← 返回 PaperDaily 视觉与图像

西安交大新作TempoGround:流式目标不再“跟丢”,3D指标均提升7.5

视频流一帧一帧地来,模型能不能不串号、不手抖、不跟丢?西安交大联合EngineAI提出TempoGround,让视觉语言模型在流式输入下连续输出稳定的2D/3D框,3D精度平均提升7.5。这套“状态感知课程预测+强化学习”的组合拳,值得做具身智能和多模态感知的同学认真看一眼。

西安交大新作TempoGround:流式目标不再“跟丢”,3D指标均提升7.5
原论文信息如下:
论文标题:
TempoGround: State-Aware Streaming Visual Grounding with Vision-Language Models
发表日期:
2026年9月(arXiv预印本)
发表单位:
西安交通大学、EngineAI(深圳)

一、画面一直来,框却一直飘:流式视觉定位的三大硬伤

想象一个机器人端着水杯走来,你说“右边那个红色杯子”,它需在视频中持续框住杯子。实际情况是,模型可能上一秒框A,下一秒框B;或框位置忽大忽小;或杯子被挡后模型“失忆”。

论文将这些问题归为流式视觉定位的三种失败模式:身份漂移、跨帧不一致、部分遮挡下的脆弱定位。传统模型处理单帧或离线视频,无法应对实时流式输入。

流式视觉接地为何如此困难?三大失败模式解析

流式视觉接地任务是让模型在连续视频中稳定框住查询物体。流式输入要求模型实时判断,无法像离线处理那样缓存片段。
论文总结三种失败模式:身份漂移、跨帧不一致、部分遮挡下的脆弱定位。模型缺乏跨帧对象对应关系,无法记住上一帧的物体特征,导致后续定位不稳定。
图1:流式视觉接地下的三种典型失败模式(左),以及TempoGround利用跨帧对应进行状态感知课程预测后获得的稳定2D/3D定位(右)
流式视觉接地下的三种典型失败模式(左),以及TempoGround利用跨帧对应进行状态感知课程预测后获得的稳定2D/3D定位(右),适用于检测和指代定位两类任务。
已有方法尝试重建全局3D场景,但对机器人第一人称感知不适用。论文目标是在因果输入的图像流上直接输出当前相机坐标系下的2D和3D框。

TempoGround核心机制:状态感知课程预测如何实现跨帧一致性

TempoGround采用状态感知策略,基于自回归视觉语言模型解码器,按课程式顺序预测结构化token序列。四步推理链:跨帧对应→存在状态预测→2D框解码→3D框提升。
形式化来看,模型输出的是实例集合,每个包含二维框和相机系三维框。2D框用归一化坐标表示,三维框包括物体中心、尺寸及朝向角。
公式1:流式视觉接地中t时刻输出的实例集合定义
公式1:t时刻的输出实例集合V_t,每个实例由2D框b_t^{2D,(k)}与3D框b_t^{3D,(k)}构成,N_t为此时预测的实例个数。
公式2:相机系3D框的九维参数表示
公式2:3D框在当前相机坐标系中的九维参数表示,前三维为中心,中间三维为长宽高(尺寸),后三维为滚转、俯仰和偏航角。
第一步跨帧对应关系是基石。TempoGround在预测时不仅看当前帧,还输入上一帧图像及预测结果,但只保留类别标签和2D框,丢弃3D信息。
论文理由是,上一帧的3D框在当前帧不可靠,2D框是视角稳定的信号,跨帧匹配更可靠。消融实验验证了只携带2D框的表现更好。
公式3:跨帧对应提示c_t-1的构造方式
公式3:上一时刻留下的跨帧提示c_{t-1},只保留类目标签ℓ_{t-1}^{(k)}与2D框b_{t-1}^{2D,(k)},不加3D框,避免把已经过时的三维几何偏置带入当前帧。
第二步存在状态预测,模型预测物体状态:new、track、lost。物体跑丢后重新出现,模型当作new处理,符合流式感知需求。
公式4:存在状态词汇表
公式4:存在状态词汇表S = {new, track, lost},分别表示新进入视野、持续留在视野中、离开视野。
模型明确2D关联和存在状态后,进入第三步和第四步——解码2D框,再从2D框提升到3D框。先2D后3D顺序提供稳定的几何支点。
图2:TempoGround整体框架图
图2:TempoGround整体框架。上半部分展示状态感知课程预测机制,输入相邻两帧图像、语言查询与上一帧2D提示,按“跨帧关联→存在状态→2D框→3D框”依次输出;下半部分对应三阶段渐进式训练流程。

SGR强化学习:用可验证奖励弥补token级监督的不足

课程预测骨架不够,需引入强化学习。标准token级监督微调无法解决几何匹配问题,流式预测闭环中错误会传导,需学习自我修正。
论文提出流式定位强化(SGR),引入可验证奖励。优化目标是最大化期望奖励,策略采样轨迹,验证器为轨迹打奖励。
公式5:SGR中最大化期望奖励的目标函数
公式5:SGR优化的目标函数,在输入x服从数据分布D、轨迹τ由当前策略π_θ采样得到的条件下,最大化期望奖励R(τ)。
优化器采用GRPO算法,对同一提示采样多个输出,组内奖励相对高低计算优势值,学习比较轨迹好坏。
公式6:GRPO中组内归一化优势值的计算
公式6:GRPO中第i条轨迹对应的组内归一化优势值,R(τ)为轨迹奖励,mean与std基于同一提示下G条采样轨迹计算。
SGR奖励函数包含四部分:Grounding奖励、Identity奖励、Consistency奖励及格式惩罚。Grounding奖励鼓励模型输出高质量框;Identity奖励关注物体检测正确性;Consistency奖励惩罚长期失败。数学公式表示为:
公式7:SGR总奖励的构成
公式7:SGR的总奖励R(τ) = Grounding奖励 + Identity奖励 + Consistency奖励 − 格式惩罚f_fmt(τ)。
图3:SGR中三类可验证奖励的示意
图3:SGR中的可验证奖励示意。Grounding奖励衡量生成的2D/3D框与真值整体的匹配质量,Identity奖励衡量new/track/lost进出状态的正确性,Consistency奖励对跨帧长程失败施以额外惩罚。
SGR采样轨迹时,用于下一帧的提示完全取自模型自己输出,强化阶段优化真实闭环行为。龙哥认为这是论文精髓,奖励函数对准流式场景评价指标。

三阶段渐进训练:从单帧能力到流式智能的递进之路

TempoGround设计三阶段训练:先学走路,再学跑步,最后学在颠簸路上跑。
第一阶段:单帧几何能力训练。模型在2600万单帧样本上做监督微调,练扎实“2D框–3D框”解码顺序和空间几何能力。
第二阶段:流式课程预测训练。模型在510万流式样本上微调,预测new/track/lost状态和2D/3D框,安装状态感知跨帧关联能力。
数据来源包括Objects365、V3Det、COCO等2D语料,以及ScanNet++、ARKitScenes等2D+3D语料。流式阶段主要来自ARKitScenes、ASE等多视角RGB-D序列,统一几何接口。
表1:TempoGround训练数据源汇总
表1:TempoGround训练数据源。第一阶段使用1560万2D样本和1050万相机系2D+3D样本;第二三阶段使用510万流式样本,第三阶段在其中抽取子集做强化学习。
第二阶段数据增强策略:上一帧提示混合“脏数据”,包括抖动、漏检、误检等,提升闭环鲁棒性。
表2:第二阶段非干净对应提示的扰动模式
表2:第二阶段中非干净对应提示的扰动模式,每种模式只污染输入的先验提示c_{t−1},监督目标保持不改变。80%样本使用扰动模式,剩余20%使用干净真值提示。
第三阶段:SGR强化。模型在4100条流式轨迹上用GRPO训练两个epoch,优化序列级奖励。训练耗时109小时,第三阶段占19小时。
论文还处理了ScanRefer等场景级指代数据集,生成视角限定表达式,保证查询可唯一解析。

实验结果全面领先:3D/2D接地精度大幅提升

论文设计因果流式评测协议:单帧方法独立处理当前帧;视频方法取片段作为输入,但只汇报当前帧预测。每个数据集贡献24条测试序列,检测和指代定位样本各占一半。
3D主流结果如下表。TempoGround-9B在ARKitScenes、ScanNet、ScanNet++三个数据集上,F1@0.25和AP_3D两项指标全面登顶,平均F1@0.25达到54.7,平均AP_3D达到35.5。相比此前最强的专业定位模型OVMono3D,平均F1@0.25提升了6.2,平均AP_3D提升了7.5。
表3:因果流式输入下的3D定位主结果
表3:因果流式输入下的3D定位结果。加粗为最好,下划线为第二好。TempoGround-9B在所有数据集的F1@0.25与AP_3D上均取得最高。
TempoGround-4B在ScanNet上的AP_3D达到了38.6,超过不少9B级别模型,说明增益核心来自训练机制和架构设计。
2D定位结果同样说明问题。TempoGround-9B的平均F1@0.5达到58.9,相比最强基线GroundingDINO-T提高了4.4;平均F1@0.95达到26.4,比LocateAnything提高了0.5。
表4:因果流式输入下的2D定位主结果
表4:因果流式输入下的2D定位结果。加粗为最好,下划线为第二好。TempoGround-9B在平均F1@0.5与F1@0.95上均列第一。
消融实验揭示各部分机制贡献。课程预测消融显示,跨帧对应提示和存在状态监督独立提升AP_3D;只保留2D框优于携带3D框。SGR奖励消融表明,移除任何奖励项精度下降。
表5:课程预测机制消融实验
表5:课程预测机制消融,对比跨帧对应、存在状态监督以及上一帧提示中是否携带3D框等配置的影响。
表6:SGR奖励项消融实验
表6:SGR奖励项消融,移除Grounding、Identity、Consistency中任意奖励都会使精度下降。
闭环鲁棒性实验:推理阶段故意破坏输入提示,结果显示,TempoGround混合训练策略在不同强度下均表现最优。
图4:推理阶段对应提示在不同扰动强度下的闭环鲁棒性
图4:ScanNet上AP_3D随推理时对应提示扰动强度的变化曲线。TempoGround混合训练策略在不同强度下均表现最优。
实验设计亮点:TempoGround采用因果流式协议,公平对比所有方法,说明流式定位难度。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?西安交大联合EngineAI提出TempoGround,面向流式输入的VLM视觉定位框架。通过状态感知跨帧对应与课程预测链,在因果图像流中持续输出稳定的相机系2D/3D框,并用可验证奖励强化学习补足几何监督。
这篇工作最值得看的点是什么?TempoGround-9B在3D接地任务上全面领先:F1_3D@0.25平均54.7(比最强基线OVMono3D高6.2),AP_3D平均35.5(比最强基线高7.5);在2D接地任务上F1_2D@0.5平均58.9(比最强基线LocateAnything高5.7),F1_2D@0.95平均26.4(比最强基线高0.5)。消融实验验证了各组件贡献。
这篇工作的边界或风险在哪里?优点:(1) 问题定义清晰,针对流式视觉接地这一实际部署场景,识别了三个关键失败模式(身份漂移、跨帧不一致、部分遮挡下的脆弱定位);(2) 课程预测机制设计合理,从2D关联到存在状态再到3D提升的渐进式预测链符合几何认知规律;(3) SGR强化学习引入可验证奖励,弥补了token级监督无法建模几何目标的缺陷;(4) 三阶段渐进训练策略从单帧到流式再到序列级优化,逻辑清晰;(5) 对应提示扰动策略增强了闭环鲁棒性。缺点:(1) 依赖大规模异构数据整合,数据清洗和标注流程复杂,可复现性存疑;(2) 对比方法中部分基线(如Qwen3-VL)未针对流式场景微调,可能存在不公平比较;
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出TempoGround框架,通过状态感知的跨帧对应关系引导的课程预测机制(2D关联→存在状态估计→2D框解码→相机坐标系3D提升),并引入流式接地强化学习(SGR)优化,实现因果流式输入下的连续视觉定位。

实验合理度:★★★★☆

F1_2D@0.5、F1_2D@0.95(2D);F1_3D@0.25、AP_3D(3D,在IoU阈值{0.15, 0.25, 0.50}上取平均)。

学术研究价值:★★★★☆

提出TempoGround框架,通过状态感知的跨帧对应关系引导的课程预测机制(2D关联→存在状态估计→2D框解码→相机坐标系3D提升),并引入流式接地强化学习(SGR)优化,实现因果流式输入下的连续视。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练在128块阿里云PPU上进行约109小时;推理时TempoGround-9B在单张NVIDIA H200上平均延迟0.65秒/帧,TempoGround-4B为0.45秒/帧。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:定义清晰,针对流式视觉接地这一实际部署场景,识别了三个关键失败模式(身份漂移、跨帧不一致、部分遮挡下的脆弱定位);(2) 课程预测机制设计合理,从2D关联到存在状态再到3D提升的渐进式预测链符合几何认知规律;(3) SGR强化学习引入可验证奖励,弥补了token级监督无法建模几何目标的缺陷;

主要参考文献

[1] Leqian Ding, Junning Qiu, Manwen Yang, Yu Guo, Fei Wang. TempoGround: State-Aware Streaming Visual Grounding with Vision-Language Models. arXiv:2609.02359v1, 2026.
[2] Zhihong Shao et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300, 2024. (GRPO算法出处)

end
视频流不停、目标不跟丢,才是真本事。想第一时间聊懂TempoGround这类“会追踪的视觉语言模型”?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 3D视觉+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。
群里不只有论文速递,还有一群愿意把“跟丢”“漂移”“幻觉框”这些工程病拆开揉碎聊的人。
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。