← 返回 PaperDaily
视觉与图像
NVIDIA+Stanford新作RoboTTT:8K上下文让机器人长记性
机器人策略最烦的不是“不会动”,而是“记不住”。这篇把测试时训练塞进机器人基础模型里,直接把上下文拉到8K步,还顺手做出单次视频模仿和在线改进,思路很硬。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
机器人策略最烦的不是“不会动”,而是“记不住”。这篇把测试时训练塞进机器人基础模型里,直接把上下文拉到8K步,还顺手做出单次视频模仿和在线改进,思路很硬。
原论文信息如下:
机器人也能“长记性”?看看8K上下文如何让机器人学会看完人类演示就照做
机器人最烦的事,不是“手不够稳”,而是“记不住”。很多策略模型盯着眼前这一帧就开始动手,结果前面刚看过的关键步骤,转头就忘;任务一长,动作就容易跑偏。RoboTTT 这篇论文干的事很直接:把机器人策略的上下文长度拉到 8K timesteps,也就是八千步,还尽量不把推理延迟一起拉爆。这个尺度,已经不是“多记一点”,而是“记忆容量换代”了。
这篇工作最有意思的地方,不是“又加了一个模块”,而是它把机器人策略的记忆方式改了。传统做法要么只看当前帧,要么把最近几帧硬拼起来;RoboTTT 选择了另一条路:让模型在推理时也能通过梯度更新自己的“快权重”,把历史压进参数空间里,再从参数里把上下文取出来。说人话就是,机器人不再只是“看录像带”,而是边看边在脑子里记笔记。
从单步到八千伏特:RoboTTT如何让机器人策略上下文长度提升三个数量级
先把背景讲明白。机器人基础模型里常见的“上下文”,通常就是当前图像、少量历史帧、再加一点本体感知信息。问题在于,真实任务不是单帧猜动作,而是长链条决策:先拿零件、再对齐、再拧螺丝、再翻面,任何一步漏记,后面都可能连锁翻车。RoboTTT 的目标就是让策略能吃下更长的历史,而且不是把上下文长度从 1K 拉到 2K 这种“小修小补”,而是直接冲到 8K timesteps。
这里的 TTT,英文全称是 Test-Time Training,中文可以理解成“测试时训练”。它的核心逻辑很朴素:模型在推理时不完全冻结,而是允许一小部分参数继续通过梯度下降更新。RoboTTT 把这部分会动的参数叫作 fast weights(快权重),把平时训练好的主参数叫作 slow weights(慢权重)。慢权重负责稳定,快权重负责临场记忆。
RoboTTT 不是重新发明一整套机器人骨架,而是把 TTT 层插进了现成的视觉-语言-动作(Vision-Language-Action, VLA)策略里。论文里具体落在 NVIDIA 的 GR00T N1.7 上。结构上,视觉语言模型先提取当前时刻的多模态信息,动作头用 Diffusion Transformer(DiT)生成一段动作块,再在 DiT 后面接 TTT 层,让跨时间的信息通过快权重持续滚动。换句话说,注意力像“看这一秒发生了什么”,TTT 像“把前面那十几秒的关键线索悄悄存起来”。
这个门控设计挺关键。很多“新模块加老模型”的工作,容易犯一个经典错误:新分支太猛,把原来预训练好的能力直接冲没了。RoboTTT 用一个接近 0 初始化的 tanh 门控,让 TTT 先小心翼翼地上岗,等训练过程中确认自己真有用,再逐步放大存在感。工程上这叫稳,学术上叫避免灾难性扰动,产品上则叫“别一上来就把机器人整成抽风机”。
测试时训练的黑魔法:快速权重如何让机器人在运行中学习并改进
RoboTTT 的训练也不是“把长序列喂进去就完事”。长序列训练最容易死在两个地方:一个是显存不够,另一个是序列太长,训练信号糊成一锅粥。于是论文用了两个配套技巧:sequence action forcing 和 TBPTT。
先说 sequence action forcing。flow matching 这类动作扩散式训练里,每个动作块都会带噪声。论文发现,如果整条序列共享一个噪声级别,训练会变得不稳定:要么整段都太简单,要么整段都太难。于是改成每个动作块独立采样噪声级别,让序列里的不同位置各自“按自己的难度学习”。这听上去像小改动,实际很像把一锅同温火锅改成分区控温,至少不会让所有食材同时糊掉。
再说 TBPTT。完整 BPTT 会把整条长序列的激活都存下来,显存直接跟着序列长度爆炸。TBPTT 的做法是把长序列切成一段一段,梯度只在段内传播,段与段之间断开;但快权重状态继续往后传,所以模型依然“记得”前文。这个设计很像写长篇笔记时先分章节归档,既不丢上下文,又不把桌面堆成灾难现场。
RoboTTT 的推理流程也很有意思:每到一个新时刻,模型先用当前观测更新快权重,再把这些快权重带到下一步。也就是说,历史不再只是“输入”,而是被压缩进了可更新的状态里。相比 Transformer 那种越看越占缓存的方式,这条路更像“把历史折叠进参数”,推理成本不会随着上下文无限膨胀。
机器人界的“场景理解”:长上下文如何赋予机器人战略恢复和精准操作能力
RoboTTT 之所以值得看,不只是因为“上下文更长”,而是它真的在几个长任务上表现出了不一样的行为。论文选了三个现实味很重的双臂装配任务:Pup Go Car、Circuit 和 Gear Bot。它们的共同点是流程长、步骤多、视觉上还很容易“长得像”,机器人特别容易把当前阶段认错。
先看最直观的能力:单次视频模仿。Circuit 任务里,目标配置只靠一句提示词根本分不出来,必须看人类演示视频。RoboTTT 在训练时把人类视频当作“纯上下文”,不对这段视频算动作损失,只让它更新快权重;随后再让机器人轨迹去利用更新后的状态完成任务。这样训练出来的模型,在测试时只给一段人类视频,就能照着没见过的配置去装配。论文里这个设置下,RoboTTT 成功完成了 6/10 次,而对照方法直接挂零。
再看长任务里的“战略恢复”。在 Pup Go Car 上,若机器人装螺丝时没拧准,RoboTTT 不会像某些短上下文策略那样假装事情已经成功、直接跳到下一步,而是会抬起机械臂、重新对齐、再尝试一次。这个行为非常像人类做装配时的“刚刚没对上,再来”。论文把这种能力归因于长上下文带来的阶段识别:历史信息足够长,模型就不容易把相似阶段混在一起。
还有一种更细的能力,是在零件被遮挡时仍能做出精准动作。Circuit 这种任务里,组件常常一部分被手或工具挡住,短上下文模型容易因为“眼前看不清”而动作发飘。RoboTTT 的快权重会把前面见过的局部细节留住,当前看不清时还能靠历史补全场景,这就是它在长任务里更稳的原因之一。
从结果看,RoboTTT 的平均任务完成分数达到 79%,比单步上下文基线高出 87%,也比最强基线 GDN 高出 41%。更扎眼的是 Gear Bot,这个平均要跑五分钟、十个阶段的任务,只有 RoboTTT 做出了完整成功,其他基线全军覆没。这个结果说明,长上下文不只是“锦上添花”,在多阶段装配这种场景里,它可能就是能不能完成任务的分水岭。
DAgger蒸馏:当机器人从自己的失败中学习时,快速权重发挥了重要作用
论文里另一个很像“机器人开始学会反省”的点,是 DAgger Distillation。先解释一下 DAgger,英文全称是 Dataset Aggregation,中文常叫“数据集聚合”。它的经典套路是:机器人自己先试,出错后人类纠正,再把纠正数据拿去继续训练。问题在于,标准 DAgger 往往只把人类纠正当标签,机器人自己犯错的过程被丢掉了,但这些“错在哪儿”其实恰恰是最有信息量的上下文。
RoboTTT 的做法更聪明一点:训练时把失败轨迹和人类纠正放在同一条序列里,失败动作负责更新快权重,损失只算在人类纠正上。这样一来,模型学到的不是“看到纠正就复制纠正”,而是“看到失败之后该如何进入纠正状态”。这就像学开车时,不只是记住“最后那个正确打方向盘的动作”,还要记住“前面为什么会偏、偏了以后怎么回正”。
图11 展示了一个很典型的在线修正过程:拧螺丝时第一次没对准,机器人抬臂重试;第二次还是差一点,再次微调;第三次终于成功。这个过程之所以值得强调,是因为它说明 RoboTTT 学到的不是“静态动作模板”,而是“遇到失败后如何继续推进任务”的动态策略。这个能力一旦在真实部署里稳定下来,价值会比单次成功率更大,因为现实任务里最常见的不是完美开局,而是边做边出岔子。😊
从实验上看,标准 DAgger 对各方法平均提升大约 9%,而 DAgger Distillation 对序列模型的平均提升能到 33%。这说明失败轨迹本身确实有价值,只是传统训练没把它用对地方。RoboTTT 在这里的优势,来自它本来就有一个能持续吸收历史的快权重容器,正好适合把“失败—纠正”这种在线改进过程蒸馏进去。
结论与展望:上下文长度将成为机器人基础模型的新缩放轴
RoboTTT 最值得记住的,不只是“8K 上下文”,而是它把上下文长度明确变成了机器人基础模型的一条新缩放轴。过去大家总盯着模型更大、数据更多、视觉更强;这篇工作提醒了一个很现实的问题:机器人很多时候不是缺能力,而是缺记忆窗口。当任务变长、阶段变多、状态更模糊时,记不住前文比看不清当前更致命。
不过,这条路也不是没有代价。TTT 依赖测试时梯度更新,工程上比纯前向推理更复杂;TBPTT 虽然省显存,但训练和调参门槛会更高;快权重能不能在更杂乱、更开放的真实场景里长期稳定工作,还需要更多验证。尤其是当任务从实验室装配走向开放环境时,长上下文不一定自动等于高可靠,数据分布、错误累积、在线更新稳定性,都会变成必须面对的硬问题。
但从研究方向上看,这篇论文给出的信号很清楚:机器人策略正在从“短视反应”走向“带记忆的行动”,而且这种记忆不是简单堆缓存,而是可学习、可更新、可蒸馏的。后续如果能把这种长上下文机制和更强的任务规划、更稳的安全约束、更便宜的在线更新结合起来,机器人真正进入“边干边学”的阶段,就不再只是 demo 里的漂亮动作了。
龙迷三问
这篇论文到底解决了什么问题?它解决的是机器人策略“上下文太短、记不住长任务”的问题。RoboTTT 用测试时训练把历史压进快权重里,让机器人能看更长的序列、做更长的任务,还能在推理时边看边改。
TTT 和快权重是什么意思?TTT 是 Test-Time Training,中文是测试时训练;快权重就是推理时也会被梯度更新的那部分参数。它们负责把历史信息临时写进模型,再在后续动作里读出来。
sequence action forcing 为什么重要?它让长序列训练更稳定。每个动作块独立采样噪声级别,避免整条序列因为同一个噪声设置变得“一起太容易”或“一起太难”,从而让模型更好学。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 不是简单把长上下文“硬塞”进机器人,而是把 TTT、门控、TBPTT、sequence action forcing 组合成一套能训练、能推理、还能做在线改进的方案,思路完整。
实验合理度:★★★★☆ 对比了短上下文、历史拼接、线性记忆等基线,任务也选得够长、够难,能支撑“长上下文确实有用”这个结论。
学术研究价值:★★★★★ 把“上下文长度”明确提成机器人基础模型的缩放轴,这个判断很有研究价值,后续值得继续挖。
稳定性:★★★☆☆ 实验室装配场景里表现不错,但测试时更新带来的稳定性和安全性,离大规模产品落地还有距离。
适应性以及泛化能力:★★★☆☆ 对长时序、多阶段任务很友好,但对开放世界任务是否同样稳,还需要更多验证。
硬件需求及成本:★★★☆☆ 训练要长序列、要多 GPU,推理还带测试时梯度更新,成本不算轻。
复现难度:★★★☆☆ 思路清楚,但涉及机器人数据、长序列训练和真实硬件,复现门槛不低。
产品化成熟度:★★★☆☆ 在特定长任务上很有潜力,但要进产品,还得先把稳定性、速度和安全约束打磨好。
可能的问题:方法强在长上下文,但测试时训练会抬高部署复杂度;任务越开放,快权重更新越需要严格控制,否则容易“记太多、改太快”。
主要参考文献
[1] Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi “Jim” Fan. RoboTTT: Context Scaling for Robot Policies. arXiv:2607.15275, 2026.
[2] RoboTTT 项目页面:research.nvidia.com/labs/gear/robottt
[3] Test-Time Training 相关工作与机器人基础模型相关文献,见论文正文引用。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!