← 返回 PaperDaily 视觉与图像

人民大学+智谱AI新作:训练用思维链,推理直接跳过

这篇论文最有意思的地方,不是把机器人做得更“会说”,而是把“会想”和“会动”拆开了。训练时让模型认真做具身思维链,推理时又把这层思考直接跳过,工程味很足,值得细看。

人民大学+智谱AI新作:训练用思维链,推理直接跳过
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更机器人、具身智能、大模型、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是把机器人做得更“会说”,而是把“会想”和“会动”拆开了。训练时让模型认真做具身思维链,推理时又把这层思考直接跳过,工程味很足,值得细看。


原论文信息如下:
论文标题:
Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision
发表日期:
2026年06月
发表单位:
Renmin University of China, Zhipu AI
原文链接:
https://arxiv.org/pdf/2606.30552v1.pdf
开源代码链接:
https://github.com/RUCKBReasoning/ZR-0

机器人界的“双系统”思维:新模型如何实现跨本体迁移?

机器人最难的地方,从来不是“看见一个杯子”,而是“换一台机器人还能不能把杯子拿稳”。同样是抓取、放置、整理桌面,单臂、双臂、人形机器人看起来都在干活,底层却像不同门派:关节数不同、控制接口不同、动作空间也不一样。于是很多跨本体模型看着很热闹,真到换平台时就容易露馅。
这篇论文的切入点很直接:低层动作空间可以不同,但高层“怎么想”其实很像。机器人不管长什么样,完成任务时都要经历看场景、认物体、判断进度、拆解子任务、规划下一步这套认知流程。论文把这部分叫做 Embodied Chain-of-Thought,ECoT(具身思维链),意思是把机器人做事时的“脑内小剧场”也当成监督信号来训练。
图1:ZR-0整体框架图
图1:ZR-0整体框架图。模型把“会想”和“会动”拆成两个系统:System 2 负责生成具身思维链,System 1 负责输出连续动作块。训练时两边一起学,推理时却可以把思维链整段跳过,直接出动作。
这就有点像人类做题:草稿纸上先写推理过程,交卷时不一定把草稿一并交上去。论文的妙处就在于,它不是让机器人“边说边做”地慢吞吞执行,而是训练阶段把语言推理压榨到位,部署阶段直接拿推理后的表示去驱动动作。说人话就是:训练时认真思考,推理时少废话

揭秘ZR-0:用密集的“思维链”训练机器人

ZR-0 是一个 26 亿参数的端到端视觉-语言-动作模型,核心思路不复杂,但执行得很“工程”:上半身是一个预训练视觉语言模型(论文里把它当作 System 2),下半身是一个基于 Diffusion Transformer,DiT(扩散变换器) 的动作专家(System 1)。前者负责理解图像和指令,后者负责把这些理解翻译成连续动作块。
这里的关键,不是简单把语言模型和动作模型拼起来,而是用密集的 ECoT 监督去“校准”视觉语言表示。论文把每一帧都尽量配上结构化推理内容,覆盖场景描述、任务进度判断、未来计划、子任务拆解、目标物体定位,以及离散动作 token。换句话说,模型不是只看“现在该怎么动”,而是被迫先回答“现在场景里有什么、任务做到哪了、接下来准备干什么”。这种监督密度很高,像给模型做了一次长期、连续、带讲义的实习培训。

论文主体思路

*表格超出部分左右可以滑动
项目 内容
应用场景跨单臂、双臂、人形机器人本体的通用操作策略学习
问题建模将视觉、语言、机器人状态映射到连续动作块,同时用具身思维链对齐不同本体的高层认知
模型Backbone及选择原因视觉语言模型初始化自 Qwen3-VL-2B-Instruct,擅长多模态理解;动作专家采用 DiT 结构,适合连续动作生成
损失函数具身思维链的 next-token prediction 与连续动作的 flow matching 联合优化
训练数据集ProcCorpus-60M,约 6000 万帧、400K+ 轨迹,ECoT 覆盖率 96.8%
测试数据集LIBERO、RoboTwin 2.0、RoboCasa GR-1 Tabletop、真实 xArm 平台
训练方法预训练阶段混合机器人轨迹与通用视觉语言数据;后训练阶段在各基准上再微调
实验效果整体表现强,尤其在长时序任务和双臂鲁棒性上较突出;部分关闭类任务仍有明显短板
方法优势训练时用密集推理增强表示对齐,推理时无需生成 ECoT,降低延迟
方法缺点高度依赖高质量密集标注与大规模数据,且对低频动作类型的覆盖仍不均衡
先看训练数据。论文使用的是 ProcCorpus-60M,这是一个从多个开源机器人数据集汇总而来的大规模语料,包含约 6000 万帧、1000 小时左右的轨迹,并且给了近乎全覆盖的 ECoT 标注。这里的“密集”不是修辞,是字面意义上的密:几乎每一帧都配了结构化推理。对跨本体迁移来说,这很重要,因为模型学到的不是某个机械臂的“肌肉记忆”,而是更抽象的任务理解。
ECoT 的六个组成部分也很有针对性。场景描述负责让模型“看懂桌面上有什么”;进度判断负责让模型知道“任务做到哪一步了”;未来计划负责长程规划;to-do actions 负责把大目标拆成可执行的原子步骤;目标物体框负责空间定位;离散动作 token 则把高层推理和低层控制之间搭起桥。这里最值得记住的是 to-do actions,它用“动词 + 对象 + 方位短语”的方式表达子任务,尽量避开本体差异带来的动作语义偏移。
动作专家这边则走的是连续控制路线。它不是逐 token 生成动作,而是一次预测一个动作块,再通过 flow matching 学习把噪声逐步变成真实动作。这样做的好处很实际:连续动作更适合高频控制,也避免了离散化带来的精度损失。模型内部还用了交叉注意力,把视觉语言模型的特征喂给动作专家,但有一个很关键的限制:动作专家只能看输入提示对应的特征,不能直接依赖 ECoT 文本 token。这就保证了推理时可以把整段 ECoT 省掉,动作仍然能跑。

核心设计

ZR-0 的核心设计可以概括成一句话:让语言模型先把“怎么理解任务”学扎实,再让动作专家把“怎么动”学精。训练时,两条损失一起上:一条是 ECoT 的 next-token prediction,另一条是动作块的 flow matching。前者逼 VLM 学会更细粒度的具身推理,后者逼动作专家学会把推理表示转成连续控制。
公式1:具身思维链的 next-token prediction 损失
公式1:具身思维链的 next-token prediction 损失。这里的 rt 表示某一时刻的 ECoT 序列,l 是任务指令,ot 是图像观测。它本质上就是让模型按顺序预测下一个推理 token,把“场景理解”这件事拆成可学习的语言建模问题。
动作部分的损失更像经典的去噪学习。先给真实动作块加噪声,再让模型预测噪声对应的向量场,最后通过迭代去噪把动作还原出来。这个设计的好处是连续、平滑,而且很适合机器人这种对动作精度敏感的场景。
公式2:连续动作块的 flow matching 损失
公式2:连续动作块的 flow matching 损失。At 是真实动作块,ε 是高斯噪声,τ 是噪声插值时刻。模型学的不是“直接吐动作”,而是学一个把噪声往真实动作推过去的方向场。
两部分合在一起,就是总损失。一个负责理解,一个负责执行。论文没有把这俩硬揉成一锅粥,而是保留了各自的职责边界,这一点很工程化。
公式3:联合训练目标
公式3:联合训练目标。α 用来平衡推理学习和动作学习的权重。简单理解就是:别让模型只会“说得头头是道”,也别让模型只会“闷头乱动”。
推理阶段更干脆。模型先从高斯噪声初始化一个动作块,再迭代去噪,直到得到最终动作。重点在于:ECoT 只在训练时出现,推理时完全跳过。这不是偷懒,而是把训练阶段的认知收益保留下来,把推理阶段的文本开销砍掉。
公式4:推理时的迭代去噪更新
公式4:推理时的迭代去噪更新。它表示动作块从噪声逐步演化成最终动作,N 是去噪步数。论文给出的推理延迟大约是单张 A6000 上 90 毫秒量级,说明这套设计不是纸上谈兵,至少在实时控制上是能站得住脚的。

实验结果惊艳:一个模型搞定单臂、双臂和人形机器人

图2:真实机器人环境与任务示例
图2:真实机器人环境与任务示例。论文把真实场景里的多种任务摆出来,重点看模型在指令跟随、颜色理解、长时序规划、空间推理和 OCR 相关推理上的表现。
实验覆盖了三个模拟基准和一个真实平台,算是把“跨本体迁移”这件事从单臂、双臂一路测到人形机器人,再落到真实 xArm 上。这个覆盖面很重要,因为很多方法在单一平台上看起来像天才,一换机器人就像临时工。ZR-0 至少从实验设计上,尽量避免只在舒适区里表演。

实验结果分析

先说结论:这组实验不是全线碾压,但覆盖面很扎实。在 LIBERO、RoboTwin 2.0、RoboCasa GR-1 Tabletop 和真实 xArm 上,ZR-0 都能拿出有竞争力的结果,尤其是在长时序任务、双臂协调和真实环境鲁棒性上,思路和结果是对得上的。
更关键的是,实验现象和方法设计基本一致。ECoT 的作用不是单纯“让模型多写几句”,而是通过密集监督把高层语义对齐做扎实,所以它在需要任务分解、长程规划、跨视角理解的任务上更占便宜。相反,在某些低频动作、特别是关闭柜门、关抽屉、关微波炉这类动作上,效果就没那么漂亮。这恰好说明模型不是玄学,数据里缺什么,模型就会在哪些地方露怯。
LIBERO 这边最能拉开差距的是长时序任务。因为前面几个子任务都比较容易被近期方法做满分,真正能分出高下的是 LIBERO-10。ZR-0 在这个子集上表现更强,说明密集推理监督对“多步串联”的帮助是真实存在的,不是只在单步抓取里刷存在感。
表1:LIBERO基准实验结果
表1:LIBERO 基准实验结果。可以看到,ZR-0 在四个子集上整体都很稳,尤其是 LIBERO-10 的长程任务更有优势,说明它确实学到了比较强的任务分解能力。
RoboCasa GR-1 Tabletop 更有意思,因为它把人形机器人搬进了桌面操作场景。ZR-0 的平均成功率达到 69.3%,比次优方法高出一截,但并不是所有任务都赢。它在取放、搬运这类高频原始动作上很强,可在关闭类任务上明显掉队。这个结果其实很诚实:数据分布决定了上限,方法再花哨也不能凭空变出没见过的动作经验
表2:RoboCasa GR-1 Tabletop实验结果
表2:RoboCasa GR-1 Tabletop 实验结果。ZR-0 在大量取放任务上表现突出,但在关闭柜门、抽屉、微波炉等任务上还有明显短板,说明预训练数据对动作类型的覆盖还不够均衡。
RoboTwin 2.0 是对鲁棒性更苛刻的测试。这里不仅有 clean 场景,还有 domain randomization,连光照、背景、桌面高度、语言指令都给你加点随机扰动。ZR-0 在 clean 和 randomized 的差距很小,说明通用视觉语言数据的混合训练确实起作用了。换句话说,它不是只会在“背景干净、光线标准、物体摆正”的理想实验室里表演。
表3:RoboTwin2.0实验结果
表3:RoboTwin2.0 实验结果。清洁场景和随机化场景之间的性能落差不大,说明模型对视觉扰动的适应性比较强,跨场景泛化能力也更稳。
真实 xArm 平台的结果更能说明问题。真实世界里没有仿真那么客气,物体摆放、光照变化、干扰物、指令改写,全都可能让模型翻车。ZR-0 在四个任务上都能给出不错的进度分数,说明它不只是“会算”,也确实有一定落地潜力。
表4:真实xArm平台实验结果
表4:真实 xArm 平台实验结果。真实环境下的进度分数证明,这套方法不是只在仿真里好看,至少具备一定的现实执行能力。
消融实验也很有价值。论文对比了不同微调策略,能看出 ECoT 监督并不是可有可无的装饰,而是实打实地提升了性能。这个结论和前面的主实验是互相呼应的:不是“多写点字就更聪明”,而是“把任务理解拆得更细,模型更容易学到跨本体共享的表示”。
表5:不同微调策略的消融实验
表5:不同微调策略的消融实验。结果说明 ECoT 不是“锦上添花”,而是影响跨本体迁移效果的重要训练信号。
表6:RoboTwin2.0完整结果
表6:RoboTwin2.0 完整结果。该表给出了更细的逐任务表现,整体趋势和主表一致:随机化条件下仍能保持较强稳定性。

去芜存菁:训练时用思维链,推理时直接跳过

这篇论文最值得记住的工程技巧,其实不是“思维链”本身,而是把思维链只留在训练阶段。很多方法一旦引入推理文本,部署时就开始变慢、变贵、变脆弱;ZR-0 反其道而行,训练时用文本把表示学扎实,推理时直接让动作专家吃特征,不再生成冗长的中间文本。
这类设计对机器人尤其友好。机器人控制本来就强调实时性,哪怕多几十毫秒,落地体验都可能从“能用”变成“卡顿”。所以论文把 ECoT 当成训练监督,而不是部署负担,这个取舍很聪明,也很务实。

未来展望:规模更大、数据更多、能力更强

这篇工作已经把跨本体迁移的方向说得很清楚了:不是先纠结机器人长得像不像,而是先让它们共享一套高层认知表示。接下来真正值得期待的,不是再把模型名字起得更像密码,而是继续补三件事:更丰富的动作类型、更均衡的任务分布、更高质量的密集标注
如果未来能把关闭、旋拧、插拔、整理这类低频但真实重要的操作补齐,ZR-0 这类框架的上限还会继续往上抬。另一方面,ECoT 自动标注的质量也很关键。标注越准,模型学到的“思考方式”越像样;标注一旦飘了,模型就会把错误推理也学得头头是道,那就真成了“认真地犯错”。
从行业角度看,这种路线的价值在于:它给出了一个比较现实的通用机器人训练范式,不靠玄学,也不靠把所有本体硬塞成同一种动作格式,而是承认差异、抽象共性、再用密集监督把共性学出来。对做机器人基础模型的人来说,这种思路很值得抄作业;对只想落地的人来说,这种思路也比“纯语言讲故事”靠谱得多。😊

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决的是跨本体机器人训练里的“语义对不齐”问题。不同机器人动作格式不同,论文不再只盯着动作维度怎么统一,而是用密集 ECoT 把高层认知过程对齐,让模型学到更共享的表示。

ECoT 和普通思维链有什么区别?ECoT 是 Embodied Chain-of-Thought,中文可理解为具身思维链。它不是泛泛地“解释一下答案”,而是专门围绕机器人操作过程,输出场景描述、进度判断、未来计划、子任务拆解、目标物体定位和动作 token。

为什么推理时可以直接跳过 ECoT?因为动作专家通过交叉注意力只读取输入提示对应的视觉语言特征,而不依赖 ECoT 文本 token。这样训练时 ECoT 提供了更强监督,推理时却不用付文本生成的代价,兼顾效果和速度。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把密集具身思维链引入跨本体 VLA 训练,这个方向有新意,而且不是只停留在概念层面。

实验合理度:★★★★☆。单臂、双臂、人形、真实平台都测了,验证链条比较完整;不过部分任务仍受数据分布影响,说明实验结论是“有效”而不是“无敌”。

学术研究价值:★★★★☆。它给出了一个很清晰的跨本体表示对齐思路,对具身智能基础模型研究有启发。

稳定性:★★★☆☆。真实场景能跑,但低频动作和复杂闭合操作仍有短板,离大规模稳健落地还有距离。

适应性以及泛化能力:★★★★☆。对视觉扰动和不同本体的适应性不错,尤其在随机化场景中表现比较稳。

硬件需求及成本:★★★☆☆。2.6B 参数、60M 帧级数据、分布式训练,成本不低;好在推理阶段不生成 ECoT,部署负担有所下降。

复现难度:★★★☆☆。代码开源是加分项,但大规模数据和密集标注不是随手就能复刻的。

产品化成熟度:★★★☆☆。适合研究验证和部分受控场景试点,离通用机器人产品还差数据覆盖和鲁棒性补课。

可能的问题:方法很强,但对数据分布依赖仍明显,尤其低频操作覆盖不足;如果未来只堆规模不补动作多样性,效果提升可能会变钝。


主要参考文献

[1] Li H, et al. Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision. arXiv, 2026.
[2] ProcCorpus-60M: ECoT-enhanced robotic dataset, cited in the paper.
[3] ZR-0 official code: https://github.com/RUCKBReasoning/ZR-0

机器人VLA想跑得稳,光会“动手”还不够,还得会“动脑”。想继续看这类机器人、大模型、具身智能论文拆解,欢迎扫码加入龙哥读论文星球和微信群,少走弯路,多看门道。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。