零样本跨实体迁移:VLA模型的"盲考"难题
一句话概括:这就像给学生安排了一场严格的“盲考”——考卷上全是没见过的题型,但考试规则先得说清楚,不然考出来的分数没有意义。
如果把引言里的“盲考”再往前推一步:光有“考卷上全是没见过的机器人”还不够,考试规则本身也得先定清楚。同样是声称“零样本”,A家可能彻底没让模型见过新机器人的任何一条数据;B家却悄悄把目标本体的数据混进了大规模预训练,只是在下游任务微调时拿掉而已。
一个是从没开过这台车就要求直接上路,一个是“科目二练过这车型、但没跑过这条路线”,难度差得不是一点半点。可翻开文献,这两种协议都被贴上了同一张“零样本迁移”的标签。
严格零样本 vs 预训练暴露:一个被忽视的关键区分
ZETA这篇论文做的第一件事,就是把“零样本”这个词掰成两个正式协议。
严格零样本迁移(Strict Zero-Shot Transfer):目标本体不出现在任何训练数据里,即目标机器人既没有进预训练,也没有进下游任务的后训练。这对应一个很常见的现实场景:硬件团队刚造出一台新机械臂,手里只有上一代机器人的数据,模型要直接在新硬件上无师自通。
预训练暴露零样本迁移(Pretrain-Exposed Zero-Shot Transfer):目标本体允许出现在大规模预训练数据中,只是不参与下游任务的后训练。这对应另一个更现实的产品场景:买一台市面公开的机器人,公共预训练数据里早已有大量其它机构采集的该型号数据,但自己手里没有针对具体任务的私有数据。
两种协议不仅难度不同,而且在产品层面代表两种截然不同的“数据库存”条件。如果不把它们分开,一个模型可能在“预训练暴露”的协议下表现得异常惊艳,换到“严格零样本”却立刻拉胯;更常见的情况是论文里含糊其辞,读者根本不知道它到底属于哪一种。
ZETA把文献里一批代表性工作重新筛查了一遍。结果很有意思:不少大家熟知的工作,其实并不是严格的零样本迁移。
表1:不同论文对“零样本”的认定并不一致。按目标本体的“暴露程度”重分类后,LAP、Cloak、RDT2这类属于严格零样本,而Octo、π0.7、OpenVLA、Gemini Robotics 1.5等都属于预训练暴露。有的工作(如Being-H0.5)甚至连后训练阶段也包含目标本体,只能算“未见过的任务-本体组合”,严格来说两种零样本协议都沾不上边。
这个表能解释很多争议。比如某巨型模型号称“开箱即用”,但它的预训练语料里已经见过了海量目标本体数据,新用户直接做的是下游任务适配。这当然是有价值的,但不能跟“从没见过这台机器人”划等号。
四大因素系统解构:表征、多样性、共训练与暴露
协议厘清之后,真正的问题浮出水面:同样是换台就懵,到底是哪一环导致模型懵掉?ZETA把跨本体迁移涉及的主要设计轴拆成了四个研究问题,逐个做受控变量实验。
RQ1:状态-动作表征——机器人该用什么“方言”说话
不同机器人最直接的区别,是运动学结构不同:关节数不一样、臂长不一样、关节限位不一样。如果策略输出的是关节角度这种“原生方言”,换个机器人可能连张量维度都对不上。因此ZETA把视角收缩到笛卡尔空间中的末端执行器(End-Effector,EEF)位姿,也就是夹爪或手部在空间中的位置和姿态。
同样是在笛卡尔空间,依然存在两种“口音”。动作层面,机器人可以把下一步运动写成世界坐标下的位移增量,这叫World-Delta;也可以写成当前末端自身坐标系下的局部增量,这叫EEF-Delta。状态层面,模型既可以吃历史上末端在世界系下的绝对位姿(Abs. EEF),也可以把这些历史位姿都变换到当前末端坐标系下,形成EEF-Delta状态。
表2:论文符号化定义了四种表征。简单说,World系的动作是“朝桌子东边挪3厘米”,EEF系的动作是“沿着夹爪现在的朝向往前推3厘米”。后者更接近人类操作时的手感,不依赖机器人底座坐标系的朝向定义。
上式是EEF-Delta动作的定义:从当前末端坐标系观察,下一时刻的位姿变化被表达为一个相对刚体变换。这样写的好处是,模型不需要猜测“底座在哪儿”,只要知道“我的手现在在哪儿、要往哪儿动”就够了。
四种组合的仿真结果如下。重点看两行:最传统的是“绝对状态+世界增量动作”,平均任务进度60.3%;最“局部”的是“EEF-Delta状态+EEF-Delta动作”,平均推进到75.7%。这一下就是约15个百分点的差距。
表3:RQ1仿真结果显示,EEF-Delta状态对手臂级和全身级本体的提升尤其明显。例如手臂替换场景,绝对状态只有38.5%~39.9%的任务进度,换到局部状态后直接涨到69.8%~74.3%;全身级替换也从33.9%~38.6%跳到了58.4%~60.4%。
原因不难理解:当手臂本体变化时,“世界坐标系下末端绝对位姿”的数值分布会被手臂基座位置、连杆长度、相机安装方式等非灵巧因素彻底打乱;而局部末端坐标下的状态历史,描述的是“我的手相对刚才怎么动的”,这种运动结构在不同手臂上是相近的。
真实世界的验证同样没掉链子。表4里EEF-Delta状态+EEF-Delta动作的组合在真实机器人评测中平均达到89.9%,其它三种组合只有56.0%~61.6%。注意这里的真实世界源本体是Franka-Robotiq,目标本体覆盖了外观、夹爪、手臂和全身级替换。
表4:真实世界结果与仿真结论方向一致。开空气炸锅和浇花两个下游任务的平均进度显示,局部末端表征的组合全面领先。这个跨平台一致性,让“换表征涨15个点”的结论可信度提高不少。
RQ2:源本体多样性——训练时见过越多种机器人越好吗
直觉上,预训练时数据里包含的机器人种类越多,模型对新本体的适应能力就越强。但这里面藏着一个容易忽略的陷阱:如果总预算固定,源本体越多,每个本体分到的数据就越少。
图2:ZETA程序化生成了一个包含512个Franka系变体的预训练本体池,在几何、颜色、夹爪尺寸上引入系统变化。所有目标测试机器人都是外部导入的商业型号,严格排除在预训练本体池之外。
在固定640K条轨迹总预算的核心对比下,512源模型比单源模型的平均迁移成绩高出约18个百分点。这一增益在夹爪替换、手臂替换和全身替换上尤其显著。更有意思的是注意力可视化:单源模型的注意力很散,经常落在桌子和背景上;512源模型则把注意力高度集中在任务目标物体和夹爪上。
图5(a):固定总预算下,512源模型在各个本体替换类别上普遍优于单源模型。注意“手臂替换”和“全身替换”的涨幅最大,说明多样性预训练主要补齐的正是运动学结构变化带来的泛化短板。
图5(b):真实世界验证出现了一个值得注意的非单调区间——从1个源增加到8个源时,手臂级和全身级迁移反而下降,直到512源才明显回升。这说明在固定预算下,“覆盖面”与“每个源的数据密度”之间存在拉扯,不是无脑堆机器人种类就能一直涨。
作为补充,ZETA还做了固定“每个源本体数据量”的预算扫描:32源到128源再到512源,性能单调上升。这说明当预算允许按比例扩容时,多样性几乎总在帮忙;而一旦预算被卡死,就得多留个心眼。
图4:从特征层面也能看出端倪。UMAP可视化显示,512源模型在两个未见本体UR5eUMI和GoogleRobot上的视觉-语言特征重叠度明显更高,说明跨本体的特征对齐能力确实被多样性预训练增强了。
RQ3:辅助共训练——多学几句“机器人的心里话”有用吗
纯模仿学习只告诉模型“这步该把夹爪移到哪”,模型未必能理解动作背后的语义。ZETA在预训练和后训练中加入了三种辅助目标:语言-动作预测(Language-Action Prediction,LAP)让模型预测结构化的语言动作描述;子目标预测让模型预测下一步的里程碑状态;任务条件的目标框预测则把语言指令与图像中的目标区域锚定起来。
表5:所有辅助共训练变体都优于纯模仿学习。论文摘要中给出的平均提升约7个百分点,而且本体差异越大(比如全身替换),辅助目标带来的收益越明显。
龙哥觉得,这背后的逻辑很像人学车:光是模仿教练打方向盘能学会常规操作,但要应付没开过的车型,还得理解“方向盘往哪打、车头会往哪偏”这种底层规律。辅助任务逼着模型把视觉、语言和运动之间的连接表达得更完整。
RQ4:目标本体暴露——预训练里“偷看”5%能涨多少
图7(a):RQ4在预训练数据中控制目标本体的暴露比例。注意这里只动预训练,下游后训练依然只用源本体数据,所以这仍然属于“零样本”范畴,只是从严格协议变成了预训练暴露协议。
图7(c):在Google Robot上的结果很有冲击力——预训练中只混入5%的目标本体数据,平均目标本体任务进度就能提升13.4个百分点;但即便加了这部分“预训练偷看数据”,模型的成绩仍然明显低于直接用目标本体做下游后训练的“神谕”上限。
这正是ZETA坚持要把两种协议分开报告的原因:严格零样本与预训练暴露之间存在一条不可忽视的鸿沟。5%的数据就能换来13.4个点的提升,如果把两种协议混在一起报分数,读者根本无法判断模型的跨本体能力到底来自“泛化”还是“见过”。
受控基准实验:从仿真到真实世界的全面验证
上面这些结论要是放在随便采集的数据上,一定会被质疑“是不是任务分布差异造成的”。ZETA真正花心思的地方,是把所有非本体因素尽量锁死。
图3:评测设置了七个外部留出的目标本体,并按“仅外观变化、仅夹爪变化、仅手臂变化、全身变化”四类本体位移进行细粒度分组。源本体为Franka,真实世界使用Franka-Robotiq作为源,目标本体类别与仿真严格对应。
实验设计上有很多值得留意的细节。预训练与下游任务数据完全分离,即预训练任务集和下游任务集不相交。仿真中下游每个任务只给4万条源本体轨迹,真实世界的下游数据更少,每个任务只有50条演示。评测任务包括三个:上菜(serving sausages)、叠碗(stacking bowls)、叠积木(stacking cubes),按“任务进度”0~100打分,完成必要子目标即可获得部分分数。
为了让“换台”这件事不被相机视角干扰,ZETA还刻意对齐了两类视觉输入——腕部相机和第三人称相机——到后训练分布的图像平面夹爪分布。视觉上做了域随机化,包括相机位姿、光照、背景、物体布局、质量与摩擦系数等。光看这个控制力度,就能感受到这是一篇把“减少混淆变量”刻进DNA的论文。
评估规模也是实打实的。仿真中每个模型要在3个任务×7个目标本体×100次rollout×3个独立训练随机种子上评测,总计6300次仿真rollout;再加2个任务×7个目标本体×10次试物的140次真实世界rollout。这个量级虽然不是超大,但对于要反复跑多种表征的受控研究来说,已经相当扎实。
视觉-语言-动作模型(Vision-Language-Action model,VLA)的骨干网络方面,ZETA选择了π0.5风格的模型结构并在所有对比中保持骨干、输入配置、动作预测长度、损失函数、数据预算和优化调度完全一致。这保证了不同结果之间的差异只能归因于论文想要操控的变量。
不过也要承认它的适用边界。ZETA的所有实验都限定在固定基座的桌面二指夹爪操作,不涉及移动底盘、灵巧手和长时间任务。也就是说,它是在“二指桌面操作”这个可控范围内建立了一套严谨的评估范式,而不是直接给整个人形机器人、移动操作领域下结论。
实践指南:如何评估与提升跨实体VLA迁移
如果把ZETA压缩成几条可直接带走的方法论,大概是这样。
第一,状态和动作表征优先选择局部末端坐标系。无论是状态历史还是动作增量,把坐标变换到“当前夹爪自己的坐标系”里,都能有效剥离不同手臂基座定义和运动学差异带来的干扰。这个结论在仿真和真实世界都站得住脚。
第二,预训练数据里的源本体多样性要管,但更要管预算分配。固定总预算时,源本体数从1涨到512平均涨约18个点,但中间可能存在非单调区;如果预算能随源数量同步增长,多样性带来的收益会更干净。给团队的建议是:扩充源本体前先算清楚单位本体的数据密度会不会被稀释。
第三,辅助共训练目标值得加。语言-动作预测、子目标预测、目标框预测这类目标不需要额外人工标注大改,它们只是把轨迹里已有的信息用其它形式让模型再学一遍,但换来的是更稳的跨本体表现。
第四,所有“零样本跨本体”的报告必须写明协议。如果预训练里见过目标本体,就老老实实标“预训练暴露”;如果完全没见过,才叫“严格零样本”。否则你报的10个点增益,别人复现时可能只有3个点,问题很可能就出在这条最容易含糊的协议线上。
第五,也是龙哥想额外强调的一句:不要把这篇论文的结论盲目外推到二指桌面操作之外。移动底盘、灵巧手、长时任务这些更广的场景,仍然需要先在同样严格的协议框架下重新做一遍受控实验,才能得出可信的答案。
龙迷三问
下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本论文提出ZETA受控研究,严格区分“目标本体完全不可见”与“仅预训练可见”两种零样本协议,系统解构表征、源多样性、共训练与目标暴露四大因素。
这篇工作最值得看的点是什么?EEF-Delta状态-动作表征提升约15个百分点;512源实体设置提升约18个百分点;辅助共训练提升约7个百分点;5%目标实体预训练暴露提升13.4个百分点
这篇工作的边界或风险在哪里?优点:(1)严格区分了严格零样本迁移与预训练暴露零样本迁移两种协议,澄清了文献中的定义混乱;(2)构建了受控基准,隔离了实体变化与其他因素;(3)系统研究了四个关键因素并提供了量化结果;(4)仿真与真实世界验证相结合。缺点:(1)研究范围限于固定桌面操作和两指夹爪,未覆盖移动操作和灵巧手;(2)任务为短时程操作,未验证长时程任务;(3)程序生成的源实体池为Franka风格,可能限制了结论的泛化性。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
主要创新不在新网络结构,而在对“零样本”定义的严格区分、受控评测体系与四因素分解式研究。这个创新点更偏方法论,但对领域乱象有较强的纠偏价值。
实验合理度:★★★★★
控制变量做得相当到位:任务、场景、相机、预算、骨干网络全部对齐,仿真每模型6300次rollout、真实世界140次rollout,还同时报告仿真与真实世界结果,实验设计在同类研究中属于高水准。
学术研究价值:★★★★☆
给后续跨本体VLA研究提供了一套可复用的协议分类与评测范式,对数据混合、表征选择、预算控制等研究方向都有启发。限定桌面二指操作让理论价值打了点折扣,但影响不大。
稳定性:★★★★☆
仿真与真实世界的主要结论一致,EEF-Delta表征的提升在两个平台都复现,512源优势也能跨平台出现。但固定预算下8源在真实世界中出现的性能回落提醒我们,部分结论存在边界条件。
适应性以及泛化能力:★★★☆☆
强的部分在于覆盖了外观、夹爪、手臂和全身四类本体变化且都做了真实验证;弱的边界也很明显——只针对固定基座桌面二指夹爪,移动底盘、灵巧手、长时任务均未覆盖。
硬件需求及成本:★★★☆☆
预训练使用640K条轨迹×多种源本体,属于大规模训练成本;下游每个任务还要4万条仿真或50条真实轨迹做后训练。单次评测6300次rollout也不便宜,中小团队想复刻全套实验会有压力。
复现难度:★★★☆☆
方法描述细致,评测协议清晰,但程序化源本体池、相机对齐和域随机化流程都比较复杂,目前未见代码与数据开源。愿意投入算力的团队可以复现,一般研究者想轻松复现并不容易。
产品化成熟度:★★★☆☆
它的直接产出不是一套可部署的模型,而是评估规范与设计指南——EEF-Delta表征、多样性预算管理、协议报告模板这些都能直接进入公司内部的VLA训练流程。硬件团队迭代机器人本体时,可参照该框架做回归评测。
可能的问题:本体变化范围仍以Franka族程序化变体和少数商业二指平台为主,更大的运动学跨度与复杂任务验证不足;评测任务空间限于桌面二指操作,受控程度的提高也带来了外部效度的代价,向移动操作、灵巧手与长时任务推广时需谨慎。
主要参考文献
ZETA: A Controlled Study of Zero-Shot Cross-Embodiment VLA Transfer for Tabletop Manipulation. arXiv:2609.02546v1
论文原文链接:https://arxiv.org/pdf/2609.02546v1.pdf
换台不懵、跨体不慌,正是这份ZETA研究最想教会VLA的事。群里已有不少机器人方向的同好在蹲仿真到真机的实战经验,欢迎你也进来一起聊跨本体迁移、端到端控制和数据闭环,顺便抱走论文里那批开源的仿真/真机实测设计思路。
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 具身智能+北京+北大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
RQ1:状态-动作表征——机器人该用什么“方言”说话
RQ2:源本体多样性——训练时见过越多种机器人越好吗
RQ3:辅助共训练——多学几句“机器人的心里话”有用吗
RQ4:目标本体暴露——预训练里“偷看”5%能涨多少
受控基准实验:从仿真到真实世界的全面验证
实践指南:如何评估与提升跨实体VLA迁移
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
主要创新不在新网络结构,而在对“零样本”定义的严格区分、受控评测体系与四因素分解式研究。这个创新点更偏方法论,但对领域乱象有较强的纠偏价值。实验合理度:★★★★★
控制变量做得相当到位:任务、场景、相机、预算、骨干网络全部对齐,仿真每模型6300次rollout、真实世界140次rollout,还同时报告仿真与真实世界结果,实验设计在同类研究中属于高水准。学术研究价值:★★★★☆
给后续跨本体VLA研究提供了一套可复用的协议分类与评测范式,对数据混合、表征选择、预算控制等研究方向都有启发。限定桌面二指操作让理论价值打了点折扣,但影响不大。稳定性:★★★★☆
仿真与真实世界的主要结论一致,EEF-Delta表征的提升在两个平台都复现,512源优势也能跨平台出现。但固定预算下8源在真实世界中出现的性能回落提醒我们,部分结论存在边界条件。适应性以及泛化能力:★★★☆☆
强的部分在于覆盖了外观、夹爪、手臂和全身四类本体变化且都做了真实验证;弱的边界也很明显——只针对固定基座桌面二指夹爪,移动底盘、灵巧手、长时任务均未覆盖。硬件需求及成本:★★★☆☆
预训练使用640K条轨迹×多种源本体,属于大规模训练成本;下游每个任务还要4万条仿真或50条真实轨迹做后训练。单次评测6300次rollout也不便宜,中小团队想复刻全套实验会有压力。复现难度:★★★☆☆
方法描述细致,评测协议清晰,但程序化源本体池、相机对齐和域随机化流程都比较复杂,目前未见代码与数据开源。愿意投入算力的团队可以复现,一般研究者想轻松复现并不容易。产品化成熟度:★★★☆☆
它的直接产出不是一套可部署的模型,而是评估规范与设计指南——EEF-Delta表征、多样性预算管理、协议报告模板这些都能直接进入公司内部的VLA训练流程。硬件团队迭代机器人本体时,可参照该框架做回归评测。可能的问题:本体变化范围仍以Franka族程序化变体和少数商业二指平台为主,更大的运动学跨度与复杂任务验证不足;评测任务空间限于桌面二指操作,受控程度的提高也带来了外部效度的代价,向移动操作、灵巧手与长时任务推广时需谨慎。
主要参考文献
换台不懵、跨体不慌,正是这份ZETA研究最想教会VLA的事。群里已有不少机器人方向的同好在蹲仿真到真机的实战经验,欢迎你也进来一起聊跨本体迁移、端到端控制和数据闭环,顺便抱走论文里那批开源的仿真/真机实测设计思路。
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 具身智能+北京+北大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 具身智能+北京+北大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!