← 返回 PaperDaily 前沿研究

机器人真机为何总翻车?7篇新论文追到数据、触觉与失败恢复

机器人在演示视频里越来越像“会了”,一换相机、桌面、物体或任务长度,却常常立刻掉链子。这7篇近一周新论文刚好把问题拆成七段:数据、示范、空间、接触、全身控制、想象与实机验收。

龙哥导读

机器人在演示视频里越来越像“会了”,一换相机、桌面、物体或任务长度,却常常立刻掉链子。这7篇近一周新论文刚好把问题拆成七段:数据、示范、空间、接触、全身控制、想象与实机验收。

一个具体问题是:同样一句“把杯子放进收纳盒”,为什么模型在实验室成功,换到另一张桌子就会抓偏、碰撞,甚至做到一半还以为自己进展顺利?原因并不是“大模型还不够大”这么简单。机器人要把语言变成物理行动,中间至少经过数据选择、状态理解、空间表示、动作生成、接触反馈、后果预测和长期验收。任何一环把误差放大,最后都会表现成“机械臂又犯傻了”。

触觉动作模型(DeCAL)官方仓库图:双臂灵巧手系统执行擦拭、装配、拧盖、移液与旋灯泡等真实任务,展示了视觉遮挡与接触反馈同时存在的操作场景。

本次选择2026年9月7日至9日公开的7篇工作。它们不是同一系列,也不适合按单一成功率横排:数据清洗方法(RoboDrop)负责训练数据,上下文模仿框架(ICI-VLA)负责测试时示范,三维路点方法(3DWay)负责动作表示。

另外四篇继续补齐物理闭环:触觉动作模型(DeCAL)负责接触动力学,全身导航模型(TANGO)负责身体运动。

校准世界模型(SyncWorld)负责动作后果模拟,实机评测框架(FolDeX)负责长时程验收。把它们放在一起,读者看到的不是论文清单,而是一条机器人从“看懂”走向“可靠行动”的工程链。这种组织方式也能避免把不同协议下的成功率硬凑成一张排行榜。

选文逻辑:七篇论文分别补齐机器人进入真实世界的一个关键缺口,形成从数据入口到实机验收的互补闭环。

单独看其中一篇,容易把问题理解成“某个模块又涨了几个点”;组合后出现的新结论是:真机失败往往不是一个终局错误,而是早期坏数据、错误示范、空间歧义和接触误差沿任务链逐级放大。本文的增量就在于把这些分散证据放进同一条因果链,并给出可以在统一实机协议中逐层消融的组合方案。

一、第一道坎不是模型,而是示教数据会不会把它教坏

机器人后训练经常被一句“多收数据”带过。现实却很扎心:人类示教里会混入抓空、回撤、传感器漂移和观测—动作错位;错误可能只占轨迹几秒,却会给策略一个与正确动作相反的更新方向。RoboDrop的切入点很工程化:不先猜错误类型,而是直接问这条样本的梯度,是否与当前任务附近的可靠样本同向

方法在一次预热训练中,只对动作专家计算梯度,再用随机投影压到4096维;候选样本会与任务语义、视觉状态相近的干净验证样本比较余弦兼容性,最后按整条轨迹聚合。过滤比例已知时可直接砍掉最低分轨迹;污染率未知时,则用一成分和二成分高斯混合模型比较,并由贝叶斯信息准则判断是否真的存在低分簇。这个设计避免了为每一种传感器故障单独写检测器。

实验的亮点在于横跨可控污染、自然次优示教和真实机械臂。机器人操作评测系统(LIBERO)中10%时间错位污染下,过滤后平均成功率从84.0%升至91.6%;真实机械臂四项任务里,未过滤平均35.0%,固定移除20%后为63.75%,自动过滤为67.5%。但这不是“坏数据自动消失术”:它仍要一小组经确认的干净验证数据,也要付出预热与局部梯度计算成本;真实策略评测每项20次,还不足以证明在持续数月的数据流里同样稳定。

二、数据干净以后,测试时还得找对“当前这一步”的示范

ICI-VLA处理的是另一个常见误区:给机器人塞几条成功轨迹,不代表它会照着做。长任务里,示范开头可能在找物体,中间在对齐抓取,结尾在放置;当前机械臂已经夹住杯子时,如果检索器返回“伸手靠近杯子”的片段,模型就可能倒退或重复动作。所以,测试时适配的关键不是示范数量,而是阶段与几何状态是否对齐

这篇论文把长轨迹切成带语义标签的微型示范,用动态时间规整寻找处在相似进度和运动形态的正样本,再训练专门的检索编码器。推理时策略参数完全冻结,只把三条最匹配示范作为上下文生成动作。作者还加入目标动作遮蔽:故意破坏示范里的答案,迫使模型同时观察当前画面,而不是复制上一条轨迹。消融很说明问题——去掉遮蔽后,LIBERO和双臂机器人评测系统(RoboTwin)分别降到71.5%和10.7%;去掉动态时间规整排序后为92.5%和31.4%。

完整系统报告LIBERO平均97.7%、RoboTwin 2.0平均60.4%、四项实体Aloha任务平均83.2%。这些数字不能与RoboDrop直接比较,因为数据、骨干和协议都不同;它们支持的是一个更局部的结论:冻结策略也能从对齐示范中获得测试时适配。局限也很现实:示范库没有覆盖的新阶段仍然无解,检索服务会增加延迟与运维,仿真任务每项只有10次,官方全文也没有给出代码仓库。

比较维度不是“谁的成功率最高”,而是每篇论文修复哪个环节、证据来自何种实验、最硬边界在哪里。

三、从二维像素到三维路点:机器人终于知道手该往哪儿走

视觉语言模型擅长在图像上指出“从这里绕到那里”,但二维轨迹天然缺少深度。同一条像素曲线可能贴着桌面,也可能悬在空中;简单查深度图又会遇到噪声和自由空间没有表面深度的问题。3DWay选择了一个很聪明的折中:不逼视觉语言模型直接回归陌生的三维坐标,而是让它在两个已标定视角中生成相互对应的二维路点,再用几何三角化恢复世界坐标。

这相当于让模型做擅长的“看图与输出序列”,把确定性几何留给传统算法。恢复出的三维路点既可在简单任务中直接执行,也可作为显式先验喂给通用视觉—语言—动作模型。在机器人学习评测系统(RLBench)未见任务上,完整路点模型成功率64.0%;少样本π0加入路点后由17.6%升至46.1%;真实基础任务从21.7%升至65.8%。它真正补的是动作表示,不是再造一个更大的端到端策略。

这条路线的代价同样清楚:双视角内外参要可靠,路点主要表达平移,末端姿态、抓取力和动态重规划没有被完整编码。当相机震动、遮挡严重或物体移动时,离线三角化出的漂亮轨迹仍可能过期。因此3DWay更适合成为“粗动作骨架”,后面还需要接触反馈和闭环控制接管最后几厘米。

四、最后几厘米最难:DeCAL让触觉不再只是附加通道

拧瓶盖、插装零件和双手交接时,视觉恰恰会在最关键的接触阶段被手指遮住。许多系统虽然加了触觉,却把它和图像一样从头到尾混合,未接触时触觉噪声反而干扰策略;真正接触后,又缺少对滑移、受力和形变如何发展的预测。DeCAL把理解、未来想象和动作生成拆成三个专家,再用联合注意力交换信息。

它有两个关键机制。第一,接触感知门在尚未接触时压低触觉权重,真正接触后再放大;第二,潜在协同想象同时预测未来视觉、指尖形变图和六维力,把“接下来会滑还是会卡”作为动作专家的物理先验。六项真实任务每项20次,成功率分别为100%、80%、65%、80%、60%和40%,平均70.8%,论文取整为71%,最强基线平均55.8%;动作块平均延迟约0.27秒。

最值得借鉴的不是多加了十个传感器,而是根据接触阶段决定何时相信触觉,并把未来接触状态变成训练目标。但硬件账单不能省略:触觉标定、力回归、形变转换和56维双臂双手动作都增加部署复杂度;失败主要来自双臂交接时序和头部相机视野。这说明精细操作的瓶颈已经从“能不能看见”转向“能不能在接触中持续校正”。

五、机械臂会抓还不够,人形机器人得让整个身体通过

传统导航常把机器人画成地图上的一个圆点,只规划二维路径。人形机器人穿窄门、绕桌椅、跨地面障碍或从横杆下钻过时,手臂摆放、躯干倾斜、步长和朝向共同决定是否碰撞。TANGO把“去哪里”和“身体怎么过去”合成一个问题:输入语言、前视与下视图像、本体状态,直接生成29自由度关节动作块。

训练数据由Plan–Edit–Track管线在578个室内源场景中制造:先用全局路径规划找通路,再生成行走,随后加入侧身、抬腿、弯腰等避障动作,最后用强化学习跟踪器筛掉不可执行或会碰撞的轨迹。最终得到64,633条轨迹,生成与渲染合计211个专业图形处理器小时。这种做法的价值在于,模型看到的不只是导航点,而是经过动力学筛选的全身行为。

在杂乱未见场景中,TANGO仅使用彩色视觉达到43.75%成功率、31.83路径效率和9.90%碰撞率;最强模块化基线为41.88%、29.49和15.81%。真实Unitree G1上,短程、约30米长程和三维障碍分别成功12/15、8/15、10/15。数字看起来不错,但不能忽略比较协议:视觉语言导航主表中的部分基线使用近似“瞬移”执行,而TANGO带真实低层控制;其未见集路径效率也没有超过最强二维基线。因此更稳妥的结论是:全身动作监督减少了复杂障碍中的接口损失,而不是人形导航已经被解决。

六、世界模型想当模拟器,先要学会新相机里的动作是什么意思

机器人世界模型面临一个容易被忽略的问题:动作数值不是像素世界的通用语言。同样的“向右移动”,换了相机角度、机器人底座或机械臂形态,画面里的运动方向和尺度都会变。把多个环境混在一起训练,就会产生互相冲突的动作—视觉监督。SyncWorld的办法像新设备上岗前做标定:先播放一段覆盖六个可控自由度的帧—动作片段,让模型在上下文里推断当前设置的动作—视觉映射。

SyncWorld官方流程图:视觉校准片段、交互历史和未来动作共同作为上下文,模型在不更新参数的情况下预测新设置中的未来画面。

保留校准训练、但测试时不提供显式校准片段时,模型在LIBERO、机器人操作仿真系统(ManiSkill)和真实场景的生成质量指标(FID)分别为8.7、14.0和5.9;如果从训练中移除校准机制,则恶化到15.6、25.7和18.2。更有产品味的一步,是把生成的候选动作后果交给排序器:三个作者事先确认存在提升空间的LIBERO任务,成功率由0.52/0.56/0.48升至0.58/0.72/0.60。视觉校准把“每个工位重新微调”改写成“先演示动作坐标系”,这可能是世界模型走向多机器人部署的重要接口。

SyncWorld官方仓库总览图:同一模型通过视觉校准适配不同场景、相机和机器人设置,并生成动作条件未来画面。图像为模型预测与实验示意,不是所有场景的真实执行记录。

不过,这里最需要降温。策略改进只报告三个oracle确认“有提升空间”的任务,并使用视觉语言模型做裁判,不能外推为所有策略都受益;训练仍以仿真为主,极端视角、未见物体和精细旋转会出现模糊、错位与轻微幻觉。训练成本为4组、每组8张H100,约2至3天;官方仓库还要求较新一代高端图形处理器、相应计算环境和约60GB存储空间。代码开放不等于普通团队可以低成本复现。

七、最后用什么验收?FolDeX把失败恢复和衣物折叠搬上实机

刚体短任务很容易让机器人看起来“差不多能用了”。衣物折叠却会持续改变形态,产生自遮挡、缠绕和误差累积;前一步抓偏一点,后面每一步都会继承这个偏差。FolDeX因此没有再造一个模型,而是建立全部来自真实机器人的长时程可变形物体基准:2000余小时数据、20多个任务、10多种机器人形态,并把问题分成恢复数据、跨任务、跨场景和跨形态四条轴。

它还提供统一的外部实机评测平台:保留测试实物、控制初始化和最大时长,除了成功率,还看0到5级整洁度、完成时间与折叠综合分。基线实验中,多任务参考策略将平均成功率从72.50%提高到80.75%;加入交互式纠错恢复轨迹后进一步升到95.00%,折叠综合分从75.59升到82.53。这里最有价值的发现不是又一个95%,而是失败后的人工介入轨迹,本身是一类高价值训练数据

论文也给出反例:把跨任务或跨机器人数据简单混在一起,会产生动作空间干扰和灾难性遗忘。规模大不代表数据自然兼容,这正好与RoboDrop形成呼应。FolDeX的限制是成本:实机评测昂贵,目前只有部分参考模型;整洁度仍含人工协商评分,跨任务和跨形态迁移更多提供诊断协议,而不是已经解决的答案。

八、七篇论文拼起来,能推导出什么新方案

把这些工作当成可组合模块,可以得到一条值得验证的路线。训练前,RoboDrop筛掉与目标任务梯度冲突的轨迹;执行前,ICI-VLA从可靠库中检索当前子阶段示范;策略再由3DWay给出明确三维路点。

进入物理执行后,DeCAL在接触区间用触觉和未来受力修正;如果是人形平台,TANGO式动作专家把粗路径翻译成全身动作;真正执行前,再用SyncWorld在当前相机和机器人设置下试演多个候选。最后把长时程失败与人工恢复轨迹送回统一实机评测,让系统学习何时继续、何时恢复、何时请求人工接管。

可验证的新研究假设:将数据清洗、阶段示范、三维路点、接触反馈、全身控制、校准世界模型和长时程恢复评测串成闭环。

这个组合最值得做的不是把七个网络一股脑堆进同一台机器,而是设计分层触发。远离物体时只需几何路点与低频世界模型;进入接触区再打开高成本触觉想象;检测到进度停滞或世界模型分歧时,才检索新示范或请求人工介入。可靠性不一定来自一个更大的端到端模型,也可能来自“在正确时刻调用正确模块”。

这条假设可以被明确证伪。研究者可在同一套长时程实机任务上做七级消融:只换数据清洗、只加示范检索、只加三维路点、只在接触时启用触觉、只加世界模型重排,再比较成功率、碰撞、人工接管次数、每步延迟和每次成功成本。如果组合收益只是各模块单独收益之和,说明它们没有形成闭环;如果世界模型重排降低碰撞却大幅增加延迟,则产品选择可能是局部启用,而不是全程运行。

九、判断一项机器人工作值不值得跟,至少看五张账

第一张是数据账。要问训练数据来自仿真、专家示教、普通操作员还是部署后的恢复过程,有没有时间错位、失败轨迹和跨形态混合;还要看测试对象是否真正与训练对象隔离。RoboDrop和FolDeX共同提醒,数据来源与使用方式会改变结论,不能只写“多少小时、多少条轨迹”。一万条相互冲突的示教,未必比一千条阶段明确、错误可审计的轨迹更有价值。

第二张是动作账。论文输出的是离散方向、二维路点、三维位置、末端位姿,还是全身关节目标?输出越接近执行器,模型承担的动力学责任越大;输出越抽象,系统就越依赖后端规划器与控制器。3DWay保留几何确定性,TANGO直接预测全身动作,两者没有简单优劣,区别在于团队愿意把风险放在哪一层、哪一层最容易测试和回退。

第三张是时延账。DeCAL每个动作块约0.27秒,SyncWorld还要生成候选未来并排序,ICI-VLA需要检索上下文。单看成功率,所有模块都值得加;放进一个闭环,延迟却可能让机器人错过接触窗口。成熟系统要区分慢速规划、中速动作块和高速力控,把高成本推理放在真正改变决策的位置,而不是让每个控制周期都背着整套大模型。

第四张是失败账,第五张是维护账。失败账不只记录最终成败,还应记录碰撞、重复动作、进度停滞、抓取滑移和人工接管;维护账则包括相机重新标定、触觉漂移、示范库更新、模型权重与机器人固件兼容。论文通常在固定周期内测试一个版本,产品却要在环境缓慢变化中运行数月。真正值得跟进的方法,应当让故障更容易定位、模块更容易替换,而不是只在首日演示里拿到更高分。

对学生和研究者,最值得学习的是论文如何把模糊的“泛化不好”拆成可测变量:数据梯度是否冲突、示范阶段是否对齐、路点是否具备三维一致性、接触时触觉是否真正贡献、动作—视觉映射是否随设备变化。一个好选题不一定先发明更大的骨干,也可以先找到旧评测遗漏的失败变量,再设计最小机制和对照实验把它钉住。

对创业团队和应用方,建议先挑离现金流最近的一段闭环。例如仓储抓取先做数据审计、三维路点和失败恢复,不必一开始就训练视频世界模型;服务型人形机器人若主要卡在窄通道与全身碰撞,则应优先建设可执行轨迹与安全控制。把研究模块映射到真实故障成本,比追逐一个覆盖所有任务的宏大模型更容易形成可交付的产品,也更容易在每次迭代后确认收益究竟来自哪里。

十、工程团队最容易踩的四个坑

第一,跨论文成功率不能直接排总榜。 97.7%、71%、65.8%和95%来自不同机器人、任务、数据量与试验次数。它们可以证明各自方法在特定协议里有效,不能证明谁是“最强机器人模型”。

第二,开源不等于低门槛。 触觉策略公开代码与数据,但需要双臂、灵巧手和十个触觉传感器;三维路点方案需要标定多视角和大模型训练;校准世界模型虽公开完整训练评测代码,却要求高端图形处理器、约60GB环境和额外模型权重。

第三,仿真规模不能替代真实覆盖。 TANGO的64,633条轨迹很有价值,但真实每类15次;ICI-VLA仿真每任务10次。进入工厂、家庭或医院前,地面摩擦、移动障碍、光照、磨损和人为扰动都可能改变结论。

第四,数据越多不一定越好。 RoboDrop说明坏示教会产生反向更新,FolDeX说明跨任务、跨形态简单混合会干扰。机器人学习的下一轮竞争,很可能从“谁的数据更多”转向“谁知道每条数据在什么任务、阶段和形态下有用”。

十一、龙哥点评:机器人真正缺的,是一套会承认不确定性的系统

这7篇论文放在一起,最明显的变化是研究重心正在离开单一漂亮演示。数据会不会带偏、示范是否匹配当前阶段、二维轨迹有没有三维歧义、视觉被遮挡后该信谁、换相机后动作还是什么意思、长任务失败后能否恢复——这些都不是“模型再大一点”自然消失的问题。

短期看,最容易转化为工程收益的是三类模块:数据清洗、显式三维路点、统一实机评测。它们不要求团队立即推翻现有策略,却能减少坏数据、提升可解释性、让比较更公平。触觉协同想象和校准世界模型更像下一阶段能力,潜力大,但硬件、算力与集成成本也更高。全身视觉—语言—动作模型适合人形平台,却不应被机械地复制到所有固定机械臂场景。

长期看,耐用的机器人系统会像成熟软件一样拥有监控、回滚、测试和分层接口:它知道当前示范是否匹配,知道相机坐标是否变化,知道触觉何时可信,知道模拟结果何时分歧,也知道任务失败后应请求恢复而不是继续硬做。从“每次都自信地产生动作”走向“先校准、再行动、能恢复、可验收”,才是真正的现实世界智能。

龙迷三问

第一问:如果预算只能投一处,先换更大模型,还是先审计数据? 对已有目标工位和稳定任务的团队,先量化坏示教与时间错位通常更划算;模型升级若继续吃同一批污染数据,收益很容易被抵消。

第二问:世界模型什么时候值得上线? 当动作候选多、真实试错昂贵、工位变化频繁,并且团队能提供短校准片段时,它可能值得做测试时排序;若任务本身简单、控制周期极紧,全程生成视频反而可能得不偿失。

第三问:论文里的“真实机器人”够真实吗? 看任务时长、物体变化、场景扰动、试验次数、失败是否公开、人工接管是否计入,而不是只看有没有机械臂出镜。FolDeX这类统一外部实机协议,可能比又一个自报成功率更能推动行业前进。

主要论文与资源

RoboDrop|2026-09-09
数据入口:识别会把后训练带偏的示教轨迹。
https://arxiv.org/abs/2609.10021

ICI-VLA|2026-09-07
测试时适配:不更新参数,检索当前阶段真正匹配的微型示范。
https://arxiv.org/abs/2609.07581

3DWay|2026-09-08
动作表示:把二维轨迹歧义变成可执行的三维路点。
https://arxiv.org/abs/2609.08224

DeCAL|2026-09-08
接触闭环:在遮挡最严重时,让触觉与未来动力学进入策略。
https://arxiv.org/abs/2609.09119

TANGO|2026-09-08
全身控制:把二维“往哪走”升级为29自由度“身体怎么过去”。
https://arxiv.org/abs/2609.09158

SyncWorld|2026-09-08
测试时想象:先校准动作与像素变化,再把世界模型当作新工位模拟器。
https://arxiv.org/abs/2609.09155

FolDeX|2026-09-09
终局评测:用长时程、可变形物体和失败恢复检验整条链。
https://arxiv.org/abs/2609.10243

本文基于龙哥读论文的论文检索系统(PaperDaily)与论文整理系统(PaperMiner)进行汇总。论文数字均回到官方全文、项目页或仓库核对;不同论文的任务、机器人、基线和试验次数不一致,文中不作跨协议总排名。官方图与演示用于研究解读并标注来源;本文不构成对真实部署安全性的保证。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球