← 返回 PaperDaily 视觉与图像

40%任务效率提升!重庆大学提出ExS2D:零双臂数据训练双臂机器人

想让家里的扫地机器人帮你搬桌子?想给它找俩搭子?这篇重庆大学的新研究带来一个“骚操作”:让你的单臂机器人不用练习,直接点亮“双打”天赋。不需要昂贵耗时的双臂演示数据,它们通过一个精巧的层次化框架,就让机器人自己学会左右开弓。一句话总结:白嫖单臂数据,通吃双臂任务。🤚

40%任务效率提升!重庆大学提出ExS2D:零双臂数据训练双臂机器人
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
想让家里的扫地机器人帮你搬桌子?想给它找俩搭子?这篇重庆大学的新研究带来一个“骚操作”:让你的单臂机器人不用练习,直接点亮“双打”天赋。不需要昂贵耗时的双臂演示数据,它们通过一个精巧的层次化框架,就让机器人自己学会左右开弓。一句话总结:白嫖单臂数据,通吃双臂任务。🤚


原论文信息如下:
论文标题:
One-to-Two Acting: A Novel Framework for Single-arm Agent Action Expansion to Dual Arms
发表日期:
2026年06月
发表单位:
重庆大学(Chongqing University)、西交利物浦大学(Xi’an Jiaotong-Liverpool University)、Lumos Robotics
好的,没问题!作为龙哥,我这就给你写一篇关于这篇论文的公众号文章。 以下是根据论文内容、引言及要求生成的文章主体部分HTML代码。这部分内容将紧接您提供的引言和论文基本信息,并完全遵循了所有的格式、风格和篇幅要求。 ---

从单臂到双臂:无需双臂演示如何实现?

好的,先说结论:这篇论文做的事情,简单来说就是,教你如何“白嫖”已有的单臂机器人数据,训练出一个能干活的双臂机器人。不用再费劲地去收集那些昂贵且费力的双臂演示数据了,听起来是不是很香?🤚
想象一下,你家里的单臂机器人,只能像复读机一样,一件一件地搬东西。现在,你希望它进化成“双臂大厨”,能够两手同时开工,效率翻倍。传统的做法是,给它看无数个“双臂大厨”的教学视频(也就是双臂演示数据),这玩意儿既贵又难搞。
重庆大学等机构的研究者们就想:能不能让机器人自己看着单臂视频,就学会怎么让两只手一起干活?这就像让一个只会单手打蛋的厨师,你给他看了几个单手打蛋的视频,他居然能自己琢磨出用双手同时打两个蛋的绝活。听起来有点反常识,但这篇论文的框架,确实做到了。
插图
整个框架叫做 ExS2D,全称是 Extending Single-Arm Agent Actions to Dual Arms,意思就是“将单臂智能体的动作扩展到双臂”。它不依赖于任何昂贵的双臂演示数据,而是利用现有、成熟的单臂控制策略,通过一个层级化(Hierarchical)的框架,实现了双臂的协同操作。
ExS2D主要由三个核心模块构成,像个三明治一样,层层递进:

1. 视觉-语言子任务生成器(VL-SubGen)

这是整个系统的“大脑”。它接收一个复杂的、长周期的任务指令(比如“把红色的方块叠到蓝色的方块上”),然后根据当前的视觉观察和环境描述,把这个大任务分解成一系列有先后顺序的、不能再分的“子任务”(Subtask)。例如,子任务1:抓取红色方块子任务2:将红色方块放到蓝色方块上。它还会明确地捕捉并记录这些子任务之间的时序依赖(Temporal Precedence),比如任务2必须在任务1完成之后才能进行。

2. 子任务引导的动作映射器(SA-Map)

当“大脑”把任务分解好之后,SA-Map这个“手”就开始工作了。它的任务是把每个抽象的子任务,转化为机器人能理解的、具体的“抓取-放置”动作(Pick-Place Action)。这里用到了一个非常巧妙的设计:
它先用一个VLM(视觉语言模型,这里是OWL-ViT)找到目标物体的包围盒,然后用SAM(Segment Anything Model)把这个物体精确地分割出来。最后,它会生成一个“注意力掩码”(Attention Mask),把图像中和当前子任务无关的部分统统屏蔽掉,只让机器人关注它该抓的东西。这就像你让一个小孩去拿桌上的苹果,但不要把旁边的香蕉碰倒,这个掩码就是专门告诉他“只看苹果,别看香蕉”。

3. 优先级感知的双臂协调器(P-DCoord)

前面的步骤已经为双臂协作铺平了道路。现在,P-DCoord这个“协调员”出场了,它的目标是回答一个核心问题:抓红方块和抓蓝方块这两个没啥依赖关系的子任务,到底该让哪只胳膊去干,才能干得又快又好,还不会打架(发生碰撞)?
P-DCoord也是由一个MLLM(多模态大语言模型)驱动的。它首先对子任务进行依赖推理,找出那些可以同时进行(并行)的子任务。然后,它会使用一个轻量级的运动代价函数,来评估所有可能的双臂分配方案。这个代价函数不仅考虑机械臂从当前位置移动到抓取点的运动路径长短,还会考虑抓取点和放置点之间的距离。最后,它会调用一个运动规划器(RRT*),在物理层面上验证这个分配方案是否真的可行,会不会发生碰撞。如果不行,它还会优雅地回退到单臂依次执行,保证任务不失败。
简单来说,这套流程就是:先分解任务,再精确动作,最后协调双臂。每一步都环环相扣,最终实现了从单臂到双臂的“无痛升级”。

效果如何?成功率持平,步骤减少54.4%

吹了这么多,是骡子是马,得拉出来溜溜。论文在Raven Bench这个模拟器上设置了四个经典的双臂桌面操作任务,比如叠方块、放碗里、找字母、组装套件等等。
废话不多说,直接看对比结果。ExS2D跟原始的CLIPort(单臂基线)和其他几个双臂规划器(LLM+MAP, RoCo)进行了一轮battle。
图一:各项任务的方法性能对比
表I:各项任务的方法性能对比。SR表示成功率(越高越好),Step表示执行步数(越低越好)。
看到这个表,龙哥我先来给各位看官分析分析。
从宏观平均(Macro-Average)来看,ExS2D的表现非常亮眼:

成功率(SR):ExS2D达到了87.36%,虽然比单臂的CLIPort(88.57%)低了1.21个百分点,但比另一类双臂规划器(RoCo的73.78%, LLM+MAP的70.22%)高出了一大截。

执行步数(Step):这才是ExS2D的杀手锏。它平均只需2.86步,相比单臂的6.27步,减少了整整54.4%!这意味着任务完成速度快了一倍多。即使和效率最高的双臂规划器RoCo(3.29步)相比,也快了13%左右。

这就像什么呢?单臂机器人做事是个勤恳的流水线工人,一环扣一环(6步)。而ExS2D就是个手脚麻利的“甩手掌柜”,能同时处理多个事(2.86步),效率翻倍。虽然偶尔也可能会出错,但总体效率和成功率达到了一个非常好的平衡点。
龙哥找到了一个很形象的比喻:单臂是“做一道菜再洗一个碗”(顺序操作),而ExS2D是“炖汤的时候顺便把地拖了”(并行操作)。效率的提升就是这么来的。
论文还做了充分的消融实验(Ablation Study),来证明各个模块的有效性。
图二:消融实验
表II:消融实验。W/o Mask表示去掉掩码引导,W/ Fixed Mask使用固定掩码,W/o Precedence Reasoning去掉优先级推理,W/ Fixed Allocation使用固定分配策略。
表格二里的数据说明了一切:

掩码引导(Mask Guidance)极其重要:去掉它(W/o Mask),成功率直接从87.36%狂跌到70.21%。即使是使用一个固定掩码(W/ Fixed Mask),也只能恢复到78.21%。这说明SA-Map模块的动态掩码技术是精确抓取的定海神针。

优先级推理(Precedence Reasoning)是关键:如果不考虑子任务的先后顺序(W/o Precedence Reasoning),成功率更是降到63.09%,运动代价也更高。如果用固定分配策略(W/ Fixed Allocation),虽然成功率高了些(80.21%),但运动代价增加了不少。这证明了P-DCoord这个“协调员”在提升效率和避免冲突上都发挥了不可替代的作用。

真的可行吗?真实机器人验证,零双臂演示

光在模拟器里跑得欢可不行,得在真实的机器人上见真章。论文用两台大象机器人(Elephant Pro 630)和一个D455深度相机,搭建了一个真实世界的操作场景。他们设计了四个真实世界的任务,包括叠毛巾、放杯子等。
图三:真实世界任务结果
表III:真实世界任务结果。展示了在仅有少量单臂样本且零双臂演示数据下的成功率。
在少样本(Few-shot)训练的情况下,每个任务只用了30-50个单臂演示样本,完全没有使用任何一个双臂演示样本。结果如下:

任务(e-h):平均成功率达到了60.51%。其中,像把卷纸放进碗里再盖上盖子这种有明确时序依赖的任务,以及需要双手协调折毛巾这种高难度的任务,ExS2D都成功完成了。

论文还展示了SA-Map模块在真实场景下预测的抓取/放置区域(Affordance Predictions),如下图所示,可以看到机器人准确锁定了目标区域。
图四:每个真实世界任务的可操作区域预测
图四:每个真实世界任务的可操作区域预测。展示了SA-Map在不同任务中准确预测抓取点(绿色区域)和放置点(蓝色区域)的能力。
看到这里,龙哥觉得这个结果属实不错了。要知道,这可是在双臂数据下取得的,证明了ExS2D的泛化能力和实用性。虽然成功率还有提升空间,但方向绝对是正确的。

局限与展望:开环控制的下一步

话说回来,ExS2D也并非没有短板。论文自己也很坦诚地指出了它的局限性。

最大的问题:开环执行。目前的系统是一个“开环”(open-loop)系统。意思是它根据当前的视觉输入,规划好一系列动作并开始执行,但执行过程中不会再去观察环境的变化来调整动作。这就有点像闭着眼睛走路,如果中间出了点小意外(比如抓取时物体滑了),它就不知道接着该干嘛了。

第二个局限:动作类型单一。ExS2D主要支持“抓取-放置”这种桌面上的平面操作(Planar Pick-Place)。对于那些需要更精细、更灵巧的操作,比如拧螺丝、揉面团,就显得力不从心了。毕竟它只学会了抓和放,还没学会“搓、揉、捏”等更高级的技能。

未来的方向:论文提到,未来的工作会探索闭环控制,引入更丰富的精细操作技能,并扩展到更多机械臂的场景。这无疑是一个非常值得期待的方向。

简单来说,ExS2D为我们打开了一扇新的大门,证明了“从单臂到双臂”这条路是可行的。虽然目前还是个刚会走路的孩子,但未来的成长空间是无限的。这绝对是目前“双臂机器人”研究领域一篇非常有价值的“草稿”和探索。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决了什么问题?这篇论文解决了“如何利用已有的单臂机器人数据,训练出一个零双臂演示数据的双臂机器人”这个难题。它提出的ExS2D框架,不需要昂贵且难收集的双臂演示数据,而是通过一个层次化的分解、映射和协调机制,让单臂智能体学会了如何像双臂一样协同工作,从而达到提高操作效率和吞吐量的目的。

ExS2D中的VL-SubGen、SA-Map和P-DCoord分别指什么?
VL-SubGen(Vision-Language Subtask Generator,视觉语言子任务生成器):它是一个基于MLLM的模块,负责将复杂任务分解成有顺序依赖的子任务。
SA-Map(Subtask-Guided Action Mapping,子任务引导的动作映射器):它负责把每个抽象的子任务转化为具体的“抓取-放置”动作,并使用VLM和SAM生成掩码来精确锁定目标物体。
P-DCoord(Precedence-aware Dual-arm Coordinator,优先级感知的双臂协调器):它就像一个聪明的调度员,负责规划双臂的动作,找出可以并行的子任务,并决定每个任务分配给哪只手臂,同时确保两者不会撞到一起。

这个方法在实际应用中有什么潜在的困难?ExS2D目前最大的短板是其“开环”执行的架构。这意味着它在执行动作的过程中不会实时观察环境变化,一旦出现意外情况(如物件滑落、位置偏差)就无法纠正,容错性较差。其次,它目前只支持抓取和放置这类相对简单的平面操作,无法胜任需要精细力控和灵巧操作的复杂任务(如穿针引线、揉面)。因此,将其部署到高精度或高动态变化的生产环境中,还需要进一步的稳定性验证和闭环控制设计。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

论文创新性较高,提出了一种“从单臂到双臂”的无监督扩展范式,利用VLMs和层级化规划解决了双臂数据匮乏的核心痛点。这个“白嫖”数据的思路非常灵动且有启发性。

实验合理度:★★★★☆

实验设计比较完整,包括了模拟器上的多任务对比、消融实验、真实机器人验证。对比基线选取得当(包括单臂和双臂基线),消融实验足以支撑其各个模块的有效性证明。

学术研究价值:★★★★☆

研究价值较高。为双臂机器人操作提供了一个全新的数据高效范式,有望降低相关研究的门槛,刺激更多关于“技能迁移”和“零样本双臂操作”的研究。

稳定性:★★★☆☆

稳定性一般。模拟器上表现良好,但真实世界平均成功率只有60.51%,且采用开环控制,容易出错。在面对非结构化环境时的鲁棒性有待验证,离“能用”还有一段距离。

适应性以及泛化能力:★★★★☆

泛化能力较强。能从单臂数据成功泛化并学习多种任务,证明了其框架可以适应不同的操作场景。但其底层动作库仍限于“抓取-放置”,限制了其应对更复杂任务的泛化能力。

硬件需求及成本:★★★☆☆

对硬件有一定要求。虽然无需双臂演示数据降低了数据成本,但运行VLM(Qwen2.5-VL-7B)和MLLM(Qwen3-VL)需要较强的计算资源。不过其使用的机器人本体(Elephant Pro 630)和相机都是常见设备,硬件成本可控。

复现难度:★★★☆☆

有一定复现难度。虽然论文描述了方法,但未提供开源代码。训练一个VL-SubGen需要微调大模型,对计算资源和工程师的经验都有一定要求。SA-Map和P-DCoord的集成也需要一定的工程能力。

产品化成熟度:★★☆☆☆

产品化程度较低。目前更像一个技术验证原型,开环控制、只能做简单抓放等限制,使其距离商业落地还有较长的路要走。未来如果要产品化,至少需要引入视觉闭环反馈和更丰富的操作技能。

可能的问题:最大的问题是整个系统是开环的,非常脆弱。此外,SA-Map采用了两阶段的“检测+分割+PnP”流程,步骤多,中间的误差可能会累积。最后,P-DCoord的决策依赖于一个固定的运动代价函数,当环境复杂时可能不是最优解。


主要参考文献

[1] Mohit Shridhar, Lucas Manuelli, et al., “CLIPort: What and Where Pathways for Robotic Manipulation,” in Proceedings of the 5th Conference on Robot Learning, CoRL. 2022, vol. 164, pp. 894–906, PMLR. (文中引用的单臂Agent基线)
[2] Tony Z. Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn, “Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware,” in Proceedings of Robotics: Science and Systems (RSS), 2023. (文中引用的ALOHA系统,典型的双臂演示数据收集方法)
[3] Kun Chu, Xufeng Zhao, Cornelius Weber, and Stefan Wermter, “LLM+MAP: Bimanual Robot Task Planning using Large Language Models and Planning Domain Definition Language,” ArXiv, vol. abs/2503.17309, 2025.
[4] Mandi et al., “RoCo: Dialectic Multi-Robot Collaboration with Large Language Models,” in 2024 IEEE International Conference on Robotics and Automation (ICRA), 2024, pp. 286–299.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想亲眼看看机器人如何从“单挑”变“双打”吗?本文藏着你的答案!🚀
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器人+上海+重大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。