← 返回 PaperDaily 视觉与图像

UC Berkeley等四校联名Mana:让机器人学会用钳子、打针,零样本迁移!

继2026年6月聊过AI看视频学抓瓶子后,这篇Mana又来了!UC Berkeley、CMU、斯坦福、亚马逊四家联手,把灵巧操作关节工具的难题,变成一串“动画关键帧”来解决。一分钟标注,零样本迁移,成功率高达70%!这操作,值得每个机器人从业者了解。

UC Berkeley等四校联名Mana:让机器人学会用钳子、打针,零样本迁移!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
继2026年6月聊过AI看视频学抓瓶子后,这篇Mana又来了!UC Berkeley、CMU、斯坦福、亚马逊四家联手,把灵巧操作关节工具的难题,变成一串“动画关键帧”来解决。一分钟标注,零样本迁移,成功率高达70%!这操作,值得每个机器人从业者了解。


原论文信息如下:
论文标题:
Mana: Dexterous Manipulation of Articulated Tools
发表日期:
2026年06月
发表单位:
UC Berkeley, CMU, Stanford University, Amazon FAR
原文链接:
https://arxiv.org/pdf/2606.13677v1.pdf
项目链接:
https://zhaohengyin.github.io/mana
想象一下,让你用一只手拿起桌上的钳子,然后精准地剪断一根细铁丝。这个动作对人类来说几乎不费吹灰之力,但对机器人灵巧手而言,却是一个极具挑战的难题。钳子这类工具具有内部关节,机器人不仅要牢牢抓住它,还要在抓住的同时施加力量去“开合”它,这需要精确协调夹持的稳定性和操作的力度,稍有偏差,工具就可能滑落或失控。
插图
就在这个6月,来自加州大学伯克利分校、卡内基梅隆大学、斯坦福大学和亚马逊FAR实验室的研究者们联合发表了一篇重量级论文,提出了名为Mana(Manipulation Animator)的通用框架。这篇论文的核心思想非常巧妙:将复杂的灵巧操作问题,重新理解为计算机动画中的“关键帧生成”问题。简单来说,就是先让AI在模拟环境中自动、高效地生成大量高质量的操作数据,然后训练出一个能直接部署到真实机器人上的视觉运动策略,实现零样本迁移。效果有多好?看上图(图1)就知道了!
图1:Mana框架概览
图1:Mana(Manipulation Animator)是一个学习灵巧操作关节工具的框架,实现零样本的模拟到现实迁移。该系统可以抓取和操作4种具有不同挑战性形状、尺寸和关节属性的工具,包括钳子、镊子、衣夹和注射器。除了通过手腕遥操作实现的工具到目标点的过渡外,所有上述抓取和手指控制都是自主完成的。如右下角所示,看似简单的过程需要极高精度的力控制来同时稳定和驱动工具。

关节工具操作难在哪?

要让机器人灵巧手熟练使用钳子、注射器这类关节工具,主要面临三大挑战:

1. 接触点的精准与力的平衡:手指必须在摩擦锥内施加精确的接触力来稳定地驱动工具。为了“省力”而施加的、与表面法线方向不一致的力,很容易导致工具滑落;而为了“防滑”而沿着法线方向施力,又可能产生不必要的加速度或旋转,破坏抓取的稳定性。

2. 高度耦合的动态系统:多根手指和关节工具形成了一个紧密耦合的动态系统,任何一根手指微小的执行误差,都会改变接触点、影响力臂,进而扰乱整个系统的稳定。

3. 大力量的精确控制:很多工具(如钳子剪断铁丝、推动注射器活塞)需要3到7牛顿的力,这种大力极易在操作过程中加剧滑移和动态不稳定性。

图2:关节工具使用的物理挑战
图2:关节工具使用的物理挑战。左图:灵巧的关节工具操作对接触点和力配置高度敏感。手指必须在摩擦锥内施加精确的接触力才能稳定地驱动工具。中图:由于手指和关节工具形成了一个紧密耦合的动态系统,即使一个关节处有微小的执行误差也可能导致不稳定和失败。右图:遥操作噪声大,甚至不可行。现有的遥操作接口是基于位置的而非基于力的,无法产生精确或足够的力。
传统的解决方案,如人类遥操作(图2右)和端到端的强化学习,在此类任务上都显得力不从心。

方法概述:Mana数据生成系统

Mana框架的核心是一个受计算机动画(inbetweening,即补间动画)启发而设计的“粗到细”数据生成流水线。它不追求端到端的普适性学习,而是将复杂的操作序列拆解为几个可管理的阶段,如下图3所示。
图3:Mana数据系统概述
图3:Mana数据系统概述。Mana采用粗到细的方法为策略学习生成工具操作数据。它将整个操作序列分解为许多程序化生成的抓取关键帧,然后使用运动规划(MP)和强化学习(RL)从这些关键帧生成操作轨迹(即补间动画)。
这个系统的工作流程可以分为四个核心步骤:

第一步:1分钟标注,定义功能区域

用户只需在3D工具模型上点击几下,用不到一分钟的时间,标记出工具的功能区域。比如钳子的手柄、注射器的活塞和针筒。这个过程极其简单,为后续的自动化流程打下了基础。

第二步:程序化生成抓取关键帧

基于标注,系统自动生成大量物理上可信的抓取和操作关键帧。这就像是动画师先画出角色在几个关键瞬间的姿势。Mana不仅生成“抓取成功”的瞬间,还会生成抓取前、抓取中和手内操作等不同阶段的关键帧,形成一张密集的“关键帧图谱”。

第三步:补间动画,规划轨迹

连接这些关键帧,就是生成“补间动画”的过程。Mana针对不同阶段采取不同策略:

预抓取阶段:使用GPU加速的RRT-Connect运动规划算法,规划出一条无碰撞的路径,让手从初始位置平稳移动到工具附近。这个阶段无需考虑力交互,用运动规划足矣。

抓取阶段:对于标准情况,通过程序化生成一个向内“握紧”的手指运动来抓取。对于薄、小、触点不稳定的困难情况,则使用一个短时长的强化学习策略来生成从预抓取到稳定抓取的转换轨迹。

手内操作阶段:这是最需要“力”的阶段,比如将钳子从张开状态闭合。Mana采用强化学习来处理这些接触密集的任务。通过精心设计的奖励函数,激励策略在保持稳定抓取的同时,成功改变工具的关节状态。同时,大量的域随机化(如关节的摩擦、质量、控制器增益等)被用来训练出对环境变化鲁棒的策略。


第四步:训练视觉运动策略,部署到真机

生成大量模拟轨迹后,Mana训练一个基于点云的transformer扩散策略。这个策略输入是机器人的第一人称视角点云信息和自身状态,输出是下一步的机器人动作指令。该策略完全在模拟数据上训练,可以直接零样本地部署到真实机器人上,控制灵巧手完成全套操作。
图4:控制器架构
图4:控制器架构。本文使用基于点云的扩散策略(黄色模块)进行控制。策略使用Mana生成的成功操作轨迹进行训练。
值得一提的是,为了应对极小的接触面(如1厘米厚的工具手柄),作者团队专门设计了带有扁平、柔软接触面的特制指尖,如图5所示。这个小小的硬件改动,极大地提升了抓取和操作的成功率。
图5:机器人硬件设置
图5:机器人硬件设置。左图:指尖设计。本文发现指尖的形状和材料对于从桌面成功抓取以及在操作过程中保持稳定接触至关重要。右图:部署环境设置。使用单个Realsense D435摄像头进行感知。

实验结果:70%成功率,吊打传统遥操作

研究团队在四种不同特性、共8个实例的关节工具上,对Mana系统进行了严格评估。实验分为抓取阶段和手内操作阶段,并与两种基线方法对比:开环Mana策略和基于几何重定向的遥操作系统GeoRT。
图6:实验对象和模拟环境
图6:实验对象和模拟环境。本文的测试对象涵盖不同尺寸、形状和关节属性。这些工具的厚度约为1厘米,需要3-7牛顿的力来驱动。
下面这个GIF是Mana系统在真实环境中零样本操控钳子的效果,可以看到机器人稳定地抓取并携带钳子完成移动。
Mana系统整体效果展示
Mana系统整体效果展示:机器人在真实环境中零样本自主使用四种关节工具(钳子、镊子、衣夹、注射器)进行握持和操作。
为了验证Mana的效果,研究团队在四种关节工具(钳子、镊子、衣夹、注射器)上进行实验,每种工具使用两个不同实例。他们测试了两个阶段:从桌面抓取工具(Grasp)和手内操作(Open/Close或Use)。对比的基线包括:开环执行Mana生成的轨迹(Ours Openloop)和基于几何重定向的遥操作(Teleop GeoRT)。
主要结果如下表所示(每个单元格中左右两个数字分别代表第一个和第二个实例的成功率,各测试10次):
*表格超出部分左右可以滑动
方法 Tongs Grasp Tongs Open Tongs Close Pliers Grasp Pliers Open Pliers Close Clothespin Grasp Clothespin Open Clothespin Close Syringe Grasp Syringe Use
Teleop (GeoRT)0.3/0.30.1/0.20.3/0.30.2/0.10.1/0.10.1/0.00.0/0.00.0/0.00.0/0.00.0/0.00.0/0.0
Ours (Openloop)0.5/0.60.6/0.70.4/0.60.4/0.40.3/0.40.3/0.30.3/0.20.2/0.40.4/0.30.1/0.00.3/0.3
Ours (Mana)0.8/0.80.8/0.80.7/0.80.7/0.60.7/0.70.7/0.70.8/0.70.8/0.70.6/0.70.7/0.50.6/0.6
表1:实验结果。Mana系统在抓取和手内操作两个阶段均显著优于基线方法。每个单元格中的左右两个数字分别代表两个实例在10次测试中的成功率。
可以看出,Mana在大多数任务上达到了60%-80%的成功率,而遥操作基线最高只有30%,且在衣夹和注射器上几乎为0。开环执行Mana轨迹(无视觉反馈)的效果居中,说明视觉反馈对于修正接触误差至关重要。
此外,研究还做了消融实验,考察数据量、状态多样性和力随机化对性能的影响,结果如图7所示。随着训练轨迹数量增加、抓取关键帧数量增加、域随机化强度增加,真实世界的表现逐步提升。这说明,对于这种高精度接触敏感的任务,数据的覆盖度是鲁棒性的关键
图7:消融实验
图7:消融实验。任务成功强烈依赖于数据数量、状态多样性和力随机化。由于期望的力方向和大小高度依赖于接触点,增加这些因素可以增强在接触敏感操作任务中的鲁棒性。
最后,团队还测试了Mana在真实任务中的表现,例如用钳子夹起小物件、用钳子剪断细线、给衣夹施加压力、用注射器注入液体。由于精确定位仍依赖手腕遥操作(仅用于对准目标),结果如下表所示,成功率为50%-70%,说明Mana学到的在手操作技能已经具备实用价值。
表2:各类工具使用任务的成功率
表2:各类工具使用任务的成功率(SR)。
插图

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:Mana这个名字到底是什么意思?全称是啥?Mana的全称是Manipulation Animator,中文可以理解为“操作动画师”。这个名字很形象:它把操作任务当作动画来生成。灵感来自于计算机动画中的“关键帧+补间”技术。

Q2:Mana与之前类似工作(如Dextreme、DexMV)比有什么核心区别?之前的工作大多聚焦于刚性物体的操作(如旋转魔方、玩球),或者是在工具已经被稳定抓握后再进行操控。Mana的工作流完整覆盖了从桌面抓取到功能操作的整个链条,而且针对的是非常薄、小、需要大力的关节工具。另外,Mana不需要任何人类演示,所有数据全部自动生成,这一点在灵巧操作领域是领先的。

Q3:Mana为什么只取得了70%的成功率,而不是更高?瓶颈在哪里?主要瓶颈有两方面:一是硬件本身力量有限,Allegro手指最大扭矩0.7Nm,对于需要超过10N力的工具(如某些剪钳)无能为力;二是感知能力,目前只能用RGB-D点云,在手指遮挡严重时容易丢失跟踪,而且无法检测滑移。论文中提到,如果能加入触觉传感器和更快的力反馈,成功率有望进一步提升。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

将动画的补间思想引入机器人数据生成,虽然概念本身并非全新,但针对关节工具这一具体场景做了系统化的实现,并验证了零样本迁移的有效性。属于中等偏上的创新。

实验合理度:★★★★☆

对比基线选择合理(遥操作和开环执行),且为每个工具设置了两个不同的实例,排除了偶然性。消融实验有力地支撑了数据量和多样性的重要性。唯一遗憾是没有与同期的其他SIM-TO-REAL方法(如DexterityGen)直接比较,但前者侧重刚性体。

学术研究价值:★★★★☆

为关节工具操作提供了一种可扩展、可复现的数据生成范本,推动了sim-to-real在精细操作领域的边界。其“分解->生成”的思路对其他接触密集型任务(如装配、手术)也有借鉴意义。

稳定性:★★★☆☆

在实验的四种工具上表现稳定,但遇到10N以上大力或高刚度工具时明显力不从心(硬件限制)。整体稳定,但覆盖范围有限。

适应性以及泛化能力:★★★☆☆

对具有相似几何和关节属性的工具可以泛化(同一类的不同实例),但对完全不同类型的工具(如剪刀vs螺丝刀)可能需重新标注和生成数据。此外,目前依赖ArUco或SAM分割,环境泛化性一般。

硬件需求及成本:★★★☆☆

需要一台高性能工作站(双RTX 4090)和一套Allegro灵巧手+协作臂,总成本约在10万元以上。对于个人研究者门槛较高,但对于实验室或企业可以接受。

复现难度:★★★☆☆

论文提供了项目页面和抽象算法描述,但未提供完整开源的代码和URDF模型。关键部件(如特制指尖的CAD文件)也未公开,复现需要一定工程投入。

产品化成熟度:★★☆☆☆

目前只是一个研究原型,距离在工厂或家庭中使用还有很长的路。需要解决精确的目标对准(依赖遥操作)、超过10N的力控、以及更鲁棒的视觉感知。但思路可以衍生出低成本、高数据效率的解决方案。

可能的问题:论文未与最新的端到端sim-to-real方法(如DexterityGen)直接比较;感知部分使用了SAM+Fast Foundation Stereo,但未评估不同分割/重建方法对精度的影响;工具使用任务中的手腕遥操作混淆了自主程度,未来应通过端到端策略实现全自主。


主要参考文献

[1] Mana: Dexterous Manipulation of Articulated Tools, Yin et al., 2026. arXiv:2606.13677.
[2] 项目主页: https://zhaohengyin.github.io/mana
[3] Lightning Grasp (LG+): Collision-aware grasp generation for thin objects.
[4] Geometric Retargeting (GeoRT): Ultrafast neural hand retargeting, IROS 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
机器人想用钳子、打针?来群里和嘲风探路侠一起聊聊灵巧操作新范式!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。