各位老哥老姐,有没有过这种经历:手机充电线插反了,怎么都怼不进去;或者USB接口在桌子底下,盲插半天对不准?那一刻是不是觉得,自己这双"六自由度+21个自由度"的手,居然也有笨拙的时候?人类觉得"闭着眼都能做"的插拔动作,对机器人来说,却是灵巧操作领域最硬的骨头之一。尤其是当机器人换上一只仿人五指手,光是"让五根手指协调起来把东西捏稳、转正、再对准插进去"这一套动作,就足够让无数强化学习训练曲线原地去世。 最近英伟达联合密歇根大学放出一记大招——ADEPT(Accelerating DExterity via Pre-Training),一篇关于高自由度臂手系统灵巧操作的预训练-后训练框架论文。它最狠的地方在哪?一套预训练好的灵巧策略,能够零样本迁移到下游任务的"搬运重摆"阶段,再通过稳定的后训练流程,学会接触丰富的插拔任务,最终在真机上零样本部署。23自由度的Kuka-Allegro、29自由度的Flexiv-Sharpa,都直接成了"别人家的机器人"。 ![]()
图1:ADEPT实现高自由度臂手系统在真实世界的多阶段灵巧操作(来自论文Figure 1) 更夸张的是执行速度。论文给了一组对比:原本专为平行夹爪设计的FMB(Functional Manipulation Benchmark,功能操作基准)插拔流水线,一次任务要20到70秒,中间还得靠外部夹具重新定位、多次分段抓取;ADEPT的多指策略直接一波带走,每次任务只要5到10秒,端到端提速2到14倍。这哪里是灵巧手,简直是"人形自走装机员"。 灵巧操作新突破:ADEPT如何让多指机器人学会复杂插拔任务?
为什么灵巧操作这么难?咱们先把问题拆开看看。 一只仿人机械臂加五指手,自由度轻轻松松超过20个。以论文里的Kuka-Allegro为例,7自由度的机械臂加16自由度的Allegro手,总共23个自由度;Flexiv-Sharpa那边更是到了29个自由度。动作空间维度高,状态空间维度更高,再加上接触丰富带来的非线性突变——手指刚碰到物体那一刻,动力学方程瞬间变成"薛定谔的猫":捏紧还是滑走,完全看天。 传统的做法是什么?针对每个新任务,从零开始训练一个强化学习策略。这种做法的问题在于:每一次都是"重新发明轮子"。抓取、提起、重定向这些底层技能,任务A学了,任务B还得再学一遍。论文里说得直白:从零训练的策略极少能迁移到另一个任务,每个新任务都得从零开始,把够取、抓握、提起、重定向这些基本技能重新发掘一遍。 ADEPT的思路则完全不同:与其每个任务重训一个"专科生",不如先培养一个"灵巧操作通识课全优生",再针对具体任务快速"上岗培训"。这个思路放在大语言模型领域已经见怪不怪——预训练加微调嘛。但放在高自由度灵巧操作上,说易行难,因为强化学习的微调远比监督学习容易崩溃。 ADEPT全称Accelerating DExterity via Pre-Training,表面意思是"通过预训练加速灵巧性",但它的真正精髓在于后半段——在"预训练-后训练"完整链路里,把通用灵巧运动先验和下游任务特化很好地缝合了起来。 ![]()
图2:ADEPT在两个真机平台上的Sim-to-Real演示(来自论文图集) 从零训练到预训练-后训练:ADEPT框架的核心设计思路
ADEPT整个pipeline分成四大步,论文里的Figure 2一张图就交代得明明白白。 第一步,在仿真里跑一个通用的"物体重摆放"(reposing)任务,用PPO训练出预训练策略π_pre和价值网络V_pre。第二步,针对下游接触丰富任务做后训练,得到π_post和V_post。第三步,把后训练好的状态输入教师策略,蒸馏成一个只吃立体RGB图像的视觉学生策略。第四步,把学生策略零样本部署到真机。 ![]()
图3:ADEPT框架整体流程概览(来自论文Figure 2) 先说预训练。为什么选"重摆放"而不是直接学插拔?因为重摆放任务天然包含了一整套灵巧操作的基础动作单元:够取、抓握、提起、手中重定向、搬运、放置。这就像一个体操运动员先练"倒立、空翻、落地"这些分解动作,而不是直接上去跳整套自由操。 预训练用的物体是16种基础形状:圆柱体、长方体、球体、锥体等,每种形状的尺寸和物理属性随机化。任务要求策略把物体从初始位置搬到采样出的目标位姿。训练过程中还用了两项关键技术:ADR(Automatic Domain Randomization,自动域随机化)作为在线课程,以及PBT(Population-Based Training,基于种群的训练)来搜索PPO超参数。重力也从0逐渐增加到-9.81米每秒平方,让策略慢慢适应"有重力"的世界。 预训练效果有多好?先看表1:预训练教师策略在16种训练形状上的成功率是0.73(Kuka-Allegro),在没见过的FMB插拔桩上是0.76,在VisDex的152个物体上是0.77。注意,FMB桩和VisDex物体都是训练时完全没见过的——预训练策略不仅没崩,成功率甚至还略高于分布内水平。这在灵巧操作领域可以说是非常亮眼的零样本泛化表现了。 ![]()
表1:预训练重摆放教师策略在未见物体上的成功率(来自论文Table 1) 再看表2:把预训练策略直接拿去零样本执行FMB插拔任务的"重摆放"阶段,在ADR难度等级20的时候成功率还有71.9%,到难度等级35仍有52.5%。但到了真正的插入目标(ADR 50),成功率直接归零。这个结果既说明了预训练策略的迁移能力——它确实学会了搬运和重摆,也说明了为什么还需要后训练——真正接触插入那一下,还是得专门学。 ![]()
表2:预训练教师在FMB插拔重摆放任务上跨ADR难度的零样本成功率(来自论文Table 2) 但这里藏着一个大坑:直接拿预训练策略去做PPO微调,几乎必然翻车。论文的Figure 3蓝色小图展示了这个"成功率崩塌"过程——预训练策略在ADR 20的重摆放目标上本来有很好的表现,可一旦开始标准的PPO微调,成功率先是断崖式掉到0%,然后彻底摆烂。这就是强化学习迁移里臭名昭著的"灾难性遗忘"在作祟。 ![]()
图4:FMB插拔任务训练曲线对比,蓝色小图为直接微调的成功率崩塌(来自论文Figure 3) 三大关键技术:BC蒸馏、评论家预热与保守PPO
为什么直接微调会崩?论文把原因拆成了四个:第一,任务奖励函数变了,预训练critic的价值估计完全失效;第二,下游任务引入了新的观测维度——比如插拔目标位姿和物体-插座接触力,预训练actor不知道这些额外输入该怎么用;第三,价值估计不准导致优势函数(advantage)不可靠;第四,不可靠的优势函数又推出大步长的策略更新,让策略快速偏离预训练分布。 针对这四个问题,ADEPT设计了三板斧:BC演员蒸馏、评论家预热、保守PPO更新。 第一板斧:BC演员蒸馏。这里的BC是Behavior Cloning(行为克隆)的缩写。直接把预训练actor的输出监督到新的下游actor上,跑4万次迭代,让新actor学会在"睁着新观测眼睛"的情况下复现预训练行为。这一步解决的是观察空间不匹配的问题——预训练策略没见过插拔目标的位姿和接触力,但蒸馏让新actor把这些新输入"吸收"掉,同时保留预训练学到的运动技能。 第二板斧:评论家预热。BC蒸馏做完后,actor先冻结不动,单独训练一个新的critic(评论家网络),用下游任务的奖励在冻结actor的rollout上跑大约20轮PPO迭代,每张GPU卡并行4096个环境。这一步大约消耗每GPU 100万环境步。为什么要这么做?因为预训练critic是照着旧奖励校准的,在新奖励下就是"睁眼瞎"。先让critic在新任务下重新校准,后续的策略更新才能看到可靠的优势信号。 第三板斧:保守PPO。最后才解冻actor,用PPO做联合更新。但更新方式很克制:actor学习率从预训练的1e-3直接降到1e-5,线性衰减;PPO的clip参数从0.2收紧到0.05。翻译成大白话就是:可以学新东西,但每一步都走得小心翼翼,别把老底子给败光了。 论文给了一组非常有说服力的消融实验,见表3。完整版ADEPT(a行)五颗种子全部到达最高难度ADR 50,平均训练成功率46.0%,用时19.9小时。而只要把actor学习率从1e-5升回1e-3(d和e行),无论其他组件是否保留,全部五颗种子直接崩塌在ADR 20。BC和评论家预热则分别贡献了适应速度和最终成功率:去掉BC(b行),平均耗时从19.9小时涨到35.2小时;去掉预热(c行),成功率从46.0%掉到28.4%。 ![]()
表3:后训练组件消融实验,BC为行为克隆、WU为评论家预热、LR为actor学习率、Clip为PPO裁剪阈值(来自论文Table 3) 这里还有个反直觉的细节:论文尝试过加KL散度正则来防止策略漂移,结果在1e-3学习率下照样全崩。真正救命的不是正则项,而是把学习率压低两个数量级。这给做强化学习迁移的同行提了个醒:对高自由度灵巧操作来说,策略分布塌陷的速度比你想象中快得多,光靠"软约束"根本拦不住。 蒸馏阶段的损失函数也值得一提。训练学生策略时,动作克隆损失是带方差的加权距离: ![]()
行为克隆蒸馏损失:学生策略的输出均值μ_θ和方差σ_θ要与教师策略的输出μ_T、σ_T对齐,用教师方差做归一化(来自论文附录G) 同时还加了一个辅助的8关键点物体位姿预测损失,用来逼着学生从图像里真正"看懂"物体的朝向。插拔任务最怕的就是角度差一点点,桩子对不进孔。论文用8个关键点的平均L2距离作为辅助监督,就是这个目的。 ![]()
8关键点位姿辅助损失:K_i表示第i个关键点的预测位置,K_i*为真实位置,计算两者L2距离的平均值 全关节空间几何织物:释放高自由度机器人的全部潜力
RL策略直接输出23个关节的力矩,在真机上分分钟把机械臂变成"甩鞭子"。ADEPT在策略和机器人之间加了一道"安全垫"——几何织物(Geometric Fabric),论文里强调的是全关节构型空间版本(Cspace Fabric)。 先解释一下什么是"织物"。名字听着玄乎,本质是一个二阶动力学系统,可以理解成"有物理常识的中间控制器"。RL策略不直接发关节力矩命令,而是发一个期望的关节运动方向,织物负责把它翻译成平滑、稳定、安全(避开关节限位和自碰撞)的加速度指令。几何织物由英伟达的Nathan Ratliff等人提出,是一种具有稳定性保证的反应式控制方法。 织物主方程长这样: ![]()
几何织物主方程:M_f为织物质量矩阵,f_f为自动的几何与耗散项(包含碰撞排斥、关节限位排斥、阻尼等),f_π为策略驱动项,三者叠加为零即定义了系统动力学 策略输出的是每个关节的相对增量目标(论文中a_t ∈ [-1,1]^23),再映射成织物要追踪的构型空间目标。这个设计最大的亮点是:策略能接触到全部23个自由度。之前的DextrAH-G和DextrAH-RGB等工作虽然也用了几何织物,但把手部控制限制在了一个5维的PCA抓取子空间里——手长得再灵活,也只能按预定义的"抓取姿态模板"动。ADEPT直接把整个关节构型空间丢给策略,代价是学习问题变得更难,但换来的却是手指协调、手中重定向这些精细操作成为可能。 更关键的是,同一套织物实例在仿真和真机上同时运行。这意味着仿真里学到的"动作语言"和真机上的"动作语言"是同一门,大大缩小了sim-to-real gap。这种"把控制器差异从迁移问题里抠掉"的思路,值得做机器人学习的同学记在小本本上。 真实世界验证:Kuka-Allegro与Flexiv-Sharpa上的卓越表现
仿真里再猛,真机上见真章。ADEPT在两类完全不同的硬件上做了零样本部署验证:23自由度的Kuka iiwa7机械臂加Allegro手,以及29自由度的Flexiv-Sharpa机械臂加五指手。前者只用两个RGB摄像头,后者除了两个RGB摄像头还加了五个指尖触觉传感器。 ![]()
图5:真实世界实验平台设置。A为Kuka-Allegro与Flexiv-Sharpa平台,B为FMB插拔桩与碗碟架,C为多样化初始状态与光照条件(来自论文Figure 4) 任务选的是FMB标准插拔基准——这可不是过家家。FMB原本是给平行夹爪设计的,平行夹爪没有"手指",没法在手里给物体换向,只能靠外部夹具和多次重新抓取来凑合。ADEPT的多指手直接在手掌里把桩子转正,一次抓取搞定全部动作。论文里对比很给力:FMB平行夹爪流水线每个任务要20到70秒,ADEPT只要5到10秒,提速2到14倍。 上真机的效果如何?论文的Table 4给出了一组逐阶段累积成功率数据。以Kuka-Allegro系统为例,在插拔任务上,够取阶段成功率超过90%,抓握阶段超过80%,而到最终插入阶段仍能保持80%左右。在碗碟放置任务上,整体成功率略低一些,毕竟盘子的扁大外形在预训练的16种基础形状里完全没有——但后训练仍然把它学会了。 ![]()
表4:真实世界长时程操作逐阶段成功率,每个阶段的成功率是累积的,即第k阶段成功需要前面所有阶段都成功(来自论文Table 4) Flexiv-Sharpa那边更有看头。29个自由度加上五个指尖的视触觉传感器,学生策略同时吃两路RGB图像和五张触觉图。这里用到了TacMap和SaTA两种技术思路:TacMap把触觉传感器输出模拟成与真实传感器标定一致的"穿透深度图",避免触觉域的迁移鸿沟;SaTA则用FiLM条件化把每个手指的触觉特征锚定到指尖空间位置,让策略知道"哪根手指在哪儿碰到了什么"。这套组合让机器人能"摸着"把桩子插进去,比纯视觉多了一层手感。 ![]()
图6:Kuka-Allegro与Flexiv-Sharpa真机相机视角(来自论文Figure 10) ADEPT还有个小彩蛋值得单独拎出来夸:预训练居然能产生"自然抓取"这种涌现行为。论文发现,从随机初始化直接训练插拔任务,PPO经常收敛到各种诡异的抓取姿势——比如用指节夹着桩子,看着就别扭。而经过重摆放预训练再后训练的ADEPT策略,则学会了像人一样用指尖捏持的优雅姿态。这个现象说明,预训练的任务设计确实塑造了策略的"运动品味",而不只是加速了收敛。 从实验设计角度看,ADEPT的验证闭环是比较完整的:仿真里做了预训练泛化测试、零样本迁移测试、消融实验;真机上做了两个平台、三个任务、多种初始状态和光照条件的验证。但也要客观指出,真机成功率仍然存在一定波动,而且训练成本确实不低——预训练8B环境步、后训练3B环境步,这基本是"大力出奇迹"的路线,对算力有限的团队门槛较高。 龙迷三问
下面是龙哥对于大家可能的一些问题的解答: 这篇论文到底在解决什么问题?英伟达与密歇根大学提出ADEPT,用预训练+后训练两阶段强化学习框架,让23自由度Kuka-Allegro与29自由度Flexiv-Sharpa灵巧手,仅凭视觉或视触觉感知零样本从仿真迁移到真实世界,完成插拔、放盘等长程操作。 这篇工作最值得看的点是什么?ADEPT在Kuka-Allegro上实现FMB星形插拔5/10、方圆插拔3/10、盘子放置6/10的真实世界成功率;Flexiv-Sharpa触觉版本实现方圆插拔8/10成功率;相比FMB平行夹爪pipeline实现2-14倍执行速度提升。 这篇工作的边界或风险在哪里?优点:(1)提出完整的预训练-后训练框架,解决高自由度灵巧操作从零训练难的问题;(2)全关节空间几何织物设计新颖,充分利用完整运动学灵巧性;(3)结构化后训练配方有效防止灾难性遗忘;(4)两阶段蒸馏课程有效提升视觉学生策略的sim-to-real迁移能力。缺点:(1)预训练成本高(8B环境步);(2)视觉感知仍是主要瓶颈,遮挡下姿态估计不准确;(3)真实世界成功率仍有提升空间;(4)仅在两种机器人平台上验证。 如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~ 龙哥点评
论文创新性分数:★★★★☆
提出ADEPT框架,通过通用物体重定位任务的预训练获得灵巧操作基础策略,再通过行为克隆蒸馏、评论家预热和保守PPO更新的结构化后训练流程适配下游接触丰富任务,最后通过两阶段蒸馏将状态教师策略转化为可零样本部署的视觉/触觉学生策略。实验合理度:★★★★☆
情节成功率(Episodic Success Rate),分阶段成功率(Reach/Grasp/Lifting/Reorient/Align/Insert),ADR等级进度。学术研究价值:★★★★☆
提出ADEPT框架,通过通用物体重定位任务的预训练获得灵巧操作基础策略,再通过行为克隆蒸馏、评论家预热和保守PPO更新的结构化后训练流程适配下游接触丰富任务,最后通过两阶段蒸馏将状态教师策略转化为可零。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
预训练8B环境步,后训练3B环境步,总计11B环境步;在GPU并行仿真环境下训练,单任务后训练约20小时。复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:;(2)全关节空间几何织物设计新颖,充分利用完整运动学灵巧性;(3)结构化后训练配方有效防止灾难性遗忘;(4)两阶段蒸馏课程有效提升视觉学生策略的sim-to-real迁移能力。缺点:(1)预训练成本高(8B环境步);(2)视觉感知仍是主要瓶颈,遮挡下姿态估计不准确;
主要参考文献
[1] Lee J, Yin J, Rana A, et al. ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning[J]. arXiv preprint arXiv:2608.19182, 2026. [2] ADEPT项目主页: https://adept-dexterity.github.io [3] Liu et al. Functional Manipulation Benchmark (FMB). [4] Schulman et al. Proximal Policy Optimization Algorithms. 2017. [5] Ratliff et al. Geometric Fabrics: Generalizing Classical Mechanics to Produce the Appearance of Intelligence. 2018.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
![]()
灵巧手插拔难题怎么破?ADEPT的预训练+后训练思路值得细品。想和更多同好一起拆解论文、聊机器人落地,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器人+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
![]()
![]()
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!