← 返回 PaperDaily
视觉与图像
告别昂贵遥操作?这家机构用"看视频"教手术机器人操作
手术机器人学动作,最缺的就是带标签数据。这篇来自中佛罗里达大学等机构的工作,首次把世界-动作模型(WAM)用到手术机器人上,在动作标签预算固定的条件下,用免费的无动作视频预训练就把闭环成功率从63.5%拽到77.8%,PegTransfer单任务直接涨了20个百分点。视频不要钱、标签贵上天,这条路子值得所有做医疗机器人的人看一眼。
龙哥读论文
发布于 2026-08-15 00:20:23
阅读 5
查看原文
原论文信息如下:
手术机器人学习的"数据饥渴"困境:动作标签为何如此昂贵?
手术机器人,这个听起来就带着"高科技+高精尖"双重光环的领域,正在面临一个相当尴尬的处境:想让机器人学会做手术,比让一个医学生练会做手术还要难。医学生至少有解剖模型、尸体、动物实验可以练手,而手术机器人呢?它需要的是海量的、带有精确动作标签的操作数据。问题来了:这些动作标签,贵得惊人。
为什么贵?看看数据是怎么来的就明白了。要收集一份带动作标签的手术操作数据,首先得有一台达芬奇手术机器人研究平台(da Vinci Research Kit,简称dVRK),这台设备本身就价值不菲;其次得有一位经验丰富的外科医生,在专门搭建的仿真环境或者离体组织上进行遥操作;还得保证操作过程中传感器同步记录内窥镜视频和机械臂的运动学数据。这一整套流程下来,人力、设备、时间成本全部拉满。
结果就是,目前公开的手术操作数据集中,带动作标签的演示数据通常只有几百到几千条。几千条是什么概念?在通用机器人学习领域,动辄就是几百万帧的学习规模。几千条数据连给模型塞牙缝都不够,更别提训练出一个能在真实手术中稳定操作的政策模型了。
但细想一下,事情真的有这么绝望吗?手术室里最多的数据,其实是视频。每一台手术都有完整的内窥镜录像,这些视频记录了手术的全过程——组织如何变形、器械如何操作、病灶如何暴露。这些视频完全没有任何动作标签,它们只是"画面"。但恰恰是这些没有标签的视频,可能藏着突破数据瓶颈的关键钥匙。
世界-动作模型:让视频预测与动作生成共享同一颗"大脑"
要理解这篇论文的思路,先得认识一个概念:世界-动作模型(World-Action Model,简称WAM) 。这个说法可能听起来有点玄乎,换个角度就很好懂:人在做饭的时候,脑子里其实在预演"下一步该干什么"。切菜时,看到刀口的位置,会下意识预测"刀下去之后菜会变成什么样";翻炒时,能预判"颠勺之后食材会落到哪里"。这种"预测未来画面+决定当前动作"的能力,就是WAM想赋予机器人的东西。
具体来说,WAM的核心公式是一个联合概率分布:p(o_{t+1:t+K}, a_{t:t+H_c} | o_{≤t}, s_{≤t}, c)。这个公式看着唬人,拆开就明白了。o代表内窥镜拍摄的画面帧,s代表机械臂自身的状态(位置、角度等信息),c代表当前任务的目标(比如"把针从左手换到右手"),a代表机械臂下一步要执行的动作。整个公式的意思就是:在已知当前画面、机械臂状态和任务目标的前提下,模型要同时预测"接下来几帧画面会变成什么样"和"机械臂该怎么动"。
为什么要把"预测视频"和"生成动作"塞进同一个模型,而不是干脆拆成两个独立的模块?这里面的门道在于:如果分开建模,那视频预测模型只负责"看",动作生成模型只负责"动",两者各自为政,视频模型学到的一些跟任务无关的背景杂讯会白白浪费,动作模型又因为缺少对未来画面的理解而容易"走一步看一步",缺乏长远规划。而WAM让视频预测和动作生成共享同一个Transformer网络,相当于让"看"和"动"用同一套认知体系,视频预测学到的视觉动态特征可以直接指导动作生成,动作生成反过来也会让视频预测更关注任务关键区域。
这篇论文所实现的Surgical WAM,就是基于英伟达开源的Cosmos Policy 框架构建的。Cosmos Policy 本身就是一个落地了WAM理念的扩散Transformer(Diffusion Transformer)模型,它的潜空间序列中同时设有"过去画面槽位""未来预测槽位""机器人状态槽位""动作槽位",所有槽位共享同一个Transformer网络进行联合去噪。Surgical WAM所做的,就是把这个通用框架搬到手术机器人领域,并针对手术数据"视频管够、标签稀缺"的特点,设计了相应的两阶段训练策略。
两阶段训练策略:先用海量视频"预习",再用少量标签"精修"
如果把训练手术机器人比作培养一个外科医生,那么现有的方法基本等同于"直接让医学生上台做手术,然后在一旁指出他哪里做得不对"——数据少、试错成本极高、效果还未必好。Surgical WAM的思路则更像规范的教学路径:先让医学生看大量的手术视频,理解手术中组织如何变形、器械如何操作、每一步的关键视觉特征是什么;然后,在少量的实际操练中,把这些视觉理解转化为"手部动作"。这个"先看后动"的流程,正是Surgical WAM的核心:两阶段训练 。
整个训练流程如图2所示,分为Stage 1和Stage 2两个阶段。
Stage 1:动作无关的视频预训练 。这一步只训练世界模型组件。输入是一段没有任何动作标签的手术视频片段,模型的任务只有一个:根据过去的视频画面,预测未来的视频画面。注意,这里的"预测"不是简单的下一帧插值,而是要求模型理解画面中组织如何变形、器械如何移动、整个手术场景如何演进。损失函数L_pre只计算视频重建误差,不需要任何动作标签,因此理论上可以无限量地投喂手术录像。
论文在实现Stage 1时,直接借用了He等人提出的手术视频世界模型——该模型是通过在海量手术视频上微调通用视频扩散模型得到的。其权重被用来填充WAM中视觉和未来预测的槽位,而动作和状态槽位则随机初始化,留到Stage 2再学。
Stage 2:动作标签联合微调 。这一步用的是带动作标签的演示数据(数量被严格固定),对Stage 1预训练好的模型进行全量微调。在这个阶段,损失函数变成了L_ft,同时要求模型预测未来视频帧和动作块。用公式来表示就是:
注意这两个阶段的顺序是刻意设计过的。Stage 1解决的问题是"手术场景是如何演变的",这需要海量数据支撑,但好在视频不需要标签;Stage 2解决的问题是"该怎样操作才能达到预期的演变效果",这需要精确的动作标签,但好在基于Stage 1学好的视觉表征,模型只需要用少量标签就能学会"意图到动作"的映射。这样一来,数据的瓶颈就从"昂贵的动作标签"转移到了"管够的手术视频"上。这正是论文标题中"Data-Efficient"的底气所在。
闭环控制实测:视频预训练如何将成功率从63.5%提升至77.8%?
方法说完了,该拉出来遛遛了。论文的实验主要基于SurRoL仿真基准——一个兼容dVRK的手术操作仿真环境,包含四类典型任务:Needle Pick(单臂取针)、Peg Transfer(单臂搬运)、Needle Regrasp(双臂换针)、BiPeg Transfer(双臂搬运)。这四类任务各具代表性:有单臂的精细操作,有双臂的协同配合,还有涉及接触力学的操作。评价指标是闭环任务成功率(closed-loop task success rate),即让模型从头到尾自主执行整项任务,统计完成的比例。
表1展示了主实验结果,这里信息量很大,值得仔细琢磨:
先看横向对比。BET(Behavior Transformer,行为Transformer,一种将动作离散化为行为模式的Transformer策略)、ALOHA(动作分块模仿学习策略)、Diffusion Policy(基于扩散模型的视觉运动策略)这些通用机器人领域的知名方法,在手术任务上的表现都相当惨淡。Diffusion Policy在PegTransfer上只有2%的成功率,ALOHA在同一个任务上也只有14%。这说明通用领域的操作策略并不直接迁移到手术场景:手术任务的精度要求太高了,哪怕是几毫米的误差都会导致任务失败。
更值得关注的是π0.5——这是目前相当有代表性的视觉-语言-动作(VLA)模型,在通用领域已经展现出不俗的操控能力。但即便强如π0.5,在Needle Pick上也只有8%的成功率,Needle Regrasp上12%,平均22.3%。这说明语言条件化的动作解码并不能替代对手术场景精细视觉动态的理解。
再看纵向对比,这才是论文的重头戏。Surgical WAM w/o PT表示没有经过视频预训练、直接对Cosmos Policy在动作标签数据上微调的版本;Surgical WAM w/ PT则是先做完Stage 1的视频预训练,再用相同的动作标签数据进行微调。两者架构、优化设置、动作表征、扩散采样器、评测协议完全一致,唯一差别就在于有没有Stage 1的视频预训练。
带预训练的Surgical WAM在四个任务上平均成功率达到77.8%,而不带预训练的版本只有63.5%。绝对提升14.3个百分点。其中最出彩的是PegTransfer任务:从66%直接飙升到86%,涨了整整20个百分点。而且细看每个任务的提升幅度,会发现一个有趣的规律:凡是涉及双臂协调的操作(Needle Regrasp从50%→62%,BiPeg Transfer从42%→64%),预训练带来的增益都特别明显。这其实非常好理解:双臂协调操作对"预判对方手臂移动轨迹"的要求更高,而视频预训练恰好让模型学会了"器械如何移动"的动态规律。
图1从另一个角度展示了这个优势:在同样的动作标签预算下,预训练模型以更少的微调步数就达到了更高的成功率峰值(50k步62%对比无预训练60k步50%),"数据效率"名不虚传。
消融实验与真实数据验证:视频预训练的增益从何而来?
主实验结果证明了视频预训练有效,但一个严谨的研究不能只停留在"有没有效",还得回答"为什么有效、什么条件下更有效"。为此,论文设计了两组消融实验。
实验一:微调步数的影响 。如表2所示,视频预训练模型只用80k步就到达了86%的峰值,而无需预训练的模型需要160k步才达到79%。换句话说,预训练不仅提升了最终性能,还省了一半的微调时间。不过有意思的是,当微调步数继续增加到120k和160k时,预训练模型的表现反而下滑了(34%、56.5%)。这大概率是过拟合在作祟——固定的动作标签数据被反复学习太多次,最初从视频中学到的视觉动态先验被逐渐"冲掉"了。
实验二:执行视界(Execution Horizon)的影响 。模型每次预测16步动作块,但执行几步后再重新规划是可以调节的。H_e=1表示每执行1步就重新观察和规划,H_e=8表示一口气执行8步再重新规划。表3的结果显示,预训练模型在H_e=1时取得了86%的最好成绩,而预训练模型在H_e=1、4时都达到了86%,远超无预训练模型。这说明视频预训练让模型对单步动作的置信度更高,因此在更频繁的重规划下能够更好发挥。
但仿真实验做得再漂亮,也难免被质疑"是不是只在模拟环境里有效"。论文特地加了一组真实数据验证:在JIGSAWS数据集(一个由真实dVRK遥操作录制的含同步视频和运动学数据的手术操作数据集,包含打结和缝合等任务)上测试了预训练模型的表现。从图3可以看到,真实手术视频的画面远比仿真复杂——组织变形、器械反光、视野模糊这些在仿真里根本不会出现的情况,在真实手术视频中到处都是。论文的预训练模型正是在这种真实手术视频上继续预训练的。
结果与仿真保持了一致的趋势。这说明视频预训练学习到的视觉动态先验并不是仿真环境的伪影,而是真实手术场景中普遍存在的规律。
总结与展望:数据高效的视频预训练能否成为手术机器人学习的"新基建"?
回看整篇论文,Surgical WAM做的事情可以归纳为一句话:在固定动作标签预算的情况下,用无动作视频预训练把手术机器人操作的成功率从63.5%拉到了77.8%。这篇论文在思路上最大的价值,在于将世界-动作模型(WAM)这个原本用于通用机器人操作的学习范式,成功落地到了手术机器人领域,并且通过严谨的对照实验,证明了视频预训练在手术场景的独特价值。
但冷静下来看,这个方向离真正的"手术机器人自主操作"还有不少距离。一个绕不开的问题是:目前在仿真环境中验证有效的策略,迁移到真实的dVRK机器人上还存在巨大的sim-to-real(从仿真到真实)鸿沟。仿真中不会出现组织变形不一致、器械摩擦力波动、内窥镜图像噪声等问题,而这些恰恰是真实手术中必须要面对的。不过,这篇论文利用无动作视频预训练来提升手术机器人学习效率的思路,确实提供了一条值得认真考虑的路径:与其花大价钱采集精确到每个关节的遥操作数据,不如先想办法把手术室海量的既有录像利用起来,让模型先学会"看懂"手术。
如果这条路线能走通,那么手术机器人学习的数据瓶颈就将从"采集昂贵的遥操作演示数据"转变为"整理手术室已有的录像资料"。就这一点而言,Surgical WAM开了一个好头。
龙迷三问
这篇论文到底在解决什么问题? 首个面向手术机器人的世界-动作模型Surgical WAM,在动作标签预算固定情况下,通过无动作视频预训练将闭环任务成功率从63.5%提升至77.8%,PegTransfer单任务大涨20个百分点。
这篇工作最值得看的点是什么? Surgical WAM w/ PT在四个任务中三个达到最优成功率,平均成功率从63.5%提升至77.8%;在PegTransfer上绝对提升20个百分点(66%→86%);相比π0.5 VLA基线(平均22.3%),Surgical WAM w/ PT达到77.8%,接近翻倍。
这篇工作的边界或风险在哪里? 优点:(1) 提出两阶段训练策略,有效利用无标签视频缓解动作标签稀缺问题;(2) 统一世界模型与动作预测,避免外部策略或逆动力学模型的分离;(3) 在固定动作标签预算下,视频预训练带来显著且一致的性能提升;(4) 在真实手术视频上验证了方法的泛化性。缺点:(1) 预训练模型在较长微调步数下出现性能退化(120k/160k steps),存在过拟合问题;(2) 仅在仿真环境(SurRoL)中评估闭环任务,真实机器人闭环验证缺失;(3) 计算开销较大,扩散采样需要多步去噪;(4) 对执行时域H_e的敏感性分析不够深入。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
首次将世界-动作模型应用于手术机器人学习,两阶段训练设计合理,但底层的Cosmos Policy框架和视频预训练思路并非原创。
实验合理度: ★★★★☆
实验设计严瑾,固定了动作标签预算、控制了变量,且做了微调步数和执行视界的消融。但缺少真实dVRK上的闭环验证,是一个明显短板。
学术研究价值: ★★★★☆
将WAM范式从通用机器人引入手术领域,为"无动作视频提升手术操作"这一方向提供了首个系统性证据,对后续研究有较强启发性。
稳定性: ★★★☆☆
在仿真环境中表现稳定,但在更长微调步数下出现过拟合导致性能大幅下降,在真实手术视频上的验证也仅停留在预训练效果的间接迁移层面。
适应性以及泛化能力: ★★★★☆
在四类任务上均表现良好,且在接触丰富和双臂协调任务上提升更显著,说明其对不同操作类型具备较好的泛化能力。
硬件需求及成本: ★★★☆☆
训练成本较高(扩散Transformer、80k步微调、批量大小为1),推理时需多次扩散采样,对算力有一定门槛。但相比采集真实手术动作标签的成本,算力开销反而是"便宜"的。
复现难度: ★★☆☆☆
底层依赖Cosmos Policy的官方实现、SurRoL仿真环境、JIGSAWS数据集以及He等人的手术视频世界模型权重。多个依赖组件的可用性和版本兼容性可能是复现的障碍。
产品化成熟度: ★★☆☆☆
目前仅在仿真环境验证,距离真实手术应用还有较大差距。医疗机器人的安全性要求极高,该方法还需要在真实设备上大量验证才可能走向产品化。
可能的问题: 视频预训练在长微调步数下出现性能崩塌(86%→34%),说明预训练先验容易被有限标签覆盖,如何防遗忘是需要解决的问题;目前的结果全部基于仿真,真实场景下的有效性尚待验证。
主要参考文献
[1] Ye et al. 2026. World-action models. arXiv preprint.
[2] Kim et al. 2026. Cosmos Policy: A latent video diffusion model for world-action modeling. NVIDIA.
[3] Xu et al. 2021. SurRoL: An open-source reinforcement learning centered and dVRK compatible platform for surgical robot learning.
[4] Gao et al. 2014. JIGSAWS: JHU-ISI gesture and skill assessment working set.
[5] He et al. 2026. Cosmos-H-Surgical/SurgWorld: Scaling surgical world models with video-only pretraining. arXiv preprint.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
视频不要钱,动作标签贵上天,Surgical WAM这波操作直接把省钱刻进了DNA。
想围观手术机器人如何“看片自学成才”?想和大伙儿聊聊世界模型、模仿学习、医疗AI的那些坑和甜?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 医疗机器人+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群