← 返回 PaperDaily 视觉与图像

斯坦福&MIT新作:VR采集75小时仿真数据,灵巧手五项真机任务全解锁

如果说机械臂是机器人的“手臂”,那灵巧手就是它的“指尖”——能抓鸡蛋、玩叠叠乐、拧瓶盖的那种指尖。但灵巧操作一直是机器人领域的老大难问题:机械臂在工厂里已经干了几十年活了,灵巧手却还在实验室里“装婴儿”。为啥?

斯坦福&MIT新作:VR采集75小时仿真数据,灵巧手五项真机任务全解锁
原论文信息如下:
论文标题:
Pre-training Visual Dexterity in Simulation
发表日期:
2026年08月
发表单位:
Stanford University, MIT
原文链接:
https://arxiv.org/pdf/2608.15917v1.pdf

灵巧手的数据之痛,仿真来破?

如果说机械臂是机器人的“手臂”,那灵巧手就是它的“指尖”——能抓鸡蛋、玩叠叠乐、拧瓶盖的那种指尖。但灵巧操作一直是机器人领域的老大难问题:机械臂在工厂里已经干了几十年活了,灵巧手却还在实验室里“装婴儿”。为啥?核心卡在数据上。
真实机器人遥操作采集数据又贵又慢,一个操作员一天下来可能就攒几个小时有效数据;人手视频倒是海量,但人手和机器手结构差异太大,接触点、关节驱动方式都对不上,硬迁移效果拉胯。眼看着灵巧手数据就是“数据饥荒”的重灾区,各路团队都在寻找破局之道。
最近,斯坦福、MIT等机构的研究者放出一个新框架:SPD(Simulation Pre-training for Dexterity,灵巧操作仿真预训练)。他们让操作员戴上VR头显,在物理仿真器里直接操控虚拟灵巧手干活,一周就采了75小时高质量数据,用这些数据预训练策略,再到真机上微调1-2小时,五类真实灵巧任务全部跑通。
SPD项目整体效果展示
这波操作,有点东西。今天龙哥就带大家仔细盘一盘,这套仿真预训练方案到底怎么实现的,效果有多猛,以及它离真正的灵巧操作产品化还有多远。

仿真预训练:灵巧手数据稀缺的破局之道

先捋清楚问题的核心。机器人领域过去几年的一个重大进展是“预训练+微调”范式:先在大量多任务数据上预训练一个通用策略,再到目标任务的小样本数据上微调,就能大幅提升数据效率。这个范式在抓取、桌面操作等任务上已经非常成熟,比如OpenVLA、π0等工作,都证明了大规模预训练能让新任务学得又快又好。
但问题来了:这些预训练数据基本都来自平行夹爪——就是那种两指一夹的简单夹爪。而真正像人手一样灵活的多指灵巧手,数据集少得可怜。原因前面提到了:真实遥操作成本高、通量低,人手视频又存在“实施例鸿沟”——人手和机器手的运动学、接触特性差异太大,就算录到了人手视频,也很难转化成机器手能用的动作指令。
那有没有一种数据源,既能像真实遥操作那样提供带动作标签的“同实施例”数据,又能像互联网视频那样大规模低成本采集?SPD的思路很直接:到物理仿真器里去采数据。操作员戴着VR头显,在MuJoCo物理仿真里直接操控一对虚拟灵巧手干活,整个采集过程不碰任何真实机器人硬件。
图1:灵巧操作仿真预训练。上:75小时遥操作仿真数据,覆盖六个场景、数百个物体实例,包含大量接触丰富的低层灵巧行为。下:预训练策略仅需1小时真实演示即可适应图中展示的真实灵巧任务。
这套框架包含两套遥操作系统:spd-vr(用于仿真数据采集的VR软件)和spd-teleop(真实世界遥操作系统)。两套系统高度对齐:共享顶部和手腕相机视角、使用完全相同的灵巧手和六自由度机械臂、物体集合也相似。这样预训练和微调之间的“实施例鸿沟”就被降到最低。
由于VR采集完全不需要物理硬件,虚拟物体的重置是瞬间完成的,多个操作员可以并行开工,采集效率直接起飞。整个采集过程是去中心化的——本质上就是几个人各自戴着头盔在办公室里“打游戏”,一周下来就能攒出75小时高质量数据。这也是工业界做数据标注时最爱的模式:可扩展、可并行、成本可控。

VR遥操作:75小时灵巧操作数据的高效采集

spd-vr这套系统具体怎么运作的?操作员戴上VR头显后,头显上的相机以60Hz捕捉操作员手部的姿态和指尖位置,仿真器以480Hz的物理步长在MuJoCo中实时模拟双臂灵巧手和物体的交互。检测到的手腕姿态和指尖位置通过逆运动学映射到仿真中的虚拟机器臂和灵巧手上。
仿真环境中的VR遥操作数据采集场景
为了让虚拟物体“手感真实”,所有物体都是物理仿真的,手和物体的接触由MuJoCo实时计算。仿真中的机器臂被做成半透明材质,尽量避免遮挡操作员视线。每个episode开始时,系统会随机生成一个新的任务提示,同时随机化物体的种类、物理属性和初始位置——这种自动随机化让数据多样性大大提升。
图2:开放式仿真任务中的多样化操作策略。每对帧展示了同一操作员团队在单个长时任务中产生的两种不同策略:(a)从一堆字母积木中拼出目标单词;(b)将积木堆叠成叠叠乐高塔;(c)将多米诺骨牌排列成一条长链。
采集的数据覆盖六个场景:字母拼写积木、盘子、马克杯、瓶子、杯子和叠叠乐积木。5名操作员在一周内采集了约2000个episode、共75小时的数据。任务都是长时程、开放式的——只指定期望结果,不约束具体策略和子任务顺序,这让操作员们可以自由发挥,产生了各种各样的接触丰富的灵巧行为。
表2:spd-75h数据集统计。按场景分组的各任务episode数和时长。拼写变体合并为单一SPELLING任务,少于十个episode的任务省略。时长以30Hz下的分钟数报告。
数据采完后还有一道重要的后处理工序。首先过滤掉长时间没有接触的无效片段,然后用Madrona渲染器并行渲染所有轨迹。为了增强视觉多样性,系统在GPU上做了一系列视觉增强:根据渲染时保存的分割掩码随机给物体染色、随机交换背景和桌面纹理,还做了一种“对称增强”——交换双臂并镜像翻转对应的图像、本体感觉和动作。这套后处理流程让75小时的数据“看起来”远比实际丰富,对提升策略泛化性帮助很大。

扩散Transformer策略:从仿真到真实的迁移桥梁

数据采完了,接下来就是怎么用这些数据学出一个好策略。SPD采用了和π0类似的架构:扩散Transformer(Diffusion Transformer),用流匹配(flow matching)的速度预测目标来训练。
为什么选扩散模型?因为灵巧操作天然是多模态的——同一个任务可以有多种成功解法,比如把杯子叠起来,可以从左边推,也可以从右边抓。扩散模型擅长表达这种多模态分布,这正是行为克隆任务里最需要的特性。
图3:策略架构。本策略是一个扩散Transformer,将本体感觉(o)、动作(a)、多视角图像和加噪动作块作为交织的token序列输入。训练时,模型在因果掩码下同时对所有动作块进行去噪,摊薄序列长度开销。训练中使用滑动窗口注意力,并配套滚动KV缓存以实现高效推理。
模型设计的几个关键点值得细品。首先,输入的观测序列包含本体感觉(机器人各关节角度等)、动作、多视角图像以及加噪的未来动作块,这些token按照时间顺序交织在一起。视觉部分使用一个冻结的预训练ViT(Vision Transformer,视觉Transformer)将每张图像编码成patch,然后通过可学习的query进行交叉注意力池化,压缩成紧凑的token集合。每隔两个Transformer块,池化后的视觉token还会再次与原始patch进行交叉注意力,让视觉信息在整个网络中持续流动。
图3补充:策略架构的训练与推理对比。左:训练时使用前缀并行和因果滑动窗口Transformer,对所有动作块同时去噪。右:推理时使用异步滚动KV缓存,实现高效流式生成。
为了提高训练效率,SPD在训练时用因果掩码同时对所有动作块去噪,把整个256步序列的处理成本摊薄。为了在部署时支持固定长度的KV缓存,每一层都使用窗口大小为32个时间步的滑动窗口注意力。加噪动作块还会额外加上绝对位置编码,用来表示流匹配的时间步和在动作块内的位置。
预训练数据没有稠密的语言标注,所以SPD没有做语言条件控制,而是像RPT那样对视觉-运动历史进行条件建模。所有模型用Muon优化器在固定学习率10⁻³下训练,推理时使用权重的指数移动平均(EMA)。
表4:预训练超参数。
真实世界的遥操作与VR采集在设计上保持对齐,但细节略有不同。真实硬件由两台升级版YAM Pro机械臂组成,每台配备一个22自由度(DoF,即Degree of Freedom,自由度)的Sharpa Wave灵巧手,整体是56自由度双臂系统。为了解决手部过重导致的电机过热问题,团队把YAM臂上J3和J4关节电机的齿轮比从10:1换成了40:1。传感器方面使用三个RealSense D405相机,一个安装在两臂之间俯拍,另外两个分别装在两只手的手腕尺侧。真实遥操作不再用VR头显内置手部追踪,而是改用Manus手套做手指追踪、Quest控制器做手腕追踪,以获得更平滑和精确的控制。
表5:真实世界微调超参数。仅列出与预训练(表4)不同的设置,其余超参数全部继承。数据集大小按任务报告。

五大真实任务验证:预训练带来的显著提升

预训练效果到底行不行?最终还是要到真实机器人上见真章。SPD在真实世界评估了五个双臂灵巧任务,物体和预训练时看到的相似但不完全相同:
图4:五项任务的自主rollout。(A)盘子收纳:拿起盘子并放入碗架;(B)马克杯悬挂:双臂交接后将马克杯挂到杯树上;(C)玩叠叠乐:一只手推出塔中的积木块,另一只手将其抽出,然后放到塔顶;(D)杯子叠放:拆开嵌套的杯子并搭成金字塔;(E)瓶子进箱:将瓶子抛入箱子中。
评估过程中,每个checkpoint执行20次试验,统计达到每个任务阶段(如“拿起盘子”“放入碗架”“完成收纳”)的成功比例,并计算出平均任务进度。对比基准是同样架构、完全从零训练(BC,Behavior Cloning,行为克隆)的策略,只在每个任务的1-2小时真实演示上训练。预训练checkpoint则是在同样的真实演示数据上做全量微调。
表3:评估任务评分标准。最大分数是任务可达成的最高分;报告的任务进度是实际得分除以该最大值。
结果如下图5所示,蓝色代表SPD预训练,灰色代表从零训练BC。直观来看,SPD几乎在每个任务阶段上的完成比例都更高,平均任务进度也全面领先。
图5:仿真预训练提升真实灵巧操作水平。在真实机器人上评估五项双臂灵巧任务,对比SPD预训练checkpoint与从零训练BC。A-E展示达到每个连续操作阶段的试验比例,并绘制训练损失曲线;F展示平均任务进度,误差线为标准误。
拿具体数字说话。在盘子收纳任务上,SPD平均进度达到80.6%,从零训练BC只有66.9%;玩叠叠乐更是差距悬殊,SPD达到85.0%,BC只有65.0%;杯子叠放SPD达到55.6%,BC仅35.0%。训练损失曲线与真实表现正相关——SPD的flow matching损失从一开始就更低,收敛也更快,这和π0等研究中的发现一致:行为克隆策略的训练损失比验证损失更能预测下游任务表现。
表1:所有变体的平均任务进度。每个滑动窗口(w)和动作块(c)组合的任务进度(%),每个训练机制内每任务最优变体加粗。w = 32、c = 8是最终选定的配置。
再来看看实机运行的视觉效果。下面这三个GIF对应盘子收纳、杯子叠放和玩叠叠乐三个任务的自主运行,灵巧手指尖的精细操作确实有那味儿了。
自主rollout:盘子放入碗架 自主rollout:杯子叠放 自主rollout:玩叠叠乐
注意,真实微调只用了1-2小时的真实演示数据,相比从零训练动辄需要几十小时数据才能稳定跑通的任务,这已经是质的飞跃。

消融实验揭示:历史条件与短动作块的关键作用

除了主实验,SPD还做了一组很见功力的消融实验,专门研究两个设计维度:历史窗口大小w(滑动窗口能看到多少步历史信息,取值1或32)和动作块大小c(一次预测多长的一段动作序列,取值8或32)。两个维度组合出四种配置,每种配置分别在预训练checkpoint和从零训练两种条件下训练,共8个模型,用相同的协议在五个任务上评估。
图6:历史条件与动作块大小的消融实验。展示表1中平均任务进度的可视化,左侧为SPD预训练策略,右侧为从零训练策略。
消融结果非常有意思。先看单帧设置(w=1, c=32),这正是π0等主流方案采用的配置。在这种配置下,如果把动作块从32缩小到8,性能会大幅滑坡——策略变得明显抖动,时间连贯性很差。这说明:在只能看单帧图像的情况下,短动作块没法提供足够的时序稳定性,策略容易“忘事”。
但加上历史信息后,情况完全反转:在w=32的配置下,c=8的短动作块反而成为最强变体。原因在于,历史条件提供了时间连贯性的“底座”,短动作块则让策略保持反应灵敏度——两者结合既能快速响应环境变化,又不会动作飘忽。这种“历史给连贯、短块给反应”的互补效应,是SPD发现的一个很有价值的洞察。
更关键的是,这个最优配置(w=32, c=8)恰好也是从预训练中获益最大的配置:它的平均进度比从零训练版本高出18个百分点,而其他配置的这个差值只有3个百分点甚至更少。换句话说,仿真预训练的价值在“历史+短块”组合下被最大程度释放。这可能是因为预训练让策略学会了如何高效利用历史信息进行快速反应,这种能力在真实世界中尤其宝贵——真实世界充满噪声和突发干扰,能频繁重规划但保持连贯,才是稳定操作的关键。

局限与展望:仿真预训练的边界与未来方向

SPD的效果确实令人眼前一亮,但要说它已经彻底解决了灵巧手数据问题,那还为时过早。论文里作者也坦诚地讨论了几个明显的局限。
最大的隐患在于仿真物理一致性。整个框架的有效性高度依赖仿真场景的物理参数(质量、摩擦力、接触响应)被调得足够接近真实。如果参数偏差太大,操作员在仿真里学到的策略就可能带着“虚拟世界的坏习惯”迁移到真实世界,导致策略表现打折扣。这需要经验丰富的仿真工程师花大量时间做参数调优。
其次是数据多样性依然有限。虽然75小时听起来不少,但场景还是六个固定场景,真实评估用的也是与仿真相似的物体。对于真正的分布外(Out-of-Distribution,OOD)物体、场景和任务变体,预训练策略能泛化到什么程度,论文还没有给出很强力的证据。想看更强的泛化性,还需要在更多样化的场景和物体上做更大规模的预训练。
真实世界遥操作数据采集用于微调预训练策略
未来方向也很明确:一是把仿真遥操作、真实遥操作和人手视频等多源数据混合成一个更大的预训练语料,互相补充;二是在更多场景、更多物体、更多小时数上扩展规模,探索规模化带来的涌现泛化能力;三是把预训练策略作为强化学习的初始化——毕竟RL可以用算力换操作员时间,两者结合潜力巨大。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?斯坦福与MIT联合提出SPD框架,通过VR头显在物理仿真中采集75小时灵巧操作演示,预训练扩散Transformer策略,再在56自由度双臂灵巧机器人上仅用1-2小时真实数据微调,在置盘、挂杯、叠叠乐等五项真实任务中全面超越从零训
这篇工作最值得看的点是什么?SPD在所有5个任务上均优于从零训练的BC基线,平均任务进度更高;消融实验表明w=32, c=8配置(历史条件+短动作块)效果最好,预训练带来18个百分点的提升
这篇工作的边界或风险在哪里?优点:(1) 提出了一种新颖的仿真预训练范式,解决了灵巧手数据稀缺问题;(2) VR数据收集无需物理机器人,可扩展性强;(3) 仿真与真实遥操作系统对齐,减少域差距;(4) 实验验证充分,5个真实任务均有效。缺点:(1) 仿真物理参数需要精细调优,否则演示策略迁移效果差;(2) 预训练数据场景和物体多样性有限;(3) 真实评估物体与仿真相似,泛化性验证不足;(4) 需要5名操作员和专门硬件,成本较高。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出SPD框架,利用VR在仿真环境中大规模收集灵巧操作演示数据,预训练扩散transformer策略,再在真实机器人上微调,解决灵巧手数据稀缺问题。

实验合理度:★★★★☆

任务进度(task progress),即每个任务按评分标准达到的分数占总分的比例

学术研究价值:★★★★☆

提出SPD框架,利用VR在仿真环境中大规模收集灵巧操作演示数据,预训练扩散transformer策略,再在真实机器人上微调,解决灵巧手数据稀缺问题;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

222M参数模型,训练170k步,推理时使用滚动KV缓存和10步Euler积分求解流匹配ODE。

复现难度:★★★☆☆

https://spd.bot

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;(2) VR数据收集无需物理机器人,可扩展性强;(3) 仿真与真实遥操作系统对齐,减少域差距;(4) 实验验证充分,5个真实任务均有效。缺点:(1) 仿真物理参数需要精细调优,否则演示策略迁移效果差;(2) 预训练数据场景和物体多样性有限;(3) 真实评估物体与仿真相似,泛化性验证不足;

主要参考文献

[1] Kamat S, Rashid A, Sharma S, et al. Pre-training Visual Dexterity in Simulation. arXiv preprint arXiv:2608.15917, 2026. https://arxiv.org/pdf/2608.15917v1.pdf
[2] Black K, Brown N, Driess D, et al. π0: A vision-language-action flow model for general robot control. arXiv preprint arXiv:2410.24164, 2026.
[3] Zhao T Z, Tompson J, Driess D, et al. Aloha unleashed: A simple recipe for robot dexterity. Proceedings of The 8th Conference on Robot Learning, 2025.
[4] Allshire A, Singh H G, Singh R, et al. Scalable behavior cloning with open data, training, and evaluation. arXiv preprint, 2026. https://abc.bot/
[5] SPD项目主页: https://spd.bot/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
灵巧手也想玩预训练?VR仿真采数据,真机微调一小时就上手!想和龙哥一起蹲守机器人前沿,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器人+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。🤖
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,机器人同好已在群里等你开聊!
wechat_helper dianzan


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。