当机器人灵巧手在仿真里“摸”东西时,最大的谎言就是:接触跟真实世界差不多。这篇来自UC San Diego与Amazon FAR的新作,请来了Pieter Abbeel坐镇,把触觉接触信息直接变成神经动力学的条件信号,用大规模仿真预训练+少量真实数据微调,把灵巧操作里最难搞的“接触不连续”问题治得服服帖帖。MSE最低压到0.0058,任务成功率从52.6%飙
发表日期:
2026年1月
发表单位:
UC San Diego(加州大学圣迭戈分校)、Amazon FAR(Frontier AI & Robotics)
原文链接:
https://arxiv.org/pdf/2601.12796.pdf
引言:仿真里的机器人手,为什么总像“戴了厚手套”?
先问一个扎心的问题:为什么仿真里训练得再好的灵巧手,一到真实世界就变得笨手笨脚?答案其实就藏在“接触”两个字里。我们人类用手指捏起一颗葡萄、转动一支笔、拧开一个瓶盖,靠的是指尖微妙到极致的触觉反馈——哪里碰到了、碰了多大力、会不会滑脱。这些信息在仿真里被简化成了粗糙的碰撞检测、摩擦力模型和接触刚度参数,而真实世界里的接触远比这复杂:材料会形变、摩擦是各向异性的、接触瞬间伴随着微小的滑移和振动。仿真中那些“看似合理”的接触行为,放到真实机器人上一试就原形毕露。传统上人们怎么解决这个问题?一条路是系统辨识,就是反复调整仿真器的物理参数,比如摩擦系数、质量、阻尼,让仿真轨迹尽量贴近真实轨迹。但这条路有个前提假设:真实世界的误差可以用少量低维参数来校正。在接触丰富的灵巧操作任务中,这个假设基本不成立——误差往往是高维的、状态相关的,甚至来自仿真器离散积分的固有缺陷。另一条路是域随机化,把各种物理参数随机扰动一遍,希望训练出来的策略在真实世界里足够鲁棒。但域随机化常常是“拆东墙补西墙”,用精度换鲁棒性,而且依然无法真正模拟接触瞬间那种非光滑的动态突变。本论文的思路相当直接:既然接触是问题的根源,那就把接触信息本身当作建模的输入。机器人灵巧手的每个指尖都装了力敏触觉传感器,这些传感器能实时给出“有没有碰到物体”的可靠信号。如果把仿真和真实世界的接触状态统一成一个简单的二元信号,然后用这个信号去引导一个神经动力学模型预测物体未来的运动轨迹,是不是就能绕过繁琐的参数辨识,直接实现隐式的sim-to-real对齐?这就是这篇来自UC San Diego与Amazon FAR、Pieter Abbeel参与的工作给出的答案:一个把触觉接触信号作为核心条件的接触感知神经动力学模型。接触感知神经动力学的隐式仿真到现实对齐框架总览。先在仿真中用大规模数据训练基础神经动力学模型,再用少量包含触觉信息的真实交互数据进行微调,让模型在接触丰富的操作任务中同时保持仿真和真实世界的一致性。
第二阶段负责生成未来位姿增量。把未来H步的位姿变化建模成相对于上一时刻的增量序列x_0,每个增量用6D最小参数形式表示,包含平移增量Δp和旋转增量ω:平移增量直接计算相邻时刻的位置差,旋转增量ω通过指数映射(exponential map)转为相对旋转矩阵。采用增量预测而非绝对位姿,是因为增量在时序上更接近平稳分布,扩散模型拟合起来更容易收敛,也能在一定程度上避免长程轨迹的累积漂移。扩散模型的前向过程是标准的高斯加噪:反向去噪过程由一个一维U-Net参数化,以带噪样本、噪声水平和条件向量h_t为输入,预测噪声。这里用到了FiLM(Feature-wise Linear Modulation,特征级线性调制)机制,把条件h_t以仿射变换的方式注入U-Net的每一层,确保接触信息在每一个分辨率尺度上都能引导去噪过程。训练损失就是简单的噪声回归:生成阶段从随机噪声开始逐步去噪,得到增量轨迹后叠加回初始位姿:整体训练目标把两阶段的损失联合起来:接触预测和位姿扩散联合优化,模型既学会了“何时发生接触”这个离散事件,也学会了“接触之后物体怎么动”这个连续动力学。λ是平衡两阶段损失的权重超参数。
[1] Contact-Aware Neural Dynamics, Changwei Jing, Jai Krishna Bandi, Jianglong Ye, et al. arXiv:2601.12796, 2026.[2] Todorov E, Erez T, Tassa Y. MuJoCo: A physics engine for model-based control. IROS 2012.[3] Calli B, Singh A, Bruce J, et al. YCB: Yale-Carnegie-Berkeley benchmark for robotic manipulation. ICRA 2015.[4] Qi C R, Su H, Mo K, et al. PointNet: Deep learning on point sets for 3D classification and segmentation. CVPR 2017.[5] Wen B, Yang W, Kautz J. FoundationPose: Unified 6D pose estimation and tracking of novel objects. CVPR 2024.[6] Deng X, Yu F, Zhou J. ADD-S: Average distance of symmetric objects for 6D pose estimation. 2021.