← 返回 PaperDaily 视觉与图像

不用调摩擦系数!接触感知神经动力学让仿真直通真实,成功率飙到73.7%

当机器人灵巧手在仿真里“摸”东西时,最大的谎言就是:接触跟真实世界差不多。这篇来自UC San Diego与Amazon FAR的新作,请来了Pieter Abbeel坐镇,把触觉接触信息直接变成神经动力学的条件信号,用大规模仿真预训练+少量真实数据微调,把灵巧操作里最难搞的“接触不连续”问题治得服服帖帖。MSE最低压到0.0058,任务成功率从52.6%飙

不用调摩擦系数!接触感知神经动力学让仿真直通真实,成功率飙到73.7%

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Contact-Aware Neural Dynamics(接触感知的神经动力学)
发表日期:
2026年1月
发表单位:
UC San Diego(加州大学圣迭戈分校)、Amazon FAR(Frontier AI & Robotics)
原文链接:
https://arxiv.org/pdf/2601.12796.pdf

引言:仿真里的机器人手,为什么总像“戴了厚手套”?

先问一个扎心的问题:为什么仿真里训练得再好的灵巧手,一到真实世界就变得笨手笨脚?
答案其实就藏在“接触”两个字里。我们人类用手指捏起一颗葡萄、转动一支笔、拧开一个瓶盖,靠的是指尖微妙到极致的触觉反馈——哪里碰到了、碰了多大力、会不会滑脱。这些信息在仿真里被简化成了粗糙的碰撞检测、摩擦力模型和接触刚度参数,而真实世界里的接触远比这复杂:材料会形变、摩擦是各向异性的、接触瞬间伴随着微小的滑移和振动。仿真中那些“看似合理”的接触行为,放到真实机器人上一试就原形毕露。
传统上人们怎么解决这个问题?一条路是系统辨识,就是反复调整仿真器的物理参数,比如摩擦系数、质量、阻尼,让仿真轨迹尽量贴近真实轨迹。但这条路有个前提假设:真实世界的误差可以用少量低维参数来校正。在接触丰富的灵巧操作任务中,这个假设基本不成立——误差往往是高维的、状态相关的,甚至来自仿真器离散积分的固有缺陷。另一条路是域随机化,把各种物理参数随机扰动一遍,希望训练出来的策略在真实世界里足够鲁棒。但域随机化常常是“拆东墙补西墙”,用精度换鲁棒性,而且依然无法真正模拟接触瞬间那种非光滑的动态突变。
本论文的思路相当直接:既然接触是问题的根源,那就把接触信息本身当作建模的输入。机器人灵巧手的每个指尖都装了力敏触觉传感器,这些传感器能实时给出“有没有碰到物体”的可靠信号。如果把仿真和真实世界的接触状态统一成一个简单的二元信号,然后用这个信号去引导一个神经动力学模型预测物体未来的运动轨迹,是不是就能绕过繁琐的参数辨识,直接实现隐式的sim-to-real对齐?
这就是这篇来自UC San Diego与Amazon FAR、Pieter Abbeel参与的工作给出的答案:一个把触觉接触信号作为核心条件的接触感知神经动力学模型。
图1:接触感知神经动力学的隐式仿真到现实对齐框架总览
接触感知神经动力学的隐式仿真到现实对齐框架总览。先在仿真中用大规模数据训练基础神经动力学模型,再用少量包含触觉信息的真实交互数据进行微调,让模型在接触丰富的操作任务中同时保持仿真和真实世界的一致性。

问题背景及相关工作:大家都在填坑,但坑的方向搞错了

先梳理一下sim-to-real这条赛道上已有的尝试,看完你就明白本论文的位置在哪里。

第一条路:显式系统辨识。典型做法是估计物体质量、惯性参数,或者自动化地调整仿真器参数让仿真轨迹匹配真实轨迹。问题在于这类方法把所有误差都归因于少量标量参数,但接触丰富的操作中大量误差来自高维的、状态相关的接触建模缺陷,根本不是一个摩擦系数能补回来的。就好比用空调遥控器去修一台发动机,按钮倒是不少,但没有一个旋钮对应“气门间隙”这种真正的问题。

第二条路:域随机化。把物理参数随机扰动一遍,希望策略在真实世界足够鲁棒。但接触动力学天生高度非光滑:手指碰到物体的瞬间,接触力突跳、速度方向骤变,仿真器里一个步长的误差就可能让后续轨迹完全跑偏。域随机化常常是“拆东墙补西墙”,用精度换鲁棒性,把模型折腾得“什么都见过,什么都不精”。视觉导向的域随机化方法则主要解决了感知层面的差距,对底层的接触动力学模型几乎不做任何修正。

第三条路:隐式对齐。近年来,用神经网络直接学习仿真与真实之间的残差,或者干脆训练一个神经动力学模型来替代显式物理仿真,开始受到更多关注。但这些方法大多“接触盲”——要么把接触产生的动态突变当作噪声处理,要么只依赖运动学和本体的状态信号,白白浪费了灵巧手上最值钱的一个信号:接触信息本身。触觉传感器能实时告诉系统“碰到了”还是“没碰到”,这种信息在接触切换的瞬间是决定性的。

UC San Diego与Amazon FAR的研究者们抓住这一点,提出了接触感知神经动力学(Contact-Aware Neural Dynamics)模型:先在大规模仿真数据上预训练,再用少量真实交互数据微调,不需要显式标定物理参数,而是让模型在共享的接触表征上完成隐式对齐。这思路很直接:接触最难建模,那就别绕开它,把“有没有碰到”直接喂给模型。仿真里用碰撞检测得到干净的接触标签,真实世界靠指尖力敏触觉传感器也能拿到同样的二元信号。两边信号对齐了,模型自然就走上了“用接触事件驱动位姿预测”的道路。

接触感知神经动力学:核心机制解析

在这个框架里,机器人操作被建模为一个条件动力学预测问题。每个时刻的物体位姿用SE(3)元素s_t表示(即3D位置加3D旋转),手部关节构型为q_t,动作指令为a_t,接触状态是一个二元变量c_t∈{0,1},表示是否有任何一个指尖与物体接触。物体几何信息用点云P表示,初始时刻从物体网格表面采样获得,随后跟随物体位姿变换更新。
模型输入是一个固定长度的历史窗口,包含过去K+1个时刻的物体位姿、动作指令、关节构型和接触状态:
历史窗口公式
把K+1个时刻的历史堆在一起是有讲究的:接触瞬间的动力学突变需要上下文才能判断对——只看单帧根本无法区分“即将触碰”和“已经滑脱”。为了让仿真预训练的模型能迁移到真实世界,仿真数据生成时加入大量域随机化,包括对控制指令加高斯噪声、随机扰动物体和手部位姿等,逼迫模型学会处理传感器噪声和状态估计不确定性。
给定历史窗口H_t,模型的预测目标分成两路:
预测目标公式
其中f_φ是接触预测模块,先从历史观测中推断未来H步的二元接触事件序列;g_θ是状态预测模块,以历史窗口和预测出的接触序列为条件,输出未来位姿增量序列。换句话说,先判“碰没碰”,再算“怎么动”——这跟人类操作物体的直觉一致:手指接触上物体之前和之后,动力学模型根本不是一回事。
在接触表示上,论文做了一个相当实用主义的选择:使用手级二元接触信号,而不是连续接触力。为什么?一方面真实触觉传感器测得的接触力噪声大、对校准敏感,即使接触状态不变读数也会小幅波动,连续量回归起来又难又不稳定;另一方面,仿真和真实世界的接触力尺度天然不一致,但“是否接触”这个离散事件在两边可以做到近乎一致的定义——仿真里靠碰撞网格检测,真实世界靠触觉阈值判断。用二元信号既能提供干净的监督信号,又天然对齐跨域数据分布。这个设计也恰好符合神经网络的光滑特性:把高频的接触幅值变化换成离散事件预测,再用这个事件去条件化下游动力学,学习负担大大降低。
图2:接触感知神经动力学框架总览
图2:接触感知神经动力学框架总览。模型输入多模态历史信息(物体位姿、关节构型、动作指令、接触信号、点云),时间编码器处理状态-动作-接触序列,PointNet编码器处理几何点云,融合后的潜在特征z_t由接触预测模块推断未来接触事件,再条件化扩散位姿预测器输出未来位姿增量。模型先在仿真数据上预训练,再用少量真实数据微调,实现隐式的跨域对齐。

两阶段架构:从接触预测到条件扩散

具体架构上,模型分为两个耦合模块:接触预测器(Contact Predictor)和扩散位姿预测器(Diffusion Pose Predictor)。整个模型的输入先经过多模态编码器融合:物体位姿、动作、关节构型沿时间维度堆叠起来,输入时间编码器;接触序列由一个独立编码模块处理;静态物体点云经PointNet编码器提取几何特征。所有模态的嵌入拼接后过一个轻量MLP,得到共享的潜在特征z_t∈R^512,这个特征就是后面两个阶段的公共“大脑”。

Stage I:接触预测器

第一阶段的目标是预测未来H步的接触状态。给定融合特征z_t,一个MLP直接输出接触概率序列:
接触预测公式
其中σ(·)是logistic sigmoid函数,把输出压到0和1之间。训练时使用二进制交叉熵(Binary Cross Entropy,BCE)损失:
接触预测BCE损失公式
接触预测器存在的意义,不只是为了让模型“知道”未来有没有接触,而是给位姿预测提供“事件锚点”。预测出的接触序列先经过一个小MLP压缩成64维的接触特征f_c,再与z_t拼接成动力学条件向量:
条件向量拼接公式
这一步是论文的关键设计:接触信息不是事后校验的辅助标签,而是直接参与位姿生成的先决条件。预测出的接触概率经过一个可学习的编码层,变成对下游扩散模型友好、可微的连续条件特征,避免离散硬标签导致的梯度断裂。

Stage II:扩散位姿预测器

第二阶段负责生成未来位姿增量。把未来H步的位姿变化建模成相对于上一时刻的增量序列x_0,每个增量用6D最小参数形式表示,包含平移增量Δp和旋转增量ω:
平移增量公式 旋转增量公式
平移增量直接计算相邻时刻的位置差,旋转增量ω通过指数映射(exponential map)转为相对旋转矩阵。采用增量预测而非绝对位姿,是因为增量在时序上更接近平稳分布,扩散模型拟合起来更容易收敛,也能在一定程度上避免长程轨迹的累积漂移。
扩散模型的前向过程是标准的高斯加噪:
扩散前向过程公式
反向去噪过程由一个一维U-Net参数化,以带噪样本、噪声水平和条件向量h_t为输入,预测噪声。这里用到了FiLM(Feature-wise Linear Modulation,特征级线性调制)机制,把条件h_t以仿射变换的方式注入U-Net的每一层,确保接触信息在每一个分辨率尺度上都能引导去噪过程。训练损失就是简单的噪声回归:
扩散损失公式
生成阶段从随机噪声开始逐步去噪,得到增量轨迹后叠加回初始位姿:
轨迹重建公式
整体训练目标把两阶段的损失联合起来:
联合训练目标公式
接触预测和位姿扩散联合优化,模型既学会了“何时发生接触”这个离散事件,也学会了“接触之后物体怎么动”这个连续动力学。λ是平衡两阶段损失的权重超参数。

仿真与真实世界的接触建模

实现层面,仿真与真实世界的接触建模使用一致的二元定义。仿真里,MuJoCo中指尖与物体碰撞网格相交即判定c_t=1;真实世界,XHand的每个指尖都装有基于力的触觉传感器阵列,能够以最小0.05N的精度感知三轴接触力,系统整体以80–85Hz运行。
数据采集前,所有传感器先做一次复位校准,减去静止3秒窗口的平均力值作为零点偏移:
触觉传感器校准公式
随后用累计力幅值做接触检测:
接触检测判定公式
当指尖三轴力的绝对值之和超过0.3N就判定为接触。这套规则简单粗暴,却很有效——它把高维连续的触觉读数降维成一个跨仿真和真实一致的离散事件,为后续的隐式对齐打下基础。在仿真端,接触标签直接由MuJoCo的碰撞检测给出,不需要任何额外处理,保证两边数据尽量对齐。

实验结果:精度提升与任务成功率的双重验证

实验平台方面,论文使用XArm7机械臂搭配XHand灵巧手,真实物体来自YCB日常物体集(Yale-Carnegie-Berkeley标准物体数据集)。物体位姿由FoundationPose估计,为了抑制视觉位姿估计的残余噪声和漂移,训练时采用较低的控制频率,并对测量位姿加入小幅随机扰动。真实实验布局如图3所示。
图3:真实实验平台设置
图3:真实实验设置。XArm7机械臂配合XHand灵巧手,指尖配备力敏触觉传感器用于接触检测,Realsense相机负责视觉观测,使用YCB日常物体进行抓取和操作实验。
实验设置了单物体和多物体两组任务,采用三种数据体制对比:仅仿真预训练(Sim data)、真实数据训练(Real data)、仿真预训练加少量真实数据微调(Real-Finetune)。仿真数据方面,单物体设置使用YCB的芥末瓶,共8000条仿真轨迹;多物体设置使用40个YCB物体、15000条轨迹,并随机化物理和接触参数。对比方法包括:神经网络动力学基线[52]、MLP动力学预测器、UNet动力学预测器、Diffusion-UNet动力学预测器。评价指标为均方误差MSE(Mean Squared Error)和ADD-S曲线下面积AUC(Area Under the Curve)。ADD-S来自姿态估计领域文献[43],衡量预测轨迹与真值轨迹在3D空间中保持在一定距离阈值内的比例,AUC越高代表空间一致性越好。
定性结果如图4所示:第一行是真实世界轨迹,第二行是标准MuJoCo仿真结果,第三行是接触感知神经动力学的预测结果。标准仿真在接触丰富的操作中经常出现物体抖动、穿透、甚至“飘走”等不合理的物理行为,而本文模型生成的轨迹与真实轨迹高度吻合,接触切换处的运动状态转变也干净利落。
图4:真实、仿真与模型预测的定性对比
图4:真实、仿真与本文模型预测的定性对比。第一行是真实世界轨迹,第二行是标准MuJoCo仿真,第三行是模型预测。标准仿真常因接触建模不足出现不稳定或错误接触以及物理上不合理的物体运动;本文模型生成的轨迹更平滑、更贴近真实。用少量真实数据协同训练后,时间稳定性和接触一致性进一步提升。
图5:多轨迹滚动预测对比
图5:多步轨迹滚动预测对比。左栏是两阶段接触感知模型与真值的对比,右栏是直接动力学预测器与同一真值的对比。直接预测器随步数增加轨迹漂移明显,而接触感知模型依靠“先判断接触事件、再生成位姿变化”的两阶段结构,牢牢抓住了接触驱动的运动模式切换,包括滑动场景中接触丢失后的轨迹调整。
定量结果如表1所示。在单物体设置中,接触感知的Diffusion-UNet在真实数据微调后MSE降到0.0082,ADD-S达到88.23%,明显优于不带接触的Diffusion-UNet(MSE 0.0091,ADD-S 82.45%)和MLP基线(MSE 0.0110,ADD-S 77.43%)。多物体设置的差距同样显著:真实微调后MSE 0.0058,ADD-S 79.12%,而MLP只有0.0069的MSE和73.43%的ADD-S。值得注意的是,即便是仅用仿真数据(Sim data)训练,接触感知模型的MSE也保持在同类最低水平,说明接触建模带来的收益从仿真阶段就开始体现了。
表1:单物体与多物体任务定量对比
表1:单物体和多物体任务在不同训练体制下的定量对比。指标为MSE(越低越好)和ADD-S的AUC(百分比,越高越好)。本文提出的带接触条件的Diffusion-UNet在所有设置下均优于基线,在有限真实数据微调后提升更明显,多物体任务的泛化能力尤为突出。
awesome and shock
更直接的验证来自任务成功率。表2把预测轨迹终点与真实轨迹终点的偏差小于5厘米定义为成功,单物体场景中,本文方法把成功率从52.6%提升到73.7%;多物体场景从50.0%提升到68.4%。这说明预测误差的降低确实转化成了更高层的任务完成能力——对机器人策略评估来说,这个指标比纯轨迹误差更有说服力。
表2:任务成功率对比
表2:单物体和多物体设置下的任务成功率。成功定义为预测轨迹终点与真实轨迹终点偏差小于5厘米的滚动预测比例。接触感知模型在两种设置下均显著提高了成功率。
为什么接触感知能带来这么大的提升?关键在于扩散模型本身擅长拟合连续分布,但对非光滑突变比较头疼;而接触事件恰恰是非光滑的。两阶段架构相当于给扩散模型外挂了一个“碰撞检测器”,先把离散的接触事件预测出来,再用它去条件化连续的位姿变化。这样扩散模型只需在接触状态内做平滑的动力学拟合,突变由接触预测器来“切换模式”——专业对口,各自安好。从消融结果看,带接触条件的模型与不带接触的Diffusion-UNet相比,单物体ADD-S从82.45%提升到88.23%,接近6个百分点的差距,充分说明了接触条件信号的价值。

局限与展望:接触感知的未来方向

论文的贡献很实在,但局限也比较明显。最直接的一点,二元接触信号丢失了大量信息:它只告诉模型“碰没碰”,不告诉模型“碰在哪个位置、碰了多大力”。指尖触觉阵列的丰富读数最终被压缩成单比特,对摩擦变化、滑移方向、受力分布这些精细物理量完全无感。对于精密操作(比如捏鸡蛋、拧螺丝),更细粒度的接触表征可能是必要的。另一个局限是当前实验集中在抓取、翻转等相对基础的操作,物体类型限于YCB日常物体。虽然多物体实验证明了泛化性,但距离复杂装配、形变物体操作、工具使用等更高级的接触推理场景还有明显距离。此外,模型的点云表征是初始时刻采样的静态几何,面对物体形变或严重遮挡时的适应性有待进一步验证。
从应用角度看,这个模型的定位与其说是“真实世界的精确模拟器”,不如说是“策略评估器”——用少量真实数据校准仿真动力学,让仿真里的策略评估更可信。论文4.4节也提到,神经前向动力学模型可以用于推断潜在物理属性、提供可微结构给下游决策。顺着这个方向,后续工作可以在指尖级接触表征上建模、引入连续接触力预测、把触觉与视觉信号做更深的融合。随着触觉传感器硬件成本的下降,这类“接触感知的神经动力学”很可能成为灵巧操作sim-to-real工具箱里的标准件。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?提出接触感知神经动力学,把触觉接触信息作为弥合仿真与现实鸿沟的核心信号,大规模仿真预训练+小样本真实数据微调。
这篇工作最值得看的点是什么?论文方法在所有设置下均取得最优性能。单物体Real-Finetune设置下达到0.0082 MSE和88.23% ADD-S,多物体设置下达到0.0058 MSE和79.12% ADD-S。任务成功率方面,Sim+Real w/ Contact在单物体和多物体设置下分别达到73.7%和64.7%,显著优于Real-only的52.6%和47.1%。
这篇工作的边界或风险在哪里?优点:(1) 提出接触感知的隐式仿真到现实对齐框架,有效利用触觉信息;(2) 二值接触表示简单鲁棒,在仿真和真实世界间保持一致;(3) 两阶段架构(接触预测+条件扩散)能有效建模接触引起的非光滑动力学;(4) 大规模仿真预训练+少量真实数据微调的策略高效实用。缺点:(1) 依赖FoundationPose估计物体状态,在遮挡或杂乱场景下精度下降;(2) 二值接触信号无法捕捉接触面积、滑移方向等丰富接触属性;(3) 长时程预测仍存在累积误差;(4) 需要大量仿真数据预训练。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种隐式仿真到现实对齐框架,利用触觉接触信息训练接触感知的神经动力学模型,通过大规模仿真预训练和小规模真实数据微调实现接触丰富操作任务的动力学对齐。

实验合理度:★★★★☆

均方误差(MSE)、ADD-S曲线下面积(AUC)、任务成功率(最终预测位置与真实轨迹终点偏差小于5cm的百分比)。

学术研究价值:★★★★☆

提出一种隐式仿真到现实对齐框架,利用触觉接触信息训练接触感知的神经动力学模型,通过大规模仿真预训练和小规模真实数据微调实现接触丰富操作任务的动力学对齐;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确报告具体计算量,模型为轻量级设计,适用于机器人实时控制场景。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 依赖FoundationPose估计物体状态,在遮挡或杂乱场景下精度下降;

主要参考文献

[1] Contact-Aware Neural Dynamics, Changwei Jing, Jai Krishna Bandi, Jianglong Ye, et al. arXiv:2601.12796, 2026.
[2] Todorov E, Erez T, Tassa Y. MuJoCo: A physics engine for model-based control. IROS 2012.
[3] Calli B, Singh A, Bruce J, et al. YCB: Yale-Carnegie-Berkeley benchmark for robotic manipulation. ICRA 2015.
[4] Qi C R, Su H, Mo K, et al. PointNet: Deep learning on point sets for 3D classification and segmentation. CVPR 2017.
[5] Wen B, Yang W, Kautz J. FoundationPose: Unified 6D pose estimation and tracking of novel objects. CVPR 2024.
[6] Deng X, Yu F, Zhou J. ADD-S: Average distance of symmetric objects for 6D pose estimation. 2021.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球