← 返回 PaperDaily 视觉与图像

清华TacWAM:触觉卷进世界模型,机器人操控成功率飙升37.5%

继2026年6月聊过物理对称性硬编码的世界模型、7月聊过北大DWM之后,这期看点更有“手感”的:清华TacWAM直接把触觉卷进世界动作模型,四大接触丰富任务平均成功率75%,比最强基线高出37.5个百分点。想看懂机械手怎么“摸”东西,这篇别错过。

清华TacWAM:触觉卷进世界模型,机器人操控成功率飙升37.5%
原论文信息如下:

论文标题:
TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction

发表日期:
2026年7月

发表单位:
清华大学(Tsinghua University)与 Manifold AI

原文链接:
https://arxiv.org/pdf/2607.28391v1.pdf


先问一个扎心的问题:你家机器人会“摸东西”吗?
这里的“摸”不是指机械臂碰到物体,而是在手指捏住一个生鸡蛋时,知道该用多大劲;在拿起一片薄脆薯片时,既不让它滑走也不把它捏碎;在擦白板时,保证刷子始终贴住板面,而不是悬空画空气。
这可能比听上去难得多。近两年,具身智能圈子里的世界模型(World Model)世界动作模型(World Action Model)火得不行,它们让机器人学会“脑补”未来——预测下一帧画面,再根据预测结果输出动作。可问题在于,绝大多数世界模型预测的未来,都是视觉未来:场景会怎么变、物体往哪挪、机械臂怎么走。但视觉看得到位置,却看不到、看不到形变、看不到物体即将打滑的那一瞬。
于是清华和 Man

触觉,机器人操作的下一个“视觉”?

把手机放在桌上,人眼一看就知道能不能抓住它。但如果要你闭着眼睛,靠指尖的触感判断“该用多大力气捏住一块豆腐”,你反而会犹豫——因为触觉是一种需要“贴身感受”才能获得的信息,它藏在视觉画面之外。
当前火热的世界模型(World Model)世界动作模型(World Action Model,WAM),恰恰就卡在这个问题上。视觉未来预测能让机器人“想象”场景会怎么变,但是接触力怎么涨、物体表面怎么形变、什么时候会打滑,视觉画面里看不出来。比如两个看起来几乎一样的抓取姿态,一个可能已经把薄脆的薯片捏出裂纹,另一个才刚刚碰上表面。
清华与Manifold AI联合提出的TacWAM,就把“触觉未来”正式请进了世界动作模型的训练框架。它保留视觉预测的同时,新增了一个触觉预测分支,这个分支预测未来的力场、形变流和全局力/力矩变化。这样一来,模型不再是只会“看”的机器人,而是开始学着“摸”着干活。
不过,把触觉未来直接当成动作生成的条件,会埋下一个大坑:训练时模型能看到未来触觉状态,部署时却拿不到——这叫训练-部署信息不一致。TacWAM用一个巧妙的注意力掩码机制把这个坑填上了。具体怎么回事,接着往下看。

全新WAM框架:用触觉未来“训练”动作,而非“指挥”动作

世界动作模型把“预测未来状态”和“生成动作”放进同一个框架里一起训练。视觉流预测下一帧画面,动作流根据当前的画面和任务目标输出动作序列。问题的关键在于:未来的视觉画面并不能完整描述“接触过程”。比如夹爪慢慢靠近一个生鸡蛋,视觉上根本看不出表面压力正在逼近临界值;一旦压力超限,蛋壳就裂了,但画面上只有裂开那一瞬间才暴露问题。
TacWAM的做法,是在WAM里加一条触觉预测通路:在时刻 t,机器人的观测可以写成:
其中 otv 是视觉观测,ottac 是触觉观测,qt 是本体感知(比如关节位置),l 是任务或语言条件。触觉观测先经过一个编码器变成一个紧凑的触觉表示:
这个 zttac 就是触觉潜变量,后面的触觉预测都发生在“潜空间”里,而不是直接去预测高维的原始触觉图像。
在每个动作块开始时刻 t0,TacWAM同时预测三组东西:视觉未来、触觉未来和动作序列。用公式概括就是:
FV 负责预测未来视觉帧,FT 负责预测未来触觉潜变量,FA 负责生成动作序列。注意细节差异:动作分支 FA 的输入只有当前视觉锚点 ov、当前触觉锚点 ztac、本体感知和任务条件,没有把触觉历史上下文 ctac 喂给动作分支,更没有把未来触觉目标给它。触觉历史上下文只给触觉预测分支 FT 使用。
整个TacWAM架构的宏观视图如图1所示。图1(a)展示了三模态WAM生成器的整体结构:视觉、触觉、动作三种token在统一的混合Transformer骨干网络里通过带掩码的混合自注意力进行信息交互;图1(b)是SAF触觉编码器的细节;图1(c)是AGT注意力的信息流拓扑。
图1:TacWAM整体架构概览
图1:TacWAM整体架构概览。(a) TacWAM从部署可用的上下文出发,联合预测视觉未来、触觉未来和动作块。(b) SAF触觉编码器从触觉外观、稠密力场和网格形变流构建触觉潜变量预测空间,并用全局力矩进行监督。(c) AGT注意力将可观测锚点、未来预测目标和动作token进行信息隔离。
这套设计的核心思想可以概括为一句话:未来触觉状态是“训练时的老师”,不是“部署时的拐杖”。训练时模型可以靠着预测未来触觉状态来学习接触相关的表征;部署时动作生成只依赖当前能观测到的信息,不会因为“训练时看得见未来、测试时看不见未来”而崩掉。

三管齐下:SAF编码器、触觉历史与AGT注意力的精妙配合

TacWAM的触觉侧有三大核心设计:SAF触觉编码器负责建好“触觉语言”,触觉历史编码器负责补上“时序上下文”,AGT注意力负责划清“信息边界”。三者缺一不可。

SAF触觉编码器:把三种异构信号拧成一股绳

触觉传感器输出的原始信号并不只有一张“压力图”。以夹爪两侧搭载的Xense G1-WS触觉传感器为例,每个时刻 t 的触觉观测包含三路信号:
其中 Itrect 是校正后的触觉外观图像,Ft 是稠密局部力场,Mtflow 是网格形变流。这三者都在传感器表面完成了空间对齐。SAF编码器把这三路信号分别编码之后再融合成触觉潜变量:
为了让这个潜变量真正保留力学信息,SAF还配了一个触觉重构器 Rtac,它从潜变量里尝试还原稠密力场、网格形变流,以及一个非常重要的附加量——双边合力与扭矩
rwrench 表示每个夹爪侧触觉传感器上的三维力加三维力矩,它刻画的是整个接触面的“全局力学状态”,而局部力场只反映局部接触。有了全局的力/力矩重构,潜变量就不仅仅是局部形变的压缩,还包含了整体受力信息。这部分训练损失定义为:
三个损失项分别对应力场重构、合力/力矩重构和形变流重构。SAF编码器训练好之后,后面的WAM训练阶段会把它冻结起来,当作一个固定的“触觉特征提取器”来用。

触觉历史编码器:让预测“有来龙去脉”

单帧触觉就像一个“没有上下文的表情包”——同样的力度数值,既可能是稳定接触,也可能是打滑前的临界状态,还可能是正在恢复接触的中间过程。单靠当前这一帧根本分不清。TacWAM用了一个触觉历史编码器 Ehist 把最近一段时间窗口内的触觉潜变量压缩成一个紧凑的上下文向量:
这个 ct0tac 不是被塞进序列里当额外的记忆token,而是通过自适应归一化去调制触觉专家,帮助触觉预测分支理解当前的“接触阶段”——是正在逼近、已经稳定,还是正在滑脱。同时,历史编码器上还挂了一个轻量的接触事件辅助损失,标签来自历史窗口内的二值接触序列,包括接触开始、释放、稳定接触等状态。

AGT注意力:给三个信息流划好“安全距离”

TacWAM的token排列可以表示为:
其中 V0 是当前视觉锚点,V1:H 是未来的视觉预测token;T0 是当前触觉锚点,T1:H 是未来的触觉预测token;A 是动作token。Anchor-Guided Tri-Modal Attention(AGT注意力)决定了这三组token之间谁可以“偷看”谁。
AGT注意力的可见性规则可以用一张表来总结(表1)。其核心约束非常清晰:动作token只能读 V0、T0 和自己动作token内部的信息,严禁访问未来的视觉或触觉token。同时,视频token不能读触觉未来,触觉未来token也不能读动作token。这就在训练时把“未来触觉预测目标”隔离在动作生成路径之外。
*表格超出部分左右可以滑动
查询流 允许读取的键/值流
视觉 V₀ 和 V₁:H(视频第一帧因果掩码)
触觉未来 V₀、T₀ 和 T₁:H(触觉第一帧因果掩码)
动作 V₀、T₀ 和动作token
表1:AGT注意力可见性规则。行表示查询流,列表示允许读取的键/值流。
这种“信息隔离”的代价是动作分支失去了未来信息的辅助,但换来的是训练和部署之间的一致性。换句话说,TacWAM把“未来触觉信息”严格定位成一种训练信号,而不是动作生成的输入端。这种设计哲学,恰恰是很多触觉预测方法容易忽略的地方——如果训练时动作分支偷看了未来触觉预测目标,部署时必然掉链子。
整个TacWAM的联合训练损失由五部分组成:
包括视频预测损失、动作生成损失、触觉潜变量预测损失、触觉解码语义一致性损失和接触事件辅助损失。训练时梯度可以通过冻结的触觉解码器传回预测的触觉潜变量,让触觉预测不仅匹配潜变量标签,还具备力场和形变层面的语义一致性。

四大真实任务实证:成功率碾压视觉与触觉基线

光说不练假把式。TacWAM在真实机器人平台上跑了四个接触丰富的操作任务,每一个都精准踩中视觉模型的“盲区”。这四个任务分别是:

薯片抓取:从桌面抓起一片薄脆薯片放到目标盘子里。要求力度控制极其精准——力度小了薯片会滑走,力度大了直接捏碎。

樱桃抓取:抓取尺寸不固定且表面光滑的樱桃,需要靠触觉确认接触是否稳定。

白板擦拭:夹着白板擦沿板面持续移动。难点在于擦板必须全程贴住板面,悬空或者压力不够都算失败。

双笔旋转:用夹爪带动两支笔进行动态的双侧接触旋转,对双边受力变化建模的要求极高。

图2:真实世界评估任务
图2:真实世界评估任务。图片展示了四个接触丰富操作任务对应的文本提示和顶视相机观测。
每个任务采集300条示范,每条示范约500帧,所有感知和控制流在30Hz下同步。对比的基线横跨四条技术路线:纯视觉VLA的π0.5、纯视觉WAM的Fast-WAM、反应式触觉策略RDP(Reactive Diffusion Policy,基于Slow-Fast策略结构使用触觉反馈进行接触丰富操作)、以及视觉-触觉WAM基线VT-WAM。每个方法每个任务跑20次真实试验,按成功率统计。
结果相当直观——表2给出了详细的成功率数据。
*表格超出部分左右可以滑动
方法 薯片 樱桃 擦拭 旋转 平均
π0.5 10.0% 60.0% 35.0% 20.0% 31.3%
Fast-WAM 15.0% 40.0% 20.0% 5.0% 20.0%
RDP 50.0% 45.0% 0.0% 35.0% 32.5%
VT-WAM 45.0% 45.0% 30.0% 30.0% 37.5%
TacWAM 90.0% 70.0% 75.0% 65.0% 75.0%
表2:真实世界操作主实验结果。数据为20次真实试验的任务成功率。
TacWAM在四个任务上全部领先。平均成功率75.0%,把最强基线VT-WAM(37.5%)甩开了37.5个百分点。尤其值得注意的是白板擦拭和双笔旋转这两个任务——前者需要持续接触,后者需要动态双侧接触推理。纯视觉的π0.5在擦拭任务上只有35%,RDP干脆是0%,而TacWAM直接拉到75%;双笔旋转任务上,视觉模型几乎“抓瞎”,Fast-WAM只有5%,π0.5也只有20%,TacWAM则做到了65%。
除了主实验结果,TacWAM还设计了一组递进式消融实验来回答两个核心问题:触觉历史到底重不重要?AGT信息隔离到底有没有用?
图3:注意力掩码变体
图3:联合训练消融中使用的注意力掩码变体。Attn-AT允许动作token读取完整的触觉预测序列T₀:H。Attn-VT在Attn-AT基础上进一步允许视觉未来token和触觉未来token之间双向交互。
图3展示了两个放松注意力约束的变体:Attn-AT允许动作token读取全部触觉预测序列T₀:H,Attn-VT则在Attn-AT基础上进一步放开视觉未来和触觉未来之间的双向交互。表3给出了消融结果。
*表格超出部分左右可以滑动
变体 薯片 擦拭 平均
TacWAM(完整) 90.0% 75.0% 82.5%
去掉触觉历史 50.0% 60.0% 55.0%
去掉历史 + Attn-AT 30.0% 45.0% 37.5%
去掉历史 + Attn-VT 10.0% 5.0% 7.5%
表3:消融实验结果。数据为20次真实试验的任务成功率。
消融结果清晰地呈现了“逐级崩塌”的趋势。去掉触觉历史后,平均成功率从82.5%掉到55.0%,薯片抓取直接从90.0%腰斩到50.0%。这说明在接触前期,压力的“积累过程”对后续动作决策至关重要,单靠当前触觉帧提供的上下文远远不够。更进一步,在去掉历史的基础上放开动作token对触觉预测序列的读取权限(Attn-AT),平均成功率继续掉到37.5%;再放开视觉-触觉未来token的双向交互(Attn-VT),直接崩到7.5%。
这个消融结果看似反直觉——给动作分支多看一些信息,效果反而更差了。但仔细想想,这正是训练-部署不一致的典型表现。当动作分支在训练时能读到未来触觉目标,它就会“偷懒”,把预测未来的负担推给注意力机制,而不是真正学会从当前的触觉锚点中提取有效信息。到了部署阶段,未来信息消失,动作分支就瞬间“失明”。这从反面验证了AGT信息隔离的重要性。
从实验设计的角度看,这套递进式消融把“移除历史”和“放松掩码”两个因素分开处理,先单独移除历史,再在无历史基础上逐步放松掩码限制,逻辑链条非常干净。每个变体都保持了相同的训练数据和动作表示,避免了混淆变量的干扰。稍有遗憾的是,消融实验只选了薯片抓取和白板擦拭两个任务,没有覆盖全部四个任务,不过这两个任务恰好一个代表“力积累敏感型”操作,一个代表“持续接触型”操作,已经具有足够的代表性。

从TacWAM看未来:触觉感知如何重塑机器人学习

TacWAM的核心价值并不只是“在四个任务上提升了成功率”,而是提出了一个值得深思的设计范式:触觉未来的角色应该是训练信号,而不是动作条件。这个定位上的清醒,是很多触觉预测工作容易忽略的。
触觉传感器的成本在快速下降,Xense G1-WS这类商业化触觉传感器已经能在夹爪上稳定输出图像级力场和形变流。当触觉硬件不再是瓶颈,问题就转移到了算法层面:如何把触觉信息真正融入世界模型的预测学习框架?TacWAM证明了SAF编码器+触觉历史+AGT注意力这个组合是行之有效的,并且给出了清晰的消融证据。
未来沿着这个方向走,有几个问题很值得继续深挖。第一,目前触觉预测是在潜空间做的,虽然解码到力场和形变流作为语义约束,但预测的精度评估还比较粗。能不能像视觉预测一样,把触觉预测的质量作为一个显式的评估指标来优化?第二,触觉历史编码器用的是轻量级时序压缩,面对更长程的接触任务(比如装配、打磨),是否需要更强大的时序模型?第三,SAF编码器是单帧输入,如果把触觉历史也喂给SAF做模板匹配,能不能进一步提升力场预测的准确度?这些都是有明确技术路线的后续工作。
从产业视角看,TacWAM这类方法给“柔顺操作”和“精密装配”带来了新的想象空间。传统的力控方案需要显式的力学建模和大量的手工调参,而TacWAM展示了一条纯数据驱动的路径:让模型在预测触觉未来的过程中自发地学习力的演化规律。这套思路一旦成熟,对于3C装配、医疗手术辅助、食品分拣等对“手感”要求极高的场景,都有潜在的应用价值。
当然,TacWAM也有自己的边界。目前实验平台是两指平行夹爪,触觉传感器部署在夹爪两侧,对于灵巧手这种多指高自由度的场景,SAF编码器的“双侧融合”逻辑需要拓展到多指情况。另外,触觉观测频率是30Hz,对于高速冲击或快速滑动这类瞬态过程,这样的时间分辨率是否足够,也需要进一步验证。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问:为什么训练时不能直接把未来的触觉预测结果喂给动作分支?让动作分支“开卷”不是更好吗?消融实验给出了明确的回答:当动作分支在训练时能读到未来触觉预测目标(Attn-AT变体),平均成功率反而从55.0%进一步掉到37.5%;再放开视觉-触觉未来交互(Attn-VT),直接崩到7.5%。原因在于模型会“投机取巧”——动作分支一旦发现能从未来信息里直接获知结果,就不会真正去学习“从当前触觉状态推理下一步动作”的能力。到了部署阶段,未来信息不存在了,动作分支就无所适从。这正是机器学习和机器人领域常说的“训练-部署不一致”问题。TacWAM的AGT注意力本质上是给动作分支画了一条红线,逼着它学真正可部署的映射。

问:SAF编码器为什么要重构“双边合力与扭矩”?直接预测局部力场不够吗?局部力场反映的是触觉传感器表面各点的压力分布,相当于“局部触感”。但机器人做决策时,还需要知道整个接触面的“整体受力状态”——比如物体是否被夹紧、夹爪是否受到扭转力矩。双边合力与扭矩(wrench)提供了一个全局视角,对判断物体是否接近滑脱、夹持是否稳定至关重要。SAF编码器把wrench重构作为一项训练目标,其实是在强迫触觉潜变量编码“既见树木又见森林”的信息。论文中wrench重构被当作全局力学监督而不是第四路空间输入,这个设计避免了输入维度膨胀,同时保证了全局信息的保留。

问:TacWAM的触觉预测是否只在训练时有用?部署时触觉预测分支可以拿来做在线校正吗?论文中触觉预测在部署阶段不参与在线控制,只用作离线分析。也就是说,TacWAM的部署推理路径只包含视觉预测分支、动作分支以及“当前触觉锚点”的编码,触觉未来预测分支在部署时实际上处于不活跃状态。但论文提到,预测的触觉未来状态可以通过解码器还原成力场和形变流,用来分析整个操作过程中的力学变化趋势。至于是否能用触觉预测做在线滚动校正,把预测的力变化提前用于调整动作,这是一个自然的扩展方向,论文没有走这一步,留给了后续研究。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性:★★★★☆ 将未来触觉预测引入世界动作模型训练,并明确区分“训练监督”与“部署输入”两个角色,AGT注意力机制在信息隔离层面设计巧妙。

实验合理度:★★★★☆ 四个真实任务覆盖了脆性抓取、持续接触、动态双侧旋转等典型场景,基线覆盖视觉VLA、视觉WAM、反应式触觉策略和触觉WAM四条路线。消融实验的递进设计尤其值得称赞。

学术研究价值:★★★★★ 触觉未来作为训练信号的定位,为后续触觉预测研究提供了一个清晰的设计原则。SAF编码器中“全局力矩作为重构目标”的做法也有很强的借鉴意义。

稳定性:★★★☆☆ 真实平台验证比仿真扎实,但平台局限于两指平行夹爪和Xense G1-WS这一种触觉传感器,跨硬件泛化能力未验证。

适应性以及泛化能力:★★★☆☆ 任务类型覆盖了多种接触模式,但都基于同一平台和同一传感器型号。SAF编码器的“双侧融合”推广到多指灵巧手时,需要对融合策略做实质性调整。

硬件需求及成本:★★★☆☆ 需要配备触觉传感器的夹爪、顶视相机和腕部相机。Xense G1-WS这类传感器价格不算便宜,但已经比实验室级别的专用触觉传感器亲民不少。推理时不需要额外运行触觉预测分支,部署成本可控。

复现难度:★★★☆☆ 论文对方法描述详尽,但未提供开源代码。触觉数据的采集需要专门硬件和同步系统,数据管线的复现成本不低。如果后续能开放预训练模型或SAF编码器权重,复现门槛会大幅降低。

产品化成熟度:★★★☆☆ 在原型验证阶段表现亮眼,距离产品化还需要解决传感器成本、平台适配、长时稳定性等一系列工程问题。但对于精密装配这类“手感”要求极高的细分场景,TacWAM已经展示了明确的技术潜力。

可能的问题: 触觉预测的质量缺乏独立量化评估指标(如力场预测的均方误差),主要依赖下游任务成功率间接反映。另外,消融实验只覆盖了两个代表性任务,若能在全部四个任务上做消融会更完整。触觉历史窗口长度和动作块大小这两个超参数也缺少敏感性分析。


主要参考文献

[1] Hafner D, Lillicrap T, Norouzi M, et al. Mastering Atari with Discrete World Models. ICLR 2021.
[2] Physical Intelligence. π0.5: Open-World Generalization VLA Model. Physical Intelligence Technical Report, 2025.
[3] Yuan Y, et al. Fast-WAM: Fast World Action Model. 2026.
[4] Xue H, et al. Reactive Diffusion Policy for Contact-Rich Manipulation. 2025.
[5] Tian G, et al. VT-WAM: Visual-Tactile World Action Model. 2026.
[6] Zang Y, et al. TacForeSight: Tactile Dynamics Prediction. 2026.
[7] Ye H, et al. DreamTacVLA: Future Tactile Prediction. 2025.
[8] Cheng Z, et al. τ: Spatiotemporal Tactile Representation via Future Visual Supervision. 2026.
[9] Yuan W, Dong S, Adelson E H. GelSight: High-Resolution Robot Tactile Sensors. IEEE Robotics and Automation Magazine, 2017.
原文链接:https://arxiv.org/pdf/2607.28391v1.pdf
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球