← 返回 PaperDaily
视觉与图像
马克斯普朗克研究所最新研究:一个正则化同时搞定表征崩溃与行动对齐!
同类工作里,防止表征崩溃的招数多得让人眼花缭乱:要么冻结编码器、要么上EMA、要么加各种复杂的正则项。而这篇文章用一个逆动力学预测就把问题解决了——既防止了表征崩塌,又顺带让模型只关注环境中“可控”的部分,堪称一举两得。实验还揭示了学习到的潜在空间竟能如此优雅地保持世界状态的结构,读来令人茅塞顿开。
龙哥读论文
发布于 2026-08-14 21:47:11
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 同类工作里,防止表征崩溃的招数多得让人眼花缭乱:要么冻结编码器、要么上EMA、要么加各种复杂的正则项。而这篇文章用一个逆动力学预测就把问题解决了——既防止了表征崩塌,又顺带让模型只关注环境中“可控”的部分,堪称一举两得。实验还揭示了学习到的潜在空间竟能如此优雅地保持世界状态的结构,读来令人茅塞顿开。
原论文信息如下:
行动塑造感知:用逆动力学训练世界模型
想象一下,让你教一个AI看视频学会操控机器人。一个很自然的想法是,让AI先学会预测视频里下一帧会发生什么,也就是学习一个“世界模型”。但问题来了:如果让模型完全靠自己从像素预测像素,它很容易陷入“无关细节”的汪洋大海,只记住了背景墙纸的纹路,却没搞懂是哪个动作推动的椅子。
更高级一点的思路是在“特征空间”里做预测,也就是联合嵌入预测架构(JEPA)。这种方法不再解码像素,而是在编码后的特征向量里玩“连连看”。这听起来很棒,但又引入了新问题:表征崩溃 ——模型发现把所有图像都编码成同一个向量,预测起来就太容易了,而这样的表征完全没有信息量。
近日,来自马克斯普朗克智能系统研究所、布朗大学和ETH Zurich的团队,在论文《Sensorimotor World Models: Perception for Action via Inverse Dynamics》 中,提出了一个极度简洁却又深刻的解决方案:传感器运动世界模型(SMWM) 。方法的核心思想直接了当:要想让表征不崩溃,那就加一个“逆动力学”任务——让模型从前后两帧的表征中,反过来预测出导致这一变化的动作是什么。如果你要预测的动作(比如,向右推)是准确的,那你的表征就必须包含了“物体位置”这个关键变量,而忽略掉背景里的干扰物。
从像素到动作:一个正则化解决两大难题
SMWM的设计简洁得让人怀疑:一个编码器fθ将观测ot映射为紧凑嵌入zt = fθ(ot),一个前向动力学模型gϕ从(zt, at)预测下一时刻嵌入ẑt+1,一个逆动力学模型hψ从(zt, zt+1)预测动作at。三者联合训练,损失函数为L = Lfwd + λLinv。这个简单的框架同时解决了两大问题:表征崩溃和动作相关表征学习。
为什么逆动力学能防崩溃? 直觉上,如果编码器把所有观测都映射成同一个嵌入向量,那么逆动力学模型的两输入就完全相同,它只能预测一个常值动作(即数据集中动作的均值)。这个常值预测的风险就是E∥at − E[at]∥²₂。只要逆动力学模型的损失低于这个常数风险,就说明(zt, zt+1)保留了关于at的有用信息,从而排除了完全崩溃的解。换句话说,逆动力学提供了一个基于任务的锚点 ,而不是像SIGReg那样强加一个高斯分布的几何先验。
def loss(o_t, a_t, o_tp1, lambda_inv=10.0):
z_t = encoder(o_t)
z_tp1 = encoder(o_tp1)
z_hat = fwd_model(z_t, a_t) # 前向预测
a_hat = inv_model(z_t, z_tp1) # 逆动力学预测
loss_fwd = MSE(z_hat, z_tp1)
loss_inv = MSE(a_hat, a_t)
return loss_fwd + lambda_inv * loss_inv
整个框架只有一个额外超参数λ,控制逆动力学的强度。论文通过实验发现λ=10在大多数环境下表现最佳。对于超参数的敏感性,论文还做了详细分析:
从图中可以看出,λ在0.1到50的范围内性能相对稳定,但太小(如0.01)会导致崩溃,太大(如100)会过度强调动作预测而影响前向预测质量。总的来说,这个超参数并不难调。
潜在空间揭秘:学到的不只是表征,而是世界的“操控杆”
SMWM学到的潜在空间到底有多漂亮?论文在“点世界”测试床上做了大量分析,结果令人拍案。
更让人惊讶的是,SMWM学到的潜在空间不仅维度正确,还表现出很强的结构化性质。论文证明了一个重要的等变性:编码器编码真实状态后再施加动作,与先编码再在前向模型中施加动作,结果近似一致。如下图所示,模型预测的轨迹(红色)与真实编码轨迹(蓝色)几乎完全重合。
这种等变性有一个重要的推论:如果等变性成立,那么动作的合成就对应潜在空间中平移的合成,即a 7→ ga是一个同态映射。论文从理论上证明了这个结果(定理1),并且在实验中观察到每个动作a映射到潜在空间中的一个近似平移向量ρ(a),且平移量与起点z近似无关。这种低复杂度解法的出现,很大程度上要归功于逆动力学的压力:为了让逆模型能从(zt, zt+1)解码出at,最简单的策略就是把动作信息编码到两嵌入的位移中,从而自然形成平移结构。
为了验证SMWM是否能真正过滤无关信息,论文设计了一个带“干扰物”的测试:其中一个点受动作控制,另一个点随机跳动,不受控制。结果令人信服——编码器自动忽略了随机点,只保留了受控点的信息。更极端的情况是“耦合”配置:两个点绑定在一起,由同一个2D动作控制,其潜在维数只有2,而不是4。如下图所示,PCA谱在可控自由度处急剧下降。
这个能力来自联合优化:干扰物的状态既不能帮助逆动力学预测动作(因为与动作无关),也不能被前向模型准确预测(因为随机跳动),所以编码它只会增加前向损失而不减小逆损失,模型自然就把它丢弃了。这就是“感知服务于动作”的完美体现——你眼中只有你能改变的东西。
论文还做了一个特别有趣的实验:训练一个非对称三角形精灵,其姿态为(x,y,θ)。当只允许控制x/y平移时,模型学到的重建结果成了一个模糊的、近似各向同性的斑块——因为旋转角度不受控,模型就把这个不确定的维度平均掉了。而当允许控制全部三个自由度时,重建出来的三角形就非常锐利、方向准确。这种“控制依赖的感知”直观地展示了SMWM如何根据动作空间来塑造表征内容。
实战考验:逆动力学世界模型如何胜任规划任务?
SMWM在控制任务上的表现是检验其价值的试金石。论文在四个环境上进行了目标条件规划测试:TwoRoom(2D导航),Reacher(连续控制),Push-T(2D接触式操作),OGBench-Cube(3D桌面操作)。环境可视化如下:
规划流程:给定当前观测o1和目标观测og,用冻结的编码器编码得到z1和zg,然后利用前向模型在潜在空间用交叉熵方法(CEM)优化动作序列,使得最终预测的嵌入接近目标嵌入。整个过程中fθ和gϕ不更新,只优化动作序列。为了处理长程规划中的累积误差,采用模型预测控制(MPC)框架,每步只执行前K个动作后再重新规划。
为了评估嵌入到底保留了哪些物理信息,论文对冻结编码器的输出训练了线性探针和两层MLP探针,用于回归环境中的真实物理量(如智能体位置、关节角度、块状物位姿等),结果如下表所示:
可以看到,两种正则化方法(SMWM和SIGReg)在MLP探针下都近乎完美恢复了物理状态,凸显了正则化对保留信息的重要性。SMWM在Cube任务中的三个物理量(立方体位置、夹爪位置、夹爪开度)均取得了更好的线性探针得分,说明其嵌入在保持线性可解码性方面具有优势,这对于下游规划非常有利。
为了测试模型对不同规划距离的鲁棒性,论文改变目标距离(goal offset),结果如下图所示:
SMWM在TwoRoom和Cube上保持了近乎平坦的成功率曲线,说明其前向模型具有更强的长期预测能力。在Reacher和Push-T上两种方法旗鼓相当。这种优势很可能来自逆动力学结构化表征带来的低维、平滑的潜在空间,减少了长期滚动的误差积累。
论文比较了SMWM与SIGReg在潜在空间几何上的差异。图6展示了SMWM嵌入的PCA谱及投影:
而SIGReg的潜在几何(图10)则显得更分散、缺乏明显的结构:
一句话总结:SMWM学到了一个紧凑、可解释、与可控自由度对齐的潜在空间,而SIGReg虽然也防崩溃,但它的高斯先验没有引入任何关于动作的信息,因此几何上不够规整。这就是为什么在长期规划和复杂3D任务中SMWM更胜一筹。
简洁而强大:为何逆动力学是一种更优的对抗崩溃选择?
与其他防止表征崩溃的方法相比,逆动力学正则化有着独特的优势。下表总结了当前领域内几种代表性方法:
DINO-WM 冻结了预训练的DINOv2编码器,虽然避免了崩溃,但编码器不是为机器人控制定制的,可能会丢失任务相关特征。
PLDM 使用了多个辅助损失:方差-协方差正则化、时间平滑性、逆动力学等,显得比较笨重,超参数也多。
LeWorldModel/SIGReg 使用各向同性高斯匹配正则化,虽然有效,但高斯先验没有利用任何任务信息,导致潜在空间几何不如SMWM结构化。
V-JEPA 2 使用了stop-gradient和EMA目标网络,架构更复杂。
而SMWM只用了一个逆动力学头,一个额外的超参数λ,就同时解决了崩溃和表征学习两大问题。更重要的是,这个机制赋予了表征一种“感知服务于动作”的先验,让模型自动关注可控的、任务相关的结构,而不是强加任何几何先验。
当然,逆动力学也不是银弹。论文指出其核心假设是“动作可以从连续观测中恢复”,当不同动作导致完全相同的视觉变化时(例如两个不同的关节角度组合产生同一个位移),单步逆动力学可能会感到困惑。另外,当前SMWM只处理单帧输入,因此无法捕获速度等信息(即使这些信息对前向预测有帮助),未来可以通过编码短历史来解决。
未来展望:感知与行动的桥梁能否拓展到更广阔天地?
通过逆动力学正则化将感知锚定在动作上,SMWM展示了令人印象深刻的结果,但论文也坦诚地讨论了若干局限和发展方向:
1. 可识别性问题 :当不同的动作产生完全相同的观测变化时(例如对称的操作空间),单步逆动力学无法区分。在真实机器人场景中,这种歧义可能更普遍。
2. 单帧输入限制 :当前编码器只处理单帧观测,因此无法捕获速度、动量等动态信息,而这些信息对于精确的物理预测非常重要。引入短期观测历史应该是即插即用的改进。
3. 离线数据质量 :SMWM从完全离线、无奖励的数据中学习,因此高度依赖数据集的质量和覆盖范围。如果数据集缺少某些重要状态-动作对,模型可能无法学到可靠的动力学。
尽管有这些局限,SMWM已经提供了一条极其简洁而优雅的路径来实现“感知服务于动作”的哲学。随着硬件和传感器技术的发展,将这类模型部署到真实机器人上,并观察其在复杂、部分可观测环境中的表现,将是非常有趣的方向。毕竟,我们的感知本来就不是为了重构世界,而是为了行动。
龙迷三问
Q1: 这篇论文解决什么问题? 核心问题是:在联合嵌入预测架构(JEPA)类的世界模型中,如何防止表征崩溃,同时让学习到的表征对控制任务有用。已有的解决方案要么冻结编码器(DINO-WM),要么使用分布正则化(SIGReg),要么使用EMA等复杂机制。本文提出用逆动力学正则化一举两得:既防止崩溃,又让表征自动对齐可控自由度。
Q2: 逆动力学正则化具体是怎么防止崩溃的? 考虑极端情况:如果编码器把所有观测映射成同一个嵌入向量z*,那么逆动力学模型的输入永远都是(z*, z*),它只能预测一个常值动作(数据集中动作的平均值)。这个常值预测的损失E∥at−E[at]∥²₂是一个上界。只要逆动力学损失低于这个上界,就说明(zt, zt+1)保留了关于动作的信息,从而证明编码器没有完全崩溃。实际上,逆动力学提供了一个“任务锚点”,迫使嵌入保留与动作相关的可预测信息。
Q3: SMWM与SIGReg相比,关键优势在哪里? SIGReg使用各向同性高斯匹配正则化,虽然能防崩溃,但强加的几何先验与任务无关。SMWM的逆动力学正则化则直接将表征锚定在动作上,因此学到的潜在空间自动呈现结构化:笛卡尔自由度变成线性方向,周期变量变成圆环。这种结构化空间使得长期规划误差更小,在复杂3D操作任务中表现更优。实验表明,SMWM在OGBench-Cube上的规划成功率比SIGReg高25个百分点,且对规划距离的鲁棒性更强。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
核心思想简单但效果出人意料地好,与“感知服务于动作”的哲学深度结合。逆动力学本身并非全新概念,但将其作为世界模型训练的独立正则化器是重要的增量贡献。
实验合理度: ★★★★★
实验设计系统全面,从简单到复杂,从内在维度分析到规划性能,每个环节都有充分证据支持结论。
学术研究价值: ★★★★★
为JEPA世界模型领域提供了一个极其简洁且有效的解决方案,重新激活了“感知服务于动作”的理论视角,对多个领域有很强启发价值。
稳定性: ★★★★✰
对规划距离和超参数λ都比较鲁棒,但在真实传感器噪声或动作歧义下稳定性可能下降。
适应性以及泛化能力: ★★★★✰
在多种环境上表现良好,尤其擅长过滤干扰物,但真实世界中的光照变化、部分遮挡等挑战尚未验证。
硬件需求及成本: ★★★✰✰
使用ViT-Tiny编码器和小型Transformer,参数量约15M,训练需要一定GPU算力。推理时编码器和前向模型轻量,但CEM规划需要多次前向预测。
复现难度: ★★★★★
方法极其简单,论文提供了伪代码,实验细节详尽,代码已公开。
产品化成熟度: ★★✰✰✰
目前仍处于学术验证阶段,但作为世界模型的核心组件,有潜力集成到机器人控制系统中。
可能的问题: 单步逆动力学假设动作可从连续两帧完美恢复,但在复杂物理交互中可能存在歧义;单帧输入无法捕获速度等动态信息。
主要参考文献
[1] Hafner et al. "Dream to Control: Learning Behaviors by Latent Imagination." ICLR 2020.
[2] Assran et al. "Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture." CVPR 2023.
[3] Bodnar et al. "LeWorldModel: Learning World Models for Control from Pixels via SIGReg." arXiv 2025.
[4] Hansen et al. "TD-MPC2: Scalable, Robust World Models for Continuous Control." ICLR 2024.
[5] Pathak et al. "Curiosity-driven Exploration by Self-Supervised Prediction." ICML 2017.
[6] Bard et al. "The Bitter Lesson for Robotics: Scaling is the Key." (DINO-WM) arXiv 2024.
[7] Ivashkov et al. "Sensorimotor World Models: Perception for Action via Inverse Dynamics." arXiv 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!