← 返回 PaperDaily
大模型与智能体
潜世界模型“耳朵聋了”?ActSWM一招修复,Minecraft规划成功率飙升90%
潜世界模型能预测未来帧,却可能对动作指令“假装没听见”——这不是开玩笑,论文首次定义了这个叫“上下文坍塌”的致命缺陷。ActSWM只用两个干净约束(动作对比铰链损失+冻结读取器)就让Minecraft石料挖掘成功率从50%飙到95%,还能从GTA视频里反向恢复按键。问题实在、方案漂亮、实验扎实,值得所有做模型预测控制的朋友认真读一读。
龙哥读论文
发布于 2026-08-14 09:11:35
阅读 4
查看原文
原论文信息如下:
潜世界模型的“上下文坍塌”是什么?
这事儿说起来有点反直觉。想象你在《我的世界》里按“砍树”键,树干却纹丝不动——不是网络卡,而是游戏里的“未来预测器”罢工了。它看着眼前的树直接“脑补”出你发呆的未来,完全没搭理你的指令。这就是论文定义的上下文坍塌(Context Collapse) 。
技术上,潜世界模型(Latent World Model)是模型预测控制(MPC)的核心:编码器把高维图像压入潜空间,自回归预测器“想象”未来潜状态,最后搜索最优动作序列。但作者发现一个诡异故障:当上下文变长或多步展开训练后,预测准确度涨了,可无论输入什么动作序列(甚至全零),展开的潜状态几乎一模一样。预测器越来越会“看相”——靠视觉上下文猜未来,却完全不关心你接下来要做什么。 对规划器来说,这釜底抽薪:不同动作的潜未来无法区分,所有候选评分一样,规划退化为随机游走。
图1:ActSWM概览。潜世界模型可能遭受上下文坍塌——长时域展开虽匹配合理未来,但对动作输入失去敏感性。ActSWM通过强制动作敏感的潜展开来解决,获得更大动作间隙、更强闭环规划能力。
动作敏感性的双重约束:铰链损失+固定读取器
ActSWM的核心思想是让潜世界模型无论展开多少步,都保持对动作的敏感性。作者把“动作敏感性”拆成两个层面:
1. 展开层(Rollout-level):动作对比铰链损失 从同一上下文出发,分别用“真实动作序列”和“全零动作序列”展开,得到两组潜状态序列。计算两者余弦相似度,若超过阈值m(设为0.3)则扣分。损失函数为hinge loss:
这个损失强制模型在展开中保持动作的因果差异——即使用全零动作,也必须生成与真实动作不同的潜未来。模型必须能“听”到动作指令,而非仅凭视觉拍脑袋。
2. 单步层(Transition-level):固定动作读取器 作者加入一个随机初始化、参数冻结 的动作读取器 qφ0,输入相邻潜状态拼接 [zt, zt+1],输出对应动作。因为读取器不参与训练,它无法调整决策边界来适应潜空间变化。这样,如果不同动作能被同一读取器精确解码,那么它们的潜转移必然在空间上足够分开 。作者给出理论保证(附录E):假设读取器是L-Lipschitz的,且解码误差有界,则两个潜转移距离至少为 (||ai - aj|| - εi - εj)/L。冻住的读取器就像一个“不动裁判”,逼着潜空间自己长出区分度。
论文对比了联合训练读取器(Joint)和固定读取器(Ours)。联合训练虽把零动作相似度从0.97降到0.106,但真实动作预测准确度从0.972暴跌到0.698——模型为了讨好不断变化的读取器,牺牲了预测质量。而固定读取器既保持真实动作预测高质量(0.923),又把零动作相似度压到0.163,动作间隙(Action Gap)达0.760,是联合训练的1.3倍 。这证明了“冻住裁判”的绝对优势。
ActSWM架构:如何在潜空间中保持动作可区分?
把两个约束组合起来,得到ActSWM完整架构。以下图展示整体流程:
用一个例子推演。假设模型学习《我的世界》片段(离线轨迹 τ = {(ot, at)}Tt=1):
第一步:编码与预测。 视觉编码器 fθ 将输入图像映射为 zt。给定上下文长度H=32,模型编码过去32帧潜状态,用预测器 pθ 自回归预测,生成基于真实动作序列的展开序列 ˆzgtt+1:t+K(K为展开步长)。
第二步:计算预测损失。 将展开序列与编码器直接编码的真实未来潜状态 zt+k 做MSE,对应多步预测损失 Lpred。
第三步:构建对比展开。 从同样上下文出发,把所有未来动作替换为“全零”,再自回归展开得到 ˆz0t+1:t+K。
第四步:施加铰链损失。 在每个预测步长k上,计算 ˆzgtt+k 和 ˆz0t+k 的余弦相似度,超过阈值m则惩罚,即动作对比铰链损失 Lhinge。
第五步:冻结读取器解码。 对每一步单步转移——无论是编码器真实转移 uenct+k = [zt+k, zt+k+1] 还是预测转移 upredt+k = [ˆzgtt+k, ˆzgtt+k+1]——都喂入同一冻结读取器 qφ0,输出动作预测并计算MSE作为读取损失 Lreadout。读取器不更新参数,梯度只反向传播到编码器和预测器。
公式 (9):总损失函数。Lsig 为SigReg稳定损失(从LeWM借鉴),用于稳定预测空间特征尺度和分布。
整个机制构成“双保险”:铰链损失保证多步展开的宏观可区分性,冻结读取器保证每一步转移的微观可恢复性。 两者缺一不可,共同抑制上下文坍塌。
实验验证:Minecraft规划成功率提升90%
作者在MineStudio基准上跑了三个开放世界任务:放置火把、挖掘石头、建造石柱,分别代表短时交互、持续控制和顺序动作规划。结果非常炸裂。
图4:成功率对比。ActSWM(橙色)在三个任务上都碾压了基线LeWM(蓝色)。
具体数据:放置火把任务中,ActSWM成功率为1.00,LeWM为0.95;挖掘石头任务中,ActSWM为0.95,LeWM仅0.50,成功率提升90% ;建造石柱任务中,ActSWM为0.85,LeWM为0.55,提升54.5%。
表:ActSWM在需要长时间动作序列的任务上提升尤为显著。
龙哥分析:插火把只需简单放置,预测器不敏感也能蒙对;但挖掘和建造需要持续精确动作序列,若潜未来对不同动作不敏感,规划器无法分辨“挖矿”和“发呆”。动作敏感性在长时域任务中的价值被直接量化了。
跨游戏动作恢复:从视频中找回控制信号
如果说Minecraft规划测试的是“向前看”,那么跨游戏动作恢复测试的是“逆向推导”。作者用硬核设定:只给模型一对上下文和目标帧,让模型用交叉熵方法(CEM)搜索动作序列,使展开后的潜状态尽可能接近目标帧编码。
测试域包括三个完全不同游戏:反恐精英2(CS)、侠盗猎车手V(GTA)、Apex英雄(Apex) 。视觉风格、运动模式和交互节奏天差地别,直接检验动作表示的通用性。
关键评价指标:动作间隙(CEM恢复成本与随机搜索成本差值)、全键准确率(14个按键二进制预测)、活跃准确率(仅人类实际按键时计算召回率)。全键准确率可能被“总是预测不按键”拉高,活跃准确率则要求真正抓到被按下的键。
表1:跨游戏局部动作恢复结果。Gap代表CEM优于随机搜索的幅度,值越大代表模型动作可导向性越强。
结果震撼。在GTA和Apex上,ActSWM的动作间隙分别达252.38和172.01,比LeWM提升约12~16.5倍 。规划器能清晰“看出”如何动作到达目标状态。活跃准确率方面,GTA域ActSWM达0.761,LeWM仅0.050。基线D2E G-IDM全键准确率0.709,但活跃准确率为0.000——说明它完全在瞎蒙“没按键”这个多数类。
这再次证明:对未来状态的匹配准确率,不能等同于可规划性。 大多数事件(如保持静止)易被猜中,真正有价值的是模型能否捕捉稀有的、驱动状态变化的动作。ActSWM的固定读取器不仅让潜空间记住“发生了改变”,还强迫它记住“是什么动作改变了一切”。
总结与展望
ActSWM带来一个干净认知升级:潜世界模型的规划能力,不在于精准“猜对”未来,而在于为不同动作构建可区分 的未来。上下文坍塌的发现精准戳中当前潜动力学模型在长时域规划中的软肋。“动作对比铰链损失+固定动作读取器”这套组合拳极其轻量,计算开销几乎为零。
第一,对数据质量的依赖性。 VPT数据集动作序列相对密集。若数据长尾严重(如90%“静止”),固定读取器是否仍有效?动作多样性不足时,强制区分可能引入伪差异。
第二,CEM搜索的耗时。 潜空间推理虽快,但CEM在跨游戏动作恢复中需反复调用模型展开,实时推理场景可能成为瓶颈。
第三,对离散动作空间的适配。 论文处理二进制按键,属高维离散控制。固定读取器能否扩展到连续控制信号(如关节扭矩),需进一步验证。
尽管如此,ActSWM是龙哥今年在潜世界模型方向看到最具实用价值和理论洞察的工作之一。它启发我们:评估规划模型时,不要只看预测准不准,还要看它能不能敏锐地“听”懂你的控制指令。
龙迷三问
问:JEPA是什么意思?和传统世界模型有什么区别? JEPA是联合嵌入预测架构(Joint-Embedding Predictive Architecture)的缩写,由Meta的LeCun团队提出。传统世界模型(如Dreamer)需解码回像素空间计算像素级损失,计算量大。JEPA只在潜空间预测和比较,无需重建原始图像,效率和抽象能力更高。ActSWM基于JEPA思想,学习轻量级可规划潜动力学模型(LeWM为基线)。
问:CEM(交叉熵方法)具体怎么工作? CEM是一种优化算法,用于搜索最优动作序列。例如在《我的世界》挖石头:第一步随机采样一堆候选动作序列(如“向左走+挥镐”、“原地跳+挥镐”等),用世界模型展开并计算与目标状态的距离,选距离最近的前10%作为“精英”样本。第二步基于精英样本的动作分布(均值和方差)重新采样,重复若干次。最终动作分布均值作为最优解输出。ActSWM因潜空间对不同动作更敏感,CEM能找到距离目标更近的序列。
问:固定动作读取器为什么需要L-Lipschitz?实际中怎么保证? Lipschitz连续性保证函数输出变化不超过输入变化的L倍。公式(3)利用Lipschitz性质从解码误差反推潜转移距离下界。实际实现中,论文随机初始化一个简单MLP作为读取器,用较小参数规模确保平滑性。固定参数后,读取器天然具有确定的Lipschitz上界,无需显式约束。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
发现并命名“上下文坍塌”新故障模式,提出固定读取器巧妙解法,洞察深刻,但核心组件均为已有技术改进组合。
实验合理度: ★★★★★
实验设计扎实,从离线诊断到闭环规划到跨域动作恢复三位一体;对比基线得当,消融充分,结果清晰有说服力。
学术研究价值: ★★★★★
定义广泛存在但被忽略的关键问题,为潜世界模型规划提供新评价维度和优化方向,理论启发性高。
稳定性: ★★★✰✰
开放世界游戏中表现良好,但尚未验证在高噪音、部分可观测或动作严重长尾分布环境中的鲁棒性。
适应性以及泛化能力: ★★★★✰
跨三个不同游戏的动作恢复实验展示强域内泛化能力,但尚未验证在连续控制域(机器人)或多智能体系统中的表现。
硬件需求及成本: ★★★★✰
固定读取器额外计算和存储开销几乎为零,整体模型轻量,训练高效。但CEM在动作恢复阶段可能需要数百次模型推断。
复现难度: ★★★✰✰
方法和框架描述清楚,但未提供开源代码,且涉及Minecraft/MineStudio等特定游戏环境和VPT数据集,环境搭建和数据预处理有门槛。
产品化成熟度: ★★✰✰✰
学术探索概念验证阶段,距离可直接用于游戏AI产品的稳定实时推理尚有距离,跨域依赖微调。
可能的问题: 铰链损失中全零动作作为单一对比项可能不够全面;在动作空间极大或极稀疏时效果未验证;CEM收敛性在不同游戏间差异较大,可能不够稳定。
主要参考文献
[1] Baker, B., Akkaya, I., Zhokov, P., et al. Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos. NeurIPS 2022.
[2] Maes, F., et al. LeWorldModel: Lightweight Plannable Latent Dynamics from Pixels. 2026.
[3] Assran, M., Duval, Q., Misra, I., et al. Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture. CVPR 2023.
[4] Hafner, D., Pasukonis, J., Ba, J., and Lillicrap, T. Mastering Diverse Domains through World Models. 2024.
[5] Ivashkov, P., Balestriero, R., and Schölkopf, B. Sensorimotor World Models: Perception for Action via Inverse Dynamics. 2026.
[6] de Boer, P.-T., Kroese, D. P., Mannor, S., and Rubinstein, R. Y. A tutorial on the cross-entropy method. Annals of Operations Research.
[7] Han, Y., and Yilmaz, A. Enhancing Policy Learning with World-Action Model. 2026.
[8] Cai, S., Mu, Z., He, K., et al. MineStudio: A Streamlined Package for Minecraft AI Agent Development. 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!