← 返回 PaperDaily 视觉与图像

上交大等提出ForeWAM:机器人不生成视频也能“预见”未来,成功率96.7%

机器人操作正从“看一步动一步”走向“预见式决策”,但生成未来视频开销太大。上海交大等团队提出的ForeWAM,用一次KV预填充让动作模型“脑补”动态未来,不生成视频、不用未来观测,LIBERO成功率96.7%,动作延迟比Fast-WAM降67%。这篇论文值得细读。

上交大等提出ForeWAM:机器人不生成视频也能“预见”未来,成功率96.7%
原论文信息如下:
论文标题:
FORESIGHT WITHOUT SEEING: LATENT FUTURES FOR WORLD ACTION MODELS
发表日期:
2026年08月
发表单位:
上海交通大学、ACE Robotics、南洋理工大学
原文链接:
https://arxiv.org/pdf/2608.11605v1.pdf
机器人操作中,大脑能否预判物理世界的演变?人类伸手拿杯时无意识预演,而机器人要做到这点极难。传统做法是让机器人先“脑补”未来帧再决策,但生成视频极其昂贵。ForeWAM的核心答案是:不生成视频,也能拥有“预见”能力。
上海交通大学、ACE Robotics 与南洋理工大学合作提出 ForeWAM——一个“不生成视频也能预见未来”的世界行动模型(WAM)。它在 LIBERO 基准上拿下 96.7% 的平均成功率,在鲁棒性更强的 LIBERO-Plus 上达到 61.6%,比同类型方法 Fast-WAM 高出 10.1 个百分点,而动作生成延迟反而降低了 67%,参数量只有后者的三分之一。

机器人如何“预见”未来?不生成视频也能预测动作的新范式

图1:世界行动模型范式对比
世界行动模型范式对比。(a) 级联式WAM先生成未来观测,再基于此预测动作;(b) 联合式WAM在统一生成过程中同时生成未来观测和动作;(c) 直接策略WAM在推理时跳过未来展开,基于当前观测提取的隐式世界表征预测动作;(d) ForeWAM保留直接动作预测,同时通过隐藏的未来槽位K/V状态和动态寄存器暴露与动作相关的预测性动态。
近年来,视觉-语言-动作模型(VLA)成为机器人操作主流方案,但未显式建模物理世界演变。世界行动模型(WAM)则把“未来视觉预测”和“动作生成”耦合,让策略学会感知交互引发的场景动态。目前主流WAM设计可分为级联式、联合式和直接策略式等范式。
级联式WAM先预测未来帧再喂给动作模型,但视频扩散模型迭代去噪开销大,且生成误差会传导。联合式WAM把未来帧和动作放在同一生成过程,同样避免不了高开销。直接策略式WAM(如Fast-WAM)在推理时跳过未来视频生成,直接从当前观测提取隐式表征预测动作,效率高但动作DiT缺少显式接口访问“预测性动态”。
正是这个关键接口问题构成ForeWAM的出发点。直接策略的推理公式是基于当前观测o、语言指令l和本体感受状态p预测动作块的条件概率:
p_theta(a_1:H | o, l, p)
显式未来WAM则额外引入未来视觉轨迹的积分项:
p(a_1:H | o, l, p) = ∫ p_φ(u_1:T | o, l, p) p_θ(a_1:H | o, l, p, u_1:T) du_1:T
ForeWAM的回答是:保留直接策略的推理结构,但把显式未来观测生成替换成隐式接口——用视频骨干网络对“当前干净视觉潜在表征 + 随机噪声初始化的未来槽位”做一次预填充,缓存分层键值状态(K/V状态),供动作DiT在去噪过程中反复读取。这样动作通路能访问预测性上下文,同时免除迭代式未来视频生成。
打个比方:传统WAM是在大脑里先放完“未来剧集”再决定动作,而ForeWAM只用一帧静态截图加随机噪声跑一次前向,就能把“剧透”压缩成缓存特征,动作模块边推理边查这份“剧透笔记”。KV缓存是Transformer加速计算的标准技术,预填充则指正式生成前对输入序列执行一次完整前向传播,缓存中间层键值。ForeWAM巧妙地把预填充对象从文本序列扩展到“当前帧+随机未来槽位”组合。
基于此,论文还设计了动态寄存器(Dynamics Registers)机制,引导模型关注交互引起的场景变化。这两个机制的配合,构成ForeWAM完整的方法体系。

Future-KV:一次预填充,全程复用——预测性上下文的高效传递

Future-KV是ForeWAM的核心机制。训练阶段,视频分支接收演示的未来潜在表征序列,通过流匹配目标学会预测未来潜在特征的演变,让中间层状态携带丰富时序信息。推理阶段,未来帧不可用,ForeWAM保留当前帧的干净视觉潜在表征放在序列第一位,用随机高斯噪声填充未来槽位,构造随机未来底物:
(D_θ, H_KV) = KVPrefill_φ(z̃_1:T^Fsub, l, p)
整个序列通过一次视频分支预填充,产出动态寄存器状态D_θ和逐层键值缓存H_KV。这个过程只跑一次前向传播,不涉及迭代去噪。动作模块在每一步去噪时,把自己的查询向量与缓存的视频键值拼接做注意力计算,从而“瞟一眼”视频骨干基于当前画面和随机未来槽位形成的隐式动态表征。
图2:动态条件化的动作DiT
图2:动态条件化的动作DiT。训练阶段,演示的未来帧监督视频流匹配目标,冻结的潜在动作编码器提供LaWM目标。推理阶段,未来帧和教师路径均不存在:保留当前潜在表征,未来槽位用噪声初始化,一次视频预填充产出逐层K/V缓存,供动作去噪过程读取。
有人会问:未来槽位放纯噪声,视频分支真能提取有效信息吗?答案藏在训练方式和注意力路由里。训练时视频分支见过大量“真实未来”数据,学到视觉动态演变模式。推理时虽然未来槽位是噪声,但通过训练好的注意力机制,这些噪声槽位在深层网络里会被“修正”为包含当前上下文条件的隐式特征。论文采用的视频骨干是参数量仅1.3B的Wan2.1-T2V-1.3B Video DiT,整个ForeWAM策略参数量约2B,对比Fast-WAM的约6B少了三分之二,且未做任何具身机器人数据预训练。
最终推理策略保持直接策略形式:动作只依赖于当前观测o、语言指令l、本体感受状态p、动态寄存器D_θ和KV缓存H_KV,其中后两者都由当前观测、语言、状态和随机噪声决定:
p_θ(a_1:H | o, l, p, D_θ(o,l,p,ε_F), H_KV(o,l,p,ε_F))
这里面没有任何地面真值未来的影子,也没有解码出来的一帧视频。随机未来槽位只是内部的条件化底物,其价值是通过联合视频-动作目标学出来的。

动态寄存器:让模型真正关注“交互引起的场景变化”

有了Future-KV提供分布式预测上下文,ForeWAM还需解决另一个问题:视频生成的通用目标不天然保证“交互引起的动态”被优先编码。为此论文设计了一组较少的动态寄存器(Dynamics Registers),它们是视频骨干中额外加入的一组可学习token。在注意力掩码上,这些寄存器可聚合来自当前帧和未来槽位的信息,形成紧凑的“动态摘要”。
图3:结构化掩码路由
图3:结构化掩码路由:当前帧令牌C、动态寄存器D、未来槽位令牌F和动作令牌A之间的注意力关系。未来槽位令牌可以整合当前帧和动态寄存器的信息,动作令牌可以读取完整的视频序列和寄存器信息。
寄存器如何学会“什么是真正重要的动态”?这里引入第二个关键机制——潜在动作教师(latent action teacher)监督。这个教师来自LaWM(Latent World Action Model),一个在大规模机器人数据上训练出的逆动力学模型。给定变换前后的真实视觉观测,它提取出紧凑的、不可直接执行的潜在动作表征z_LA,描述“视觉上发生了什么变化”。
训练时,动态寄存器的平均池化结果经过可训练投影头g_ψ,被拉向冻结教师输出的潜在动作目标z_LA。损失函数是L2距离,教师目标做停止梯度处理:
L_LA = || g_ψ(1/N_D Σ D_i) - sg(z_LA) ||₂²
关键细节是:教师和未来观测只在训练阶段介入,部署时完全不需要。ForeWAM只是从教师那里“学”到如何用紧凑的寄存器表征描述交互引起的状态转移,真正上场时教师已功成身退。
整体训练目标由三项构成:视频流匹配损失L_video、动作流匹配损失L_action、潜在动作蒸馏损失L_LA。三者加权合计:
L = L_video + L_action + λ_LA L_LA
流匹配(Flow Matching)是一种生成模型训练范式。给定目标y,先随机采样噪声ε和时间t,构造带噪样本y_t = (1-t)·y + t·ε,让模型预测速度场ε - y。流匹配损失形式为:
L_FM(y) = E[|| f_θ(y_t, t, o, l, p) - (ε - y) ||₂²]
其中f_θ是模型输出的预测速度。对于视频分支,目标y是演示未来潜在表征;对于动作分支,目标y是演示的可执行动作块。在端到端配置中,动作目标产生的梯度可回流到视频到动作的K/V接口中,让动作学习反向影响视频骨干如何编码预测性上下文。

实验结果:效率与性能的双重突破

实验主要在LIBERO基准的四个标准套件(Spatial、Object、Goal、Long)上进行,每个任务跑50次rollout统计成功率。LIBERO是机器人操作领域应用最广的仿真基准之一。
表1:标准LIBERO套件上的成功率(%),每任务50次rollout评估
表1:标准LIBERO套件上的成功率(%)。ForeWAM和ForeWAM-Flash在不使用具身预训练的前提下,分别取得96.7%和96.9%的平均成功率,与使用6B参数的Fast-WAM(97.6%)差距很小。
ForeWAM在标准LIBERO上平均成功率为96.7%,加速版ForeWAM-Flash反而略高(96.9%)。和Fast-WAM相比,两个变体分别低0.9和0.7个百分点。考虑到ForeWAM参数量只有2B(对比Fast-WAM的6B),且未做任何具身预训练,这个差距完全可接受。在Object套件上ForeWAM反而超过Fast-WAM(97.2% vs 97.0%)。
表2:七个LIBERO-Plus扰动类别上的观测成功率(%)
表2:七个LIBERO-Plus扰动类别上的观测成功率(%)。LIBERO-Plus在原始任务上增加了七类扰动:相机视角、机器人初始状态、语言指令、光照、背景纹理、传感器噪声和物体布局。ForeWAM在总体成功率上比Fast-WAM高10.1个百分点。
真正拉开差距的是在LIBERO-Plus上的表现。LIBERO-Plus是对原始LIBERO任务沿七个维度施加扰动的鲁棒性测试集。表2显示ForeWAM总体成功率达到61.6%,比Fast-WAM的51.5%高出10.1个百分点。最夸张的是相机视角扰动这一项,ForeWAM拿下62.5%,而Fast-WAM只有16.4%,差距高达46.1个百分点。传感器噪声扰动下也领先21.1个百分点(58.8% vs 37.7%)。
不过也得客观看待:在机器人初始状态扰动和光照扰动上,ForeWAM分别比Fast-WAM低7.1和4.1个百分点。这说明Future-KV带来的鲁棒性增益并不均匀——它对视觉相关扰动(相机、噪声)的改善尤其显著,但对状态配置类扰动的泛化能力反而偏弱。一个可能解释是,未来槽位的隐式预测主要编码视觉动态,当机器人初始状态改变导致动作分布发生根本性变化时,仅靠视觉层面的预测上下文不足以覆盖这种偏移。
论文还进一步用OneDP(One-step Distillation of diffusion Policies)把动作去噪从10步压缩到2步,得到ForeWAM-Flash加速变体。表3给出了单次动作生成的推理延迟对比:
表3:单次动作生成推理延迟
表3:单次动作生成推理延迟。Fast-WAM为667毫秒,ForeWAM为568毫秒(降低14.8%),ForeWAM-Flash为220毫秒(相比Fast-WAM降低67.0%)。
Fast-WAM的10步去噪延迟是667毫秒,ForeWAM把延迟拉低到568毫秒(减少14.8%),而ForeWAM-Flash更是压到了220毫秒——比Fast-WAM缩小了整整67%。对一个需要实时响应的机器人控制器来说,这项提升意义不亚于精度数字。
消融实验方面,表4比较了三种覆盖范围匹配的配置。只使用Future-KV的配置(58.5%)和只使用潜在动作监督的配置(58.0%)各自都比完整版(61.6%)低约3个百分点,证明两个路径是互补的——Future-KV提供分布式的视觉上下文,动态寄存器则提供紧凑的动作导向动态摘要,两者缺一不可。作为参考,两者都不用的基础策略在不同覆盖范围下取得了53.6%的成绩。
表4:LIBERO-Plus消融实验的总体观测成功率(%)
表4:LIBERO-Plus消融实验的总体观测成功率(%)。完整版ForeWAM为61.6%,仅使用Future-KV为58.5%,仅使用潜在动作监督为58.0%,基础策略为53.6%。
从实验设计角度评价,标准LIBERO上的对比覆盖了OpenVLA、π0、π0.5、π0-Fast、UniVLA、WorldVLA、Fast-WAM这些主流方法,包含7B参数的大模型和有具身预训练的强基线,对比阵容很扎实。需要留意的是,表格中Fast-WAM的数据引用的论文报告值,并非在同一代码库下复现的;LIBERO-Plus的扰动拆解比标准测试更能体现方法的鲁棒性,但这份数据也只是“观测到的成功率”,不是严格覆盖匹配的因果估计。论文在方法部分也坦诚地指出了这一点。
speechless

局限与展望:从LIBERO到真实世界的距离

客观地说,这项研究目前还集中在LIBERO仿真环境和LIBERO-Plus扰动集上,与真实世界的物理机器人部署仍有距离。LIBERO虽然覆盖了多种操作任务,但它的视觉保真度、物理引擎精度和真实机器人平台相比还是有差距。论文也明确承认:不同机器人形态、更复杂的任务分布、真实世界的部署场景,ForeWAM的泛化能力尚未得到验证。
从技术方向上看,ForeWAM的核心贡献在于把“隐式未来接口”和“动态寄存器”两个模块组合起来。论文没有过度声称某种单一机制是全能的——Future-KV负责分布式的上下文保留,动态寄存器负责动作导向的紧凑总结,两个路径互补使用效果最佳。这种“不把话说满”的风格在AI论文里并不常见,反而给人一种踏实感。
从产业角度看,“不生成视频也能预见未来”这个思路对机器人产品化的吸引力是巨大的。视频生成不仅在推理时开销大,还需要额外的视频解码和后处理流程;ForeWAM的方案把整个未来预测压缩成一次KV预填充,动作生成延迟直接压到220毫秒级别。如果后续能在真实机器人上复现出LIBERO-Plus级别的鲁棒性优势,这个方向有着相当大的落地潜力。
当然,也有几个疑问值得后续研究关注。第一,当前评估是在仿真中进行的,真实世界的视觉噪声、物理不确定性和遮挡情况比LIBERO-Plus的扰动集更复杂,ForeWAM的隐式未来上下文能否在真机上继续发挥作用,还是一个开放问题。第二,动态寄存器从教师模型学到的“潜在动作表征”在概念上很优雅,但其可解释性如何——我们并不知道这些寄存器到底编码了什么,只能通过实验结果间接推断。第三,未来槽位初始化采用纯噪声,理论上可以大胆推测噪声尺度会影响预测质量,但论文没有展示相关敏感性分析。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?直接策略世界动作模型ForeWAM通过Future-KV和动态寄存器,为动作DiT提供预测性上下文,无需生成未来视频。在LIBERO上平均成功率96.7%,动作生成延迟最低降至220ms,比Fast-WAM降67%。
这篇工作最值得看的点是什么?在LIBERO标准套件上达到96.7%平均成功率(标准版)和96.9%(加速版),在LIBERO-Plus上达到61.6%成功率,比Fast-WAM高10.1个百分点;推理延迟比Fast-WAM降低14.8%,加速版降低67.0%;参数量仅为Fast-WAM的三分之一。
这篇工作的边界或风险在哪里?优点:(1) 提出Future-KV机制,在保持直接策略推理效率的同时为动作生成提供预测性上下文;(2) 动态寄存器配合潜在动作监督,有效编码交互引起的场景变化;(3) 无需具身预训练,参数量小,推理效率高;(4) 在LIBERO-Plus上展现出较强的鲁棒性。缺点:(1) 仅在LIBERO基准上验证,缺乏真实机器人实验;(2) 对机器人初始状态和光照扰动的鲁棒性提升有限;(3) 消融实验的覆盖范围不完全匹配,Base策略与组件消融的评估覆盖不同。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出ForeWAM,通过Future-KV机制在单次Video DiT预填充中生成层间键值状态作为预测性上下文,配合潜在动作监督的动态寄存器,使直接策略世界模型无需显式生成未来视频即可为动作生成提供预测性动力学上下文。

实验合理度:★★★★☆

任务成功率(50次rollout),动作生成推理延迟(毫秒)。

学术研究价值:★★★★☆

提出ForeWAM,通过Future-KV机制在单次Video DiT预填充中生成层间键值状态作为预测性上下文,配合潜在动作监督的动态寄存器,使直接策略世界模型无需显式生成未来视频即可为动作生成提供预。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

模型参数量2B(对比Fast-WAM的6B),推理延迟568ms(10步去噪),加速版ForeWAM-Flash延迟220ms(2步去噪)。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 仅在LIBERO基准上验证,缺乏真实机器人实验;

主要参考文献

[1] ForeSight without Seeing: Latent Futures for World Action Models, arXiv:2608.11605v1
[2] Yuan et al., Fast-WAM: Direct-policy World Action Models, 2026b
[3] Chen et al., LaWM: Latent World Action Models, 2026a
[4] Black et al., π0: A Vision-Language-Action Flow Model for General Robot Control, arXiv:2410.24164
[5] Kim et al., OpenVLA: An Open-Source Vision-Language-Action Model, 2024
[6] Liu et al., LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning, NeurIPS 2023
[7] Fei et al., LIBERO-Plus: Robustness Evaluation for Robot Manipulation, 2025
[8] Wang et al., OneDP: One-step Distillation of Diffusion Policies, 2024
[9] Lipman et al., Flow Matching for Generative Modeling, ICLR 2022

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
机器人不再需要“看”未来,也能把活干好?来龙哥读论文,解锁更多世界模型的打开姿势!扫描下方二维码或添加助手微信,备注格式见下,马上进群跟龙哥一起聊论文聊落地。
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球