Future-KV是ForeWAM的核心机制。训练阶段,视频分支接收演示的未来潜在表征序列,通过流匹配目标学会预测未来潜在特征的演变,让中间层状态携带丰富时序信息。推理阶段,未来帧不可用,ForeWAM保留当前帧的干净视觉潜在表征放在序列第一位,用随机高斯噪声填充未来槽位,构造随机未来底物:整个序列通过一次视频分支预填充,产出动态寄存器状态D_θ和逐层键值缓存H_KV。这个过程只跑一次前向传播,不涉及迭代去噪。动作模块在每一步去噪时,把自己的查询向量与缓存的视频键值拼接做注意力计算,从而“瞟一眼”视频骨干基于当前画面和随机未来槽位形成的隐式动态表征。图2:动态条件化的动作DiT。训练阶段,演示的未来帧监督视频流匹配目标,冻结的潜在动作编码器提供LaWM目标。推理阶段,未来帧和教师路径均不存在:保留当前潜在表征,未来槽位用噪声初始化,一次视频预填充产出逐层K/V缓存,供动作去噪过程读取。有人会问:未来槽位放纯噪声,视频分支真能提取有效信息吗?答案藏在训练方式和注意力路由里。训练时视频分支见过大量“真实未来”数据,学到视觉动态演变模式。推理时虽然未来槽位是噪声,但通过训练好的注意力机制,这些噪声槽位在深层网络里会被“修正”为包含当前上下文条件的隐式特征。论文采用的视频骨干是参数量仅1.3B的Wan2.1-T2V-1.3B Video DiT,整个ForeWAM策略参数量约2B,对比Fast-WAM的约6B少了三分之二,且未做任何具身机器人数据预训练。最终推理策略保持直接策略形式:动作只依赖于当前观测o、语言指令l、本体感受状态p、动态寄存器D_θ和KV缓存H_KV,其中后两者都由当前观测、语言、状态和随机噪声决定:这里面没有任何地面真值未来的影子,也没有解码出来的一帧视频。随机未来槽位只是内部的条件化底物,其价值是通过联合视频-动作目标学出来的。
实验主要在LIBERO基准的四个标准套件(Spatial、Object、Goal、Long)上进行,每个任务跑50次rollout统计成功率。LIBERO是机器人操作领域应用最广的仿真基准之一。表1:标准LIBERO套件上的成功率(%)。ForeWAM和ForeWAM-Flash在不使用具身预训练的前提下,分别取得96.7%和96.9%的平均成功率,与使用6B参数的Fast-WAM(97.6%)差距很小。ForeWAM在标准LIBERO上平均成功率为96.7%,加速版ForeWAM-Flash反而略高(96.9%)。和Fast-WAM相比,两个变体分别低0.9和0.7个百分点。考虑到ForeWAM参数量只有2B(对比Fast-WAM的6B),且未做任何具身预训练,这个差距完全可接受。在Object套件上ForeWAM反而超过Fast-WAM(97.2% vs 97.0%)。表2:七个LIBERO-Plus扰动类别上的观测成功率(%)。LIBERO-Plus在原始任务上增加了七类扰动:相机视角、机器人初始状态、语言指令、光照、背景纹理、传感器噪声和物体布局。ForeWAM在总体成功率上比Fast-WAM高10.1个百分点。真正拉开差距的是在LIBERO-Plus上的表现。LIBERO-Plus是对原始LIBERO任务沿七个维度施加扰动的鲁棒性测试集。表2显示ForeWAM总体成功率达到61.6%,比Fast-WAM的51.5%高出10.1个百分点。最夸张的是相机视角扰动这一项,ForeWAM拿下62.5%,而Fast-WAM只有16.4%,差距高达46.1个百分点。传感器噪声扰动下也领先21.1个百分点(58.8% vs 37.7%)。不过也得客观看待:在机器人初始状态扰动和光照扰动上,ForeWAM分别比Fast-WAM低7.1和4.1个百分点。这说明Future-KV带来的鲁棒性增益并不均匀——它对视觉相关扰动(相机、噪声)的改善尤其显著,但对状态配置类扰动的泛化能力反而偏弱。一个可能解释是,未来槽位的隐式预测主要编码视觉动态,当机器人初始状态改变导致动作分布发生根本性变化时,仅靠视觉层面的预测上下文不足以覆盖这种偏移。论文还进一步用OneDP(One-step Distillation of diffusion Policies)把动作去噪从10步压缩到2步,得到ForeWAM-Flash加速变体。表3给出了单次动作生成的推理延迟对比:表3:单次动作生成推理延迟。Fast-WAM为667毫秒,ForeWAM为568毫秒(降低14.8%),ForeWAM-Flash为220毫秒(相比Fast-WAM降低67.0%)。Fast-WAM的10步去噪延迟是667毫秒,ForeWAM把延迟拉低到568毫秒(减少14.8%),而ForeWAM-Flash更是压到了220毫秒——比Fast-WAM缩小了整整67%。对一个需要实时响应的机器人控制器来说,这项提升意义不亚于精度数字。消融实验方面,表4比较了三种覆盖范围匹配的配置。只使用Future-KV的配置(58.5%)和只使用潜在动作监督的配置(58.0%)各自都比完整版(61.6%)低约3个百分点,证明两个路径是互补的——Future-KV提供分布式的视觉上下文,动态寄存器则提供紧凑的动作导向动态摘要,两者缺一不可。作为参考,两者都不用的基础策略在不同覆盖范围下取得了53.6%的成绩。表4:LIBERO-Plus消融实验的总体观测成功率(%)。完整版ForeWAM为61.6%,仅使用Future-KV为58.5%,仅使用潜在动作监督为58.0%,基础策略为53.6%。从实验设计角度评价,标准LIBERO上的对比覆盖了OpenVLA、π0、π0.5、π0-Fast、UniVLA、WorldVLA、Fast-WAM这些主流方法,包含7B参数的大模型和有具身预训练的强基线,对比阵容很扎实。需要留意的是,表格中Fast-WAM的数据引用的论文报告值,并非在同一代码库下复现的;LIBERO-Plus的扰动拆解比标准测试更能体现方法的鲁棒性,但这份数据也只是“观测到的成功率”,不是严格覆盖匹配的因果估计。论文在方法部分也坦诚地指出了这一点。
[1] ForeSight without Seeing: Latent Futures for World Action Models, arXiv:2608.11605v1[2] Yuan et al., Fast-WAM: Direct-policy World Action Models, 2026b[3] Chen et al., LaWM: Latent World Action Models, 2026a[4] Black et al., π0: A Vision-Language-Action Flow Model for General Robot Control, arXiv:2410.24164[5] Kim et al., OpenVLA: An Open-Source Vision-Language-Action Model, 2024[6] Liu et al., LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning, NeurIPS 2023[7] Fei et al., LIBERO-Plus: Robustness Evaluation for Robot Manipulation, 2025[8] Wang et al., OneDP: One-step Distillation of Diffusion Policies, 2024[9] Lipman et al., Flow Matching for Generative Modeling, ICLR 2022