← 返回 PaperDaily 视觉与图像

华中科大SimWAM:单目摄像头91.5 PDMS登顶NAVSIM,视频生成零开销!

视频生成模型在自动驾驶里一直是“吃钱大户”,训练花钱推理更花钱。华中科大这波操作骚气:让视频大模型只在训练时当“免费家教”,推理时直接扔了它,结果单目摄像头91.5 PDMS登顶NAVSIM,延迟还比别人低一大截😏 这便宜占得,值得好好看看。

华中科大SimWAM:单目摄像头91.5 PDMS登顶NAVSIM,视频生成零开销!
原论文信息如下:
论文标题:
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
发表日期:
2026年08月
发表单位:
华中科技大学(Huazhong University of Science & Technology)、东风汽车研发总院
原文链接:
https://arxiv.org/pdf/2608.07468v1.pdf
开源代码链接:
https://github.com/H-EmbodVis/SimWAM/
项目链接:
https://github.com/H-EmbodVis/SimWAM/
自动驾驶的端到端规划近两年卷得飞起,大方向已经从“感知-预测-规划”三件套,逐渐转向用一个统一的网络直接输出轨迹。但有个问题一直卡着:想让模型真正“理解”交通场景的动态演变,要不要真的把未来几帧画面先画出来?画出来吧,推理得排队等生成,延迟上去了;不画吧,又担心模型对场景演变的建模能力不够。今天这篇来自华中科技大学与东风汽车研发总院的SimWAM,给出的答案非常干脆:视频生成只当训练期的“家教”,上课时好好教动作专家关于交通动态的先验,推理时直接让它下课走人,一个轻量动作专家独挑大梁。

世界模型的新玩法:视频生成只当训练老师,推理时直接扔掉

先解释一下什么是“世界动作模型”。World-Action Model(世界动作模型,简称WAM),是近年来具身智能和自动驾驶领域的一个新趋势。核心思路是:既然视频生成模型已经很擅长预测“画面下一帧会发生什么”,那能不能把这个对未来场景的建模能力,直接用到动作预测上?比如DriveLaW、DriveWAM等工作,都采用了“先想象、再行动”(imagine-then-act)的范式——推理时先生成未来帧的潜表示,再让规划器基于这些未来帧来输出轨迹。
这条路的效果确实不错,但有个致命伤:把视频生成塞进了推理管线里。视频生成模型动辄几十亿参数,生成几帧画面的时间足够车辆跑出几十米了。实时规划根本等不起。Fast-WAM的一篇工作倒是发现了另一个事实:视频协同训练对动作预测的增益,主要来自训练阶段的表示学习,而不是测试阶段的“未来想象”。换句话说,未来帧生成本质上是在给动作专家“上课”,但考试的时候并不需要把上课的东西再背一遍。
SimWAM正是基于这个洞察来设计的。论文用一个预训练的视频扩散Transformer(Diffusion Transformer,简称DiT)作为“视频专家”,初始化自Wan2.2-5B视频生成模型;同时配一个轻量级DiT作为“动作专家”,两者通过联合流匹配(joint flow matching)共同训练。训练结束后,视频专家连同它的VAE解码器、T5文本编码器全部从推理流程中移除,只留下一个参数规模小得多的动作专家,直接从前视相机观测中输出轨迹。下图展示了SimWAM在NAVSIM上与其它世界模型规划器的PDMS和推理延迟对比,可以看到它在拿下了最高分的同时,延迟还压到了几乎最低的水平。
图1:SimWAM在NAVSIM上以显著更低的延迟取得了最佳PDMS,超越了基于世界模型的规划器。
SimWAM在NAVSIM上以显著更低的延迟取得了最佳PDMS,超越了基于世界模型的规划器。
把整个论文主体思路做个快速汇总,方便大家先建立整体框架。
*表格超出部分左右可以滑动 Table 1: Comparison with state-of-the-art planners on the NAVSIM navtest benchmark. C denotes camera and L denotes LiDAR. The best learned result in each column is shown in bold.
Table 1: Comparison with state-of-the-art planners on the NAVSIM navtest benchmark. C denotes camera and L denotes LiDAR. The best learned result in each column is shown in bold.

隔离注意力掩码:如何让动作预测与未来帧彻底解耦

那么这个“视频生成只当训练老师”的设定,具体是怎么实现的呢?关键设计是一张隔离注意力掩码(Isolated Attention Mask)。
先看看SimWAM的整体架构。如下图所示,视频专家和动作专家在联合训练阶段通过共享注意力流进行信息交互。当前帧观测的潜表示z(o_t)作为“共同课堂”,未来帧潜表示和动作轨迹token都在这里学习。隔离注意力掩码的规则很简单:未来帧token和动作token都可以关注当前观测z(o_t),但两者之间彼此不可见。也就是说,动作专家在预测轨迹时,只能“看到”当前观测,无法“偷看”任何未来帧的信息。
图2:SimWAM架构总览。联合训练阶段,视频与动作DiT通过MoT(Token混合机制)学习未来动态与轨迹生成;隔离注意力掩码将动作token限制在当前观测。推理与强化学习阶段仅保留动作DiT。
图2:SimWAM架构总览。联合训练阶段,视频与动作DiT通过MoT(Token混合机制)学习未来动态与轨迹生成;隔离注意力掩码将动作token限制在当前观测。推理与强化学习阶段仅保留动作DiT。
为什么这个掩码设计能成立?关键在于训练目标的优化方式。流匹配(flow matching)是一种生成模型训练范式,它的目标函数可以写成如下形式:
公式1:流匹配损失函数。其中x为干净目标,ε为高斯噪声,τ为插值时间步,v_θ为网络预测的速度场,c为条件。
公式1:流匹配损失函数。其中x为干净目标,ε为高斯噪声,τ为插值时间步,v_θ为网络预测的速度场,c为条件。
SimWAM把流匹配同时用在两个模态上:动作专家预测轨迹的速度场,视频专家预测未来帧潜空间的速度场。联合目标函数如下:
公式2:SimWAM联合训练目标,由动作轨迹流匹配损失与未来帧潜空间流匹配损失加权求和。λ为平衡系数,实验中设为1。
公式2:SimWAM联合训练目标,由动作轨迹流匹配损失与未来帧潜空间流匹配损失加权求和。λ为平衡系数,实验中设为1。
这里有个很关键的数学细节。传统WAM(如DriveLaW、DriveWAM)的条件轨迹分布可以写成边际化形式,即先对未来帧潜表示做积分再条件于它们预测动作:
公式3:传统世界动作模型的概率分解(先想象后行动)。轨迹分布需要先对未来场景潜表示积分,再将动作条件于未来帧。
公式3:传统世界动作模型的概率分解(先想象后行动)。轨迹分布需要先对未来场景潜表示积分,再将动作条件于未来帧。
而SimWAM直接绕过了这个积分,采用简洁的条件分布形式:
公式4:SimWAM的直接策略形式。轨迹分布只条件于当前观测的表示、自车状态和导航指令,不依赖任何未来帧。
公式4:SimWAM的直接策略形式。轨迹分布只条件于当前观测的表示、自车状态和导航指令,不依赖任何未来帧。
这意味着在训练完成后,视频专家完全可以被丢弃。动作专家已经通过共享注意力从当前观测表示中“吸收”了交通动态先验,推理时不再需要视频分支。从表2的组件分析可以看到,单独训练的动作专家只有86.6 PDMS,加上视频联合训练后直接飙升到90.3 PDMS,涨幅高达3.7个点,足见视频生成这个“家教”确实把硬知识教到位了。
表2:组件分析。Action-only为86.6 PDMS,加入视频联合训练后提升至90.3,再加RL后达到91.5。
表2:组件分析。Action-only为86.6 PDMS,加入视频联合训练后提升至90.3,再加RL后达到91.5。
论文还专门对比了三种注意力掩码模式。双向注意力(Bidirectional)和动作→视频注意力(Action→video)都会让动作预测依赖未来帧token,视频分支在推理时就扔不掉了。而隔离掩码虽然只让动作分支通过当前观测学习,却取得了三者中最高的PDMS(90.3),同时在无碰撞率和碰撞时间两项指标上也是最强的。这个实验结果说明:让动作分支直接看到视频token,在当前设定下并不能带来额外收益,反而把推理效率的坑给踩了。
表3:注意力掩码分析。隔离掩码取得最好的PDMS(90.3),同时实现与未来帧的解耦。
表3:注意力掩码分析。隔离掩码取得最好的PDMS(90.3),同时实现与未来帧的解耦。

强化学习加持:从模仿到超越,PDMS提升1.2个点

模仿学习只能让模型复现人类司机的行为,但人类行为本身并不总是最优的。为了进一步提升驾驶质量,SimWAM在联合训练之后引入了一个强化学习(Reinforcement Learning,简称RL)阶段,直接优化驾驶奖励。
但这里有个技术障碍:流匹配训练出来的生成器是一个确定性常微分方程(ODE)采样器。给定一个初始噪声,它只输出一条固定的轨迹,没法探索多种备选驾驶方案;而且ODE没有可解析的转移概率密度,策略梯度类算法根本无从用起。SimWAM的做法是借鉴Flow-GRPO的思路,把确定性的概率流ODE重写为保持同样边际分布的随机微分方程(SDE): 公式5:将确定性流ODE转化为保边际SDE。其中dw为维纳增量,a控制噪声尺度。每个欧拉-丸山步产生一个各向同性高斯转移,具有可解析的似然,可用于重要性采样。
公式5:将确定性流ODE转化为保边际SDE。其中dw为维纳增量,a控制噪声尺度。每个欧拉-丸山步产生一个各向同性高斯转移,具有可解析的似然,可用于重要性采样。
SDE转化后,每个采样步都成为一个可计算的高斯转移,策略梯度就能直接作用了。SimWAM采用GRPO(Group Relative Policy Optimization,分组相对策略优化)框架:每个场景采样8条候选轨迹,用NAVSIM的PDM奖励分别打分,再计算组内相对优势进行剪裁策略更新。奖励函数本身是组合式的,综合了无碰撞(NC)、可行驶区域合规(DAC)、自车进度(EP)、碰撞时间(TTC)和舒适度(C)五个子指标。PDMS的计算则是将前两个作为二元惩罚因子、后三个加权求和再相乘:
公式6:PDMS计算公式。NC和DAC为二元惩罚因子,EP、TTC、C为加权质量项。
公式6:PDMS计算公式。NC和DAC为二元惩罚因子,EP、TTC、C为加权质量项。
RL训练的细节值得一提。SimWAM没有在全部训练集上做强化学习,而是挑出了模仿学习阶段PDMS低于90的“硬场景”子集来做RL。下图展示了训练动态:在硬子集上训练(橙色曲线)始终优于在全量场景上训练(蓝色曲线),而且收敛速度更快。这个操作既节约了训练成本,又让RL集中火力解决真正困难的交通场景。
图3:RL训练动态。星号表示模仿学习检查点。在硬子集上训练始终优于在所有navtrain场景上训练。
图3:RL训练动态。星号表示模仿学习检查点。在硬子集上训练始终优于在所有navtrain场景上训练。
从表2的组件分析可以看到,在联合训练达到90.3 PDMS的基础上,加入RL后又提升到了91.5,继续涨了1.2个点。值得注意的是,RL在提高自车进度(EP从83.9到86.4)和可行驶区域合规(DAC从98.0到98.7)的同时,无碰撞率(NC)出现了轻微下降(98.7到98.4),这说明PDMS这个组合指标在“敢开”和“不出事”之间有着微妙的权衡。不过整体来看,RL确实让模型从纯粹的模仿行为中解放出来,学会了更积极地规划路线。下图的定性对比可以直观地看到这个变化:经过RL之后,自车在保持不驶出可行驶区域的前提下,能够在复杂场景中行进得更远。
图4:两个navtest场景中Ours-IL与Ours-RL的定性对比。红色椭圆标注了RL后自车在可行驶区域内行进得更远的区域。
图4:两个navtest场景中Ours-IL与Ours-RL的定性对比。红色椭圆标注了RL后自车在可行驶区域内行进得更远的区域。

灵活架构:视频专家随便换,动作专家随便扩

SimWAM这个“训练时双专家、推理时单专家”的设计,还带来一个意外的红利:架构解耦带来的高度灵活性。
视频专家和动作专家不共享任何参数,唯一的交互通道就是注意力流。这意味着视频专家换掉,动作专家完全不受影响。论文验证了四种不同的视频骨干:轻量级的LTX-Video只能到88.7 PDMS,Wan2.1-1.3B和Wan2.2-5B分别有90.2和90.3,而新出的Cosmos-Predict2.5因为在大规模驾驶视频上预训练过,提供了更强的驾驶相关动态先验,拿到了90.4 PDMS的最高成绩。这个结果说明,视频生成领域的进步可以直接“平移”到自动驾驶规划上——以后有更强的视频生成模型出来,往里一插就行,动作专家、训练目标、推理管线都不用动。
表4:视频骨干灵活性分析。不同视频生成模型都能提升动作专家性能,其中Cosmos-Predict2.5因为具备驾驶视频预训练先验而表现最佳。
表4:视频骨干灵活性分析。不同视频生成模型都能提升动作专家性能,其中Cosmos-Predict2.5因为具备驾驶视频预训练先验而表现最佳。
动作专家这边同样可以独立缩放。论文将动作DiT从0.21B扩展到0.45B再到1.02B,PDMS从89.9涨到90.1再到90.3。虽然涨幅不大,但重要的是:动作专家的容量调整完全不需要重新训练视频专家,两者是“即插即用”的关系。这给实际工程部署提供了两个独立的调节旋钮——训练时你可以用最大的视频模型来“教”,部署时再用一个满足延迟预算的紧凑动作专家来“跑”。
表5:动作专家缩放分析。动作DiT从0.21B扩展到1.02B,PDMS从89.9提升到90.3。
表5:动作专家缩放分析。动作DiT从0.21B扩展到1.02B,PDMS从89.9提升到90.3。

实验结果全面解读:91.5 PDMS登顶NAVSIM,零样本迁移nuScenes

主实验的含金量直接看NAVSIM navtest基准。SimWAM仅用单目前视摄像头就拿到了91.5 PDMS,把当前所有VLM基和世界模型基规划器都甩在了身后。注意对比表中SGDrive是91.1(多传感器融合)、ReCogDrive是90.8、ExploreVLA是90.4、DriveWAM是90.1,SimWAM只用1颗摄像头就赢了它们。与传统E2E规划器相比(UniAD 83.4、DiffusionDrive 88.1、SeerDrive 88.9),领先优势更是拉到了2.6个点以上。
表1:NAVSIM navtest基准上与最新规划器的对比。C表示摄像头,L表示激光雷达。SimWAM以91.5 PDMS在所有学习型规划器中排名第一。
表1:NAVSIM navtest基准上与最新规划器的对比。C表示摄像头,L表示激光雷达。SimWAM以91.5 PDMS在所有学习型规划器中排名第一。
零样本迁移的结果也相当扎实。SimWAM不做任何微调,直接搬到nuScenes数据集上做开放环路规划评估。从下面的表6可以看到,在平均L2误差(1.27米)和平均碰撞率(0.61%)两项指标上,SimWAM都大幅优于VAD-Base、GenAD、OccNet等此前的方法。
表6:nuScenes开放环路规划基准上的零样本泛化结果。SimWAM在无任何微调的情况下实现平均L2误差1.27米、平均碰撞率0.61%。
表6:nuScenes开放环路规划基准上的零样本泛化结果。SimWAM在无任何微调的情况下实现平均L2误差1.27米、平均碰撞率0.61%。
另外两组消融实验也值得关注。关于RL阶段探索采样器的选择,论文对比了SDE采样、Euler采样和DPM solver三种方式(表7),结果显示SDE采样的RL效果最佳。关于未来帧预测目标,预测未来8帧的统一噪声处理优于逐帧独立噪声(表8),这验证了时间一致性在视频预测中的重要性。
表7:探索采样器分析。SDE采样比Euler和DPM solver更适合RL阶段的轨迹探索。
表7:探索采样器分析。SDE采样比Euler和DPM solver更适合RL阶段的轨迹探索。
表8:未来视频目标分析。对8帧未来帧统一加噪处理比逐帧独立加噪效果更好,验证了时间一致性建模的重要性。
表8:未来视频目标分析。对8帧未来帧统一加噪处理比逐帧独立加噪效果更好,验证了时间一致性建模的重要性。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?SimWAM是一种端到端自动驾驶世界动作模型,将视频生成作为纯训练信号,通过隔离注意力掩码让动作预测与未来帧解耦,训练后可丢弃视频分支。仅用单目前视摄像头即达91.5 PDMS,超越现有世界模型规划器,并零样本泛化至nuScene
这篇工作最值得看的点是什么?SimWAM在NAVSIM上达到91.5 PDMS,超越所有对比方法,包括最强的VLM规划器SGDrive(91.1)和世界模型规划器DriveWAM(90.1),同时推理延迟显著低于其他世界模型方法。在nuScenes零样本迁移中取得最低平均碰撞率0.04%。
这篇工作的边界或风险在哪里?优点:1)架构简洁,视频分支训练后可完全移除,推理高效;2)视频专家可替换,动作专家可独立扩展;3)强化学习进一步优化驾驶质量。缺点:1)仅使用前视相机,未利用多视角信息;2)视频生成质量对性能有影响,轻量视频模型效果下降明显;3)RL训练需要额外的采样和奖励计算开销。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出SimWAM,将视频生成仅作为训练信号,通过隔离注意力掩码解耦动作专家与视频分支,训练后丢弃视频分支,仅保留轻量动作专家直接预测轨迹,并利用强化学习优化驾驶奖励。

实验合理度:★★★★☆

PDMS(预测驾驶模型分数),包含NC、DAC、EP、TTC、C五个子指标;nuScenes上使用L2误差和碰撞率

学术研究价值:★★★★☆

提出SimWAM,将视频生成仅作为训练信号,通过隔离注意力掩码解耦动作专家与视频分支,训练后丢弃视频分支,仅保留轻量动作专家直接预测轨迹,并利用强化学习优化驾驶奖励;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

推理延迟约518ms(A100 GPU,10步采样),视频分支在推理时完全移除

复现难度:★★★☆☆

https://github.com/H-EmbodVis/SimWAM/

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)仅使用前视相机,未利用多视角信息;2)视频生成质量对性能有影响,轻量视频模型效果下降明显;3)RL训练需要额外的采样和奖励计算开销。

主要参考文献

[1] Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai. SimWAM: A Simple World Action Model for End-to-End Autonomous Driving. arXiv:2608.07468, 2026.
[2] Daewood Kim, et al. NAVSIM: Data-driven non-reactive autonomous vehicle simulation and benchmarking. NeurIPS 2024 Datasets and Benchmarks.
[3] DriveWAM: Driving World-Action Models for Autonomous Driving. arXiv 2026.
[4] Flow-GRPO: Reinforcing Flow Generation Models via Group Relative Policy Optimization. 2025.
[5] SimWAM开源代码: https://github.com/H-EmbodVis/SimWAM/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
视频老师傅带出来的驾驶小徒弟,上车后居然不用带老师傅😏 想和龙哥一起追踪这类又省又强的自动驾驶新范式?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 自动驾驶+北京+华中科大+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。