← 返回 PaperDaily
视觉与图像
清华AIR最新研究:视频扩散模型做规划不用跑完,170ms就够?
视频扩散模型做驾驶规划,一定要把未来视频全部生成完吗?清华AIR这篇工作给出了否定的答案:中间层特征已经足够解码出好轨迹。它给六个中间层装上"提前出口",配一个轻量质量打分器,分数够了就立刻刹车返回,平均端到端延迟只有170毫秒,比全深度规划省下47%的时间,数值还更高。把视频生成的成本巧妙避开了,这个思路在同类工作里相当眼前一亮。
龙哥读论文
发布于 2026-08-15 00:20:01
阅读 3
查看原文
原论文信息如下:
视频扩散模型做规划,真的需要跑完整个生成过程吗?
"世界动作模型"(WAM)在自动驾驶圈已不新鲜:用大规模视频扩散模型学习驾驶时空先验,再解码成自车轨迹。这类方法在预测和控制间建起桥梁,但部署时系统只需一条轨迹,却要跑完整个"未来视频生成"流程——迭代去噪、无分类器引导、视频解码,全套在A100上要13.22秒。时速60公里的车,13秒已开出216米,这显然不是量产车能接受的数字。
于是清华AIR的研究者问了一个更本质的问题:想让视频扩散模型做出可靠的驾驶决策,到底需要跑完模型的多少部分?答案相当反直觉——完全不用跑完。论文把问题拆成两个常被混为一谈的维度:视频扩散的时间步(决定噪声水平)和DiT的深度(决定评估多少Transformer块)。结果发现,在NAVSIM测试的五个视频时间步下,固定层输出的分数变化最多只有0.15分;而不同深度出口的动作质量差异却非常显著。更关键的是,最好的中间层出口比跑完全部30层的最终出口分数还高。
既然如此,为什么要为一条轨迹去生成一整段视频?能不能把"跑多深"的决定权交给规划质量本身?这正是Adaptive-WAM的核心出发点:放弃固定计算路径,按需分配骨干深度。
问题背景及相关工作
在正式介绍Adaptive-WAM之前,先把周围风景看清。驾驶视频生成与仿真这一支,GAIA-1用自回归方式建模离散视觉token,MagicDrive、DriveDreamer等方法把结构化几何或控制信号注入扩散模型,VISTA和MiLA提升了可控性和长时一致性。这些工作确立了视频预测作为时空先验来源的价值,但部署路径几乎都绕不开像素级生成。
世界动作模型这条线更贴近本文坐标。LAW学了一个潜在动力学模型做端到端驾驶,DrivingWorld用视频中心表征做预训练,PWM联合预测未来状态和动作。更新的WAM直接把视觉预测和控制耦合起来:DrivingGPT、Epona、VaViM等用自回归或并行推理流同时建模未来观测与动作;DriveLaW用视频模型特征去条件化动作扩散器;DriveVA在同一个潜在空间里联合去噪视频和动作。这些方法在"预测和动作怎么耦合"上各有答案,但部署时的骨干计算路径都是事先定死的——要么跟未来视频生成绑在一起,要么固定走某条深度路径。
高效视频表征和自适应推理是另一块拼图。机器人控制里的DiT4DiT用中间视频DiT特征去条件化动作扩散器,Fast-WAM保留未来视频监督但部署时跳过显式想象,DriveLaW也用早期去噪视频表征做轨迹规划而无需VAE解码。它们的共同洞察是:预测性视频表征可以支撑动作生成,不必渲染未来观测。但是,它们仍然依赖固定的表征接口或预定计算路径。
早退网络(Early-Exit)的做法也很值得参考。BranchyNet和MSDNet在中间层挂预测头,根据置信度改变执行深度。但这些标准是为单标签分类设计的,没有直接处理扩散式轨迹生成、高度饱和且频繁平局的规划奖励,也缺乏轨迹质量验证机制。Adaptive-WAM把这两拨思路焊在了一起:在同一个视频DiT上挂多个轨迹出口,用预测的规划质量来决定是否继续向下走。
研究目标:分离视频噪声与骨干深度
论文做了非常干净的控制实验,把视频扩散时间步和DiT深度这两个经常被混在一起的变量分开来看。在NAVSIM v1上,用完全相同的固定出口单轨迹读取方式,测试对视频噪声水平和DiT深度的敏感性。
先看视频时间步。在第15个块上,五个采样索引{1, 9, 17, 25, 32}产生了{86.44, 86.56, 86.57, 86.55, 86.50}的模仿学习分数,极差只有0.13。换到第18个块,对应分数是{84.02, 84.14, 83.99, 84.12, 84.01},极差0.15。结论很干脆:规划性能对测试的五个视频噪声水平基本不敏感。于是论文固定住索引17,专注研究深度。
再来看表1的逐层规划质量。第15块在模仿学习和强化学习两个阶段都是最强固定出口,强化学习让六个出口普遍涨了4到5分。单条轨迹模式下,第15块从模仿学习的86.56涨到90.62,相当可观。但要注意,第18、22、30块的表现都不如第15块,说明"中间层最强"不是个例,而是有结构的现象。
表1:层间规划质量(同一调度与验证集最优选择,十个随机种子)
*表格超出部分左右可以滑动
Table 1: Layer-wise planning quality with identical schedules and validation-best selection over ten seeds.
但"第15块最好"不等于"其他出口都没用"。图2展示了强化学习后高质量场景集合的Jaccard重叠度。第9块和第15块的重叠最大,达到0.82;而早期与晚期出口对的重叠最低掉到0.69。这个数字说明不同深度解决的场景集合有相当大的交集,但远不完全重合。换句话说,浅层出口在相当一部分场景里已经够强,而深层出口还能补救一些浅层解决不了的场景。
图3把全局平均掩盖的信息挖得更深。第15块对第30块的优势最大:RL前有554.8个场景、RL后有598.6个场景出现至少50分的优势。但反向计数也不是零——RL前412.0个、RL后422.4个场景,第30块反而赢了第15块。这说明全局最强的固定出口并非逐场景最优。
这个发现直接把问题的答案推向了另一个维度:不选"哪一层最好",而是让每个输入自己决定"该跑多深"。
中间层特征已足够:从实验发现到自适应推理设计
实验已经证明"中间层特征足以支撑轨迹解码",但如何把这一观察变成可落地的系统?论文给出的方案是:把六个中间层出口都保留,每条输入先走浅层,如果解码出的轨迹质量已经够好,那就直接返回,省掉后续骨干计算;如果质量不够,再继续往深了走。
这里的关键问题是:谁来判定"质量够好"?论文设计了一个轻量的轨迹质量评分器,输入是当前帧图像和刚解码出的轨迹,输出是六个规划分量的预测值。评分器在DINOv2-Small的基础上微调而来,参数量小,推理开销可以忽略。每次出口解码完一条轨迹,评分器立刻打分,分数超过预设阈值就提前终止。
质量引导的多出口架构:如何动态决定计算深度
Adaptive-WAM的骨干选择是Wan2.2-TI2V-5B,一个潜空间视频扩散模型。论文在其中的第5、9、15、18、22、30层分别挂上独立的轨迹解码头。每个轨迹解码头都是ReCogDrive风格的五步扩散式轨迹生成器。之所以选择这六个层,是前面逐层诊断的结果:过早的层信息不够,过深的层反而性能下滑,中间这段是最有辨识度的"甜点区"。
在部署时,条件骨干分支只跑一次前向。给定当前帧图像和部署可用的文本描述,骨干前向到第ℓ层的隐藏特征为:
注意,这个前向过程只处理当前图像和文本描述,不消费任何未来视频帧。未来视频只出现在训练阶段的监督信号里。在每个出口处,一个投影模块把隐藏特征转换成轨迹条件token,然后由独立的扩散头生成一条四秒规划轨迹:
六个解码头的架构完全相同,训练时的优化预算、batch size和迭代轮次也完全一致。这样设计是为了保证不同出口之间的性能差异只能归因于骨干深度,而不是解码头的容量差异。每个头独立参数、互相不通信,也不交换特征和预测结果。
轨迹质量评分器是这套机制的"裁判"。它把当前帧图像和轨迹编码成特征,然后通过六个独立的二分类头,分别预测NAVSIM评估器的六个规划分量:无过错碰撞(NC)、可行驶区域合规(DAC)、偏离中心距离(DDC)、碰撞时间(TTC)、自车进度(EP)和舒适度(Comf)。
评分器不接收自车状态和导航指令,刻意保持信息的独立性。预测的六个分量按NAVSIM的PDMS公式组合,得到轨迹质量的100分制分数Q。在推理时,算法维护一个轨迹池,每尝试一个出口就把新解码的轨迹放进去,并记录当前最高分。如果最高分达到阈值,马上返回这条轨迹;否则缓存当前隐藏状态,继续往深一层走。若六个出口全部尝试完仍未达标,就从轨迹池里挑分数最高的那条返回。
这里有个很关键的细节:为什么评分器要预测六个分量,而不是直接回归总分?因为NAVSIM的规划分数高度饱和——大量轨迹都能拿到近乎满分,分数的微小差距经常被并列、被四舍五入抹平。如果评分器学习一个严格的总分排序,它会在大量平局样本上无所适从。论文把评分器定位成"出口质量验证器"而非"轨迹排序器",只回答"这条轨迹够不够好",不强行区分"哪条最好"。
评分器训练时,生成的轨迹被当作stop-gradient输入,也就是说评分器的梯度不会回流到骨干网络和轨迹头。这样做避免了评分器和动作生成器之间互相干扰,让评分器纯粹地学习"评估"而不是参与"生成"。评分器训练使用六分量等权的soft-label二分类损失,目标值直接使用评估器给出的原始分量分数,不做过度的二值化处理。
训练过程中,Wan骨干和轨迹头采用LoRA加全量优化的组合策略,训练目标是视频扩散损失和六个出口的轨迹扩散损失的加权和。整个训练流程分为三个阶段:先是联合模仿学习,把骨干适配到驾驶场景并让各出口学会解码轨迹;然后是评分器训练,用模仿学习阶段生成的轨迹构造训练数据;最后是规划器单独的强化学习阶段,只更新各个轨迹头,骨干和评分器全部冻结。
强化学习阶段采用DifGRPO策略,每条轨迹视为一个动作,用NAVSIM评估器给整条轨迹打分当奖励。论文实验了十个随机种子,每个种子独立训练、独立选验证集最优checkpoint,最终指标是十个种子的聚合结果。这种多出口、多阶段、多随机种的实验设置,让论文的结论有相当高的可信度。
1. 编码当前图像与文本描述
2. 初始化轨迹池 A ← ∅
3. for ℓ ∈ {5, 9, 15, 18, 22, 30} do
4. 继续条件Wan前向到第ℓ层
5. 在出口ℓ解码一条轨迹 τℓ
6. 预测质量分量并缓存 Q(τ̂ℓ)
7. 将 τℓ 加入轨迹池 A
8. 取轨迹池中预测分最高的 (q̂, τ̂)
9. if q̂ ≥ η 或 ℓ == 30 then
10. return τ̂
11. end if
12. end for
这套流程最精妙的地方在于"免费的路由"。每次被拒绝的出口,其骨干隐藏状态和轨迹分数都被缓存下来,后续尝试只需要计算未评估的那部分骨干块。系统最终的平均推理成本是各出口终止概率的期望,而不是固定走满全网络。
性能与效率兼得:NAVSIM和nuScenes上的全面验证
评估分三个层次展开:NAVSIM v1/v2基准、零样本跨数据集迁移、以及消融实验和效率分析。
先看NAVSIM v1。自适应单轨迹规划器拿到90.8 PDMS,显著超越先前的前视相机世界模型规划器。论文里还附加了一个固定B22出口、64条轨迹候选的版本,达到92.6 PDMS,比DriveVA在混合数据上的头条成绩还高1.7个点。这里要注意,64提案版本不走自适应路由,是纯性能上限展示;单轨迹版本才是自适应系统的真实水平。
NAVSIM v2上,Adaptive-WAM拿到89.9 EPDMS,超过了所有对比的前视相机视频世界模型规划器,包括DriveVLA-W0、Epona和ReCogDrive。这个环节的领先意义在于:v2版本的评价指标更细、维度更多,在更严格的协议下依然能保持优势,说明不是只在单一指标上刷出来的结果。
零样本迁移测试更考验泛化能力。把NAVSIM上训练好的模型直接拿到nuScenes上评估,不微调任何参数,Adaptive-WAM取得0.88米的平均L2误差和0.08%的碰撞率。DriveVA的零样本成绩是0.84米和0.06%,略优一点。但注意,DriveVA在推理时要跑完整的未来视频生成管线,计算量比Adaptive-WAM的单个条件前向加早退路径大一到两个数量级。拿高一个量级的计算成本换微小的精度优势,这笔账怎么算都划不来。
表5展示了自适应路由的效率价值。阈值η=90时,94.1%的场景在前三个出口内终止,平均端到端延迟170毫秒,而PDMS达到了90.79,比最强的固定单轨迹出口还高0.17个点。对比跑满30层的全深度规划器——320毫秒加85.82分——自适应策略用一半的延迟换来了近5分的提升。这种性能-效率双赢的结果,是"不同深度解决不同场景"这个观察的最直接兑现。
消融实验有两条关键结论。第一,骨干适配方式影响巨大:冻结Wan只有84.20分,用LoRA联合适配直接跳到90.62分,全量微调只多0.02分。这说明了视频骨干必须和驾驶场景做联合适配,而LoRA已经足够,没必要全量微调。第二,Wan的中间特征确实比其他视觉骨干更强:ViT-L达到88.88分,比Wan的90.62分低了近2分。这验证了视频扩散模型学习的时空先验对驾驶规划的独特价值——它不只是图像特征,还包括运动趋势的表征。
局限与展望:自适应推理的边界在哪里?
再好的工作也有自己的边界。论文训练时用的视频骨干是Wan2.2-TI2V-5B,虽然属于Wan系列,但5B参数量对车端部署依然不轻。论文评测用的硬件是单张A100 80GB,这是云端实验室的配置。如果未来要上量产车,还要经历知识蒸馏、量化、剪枝等一系列"瘦身"流程,能否保持中间层特征的优势有待验证。
另一个潜在的限制是质量评分器依赖NAVSIM的评估指标。评分器是在NAVSIM评估器产生的伪标签上训练的,这本身没有错,因为NAVSIM是公认的离线基准。但如果换一个评估指标差异很大的新基准,评分器可能需要重新适配。
还有一点值得思考:阈值η决定了质量-效率的权衡点,这个阈值需要在验证集上选择。不同城市、不同天气、不同路况下,最优阈值会不会漂移?论文目前只在一个验证集上选阈值,跨场景的阈值鲁棒性还没有充分讨论。
论文中还有一个值得一提的定性观察:不同层解出的轨迹确实在"互补"。浅层出口的轨迹在简单场景中与深层一致,但在复杂交互场景中可能偏离共识;少数场景中,浅层出口反而能发现深层出口忽略的可行轨迹。这为未来研究留了一个开放问题:能否让每个出口不仅提供"一条轨迹",还提供"一种决策模式"?那将是一个更全面的多模态规划系统。
龙迷三问
这篇论文到底在解决什么问题? 清华大学AIR提出Adaptive-WAM,基于Wan2.2-5B视频扩散骨干,在六个中间层挂载轨迹解码头并引入质量打分器做自适应提前退出,NAVSIM上实现90.8 PDMS,…
这篇工作最值得看的点是什么? NAVSIM v1上自适应单轨迹规划器达到90.8 PDMS,固定B22 64提案变体达到92.6 PDMS;NAVSIM v2上达到89.9 EPDMS,优于对比的前视视频世界模型规划器;零样本迁移到nuScenes达到0.88m平均L…
这篇工作的边界或风险在哪里? 优点:1)系统性地揭示了视频扩散模型中间层特征对规划任务的有效性;2)提出质量引导的自适应推理机制,在性能几乎不损失的情况下显著降低计算开销;3)多出口设计提供了灵活的性能-计算权衡。缺点:1)质量评分器依赖DINOv2-Small,对复…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一种基于视频扩散模型中间层特征的多出口轨迹规划框架,通过轻量级轨迹质量评分器动态决定推理深度,在保证规划性能的同时显著降低计算开销。
实验合理度: ★★★★☆
PDMS(NAVSIM v1)、EPDMS(NAVSIM v2)、平均L2误差和碰撞率(nuScenes)
学术研究价值: ★★★★☆
提出一种基于视频扩散模型中间层特征的多出口轨迹规划框架,通过轻量级轨迹质量评分器动态决定推理深度,在保证规划性能的同时显著降低计算开销。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
在A100 80GB上,自适应规划平均端到端延迟170ms(固定第15层为190ms,固定全深度为320ms);完整40步视频生成需13.22s。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1)质量评分器依赖DINOv2-Small,对复杂场景的评分准确性有限;2)阈值η需要验证集调优,不同数据集可能需要重新调整;3)与DriveVA相比,零样本迁移性能仍…
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!