← 返回 PaperDaily 视觉与图像

华中科大小米汽车新方法:中间层一训,PDMS涨1.3

这篇论文最有意思的地方,不是又堆了一个更大的自动驾驶模型,而是把“中间表示”当成了真正要训练的对象。它把视频生成、轨迹规划和安全边界三件事拆开处理,结果还真把收敛速度和闭环表现一起抬起来了。

华中科大小米汽车新方法:中间层一训,PDMS涨1.3
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header
龙哥推荐理由:这篇论文最有意思的地方,不是又堆了一个更大的自动驾驶模型,而是把“中间表示”当成了真正要训练的对象。它把视频生成、轨迹规划和安全边界三件事拆开处理,结果还真把收敛速度和闭环表现一起抬起来了。

原论文信息如下:
论文标题:
REWORLD: LEARNING BETTER REPRESENTATIONS FOR WORLD ACTION MODELS
发表日期:
2026年06月
发表单位:
华中科技大学;小米汽车
原文链接:
https://arxiv.org/pdf/2606.27504v1.pdf

自动驾驶“世界动作模型”的瓶颈在哪?

自动驾驶里最容易被忽视的一件事,是模型看起来“会生成未来”,不代表它真的“懂未来”。很多世界模型把精力都花在了最后一层输出上:画面像不像、轨迹对不对,至于中间那些承载世界知识的表示,往往只是顺手被训练了一下,像是顺带打工,没真正被当成主角。
这篇论文抓的就是这个“中间层没人管”的痛点。作者把它说得很直白:输出层监督够用,但不够好。如果中间表示没有被明确塑形,视频生成和轨迹规划就会像两条各走各路的平行线,前者能画出未来,后者能给出动作,但二者之间的世界知识传递并不牢靠。
封面
图1:ReWorld整体框架。它把训练拆成三步:先让视频分支的中间层学会预测未来,再让动作分支去对齐视频世界表示,最后用难负例把规划表示往“安全边界”上拽一把。
这也是 ReWorld 最有意思的地方:它不是再堆一个更大的自动驾驶模型,而是把“表示学习”这件事单独拎出来,专门给世界动作模型补课。名字里的 ReWorld,核心意思也很朴素——不是重造世界,而是把世界表示学得更像样一点。

ReWorld:三管齐下,直击中间表示优化问题

先把概念捋顺。论文中的 World Action Models,简称 WAMs(World Action Models,世界动作模型),指的是一类同时建模未来场景演化和动作规划的模型。它不只是“看未来”,还要“在未来里做决定”。
ReWorld 的思路很像给一个学生分三门补习:视频分支补“未来感”,动作分支补“理解感”,最后再补“安全感”。这三门课不是并列摆设,而是前后接力。先让视频表示更会预测未来,再把这些世界知识传给动作表示,最后用难负例把安全边界刻进去。这样一来,生成和规划不再只是“各自完成任务”,而是开始共享同一套世界理解。
论文采用的是一个链式 WAM 框架:先用 Video DiT 生成未来视频,再把视频隐藏状态送进 Action DiT 做轨迹规划。这里的 DiT 是 Diffusion Transformer,中文可理解为“扩散式 transformer”。视频分支负责把世界“演出来”,动作分支负责在这个世界里“走一步”。
图2
图2:中间监督带来的推理修正和收敛加速。左边展示的是采样时用中间预测和最终预测的差异做“自我引导”;右边展示的是训练时收敛速度大约提升 2 倍。
这套设计的关键,不是把三个损失简单相加,而是把三类表示问题拆开处理。第一类是“未来预测表示”,第二类是“世界对齐表示”,第三类是“安全判别表示”。前两类解决“懂不懂世界”,后一类解决“会不会把车开进坑里”。自动驾驶里这一步很要命,因为看起来合理真正安全,经常不是一回事。

Video DiT“开小灶”:中间层预测未来,加速又提效

视频分支这部分,ReWorld 做了一个很实在的动作:不给最后一层单独背锅,而是给中间层也安排了预测任务。具体来说,就是在选定的中间 block 上挂辅助头,让它们也去预测和主头一样的速度目标。这里的速度目标来自 flow matching(流匹配),可以把它理解成“告诉模型当前时刻往哪儿推,才能更接近未来视频”。
这一步的妙处在于,中间层不再只是“中转站”,而是被迫学会更早地理解未来。换句话说,模型不能等到最后一层才开始想“前面发生了什么、后面会怎样”,而是从中层就开始被未来约束。对视频生成来说,这通常会带来两个结果:一是训练更稳更快,二是生成时的时序一致性更好。
论文还做了一件挺有意思的事:它把中间层和最终层的预测差异拿来做推理时的自我引导。直白点说,就是中间层像“草稿”,最终层像“定稿”,两者有差异时,不是当作噪声扔掉,而是拿来修正采样方向。于是采样阶段就不只是“照着最终头走”,而是“边走边校正”。这个设计不需要外部模型,属于那种看起来朴素、实际很省钱的工程优化。
表6
表6:自我引导强度 γ 的消融实验。它说明这个“草稿修正”不是随便拍脑袋,强度太小修不动,太大又容易把采样带偏,得找一个合适的平衡点。
从方法论上看,这一招其实很符合视频生成的本性。视频不是单帧图像,真正难的地方在于时间连续性和运动合理性。中间层越早被未来监督,越容易把“下一步该怎么变”这件事内化成表示的一部分,而不是等最后输出时才临时补丁。论文里给出的结果也说明,这种中层监督不仅能提速,还能改善生成质量,属于一鱼两吃。

Action DiT“镀金身”:跨模态对齐+难负例排斥,让规划更安全

如果说视频分支解决的是“世界表示怎么长得更像未来”,那动作分支解决的就是“规划表示怎么别光会看热闹”。ReWorld 在 Action DiT 上做了两层处理:先做跨模态对齐,再做难负例排斥。前者让动作 token 真正吸收视频世界知识,后者让动作表示学会区分“看起来差不多、实际上很危险”的轨迹。
跨模态对齐这一步,核心是把动作分支中某一层 cross-attention 之后的状态,和它所关注到的视频 readout 拉近。这里的 readout 可以理解成“动作 token 从视频里读出来的世界信息摘要”。论文还特意用了 stop-gradient,即停止梯度回传,避免这个辅助损失反过来扰动视频分支。这个细节很重要,不然就容易出现“为了让动作分支好看,把视频分支也拽歪了”的副作用。
但只对齐还不够。因为世界知识本身并不等于安全知识。一个轨迹可能非常符合场景物理逻辑,却依然会在闭环里撞车、压线或者让乘坐体验变差。所以论文引入了难负例监督:先离线采样一堆候选轨迹,再用 NAVSIM 的 PDM 模拟器打分,找出和专家轨迹几何上很近、但闭环得分很差的那条“坏得最像好的”轨迹。然后让模型把预测轨迹和这个难负例拉开距离。
表7
表7:repulsive distance loss 的权重 λRDE 消融。这个结果说明,安全边界不能“猛拽”,否则会把规划拉得过头;但完全不拽,又学不到区分危险轨迹的能力。
这里的思想其实挺硬核:不是只告诉模型“什么是对的”,还要告诉它“什么是最容易被骗的错的”。这比单纯模仿专家轨迹更接近真实驾驶,因为现实道路里最危险的往往不是离谱错误,而是那些“差一点就对了”的选择。论文把这种 repulsive distance loss 简写成 RDE(Repulsive Distance Loss,排斥距离损失),名字虽然朴素,作用却很实在。

实验全面碾压:FVD降23.9%,PDMS提升1.3,无需后训练

实验部分最值得看的,不是某一个孤立指标,而是三件事同时成立:视频更稳、规划更强、训练还更快。很多方法只能在其中一项上刷存在感,ReWorld 则是把三条线一起往上拉,这就比较难糊弄了。
表1
表1:nuScenes 验证集上的视频生成结果。作者用 FVD 衡量时序一致性,并说明 FID 不太适合视频质量评估。
在视频生成上,ReWorld 把 fine-tuned FVD 从 81.3 降到 61.9,提升幅度是 23.9%。FVD 是 Fréchet Video Distance,中文可译为“弗雷歇视频距离”,数值越低,说明视频时序一致性越好。这个结果说明,中间层未来监督确实不是摆设,它对长时序动态建模有实打实的帮助。
表2
表2:从零训练的视频生成代表性对比。ReWorld 在统一的 LTX-Video 框架下训练 120k 步后,FVD 进一步压到 270.4,说明它不只是微调阶段占便宜,单独从头训练也更能学到好表示。
表3
表3:NAVSIM 闭环规划结果。ReWorld 的 PDMS 达到 90.4,比 DriveLaW 基线的 89.1 提升 1.3 分,且没有依赖强化学习或后处理。
规划结果也很关键。PDMS 是 Predictive Driver Model Score,中文可理解为“预测式驾驶模型得分”,它综合了碰撞、可行驶区域、时间到碰撞、舒适性和行驶进度等指标。ReWorld 在 NC、DAC、TTC 等子项上也表现最好,说明它不是单纯把某一个指标刷高,而是整体驾驶行为更稳了。
更有意思的是训练效率。论文显示,加入中间层监督后,Video DiT 的从零训练收敛速度大约提升 2 倍,而且没有引入外部编码器或教师模型。对工程来说,这种提升比“又涨了 0.2 个点”更实在,因为训练大模型最贵的往往不是最后那一点精度,而是算力和时间。
表8
表8:Video DiT 训练计算开销对比。ReWorld 的中间监督几乎不靠外部模型,但能换来更快收敛,这一点对大规模训练很友好。
图3
图3:与 DriveLaW 的视频生成定性对比。高速场景下,ReWorld 在路面标线、远处车辆和道路结构的连续性上更稳,漂移和伪影也更少。
从这些结果看,ReWorld 不是靠某个单点技巧“偷分”,而是把表示学习插进了 WAM 的三个关键位置:视频中层、动作对齐、难负例安全边界。它的提升也因此显得比较可信,因为每一项增益都能和方法设计对上号,不是玄学。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是 WAM 里“中间表示没人认真管”的问题。以前模型主要盯着最终视频和最终轨迹,ReWorld 则把中间层当成直接优化对象,让视频分支学未来、动作分支学世界、再学安全边界。

FVD、PDMS、RDE 这些缩写分别是什么意思?FVD 是 Fréchet Video Distance,衡量视频时序质量;PDMS 是 Predictive Driver Model Score,衡量闭环驾驶整体表现;RDE 是 Repulsive Distance Loss,中文可理解为排斥距离损失,用来把预测轨迹和危险难负例拉开。

为什么这个方法能同时提升生成和规划?因为它不是只在输出端“补成绩”,而是从表示层就开始塑形。视频中层更早学会未来结构,动作分支更准确吸收视频世界知识,再用难负例强化安全判别,三个环节串起来,生成和规划自然更一致。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“中间表示优化”系统化地搬进 WAM,思路很完整,尤其是视频未来监督、跨模态对齐、难负例排斥三段式设计,组合起来是有新意的,不是简单拼盘。

实验合理度:★★★★☆

对比了视频生成、从零训练、闭环规划三条线,还做了消融,逻辑比较闭合。唯一要留意的是,部分收益来自特定框架和训练流程,外推到别的 WAM 体系还需要验证。

学术研究价值:★★★★☆

这篇工作把“表示学习”从泛泛而谈变成了可操作的 WAM 训练目标,对后续做自动驾驶世界模型的人有启发,尤其适合继续挖“中间层到底该学什么”。

稳定性:★★★☆☆

中间监督和难负例都能带来收益,但对训练阶段、超参数和候选轨迹池质量有依赖。能用,不算脆,但还没到“拿来就能无脑上线”的程度。

适应性以及泛化能力:★★★☆☆

方法和 WAM 结构绑定较紧,尤其依赖视频分支与动作分支的链式设计。换框架能不能继续好使,还得看具体架构是否支持类似中间表示对齐。

硬件需求及成本:★★★☆☆

训练主体还是 2B 级 Video DiT,算力门槛不低;好在方法本身没有额外外部编码器,增量成本主要来自辅助头和损失项,不是那种再养一个大模型的离谱玩法。

复现难度:★★★☆☆

论文给了训练策略和主要超参,但闭环难负例的挖掘、候选池构建、以及具体 WAM 框架复现,都有一定工程门槛。不是不能复现,是需要耐心。

产品化成熟度:★★★☆☆

作为研究原型已经挺完整,但离稳定产品还差一口气。尤其是安全负例挖掘、跨数据集泛化和实时部署成本,还需要更系统的验证。

可能的问题:方法很强,但对框架耦合较深,且安全边界主要靠离线难负例塑形,真实长尾场景下是否足够稳,还需要更多闭环验证。


主要参考文献

[1] Xia, T., Zhou, L., Xiong, K., et al. ReWorld: Learning Better Representations for World Action Models. arXiv, 2026.
[2] Xia et al. DriveLaW. 2026.
[3] Yu et al. REPA. 2024.
[4] Jiang et al. SRA. 2025.

世界模型不是只会“看起来像”,还得想得对、传得稳、开得安全。想继续追自动驾驶、世界模型和前沿论文拆解,欢迎加入龙哥读论文粉丝群,一起把复杂论文拆成能落地的真东西。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。自动驾驶、世界模型、视频生成这些方向,群里讨论得最热,适合边读边聊。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。