← 返回 PaperDaily
视觉与图像
华中科大小米汽车新方法:中间层一训,PDMS涨1.3
这篇论文最有意思的地方,不是又堆了一个更大的自动驾驶模型,而是把“中间表示”当成了真正要训练的对象。它把视频生成、轨迹规划和安全边界三件事拆开处理,结果还真把收敛速度和闭环表现一起抬起来了。
龙哥读论文
发布于 2026-08-14 09:10:57
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:这篇论文最有意思的地方,不是又堆了一个更大的自动驾驶模型,而是把“中间表示”当成了真正要训练的对象。它把视频生成、轨迹规划和安全边界三件事拆开处理,结果还真把收敛速度和闭环表现一起抬起来了。
原论文信息如下:
自动驾驶“世界动作模型”的瓶颈在哪?
自动驾驶里最容易被忽视的一件事,是模型看起来“会生成未来”,不代表它真的“懂未来”。很多世界模型把精力都花在了最后一层输出上:画面像不像、轨迹对不对,至于中间那些承载世界知识的表示,往往只是顺手被训练了一下,像是顺带打工,没真正被当成主角。
这篇论文抓的就是这个“中间层没人管”的痛点。作者把它说得很直白:输出层监督够用,但不够好 。如果中间表示没有被明确塑形,视频生成和轨迹规划就会像两条各走各路的平行线,前者能画出未来,后者能给出动作,但二者之间的世界知识传递并不牢靠。
这也是 ReWorld 最有意思的地方:它不是再堆一个更大的自动驾驶模型,而是把“表示学习”这件事单独拎出来,专门给世界动作模型补课。名字里的 ReWorld,核心意思也很朴素——不是重造世界,而是把世界表示学得更像样一点。
ReWorld:三管齐下,直击中间表示优化问题
先把概念捋顺。论文中的 World Action Models,简称 WAMs(World Action Models,世界动作模型) ,指的是一类同时建模未来场景演化和动作规划的模型。它不只是“看未来”,还要“在未来里做决定”。
ReWorld 的思路很像给一个学生分三门补习:视频分支补“未来感”,动作分支补“理解感”,最后再补“安全感”。这三门课不是并列摆设,而是前后接力。先让视频表示更会预测未来,再把这些世界知识传给动作表示,最后用难负例把安全边界刻进去。这样一来,生成和规划不再只是“各自完成任务”,而是开始共享同一套世界理解。
论文采用的是一个链式 WAM 框架:先用 Video DiT 生成未来视频,再把视频隐藏状态送进 Action DiT 做轨迹规划。这里的 DiT 是 Diffusion Transformer ,中文可理解为“扩散式 transformer”。视频分支负责把世界“演出来”,动作分支负责在这个世界里“走一步”。
这套设计的关键,不是把三个损失简单相加,而是把三类表示问题拆开处理。第一类是“未来预测表示”,第二类是“世界对齐表示”,第三类是“安全判别表示”。前两类解决“懂不懂世界”,后一类解决“会不会把车开进坑里”。自动驾驶里这一步很要命,因为看起来合理 和真正安全 ,经常不是一回事。
Video DiT“开小灶”:中间层预测未来,加速又提效
视频分支这部分,ReWorld 做了一个很实在的动作:不给最后一层单独背锅,而是给中间层也安排了预测任务。具体来说,就是在选定的中间 block 上挂辅助头,让它们也去预测和主头一样的速度目标。这里的速度目标来自 flow matching(流匹配) ,可以把它理解成“告诉模型当前时刻往哪儿推,才能更接近未来视频”。
这一步的妙处在于,中间层不再只是“中转站”,而是被迫学会更早地理解未来。换句话说,模型不能等到最后一层才开始想“前面发生了什么、后面会怎样”,而是从中层就开始被未来约束。对视频生成来说,这通常会带来两个结果:一是训练更稳更快,二是生成时的时序一致性更好。
论文还做了一件挺有意思的事:它把中间层和最终层的预测差异拿来做推理时的自我引导。直白点说,就是中间层像“草稿”,最终层像“定稿”,两者有差异时,不是当作噪声扔掉,而是拿来修正采样方向。于是采样阶段就不只是“照着最终头走”,而是“边走边校正”。这个设计不需要外部模型,属于那种看起来朴素、实际很省钱的工程优化。
从方法论上看,这一招其实很符合视频生成的本性。视频不是单帧图像,真正难的地方在于时间连续性和运动合理性。中间层越早被未来监督,越容易把“下一步该怎么变”这件事内化成表示的一部分,而不是等最后输出时才临时补丁。论文里给出的结果也说明,这种中层监督不仅能提速,还能改善生成质量,属于一鱼两吃。
Action DiT“镀金身”:跨模态对齐+难负例排斥,让规划更安全
如果说视频分支解决的是“世界表示怎么长得更像未来”,那动作分支解决的就是“规划表示怎么别光会看热闹”。ReWorld 在 Action DiT 上做了两层处理:先做跨模态对齐,再做难负例排斥。前者让动作 token 真正吸收视频世界知识,后者让动作表示学会区分“看起来差不多、实际上很危险”的轨迹。
跨模态对齐这一步,核心是把动作分支中某一层 cross-attention 之后的状态,和它所关注到的视频 readout 拉近。这里的 readout 可以理解成“动作 token 从视频里读出来的世界信息摘要”。论文还特意用了 stop-gradient ,即停止梯度回传,避免这个辅助损失反过来扰动视频分支。这个细节很重要,不然就容易出现“为了让动作分支好看,把视频分支也拽歪了”的副作用。
但只对齐还不够。因为世界知识本身并不等于安全知识。一个轨迹可能非常符合场景物理逻辑,却依然会在闭环里撞车、压线或者让乘坐体验变差。所以论文引入了难负例监督:先离线采样一堆候选轨迹,再用 NAVSIM 的 PDM 模拟器打分,找出和专家轨迹几何上很近、但闭环得分很差的那条“坏得最像好的”轨迹。然后让模型把预测轨迹和这个难负例拉开距离。
这里的思想其实挺硬核:不是只告诉模型“什么是对的”,还要告诉它“什么是最容易被骗的错的”。这比单纯模仿专家轨迹更接近真实驾驶,因为现实道路里最危险的往往不是离谱错误,而是那些“差一点就对了”的选择。论文把这种 repulsive distance loss 简写成 RDE(Repulsive Distance Loss,排斥距离损失) ,名字虽然朴素,作用却很实在。
实验全面碾压:FVD降23.9%,PDMS提升1.3,无需后训练
实验部分最值得看的,不是某一个孤立指标,而是三件事同时成立:视频更稳、规划更强、训练还更快。很多方法只能在其中一项上刷存在感,ReWorld 则是把三条线一起往上拉,这就比较难糊弄了。
在视频生成上,ReWorld 把 fine-tuned FVD 从 81.3 降到 61.9,提升幅度是 23.9% 。FVD 是 Fréchet Video Distance ,中文可译为“弗雷歇视频距离”,数值越低,说明视频时序一致性越好。这个结果说明,中间层未来监督确实不是摆设,它对长时序动态建模有实打实的帮助。
规划结果也很关键。PDMS 是 Predictive Driver Model Score ,中文可理解为“预测式驾驶模型得分”,它综合了碰撞、可行驶区域、时间到碰撞、舒适性和行驶进度等指标。ReWorld 在 NC、DAC、TTC 等子项上也表现最好,说明它不是单纯把某一个指标刷高,而是整体驾驶行为更稳了。
更有意思的是训练效率。论文显示,加入中间层监督后,Video DiT 的从零训练收敛速度大约提升 2 倍 ,而且没有引入外部编码器或教师模型。对工程来说,这种提升比“又涨了 0.2 个点”更实在,因为训练大模型最贵的往往不是最后那一点精度,而是算力和时间。
从这些结果看,ReWorld 不是靠某个单点技巧“偷分”,而是把表示学习插进了 WAM 的三个关键位置:视频中层、动作对齐、难负例安全边界。它的提升也因此显得比较可信,因为每一项增益都能和方法设计对上号,不是玄学。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是 WAM 里“中间表示没人认真管”的问题。以前模型主要盯着最终视频和最终轨迹,ReWorld 则把中间层当成直接优化对象,让视频分支学未来、动作分支学世界、再学安全边界。
FVD、PDMS、RDE 这些缩写分别是什么意思? FVD 是 Fréchet Video Distance,衡量视频时序质量;PDMS 是 Predictive Driver Model Score,衡量闭环驾驶整体表现;RDE 是 Repulsive Distance Loss,中文可理解为排斥距离损失,用来把预测轨迹和危险难负例拉开。
为什么这个方法能同时提升生成和规划? 因为它不是只在输出端“补成绩”,而是从表示层就开始塑形。视频中层更早学会未来结构,动作分支更准确吸收视频世界知识,再用难负例强化安全判别,三个环节串起来,生成和规划自然更一致。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“中间表示优化”系统化地搬进 WAM,思路很完整,尤其是视频未来监督、跨模态对齐、难负例排斥三段式设计,组合起来是有新意的,不是简单拼盘。
实验合理度: ★★★★☆
对比了视频生成、从零训练、闭环规划三条线,还做了消融,逻辑比较闭合。唯一要留意的是,部分收益来自特定框架和训练流程,外推到别的 WAM 体系还需要验证。
学术研究价值: ★★★★☆
这篇工作把“表示学习”从泛泛而谈变成了可操作的 WAM 训练目标,对后续做自动驾驶世界模型的人有启发,尤其适合继续挖“中间层到底该学什么”。
稳定性: ★★★☆☆
中间监督和难负例都能带来收益,但对训练阶段、超参数和候选轨迹池质量有依赖。能用,不算脆,但还没到“拿来就能无脑上线”的程度。
适应性以及泛化能力: ★★★☆☆
方法和 WAM 结构绑定较紧,尤其依赖视频分支与动作分支的链式设计。换框架能不能继续好使,还得看具体架构是否支持类似中间表示对齐。
硬件需求及成本: ★★★☆☆
训练主体还是 2B 级 Video DiT,算力门槛不低;好在方法本身没有额外外部编码器,增量成本主要来自辅助头和损失项,不是那种再养一个大模型的离谱玩法。
复现难度: ★★★☆☆
论文给了训练策略和主要超参,但闭环难负例的挖掘、候选池构建、以及具体 WAM 框架复现,都有一定工程门槛。不是不能复现,是需要耐心。
产品化成熟度: ★★★☆☆
作为研究原型已经挺完整,但离稳定产品还差一口气。尤其是安全负例挖掘、跨数据集泛化和实时部署成本,还需要更系统的验证。
可能的问题: 方法很强,但对框架耦合较深,且安全边界主要靠离线难负例塑形,真实长尾场景下是否足够稳,还需要更多闭环验证。
主要参考文献
[1] Xia, T., Zhou, L., Xiong, K., et al. ReWorld: Learning Better Representations for World Action Models. arXiv, 2026.
[2] Xia et al. DriveLaW. 2026.
[3] Yu et al. REPA. 2024.
[4] Jiang et al. SRA. 2025.
世界模型不是只会“看起来像”,还得想得对、传得稳、开得安全 。想继续追自动驾驶、世界模型和前沿论文拆解,欢迎加入龙哥读论文粉丝群,一起把复杂论文拆成能落地的真东西。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
自动驾驶、世界模型、视频生成这些方向,群里讨论得最热,适合边读边聊。