← 返回 PaperDaily 视觉与图像

OWMDrive来了:4D世界模型让自动驾驶先看见未来

这篇论文最有意思的地方,不是又堆了一个规划器,而是先让车“脑补未来场景”,再去做轨迹生成。对遮挡多、交互复杂的驾驶环境来说,这种先预测世界再决策的思路,比只盯着眼前画面靠谱得多。

OWMDrive来了:4D世界模型让自动驾驶先看见未来
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是又堆了一个规划器,而是先让车“脑补未来场景”,再去做轨迹生成。对遮挡多、交互复杂的驾驶环境来说,这种先预测世界再决策的思路,比只盯着眼前画面靠谱得多。


原论文信息如下:
论文标题:
OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model
发表日期:
2026年06月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2606.30421v1.pdf
开车这件事,最怕的不是“看不见”,而是只看见眼前。前车一脚刹车、侧向来车突然变道、路口被遮挡的行人冷不丁冒出来,很多规划器不是反应慢,而是压根没把“未来几秒会发生什么”算进脑子里。OWMDrive这篇工作,干的就是这件有点像“先算命再开车”的事:先让系统预测4D占据世界的未来演化,再把这些“预知片段”喂给扩散式轨迹规划器,让车不只会躲眼前,还能提前绕开未来的坑。
图1:生成式端到端自动驾驶范式演进
图1:生成式端到端自动驾驶范式演进。论文想表达的核心很直接:端到端自动驾驶正在从“只看当前场景”走向“预测未来场景再决策”,而 OWMDrive 站在了这个转折点上。
这篇论文的关键词其实就两个:Occupancy World Modeldiffusion planner。前者负责“看未来”,后者负责“把未来变成轨迹”。其中,Occupancy World Model 可直译为“占据世界模型”,这里的 occupancy 指空间里哪些位置被车、行人、障碍物占着;4D 则表示不仅有三维空间,还有时间维度,也就是把场景在未来几秒怎么变也建模进去。论文的野心不小:不是再堆一个更花哨的规划器,而是先补上自动驾驶最缺的一块——对场景演化的因果理解

开车时只会看眼前?老司机教你“预见”未来!

传统自动驾驶里,很多方法像“只盯着仪表盘”的新手司机:当前车道、当前目标、当前障碍物都看得很清楚,但一旦场景里出现遮挡、突然加塞、复杂交互,系统就容易变得要么激进,要么过度保守。OWMDrive 的思路更像老司机——不是只看现在,而是先判断接下来几秒谁会动、往哪动、会不会挡路,再决定自己的轨迹。
这篇工作最有价值的地方,不在于把“规划”这个词又说了一遍,而在于把规划从“对当前画面反应”推进到“对未来世界状态负责”。说白了,车不是在猜下一步怎么开,而是在先猜世界会怎么变,然后让轨迹生成去顺着这个变化走。这个差别非常关键:前者像临场反应,后者像提前布局。
图2:OWMDrive整体框架
图2:OWMDrive整体框架。环视图像先编码成视觉 token,再进入占据世界模型预测未来场景 token,最后由扩散规划器在当前与未来场景条件下逐步生成轨迹点。
如果把这套流程翻译成人话,就是三步:先看见,后预判,再决策。第一步把多摄像头画面变成可计算的场景表示;第二步用世界模型预测未来几帧 3D 占据;第三步把这些未来信息作为条件,驱动扩散模型不断“擦掉噪声”,最终生成更稳、更安全的轨迹。这个链条看起来朴素,但真正厉害的地方在于:未来信息不是摆设,而是直接参与规划

核心思想:用“预知”能力打造因果感知规划器

OWMDrive 的核心判断是:自动驾驶里很多危险并不是“现在就危险”,而是“再过一两秒就危险”。如果规划器只根据当前帧做决定,就很容易在遮挡、交互和长时序误差积累里翻车。于是论文把未来场景预测前置成条件输入,让轨迹生成从“反应式”变成“前瞻式”。
这里的“因果感知”不是在做哲学讨论,而是很工程化地表达一件事:当前场景会如何演化,决定了未来轨迹该怎么走。比如前方车辆减速,不是因为规划器“想太多”,而是因为未来占据里已经能看到它会挡住路;路口行人被车柱遮住,也不是现在没事就真的没事,而是未来几帧里可能会突然变成高风险区域。OWMDrive 试图把这种关系显式喂给模型,而不是让模型自己在黑盒里瞎悟。
论文里的另一个关键点是:规划不是直接回归一条线,而是用扩散模型生成轨迹。扩散模型的好处是能从一团噪声里逐步“雕刻”出合理结果,天然适合多模态决策——同一个路口,直行、左转、右转都可能合理。相比一次性输出单一路径,这种逐步去噪的方式更像“边想边改”,也更容易融合复杂条件。

关键技术解剖:4D世界模型如何“未卜先知”?

论文把世界模型做成了一个4D 占据预测器。这里的 4D 不是炫技,而是把“空间里的占据关系”与“时间上的变化趋势”绑在一起。简单说,模型不只知道“哪儿有人”,还要知道“这个人接下来会往哪儿走”。
为了让未来预测既准又省,OWMDrive 先把高维 3D 占据压成离散 latent token。这里用到了 VQ-VAE(Vector Quantized Variational AutoEncoder,向量量化变分自编码器,引用自论文中所述的相关工作)和 VAR(论文中用于多尺度残差量化的相关模块/框架,原文引用为 VAR[26])。前者负责把连续特征离散化,后者帮助做多尺度的残差量化。这样做的好处很实在:占据场景很大、很密、很贵,不压缩就会把算力烧穿;压缩后既能保留结构,又能让后续预测更轻量。
这个世界模型里有两个重要动作。一个是空间压缩:把每一时刻的 3D 占据图从粗到细地量化,尽量别把边缘细节压没了。另一个是时间对齐:把历史帧通过位姿变换对齐到当前坐标系,避免“昨天的障碍物”和“今天的障碍物”在坐标上打架。说白了,模型不是只记住过去,而是先把过去摆正,再判断它和现在之间的变化。
在时序预测上,论文采用了自回归方式逐步预测未来 token。也就是说,先预测下一帧,再用这一帧去预测更远的下一帧。这样的设计比一次性硬猜未来更稳,因为交通场景本身就是逐步演化的。为了让这个过程不至于算力爆炸,论文用的是轻量的时空融合:空间上用注意力聚合局部上下文,时间上用简化的历史特征融合模块。这个思路很像“先看局部,再看趋势”,不追求花里胡哨的大而全,追求能落地。
图2:OWMDrive整体框架
图2里最值得注意的是中间那条链路:当前场景 token 和未来场景 token 一起进入规划器。也就是说,规划器看到的不是“静态照片”,而是“带时间走势的场景剧本”。

关键技术解剖:强化扩散如何“趋利避害”?

如果说世界模型负责“预见”,那扩散规划器负责“把预见变成动作”。OWMDrive 不是直接从高斯噪声里瞎抠轨迹,而是先给扩散过程一个多模态参考轨迹分布,再通过去噪逐步逼近更合理的方案。这个设计的潜台词很明显:驾驶不是单峰问题,很多时候本来就有多个可行答案。
更关键的是,扩散过程并不是只看当前场景,而是把未来预测到的 occupancy 一起做条件输入。这样一来,轨迹生成就不再是“现在没撞就行”,而是“现在不撞、未来也别撞”。这也是论文标题里“causality-aware”的真正含义:轨迹不是对当前帧做最优拟合,而是对未来演化做一致响应。
为了让扩散不只是“像样”,而是真的“安全”,论文还加了强化学习信号。这里的 GRPO 是 Group Relative Policy Optimization,中文可理解为“组相对策略优化”。它的作用不是让模型死记某条轨迹,而是让同一组采样轨迹之间做相对比较:哪条更安全、哪条更顺、哪条更接近目标,就给更高权重。这样能减少单次采样偶然性带来的偏差,也更适合扩散模型这种多候选生成场景。
奖励设计也很务实,主要围绕五个闭环指标:无责任碰撞、可行驶区域约束、碰撞时间安全、舒适性、以及任务进展。说人话就是:别撞、别出界、别太危险、别太晃、还得往前走。这个奖励不像某些论文只会堆一个漂亮总分,而是把自动驾驶最关心的几件事拆开来管,避免模型为了“冲进度”把安全忘了。
图3:NavSim闭环规划可视化
图3:NavSim闭环规划可视化。论文展示了直行、左转、右转、超车、变道、让行等场景,说明这个方法不是只会在简单路段“表演”,而是要在真实交互里接受检验。
从工程角度看,这套“世界模型 + 扩散 + 强化”的组合并不轻,但它的逻辑很完整:先让未来可见,再让轨迹可选,最后让选择更符合安全目标。它不是把强化学习硬塞进来凑热闹,而是让奖励去修正扩散采样的偏好。这个设计比单纯回归轨迹更像一个真正的规划系统。

SOTA性能:开环与闭环测试全面领先

OWMDrive 的实验分成两类:一类是 nuScenes 上的开环评估,主要看轨迹预测得准不准、撞不撞;另一类是 NAVSIM 上的闭环评估,更接近真实驾驶,重点看安全、可行驶性、舒适性和进度。这个划分很重要,因为有些方法开环看起来很美,闭环一上路就开始“纸上谈兵”。
表1:nuScenes开环结果对比
表1:nuScenes 开环结果对比。OWMDrive 在三个预测时长上都拿到了最好的 L2 误差和碰撞率,平均 L2 只有 0.18 米,平均碰撞率只有 0.05%。这说明未来场景条件确实帮助模型减少了长时序误差积累。
开环结果最能说明一个事实:只看当前帧的规划器,时间一拉长就容易漂。而 OWMDrive 把未来 occupancy 作为条件后,误差和碰撞都明显压下来了。尤其是 3 秒视野下依然保持较低误差,说明它不是靠短期“蒙对”,而是真的在利用未来结构信息。
表2:NAVSIM闭环结果对比
表2:NAVSIM 闭环结果对比。OWMDrive 的总体 PDMS 达到 90.8,DAC 为 97.6,EP 为 87.3,都是非常靠前的水平。闭环里这类提升更有含金量,因为它不是单点回归,而是整个驾驶过程的综合表现。
闭环结果说明,未来场景预测并没有把系统搞得更保守,反而让它在复杂场景下更敢走、更会走。特别是 EP 的提升,说明模型不仅顾安全,也能维持任务推进。很多自动驾驶方法容易掉进一个坑:安全分数高了,车却像在“原地思考人生”;OWMDrive 至少在这点上没有犯怂。
表3:未来场景预测时长的影响
表3:未来场景预测时长的影响。随着未来预测从 0 秒扩展到 3 秒,L2 误差和碰撞率持续下降,说明“看得更远”确实有用,而且不是玄学。
表4:未引入强化学习时的闭环效果
表4:未引入强化学习时的闭环效果。可以看到,单靠未来场景预测已经有不错提升,但再叠加强化信号后,整体导航质量还能继续往上抬一截,说明强化项主要在修正规划偏好。
表5:强化扩散的作用
表5:强化扩散的作用。加入强化后,DAC 和 EP 明显更好,PDMS 从 88.4 提升到 90.8,说明奖励设计对轨迹质量的确有实际帮助。
把这些结果连起来看,OWMDrive 的提升不是单一模块“碰巧有效”,而是一个连锁反应:未来场景预测让条件更可信,扩散规划让候选轨迹更丰富,强化学习再把安全和任务目标拉回正轨。换句话说,先看未来,再做生成,最后用奖励收口,这条链是通的。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?解决的是端到端自动驾驶里“只看当前、不看未来”带来的规划不稳问题。OWMDrive 先预测未来 4D 占据场景,再把未来信息作为条件输入扩散规划器,让轨迹生成更符合真实场景演化。

4D Occupancy World Model 是什么意思?4D 表示三维空间加时间维度,Occupancy 表示场景中哪些位置被占据。这个模型不是只判断“现在哪儿有车”,而是预测“未来几秒这些占据关系会怎么变”。

GRPO 在这里起什么作用?GRPO 是 Group Relative Policy Optimization,组相对策略优化。它把同一组轨迹采样放在一起比较,用奖励信号强化更安全、更顺滑、更能推进任务的轨迹,帮助扩散规划器从“会生成”走向“会开车”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 先预测未来占据,再把未来条件喂给扩散规划器,这个组合不算凭空造词,但把“前瞻性”真正接进规划链路,思路是扎实的。

实验合理度:★★★★☆ 开环、闭环、消融都做了,而且指标选得比较贴近驾驶任务;不过部分收益来自多模块叠加,仍需更细的分解验证。

学术研究价值:★★★★☆ 把世界模型和生成式规划更紧地绑在一起,对后续研究“如何把未来信息真正用于决策”很有启发。

稳定性:★★★☆☆ 方向是对的,但依赖世界模型预测质量;一旦长尾场景里预测偏了,规划也会跟着偏。

适应性以及泛化能力:★★★☆☆ 在 nuScenes 和 NAVSIM 上表现不错,但是否能跨城市、跨传感器配置稳定泛化,还需要更多验证。

硬件需求及成本:★★☆☆☆ 训练用 8 张 NVIDIA L20,世界模型+扩散+强化三件套都不轻,离“随便一台车机直接跑”还有距离。

复现难度:★★★☆☆ 论文给了主要设定和指标,但整体系统链路较长,复现时要同时搞定世界模型、扩散训练和强化优化,工程量不小。

产品化成熟度:★★★☆☆ 适合做研究型原型和高算力平台验证,但要进真实量产车,还得补推理效率、鲁棒性和极端场景安全验证。

可能的问题:方法链路长、算力重,且因果关系仍是隐式建模;未来预测一旦失真,规划收益会被放大消耗。


主要参考文献

[1] OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model, arXiv:2606.30421v1, 2026.
[2] nuScenes benchmark: 用于自动驾驶感知与规划的多模态真实世界数据集。
[3] NAVSIM benchmark: 面向闭环驾驶评估的非反应式仿真基准。

这类“先看未来再开车”的方法,最怕的不是模型不够大,而是信息不够准、推理不够稳。想继续追自动驾驶、世界模型、扩散规划这些前沿拆解,欢迎加入龙哥读论文星球,每天少走弯路,多看门道。扫描二维码,进群一起把论文拆到骨头里。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。