← 返回 PaperDaily 视觉与图像

告别“走一步看一步”!GraphWorld让自动驾驶学会用潜世界模型“预判未来”

现有的端到端自动驾驶方法大多“走一步看一步”,缺乏长远预判。本文提出的GraphWorld,用潜世界模型为车辆装上“预知眼”,不再生成昂贵的未来视频,而是将交互关系压缩成紧凑的潜世界状态,大幅提升6秒长时域规划的精度和安全性,碰撞率直接砍半。论文已被CVPR 2026接收。

告别“走一步看一步”!GraphWorld让自动驾驶学会用潜世界模型“预判未来”
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
现有的端到端自动驾驶方法大多“走一步看一步”,缺乏长远预判。本文提出的GraphWorld,用潜世界模型为车辆装上“预知眼”,不再生成昂贵的未来视频,而是将交互关系压缩成紧凑的潜世界状态,大幅提升6秒长时域规划的精度和安全性,碰撞率直接砍半。论文已被CVPR 2026接收。


原论文信息如下:
论文标题:
GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving
发表日期:
2026年06月
发表单位:
北京交通大学,燕山大学,南洋理工大学,昆士兰大学,澳门大学
原文链接:
https://arxiv.org/pdf/2606.16274v1.pdf

长时域规划的瓶颈:为什么现有方法“短视”?

想象你开车在双向两车道上,前方有慢车,对向有来车。你需要“先跟车,等对向车流走完再借道超车”的宏观策略。但大多数端到端自动驾驶(E2E-AD)方法只预测未来1~2秒轨迹,然后反复重规划。这种“走一步看一步”的模式,在需要提前博弈的场景中彻底露怯。
学界将目光投向世界模型(World Model),让车辆在潜在空间“想象”未来。但DriveDreamer、Vista等生成未来视频的方法计算量巨大;WoTE、LAW等轻量级模型又只关注像素级预测,对长时域轨迹推理帮助甚微。现有方法要么“看不清长远”,要么“看得清但跑不动”。长时域规划已成为E2E-AD的天花板。
Fig. 2: GraphWorld 的动机示意图。 (a) E2E-AD 方法受限于短时域推理,长期鲁棒性不足。 (b) 世界模型方法能够进行长时域想象但效率低下。 (c) GraphWorld 通过以自我为中心的交互图与潜在世界表示相结合,实现高效的长时域规划。
图 2:GraphWorld 的动机示意图。
在此背景下,来自北京交通大学、南洋理工大学等机构的研究者提出了 GraphWorld(CVPR 2026)。核心思想:不再生成未来视频,而是将自车与周围车辆的交互关系压缩成紧凑的“潜在世界状态”,基于此指导长时域轨迹规划,真正做到“不生成像素,但预知未来”。
插图

GraphWorld:潜在世界模型如何“预知未来”?

GraphWorld 整体框架如图3。输入环视相机和多模态数据,经感知模块提取实例级特征。核心模块:以自我为中心的交互图(ECIG)世界状态条件规划(WSCP)
图 3:GraphWorld 的长时域端到端自动驾驶框架概览。
图 3:GraphWorld 框架概览。
ECIG 从密密匝匝的交通参与者中筛选出关键邻居车辆,编码交互关系为图结构。WSCP 利用图推断的“潜在世界状态”,显式引导多模态轨迹生成,让自车感知未来几秒的风险。最大亮点:用潜在空间表示代替昂贵的视频生成。GraphWorld 在计算效率和预测精度间取得出色平衡——图1显示,速度比 DiffusionDrive 快 13.3%,碰撞率大幅降低。
图 1:NAVSIMv1 上的 SOTA 方法性能对比。
图 1:NAVSIMv1 性能对比。

以自我为中心的交互图:精准抓取关键交互

GraphWorld 的策略是只关注对决策真正重要的邻居。ECIG 根据空间距离为自车动态挑选固定数量邻居(距离阈值τ),通过“填充/修剪”得到固定大小K邻居集。自车和邻居构成星型拓扑有向图,自车规划查询通过交叉注意力聚合邻居特征,实现交互信息结构化编码。
为实现长时域世界感知,ECIG 将交互信息与历史轨迹、地图语义融合,通过循环世界编码器得到累积世界上下文 st,再经交叉注意力和残差注入生成每个节点的潜在世界状态 wi。最终得到结构化潜在世界表示 W = {w1, ..., wK, wN, wego}(N=900,未选中节点零填充)。这个表示就是后续规划的“上帝视角”。

世界状态条件规划:安全引导轨迹生成

WSCP 包含三个关键步骤:
流匹配动态世界状态。 引入条件流匹配[42]学习时间依赖速度场,将当前世界状态 Wcur 运输到目标状态 Wtgt。训练时最小化预测与真实速度场差异;推理时仅需两步Euler更新,非常高效。
重要性重加权。 利用轻量级两层MLP网络 fimp 为每个运动模态生成权重α,抑制不靠谱假设,强调符合未来交互趋势的假设。
世界到自车反馈。 精炼后的世界状态通过残差调制修正自车规划查询,使每个轨迹假设感知未来交互风险。
下表显示,GraphWorld 在 nuScenes 验证集6秒规划中,平均碰撞率仅0.70%,比 MomAD(0.90%)降低22%,比 World4Drive(0.87%)降低19.5%。轨迹位移误差(L2)也全面领先。
表 1:nuScenes 验证集上 6 秒长时域规划的规划结果。
表 1:nuScenes 6秒规划结果。

两阶段训练:让世界状态“呼吸”时间信息

第一阶段:单步世界状态学习。 仅用当前时刻t输入,端到端训练感知、预测和规划,让世界状态学会编码交互语义。
第二阶段:时间世界状态一致性学习。 引入t+1时刻观测,用ℓ2回归损失强制预测的Wt+1与Wt在潜在空间保持一致。总损失 L = Ltask + λ Ltemporal。消融实验(表14)表明,第二阶段显著提升长时域规划性能,尤其5~6秒碰撞率下降明显。

实验验证:全面超越,碰撞率降低19.5%

GraphWorld 在 Bench2Drive、NAVSIMv1/v2、nuScenes 等基准上全面评估,在几乎所有指标上取得最佳,尤其擅长6秒长时域规划和安全性。
Bench2Drive 闭环结果。 表2显示,GraphWorld 在 Driving Score、Success Rate 等五项技能上大幅超越之前SOTA。无额外蒸馏下表现更优。
表 2:在 Bench2Drive (V0.0.3) 基本训练集上的开环、闭环和多能力结果。
表 2:Bench2Drive 结果。
NAVSIMv1/v2 闭环结果。 表3显示,GraphWorld 在 NC、DAC、TTC 等指标全面领先,推理速度比 DiffusionDrive 快13.3%。表4、表5为 NAVSIMv2 结果。
表 3:NAVSIMv1 navtest 分割上的闭环指标对比。
表 3:NAVSIMv1 结果。
nuScenes 长时域规划与鲁棒性。 除表1的6秒规划,GraphWorld 在3秒短时域(表6)也保持最优。在 Adv-nuSc 上平均碰撞率1.27%,比第二好方法低50%以上(表8)。Turning-nuScenes 上轨迹一致性远胜其他方法。图4、图5展示了6秒可视化结果。
图 4:GraphWorld 在 nuScenes 数据集上的 6 秒长时域规划可视化。
图 4:nuScenes 6秒可视化。
图 5:GraphWorld 在 NAVSIMv1 数据集上的可视化。
图 5:NAVSIMv1 可视化。
消融实验(表11~18)证明每个模块有效性:ECIG邻居选择策略至关重要,Flow-Matching优于扩散模型,两阶段训练带来显著增益。GraphWorld 在精度、效率和鲁棒性上实现“三杀”。

龙迷三问

1. “潜在世界状态”代表什么?与生成视频的世界模型有何区别?传统世界模型生成未来视频,计算量巨大;GraphWorld的“潜在世界状态”是紧凑向量,只编码自车与关键邻居的交互动力学,不依赖视觉生成。前者模拟整个物理世界,后者只关心对规划最重要的交互关系。

2. ECIG如何选择邻居?先根据距离阈值τ选出候选,再通过“填充/修剪”强制固定为K个(约10个)。只选近距离车辆,远距离影响很小。稀疏化设计显著降低计算量,效果优于全连接图。

3. 两阶段训练是否必要?消融实验表明必要:仅第一阶段世界状态缺乏时间连续性;加上第二阶段后5~6秒碰撞率显著下降。直接一起训可能让世界状态陷入局部最优。

欢迎在评论区留言讨论~

龙哥点评

论文创新性分数:★★★★☆

将世界模型从像素生成转向关系图潜在表示,ECIG和WSCP设计有新意,但整体仍属“世界模型+图神经网络”方向。

实验合理度:★★★★★

对比方法全面,涵盖多种场景,消融实验完整。代码未开源稍显遗憾。

学术研究价值:★★★★☆

为长时域规划提供有效新思路,未来可探索更精细交互建模或闭环训练。

稳定性:★★★★☆

闭环测试表现出色,但完全依赖潜在世界状态,可能遗漏极端边缘情况。

适应性以及泛化能力:★★★★☆

在多个数据集和退化/对抗数据上有效,泛化能力不错,但极端情况有待更多测试。

硬件需求及成本:★★★★☆

推理仅需2步Euler更新,速度优于DiffusionDrive,但训练仍需多GPU。

复现难度:★★★☆☆

公式和流程详细,但代码未开源,两阶段训练和超参数调优有一定工作量。

产品化成熟度:★★★☆☆

学术验证阶段,离车规级量产还有距离。

可能的问题:潜在世界状态只编码有限交互信息,对需要丰富视觉理解的任务可能不足;两阶段训练增加部署复杂性。


主要参考文献

[1] Ziying Song, et al. "GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving." CVPR 2026. arXiv:2606.16274.
[2] Hu, Y., et al. "Planning-oriented Autonomous Driving." CVPR 2023. (UniAD)
[3] Jiang, B., et al. "VAD: Vectorized Autonomous Driving." ICCV 2023.
[4] Wang, X., et al. "MomAD: Momentum-based Multi-modal Trajectory Planning for Autonomous Driving." CVPR 2025.
[5] Chen, L., et al. "SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation." ICRA 2025.
[6] Hu, A., et al. "DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving." ECCV 2024.
[7] WoTE: "World Model on the Edge for Autonomous Driving." ICCV 2025.
[8] World4Drive: "World Model as a Guide for End-to-End Autonomous Driving." (2024)

*本文仅代表个人理解及观点。欢迎就论文内容交流探讨。想了解更多原文细节,可点击"阅读原文"

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或添加龙哥助手微信号加群:kangjinlonghelper。备注:研究方向+地点+学校/公司+昵称
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。