← 返回 PaperDaily
视觉与图像
告别“走一步看一步”!GraphWorld让自动驾驶学会用潜世界模型“预判未来”
现有的端到端自动驾驶方法大多“走一步看一步”,缺乏长远预判。本文提出的GraphWorld,用潜世界模型为车辆装上“预知眼”,不再生成昂贵的未来视频,而是将交互关系压缩成紧凑的潜世界状态,大幅提升6秒长时域规划的精度和安全性,碰撞率直接砍半。论文已被CVPR 2026接收。
龙哥读论文
发布于 2026-08-19 00:20:08
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 现有的端到端自动驾驶方法大多“走一步看一步”,缺乏长远预判。本文提出的GraphWorld,用潜世界模型为车辆装上“预知眼”,不再生成昂贵的未来视频,而是将交互关系压缩成紧凑的潜世界状态,大幅提升6秒长时域规划的精度和安全性,碰撞率直接砍半。论文已被CVPR 2026接收。
原论文信息如下:
长时域规划的瓶颈:为什么现有方法“短视”?
想象你开车在双向两车道上,前方有慢车,对向有来车。你需要“先跟车,等对向车流走完再借道超车”的宏观策略。但大多数端到端自动驾驶(E2E-AD)方法只预测未来1~2秒轨迹,然后反复重规划。这种“走一步看一步”的模式,在需要提前博弈的场景中彻底露怯。
学界将目光投向世界模型(World Model),让车辆在潜在空间“想象”未来。但DriveDreamer、Vista等生成未来视频的方法计算量巨大;WoTE、LAW等轻量级模型又只关注像素级预测,对长时域轨迹推理帮助甚微。现有方法要么“看不清长远”,要么“看得清但跑不动”。长时域规划已成为E2E-AD的天花板。
在此背景下,来自北京交通大学、南洋理工大学等机构的研究者提出了 GraphWorld (CVPR 2026)。核心思想:不再生成未来视频,而是将自车与周围车辆的交互关系压缩成紧凑的“潜在世界状态” ,基于此指导长时域轨迹规划,真正做到“不生成像素,但预知未来”。
GraphWorld:潜在世界模型如何“预知未来”?
GraphWorld 整体框架如图3。输入环视相机和多模态数据,经感知模块提取实例级特征。核心模块:以自我为中心的交互图(ECIG) 和 世界状态条件规划(WSCP) 。
ECIG 从密密匝匝的交通参与者中筛选出关键邻居车辆 ,编码交互关系为图结构。WSCP 利用图推断的“潜在世界状态”,显式引导多模态轨迹生成 ,让自车感知未来几秒的风险。最大亮点:用潜在空间表示代替昂贵的视频生成 。GraphWorld 在计算效率和预测精度间取得出色平衡——图1显示,速度比 DiffusionDrive 快 13.3% ,碰撞率大幅降低。
以自我为中心的交互图:精准抓取关键交互
GraphWorld 的策略是只关注对决策真正重要的邻居 。ECIG 根据空间距离为自车动态挑选固定数量邻居(距离阈值τ),通过“填充/修剪”得到固定大小K邻居集。自车和邻居构成星型拓扑有向图,自车规划查询通过交叉注意力聚合邻居特征,实现交互信息结构化编码。
为实现长时域世界感知,ECIG 将交互信息与历史轨迹、地图语义融合,通过循环世界编码器得到累积世界上下文 st,再经交叉注意力和残差注入生成每个节点的潜在世界状态 wi。最终得到结构化潜在世界表示 W = {w1, ..., wK, wN, wego}(N=900,未选中节点零填充)。这个表示就是后续规划的“上帝视角”。
世界状态条件规划:安全引导轨迹生成
流匹配动态世界状态。 引入条件流匹配[42]学习时间依赖速度场,将当前世界状态 Wcur 运输到目标状态 Wtgt。训练时最小化预测与真实速度场差异;推理时仅需两步Euler更新,非常高效。
重要性重加权。 利用轻量级两层MLP网络 fimp 为每个运动模态生成权重α,抑制不靠谱假设,强调符合未来交互趋势的假设。
世界到自车反馈。 精炼后的世界状态通过残差调制修正自车规划查询,使每个轨迹假设感知未来交互风险。
下表显示,GraphWorld 在 nuScenes 验证集6秒规划中,平均碰撞率仅0.70%,比 MomAD(0.90%)降低22%,比 World4Drive(0.87%)降低19.5%。轨迹位移误差(L2)也全面领先。
两阶段训练:让世界状态“呼吸”时间信息
第一阶段:单步世界状态学习。 仅用当前时刻t输入,端到端训练感知、预测和规划,让世界状态学会编码交互语义。
第二阶段:时间世界状态一致性学习。 引入t+1时刻观测,用ℓ2回归损失强制预测的Wt+1与Wt在潜在空间保持一致。总损失 L = Ltask + λ Ltemporal。消融实验(表14)表明,第二阶段显著提升长时域规划性能,尤其5~6秒碰撞率下降明显。
实验验证:全面超越,碰撞率降低19.5%
GraphWorld 在 Bench2Drive、NAVSIMv1/v2、nuScenes 等基准上全面评估,在几乎所有指标上取得最佳,尤其擅长6秒长时域规划和安全性。
Bench2Drive 闭环结果。 表2显示,GraphWorld 在 Driving Score、Success Rate 等五项技能上大幅超越之前SOTA。无额外蒸馏下表现更优。
NAVSIMv1/v2 闭环结果。 表3显示,GraphWorld 在 NC、DAC、TTC 等指标全面领先,推理速度比 DiffusionDrive 快13.3%。表4、表5为 NAVSIMv2 结果。
nuScenes 长时域规划与鲁棒性。 除表1的6秒规划,GraphWorld 在3秒短时域(表6)也保持最优。在 Adv-nuSc 上平均碰撞率1.27%,比第二好方法低50%以上(表8)。Turning-nuScenes 上轨迹一致性远胜其他方法。图4、图5展示了6秒可视化结果。
消融实验(表11~18)证明每个模块有效性:ECIG邻居选择策略至关重要,Flow-Matching优于扩散模型,两阶段训练带来显著增益。GraphWorld 在精度、效率和鲁棒性上实现“三杀”。
龙迷三问
1. “潜在世界状态”代表什么?与生成视频的世界模型有何区别? 传统世界模型生成未来视频,计算量巨大;GraphWorld的“潜在世界状态”是紧凑向量,只编码自车与关键邻居的交互动力学,不依赖视觉生成。前者模拟整个物理世界,后者只关心对规划最重要的交互关系。
2. ECIG如何选择邻居? 先根据距离阈值τ选出候选,再通过“填充/修剪”强制固定为K个(约10个)。只选近距离车辆,远距离影响很小。稀疏化设计显著降低计算量,效果优于全连接图。
3. 两阶段训练是否必要? 消融实验表明必要:仅第一阶段世界状态缺乏时间连续性;加上第二阶段后5~6秒碰撞率显著下降。直接一起训可能让世界状态陷入局部最优。
龙哥点评
论文创新性分数: ★★★★☆
将世界模型从像素生成转向关系图潜在表示,ECIG和WSCP设计有新意,但整体仍属“世界模型+图神经网络”方向。
实验合理度: ★★★★★
对比方法全面,涵盖多种场景,消融实验完整。代码未开源稍显遗憾。
学术研究价值: ★★★★☆
为长时域规划提供有效新思路,未来可探索更精细交互建模或闭环训练。
稳定性: ★★★★☆
闭环测试表现出色,但完全依赖潜在世界状态,可能遗漏极端边缘情况。
适应性以及泛化能力: ★★★★☆
在多个数据集和退化/对抗数据上有效,泛化能力不错,但极端情况有待更多测试。
硬件需求及成本: ★★★★☆
推理仅需2步Euler更新,速度优于DiffusionDrive,但训练仍需多GPU。
复现难度: ★★★☆☆
公式和流程详细,但代码未开源,两阶段训练和超参数调优有一定工作量。
产品化成熟度: ★★★☆☆
学术验证阶段,离车规级量产还有距离。
可能的问题: 潜在世界状态只编码有限交互信息,对需要丰富视觉理解的任务可能不足;两阶段训练增加部署复杂性。
主要参考文献
[1] Ziying Song, et al. "GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving." CVPR 2026. arXiv:2606.16274.
[2] Hu, Y., et al. "Planning-oriented Autonomous Driving." CVPR 2023. (UniAD)
[3] Jiang, B., et al. "VAD: Vectorized Autonomous Driving." ICCV 2023.
[4] Wang, X., et al. "MomAD: Momentum-based Multi-modal Trajectory Planning for Autonomous Driving." CVPR 2025.
[5] Chen, L., et al. "SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation." ICRA 2025.
[6] Hu, A., et al. "DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving." ECCV 2024.
[7] WoTE: "World Model on the Edge for Autonomous Driving." ICCV 2025.
[8] World4Drive: "World Model as a Guide for End-to-End Autonomous Driving." (2024)
*本文仅代表个人理解及观点。欢迎就论文内容交流探讨。想了解更多原文细节,可点击 "阅读原文" 。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或添加龙哥助手微信号加群 :kangjinlonghelper。
备注:研究方向+地点+学校/公司+昵称 。