← 返回 PaperDaily 视觉与图像

中山大学最新研究:让自动驾驶先“脑补”未来,再“反思”轨迹,4B模型SOTA效果亮眼8B

大多数自动驾驶模型都是“一条路走到黑”,直接生成轨迹,却不知道这轨迹未来会导出什么结果。中山大学等机构提出的IRR-Drive模型,让智能体先“预设意图”,再通过预测未来BEV可视化地“反思”一遍,最后才修正轨迹。这种做法在NAVSIM v1/v2两个权威榜单上都拿到SOTA,而且仅用4B参数就能干翻不少8B模型,性价比拉满。

中山大学最新研究:让自动驾驶先“脑补”未来,再“反思”轨迹,4B模型SOTA效果亮眼8B
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
大多数自动驾驶模型都是“一条路走到黑”,直接生成轨迹,却不知道这轨迹未来会导出什么结果。中山大学等机构提出的IRR-Drive模型,让智能体先“预设意图”,再通过预测未来BEV可视化地“反思”一遍,最后才修正轨迹。这种做法在NAVSIM v1/v2两个权威榜单上都拿到SOTA,而且仅用4B参数就能干翻不少8B模型,性价比拉满。


原论文信息如下:
论文标题:
Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving
发表日期: 2026年06月
发表单位: 中山大学, 香港科技大学(广州), 银旺智能科技有限公司
原文链接: https://arxiv.org/pdf/2606.22913v1.pdf
引言
现在的自动驾驶模型多半是单次生成的,输入图像,直接吐出一条轨迹。这种做法虽然快,但是忽略了很重要的一点:这个轨迹在未来会导致什么后果?会不会撞上突然窜出的行人?会不会偏离车道?说白了,就是没有“反思”机制。就像下棋时,高手都会多想几步,而不是只看眼前这一步。
为了解决这个问题,中山大学等机构联合提出了一个叫做 IRR-Drive 的框架,全称是“Intend, Reflect, Refine”(意图、反思、修正)。它的核心思想就是让模型先生成一个初步的轨迹意图,然后预测这个意图在未来几秒钟会导致的鸟瞰图(BEV),借助视觉化的未来场景来检测潜在风险,最后再对轨迹进行修正。
更厉害的是,IRR-Drive 并不是在所有场景下都无脑“反思”,而是学会了一种 自适应反思 策略:简单情况下直接输出轨迹,只有遇到复杂情况时才启动反思,做到了效率与性能的兼得。
最终,这个 4B 参数的模型在 NAVSIM v1 和 v2 两个权威自动驾驶规划榜单上,以 91.3 PDMS 和 89.0 EPDMS 的成绩拿下 SOTA,甚至把不少 8B 参数的模型都甩在了身后。

痛点分析:现有方法因“单次生成”和“无物理后果评估”,在动态场景中可靠性受限

现有VLA模型大多是“单次生成”的——输入多视角图像,直接吐出一条轨迹。虽然有些模型也加了文本推理,但这些推理更像是事后解释,并没有真正用来评估和修正即将输出的轨迹。模型缺乏一个关键的“反思”环节:先想象一下如果按这个轨迹开下去,未来几秒会发生什么,再决定要不要改。这就像下棋只考虑当前步,在复杂博弈中很容易翻车。在自动驾驶领域,复杂动态场景下(比如密集路口、鬼探头),这种“单次生成”的可靠性就大打折扣。
插图
图1:IRR-Drive的整体视觉概览。模型通过三个渐进阶段学习。首先在驾驶世界理解和未来BEV生成上预训练;然后微调模型,在简单场景直接执行,在挑战性场景使用基于BEV的反思来学习自适应推理;最后使用强化学习,结合多个奖励函数来优化策略。右侧结果显示,IRR-Drive-4B在NAVSIM基准上以较小的参数量取得了极具竞争力的PDMS和优越的EPDMS分数。
插图

核心创新:IRR-Drive通过预测未来BEV,构建“文本+BEV”双模态反思空间,实现轨迹的自我修正

中山大学联合香港科技大学(广州)、银旺智能科技的研究者们,提出了一个很有意思的框架:IRR-Drive(Intend, Reflect, Refine——意图、反思、修正)
它的核心创新就一句话:让模型先“脑补”未来,再修正轨迹。具体来说,IRR-Drive先生成一个初步的轨迹意图(Intend),然后基于这个意图和当前场景,预测未来几秒的语义鸟瞰图(BEV),构建一个“文本+BEV”的双模态反思空间(Reflect),最后根据这个反思结果修正初始意图,输出最终轨迹(Refine)。为什么是双模态?因为单靠文本推理太粗糙——你说“前方有车要变道”,但具体距离、速度都说不清楚。而BEV保留了精确的几何信息,两者结合,就像人类司机既靠语言逻辑又靠空间直觉,互为补充。
为了将这个反思机制融入VLA框架,论文设计了一个语义BEV分词器(Semantic BEV Tokenizer),将连续的BEV图像离散化为一系列code token,这样VLM就能以自回归的方式同时处理文本和BEV token。
插图
图2:IRR-Drive是一个端到端自动驾驶框架,能够根据场景复杂度自适应选择“非反思”与“反思”模式。在反思框架内,它整合了视觉和文本推理来修正意图和轨迹。在强化学习阶段,结合了包括PDMS、格式、OBB奖励以及所提出的自适应反思奖励在内的多种奖励。
从图2可以看到,IRR-Drive的整体架构非常清晰:多视角图像输入后,经过视觉编码器,与历史轨迹、自车状态一起送入VLM。VLM首先输出一个初始轨迹意图(文本),然后预测未来BEV(视觉反思),再生成反思文本,最后输出修正后的轨迹。整个过程就是“Intend → Reflect → Refine”三步骤。

高效方案:场景自适应反思机制,让模型只在复杂场景调用反思,平衡规划性能与推理效率

如果每个场景都先反思再开车,那就太慢了——高速巡航、空旷直道也非要“想一想”才能走,推理时间直接翻倍。所以IRR-Drive设计了一个自适应反思(Adaptive Reflection)策略:简单场景直接输出轨迹,只有模型判断为挑战性场景时才启动多模态反思。
这个自适应通过两个阶段训练实现:第一步:数据构建。先训练一个基础VLA规划器,用它的预测PDMS分数将NAVSIM训练集划分为简单场景和挑战性场景。简单场景直接存为“意图→最终轨迹”,挑战性场景则额外生成未来BEV和反思文本,构成多模态反思数据。如图3所示。
插图
图3:(a) 使用轻量微调规划器基于预测PDMS将NAVSIM训练集划分为挑战性和简单场景;(b) 模拟器生成未来BEV表示,LLM生成轨迹意图;(c) VLM生成基于BEV的反思文本;(d) 简单和挑战性场景最终的数据结构。
第二步:两阶段监督微调。第一阶段在驾驶VQA数据和BEV重建/预测数据上预训练,让模型学会感知可行驶区域并将多视图图像映射到BEV。第二阶段用轨迹规划数据和反思数据进行监督微调(SFT),让模型具备两种模式:简单场景走“非反思”通道,挑战性场景走“反思”通道。
来看一个直观的对比结果——表3展示了不同推理模式下的性能。
插图
表3:不同推理模式的对比。运行时间表示在NAVTEST上每个样本的平均推理时间,在单张H800 GPU上测量。
可以看到,纯反射模式(Reflection)虽然PDMS略高(90.8 vs 90.6),但推理时间从1.46秒暴涨到3.03秒,翻了一倍多。而IRR-Drive的自适应模式仅用1.70秒就达到了91.3,既比非反射高、又比全反射快得多——这就是“把钱花在刀刃上”的智慧。

优化利器:提出同心OBB-FDE奖励与自适应反思奖励,协同强化学习实现更优策略

经过SFT之后,模型已经有了反思能力,但它是从静态的专家数据中学出来的。为了进一步优化闭环规划性能,论文引入了强化学习(RL)阶段,使用GSPO进行序列级优化,避免长序列偏差。
奖励函数由四个部分组成,其中最亮眼的是两个新设计的奖励:
① 同心OBB-FDE奖励(Concentric OBB-FDE Reward):传统的终点误差(FDE)是连续距离惩罚,容易让模型过拟合到次优的人类轨迹。本文设计了一个分级的、基于朝向感知的定向包围盒(OBB)的奖励:以专家终点为中心,设置一系列同心缩放比的OBB,预测终点落在哪个框内就获得对应的递减奖励。这样既鼓励精确性,又给RL探索留有余地。
② 自适应反思奖励(Adaptive Reflection Reward):为了防止模型在RL训练中退化为单一模式(比如全部选择反思或全部不反思),该奖励动态地根据场景复杂度和当前策略的PDMS分数来调整:简单场景强制非反思;挑战场景中,如果当前rollout的PDMS已经高于阈值τ,允许不反思,否则必须反思。这样模型就能学会“什么时候该想,什么时候该直接做”。
插图
图4:(a) 同心OBB-FDE奖励在专家终点周围使用朝向感知的包围盒分配层级终点奖励。(b) 自适应反思奖励在简单场景中鼓励直接预测,在挑战场景中仅当当前rollout已达到足够高的PDMS时才允许不反思。
另外两个基础奖励是:PDMS奖励(直接使用NAVSIM模拟器给出的闭环分数)和格式奖励(确保输出的轨迹格式正确)。
消融实验(表4)清晰地展示了每个奖励的贡献:
插图
表4:奖励函数的消融实验。Refl. Ratio表示在NAVTEST推理中采用反思的样本比例。
仅用PDMS奖励时,PDMS只有88.9,且反思率暴跌至1.9%。加入自适应反思奖励后,PDMS升至90.5,反思率恢复至22.9%。再叠加上同心OBB-FDE奖励,PDMS达到最高的91.3,同时保持稳定的20.6%反思率。可见两个新设计的奖励都起到了关键作用。

效果验证:NAVSIM v1/v2两项基准上取得SOTA,以4B参数超越8B模型,验证多模态反思的有效性

IRR-Drive在NAVSIM v1和NAVSIM v2两个权威闭环规划基准上进行了全面评估。下面直接看结果。
插图
表1:NAVSIM v1上的对比。缩写:Diff. (扩散), Comf. (舒适度), Cam (相机), L (激光雷达)。
在NAVSIM v1上,IRR-Drive-4B以91.3 PDMS排名第一(与LaST-VLA-8B并列),但其参数量只有4B,而LaST-VLA-8B是8B模型。在DAC(可行驶区域合规率)上达到98.3,EP(自车进度)达到88.5,均为最高。即使IRR-Drive-3B也达到了90.6,超过了多数8B方法。
插图
表2:NAVSIM v2上使用EPDMS的最先进方法对比。EPDMS是扩展的预测驾驶模型分数(Extended PDMS),包含更多子指标。
在更难的NAVSIM v2上,IRR-Drive-4B的优势更为显著:EPDMS达到89.0,比之前最好的ELF-VLA-8B(87.1)高出+1.9,同时EP(自车进度)92.3也是最高。这说明多模态反思在复杂场景中带来的收益更大。
此外,表5的消融实验也验证了“文本+BEV”双模态反射的必要性:单独用文本或单独用BEV在RL后PDMS分别为90.6和90.5,而两者结合能达到91.3,证明了互补性。
插图
表5:CoT内容的消融。文本+BEV推理在SFT和RL阶段都取得了最佳性能,表明文本推理与BEV反射的互补性。
插图

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:IRR-Drive的“反思”到底是怎么工作的?能举一个具体的例子吗?A1:假设场景是:自车在路口右转,右方有摩托车快速接近。IRR-Drive先根据当前图像生成一个初始意图文本:“右转,速度15km/h”。然后,它基于这个意图预测未来3秒的BEV,BEV中显示出摩托车将在自车右转后1.5秒进入自车路径。VLM看到这个BEV后生成反思文本:“检测到右侧摩托车冲突,建议减速并等待”。最后,模型修正意图为:“先减速至5km/h,确认安全后再右转”,并输出对应的轨迹点。

Q2:文中提到的NAVSIM v1和v2有什么区别?为什么说v2更难?A2:NAVSIM v1是基础的闭环规划基准,主要用PDMS评分(包含NC、DAC、TTC、舒适度、自车进度5个指标)。NAVSIM v2是扩展版,引入了更多指标(如DDC、TLC、LK、HC、EC等)和更复杂的场景,因此EPDMS(扩展PDMS)的满分范围更广,整体分数更低,挑战性更大。

Q3:为什么IRR-Drive只用4B参数就能超过8B模型?核心竞争力在哪?A3:核心在于它用更聪明的“反思”机制替代了堆参数。8B模型可能依赖更大的容量来记忆海量驾驶模式,但依然缺乏主动评估未来后果的能力。IRR-Drive通过多模态反思,在规划过程中引入了基于BEV的“模拟-检查-修正”步骤,相当于用更强的算法设计来弥补参数量的不足。另外,自适应反思策略也只在小部分场景中增加推理成本,整体效率高。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

将多模态反思(文本+BEV预测)引入VLA规划,并设计了自适应反思机制和同心OBB奖励,整体创新度较高。但单个模块并非完全新创,组合创新为主。

实验合理度:★★★★★

在NAVSIM v1和v2双基准上与15+种方法对比,消融实验设计完整,覆盖奖励函数、模态组合、训练阶段等,结果可信度高。

学术研究价值:★★★★✰

为VLA领域提供了“反思必须扎根于物理后果”的新视角,探索了BEV作为反思空间的可行性,对后续工作有启发意义。

稳定性:★★★★✰

闭环仿真中表现稳定,但非反应式仿真与实际道路仍有差距。方法对BEV预测的准确性依赖较强。

适应性以及泛化能力:★★★★✰

在NAVSIM的多种场景(城区、高速)都有效,但训练数据来自模拟器,直接迁移到真实世界可能需要额外fine-tune。

硬件需求及成本:★★★✰✰

基础模型为Qwen2.5-VL-3B/ Qwen3-VL-4B,推理时需H800 GPU,自适应模式下平均1.7秒/样本。训练阶段需要模拟器生成BEV和反思数据,成本较高。

复现难度:★★✰✰✰

论文未开源代码,数据构建流程复杂,复现门槛较高。

产品化成熟度:★★✰✰✰

目前还在仿真阶段,推理速度1.7秒对实时驾驶(100ms)还差一个数量级,但思想可以作为高级规划模块的参考。

可能的问题:① 论文未展示在真实驾驶场景的测试结果。② 自适应阈值τ的设定需要手动调参。③ 反思阶段引入的额外延迟在高速场景下可能不够及时。


主要参考文献

[1] Chen et al. “Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving”. arXiv:2606.22913, 2026.
[2] NAVSIM: Da et al. “NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking”. CoRL 2024.
[3] ELF-VLA: Hu et al. “ELF-VLA: Efficient Learning from Failure for Vision-Language-Action in Autonomous Driving”. NeurIPS 2025.
[4] LaST-VLA: Zhang et al. “LaST-VLA: Latent Space Transformer for Vision-Language-Action Driving”. CVPR 2026.
[5] Qwen2.5-VL: Bai et al. “Qwen2.5-VL Technical Report”. arXiv:2502.13923, 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想让你的自动驾驶模型也学会“先想后做”?加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 自动驾驶+上海+中山大学+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。