← 返回 PaperDaily
视觉与图像
中山大学最新研究:让自动驾驶先“脑补”未来,再“反思”轨迹,4B模型SOTA效果亮眼8B
大多数自动驾驶模型都是“一条路走到黑”,直接生成轨迹,却不知道这轨迹未来会导出什么结果。中山大学等机构提出的IRR-Drive模型,让智能体先“预设意图”,再通过预测未来BEV可视化地“反思”一遍,最后才修正轨迹。这种做法在NAVSIM v1/v2两个权威榜单上都拿到SOTA,而且仅用4B参数就能干翻不少8B模型,性价比拉满。
龙哥读论文
发布于 2026-08-14 09:10:44
阅读 5
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 大多数自动驾驶模型都是“一条路走到黑”,直接生成轨迹,却不知道这轨迹未来会导出什么结果。中山大学等机构提出的IRR-Drive模型,让智能体先“预设意图”,再通过预测未来BEV可视化地“反思”一遍,最后才修正轨迹。这种做法在NAVSIM v1/v2两个权威榜单上都拿到SOTA,而且仅用4B参数就能干翻不少8B模型,性价比拉满。
原论文信息如下:
现在的自动驾驶模型多半是单次生成的,输入图像,直接吐出一条轨迹。这种做法虽然快,但是忽略了很重要的一点:这个轨迹在未来会导致什么后果?会不会撞上突然窜出的行人?会不会偏离车道?说白了,就是没有“反思”机制。就像下棋时,高手都会多想几步,而不是只看眼前这一步。
为了解决这个问题,中山大学等机构联合提出了一个叫做 IRR-Drive 的框架,全称是“Intend, Reflect, Refine”(意图、反思、修正)。它的核心思想就是让模型先生成一个初步的轨迹意图,然后预测这个意图在未来几秒钟会导致的鸟瞰图(BEV),借助视觉化的未来场景来检测潜在风险,最后再对轨迹进行修正。
更厉害的是,IRR-Drive 并不是在所有场景下都无脑“反思”,而是学会了一种 自适应反思 策略:简单情况下直接输出轨迹,只有遇到复杂情况时才启动反思,做到了效率与性能的兼得。
最终,这个 4B 参数的模型在 NAVSIM v1 和 v2 两个权威自动驾驶规划榜单上,以 91.3 PDMS 和 89.0 EPDMS 的成绩拿下 SOTA,甚至把不少 8B 参数的模型都甩在了身后。
痛点分析:现有方法因“单次生成”和“无物理后果评估”,在动态场景中可靠性受限
现有VLA模型大多是“单次生成”的——输入多视角图像,直接吐出一条轨迹。虽然有些模型也加了文本推理,但这些推理更像是事后解释,并没有真正用来评估和修正即将输出的轨迹。模型缺乏一个关键的“反思”环节:先想象一下如果按这个轨迹开下去,未来几秒会发生什么,再决定要不要改。这就像下棋只考虑当前步,在复杂博弈中很容易翻车。在自动驾驶领域,复杂动态场景下(比如密集路口、鬼探头),这种“单次生成”的可靠性就大打折扣。
核心创新:IRR-Drive通过预测未来BEV,构建“文本+BEV”双模态反思空间,实现轨迹的自我修正
中山大学联合香港科技大学(广州)、银旺智能科技的研究者们,提出了一个很有意思的框架:IRR-Drive(Intend, Reflect, Refine——意图、反思、修正) 。
它的核心创新就一句话:让模型先“脑补”未来,再修正轨迹 。具体来说,IRR-Drive先生成一个初步的轨迹意图(Intend),然后基于这个意图和当前场景,预测未来几秒的语义鸟瞰图(BEV),构建一个“文本+BEV”的双模态反思空间(Reflect),最后根据这个反思结果修正初始意图,输出最终轨迹(Refine)。为什么是双模态?因为单靠文本推理太粗糙——你说“前方有车要变道”,但具体距离、速度都说不清楚。而BEV保留了精确的几何信息,两者结合,就像人类司机既靠语言逻辑又靠空间直觉,互为补充。
为了将这个反思机制融入VLA框架,论文设计了一个语义BEV分词器(Semantic BEV Tokenizer) ,将连续的BEV图像离散化为一系列code token,这样VLM就能以自回归的方式同时处理文本和BEV token。
从图2可以看到,IRR-Drive的整体架构非常清晰:多视角图像输入后,经过视觉编码器,与历史轨迹、自车状态一起送入VLM。VLM首先输出一个初始轨迹意图(文本),然后预测未来BEV(视觉反思),再生成反思文本,最后输出修正后的轨迹。整个过程就是“Intend → Reflect → Refine”三步骤。
高效方案:场景自适应反思机制,让模型只在复杂场景调用反思,平衡规划性能与推理效率
如果每个场景都先反思再开车,那就太慢了——高速巡航、空旷直道也非要“想一想”才能走,推理时间直接翻倍。所以IRR-Drive设计了一个自适应反思(Adaptive Reflection) 策略:简单场景直接输出轨迹,只有模型判断为挑战性场景时才启动多模态反思。
这个自适应通过两个阶段训练实现:第一步:数据构建。 先训练一个基础VLA规划器,用它的预测PDMS分数将NAVSIM训练集划分为简单场景和挑战性场景。简单场景直接存为“意图→最终轨迹”,挑战性场景则额外生成未来BEV和反思文本,构成多模态反思数据。如图3所示。
第二步:两阶段监督微调。 第一阶段在驾驶VQA数据和BEV重建/预测数据上预训练,让模型学会感知可行驶区域并将多视图图像映射到BEV。第二阶段用轨迹规划数据和反思数据进行监督微调(SFT),让模型具备两种模式:简单场景走“非反思”通道,挑战性场景走“反思”通道。
来看一个直观的对比结果——表3展示了不同推理模式下的性能。
可以看到,纯反射模式(Reflection)虽然PDMS略高(90.8 vs 90.6),但推理时间从1.46秒暴涨到3.03秒,翻了一倍多。而IRR-Drive的自适应模式仅用1.70秒就达到了91.3,既比非反射高、又比全反射快得多——这就是“把钱花在刀刃上”的智慧。
优化利器:提出同心OBB-FDE奖励与自适应反思奖励,协同强化学习实现更优策略
经过SFT之后,模型已经有了反思能力,但它是从静态的专家数据中学出来的。为了进一步优化闭环规划性能,论文引入了强化学习(RL) 阶段,使用GSPO进行序列级优化,避免长序列偏差。
奖励函数由四个部分组成,其中最亮眼的是两个新设计的奖励:
① 同心OBB-FDE奖励(Concentric OBB-FDE Reward) :传统的终点误差(FDE)是连续距离惩罚,容易让模型过拟合到次优的人类轨迹。本文设计了一个分级的、基于朝向感知的定向包围盒(OBB)的奖励:以专家终点为中心,设置一系列同心缩放比的OBB,预测终点落在哪个框内就获得对应的递减奖励。这样既鼓励精确性,又给RL探索留有余地。
② 自适应反思奖励(Adaptive Reflection Reward) :为了防止模型在RL训练中退化为单一模式(比如全部选择反思或全部不反思),该奖励动态地根据场景复杂度和当前策略的PDMS分数来调整:简单场景强制非反思;挑战场景中,如果当前rollout的PDMS已经高于阈值τ,允许不反思,否则必须反思。这样模型就能学会“什么时候该想,什么时候该直接做”。
另外两个基础奖励是:PDMS奖励 (直接使用NAVSIM模拟器给出的闭环分数)和格式奖励 (确保输出的轨迹格式正确)。
仅用PDMS奖励时,PDMS只有88.9,且反思率暴跌至1.9%。加入自适应反思奖励后,PDMS升至90.5,反思率恢复至22.9%。再叠加上同心OBB-FDE奖励,PDMS达到最高的91.3,同时保持稳定的20.6%反思率。可见两个新设计的奖励都起到了关键作用。
效果验证:NAVSIM v1/v2两项基准上取得SOTA,以4B参数超越8B模型,验证多模态反思的有效性
IRR-Drive在NAVSIM v1和NAVSIM v2两个权威闭环规划基准上进行了全面评估。下面直接看结果。
在NAVSIM v1上,IRR-Drive-4B以91.3 PDMS排名第一(与LaST-VLA-8B并列),但其参数量只有4B,而LaST-VLA-8B是8B模型。在DAC(可行驶区域合规率)上达到98.3,EP(自车进度)达到88.5,均为最高。即使IRR-Drive-3B也达到了90.6,超过了多数8B方法。
在更难的NAVSIM v2上,IRR-Drive-4B的优势更为显著:EPDMS达到89.0,比之前最好的ELF-VLA-8B(87.1)高出+1.9,同时EP(自车进度)92.3也是最高。这说明多模态反思在复杂场景中带来的收益更大。
此外,表5的消融实验也验证了“文本+BEV”双模态反射的必要性:单独用文本或单独用BEV在RL后PDMS分别为90.6和90.5,而两者结合能达到91.3,证明了互补性。
龙迷三问
Q1:IRR-Drive的“反思”到底是怎么工作的?能举一个具体的例子吗? A1:假设场景是:自车在路口右转,右方有摩托车快速接近。IRR-Drive先根据当前图像生成一个初始意图文本:“右转,速度15km/h”。然后,它基于这个意图预测未来3秒的BEV,BEV中显示出摩托车将在自车右转后1.5秒进入自车路径。VLM看到这个BEV后生成反思文本:“检测到右侧摩托车冲突,建议减速并等待”。最后,模型修正意图为:“先减速至5km/h,确认安全后再右转”,并输出对应的轨迹点。
Q2:文中提到的NAVSIM v1和v2有什么区别?为什么说v2更难? A2:NAVSIM v1是基础的闭环规划基准,主要用PDMS评分(包含NC、DAC、TTC、舒适度、自车进度5个指标)。NAVSIM v2是扩展版,引入了更多指标(如DDC、TLC、LK、HC、EC等)和更复杂的场景,因此EPDMS(扩展PDMS)的满分范围更广,整体分数更低,挑战性更大。
Q3:为什么IRR-Drive只用4B参数就能超过8B模型?核心竞争力在哪? A3:核心在于它用更聪明的“反思”机制替代了堆参数。8B模型可能依赖更大的容量来记忆海量驾驶模式,但依然缺乏主动评估未来后果的能力。IRR-Drive通过多模态反思,在规划过程中引入了基于BEV的“模拟-检查-修正”步骤,相当于用更强的算法设计来弥补参数量的不足。另外,自适应反思策略也只在小部分场景中增加推理成本,整体效率高。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
将多模态反思(文本+BEV预测)引入VLA规划,并设计了自适应反思机制和同心OBB奖励,整体创新度较高。但单个模块并非完全新创,组合创新为主。
实验合理度: ★★★★★
在NAVSIM v1和v2双基准上与15+种方法对比,消融实验设计完整,覆盖奖励函数、模态组合、训练阶段等,结果可信度高。
学术研究价值: ★★★★✰
为VLA领域提供了“反思必须扎根于物理后果”的新视角,探索了BEV作为反思空间的可行性,对后续工作有启发意义。
稳定性: ★★★★✰
闭环仿真中表现稳定,但非反应式仿真与实际道路仍有差距。方法对BEV预测的准确性依赖较强。
适应性以及泛化能力: ★★★★✰
在NAVSIM的多种场景(城区、高速)都有效,但训练数据来自模拟器,直接迁移到真实世界可能需要额外fine-tune。
硬件需求及成本: ★★★✰✰
基础模型为Qwen2.5-VL-3B/ Qwen3-VL-4B,推理时需H800 GPU,自适应模式下平均1.7秒/样本。训练阶段需要模拟器生成BEV和反思数据,成本较高。
复现难度: ★★✰✰✰
论文未开源代码,数据构建流程复杂,复现门槛较高。
产品化成熟度: ★★✰✰✰
目前还在仿真阶段,推理速度1.7秒对实时驾驶(100ms)还差一个数量级,但思想可以作为高级规划模块的参考。
可能的问题: ① 论文未展示在真实驾驶场景的测试结果。② 自适应阈值τ的设定需要手动调参。③ 反思阶段引入的额外延迟在高速场景下可能不够及时。
主要参考文献
[1] Chen et al. “Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving”. arXiv:2606.22913, 2026.
[2] NAVSIM: Da et al. “NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking”. CoRL 2024.
[3] ELF-VLA: Hu et al. “ELF-VLA: Efficient Learning from Failure for Vision-Language-Action in Autonomous Driving”. NeurIPS 2025.
[4] LaST-VLA: Zhang et al. “LaST-VLA: Latent Space Transformer for Vision-Language-Action Driving”. CVPR 2026.
[5] Qwen2.5-VL: Bai et al. “Qwen2.5-VL Technical Report”. arXiv:2502.13923, 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想让你的自动驾驶模型也学会“先想后做”?加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 自动驾驶+上海+中山大学+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群