← 返回 PaperDaily 视觉与图像

中科院自动驾驶"错题本":26毫秒现学现卖,Navtest冲到94.1

老司机最怕的不是路况差,而是同一个坑栽两次。这篇论文给自动驾驶大模型装上一个"失败记忆库",用结构化解耦检索加上解耦LoRA测试时训练,让模型现学现卖、遇险纠偏,还把NAVSIM双榜SOTA收入囊中,代码已开源。

中科院自动驾驶"错题本":26毫秒现学现卖,Navtest冲到94.1
原论文信息如下:
论文标题:
DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving
发表日期: 2026年08月
发表单位: 中国科学院自动化研究所、重庆长安科技有限公司
原文链接: https://arxiv.org/pdf/2608.10413v1.pdf
开源代码链接: https://github.com/ZebinX/DriveVLA-M0
各位开车时有没有过这种体验:同一个路口,上次因为没注意右侧来车差点撞上,这次开过去,心里就多留了个心眼,右脚不自觉就搭在刹车踏板上。这种"吃一堑长一智"的能力,对老司机来说是肌肉记忆,但对现在的自动驾驶系统来说,却是一件奢侈品。大多数端到端自动驾驶模型,无论开了多少公里,在同一个坑里栽两次是常有的事儿——因为它们没有"记忆"。
图1:DriveVLA-M0框架概览
图1:DriveVLA-M0,一个失败感知记忆增强的VLA框架。(a)经典VLA:视觉语言模型在视觉-语言空间中进行场景推理,并将中间特征传递给动作解码器进行规划。红色轨迹表示模型可能的选择。(b)本文方法:使用检索模型从潜在记忆池中检索结构相似的失败案例,并通过基于LoRA的测试时训练将其注入动作解码器,实现场景特定修正。(c)性能:DriveVLA-M0在Navtest(NAVSIMv1,蓝色)和Navhard(NAVSIMv2,橙色)上达到SOTA。

自动驾驶的"记忆革命":DriveVLA-M0如何让AI从失败中学习

最近,来自中国科学院自动化研究所和重庆长安科技有限公司的研究团队,在ACM Multimedia 2026上发表了DriveVLA-M0——一个带有失败感知潜在记忆的检索增强VLA框架。这里先解释一下VLA是什么。VLA是Vision-Language-Action的缩写,指的是视觉-语言-动作模型。这类模型把大语言模型(LLM)的语义推理能力、视觉模型的场景理解能力和下游的动作规划能力统一在一个框架里。在自动驾驶场景下,VLA模型吃进摄像头画面,输出的是驾驶决策或者轨迹,相当于给车装了一个会"看图说话"的驾驶大脑。
论文的核心动机非常朴素:人类开车的时候,大脑会不自觉地把当前场景和过去的错误经历做关联。比如之前在学校门口差点撞到突然冲出来的小孩,下次经过学校路段就会本能地减速。这种将当下情景与历史错误联系起来、预判当前情境中失败的可能并相应调整行为的能力,在认知科学里是有据可循的。而现有的VLA驾驶模型,虽然已经在感知和推理上做得越来越强,却普遍缺少这种"联想记忆"——它们不会主动把当前场景和过去犯过的错联系起来,于是在相似场景下反复出错。
图2:DriveVLA-M0方法总览
图2:DriveVLA-M0总体架构。(上方)[M]记忆生成:通过oracle仿真评分识别基础模型表现不佳的场景,并将其中间特征存储在潜在记忆M中。(下方)[I]带TTT的推理:测试时,根据当前场景特征从M中检索结构相似的案例,检索到的内容通过解耦LoRA对Action Decoder进行微调。具体来说,地图特征检索到的案例用于调整Map(静态)LoRA分支,而agent特征检索到的案例用于调整Agent(动态)LoRA分支,实现有针对性的场景特定规划修正。
DriveVLA-M0的做法,通俗点说,就是给自动驾驶大模型建了一个"错题本"。这个错题本不记文字,记的是模型在过往驾驶中"翻车"场景的结构化特征——包括道路结构长什么样、周围的车辆怎么分布、当时模型自己算出来的中间表示是什么、以及正确的专家轨迹是什么。等到模型再次遇到结构相似的场景时,它就把这本错题本里的相关"题目"翻出来,在测试现场临时做一次快速的针对性微调,让模型当场"长记性",从而避免重蹈覆辙。

从人类认知到机器智能:失败感知记忆的核心思想

整个DriveVLA-M0的设计分为两个阶段:离线阶段的记忆生成(Memory Generation)和在线阶段的测试时训练推理(Inference with TTT)。
先看离线阶段。研究团队先用一个训练好的基础模型,在大量训练数据或者外部数据上做推理。对于每一个场景,用仿真器里的oracle评分器给模型预测的轨迹打分。这里PDM是Plan-Driven Metrics的缩写,是基于规划驱动的评价指标,它模拟一个"完美驾驶员"的决策,从安全性、舒适性等多个维度给模型输出的轨迹打分。如果打分低于某个阈值,就认为这是一个失败场景。这些失败场景的中间特征会被写进一个潜在记忆池里,每条记忆包括三部分内容:检索键(地图特征和agent特征)、适配输入(语言嵌入、自车状态嵌入和中间轨迹簇)、监督标签(专家轨迹和oracle打分结果)。
在线阶段就更有意思了。当车在实际行驶中遇到一个新场景时,模型会先用一个专门的检索模型(Retrieve Model)提取当前场景的地图结构和动态agent分布特征,然后去记忆池里找最相似的历史失败案例。如果找到了足够相似的案例,就触发一次快速的测试时训练:用这些检索到的失败案例当训练数据,对动作解码器做几步梯度更新,把"这次别再犯同样的错"这个信息实时写进模型参数里。整个过程走的是LoRA低秩适配的轻量路线,不会改动主干模型的大参数。
图4:TTT注入前后的轨迹分布可视化
图4:TTT注入前后的轨迹分布可视化。上方为注入前,下方为注入后。红色轨迹表示模型更可能选择的轨迹,绿色轨迹代表人类轨迹。右侧分布图显示了轨迹簇的GT分数密度,右移表示簇整体质量提高。
图4非常直观地展示了这个"临阵磨枪"的效果。上半部分是注入前:模型输出的轨迹集中在零附近,几乎没有高分选项,整个轨迹簇的质量分布很糟糕。下半部分是注入后:轨迹簇的质量明显右移,模型有了选择安全轨迹的余地。说白了,就是模型在关键时刻被"点了一下",想起了自己以前在这里栽过跟头。

结构化解耦检索:精准匹配相似场景的关键技术

检索是记忆系统的灵魂。如果检索回来的案例跟当前场景八竿子打不着,那后面的"临阵磨枪"就是瞎忙活。论文在这里点出了一个关键的痛点:既有的一些记忆增强方法(比如MemoryVLA等),通常用视觉-语言特征作为检索键。这在机器人操作任务里问题不大,因为操作任务更关注物体语义,但放在自动驾驶上就有问题了——自动驾驶的决策极度依赖两类信息:动态信息(周围车辆、行人的运动状态)和场景结构信息(道路拓扑、车道线、路口形状)。纯视觉-语言特征很难精确捕捉这两类信息,结果就是检索回来的案例可能语义上相似,但结构上完全不匹配。举个例子:两个场景都是"车在路口等左转",语义描述完全一样,但一个是双向四车道的城市路口,一个是单向两车道的乡村路口,前车的运动模式和风险特征截然不同,拿前者去指导后者,效果可想而知。
图5:检索模型架构
图5:检索模型的架构。
为了解决这个问题,DriveVLA-M0专门设计了一个结构化解耦的检索模型。这个检索模型以DINOv2作为骨干网络,DINOv2是Meta AI提出的一种自监督视觉特征提取器,具有很好的场景泛化能力。在DINOv2之上,论文使用了LoRA(Low-Rank Adaptation,低秩适配)技术进行微调。LoRA是一种参数高效的模型微调方法,它通过注入低秩矩阵来近似模型的权重更新量,只需要训练极少量参数就能达到接近全量微调的效果。这里的特别之处在于,LoRA被设计成解耦的两个分支:一个地图(静态)分支负责捕捉道路结构,一个agent(动态)分支负责捕捉周围交通参与者的交互状态。
图3:查询场景与检索场景的注意力图
图3:查询场景和检索场景的注意力图。上方为地图嵌入,下方为agent嵌入。黄色表示较高的注意力,灰紫色表示较低的注意力。
图3展示了这个解耦设计的实际效果:地图分支的注意力集中在车道线、路缘等道路边界上,而agent分支的注意力主要集中在前方的车辆上。两个分支各司其职,互不干扰,这保证了检索的键能同时反映场景的"静态骨架"和"动态血肉"。训练时,这个检索模型用占用网格预测作为监督信号,分别预测地图占用网格和agent占用网格,通过二值交叉熵损失来约束两个分支学到结构化的场景表示。

解耦LoRA测试时训练:轻量高效的场景自适应机制

检索到相似的失败案例之后,下一个问题就是:怎么把这些案例里的"教训"高效地注入到正在运行的模型里去?直接拿案例去微调整个大模型显然不现实,推理时不可能等那么久。DriveVLA-M0这里采用了解耦LoRA的测试时训练方案。
先解释两个基础概念。TTT全称是Test-Time Training(测试时训练),指的是在推理阶段针对当前输入对模型进行额外的梯度更新,让模型更好地适配当前数据分布,这个概念最早是为了应对训练集和测试集分布不一致的问题而提出的。LoRA前面已经提到,是一种低秩适配的轻量微调方法。把这两者结合,就是"在测试的时候用LoRA快速微调一下模型",避免修改骨干网络的大参数。
DriveVLA-M0的巧思在于"解耦"。它不是简单地把检索到的案例一股脑塞进去微调,而是先把案例分成两组:由地图分支检索出来的案例,专门用来微调地图(静态)LoRA分支;由agent分支检索出来的案例,专门用来微调agent(动态)LoRA分支。每个测试场景开始前,LoRA权重都会被重新初始化,确保每次"临阵磨枪"都是针对当前场景的一次干净利落的适配,不会把前一个场景的记忆带过来。
到了实际的推理阶段,两个LoRA分支会各自输出独立的分数预测。对道路理解相关的指标(比如可行驶区域合规率),采用静态LoRA分支的预测;对动态能力相关的指标(比如碰撞率),采用动态LoRA分支的预测。这种"分路评分、按需融合"的设计,让不同类型的知识各归其位,互不干扰。整体来看,TTT推理路径只给基础模型增加了约26.44毫秒的额外计算开销,却带来了显著的性能提升,性价比相当高。

实验验证:全面超越现有方法的性能表现

论文的实验基于NAVSIMv1和NAVSIMv2两个自动驾驶仿真基准。NAVSIM是加州大学伯克利分校等机构发布的大规模自动驾驶仿真数据集,基于nuPlan场景构建。NAVSIMv2是升级版本,引入了更严格的安全指标EPDMS。评测指标方面,NAVSIMv1使用PDMS(Planning-Driven Metric Score,规划驱动指标分数),NAVSIMv2使用EPDMS(Extended PDMS,扩展PDMS),两者都是越接近100越好。
先看Navtest(NAVSIMv1测试集)的对比结果。论文的DriveVLA-M0-Scale拿到了94.1的PDMS,大幅超过了之前的方法。直接看这个数字可能不够直观,对比一下就知道了:之前表现最好的经典端到端方法DriveSuprim是93.5,VLA类方法中表现最好的DriveVLA-W0是90.2。DriveVLA-M0把PDMS直接推到了94.1,比最强的VLA基线方法高了将近4个点。在安全关键指标上,碰撞率(NC)达到99.1,可行驶区域合规率(DAC)达到98.1,都处于领先水平。
表1:Navtest(NAVSIMv1)上的SOTA方法对比
表1:Navtest(NAVSIMv1)上与最先进方法的对比。粗体为最优。C代表摄像头(Camera),L代表激光雷达(LiDAR)。
再看NAVSIMv2的Navhard测试集。这个测试集比v1难度更大,加入了更多复杂和边界场景。DriveVLA-M0拿到了47.0的EPDMS,同样位列第一。要知道,NAVSIMv2的评分体系比v1严苛得多,47.0的绝对分数看起来不高,但对比其他方法就能看出差距——之前表现最好的方法是40.9,DriveVLA-M0直接领先了约6个EPDMS点,这个优势相当显著。
表2:Navhard(NAVSIMv2)上的SOTA方法对比
表2:Navhard(NAVSIMv2)上与最先进方法的对比。所有方法均依赖传感器数据进行规划。
论文还做了充分的消融实验。表3和表4分别对比了不同的检索策略和知识注入策略。核心结论是:用解耦的地图+agent双分支检索,比只用单个分支或直接用视觉-语言特征检索要更好;用解耦LoRA分别注入地图知识和agent知识,也比不加区分地混合注入更有效。这说明"分开走"的设计确实是有道理的。
表3:检索策略的消融实验
表3:检索策略的消融实验。†表示无记忆的评估。
表4:知识注入策略的消融实验
表4:知识注入策略的消融实验。所有非基础方法均使用map+agent检索。†表示无记忆的评估。
延迟分析(表6)显示,DriveVLA-M0整体的TTT反向传播延迟只有26.44毫秒,这个代价放在真实驾驶场景里几乎可以忽略不计。
表6:DriveVLA-M0各组件的延迟分解
表6:DriveVLA-M0各组件的延迟分解(毫秒)。
表8:TTT学习率和梯度步数的鲁棒性消融
表8:TTT学习率和梯度步数的鲁棒性消融实验。
图6:记忆注入前后轨迹簇的对比可视化
图6:记忆注入前后轨迹簇的对比。每一对中,左边是基础模型生成的轨迹,右边是注入后的轨迹。
图7:与其他方法的轨迹对比可视化
图7:与之前方法的轨迹对比。论文选取TransFuser作为代表性端到端方法,RecogDrive作为代表性基于VLM的方法,将它们的生成轨迹与本文方法进行比较。
图7的可视化对比非常有意思。在典型的复杂场景中,TransFuser这类端到端方法输出的轨迹比较"愣",倾向于直线行驶;RecogDrive虽然有VLM的推理加持,但在一些长尾场景下仍然会偏离安全区域;而DriveVLA-M0输出的轨迹更接近理想的人类驾驶行为——在路口提前减速、避让行人、保持在车道中心。这是"记忆注入"在行为层面最直观的体现了。

未来展望:记忆增强在自动驾驶中的广阔前景

这篇论文最有价值的启发,在于它把"记忆"和"测试时训练"这两条本来独立的技术路线拧到了一起,形成了一套"外挂式"的纠错机制。这套机制不需要重新训练主干模型,不需要动大参数,也不需要额外的标注数据——记忆池里的失败案例完全来自模型自身的"驾驶经历",相当于让模型把踩过的坑都记下来,第二次路过的时候绕开走。
值得注意的是,论文提到的Scalability实验表明,DriveVLA-M0的框架天然支持外部数据扩展——大规模合成数据可以直接通过离线流程写入记忆池,不需要对基础模型做任何重新训练。这意味着,当某个自动驾驶车队在某条新的城市路线上积累了大量失败案例后,这些案例可以离线写入记忆池,让同型号的其他车辆"间接共享经验"。这个"车队级记忆共享"的想象空间相当大,已经带有一点群体智能的味道了。
当然,DriveVLA-M0离大规模量产部署还有距离。它的记忆池目前主要覆盖历史驾驶场景,对新出现的、从未见过的场景类型无能为力;TTT阶段虽然只有26毫秒的延迟,但要跑起来仍然需要额外的计算资源;记忆池的构建依赖oracle仿真器打分,而仿真器评价体系本身的局限性也会传导到记忆质量上。不过,这些限制并不影响这篇论文在方法论上的启发意义——"让AI记住自己犯过的错",这个方向本身就值得整个领域跟进。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本论文提出DriveVLA-M0,一种带失败感知记忆增强的自动驾驶视觉-语言-动作模型。
这篇工作最值得看的点是什么?在NAVSIMv1上达到94.1 PDMS,在NAVSIMv2上达到47.0 EPDMS,均超越现有方法,且在安全关键指标(碰撞避免、可行驶区域合规)上表现优异
这篇工作的边界或风险在哪里?优点:1)提出失败感知记忆增强新范式,有效利用历史失败经验;2)结构化解耦检索机制能更准确匹配场景;3)解耦LoRA TTT实现高效场景特定适应;4)记忆扩展可实现无需重训的性能提升。缺点:1)依赖oracle评分器识别失败场景,可能引入偏差;2)TTT触发阈值需要调参;3)记忆库构建需要额外计算资源
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种失败感知的潜在记忆增强框架,通过结构化解耦检索(静态道路结构+动态智能体交互)从记忆池中检索相似失败案例,并利用解耦LoRA的测试时训练机制实现场景特定的规划修正。

实验合理度:★★★★☆

PDMS(NAVSIMv1),EPDMS(NAVSIMv2),包含NC、DAC、EP、TTC、C等子指标

学术研究价值:★★★★☆

提出一种失败感知的潜在记忆增强框架,通过结构化解耦检索(静态道路结构+动态智能体交互)从记忆池中检索相似失败案例,并利用解耦LoRA的测试时训练机制实现场景特定的规划修正;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

TTT反向传播仅需26.44ms延迟开销,检索阶段15.19ms,单次前向传播30.79ms

复现难度:★★★☆☆

https://github.com/ZebinX/DriveVLA-M0

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:感知记忆增强新范式,有效利用历史失败经验;2)结构化解耦检索机制能更准确匹配场景;3)解耦LoRA TTT实现高效场景特定适应;4)记忆扩展可实现无需重训的性能提升。缺点:1)依赖oracle评分器识别失败场景,可能引入偏差;2)TTT触发阈值需要调参;3)记忆库构建需要额外计算资源

主要参考文献

[1] Zebin Xing, Yupeng Zheng, Qiang Chen, et al. DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving. ACM MM 2026. https://arxiv.org/pdf/2608.10413v1.pdf
[2] 开源代码: https://github.com/ZebinX/DriveVLA-M0


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
老司机都懂"吃一堑长一智",自动驾驶也该学会记住翻车教训!想第一时间解锁DriveVLA-M0这类脑洞大开的论文解读,欢迎加入龙哥读论文粉丝群,扫码或添加龙哥助手微信号加群:kangjinlonghelper。备注:自动驾驶/机器人+城市+单位+昵称,更快通过邀请。群里已有图像处理、大模型与智能体、自动驾驶与机器人、AI医疗与AI金融五个方向的小伙伴在等你~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。