← 返回 PaperDaily
视觉与图像
ICLR 2026新作:自动驾驶微调为何越训越忘?
自动驾驶里最容易被忽略的坑,不是模型不会开车,而是学会开车后把老本行忘了。这篇论文第一次把“灾难性遗忘”做成可量化基准,还给出了一种不乱改权重的解法,挺适合认真看一遍。😊
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
自动驾驶里最容易被忽略的坑,不是模型不会开车,而是学会开车后把老本行忘了。这篇论文第一次把“灾难性遗忘”做成可量化基准,还给出了一种不乱改权重的解法,挺适合认真看一遍。😊
原论文信息如下:
灾难性遗忘:VLM 自动驾驶的隐形杀手
自动驾驶里最怕的,往往不是模型“不会开”,而是模型学会新东西以后,把老本事忘了。这篇论文盯上的,就是这个很容易被忽略的坑:视觉语言模型(VLM,Vision-Language Model,视觉语言模型)一旦被拿去做驾驶微调,原本在通用世界里积累的常识、物体识别和场景理解能力,可能会被训练数据悄悄冲掉。
问题的尴尬之处在于:VLM 之所以被引入自动驾驶,本来就是冲着通用知识和长尾场景泛化去的。结果一微调,模型开始“专心学车”,顺手把原来认识的路沿、碎石、动物、施工障碍这些关键细节忘掉了。对于一个要上路的系统来说,这不是学霸退化成普通人,而是把安全底线往后挪了一步。
论文先做了一件很“扎心”的事:不先讨论怎么修,而是先证明这个坑到底有多深。作者发现,现有自动驾驶 VLM 方法大多只看当前任务分数,却很少专门测“微调后还剩多少通用知识”。这就像只考驾照路考,不考夜间、雨雾、碎石路,最后出了问题还以为是运气差。
这里的关键背景也顺手解释一下。灾难性遗忘指的是模型在学习新任务时,对旧知识的表现明显下降。它在增量学习、持续学习里早就不陌生,但放到“通用 VLM + 自动驾驶微调”这个组合里,之前几乎没人系统量化。论文的价值就在于:它没有停留在“感觉有点忘了”,而是把这个感觉做成了可测、可比、可复现的基准。
首个定量基准:FidelityDriving Bench,揭示遗忘有多严重
论文最硬的一步,不是提出一个更花哨的模型,而是先造了一个能把问题照出来的“镜子”——FidelityDrivingBench。它的目标很直接:专门衡量驾驶微调之后,VLM 的基础知识到底还剩多少。
这个基准的构建过程并不轻松。作者把 15 个带语言标注的自动驾驶数据集整合起来,还补充了 WOD-E2E 的语言描述,最后形成了一个约 18 万场景、90 万问答对的大规模训练池。然后再从中抽出 1000 张最“刁钻”的长尾场景作为测试集。这里的“刁钻”,不是靠主观挑图,而是靠统计学筛出来的。
具体怎么筛长尾?论文用了两个很实用的思路。第一步是把每个场景拆成一组元素,比如道路状况、交通参与者、特殊物体等,再计算每个元素的稀有度。这里的 IDF(Inverse Document Frequency,逆文档频率) 本来是文本检索里常见的“越少见越重要”思想,论文把它搬到了场景稀有度上:出现得越少的元素,权重越高。第二步又加了一个类似 BM25 的长度归一化,防止某些图片只是因为物体堆得多,就被错误打成“超级长尾”。
这套设计的聪明之处在于,它没有把“长尾”理解成“图里东西越多越怪越好”,而是尽量接近真实驾驶里真正危险、真正少见、真正容易被模型漏掉的场景。比如路沿、石块、动物、警察、船只之类的目标,一旦识别失败,后果就不是答错题,而是可能直接撞上去。
为了让“遗忘”不再停留在口头上,论文还设计了两个指标。一个是 NoPR(Noteworthy Objects’ Perception Recall,重点物体感知召回),看模型能不能把长尾场景里的关键物体认出来;另一个是 KRR(Knowledge Retention Rate,知识保留率),衡量微调后模型对原始知识的保留程度。简单说,NoPR 盯“看见没”,KRR 盯“忘没忘”。
这套基准最有说服力的地方,不是“分数做得很好看”,而是它把一个很现实的现象摆在台面上:有些方法在驾驶任务上分数更高,但对通用知识的保留更差。也就是说,模型可能在当前测试集上更像“老司机”,但在真正复杂的路况里,反而更容易漏看关键物体。这种反差,才是自动驾驶里最危险的“盲区”。
从权重到提示:DEA 如何在不破坏模型的前提下注入驾驶知识
知道问题在哪之后,论文没有继续把“微调权重”这条路硬走到底,而是提出了一个更克制的方案:Drive Expert Adapter,DEA。它的核心思路很简单:别总想着改模型参数,先想办法把合适的知识“提示”给模型,让它在对的场景里调用对的经验。
DEA 的第一块是 Prompt Adapter(提示适配器)。它不是手工写一堆死板模板,而是学习一组可训练的提示嵌入,把驾驶相关的先验知识编码进去。推理时,系统先理解当前问题语义,再检索最相关的提示片段,把它们拼到输入前面。这样做的好处是,模型的核心参数不动,但输入语境更贴近驾驶任务,既减少遗忘,也避免被固定模板绑死。
第二块是 Task-Adaptive Expert Module,TAEM(任务自适应专家模块)。它借鉴了 Mixture-of-Experts(MoE,混合专家)思路,但不是把整个模型改成大杂烩,而是外挂一组轻量专家,由门控网络根据当前场景特征去选择和融合。比如拥堵路口、恶劣天气、高速并线、视野遮挡,这些场景需要的“经验”不一样,TAEM 的作用就是别让一个通用适配器硬扛所有情况。
这套设计真正聪明的地方,在于它把“适应”拆成了两层:一层是语言层面的提示控制,一层是任务层面的专家路由。前者尽量不动权重,后者尽量把能力分工做细。这样一来,模型既能保住预训练世界知识,又能在驾驶场景里学到更有针对性的反应方式。说白了,就是不让模型为了学开车,把识字能力也顺手丢了。
从工程角度看,这种路线也很讨巧。它比全量微调更省,也比单纯 LoRA 更不容易把模型带偏。更重要的是,它对“保留原知识”这件事态度很明确:不是靠祈祷模型别忘,而是尽量不去破坏原来的参数空间。这个思路对很多需要兼顾通用能力和行业能力的场景,都有启发。
实验验证:DEA 在性能和知识保留间取得最佳平衡
论文的实验部分,基本是在回答一个很朴素但很重要的问题:这套方法到底有没有把“驾驶能力”和“知识保留”同时保住。答案是:比单纯全量微调和简单 LoRA 更平衡,而且这个平衡不是靠运气。
先看基线实验。表2显示,许多现有 VLM 驾驶方法在当前任务上能拿到不错成绩,但知识保留率并不高,尤其在长尾物体感知上,掉得很明显。论文还对比了基础模型不微调时的表现,结果说明:有些底座模型本来识别能力不差,一旦被粗暴微调,反而把原有优势磨没了。这个现象很像“为了考试刷题,把理解能力刷丢了”。
更有意思的是 LoRA 的对照。作者把基础模型做 LoRA 微调后,发现不少模型在长尾测试集上不升反降。这说明“少改参数”并不自动等于“少出问题”,如果训练数据和任务分布没有处理好,轻量微调也可能把模型往错误方向推。这个结论挺反常识,但很真实。
DEA 的结果则比较像“终于走对路了”。它没有追求把每个分数都拉满,而是尽量把驾驶任务性能和原始知识保留同时抬起来。论文的核心结论也很清楚:真正有效的适配,不一定是把模型改得更狠,而是把知识调度得更聪明。这比一味堆参数更像工程解法。
再补一句实验设计上的判断:这篇论文的实验是比较可信的,因为它没有只拿一个指标讲故事,而是同时看驾驶任务表现、长尾物体感知、知识保留率,还把不同基础模型、不同微调策略都拉进来对比。尤其是把“微调前后”的变化单独拎出来看,能更清楚地识别遗忘到底是哪里发生的。
龙迷三问
这篇论文到底解决了什么问题?它解决的是“自动驾驶 VLM 微调后会忘记通用知识”这个长期被忽视的问题。论文先做了一个专门测遗忘的基准,再提出 DEA 去缓解这个现象。
KRR 和 NoPR 分别是什么意思?NoPR 是重点物体感知召回,主要看长尾物体有没有被认出来;KRR 是知识保留率,主要看微调后模型对原始知识保留得怎么样。一个看“看见没”,一个看“忘没忘”。
DEA 为什么比直接全量微调更合理?因为它尽量不破坏模型原有参数,而是通过提示适配器和任务自适应专家模块去“调度知识”。这样既能补驾驶能力,又能减少把通用世界知识冲掉的风险。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 先做遗忘基准,再给出“从权重转向提示”的适配方案,思路不算玄学,胜在切中了自动驾驶 VLM 的真实痛点。
实验合理度:★★★★☆ 数据、指标、基线、微调前后对照都比较完整,尤其把遗忘单独拉出来测,实验逻辑是顺的。
学术研究价值:★★★★★ 这篇工作把“微调会忘”从经验现象变成了可量化问题,对后续持续学习、驾驶大模型都很有参考价值。
稳定性:★★★☆☆ DEA 比粗暴全量微调稳,但仍依赖场景路由和数据质量,离直接上车还有距离。
适应性以及泛化能力:★★★★☆ 面向长尾驾驶场景的适配思路不错,但跨城市、跨传感器、跨任务时还需要进一步验证。
硬件需求及成本:★★★☆☆ 比全量训练省,但仍然要做大规模数据整理和多模型评测,不算轻量玩具。
复现难度:★★★☆☆ 数据构建和人工复核成本不低,基准本身复现门槛比普通方法高一些。
产品化成熟度:★★★☆☆ 作为驾驶辅助研究方向很有价值,但要进产品还得补实时性、鲁棒性和极端场景验证。
可能的问题:基准和方法都很扎实,但仍偏研究型;场景路由与专家选择的泛化边界、以及真实部署中的时延和安全验证,还需要更硬的证据。
主要参考文献
[1] Runhao Mao, Hanshi Wang, Yixiang Yang, Qianli Ma, Jingmeng Zhou, Zhipeng Zhang. The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models. arXiv, 2026.
[2] FidelityDrivingBench 数据与模型发布页面:FidelityDrivingBench。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

