← 返回 PaperDaily 视觉与图像

端到端驾驶加上记忆,NAVSIM-v2最高涨3.7

牛津这篇不靠“更大模型”,而是给自动驾驶塞进一段更像人类的驾驶记忆:前方路况没看到,也能提前知道。更妙的是,它还考虑了先验失真时怎么安全退回,工程味很足。

端到端驾驶加上记忆,NAVSIM-v2最高涨3.7
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header
龙哥推荐理由:牛津这篇不靠“更大模型”,而是给自动驾驶塞进一段更像人类的驾驶记忆:前方路况没看到,也能提前知道。更妙的是,它还考虑了先验失真时怎么安全退回,工程味很足。

原论文信息如下:
论文标题:
PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving
发表日期:
2026年06月
发表单位:
University of Oxford, Mobile Robotics Group
原文链接:
https://arxiv.org/pdf/2606.31830v1.pdf
项目链接:
https://orimrg.github.io/PriorEye

引言

端到端自动驾驶最怕什么?不是不会开,而是只会看眼前。很多方法盯着当前传感器画面做决策,遇到雪天、遮挡、路口没露头这些场景,就容易变成“临场反应型选手”,少了人类司机那种提前预判的本事。
PriorEye 的思路很直接:把沿着目标路线离线采集的街景图像,和路线位置一起绑成地理空间视觉先验,再用双记忆结构和自适应门控塞回规划模型里。说白了,就是让车在“看不见前方”时,也能借助路上的旧记忆提前做决定。

方法概述

这篇论文的关键不是重新造一个更复杂的自动驾驶主干,而是给现有端到端模型加一层“会翻旧账的驾驶记忆”。整体流程可以概括成三步:先离线建记忆库,再按当前路线检索相关街景先验,最后把先验注入规划状态里。
图1:地理空间视觉先验的动机
图1:地理空间视觉先验的动机。左边是雪天遮挡下的车载观测,右边是沿路线离线采集的街景图。前者一糊,模型就容易抓瞎;后者不受当前传感器影响,关键路牌还清清楚楚。
先看记忆库怎么建。论文沿着目标部署区域的车道中心线按固定间隔采样街景图片,用冻结的视觉骨干编码,再把图片 embedding 和位置一起存起来。这里没有追求“像素级对齐到毫米”,而是追求“能给驾驶提供有意义的环境提示”,所以稀疏采样也能用。
图2:所提出框架总览
图2:所提出框架总览。记忆增强模块把当前驾驶状态和地理空间视觉先验作为输入,输出一个更强的状态给后续解码器。虚线框表示原有模块基本不动,说明这个方法主打“外挂增强”,不是推倒重来。
检索阶段也很讲究,不是简单找最近的几个点,而是先根据当前自车所在车道和高层导航意图,沿车道连接图做深度优先搜索,拿到前方候选路线,再按“左转、右转、直行”选择对应路径上的先验。这样做的核心原因很朴素:离得近不等于有用,和当前动作一致才有用
接下来是最关键的记忆增强模块。它不是把先验硬塞进去,而是拆成两种记忆:上下文记忆持久记忆。前者装的是检索到的地理空间视觉先验,后者则像“保底垫子”,当先验不靠谱时负责兜底。
插图
这里的设计挺像老司机脑子里的两套东西:一套是“这条路我见过”,另一套是“先别急,万一记错了呢”。
上下文记忆把视觉 embedding 和二维位置编码加在一起,让模型同时知道“看见了什么”和“它大概在前方哪里”。持久记忆则是一组可学习 token,作用不是提供具体路况,而是在上下文记忆失真时吸走注意力,避免模型死盯着错误先验不放。
最后通过 cross-attention 把当前状态和两类记忆融合,再用自适应门控根据当前状态与记忆的一致性来决定“信多少”。这个门控同时看欧氏距离和余弦相似度,等于给记忆做了一次“可信度体检”。如果判断不靠谱,门就关小一点;如果判断靠谱,记忆就大胆参与规划。
模型整体还有一个好处:它不需要改原始端到端驾驶器的主干结构,只是在中间状态上做增强。所以不管是回归式、扩散式还是打分式规划器,都能挂上这层记忆外挂。工程上,这种“插拔式增强”比重写整套管线友好多了。
图5:各基线的集成示意图
图5:各基线的集成示意图。可以看到,PriorEye 并不是只适配某一种规划器,而是把同一套记忆模块接到不同模型的中间特征上,通用性很强。

核心设计

如果把这篇工作的核心翻译成人话,就是一句:别让自动驾驶只盯着眼前那几帧,要让它带着“路上见过什么”的记忆去开车。这比单纯加大感知输入更像人类司机,也更符合真实道路里“提前知道”的价值。
图3:左转场景中的轨迹可视化
图3:左转场景中的轨迹可视化。下游道路里有一个还没进入车载视野的人行横道,基线更激进,而 PriorEye 因为提前看到了先验里的路况,速度更保守,轨迹也更稳。
这张图很能说明问题:模型并不是“预测得更远”这么简单,而是在看不见的地方提前收油。这种行为在真实驾驶里非常重要,尤其是路口、遮挡和弯道场景,太晚反应往往比反应慢更危险。
论文还专门做了鲁棒性分析。一个方向是传感器被污染,比如雪、霜、泥点、手印这些现实里很常见的“给摄像头添堵”场景。由于先验来自离线街景,它不受实时传感器损坏影响,所以在车载画面糊掉时,仍然能给规划器提供干净上下文。
图4:合成传感器污染示例
图4:前视摄像头上的合成传感器污染示例。从正常画面到手印、霜冻、泥点重污染,模型面对的就是这种“现实版糊镜头”。
另一个更聪明的点,是论文没有假装先验永远正确。它还模拟了街景先验过时、错位、缺失等情况,并证明双记忆结构能把注意力自动切回持久记忆。也就是说,先验靠谱就用,先验离谱就别硬信,模型至少知道“自己可能记错了”。
图9:先验被错误检索时的退化表现
图9:当先验被错误检索到约500米外时,模型会把注意力几乎全部转向持久记忆,轨迹依然保持稳定。这种“错了就退回保底方案”的设计,比很多只会硬扛的模块靠谱得多。

实验结果

实验放在 NAVSIM-v2 上做,覆盖回归式、扩散式和打分式四个基线。结论很统一:加上 PriorEye,四个基线都涨了。这说明它不是只对某个特定结构有效,而是确实提供了可迁移的额外信息。
在 navhard-two-stage 上,LTF、GTRS-DP、GTRS-Dense、DrivoR 都有提升,其中 LTF 的相对提升最明显,说明记忆先验对“更基础”的规划器帮助尤其大。更直白地说,原来只会盯着眼前开的模型,最需要这种提前量。
图1:地理空间视觉先验的动机
图1再次说明了问题本质:不是感知不重要,而是感知有时会被天气和遮挡狠狠干扰,先验刚好补上这块短板。
更有意思的是,在 navtest 上,所有基线也都稳定提升,说明收益不是某个设置下的偶然波动。再加上论文还比较了 HD 地图先验,结果显示只用车道中心锚定的街景先验,居然能超过更重的 HD 地图方案,说明真正有用的不是“地图元素越多越好”,而是“路线上的视觉上下文更对味”。
图6:同一场景下的不同先验表示对比。左边是栅格化 HD 地图,中间是向量化 HD 地图,右边是地理空间视觉先验。PriorEye 用更轻的表示,拿到了更大的收益。
鲁棒性实验也很加分。摄像头被污染时,基线的性能掉得更厉害,而 PriorEye 因为有离线街景记忆,退化明显更少。先验本身被故意搞坏时,双记忆结构又能把注意力切回持久记忆,避免模型被错误上下文带偏。
工程上也不算重。论文给出的额外参数只有 71.3 万,推理开销也控制在可接受范围内,10Hz 预算内还能跑得动。离线建库确实要花点功夫,但比起给整套自动驾驶系统重做一遍,这个成本已经算相当克制。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这方法到底新在哪?新点不在“又加了一个记忆模块”,而在于把路线相关的街景先验真正接进了端到端规划,而不是只拿来做地图或检索辅助。

它最适合落地在哪?适合有稳定路线规划、能离线采集街景或车队数据的系统,比如固定区域自动驾驶、园区配送、地图较稳定的城市道路辅助驾驶。

它有什么边界?先验依赖路线和离线街景质量,若道路变化太快、检索错位严重,收益会打折;好在论文已经用持久记忆做了兜底,但这不等于先验可以随便乱喂。

如果还有想继续拆的点,欢迎留言继续聊。

龙哥点评

论文创新性分数:★★★★☆

把“记忆”从语言模型那套思路搬到自动驾驶里,不算空中楼阁,而且和路线先验结合得比较自然。

实验合理度:★★★★☆

基线覆盖回归、扩散、打分三类,鲁棒性、消融、时延都做了,实验链条比较完整。

学术研究价值:★★★★☆

它回答的是一个很真实的问题:端到端驾驶怎么从“反应式”变成“有预判”。这个方向值得继续往下挖。

稳定性:★★★★☆

双记忆+门控让它不是一股脑相信先验,遇到错误检索还能退回保底方案,这点很加分。

适应性以及泛化能力:★★★★☆

能挂到多个基线上,说明不是特化小把戏;但对路线和离线街景质量仍有依赖。

硬件需求及成本:★★★★☆

额外参数和时延都不算夸张,离线建库是主要成本,但属于一次性投入。

复现难度:★★★☆☆

思路清楚,但要做出同样效果,路线图、街景检索、基线接入和评测环境都得齐。

产品化成熟度:★★★☆☆

有落地味道,但更像“能上车的研究原型”,离大规模商用还差地图更新和长期维护方案。

可能的问题:先验过时、路线变化、城市环境更新过快时,收益可能下降;后续若能加入记忆更新与遗忘机制,会更像真正可长期部署的系统。


主要参考文献

1. Bansal, M., Krizhevsky, A., Ogale, A.S.: Chauffeurnet: Learning to drive by imitating the best and synthesizing the worst. In: RSS (2019).
2. Behrouz, A., Zhong, P., Mirrokni, V.: Titans: Learning to memorize at test time. In: NeurIPS (2025).
3. Burnett, K., Yoon, D.J., Wu, Y., Li, A.Z., Zhang, H., Lu, S., Qian, J., Tseng, W.K., Lambert, A., Leung, K.Y., Schoellig, A.P., Barfoot, T.D.: Boreas: A multi-season autonomous driving dataset. The International Journal of Robotics Research 42(1-2) (2023).
4. Cao, W., Hallgarten, M., Li, T., Dauner, D., Gu, X., Wang, C., Miron, Y., Aiello, M., Li, H., Gilitschenski, I., Ivanovic, B., Pavone, M., Geiger, A., Chitta, K.: Pseudo-simulation for autonomous driving. In: CoRL (2025).
5. Chitta, K., Prakash, A., Jaeger, B., Yu, Z., Renz, K., Geiger, A.: Transfuser: Imitation with transformer-based sensor fusion for autonomous driving. IEEE TPAMI 45(11) (2023).
6. Dauner, D., Hallgarten, M., Li, T., Weng, X., Huang, Z., Yang, Z., Li, H., Gilitschenski, I., Ivanovic, B., Pavone, M., Geiger, A., Chitta, K.: NAVSIM: datadriven non-reactive autonomous vehicle simulation and benchmarking. In: NeurIPS (2024).
7. Tschannen, M., Gritsenko, A.A., Wang, X., Naeem, M.F., Alabdulmohsin, I., Parthasarathy, N., Evans, T., Beyer, L., Xia, Y., Mustafa, B., Harmsen, J., Steiner, A., Zhai, X.: Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features. arXiv preprint arXiv:2502.14786 (2025).

开车最怕的不是看不见,而是“该提前知道却不知道”。PriorEye把路上的经验装进记忆里,读论文也一样,别只盯眼前一帧,来星球看更多前沿拆解、自动驾驶方法和开源代码速递吧。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。