← 返回 PaperDaily 视觉与图像

端到端自动驾驶:22小时适配变0.9小时,且零在线交互

端到端驾驶系统有个“隐形痛点”:车厂不断升级感知模型,可下游的决策策略一旦重训就是天价成本。上海交大这篇论文直接点题:不重训策略,就用一个轻量“拼接层”把特征空间对齐回来!效果扎实,跨域场景下驾驶分数从34.76飙到89.88,而适配时间从22小时缩到1小时以内。这思路特别实用,喜欢搞工程落地的朋友别错过。

端到端自动驾驶:22小时适配变0.9小时,且零在线交互
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
xingqiu_header

龙哥推荐理由:
端到端驾驶系统有个“隐形痛点”:车厂不断升级感知模型,可下游的决策策略一旦重训就是天价成本。上海交大这篇论文直接点题:不重训策略,就用一个轻量“拼接层”把特征空间对齐回来!效果扎实,跨域场景下驾驶分数从34.76飙到89.88,而适配时间从22小时缩到1小时以内。这思路特别实用,喜欢搞工程落地的朋友别错过。


原论文信息如下:
论文标题:
A Stitch in Time Saves Nine: Preserving Policy Compatibility Under Perception Updates in End-to-End Autonomous Driving
发表日期:
2026年06月

发表单位:
上海交通大学

原文链接:
https://arxiv.org/pdf/2606.21509v1.pdf

开源代码链接:
https://github.com/SCP-CN-001/model-stitching (论文接收后将开源)

感知更新了,驾驶策略就失灵?端到端自动驾驶的“兼容性危机”

龙哥先问一个扎心的问题:你辛辛苦苦把端到端自动驾驶系统部署到车队,感知模型为了提升性能换了一套新的传感器或者加了更多训练数据——结果车辆开着开着突然开始画龙了、刹车毫无章法。咋回事?答案在于:端到端系统的感知与决策是“连体婴儿”,感知一升级,下游策略就懵了。
传统的模块化自动驾驶方案中,感知、预测、规划每个模块都有明确定义的接口,更新一个模块对其他模块影响有限。但端到端方法把所有东西缝在一个隐空间里:感知模型把传感器映射成潜在表示(latent representation),下游策略直接在这个表示上做决策。这种“紧耦合”带来高效率的同时,也埋下了雷——一旦感知模型因为随机初始化不同、传感器配置变化、训练数据域变化等原因更新,它输出的隐特征分布很可能已经偏离了策略原本熟悉的区域。结果就是:策略以为收到的信号是“前方50米有车”,实际上特征空间早已漂移,驾驶行为一落千丈。
上海交通大学这篇论文给了直觉上的证据:用相同的BEV语义监督信号训练两个不同的感知模型,它们的隐空间在高维空间里其实长得挺像(t-SNE投影后聚类结构一致)。下面这张图就展示了两个模型在相同输入下的特征聚类,颜色代表同一簇——虽然参数不同,但高层特征确实有相似模式。
图1:两个感知模型在相同BEV语义监督下学到的隐表示的t-SNE可视化。颜色代表跨模型的相同聚类。
图1:两个感知模型在相同BEV语义监督下学到的隐表示的t-SNE可视化。颜色代表跨模型的相同聚类。
这说明什么?说明即便更新了感知模型,它学到的东西本质上仍然包含那些与驾驶决策相关的关键信息(道路拓扑、障碍物位置等),只是这些信息被“重新编码”到了略有不同的特征空间里。如果能把新的特征空间“翻译”成策略熟悉的那个旧空间,是不是就不需要重训策略了?
这就是本文的核心切入点——在特征空间层面做一个轻量级的“拼接器”(Stitcher),让新的感知表示经过拼接后能被旧的冻结策略直接使用。不需要重训策略,不需要端到端联调,只需要练一个非常小的映射层。

不重训、不微调,一个“轻量拼接”恢复91%驾驶性能

传统的兼容性恢复方案有两类:要么一把梭重训下游策略(成本高得离谱),要么设计解耦的架构(但需要提前规划,对已部署系统不友好)。本文提出的模型拼接(Model Stitching)思路完全不同——它只在两个模型的特征层之间插入一个极小的“转换层”,绿色通道保持冻结,只训练这个转换层。
整体流程如下图:旧的感知模型pφ1和旧的策略πφ1是成对训练的。更新后变成pφ2,它的输出z2需要经过一个拼接器T映射回z1空间才能喂给πφ1。训练T时只需要少量配对数据(同一场景下两个感知模型的输出),且完全不需要模拟器在线交互。
图2:模型拼接过程示意图。更新后的感知模型产生的特征通过拼接器映射回原空间,再输入冻结的下游策略。
图2:模型拼接过程示意图。更新后的感知模型产生的特征通过拼接器映射回原空间,再输入冻结的下游策略。
论文给出了一个形式化的假设——策略兼容表示可拼接性假说:如果两个感知模型在相似的监督信号下训练,并且都保留了任务相关的驾驶信息(如道路拓扑、语义类别、空间对齐),那么就存在一个低复杂度的映射T让拼接后的策略性能接近原始性能。为了验证这个假说,作者准备了7种不同的感知更新场景——从最轻微的变化(随机初始化不同)到最剧烈的变化(从真实数据集nuScenes到模拟器CARLA的跨域迁移)。
实验用的基础框架是RAMBLE(一个端到端驾驶系统),感知模块基于BEVFusion(BEV即Bird's Eye View,鸟瞰图),下游策略包括Transformer动力模型和SAC(Soft Actor-Critic,一种强化学习算法的策略网络)。注意,这里的策略输入是紧凑的隐状态,因此对特征空间的偏移特别敏感。下面这张表列出了所有更新条件和对应的模型ID(Model 1-9):
表III:模拟不同更新条件的模型设置。包含表示模型(VAE/AE)、传感器模态(多模态/单模态)、训练数据集和监督信号。
表III:模拟不同更新条件的模型设置。VAE(变分自编码器)、AE(自编码器)、BEV Seg.(BEV语义分割)、3D Det.(3D目标检测)。
接着从Model 1作为基准,让其他模型作为“更新后的感知”,然后拼接回Model 1的策略。实验案例由下表定义(Case 1到Case 7):
表IV:实验案例设置。每个案例定义何种因素被更新(初始化、表示模型、传感器模态、传感器设置、域)以及源和目标模型。
表IV:实验案例设置。每个案例定义何种因素被更新(初始化、表示模型、传感器模态、传感器设置、域)以及源和目标模型。
在最小偏移(Case 1)和传感器变化(Case 5)以及跨域变化(Case 6)上,作者对比了四种策略:不清零(No Action)、重训(Retraining)、全微调(Finetuning)以及线性拼接和卷积拼接。结果让人眼前一亮——卷积拼接在跨域场景(Case 6)下达到了92%的路线完成率(RC)和89.88的驾驶分数(DS),而原始未偏移的基准是98.58 DS——性能保持率超过91%!相比之下,不清零的驾驶分数只有34.76。

线性拼接 vs. 卷积拼接:如何“对症下药”?

论文尝试了两种"低复杂度"的拼接方法,分别是线性拼接卷积拼接。到底什么情况下该用哪种?咱们拆解一下。
线性拼接:假设两个模型的特征向量之间存在一个线性映射关系,通过最小二乘法直接求解。公式如下:T(z2) = A·z2 + b,其中A和b从配对的锚点特征中估计——本质上就是找一组线性变换让新特征尽可能接近旧特征。优点是几乎零参数(0.001%以下),训练快(仅需0.02小时),而且有闭式解。但缺点也很明显:一旦特征偏移中包含非线性扭曲,线性映射就力不从心了。实验也证明,在传感器配置变化(Case 5)和跨域(Case 6)等复杂场景下,线性拼接的驾驶分数分别只有43.79和35.63,明显不够用。
卷积拼接:用一层1×1的卷积(带批量归一化BN)来学习空间的通道级对齐。虽然参数也极少(仅0.001%的总参数),但因为它能捕获通道间非线性的重新校准,表达能力比线性强不少。训练时用监督信号(BEV分割或3D检测)来指导,配合一个可选的特征对齐损失(让拼接后的特征与旧模型特征的差异最小化),效果显著提升。在Case 6(nuScenes到CARLA的跨域)中,卷积拼接直接飙到了89.88 DS,而线性拼接只有35.63。用个表情就是“这差距,有点大”。
为什么卷积能这么好?因为1×1卷积相当于在通道维度上做了一种“重新加权组合”,它允许不同通道的特征按策略需要的权重进行混合。线性映射只做平移缩放,而卷积可以同时学习跨通道的非线性混合(通过ReLU等激活函数)。这正好匹配了CKA分析的结果——深层特征虽然相似但并非逐通道对应,需要一个轻量的通道重排。
另一个有趣的发现是:在表示模型变化(VAE变AE,Case 2)和单模态变多模态(Case 3-4)时,线性拼接居然也表现不错(Case 1下线性拼接DS = 96.00,卷积拼接98.51)。说明对于结构变化较小的更新,线性映射就足够应付了。所以口诀是:轻度变化用线性、大幅变动上卷积。

22小时变0.9小时:效率提升24倍,且无需在线交互

上面说拼接效果好,但代价呢?我们来看看最核心的效率对比(Case 5,传感器配置变化场景)。
表VI:不同恢复策略的效率对比(Case 5)。包括更新参数比例、内存使用、GPU内存、运行时间和交互步数。
表VI:不同恢复策略的效率对比(Case 5)。更新参数比例、内存使用、GPU内存、运行时间和交互步数。
看这张表,差距太明显了:重训需要22.18小时,全微调18.94小时,而且还分别需要7万和5万步在线交互。而卷积拼接只需要0.91小时(约55分钟),而且完全不需要在线交互——只要存一批配对的特征就能离线训练!线性拼接更夸张,0.02小时,1.2分钟完事。
这种效率优势怎么来的?因为拼接只更新极少参数:卷积拼接仅更新下游总参数的0.001%(不到万分之零点一),线性拼接更是0%。而重训要动100%参数。在GPU内存占用上,卷积拼接只需要5.66 GB(重训要18.66 GB)。这意味着一张消费级RTX 4090就能轻松搞定,而重训得掏服务器级别的显卡
更重要的是,不需要在线交互意味着不需要在真实道路上或者昂贵模拟器中进行风险驾驶。重训和微调过程中,策略会产出探索性的动作,有可能导致碰撞——这对自动驾驶安全至关重要。而拼接只用已有的离线成对数据,完全避免了探索风险。

突破跨域壁垒:从nuScenes到CARLA,真实到仿真的“奇点”

前面提到的Case 6和Case 7代表了最极端的场景:感知模型在真实数据集nuScenes上训练,但下游策略却要部署到模拟器CARLA中。这种“真实到仿真”的迁移,是自动驾驶研究中的一个著名难题——两个域的数据分布(光照、纹理、传感器噪声)差异巨大。
先看Case 6(BEV分割监督)的结果:不清零时DS仅34.76,重训和微调也分别只有35.10和31.35——竟然比不清零还差?原因可能是重训时数据不够或者策略过于复杂导致过拟合。但卷积拼接直接提高到89.88,这已经是可用级别了。下面这张图展示了Case 2(AE到VAE拼接)的可视化案例,虽然场景不同,但能看出拼接后的特征质量。
图4:Case 2(AE到VAE拼接在线性拼接方式下)的可视化结果。展示了BEV分割监督下的特征对齐效果。
图4:Case 2(AE到VAE拼接在线性拼接方式下)的可视化结果。
再看Case 7(3D目标检测监督),这是稀疏的物体中心特征,原本以为更难拼接。结果卷积拼接依然有效,下图中展示了源模型(nuScenes训练)和目标模型(CARLA训练)在拼接前后的检测输出对比,可以明显看到拼接后的特征分布更接近目标。
图5:Case 7卷积拼接的可视化。源模型在nuScenes上训练(3D检测监督),目标模型在CARLA上训练。展示了不同传感器位置和旋转下的拼接效果。
图5:Case 7卷积拼接的可视化。源模型在nuScenes上训练(3D检测监督),目标模型在CARLA上训练。
这些结果有力地支持了本文的核心理念:即使感知模型经历了巨大的域偏移,只要它学习的是与任务相关的监督信号(BEV分割或3D检测),其隐空间依然保留了与旧策略兼容的结构性信息,通过一个轻量拼接器就能恢复功能。这突破了传统认为“跨域必须重新训练策略”的直觉。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

模型拼接的训练具体需要什么数据?够简单吗?训练拼接器只需要成对的数据:同一个驾驶场景下,新旧感知模型分别输出的隐特征。具体来说,采样2048对特征(线性拼接)或一个epoch的卷积拼接数据(从CARLA数据集收集,约4万帧)。对比之下,重训策略需要数十万步的模拟交互。所以拼接受限于“能否获得成对的旧感知输出”——这在实践中很容易,只要在部署前把旧模型在新数据上跑一遍就行。

为什么卷积拼接在跨域场景下表现远超重训和微调?重训和微调本质上是让策略重新适应新特征空间,但跨域场景中可用的数据量有限(nuScenes只有2.8万帧,且和CARLA分布不同),策略很容易过拟合。而拼接保留策略完全不变,只让特征“靠拢”,这约束了问题空间——只要新特征中与驾驶决策相关的信息没有被损坏,通过轻量映射就能恢复。这得益于任务相关流形假设:驾驶决策只依赖于低维流形,而不同感知模型学到的流形结构是相似的。

这篇论文对实际落地有多大价值?非常大。现实中的自动驾驶团队经常更新感知模型(比如换了摄像头型号、加了夜间训练数据),但重训下游策略需要模拟器、评估和验证,周期很长。这篇工作提供了一种“即插即用”的修复方案:在感知模型更新后,只需几个小时的离线计算+一次线上验证就能恢复驾驶性能。而且不依赖在线交互,意味着可以在不中断车队运营的情况下完成升级。当然,这需要新旧模型使用相同的监督信号类别(比如都是BEV分割),但这是目前主流端到端系统(如UniAD、VAD)的标准设置。龙哥认为这篇论文有很高的工程落地潜力。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将模型拼接引入端到端自动驾驶的持续维护场景,提出“策略兼容表示可拼接”假说并系统验证,思路新颖。但拼接技术本身非首创,创新主要在应用和验证。

实验合理度:★★★★★

实验设计非常系统:覆盖7种不同难度的更新情况,从随机初始化到跨域迁移;对比重训、微调、清零三个基线;使用真实数据集和模拟器闭环评估;效率对比详细。龙哥认为非常扎实。

学术研究价值:★★★★☆

首次将“任务相关流形”和“策略兼容拼接”假设在复杂驾驶任务中验证,为理解端到端系统的持续演进提供了理论基础。但理论深度仍有提升空间,例如未给出拼接误差的理论界。

稳定性:★★★★☆

在多数场景下拼接策略与原始策略的驾驶行为一致性高,跨域场景也能保持91%以上的驾驶分数。但在传感器变化剧烈(Case 5)时线性拼接失效,卷积拼接仍有91% DS,整体鲁棒。

适应性以及泛化能力:★★★★☆

方法不依赖于特定的感知或策略架构,只要特征维度匹配且监督信号相似即可。但论文仅验证了BEV分割和3D检测两种监督,对其他监督(如占用网格、实例分割)未测试。

硬件需求及成本:★★★★★

卷积拼接只需要一张RTX 4090训练55分钟,线性拼接1.2分钟。推理时拼接层是极轻量的1×1卷积,几乎不影响推理速度。产品落地非常友好。

复现难度:★★★☆☆

论文使用了RAMBLE框架和BEVFusion,但RAMBLE未公开代码部分细节。论文称代码将在接收后开源,目前无法直接复现。但整体方法不复杂,有能力的团队可根据描述自行实现。

产品化成熟度:★★★★☆

只要满足“新旧模型使用相同的监督信号类别”这一条件,几乎可以直接集成到现有的端到端驾驶系统中。但对传感器变化的鲁棒性需要在实际车队中进一步验证。龙哥认为离产品化仅差一步“大规模实车测试”。

可能的问题:论文仅在单一场景(EnterActorFlowV2)中评估驾驶性能,缺乏多场景和长尾情况验证。未讨论拼接器对安全关键场景(如紧急刹车)的影响。另外,假设监督信号不变,实际中若监督信号也变化(如从BEV分割换为占用网格)则方法失效。


主要参考文献

[1] Y. Li, Y. Xiao, M. Jiang, X. Zuo, S. Zhang, and M. Yang, "A Stitch in Time Saves Nine: Preserving Policy Compatibility Under Perception Updates in End-to-End Autonomous Driving," arXiv:2606.21509, 2026.
[2] Hu et al., "End-to-end navigation with behavior cloning and reinforcement fine-tuning," in ICLR, 2023.
[3] L. Bansal, L. R. Seitz, R. Salakhutdinov, et al., "Model stitching: Learning to stitch together two independently trained neural networks," in NeurIPS, 2021.
[4] K. Lenc and A. Vedaldi, "Understanding image representations by measuring their equivariance and equivalence," in CVPR, 2015.
[5] S. Kornblith, M. Norouzi, H. Lee, and G. Hinton, "Similarity of neural network representations revisited," in ICML, 2019.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
别再让整个模型“换血”重训了!交大团队一项巧妙的研究告诉我们,有时候一个轻量的“拼接”层就能搞定。如果你也厌倦了高成本的模型迭代,欢迎来「龙哥读论文」粉丝群一起交流,和一帮懂门道的同行探讨更高效的自动驾驶技术路径。
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。