← 返回 PaperDaily 视觉与图像

清华×阿里最新方法:先验保留+自适应路由

自动驾驶里最烦的事,不是“看不见”,而是“看见了一堆东西却不知道该信谁”。PerceptDrive 直接把这个矛盾摊开:感知先验不再一锅炖,而是分专家保留、按场景路由,再输出单条轨迹,90.4 的成绩也就顺理成章了。

清华×阿里最新方法:先验保留+自适应路由
原论文信息如下:
论文标题:
PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving
发表日期:
July 20, 2026
发表单位:
Tsinghua University; AMap, Alibaba Group
原文链接:
https://arxiv.org/pdf/2607.20175v1.pdf

第一步:引出问题,方法总览

自动驾驶最头疼的,不是“看不见”,而是“看见太多,最后不知道该信谁”。感知模型会给出几何、语义、动态等一堆先验,规划模型也能拿到更丰富的信息,但问题来了:这些信息一旦被压缩进少量查询向量,很多关键线索就会被挤掉;再加上不同场景里该信几何、该信语义、还是该信动态,本来就不一样,静态融合很容易一把梭,结果就是“平均得很努力,场景适配得很随缘”。
PerceptDrive 盯住的就是这个矛盾:不是再堆一个更大的端到端模型,而是把问题拆成两层——先把感知先验“保住”,再让规划器按场景“会挑”。它的核心思路很直白:冻结一个已经学到驾驶知识的感知提供器,再把一个冻结的视频编码器提供的密集时空信息一起送进可训练的世界-动作模型(World-Action Model,WAM,世界-动作模型),最后由一个自适应路由器决定当前场景更该偏向几何、语义还是动态先验。整个推理阶段只输出一条轨迹,不搞候选集、不做重排序、不做搜索,省得规划器在路口前还要开个“内部投票会”。
图1:VLM 驱动规划范式对比
图1:基于视觉语言模型(VLM)的规划范式对比。可以看到,直接把知识塞进单一接口,容易把任务相关线索压扁;把多个先验混在一起,又缺少明确约束;静态融合则无法随场景调整权重。PerceptDrive 的做法更像“先保留,再路由”,让每个专家先验都有自己的位置。
论文里把这个问题称作 prior-to-plan transfer,也就是“从先验到规划的迁移”。听起来像术语,翻译成人话就是:感知模型已经知道很多,但规划器不能把这些知识一股脑吞下去,否则不是消化不良,就是营养流失。PerceptDrive 试图做的,就是给这条链路加一个更靠谱的“知识中转站”。

第二步:冻结感知提供器构建

先验不是凭空长出来的。PerceptDrive 的第一步,是先构建一个冻结的感知提供器:先把 InternVL3-2B 适配到驾驶问答任务上,再通过多教师蒸馏,把几类专家先验压进模型里的专门槽位中。这里的关键不是“让模型更会聊天”,而是让它真正学会驾驶场景里的几何结构、道路语义和动态变化。
这个阶段分两层。第一层是驾驶问答微调。论文用来自 DriveLM、LingoQA、DriveQA、NuScenes-QA 和 Reason2Drive 的大量清洗去重样本,让模型对“路口怎么走”“前车在干嘛”“这个标志意味着什么”这类问题更敏感。对应的语言建模损失就是标准的下一词预测交叉熵:
公式1:语言建模损失
这里的 𝒴 表示答案 token 集合,p(yj|y<j,x) 是在输入上下文 x 和前文 token 条件下预测当前 token 的概率。说白了,就是先让模型把“驾驶语言”学顺,再谈更深层的视觉先验。
第二层才是真正有意思的地方:论文不是只让模型“懂驾驶”,而是把三类先验显式拆开,分别命名为 GEOSEMDYN。这三个缩写分别代表 Geometric(几何)、Semantic(语义)和 Dynamic(动态)先验。几何先验来自 VGGT,语义先验来自 V-JEPA 2,动态先验来自 Wan 2.1,都是冻结教师模型,PerceptDrive 自己只负责把这些知识“搬进来、放稳当”。
公式2:几何先验损失
几何先验的蒸馏,既看方向又看幅值。zgeo 是模型中几何槽位映射后的表示,Fgeo 是教师特征。损失同时包含余弦相似度和 L2 距离,意思很朴素:不光要“像”,还要“像得像那么回事”。
公式3:语义先验损失
语义先验则用掩码预测来对齐。模型只看见一部分上下文,再去补全被遮住的位置,这样学到的不是死记硬背,而是对场景关系的补全能力。这里的 M 是掩码,Pred 是预测器,目标是教师模型在被遮挡位置上的特征。
公式4:动态先验损失
动态先验更像是在学“未来会怎么动”。这里用的是视频扩散教师的速度场目标,D 是冻结去噪器, 是带噪潜变量,εw 分别表示噪声和视频编码后的目标。这个设计的意思很直接:别只盯着当前帧,得知道世界下一秒可能怎么变。
公式5:感知提供器总损失
三类先验再加上问答回放损失,组成感知提供器的总目标。这里最值得注意的是:教师全都冻结,梯度只回到槽位、投影头、桥接层和 LoRA 适配器。也就是说,知识不是把教师改坏了,而是把学生调到能稳定接住知识的状态。
图2:PerceptDrive 总体框架
图2:PerceptDrive 总体框架。上半部分先构建冻结感知提供器,下半部分训练世界-动作模型。感知侧输出高层先验 Ht,视频编码器输出密集潜表示 Ft,再一起进入可训练的规划模块。

第三步:先验保留世界-动作模型

如果说感知提供器负责“把知识准备好”,那世界-动作模型就是负责“把知识用对”。PerceptDrive 的 WAM 不是直接把感知特征扔给轨迹头,而是先经过一层查询接口压缩,再通过保留目标把每个专家分支重新拴回对应先验。这个设计很关键,因为查询接口本身就是瓶颈:压得太狠,信息丢失;压得太松,模型又容易学成一锅粥。
论文的做法是给每个先验分支配一个专属查询银行,让几何、语义、动态三路先验先被压缩成各自的分支读出,再送入共享 backbone 融合。为了防止这些分支最后都长得一模一样,作者加了一个 prior-retention objective,中文可以叫“先验保留目标”。它的作用不是让分支背诵原始特征,而是要求压缩后的分支读出还能重构回自己该保留的那类先验。
公式6:先验保留损失
这里的 ρc 是保留探针,Cc 是第 c 个分支的压缩读出,hc 是对应的先验目标。这个损失的直觉很简单:别让分支“学成通才”,而是让它在压缩后仍然记得自己原本负责什么。
更妙的是,保留目标不是直接把原始槽位硬传下去,而是让分支在保留专长的同时,还能接触完整感知池里的密集观察信息。这样做的好处是,分支既不会被原始先验“锁死”,也不会在融合里丢掉自己的身份。论文后面的消融也证明了这一点:只给分支看自己的槽位,效果反而不如“先压缩、再保留、再融合”的路线。
在主干结构上,WAM 还接了一个未来头和一个动作头。未来头先预测一个“无动作未来潜表示”,再用这个未来表示去条件化动作生成;动作头则采用 flow matching 的方式直接输出轨迹。这里的 flow matching 可以理解成一种连续生成轨迹的方法:不是一次性拍板,而是沿着一个可学习的速度场,把随机噪声一步步推成最终轨迹。它的好处是生成过程比较平滑,也更适合连续控制问题。
公式7:未来潜表示预测
未来头分成两条路:v̂free 是不带动作的未来潜表示,用来给动作头提供前瞻;v̂(a) 是带动作条件的未来潜表示,用来做辅助监督。两者都对齐到冻结视频编码器生成的目标空间,这样未来不是瞎猜,而是和视觉时序表征对得上。
公式8:未来重建损失
未来监督本质上是让模型学会“向前看”。这里的目标是冻结编码器在未来帧上的输出 vgt,分别约束无动作未来和动作条件未来。这样做的价值在于:动作生成不是只盯着当前场景做局部拟合,而是被迫和未来演化保持一致。

第四步:自适应专家路由与训练

真正把 PerceptDrive 和“静态融合”拉开差距的,是路由器。它不是简单给三个专家固定权重,而是根据共享场景表示预测软门控,再把三个分支的条件向量加权合并。换句话说,左转、右转、直行这种不同场景,本来就不该用同一套权重硬套,路由器做的就是让模型知道“现在该偏谁一点”。
公式9:自适应路由
这里的 α 是三路专家的权重,经过 softmax 后落在概率单纯形上,所以三路专家都会参与,只是比例不同。ŝt 是场景向量,ĉexp 是最终的专家混合条件。这个设计的精髓在于:不是“选一个专家,扔掉另外两个”,而是“让每个专家都在,只是按场景调音量”。
训练时,论文还额外用了规则引导的子指标来给路由器做蒸馏。简单理解就是:训练阶段先让每个专家分支各自生成一个草稿轨迹,再用一套“便宜但有效”的规则指标去打分,把这些分数变成路由目标。这样路由器学到的就不是拍脑袋的偏好,而是和驾驶质量更一致的门控策略。这里有个很重要的工程取舍:这些 privileged components 只在训练里出现,推理时全都拿掉,避免测试阶段再做评分、重排或搜索,把系统复杂度控制住。
公式10:分支草稿轨迹
这个式子描述的是每个专家在 one-hot 路由下生成的分支草稿轨迹。sg 表示 stop-gradient,也就是“这里别反传”,避免训练时梯度乱串,把路由和生成搅成一锅。
公式11:路由损失
路由损失就是让预测门控去拟合训练阶段蒸馏出来的目标门控。别小看这一步,论文后面的消融显示,少了路由蒸馏,模型会更像“平均主义者”,在需要明确偏向某类先验的场景里表现会掉。
公式12:总训练目标
最终训练目标把动作损失、未来损失、辅助质量监督、先验保留和路由蒸馏全部放进来。注意这里的梯度流向是刻意设计过的:动作损失不更新未来头,质量监督和路由蒸馏主要通过场景向量回流,保留损失只修分支读出。这个“各管一摊”的训练方式,虽然看着麻烦,但正是它让系统不至于在多目标优化里互相打架。
图4:路由权重与消融可视化
图4:路由权重与消融可视化。左图显示不同导航命令下的平均路由权重,转弯时几何专家权重更高,直行时动态专家更占比重;右图则说明,屏蔽某个专家后,受影响最明显的正是它最擅长的那一块指标。

实验结果与消融分析

实验设计很务实:训练只用 NAVSIM 的 navtrain,评测则看 navtest 上的 NAVSIM v1 PDMS、NAVSIM v2 EPDMS,以及公开的 navhard。更重要的是,推理阶段只有单前视相机,没有候选轨迹评分,也没有测试时搜索。这个设定很“狠”,因为它逼着方法证明自己不是靠后处理堆出来的分数,而是真正把规划主干做强了。
表1:NAVSIM v1 主要结果对比
表1:NAVSIM v1 navtest 上与现有方法的对比。PerceptDrive 在单前视相机条件下拿到 90.4 的 PDMS,超过了此前最强的单目基线。更有意思的是,它在 NC、DAC、TTC 等分项上都保持了很稳的表现,说明不是某一项“刷分”,而是整体规划质量在抬升。
表2:NAVSIM v2 主要结果对比
表2:NAVSIM v2 EPDMS 对比。PerceptDrive 在更复杂的评测协议下依然拿到 90.2,说明它不是只会在某一种指标上“讨巧”。尤其在 EC 这类更难的扩展舒适度指标上,提升很扎实,和它引入动态先验、未来条件化以及路由蒸馏的设计是对得上的。
图3:定性结果展示
图3:定性结果展示。红线是 PerceptDrive 生成的轨迹,绿线是人类驾驶轨迹。可以看到在路口、转弯和车流密集场景里,轨迹大体都能贴着合理的通行路径走,没有那种“模型自信地冲向错误车道”的离谱感。
消融结果最能说明问题。先看感知先验这部分,去掉几何、语义或动态中的任意一类,都会在对应的子指标上掉得更明显,这说明这三类先验不是摆设,而是互补的。尤其动态先验,去掉后对进展和舒适度的影响更突出,说明“知道场景里有什么”还不够,还得知道“接下来会怎么动”。
表A1:感知先验消融
表A1:感知先验消融。上半部分是重新训练后的提供器对比,下半部分是推理时直接屏蔽某个先验。两类实验都指向同一个结论:三类先验各有分工,而且动态先验并不是“锦上添花”,而是会实打实影响规划质量。
再看世界-动作模型的消融,性能是随着未来条件化、质量监督、先验保留和路由蒸馏逐步加入而单调上升的。这个结果挺说明问题:PerceptDrive 不是靠某一个“神奇模块”撑起来的,而是每一层都在做自己的事。未来条件化先把时序前瞻补上,先验保留防止分支塌缩,路由蒸馏再把场景偏好学出来,最后才形成完整收益。
表3:世界-动作模型消融
表3:世界-动作模型消融。FC、MS、PR、MR 依次加入后,两个主指标都持续上升,说明设计是有层次的,不是把模块堆起来碰运气。尤其路由蒸馏加入后,模型才真正从“平均分配专家”变成“按场景分配专家”。
论文还做了多种稳定性和有效性检查。三次训练种子下,完整模型的波动很小;路由权重在不同命令下也呈现出稳定偏好;而保留诊断表明,各专家分支确实更容易重构自己的目标槽位,说明“分工”不是幻觉。对工程落地来说,这类证据很重要,因为自动驾驶最怕的不是偶尔不准,而是今天像样、明天发疯。
表A4:多种子稳定性
表A4:多种子稳定性。均值和标准差都很稳,说明这套方法不是靠“碰对一次随机种子”刷出来的。
表A7:保留诊断
表A7:先验保留诊断。分支之间的相似度、交叉重构能力和注意力分布都支持“每个分支保留不同先验”这件事,至少从表征层面看,分工不是嘴上说说。

结论与展望

PerceptDrive 的价值,不在于又造了一个更大的端到端模型,而在于它把一个经常被忽略的问题讲明白了:感知先验不是越多越好,关键是怎么保住、怎么分工、怎么按场景调度。这套思路让模型在单前视相机、无测试时搜索的条件下,依然能拿到很强的规划结果,工程味道是比较足的。
不过,这类方法也有边界。第一,它依赖一个已经相当强的冻结感知提供器,前期构建成本不低;第二,训练阶段引入了多个教师和规则评分,系统复杂度明显高于普通单模型;第三,虽然推理阶段很干净,但训练管线并不轻松,复现门槛也不算低。换句话说,PerceptDrive 更像是“把复杂度前置到训练里”,而不是把复杂度留到上路时。
表A8:超参数敏感性
表A8:路由与保留超参数敏感性。默认设置附近表现最稳,说明作者不是随便拍参数,而是把训练配方调到一个比较合理的区间。
如果把这篇工作放到更大的自动驾驶脉络里看,它给出的启发很明确:未来的端到端规划,可能不只是“更大 backbone + 更多数据”,而是“把不同来源的知识分层保留,再用场景化路由去调度”。这类设计在复杂场景里尤其有意义,因为真实路况从来不是单一模式,模型若不能识别“当前更该信谁”,再强的先验也可能被平均掉。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“感知先验怎么传给规划器”这个接口问题。不是感知不够强,而是强感知信息进规划时容易被压缩掉、混掉、平均掉,所以论文用先验保留和自适应路由把这条链路重新整理了一遍。

GEO、SEM、DYN 分别是什么意思?它们分别是几何(Geometric)、语义(Semantic)和动态(Dynamic)先验。几何管道路与空间结构,语义管交通规则和场景理解,动态管未来变化趋势,三者互补,所以不能随便合并成一坨。

为什么它能在推理时只输出一条轨迹?因为所有“挑选候选轨迹、打分、重排、搜索”的活,都被搬到训练阶段了。训练时用规则子指标给路由器蒸馏,推理时只保留一个前向过程,所以系统更轻,也更接近真实部署需求。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“先验保留”和“场景自适应路由”绑在一起,思路不算花里胡哨,但抓住了自动驾驶里很真实的接口痛点,属于扎实型创新。

实验合理度:★★★★☆

单目、无测试时搜索、跨协议评测、再加多种子稳定性和消融,整体很完整;唯一代价是训练管线比较复杂,复现时不能偷懒。

学术研究价值:★★★★☆

对“先验如何进入规划”这个老问题给出了比较清晰的拆解,尤其适合后续继续研究知识压缩、路由和世界模型的结合。

稳定性:★★★★☆

多种子结果较稳,推理阶段也没有花哨后处理,稳定性比很多“靠候选集撑分”的方案更像能上车的样子。

适应性以及泛化能力:★★★☆☆

对 NAVSIM 这类评测很强,但是否能无缝迁移到更多传感器配置和更复杂城市环境,还需要进一步验证。

硬件需求及成本:★★☆☆☆

推理不算重,但训练阶段要冻结多个教师、做多轮蒸馏和路由监督,成本明显不低,适合研究和高预算团队。

复现难度:★★☆☆☆

数据、教师模型、训练配方和评测协议都比较多,虽然思路清楚,但真要复现出同样结果,不会太轻松。

产品化成熟度:★★★☆☆

推理形态比较干净,具备落地潜力;但前提是感知提供器和训练配方要足够稳定,且要经过更大范围路测验证。

可能的问题:方法很强,但训练链路偏重;先验依赖也较高,若教师质量或数据分布变化,收益可能会缩水。


主要参考文献

[1] PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving. arXiv:2607.20175v1, 2026.
[2] NAVSIM v2 官方评测协议与 EPDMS 指标说明,论文实验部分引用。
[3] VGGT、V-JEPA 2、Wan 2.1、InternVL3-2B 等基础模型与教师模型,见论文正文相关引用。

这篇 PerceptDrive 的妙处,在于把“看见什么”与“怎么开”拆开再重新接好。想继续追这种自动驾驶、世界模型、端到端规划的硬核解读,欢迎加入龙哥读论文粉丝群,一起把论文里的门道掰开揉碎。 

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。自动驾驶、机器人、世界模型、端到端规划都欢迎来聊,别让好论文只停留在收藏夹里。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。