← 返回 PaperDaily 视觉与图像

UniTeD拿下NAVSIM 90.2:感知规划一起扩散

这篇论文把自动驾驶里最爱“各干各的”的感知和规划,硬生生塞进同一个扩散框架里一起去噪。再配上TTM和ARS两个补丁,既照顾时序,又盯住训练推理偏移,属于那种思路很顺、工程也不算太虚的方案。

UniTeD拿下NAVSIM 90.2:感知规划一起扩散
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文把自动驾驶里最爱“各干各的”的感知和规划,硬生生塞进同一个扩散框架里一起去噪。再配上TTM和ARS两个补丁,既照顾时序,又盯住训练推理偏移,属于那种思路很顺、工程也不算太虚的方案。


原论文信息如下:
论文标题:
UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving
发表日期:
2026年06月
发表单位:
Nullmax, Westlake University
原文链接:
https://arxiv.org/pdf/2606.25736v1.pdf

统一扩散框架UniTeD:端到端自动驾驶的感知与规划联合建模

自动驾驶里最烦的一件事,不是“车会不会开”,而是感知和规划老爱分家。感知负责看世界,规划负责想怎么走,听起来像两位同事分工明确,实际上却常常是“你看你的,我想我的”,出了问题还容易互相甩锅。UniTeD 的思路很直接:既然最终目标都是把车安全地开到目的地,那就别让它们各自修仙了,干脆放进一个统一的扩散框架里一起去噪、一起更新、一起进步。
封面
图2:UniTeD 总体框架。它把感知、地图和规划三类任务放进同一个扩散式解码器里,再配上时间模块和锚点刷新策略,试图把“多任务互相拖后腿”变成“多任务互相补短板”。
先把背景说清楚。扩散模型本来是从“噪声”一步步还原出“干净结果”的生成模型,最早在图像生成里风生水起,后来被搬到自动驾驶里做轨迹生成、行为预测,甚至地图恢复。它的优势是天然能表示多模态:同一个场景里,车可能直行、变道、减速,扩散模型能保留多种可能性,不像普通回归那样容易输出“平均答案”。但问题也很明显:很多方法只把扩散留给规划,把感知仍然交给单独的判别式网络。这样一来,感知一旦出错,规划就只能拿着错误输入硬着头皮继续推理,像拿着一张画错的地图去找路,越走越迷糊。
UniTeD 的核心变化,就是把感知、地图和规划统一成一组任务锚点,在同一个生成空间里同步去噪。这里的“锚点”可以理解成任务的初始候选位置或状态种子:有的负责车和动态目标,有的负责车道和地图元素,有的负责自车未来轨迹。模型先把这些锚点加噪,再在统一解码器里逐步去噪恢复。这样做的妙处在于,感知任务不再只是规划的“前置供应商”,规划也不再是感知结果的“被动接盘侠”,而是彼此在同一个生成过程中互相提供线索。
从实现上看,UniTeD 的结构并不花里胡哨。图像骨干网络先从多摄像头输入中提取多尺度特征,然后把三类锚点投到同一个潜在查询空间,交给统一扩散解码器。解码器内部最关键的不是“堆更多层”,而是让任务之间真的能交流:自注意力允许不同任务的查询彼此看见,空间可变形注意力把查询重新锚定到三维空间,而条件调制则根据当前噪声步数调整去噪节奏。换句话说,这不是“各做各的再拼起来”,而是“大家围成一桌边聊边改”。
图1
图1:现有端到端自动驾驶范式对比。左边是感知和规划分开做,右边是把二者统一起来;UniTeD 进一步把“统一”推进到生成式建模层面,让感知和规划在同一个扩散过程中共同更新。
这里要补一个术语。DDIMDenoising Diffusion Implicit Models,中文常译为去噪扩散隐式模型,是扩散模型里常用的一种采样方式,特点是推理时步数更少、速度更快。UniTeD 继承了这种思路,但把它从“只管规划”升级成“全任务一起管”。

如何解决时序扩散中的噪声级别不匹配?TTM模块详解

如果说统一建模解决的是“同一帧里大家别各说各话”,那时序建模解决的就是“前后帧别对不上频道”。自动驾驶不是单帧拍照,它更像一段连续剧:前一秒前车还在左边,后一秒可能已经开始并线;地图也会随着视角变化被重新补全。很多扩散式方法只盯当前帧,或者把历史特征简单拼接一下,结果就是历史查询和当前查询噪声级别不一致,像把不同温度的水硬倒进一个锅里,最后很难煮出稳定结果。
图3
图3:时序交互模块。TTM 的任务很明确:先把历史查询“调到”和当前帧一致的噪声水平,再让它们参与跨帧注意力交互,避免历史信息因为噪声步不一致而干扰当前去噪。
TTM 的全称是 Temporal Transition Module,中文可理解为时序迁移模块。它的核心不是简单“记住过去”,而是先对齐,再融合。历史帧在进入当前帧的交互前,会先根据历史噪声步和当前噪声步的差异做一次条件变换,把历史查询重新投影到当前噪声流形里。这样做的好处很直白:历史信息仍然保留,但不会因为“我在第 3 步,你在第 8 步”而产生节奏错乱。
从机制上拆开,TTM 先把当前帧的时间步编码成条件向量,再把历史帧的条件向量和当前条件向量的差异送进一个小型映射网络,生成缩放和偏移参数。历史查询经过这组参数变换后,才进入跨注意力层与当前查询交互。这个设计有点像开会前先统一口径:不是把所有历史发言原封不动搬进来,而是先翻译成当前议题能听懂的语言,再开始讨论。这样,跨帧信息能提供运动趋势、结构延续和场景稳定性,而不是制造额外噪音。
这部分的设计很关键,因为扩散模型最怕“条件错配”。如果历史信息的噪声水平和当前步不一致,模型看到的就不是“更完整的上下文”,而是“风格不统一的杂烩”。TTM 通过显式对齐噪声状态,让时间记忆真正服务于生成,而不是拖累生成。这个思路也说明,时序建模不是简单把帧数堆上去就完事,对齐方式往往比“有没有历史”更重要。

锚点刷新策略:缓解训练-推理分布偏移的利器

UniTeD 还有一个很“懂工程”的设计,叫 Anchor Refresh Strategy,中文可以叫锚点刷新策略,简称 ARS。这里的痛点来自稀疏查询式扩散规划:训练时,只有少量与真值匹配的查询会被认真监督,其他查询几乎没怎么学;推理时,所有查询又都要参与迭代更新。结果就是训练和推理看到的查询分布不一致,模型越跑越容易“走偏”。
ARS 的做法很像给迷路队伍做“现场补给”。在每个去噪步,如果某个查询的置信度足够高,就继续按正常 DDIM 轨迹往下走;如果置信度偏低,就不让它继续在错误方向上越陷越深,而是直接从原始噪声分布重新采样,把它刷新回训练时熟悉的锚点附近。这样做的目的不是粗暴重置,而是保留高质量轨迹,补救低质量轨迹,同时维持查询多样性。
这个策略的价值在于,它不是单纯追求“每个查询都往前走”,而是承认扩散推理里有些查询一开始就不靠谱,继续硬推只会把错误放大。ARS 相当于给模型加了一道“纠偏闸门”,让低置信度分支有机会回到更接近训练分布的区域,再重新参与后续去噪。对于自动驾驶这种对稳定性极其敏感的任务来说,这种小修小补往往比大刀阔斧更实用。
表7
表7:锚点刷新策略消融实验。可以看到,单靠统一扩散还不够,加入 ARS 后,模型在规划稳定性上更容易站稳脚跟,说明“刷新低质量查询”确实不是摆设。

实验结果全面领先:NAVSIM、Bench2Drive和nuScenes最优

实验部分最值得看的,不是“某个指标涨了 0.1”这种让人眼皮打架的细节,而是 UniTeD 的优势是否真的来自它的设计。论文在三个层面做了验证:NAVSIM 看中期仿真规划,Bench2Drive 看闭环交互驾驶,nuScenes 看感知与预测能力。这样的组合比较合理,因为如果一个方法只会在单一榜单上刷分,那多半是“会考试,不会开车”;而 UniTeD 想证明的是,它不仅能规划,还能顺带把感知一起提升。
表1
表1:NAVSIM v1 上的对比结果。UniTeD 以 90.2 的 PDMS 取得最优,且只用摄像头输入就超过了不少使用摄像头加激光雷达的对手,说明统一扩散并不是“花架子”,而是能实打实把规划指标拉上去。
在 NAVSIM v1 上,UniTeD 相比最强的分离式判别模型和已有生成式规划方法都有进一步提升。更关键的是,它不是只在某一个子指标上“擦边赢”,而是在整体分数上持续领先。这说明统一扩散带来的收益,不只是轨迹更像样,而是感知、地图和规划在同一个空间里共同优化后,整体决策质量真的变好了。论文还特别强调,模型不依赖激进的花活,属于“没加太多奇怪配方,还是能赢”的类型,这一点很加分。
表2
表2:NAVSIM v2 上的结果。面对更难的场景,UniTeD 仍然保持领先,EPDMS 达到 90.1,说明它不是只会在“相对温和”的环境里表现好,而是有一定的复杂场景适应能力。
NAVSIM v2 的难度更高,指标也更综合,既看安全,也看舒适和效率。UniTeD 在这里依旧压过了最强生成式基线 DiffRefiner,说明它的优势不是单点技巧,而是整个统一生成框架更稳。换句话说,别人像是在修一条路,UniTeD 更像是把路网、车流和导航逻辑一起重新理了一遍,结果自然更顺。
表3
表3:Bench2Drive 在线榜单结果。UniTeD 在 200K 训练数据下拿到 87.3 的 DS,甚至超过了一些用更多数据训练的模型,说明它在闭环交互环境里也有不错的泛化和鲁棒性。
Bench2Drive 更像真实开车:路口、交互、长尾情况一股脑儿都来了。UniTeD 在这里还能稳住,说明它的统一扩散并不只是“静态回放好看”,而是能在闭环中持续修正自己的动作。这个结果和 ARS、TTM 的设计是能对上的:一个负责跨帧信息对齐,一个负责低置信度刷新,合起来就让模型在连续决策里少犯糊涂。
表4
表4:nuScenes 验证集上的感知与预测结果。UniTeD 不仅规划强,检测、地图分割、跟踪和运动预测也都不弱,说明它并没有为了规划牺牲环境理解。
nuScenes 的结果很有意思,因为它直接证明了 UniTeD 不是“只会开车,不会看路”。在检测、地图、跟踪和运动预测上,它都能保持较强表现,尤其是地图分割和运动预测的提升,说明统一扩散确实让任务之间形成了正向互补。感知更准,规划更稳;规划更稳,反过来又能帮助模型理解场景结构,这种双向增益正是统一生成式建模最值得期待的地方。
图S1
图S1:NAVSIM 上的定性对比。生成式不确定性建模让 UniTeD 在复杂场景里更不容易“一条道走到黑”,对一些边界情况更有弹性。
图S2:NAVSIM 上的定性对比。联合分布建模带来的互相修正效果更明显,车道结构、目标状态和规划轨迹之间的关系更连贯。
如果把结果总结成一句话,那就是:统一扩散 + 时序对齐 + 锚点刷新这三件事没有一个是摆设。统一扩散让多任务彼此增益,TTM 让历史信息真正可用,ARS 让推理分布别跑偏。三者叠在一起,才有了论文里这种“多榜单都能打”的表现。

方法优缺点与未来展望

UniTeD 的优点很集中。第一,它把端到端自动驾驶里最容易割裂的感知和规划,真正放进了一个统一生成框架里,理论上更符合“最终决策由整体场景共同决定”的直觉。第二,它不是只做单帧生成,而是把时间上下文也纳入统一扩散,解决了不少时序方法“历史有了,但没对齐”的老毛病。第三,ARS 这种策略很工程化,说明作者不只会写漂亮公式,也考虑了训练和推理之间那道最容易翻车的沟。
但它也不是“无敌版”。首先,扩散模型本身的推理开销仍然高于很多一次性回归式方法,虽然这里用了截断扩散和较少的去噪步数,但要真上车,延迟、算力和系统工程还是得继续打磨。其次,统一建模虽然让任务互相帮助,但也意味着任务间耦合更强,一旦某个子模块学偏了,可能会影响整个生成链路。最后,论文主要验证了几个主流基准,离极端天气、超长时序、传感器异常等更复杂场景,还需要更多实车或大规模闭环验证。
未来如果继续往前走,UniTeD 这类方法很可能会有两个方向值得追。一个方向是把更多任务也纳入统一生成空间,比如占用、意图、交互关系等,让车辆对世界的理解更完整;另一个方向是继续压缩推理成本,让统一扩散不只停留在论文榜单上,而是真正能进入车端系统。毕竟自动驾驶最不缺的就是“效果不错但太贵”,最缺的是“效果不错、还跑得动”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决的是端到端自动驾驶里感知和规划分开建模、时序信息利用不足,以及扩散式规划训练和推理不一致这三类问题。UniTeD 的办法是把感知、地图和规划统一进一个扩散框架,再用 TTM 和 ARS 把时间信息和推理分布问题一起处理掉。

TTM 和 ARS 分别是干什么的?TTM 是 Temporal Transition Module,负责把历史查询对齐到当前噪声级别,避免跨帧信息“噪声不统一”;ARS 是 Anchor Refresh Strategy,负责在推理时刷新低置信度锚点,减少训练和推理分布偏移。

为什么说它不只是“规划模型更强”这么简单?因为它在 nuScenes 上不仅规划好,感知、地图分割、跟踪和运动预测也同步提升了。也就是说,它不是拿感知给规划“打工”,而是把整套场景理解和决策一起抬高了。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把感知和规划统一到扩散式生成空间里,再叠加时序对齐和锚点刷新,思路是比较完整的,不是小修小补。

实验合理度:★★★★☆。在 NAVSIM、Bench2Drive、nuScenes 上都做了验证,且有消融支撑关键模块,整体比较有说服力。

学术研究价值:★★★★☆。它把“统一建模”从判别式推进到生成式,对端到端自动驾驶的任务组织方式有启发。

稳定性:★★★☆☆。比纯生成规划更稳,但扩散推理和多模块耦合仍然意味着工程稳定性还要继续打磨。

适应性以及泛化能力:★★★★☆。跨多个基准都能保持优势,说明泛化能力不错,不过极端场景还需要更多验证。

硬件需求及成本:★★★☆☆。截断扩散和少步采样有帮助,但整体仍比轻量回归式方案更吃算力。

复现难度:★★★☆☆。方法结构清楚,但涉及多任务扩散、时序模块和推理策略,复现不会太轻松。

产品化成熟度:★★★☆☆。作为研究原型很强,若要上车,还需进一步压缩延迟并验证长尾鲁棒性。

可能的问题:统一扩散很漂亮,但多任务耦合更强,某个子任务偏差可能会传导到整体;此外推理成本和真实闭环稳定性仍是落地门槛。


主要参考文献

[1] Bo Zhao, Xinting Zhao, Naifan Li, Erkang Cheng, Haibin Ling. UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving. arXiv:2606.25736v1, 2026.
[2] nuScenes, NAVSIM, Bench2Drive 等基准与相关方法见原论文正文及附录。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。