← 返回 PaperDaily 视觉与图像

北邮新方法:夜间深度估计误差暴降85%,雪天零样本也涨20%

雨天路面反光、夜间地面忽明忽暗、雪天纹理全无——自监督深度估计在这些场景下经常直接崩掉。北邮这篇工作给出了一个漂亮的解决方案:先用多个「天气专家」教师产生伪标签,再用不确定性蒸馏让学生学会判断该信谁;同时把雷达从稀疏的POV视角投影到更稠密的BEV空间做跨注意力融合。效果立竿见影,夜间absRel暴降85%,雪天泛化也提升了20%+。代码已开源,值得所有做自

北邮新方法:夜间深度估计误差暴降85%,雪天零样本也涨20%
原论文信息如下:
论文标题:
Boosting Robustness for All-Weather Self-Supervised Depth Estimation in Autonomous Driving
发表日期:
2026年07月
发表单位:
北京邮电大学(State Key Laboratory of Networking and Switching Technology)
原文链接:
https://arxiv.org/pdf/2607.21526v1.pdf
开源代码链接:
https://github.com/MICLAB-BUPT/RobustDepth

引言

在自动驾驶系统中,深度估计是感知模块的基石——无论是3D检测、轨迹预测还是路径规划,都需要准确理解每个像素到本车的距离。自监督深度估计通过学习相邻帧之间的几何关系来预测深度,无需昂贵的激光雷达标签,因此受到广泛关注。然而,这种方法的隐式前提是「亮度一致性假设」:两个相邻帧中对应像素的颜色应当相同。一旦遭遇恶劣天气——雨夜路面积水反光、雪天纹理被掩盖、雾天散射导致模糊——这个假设就被彻底破坏,深度预测立即出现黑洞、错估等灾难性错误。
现有的鲁棒性方法大多通过生成对抗网络或扩散模型合成恶劣天气下的配对数据来增强模型,但合成数据与真实世界之间存在不可忽视的域间隙。另一条路线是融合雷达——雷达波长长,不受雨雾影响,但雷达点在相机视角(POV)中极度稀疏(平均每帧仅413个非零点),而在鸟瞰视角(BEV)下则稠密得多(98,840个)。如何有效利用BEV下的稠密雷达信号,同时保持自监督训练的完整性,是一个关键挑战。
为此,北京邮电大学Mengshi Qi团队提出了一个全新的训练框架,核心包括:不确定性感知多教师蒸馏(UAMTD)POV-BEV雷达跨视角融合(PBCRF)。前者通过构建多个专精不同天气的教师模型,并利用不确定性估计让学生模型主动筛选可靠的伪标签;后者利用相机像素射线约束,将稠密的BEV雷达特征拉回POV空间进行交叉注意力融合,同时保留稀疏但精确的POV雷达。整个框架在真实全天气数据集RADIATE和nuScenes上取得了SOTA效果,夜间absRel降低85%,雪天泛化精度提升20%。
Fig. 1: (a) 顶级自监督深度模型LiteMono在全天气数据上预测出错(如夜间将地面误估为空洞),本文方法有效解决;(b) 雷达在POV视角下点稀疏,在BEV视角下更稠密,结合BEV可改善深度预测。
图1: (a) 顶级自监督深度模型LiteMono在全天气数据上预测出错(如夜间将地面误估为空洞),本文方法有效解决;(b) 雷达在POV视角下点稀疏,在BEV视角下更稠密,结合BEV可改善深度预测。

方法概述

本文的整体方法如图2所示。整个训练流程包含两个核心模块:左侧的不确定性感知多教师蒸馏(UAMTD)和右侧的POV-BEV雷达跨视角融合(PBCRF)。学生模型以相机图像+雷达数据为输入,同时优化不确定性蒸馏损失和光度重建损失。训练完毕后,教师模型和不确定性分支均可丢弃,推理时只有单网络,与标准自监督深度估计框架一样轻量。
整体数据流:首先用晴好数据训练一个基础教师 clear;然后将全天气数据按天气类型(雨、雾、夜等)分成不同子集,通过单教师蒸馏得到多个「天气专家」教师 1, 2, ... n。这些教师对全天气数据 Xe 推理得到伪标签 Di 和对应的不确定性图 Ui。学生模型从相机图像和雷达数据中提取特征,经过PBCRF融合后得到深度预测,同时用不确定性估计分支联合评估所有教师伪标签的置信度,从而自适应的加权蒸馏损失。
Fig. 2: 本文方法总览。首先生成多个天气专家教师,然后用不确定性蒸馏引导学生选择性学习,同时用POV-BEV跨注意力融合相机与雷达。
图2: 本文方法总览。首先生成多个天气专家教师,然后用不确定性蒸馏引导学生选择性学习,同时用POV-BEV跨注意力融合相机与雷达。
下面首先介绍单教师蒸馏(STD)作为基础。给定在晴好数据上训练的教师 clear,它产生伪标签 Dclear。学生模型同时优化与教师伪标签的相似度损失 Lsim 和在全天气数据上的自监督光度损失 Lp。 Lsim 提供鲁棒的锚点抑制异常输出, Lp 则让学生适应真实恶劣天气的外观细节。两者平衡避免了学生对盲教师的过度依赖或光度信号的漂移。最终单教师蒸馏损失为: Ld = Lsim + Lp。

核心机制:不确定性感知多教师蒸馏(UAMTD)

单教师蒸馏虽然比直接训练好,但一个教师无法覆盖所有恶劣天气模式。北邮团队进一步提出多教师蒸馏,但直接使用多个教师的简单平均往往会互相干扰(一个教师置信但错误的区域会误导学生)。因此他们引入了不确定性估计来动态衡量每个教师、每个像素的可靠性。

多样化教师生成

以晴好教师 clear 为基础,从全天气数据中选取不同天气子集(如雨+夜、雾+夜等)作为每个教师的训练数据,采用单教师蒸馏方法单独训练。这样每个教师都变成了对应天气条件下的「专家」。例如在RADIATE实验中,最优配置是两个教师:一个在(晴、雨、雾)上训练,另一个在(晴、雨、夜)上训练。这样的组合既覆盖了所有天气,又避免了数据碎片化。

不确定性感知蒸馏

不确定性估计分支(UEB)与学生模型共享多阶段特征,通过粗到细的方式生成每个教师的不确定性图。核心公式如下:在每个阶段 t,将学生特征 Ft 和所有教师的不确定性图进行拼接,输入包含非局部自注意力的网络,得到更新

恶劣天气下自监督深度估计为什么难?

自监督深度估计的核心思路很简单:让模型通过学习相邻两帧图像之间的几何关系来推导深度。这个过程依赖一个关键假设——亮度一致性假设,即同一物体在相邻两帧中的颜色应该相同。在晴朗的白天,这个前提基本成立;可一旦切换到雨、雪、雾、夜等恶劣天气,这个假设就变得千疮百孔。
具体来说,论文指出了四个典型的破坏场景:

雨天路面反光与纹理缺失:雨水覆盖地面后,原本具有纹理的路面变得像一面镜子,相邻帧之间的像素对应关系被彻底扭曲。夜间光照多变与闪烁:车灯照射下的路面在不同帧中呈现截然不同的亮度,违反了恒定光照假设,导致模型误将地面识别为「洞」或障碍物。雾天散射与模糊:雨滴或雪花遮挡在镜头前方,造成不可预测的折射和光晕变化。雪天地面纹理覆盖:积雪使地面纹理完全消失,算法彻底丢失了关键的几何线索。

现有的方法大多尝试用GAN或扩散模型来合成恶劣天气数据,然后训练模型适应这些合成数据。但这条路有个致命缺陷:合成数据与真实世界之间存在不可忽视的域间隙,在真实场景中部署效果往往大打折扣。
另外一条路线是融合雷达。雷达的长波长几乎不受雨雾和黑暗影响,是恶劣天气下最可靠的传感器之一。但问题也随之而来:雷达点在相机视角(Point of View,POV)中极度稀疏——经统计,在RADIATE数据集的60个场景中,POV视角每帧平均仅413个非零点。相比之下,同一帧雷达数据投影到鸟瞰视角(Bird's-Eye View,BEV)后,非零点数量飙升到98,840个,密度提升了239倍。如何把BEV的稠密雷达信号有效融合到POV的深度估计中,成为另一个技术瓶颈。
北邮团队的解决方案正是针对这两个痛点:用多教师蒸馏解决亮度一致性被破坏的问题,用跨视角雷达融合攻克雷达稀疏性的难题。

核心机制:不确定性感知多教师蒸馏(UAMTD)

蒸馏学习在深度估计中并不是新概念。一个常见的做法是先用晴好数据训练一个教师模型,然后用它的输出去「带」学生模型。但这种方法只能覆盖晴好场景,当学生接触到恶劣天气数据时,教师给出的伪标签在恶劣天气区域可能完全不靠谱,反而会误导学生。
本文的不确定性感知多教师蒸馏(Uncertainty-Aware Multi-Teacher Distillation,UAMTD)巧妙地解决了这个问题。整体上,UAMTD由两个阶段构成:多样化教师生成和不确定性感知蒸馏。

第一步:生成「天气专家」教师队伍

论文的设计是:先训练一个基础的晴好教师,再根据天气类型将全天气训练数据划分为不同的子集。比如对于RADIATE数据集,最优配置是包含两个天气专家教师:一个在(晴、雨、雾)上训练,另一个在(晴、雨、夜)上训练。每一个教师都使用单教师蒸馏方法单独训练,这样每个教师都变成了对应天气条件下的「专家」。这种设计的关键在于:单一的教师永远只擅长某一类场景,而组合多个专家才能覆盖所有天气。

第二步:不确定性感知——学生该信谁?

多个教师同时为学生提供伪标签,直接平均显然是粗鲁的做法——一个教师在某些区域很自信却是错误的,如果这时给它和正确教师相同的权重,反而会污染学生。因此,论文设计了一个不确定性估计分支(Uncertainty Estimation Branch,UEB)
UEB的核心思路是:将学生特征和所有教师的不确定性图拼接起来,通过非局部自注意力网络进行联合评估。这样,UEB能够学到:如果一个教师关于某个像素的预测与其他教师不一致,或者学生的视觉特征强烈暗示了不同的深度,那这块区域的不确定性就应该被拉高,学生应当减少对这个教师伪标签的依赖,转而更多依靠自监督光度损失。
最终的蒸馏损失函数通过负对数似然来实现不确定性感知:当不确定性高时,相似度损失的权重自动下降;同时还有一个正则项防止不确定性膨胀到无穷大。整个UEB是端到端训练的,不需要额外的人工标注。

创新融合:POV-BEV雷达跨视角注意力(PBCRF)

雷达融合是本文另一大亮点。先前的雷达融合方法基本都局限在POV视角,但正如之前所述,POV中的雷达点太稀疏(每帧仅413个点),提供的空间样本太少。而BEV视角下的雷达密度是239倍。
论文的POV-BEV雷达跨视角融合(POV-BEV Camera-Radar Fusion,PBCRF)采用了一种与传统Lift-Splat-Shoot相反的方向:它没有把图像特征提升到BEV空间,而是利用相机像素射线将稠密的BEV雷达特征拉回POV空间。
具体来说,PBCRF的工作流程如下:

编码与视角投影:使用轻量的ResNet-18分别编码相机图像、POV雷达和BEV雷达,得到各自的特征。然后利用相机模型假设每个像素对应一条3D射线,这个射线投影到BEV空间中,使得每个相机像素可以找到对应的BEV雷达特征。

跨注意力融合:相机特征作为query,对应的BEV雷达特征作为key和value,通过cross-attention机制进行融合。这样,每个像素能够自适应地从其射线上的多个BEV雷达点中聚合信息,同时抑制噪声。

POV雷达补充:融合了BEV雷达的特征之后,再与POV雷达特征进行渐进式融合,最终得到增强的深度特征。这样既利用了BEV的稠密几何线索,又保留了POV雷达精确的局部信息。

整个过程完全可微且不加额外可学习参数。尤为关键的是,PBCRF是专门为自监督目标设计的:融合后的特征仍在POV空间,与逐像素的光度重建损失完全对齐,而如果像常规方法那样把图像提升到BEV,反而会破坏这种对齐。

实验结果分析

论文的实验设计覆盖了RADIATE和nuScenes两大全天气自动驾驶数据集,比较了单帧和多帧架构、是否使用合成数据增强、以及不同的雷达融合策略。评估指标包括AbsRel(绝对相对误差)、RMSE(均方根误差)和δ<1.25(精度)。最大深度评估范围统一设置为80米。
为什么这个实验设计值得信服?主要有以下四点原因:第一,对比的方法覆盖了当前主流的单帧方法(MonoDepth2、LiteMono、MonoViT)和多帧方法(ManyDepth2),还包括了最先进的鲁棒性方法(WeatherDepth、md4all-DD等),范围全面。第二,UAMTD被证明是架构无关的——把它应用到不同的基础模型上都能带来一致的提升,这说明方法本身的设计是通用的、泛化的,而不是针对某个模型做了特殊调整。第三,RADIATE数据集包含了5种真实天气条件(晴、夜、雨、雾、雪),其中雪景完全没有出现在训练集中,这使得论文能够评估模型在零样本跨天气泛化上的能力。第四,消融实验设计非常充分,详细拆解了蒸馏策略、不确定性建模方法、雷达融合策略、教师选择方式以及模态平衡策略的影响,使得每一个设计选择都有数据和推理支撑。
在RADIATE数据集上,以LiteMono为基础模型的完全体方法(UAMTD + PBCRF)与直接在全天气数据上训练相比,夜间AbsRel从0.410降至0.060,降幅高达85%;雪天(零样本)条件下AbsRel从0.342降至0.246,提升20%以上。即使在晴好条件下,也实现了13%的误差降低。这些数据清晰地说明:方法不仅救了恶劣天气,也没有在好天气上「掉链子」。
表I:在RADIATE数据集上与现有SOTA自监督深度估计方法的比较。训练数据标注CLEAR表示仅使用白天晴好数据,ALL表示全天气数据。灰色标注表示误差过高不可接受。第1-12行展示不同架构上应用UAMTD的结果;第13-15行展示在UAMTD基础上进一步应用PBCRF的结果。粗体表示最佳结果。
表I:在RADIATE数据集上与现有SOTA自监督深度估计方法的比较。训练数据标注CLEAR表示仅使用白天晴好数据,ALL表示全天气数据。灰色标注表示误差过高不可接受。第1-12行展示不同架构上应用UAMTD的结果;第13-15行展示在UAMTD基础上进一步应用PBCRF的结果。粗体表示最佳结果。
论文还利用训练过程中误差变化曲线直观展示了UAMTD的稳定性优势。在夜间条件上,直接全天气训练的LiteMono随着训练轮次增加,AbsRel不断增大,最终发散;而不确定性蒸馏训练的模型误差则持续下降且趋于稳定。
图3:不同模型在夜间条件下,随着训练轮次增加,AbsRel误差的变化趋势。
图3:不同模型在夜间条件下,随着训练轮次增加,AbsRel误差的变化趋势。
在nuScenes数据集上,UAMTD同样表现优异:夜间AbsRel降低23%,雨天降低6%,晴好精度也保住了。在加入雷达融合后,晴好、夜间、雨天的AbsRel均进一步下降。
表II:在nuScenes数据集上与现有SOTA自监督深度估计方法的比较。粗体为最佳,下划线为次佳。
表II:在nuScenes数据集上与现有SOTA自监督深度估计方法的比较。粗体为最佳,下划线为次佳。
消融分析表明,不进行任何蒸馏(直接训练)、使用单教师蒸馏、使用多教师简单平均、以及使用不确定性感知多教师蒸馏,四个等级的性能递进非常清晰。不确定性分支替换为传统的异噪不确定性(aleatoric uncertainty)也低于本文方案,印证了多教师联合评估的优势。
表IV:所提出方法的全面消融研究。从上到下依次评估:不确定性感知多教师蒸馏、不同不确定性估计方法、雷达融合策略、教师选择策略、以及模态平衡策略。粗体为最佳,下划线为次佳。
表IV:所提出方法的全面消融研究。从上到下依次评估:不确定性感知多教师蒸馏、不同不确定性估计方法、雷达融合策略、教师选择策略、以及模态平衡策略。粗体为最佳,下划线为次佳。
图4:不同教师模型在热力图形式下的不确定性估计比较。红色圆圈标记了不确定性差异显著的区域。
图4:不同教师模型在热力图形式下的不确定性估计比较。红色圆圈标记了不确定性差异显著的区域。
在效率方面,整个框架的推理时不需要保留教师模型和不确定性分支,因此推理帧率与普通LiteMono完全相同(29.8 FPS)。训练阶段虽然需要多教师前向传播,但通过交替训练相机和相机-雷达对,单张3090即可完成训练。
表V:各组件在单张NVIDIA V100上的效率测试。教师模型和不确定性挖掘分支仅在训练阶段使用,推理阶段零开销。
表V:各组件在单张NVIDIA V100上的效率测试。教师模型和不确定性挖掘分支仅在训练阶段使用,推理阶段零开销。
可视化对比结果同样直观。在雨、雪、雾、夜四种天气条件下,直接在全天气数据上训练的LiteMono频繁出现将地面预测为「洞」、将车辆与背景预测为同一深度等严重错误;而本文方法在所有场景中均给出了清晰的深度边界和合理的物体形状。
图5:不同方法的可视化对比。绿色框标记了错误的深度估计(如雨天将地面预测为洞),红色框标记了物体估计模糊(如将车辆和背景预测为同一深度)。Lite-Mono和MonoVit指在晴好数据上训练的模型;Lite-Mono+和MonoVit+指在全天气数据上训练的模型。本文模型基于Lite-Mono并在全天气数据上训练。
图5:不同方法的可视化对比。绿色框标记了错误的深度估计(如雨天将地面预测为洞),红色框标记了物体估计模糊(如将车辆和背景预测为同一深度)。Lite-Mono和MonoVit指在晴好数据上训练的模型;Lite-Mono+和MonoVit+指在全天气数据上训练的模型。本文模型基于Lite-Mono并在全天气数据上训练。

讨论与展望:模态失衡问题与未来方向

尽管整体效果亮眼,论文的消融实验中暴露了一个有意思的现象:当相机分支和雷达分支使用相同的权重进行梯度更新时,发现雷达分支完全占据了主导地位,导致模型过于依赖雷达而忽略了视觉特征。这是因为在RADIATE中,雷达数据的信号强度天然较高,不平衡的训练会破坏相机特征的训练。论文通过引入模态平衡因子(设置为0.2)解决了这个问题,让相机和雷达以合适的比例共同进化。
这提醒我们:多模态融合不仅仅是把两个传感器对齐,还要考虑它们在训练中的相对强度。如果一方的梯度远大于另一方,融合结果就会被「带偏」。这个问题在实际工程中非常普遍,论文的处理方式具有参考价值。
关于未来方向,论文虽然没有长篇讨论,但可以从消融结果中看到几条明确的路径:如何设计更优的教师选择策略(当前是手动按天气类型划分,是否可以自动化?);如何进一步降低多教师训练的代价(当前需要多个教师模型,虽然推理时可丢弃但训练代价不低);以及当遇到更多种未知天气(如冰雹、沙尘暴)时,当前基于有限天气专家的设计能否扩展到无限天气?

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

UAMTD中的不确定性估计是怎么训练的?不需要标注吗?不需要人工标注。UEB的标签是隐式地从蒸馏损失中产生的:如果某个教师的高置信度伪标签与光度损失冲突很大,意味着这块区域教师不可靠,不确定性就会被拉高。同时还有一个正则项防止不确定性无限膨胀。整个UEB通过L_sim_L1损失的负对数似然形式端到端进行训练。

PBCRF为什么要用「反方向」的跨视角融合(BEV拉回POV),而不是LSS那样的POV到BEV?因为自监督深度估计的目标在POV空间(光度重建损失是对每个像素计算的)。如果把图像特征投影到BEV,与目标损失空间不一致;相反,把稠密的BEV雷达拉到POV空间,就可以直接参与逐像素的特征增强。虽然LSS路线在检测任务中流行,但对于深度估计,POV是主战场。

论文的方法在边缘设备上能跑吗?推理时完全可行。因为教师模型和不确定性分支在训练后可以丢弃,推理只有学生单网络+雷达特征编码,与标准LiteMono结构一致,单张V100上可达29.8 FPS,功耗可控。训练时需要多教师,但论文使用了单张3090即可完成,说明显存开销在可接受范围。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

首次将不确定性联合评估引入多教师蒸馏,反向BEV→POV雷达跨注意力设计也很有原创性。

实验合理度:★★★★★

消融完整,对比覆盖全面,且验证了架构无关性。消融设计细致到教师选择、模态平衡等细节。

学术研究价值:★★★★☆

为全天气自监督深度估计提供了可复用的通用框架,不确定性蒸馏的设计思路对多教师蒸馏是一种有意义的推进。

稳定性:★★★★☆

在训练过程中误差收敛曲线稳定,未出现发散;推理时无额外开销。但在极端天气(如雪景)是零样本测试,泛化表现还有提升空间。

适应性以及泛化能力:★★★★☆

跨越晴、夜、雨、雾、雪五种天气,并且对未训练过的雪景有提升。但教师选择策略依靠天气先验划分,泛化到全新未知天气时可能需要重新选择合适的教师。

硬件需求及成本:★★★★☆

推理时与LiteMono相当(29.8 FPS on V100)。训练需要单张3090,多教师增加了训练成本但尚可接受。扣一星是因为雷达数据需要预处理和同步,稍增加工程复杂度。

复现难度:★★★★☆

代码已开源,且依赖库(PyTorch、ResNet-18等)常见。主要难点在于雷达数据的预处理和相机-雷达帧对准,但论文已提供足够细节。

产品化成熟度:★★★☆☆

作为自监督深度估计的学术框架已经很完整,但产品落地还需要考虑:雷达在不同车辆上的配置差异、训练数据覆盖更多未知天气、以及与其他感知模块(检测、跟踪)的联合部署。

可能的问题:教师选择策略仍然依赖人工先验按天气划分,没有实现全自动教师发现;在雪景上提升有限(20% vs 夜间85%),说明零样本泛化还有空间;雷达装置的成本和安装复杂度限制了该方法在低成本方案中的推广。


主要参考文献

[7] Godard, Clément, et al. "Digging into self-supervised monocular depth estimation." Proceedings of the IEEE/CVF international conference on computer vision. 2019.
[14] Zhao, Ning, et al. "Lite-mono: A lightweight cnn and transformer architecture for self-supervised monocular depth estimation." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2023.
[16] Saunders, Keith, et al. "Monocular depth estimation for all-weather conditions." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2022.
[44] Qi, Mengshi, et al. "Multi-teacher distillation for self-supervised depth estimation." IEEE Transactions on Intelligent Transportation Systems, 2023.
[53] He, Kaiming, et al. "Deep residual learning for image recognition." Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2016.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
还在为雨夜雾雪时自动驾驶深度估计崩溃而头痛?北邮这篇把「多教师蒸馏」和「雷达BEV视角」玩出了花!想和龙哥一起跟踪更多自动驾驶前沿硬核技巧?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 深度估计+上海+北邮+小明),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。