← 返回 PaperDaily
视觉与图像
雨天雪天雾天通吃?慕尼黑工业大学UAR-Net四项基准刷新SOTA
雨天、雪天、雾天,一个模型全搞定?针对统一恶劣天气修复中“全局聚合不分天气、跨尺度融合太粗暴、目标函数太自信”三大痛点,慕尼黑工业大学团队祭出UAR-Net,用门控Transformer加不确定性建模,直接刷新SOTA。结果实在,思路清晰,搞图像恢复的同学值得一读。
龙哥读论文
发布于 2026-09-12 16:54:33
阅读 1
查看原文
原论文信息如下:
想象一下这样一个场景:你正在高速上开着车,自动驾驶系统必须实时分析路况。突然,一场大雨倾盆而下,挡风玻璃上的水滴、前方的雾气和湿滑路面反光,让摄像头捕捉到的画面变得一团糟。这时候,如果车载视觉系统不能快速“脑补”出干净的图像,哪怕只是0.1秒的误判,后果都不堪设想。这正是恶劣天气图像恢复要解决的核心问题——它不仅是让照片更好看,更是保障自动驾驶、智能监控等系统在真实世界中可靠运行的关键前提。 恶劣天气图像恢复为何如此困难?
早期的图像恢复方法思路很简单:针对一种天气训练一个专用模型。比如专门去雨的、专门去雪的、专门去雾的。这种“一个萝卜一个坑”的思路,在实验室里效果尚可,但一放到现实场景就抓瞎了。现实世界哪会按你训练好的天气来?可能前一秒还晴空万里,后一秒就是狂风暴雨,再下一秒又飘起鹅毛大雪。如果你想应对所有情况,难道要在手机里装几十个模型吗?显然不现实。
所以,学术界慢慢转向了All-in-One的研究范式,希望能用一个统一的网络来处理多种恶劣天气退化。思路是好的,但随着研究的深入,大家发现这条路并不好走。目前的统一模型普遍存在三个很棘手的毛病。
第一个毛病,叫做“不分青红皂白的全局聚合”。无论是经典的Transformer还是新潮的线性注意力,它们在建模全局关系时,都是对图像里的所有像素一视同仁。但问题来了,雨和雪对全局信息的依赖能一样吗?雨丝是长条状的,有方向性;而雾是均匀弥散的,没什么结构。如果模型用同样一套逻辑去聚合全局特征,就好比用同一种锅铲去炒所有的菜,很难炒出符合每种食材特性的味道,这自然会限制模型对特定天气的适应能力。
第二个毛病,是“简单粗暴的跨尺度融合”。现在的修复模型基本都是U-Net结构,为了把encoder的细节信息传给decoder,通常会有skip connection。但大多数方法就是简单地把encoder特征和decoder特征拼起来或者加起来完事。这在天气好的时候没问题,但在恶劣天气下,encoder的浅层特征里可能全是雨滴、雪花这种“噪声”,你把这些脏乱差的特征一股脑地加到decoder里,反而会干扰重建,得不偿失。
第三个毛病,是“过度自信的确定性目标”。大多数模型训练时用的都是L1或L2这种像素级损失函数。在轻度退化区域,这没什么问题。但遇到被大雪或浓雾完全遮住的区域,模型根本不可能精确恢复出原始纹理,这时候你还逼着它输出一个确定的像素值,它要么给你个模糊的平均色,要么就“自信”地编造一个不存在的细节。在真实的复杂场景中,这种不确定区域的误判往往是最致命的。
来自慕尼黑工业大学团队的最新研究,正是精准地瞄准了这三大痛点,提出了一种全新的解决方案——UAR-Net。
方法概述:三位一体的UAR-Net
一起来看下UAR-Net的总体架构,它整体上仍然是一个优雅的U-Net形状,但内部的“零件”已经焕然一新。
整个网络的核心由三大部分组成:作为骨干的特征提取器GDTB,负责打通编码器与解码器之间信息通路的BMSC,以及在最后阶段精雕细琢的URH。这三个模块分别对治上面提到的三大痛点,配合精心设计的损失函数,最终实现效果的全方位提升。
接下来,龙哥就带大家逐一拆解这些模块,看看它们到底是如何各显神通的。
门控注意力:让模型学会选择性关注
为了解决第一个痛点,论文提出了一个名为GDTB的模块。这个模块的核心是一个叫做选择性门控注意力(SGA)的机制。要理解SGA,得先简单了解一下线性注意力。
传统的Transformer的注意力机制,计算量是图像尺寸的平方,处理高分辨率图像时计算开销大得吓人。而线性注意力通过一些数学技巧,把计算复杂度从O(N²)降到了O(N),可以处理更大尺寸的图像。但线性注意力有个通病,就是它对图像的全局信息“一视同仁”,很难区分哪些是重要的雨丝,哪些是次要的背景。
SGA的改进很巧妙。它在线性注意力的基础上加了两个关键设计。第一个是正弦调制,通过在查询和键的特征上叠加位置相关的正弦函数(例如Qcos、Kcos),让模型天然地对邻近区域更敏感,从而能更好地捕捉雨丝、雪花这种局部结构。第二个就是“门控”。论文把查询特征的一部分拿出来,经过一个sigmoid函数,生成一个0到1之间的“门”。这个门的作用就像是一个智能开关,能根据当前图像区域的内容,自主决定是放大还是抑制来自某个全局位置的信息。
除了这个SGA,GDTB里还配备了一个双尺度门控前馈网络(DGFF)。这个模块用两个不同感受野(3x3和5x5)的深度卷积来并行处理特征,相当于同时用两个不同倍率的放大镜观察局部细节,最后再通过门控机制把放大镜下看到的互补信息融合起来,进一步增强了模型对局部细节的建模能力。这个设计可以理解为SGA负责宏观的“选择性关注”,而DGFF负责微观的“精细化观察”,二者相辅相成。
平衡跳跃连接:多尺度融合的新思路
针对第二个痛点,论文提出了BMSC。这个设计的目标,是解决简单跳跃连接可能带来的垃圾信息传递问题。试想一下,U-Net的编码器从浅到深有多个尺度的特征,浅层的特征空间分辨率高,保留了丰富的边缘和纹理,但恰恰也包含了最多的雨雪噪声。过去的做法是直接把它们“生搬硬套”给解码器,但现在,BMSC希望能先对这些多尺度特征进行一次“清洗”和“融合”,提炼出一个更干净、更稳定的“平衡”表示。
更有趣的是论文为BMSC赋予了一个极具物理直觉的解释。它类比了数值分析中的亚当斯-巴什福思(Adams-Bashforth)和亚当斯-莫尔顿(Adams-Moulton)方法,提出了一种预测-校正机制。刚才提到,深层特征语义丰富但分辨率低,浅层特征细节多但噪声也多。如何将这么多不同尺度的特征融合起来?从深到浅,逐步走到一半时,既包含深层的语义,又融合了部分浅层细节,但走到浅层时,就会把噪声也带进来。于是论文设计了一个“预测-校正”策略:先用一个显式的预测器(相当于AB方法)粗略估计下一步的状态,再用一个隐式的校正器(相当于AM方法)来修正这个预测,从而让整个融合过程更加稳定,不至于“跑偏”。
不确定性感知:让模型知道“哪里不确定”
前两问解决的是“模型看不看得清”的问题,最后一问更深刻——模型怎么知道自己其实没看清?
大部分图像恢复模型的训练目标,都是让输出和真值在像素级别尽可能接近。问题在于,当输入图像某区域被严重遮挡时,干净图像的内容本质上已经无法从输入中唯一推断出来。这时候强行让模型输出一个确定的干净像素,只会得到一个模糊的平均值,甚至出现“一本正经地编细节”。
UAR-Net在解码器末端接了一个URH,全称Uncertainty-Aware Refinement Head,即“不确定性感知精修头”。它从解码器的粗特征出发,分出两个并行预测分支:一个预测均值,也就是最终恢复图像;另一个预测方差,代表每个像素的不确定程度。换句话说,模型不仅告诉用户“我恢复了什么”,还告诉用户“我对这块恢复得多有把握”。为了训练这个不确定性估计,作者设计了BAE-Loss,全称Brightness-Aware Energy Loss,即“亮度感知能量损失”。这个损失从随机变量的分布差异角度出发,先构造两个高斯分布来分别描述预测和真值的概率特性,再计算它们之间的能量距离。简单理解就是:在误差本来就很大的区域,损失权重会自动调整,模型不需要为了“硬拟合”而牺牲整体稳定性。
为了让预测值和真值在概率分布层面更接近,BAE-Loss里还引入了一个能量距离项D_B。给定两组像素分布,能量距离衡量的是“两个高斯分布之间的差异程度”,它同时考虑均值的偏移和方差的差异。这个项目的直观含义是:如果模型预测的不确定性很高,那么损失函数不会强求该区域输出与真值完全一致,而是允许预测保持一定“模糊度”;反过来,如果模型预测得很确定,那损失函数就会非常严格地要求预测接近真值。
除了BAE-Loss,模型还额外加了一个相关损失来保持结构一致性。这个损失计算预测图像和真值图像在像素空间的相关性,相当于从全局结构上约束模型别把“亮度补对了,但纹理位置搞错了”。最终总损失是BAE-Loss与相关损失的加权和。
实验结果全面领先
方法设计得再漂亮,最终还得看实验数据是否接得住。UAR-Net在四类广为人知的恶劣天气基准上做了对比测试,包括Snow100K-S/L(去雪)、Outdoor-Rain(去雨)和Raindrop(去雨滴)。主结果使用PSNR(峰值信噪比,单位dB,越高代表像素重建误差越小)和SSIM(结构相似度,越接近1代表结构保持越好)两个指标来评价。
从主表的定量对比来看,UAR-Net在不同退化类型下都表现出了稳定性。这里说的稳定性不只是说某个单指标刷得高,而是说它在不同数据集上的涨幅比较均衡。很多统一模型往往“偏科”,去雨好但去雪平平;UAR-Net的目标是让所有退化类型都能从统一框架中受益。
只看PSNR、SSIM还不够,因为像素指标有时和人的主观感受并不完全同步。论文还补充了LPIPS、Q-Align、MUSIQ等多个感知类指标的比较,以便更全面地衡量图像在人类视觉系统中的真实观感质量。这一组结果同样显示出UAR-Net的优势,说明它不只是“数值怪”,在生成观感上也经得起推敲。
为了验证各个模块的真实贡献,论文做了细致的消融实验。表5汇总了去掉SGA门控、去掉BMSC、去掉URH之后的效果变化。结果显示,每个模块的移除都会带来一定幅度的性能下降,表明这三部分并非锦上添花,而是协同工作、缺一不可。
这里还想多说一点:门控机制带来的提升到底来自哪里?实验显示,单独加正弦重加权、单独加门控,都能取得正向收益,但两者结合时效果最好。原因在于,正弦重加权负责给模型提供“位置远近”的先验,门控则负责让模型对具体内容做动态选择,两者关注的角度不同,正好形成互补。
模型学了多个天气下的统一表征后,这些表征能不能被清楚地区分开?论文用t-SNE可视化了特征分布。可以明显看到,相比对比方法,UAR-Net学到的特征在不同天气类别之间边界更清晰,同类天气内部的聚类也更紧凑。这说明模型不是简单地把所有天气混在一个模糊空间里,而是学会了“天气感知”的特征分离。
除了恢复精度,实际部署还关心一件事:模型够不够轻。论文对比了平均PSNR与计算复杂度之间的平衡关系。可以看出,UAR-Net并不靠堆算力取胜,而是在可接受的计算开销下,把性能推到了更高的位置。这种效果对于自动驾驶等实时性要求高的场景尤为重要。
从整体结果来看,UAR-Net在基准测试上确实做到了全面领先,多个模块带来的增益均可被消融实验验证。不过,也要清醒看到:现有实验大多基于合成恶劣天气数据,与真实雨雪场景之间仍然存在domain gap。如何把这种在基准上表现优异的能力迁移到复杂开放世界,是后续值得持续跟进的题。
龙迷三问
这篇论文到底在解决什么问题? 针对现有恶劣天气修复模型在统一框架下难以处理异构退化的问题,本文提出UAR-Net,通过门控Transformer、平衡多尺度跳跃连接及不确定性感知优化,在4大基准上全面超越MODEM等SOTA方法,平均PSNR提升0.28dB。
这篇工作最值得看的点是什么? UAR-Net在四个基准数据集上均取得最优PSNR和SSIM,平均PSNR达34.46dB,比Histoformer高0.78dB,比MODEM高0.28dB。在感知质量指标LPIPS、Q-Align和MUSIQ上也全面领先。
这篇工作的边界或风险在哪里? 优点:(1) 提出GDTB中的选择性门控注意力,通过正弦重加权和数据相关门控实现天气感知的自适应全局建模;(2) BMSC通过预测-校正多尺度融合有效抑制了损坏浅层特征的影响;(3) URH结合BAE-Loss实现不确定性感知的细化,在严重退化区域表现更稳健;(4) 在多个基准上取得SOTA性能。缺点:(1) 计算量相对较大(35.44 GMacs),可能限制实时应用;(2) 方法组件较多,整体框架复杂度较高;(3) 不确定性估计的校准质量缺乏定量评估;(4) 在真实场景的泛化能力验证有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出UAR-Net,通过门控双尺度Transformer块(GDTB)实现选择性全局交互与多尺度局部建模,结合平衡多尺度跳跃连接(BMSC)和不确定性感知细化头(URH),在统一框架中处理多种恶劣天气退化。
实验合理度: ★★★★☆
PSNR、SSIM、LPIPS、Q-Align、MUSIQ
学术研究价值: ★★★★☆
提出UAR-Net,通过门控双尺度Transformer块(GDTB)实现选择性全局交互与多尺度局部建模,结合平衡多尺度跳跃连接(BMSC)和不确定性感知细化头(URH),在统一框架中处理多种恶劣天气。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
35.44 GMacs(128×128输入)
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
主要参考文献
Zheke Jin, Yuning Cui, Tianle Jin, Alois Knoll, Hu Cao. “Uncertainty-Guided Adverse Weather Restoration via Gated Transformer Network.” arXiv:2609.02434v1, 2026.
雨雪雾霾,一键清除,UAR-Net教会AI拿捏“坏天气”😎。想和龙哥一起围观更多图像增强黑科技,或是聊聊如何让画质修复落地?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!