恶劣天气下的图像恢复难题
想象一下这样的场景:你正在高速公路上开着车,突然一阵瓢泼大雨夹杂着雾气扑面而来,挡风玻璃上的雨滴和雾气让前方的路况变得模糊不清。这时候,无论是你的人类双眼,还是车载的自动驾驶感知系统,都面临着巨大的挑战。让AI从这种被恶劣天气“污染”的图像中,恢复出原本清晰的画面——这正是图像恢复技术要解决的问题。
早期的研究通常针对单一的天气退化进行建模,比如专门训练的“去雨模型”、“去雾模型”或者“去雪模型”。但现实世界中的天气从来不会这么“讲武德”——雨滴、雨线、雾、雪经常混合在一起出现。如果每种退化都要准备一个专用模型,不仅存储成本高,还需要动态选择使用哪个模型,这在真实应用中简直是噩梦。
于是,“All-in-One”全能修复模型成为了学术界和工业界追逐的方向:只用单一模型,就能应对多种天气退化。然而,目前表现优异的AIO模型大多基于Transformer架构,它们虽然效果出众,但高昂的计算成本和参数量让它们很难落地到手机、车载芯片等资源受限的边缘设备上。
那么问题来了:能否设计一个既轻量又高效的“一个打十个”的天气修复模型?来自西班牙Cidaut AI基金会和德国慕尼黑工业大学的研究者们给出了一个令人兴奋的答案——FReSH-IR。
三种不同的频域修复策略对比。(a)全局频谱过滤;(b)高低频分离但共享处理;(c)本文提出的FReSH-IR,高低频分离并定制化处理。下方为本方法在真实与合成图像上的修复效果。
FReSH-IR:频谱谐波实现高效恢复
FReSH-IR的核心思想可以概括为一句话:把图像特征按频率拆开,让高频细节和低频结构各走各路、各找各妈,最后再高效融合。
研究者敏锐地观察到,不同的天气退化模式往往集中在图像的高频部分。比方说,雨滴的边缘、雪花的轮廓、雨线的纹理,这些都是局部高频信息。而图像的整体轮廓、光照和颜色布局,则是低频信息。如果把特征不加区分地全部混在一起喂给网络,模型需要“费力”地在高低频混合的特征空间中去学习区分哪些是天气伪影、哪些是需要保留的结构细节。
FReSH-IR巧妙地避开了这个问题——它在编码器和解码器的每一层,都通过傅里叶变换将特征地图显式地分解成高频和低频两个分支,并分别设计针对性的模块来处理。
图2:FReSH-IR整体架构。编码器由频谱分解块(SDB)和两个残差块组成,通过蓝色箭头(低频)和红色箭头(高频)将分层特征传递到解码器,并经频谱谐波块融合。
核心创新:频谱分解与融合机制
为了让你彻底搞懂FReSH-IR的精妙之处,咱们不妨把它拆解成四大核心组件来看。
首先登场的是频谱分解块(SDB)。SDB位于编码器每一层的入口,它利用快速傅里叶变换(FFT)将特征从空间域转换到频域,然后通过一个高斯掩膜(Gaussian Mask),把低频分量集中在中心,高频分量推向边缘。用一个可调节的“截止频率”参数α,就可以精确控制保留哪些频率成分。论文里设置α在编码器逐层递减(0.4→0.12),这意味着浅层保留更多高频细节用于精细分辨天气伪影,深层则逐渐放宽限制,保留更多结构化信息。SDB将提取到的高频信息直接传给解码器分支,而低频部分则先通过一叠带上注意力机制的轻量残差块进行精炼。
图3:(a)频谱分解块(SDB):输入经FFT后通过高斯掩膜分成高频与低频,其中低频经1×1卷积精炼。(b)频谱谐波块(SHB):类似SDB分解后,将对应频率分量与编码器的残差求和。
接下来是两个高频“专职干事”。第一个是在瓶颈层引入的双重注意力模块(DAM)。DAM借鉴了FocalNet的设计思路,利用通道平均池化和最大池化来分别捕捉低频和高频线索,进而生成空间注意力图,并结合两组不同感受野的深度可分离扩张卷积来增强特征表达。最妙的一步是,DAM在深层特征中通过GAP(全局平均池化)提取高频残差,通过“减去均值”这种极简方式,把那些高频的锐利边缘和精细纹理从特征中剥离出来,作为后续修复的重点对象。
第二个则是替换传统跳跃连接的频谱谐波块(SHB)。在回程(解码器)中,每一层上采样得到的特征图同样会被进行傅里叶分解。然后,分解出的高频分量和低频分量,会分别与来自同层编码器(通过频谱跳跃连接传回)的高频、低频特征进行融合相加,真正做到“物以类聚”——结构找结构,细节找细节,而不是像传统UNet那样低效地直接把所有通道拼在一起。
最后,融合完毕的高低频特征会进入频率Transformer块(FTB)做进一步精修。FTB同样维持高低频两个分支:低频分支通过一组并行的扩张深度卷积(扩张率分别为1、4、9)来捕捉多尺度的结构上下文;高频分支则采用一个轻量级的Transformer块来建模长距离依赖关系,让离散的高频碎片能够互相“沟通”。每个解码器level的最后一个FTB才把两个分支融合起来,并通过一个共享的FFN进行最终的特征提炼。
此外,FReSH-IR的训练策略也别具匠心。总损失函数是像素损失、增强损失与傅里叶边缘损失的加权组合。其中有意思的是“增强损失”:在瓶颈位置,用一个预训练的VGG-19网络来监督编码器输出的特征图与下采样16倍的真实清晰图保持感知层面的一致。傅里叶边缘损失则像是给高频分支上的一个“紧箍咒”,强制它在去除噪音的同时不能丢失真正的边缘纹理细节。
实验结果:效率与性能的完美平衡
在极具挑战的AllWeather基准(包含雨滴、雨+雾、雪天三种退化)上,FReSH-IR与当前SOTA方法展开了激烈的角逐。实验结果清晰地揭示了它的绝世武功:既生瑜,何生亮,但FReSH-IR偏偏用轻量身材打出了重量级的拳法。
图4:合成数据集上的主观对比。从上下分别为RainDrop、Snow100K和OutdoorRain结果,FReSH-IR与SOTA方法视觉质量相当。
从定量指标上看,FReSH-IR的PSNR/SSIM与最重的SSG-Former相比,仅存在约4.6%的微小差距,但它的参数数量仅为后者的1/5(3.46M vs 16.65M),计算量仅为后者的1/10(8.32G MACs vs 89.84G MACs)。换句话说,你用不到它20%的“燃油”,就达到了它96%的修图战斗力。这在工程应用上是降维打击般的诱惑。
表1:多天气恢复基准定量对比(PSNR/SSIM及计算开销)。方法后的†表示此结果来自SSGFormer论文。
在实时性测试中(NVIDIA RTX 4090, 256×256分辨率),FReSH-IR单次前向推理仅需11.42ms,比SSGFormer快了整整5倍!进一步的压力测试显示,在RTX 4090和边缘设备Jetson Orin NX上,SSGFormer在720p分辨率下就已显存溢出(OOM),而FReSH-IR甚至可以在Jetson Orin NX上跑到1440p分辨率(7.9秒),这在其对比方法中只有极少数能做到1080p以上。这意味着FReSH-IR可以流畅处理2K级别的高分辨率图像修复任务,让我们不禁对其端侧应用充满了想象空间。
图5:RealSnow数据集上的视觉对比,FReSH-IR在恢复真实雪景时干净自然。
在无真实参考图的真实雪景数据集评估中,FReSH-IR的BRISQUE和NIQE分数甚至优于所有对比方法,说明它恢复出的图像看起来最“自然”,没有明显的过度平滑或伪影,这对于无人驾驶和安防监控等对真实感要求严苛的场景非常关键。
更让人惊喜的是,FReSH-IR还能极大增益下游任务。将雨景图像送入语义分割与目标检测引擎前,先用FReSH-IR进行恢复,检测精度mAP提升了8%(从0.163到0.176),显著优于直接在带雨图片上跑算法的效果。给AI一双“晴天般”的眼睛,确实是提升机器感知能力的正道。
图6:下游检测任务可视化。经过FReSH-IR恢复后(下半图),原先在雨雾图(上半图)中丢失的目标被检测出来,置信度也更高。
局限性与未来展望
在充分肯定其思路和效果的同时,龙哥也需要指出它的局限性。FReSH-IR在真实世界的复杂天气泛化能力依然受限于训练数据的匮乏。目前标准训练集多以合成数据为主,与真实世界的恶劣天气仍然存在不可忽视的domain gap。对于雨滴附着、浓厚雾霾与动态雪花交杂的极端场景,FReSH-IR与所有同类模型一样,还有很长的路要走。
作者在论文的Discussion中坦诚:“性能上的微小牺牲是刻意设计的选择,我们的目标是大幅降低计算开销和内存占用,而非在单一指标上无脑刷分。”这种务实的精神,值得在AI内卷的大环境下提倡。
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
提出FReSH-IR,一种基于频谱谐波的轻量级全合一恶劣天气图像恢复方法,通过在每个尺度上将特征分解为高频和低频分量,并使用专门设计的模块分别处理,实现高效且高质量的图像恢复。实验合理度:★★★★☆
PSNR-Y(dB)、SSIM、LPIPS、MUSIQ、CLIPIQA+、BRISQUE、NIQE、mAP学术研究价值:★★★★☆
提出FReSH-IR,一种基于频谱谐波的轻量级全合一恶劣天气图像恢复方法,通过在每个尺度上将特征分解为高频和低频分量,并使用专门设计的模块分别处理,实现高效且高质量的图像恢复;更关键的是问题定义是否可复用到同类任务。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
3.46M参数,8.32G MACs,在RTX 4090上处理256x256图像平均耗时11.42ms复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:(1)在合成数据集上的PSNR略低于SOTA方法;(2)对真实世界复杂场景的泛化能力有限;(3)频谱掩码的截止值需要手动设置,缺乏自适应性。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!