← 返回 PaperDaily
视觉与图像
扩散模型终于懂物理了!阳明交大×NVIDIA最新去雾:平均涨0.57dB
同样是扩散模型,凭什么HNDif去雾更猛?因为它不玩"纯噪声瞎猜",而是把大气散射模型直接写进扩散过程:雾浓处多注噪声、雾淡处少注噪声,反向再联合去雾去噪。四个主流去雾骨干、六个基准数据集,平均PSNR提升0.57dB。想给自家去雾模型"插管提速"?这篇值得细读。
龙哥读论文
发布于 2026-08-26 00:20:01
阅读 5
查看原文
原论文信息如下:
如果给去雾模型出一张“浓雾摸底考”,画面里汽车只露出半个轮廓、广告牌的字糊成一团,很多主流模型会当场翻车——要么把雾“擦”出一片发灰的色块,要么脑补出根本不存在的纹理。问题出在哪?传统去雾模型大多在“猜”,而一篇来自台湾阳明交通大学、台湾清华大学、台湾政治大学与NVIDIA合作的新论文,决定让扩散模型先学会大气散射的物理规律,再动手去雾。这就是HNDif(Haze-Noise Diffusion,雾噪声扩散)。
雾霾下的视觉困境:为什么现有去雾方法不够好?
雾天成像的物理过程并不复杂:场景中物体反射的光线在传播过程中被大气中的微粒散射而衰减,同时大气光会叠加进来,最终到达相机的光强既丢了一部分原始信息,又混入了一层灰白色的“滤镜”。这个关系可以用大气散射模型(Atmospheric Scattering Model,ASM)精确刻画:
透射率τ(x)=e^{-σ(x)d(x)}揭示了一个关键事实:雾的浓度在图像上是空间变化的。远处的物体深度d大,散射系数σ大,透射率τ就小,雾就越浓;近处的物体雾则相对淡。因此雾并不是均匀的高斯噪声,而是一种有结构的、随场景深度变化的退化。这种空间变化特性,恰恰是许多去雾方法容易忽略的。它们往往把整张图当作均匀退化来处理,导致近处清晰区域被过度平滑,远处浓雾区域又恢复不足。
过去十年的深度学习方法大体沿着三条路线走:CNN靠局部卷积堆感受野,Transformer用自注意力捕捉全局依赖,Mamba用状态空间模型在保持线性复杂度的同时建模长距离关系。这些方法在有雾/清晰成对数据上做端到端回归,日常场景表现确实不错。但一旦遇到浓雾,远处的纹理信息在成像时就已经丢失,回归模型只能从数据集的统计记忆里“猜”一个答案,结果要么偏平滑,要么出现伪纹理。更关键的是,回归模型本质上是在学习一个从有雾图像到清晰图像的确定性映射,而雾天退化本身具有不确定性——同一张有雾图像可能对应多种合理的清晰版本,回归模型只能取一个平均结果,这天然限制了它的上限。
扩散模型恰好擅长生成细节,它可以为严重退化区域“脑补”出合理的高频结构。但常规扩散模型假定退化只是加性高斯噪声,从纯高斯噪声出发重建干净图像,既不认识雾的空间变化特性,又容易因随机采样偏离原始图像内容。说白了,传统扩散模型有生成能力,但没有物理常识。HNDif的出发点正是弥补这个鸿沟:让扩散模型既保留强大的生成能力,又理解雾的物理形成过程,从而在浓雾区域“有理有据”地生成细节,在清晰区域“小心翼翼”地保留原貌。
物理引导的扩散革命:HNDif如何将大气散射模型嵌入扩散过程?
HNDif的核心思维是:与其让扩散模型在纯噪声里瞎逛,不如直接把ASM塞进扩散前向过程,作为归纳偏置(inductive bias)。所谓归纳偏置,就是人为告诉模型“雾是怎么形成的,你就怎么退化”。传统扩散前向过程不断往图像上加高斯噪声,均值最终趋向于零;HNDif则让每一步都沿着ASM的物理轨迹走一步“变雾”的路线,同时叠加噪声。这样,扩散过程不再是盲目的噪声注入,而是有物理意义的退化模拟。
前向过程中,第t步的中间状态I_t由上一状态I_{t-1}按ASM退化后,再加上像素级噪声得到,对应公式为:
对比常规扩散模型:DDPM的前向过程是I_t = √(1-β_t)·I_{t-1} + β_t·ε,均值逐渐收缩到零;HNDif每步则多了一个由ASM决定的“均值偏移”项,图像先按透射率衰减、再叠加大气光,最后加噪声。这个均值偏移项正是物理先验的体现——它告诉扩散模型,每一步退化不是随机游走,而是沿着雾的物理形成路径在走。经过T步后,重参数化采样可以直接写成简洁的闭式形式:
这里有个现实问题:公式里需要透射率τ(或σ与d的乘积),但现存去雾数据集只有成对的清晰/有雾图像,并没有提供深度图和散射系数。HNDif的解决办法是引入一个可学习的雾估计器(haze estimator),隐式地拟合σd这个乘积,从而绕开显式透射图依赖。这个估计器本质上是一个轻量级CNN,输入有雾图像,输出逐像素的σd估计值。由于训练数据中不包含深度真值,这个估计器是通过端到端的损失函数隐式学习的——模型在训练过程中自动学会了从有雾图像中推断雾的浓度分布。
雾感知噪声调度器:让噪声注入与雾密度精准匹配
HNDif最巧妙的设计藏在噪声调度器里:雾感知噪声调度器(Haze-Aware Noise Scheduler,HANS)。既然雾密度在空间上是变化的,那么噪声注入量也应该跟着雾走。HANS把像素级噪声缩放系数定义为β_t(x)=1-e^{-α_tσ(x)d(x)},也就是说,雾越浓的地方(σd大),β_t(x)越大,注入的噪声越多,扩散模型在反向过程中就有更强的生成动力去重建被雾吞掉的纹理;反之,雾淡的区域噪声小,更多依赖回归能力保留原始细节。
这个调度的意义在于:它把“该生成还是该保真”的像素级权衡变成了一种自适应机制。浓雾处信息已经没了,硬保真也没用,不如让模型大胆生成;清晰处信息还在,过度生成反而会破坏细节,那就少注噪声、走保守路线。一个公式同时兼顾了生成能力和保真度。这种空间自适应的噪声调度,在扩散模型领域是一个新颖的设计——传统扩散模型对所有像素一视同仁地加噪,而HANS让噪声注入量随雾密度变化,使得扩散过程更加“智能”。
反向过程同样不靠纯随机采样。HNDif从加雾加噪的I_T出发,推导出了一个与ASM保持一致的反向采样公式:
这一设计让反向过程每一步都有物理公式“兜底”:先估计当前步的噪声和雾残留,然后按反向ASM变换把I_t校正回I_{t-1}。相比传统扩散模型从纯噪声一路“盲猜”到图像,HNDif每一步都在做物理可解释的逆变换。这种“物理引导的反向采样”不仅提高了恢复精度,还让整个去雾过程变得可解释——用户可以清楚地看到每一步在去除多少雾、多少噪声。
从图像空间到潜在空间:Latent HNDif的工程智慧
直接在图像空间跑扩散去雾,有两个现实痛点:一是计算量太大,每一步都要在整张高分辨率图像上做前向推理;二是扩散模型带有随机性,在严重退化区域可能生成与原始内容不一致的伪细节。HNDif团队给出的工程解法是把扩散从图像空间搬到潜在空间,也就是Latent HNDif。潜在空间的维度远低于图像空间,扩散过程的计算量大幅下降,同时潜在表示已经过编码器的压缩,保留了语义信息而丢弃了部分像素级噪声,这也有助于抑制伪细节的生成。
Latent HNDif的架构可以拆成三层理解。第一层是图像编码器(Image Encoder,IE),它把有雾输入I_H压缩成一个潜在表示Z_T,这个Z_T保留了雾霾分布和场景结构的核心信息。编码器通常采用下采样卷积网络,将高分辨率图像映射到低分辨率的潜在空间,类似于VAE或GAN中的编码器设计。第二层是HNDif扩散模型,它在这个潜在空间里完成加雾加噪/去雾去噪,输出干净的潜在先验Z_0。由于潜在空间的维度远低于图像空间,扩散过程的计算开销大幅降低。第三层是特征门控模块(Feature Gating Module,FGM),负责把Z_0转化成对骨干网络各层特征的缩放和偏置信号,从而“指导”骨干网络的判断。
FGM的具体做法是:先把先验Z_gt通过Unshuffle、AvgPool2D和MLP压缩成一个1×C的全局向量z_gt,然后对骨干网络每一层特征F̂_i做如下调制:
训练策略分三步。第一步,用有雾/清晰配对数据预训练由图像编码器、FGM和去雾骨干组成的整体框架,此时用清晰图与有雾图拼接提取的Z_gt当作先验学习的教师信号。这个阶段的目标是让骨干网络学会利用先验信息进行去雾。第二步,固定骨干网络,让HNDif学会从退化表示Z_T恢复出接近Z_gt的干净先验Z_0,用L1损失监督。这个阶段的目标是训练扩散模型本身,让它学会在潜在空间中去雾去噪。第三步,联合微调所有模块,让Z_0真正参与最终去雾图像的生成。这个阶段的目标是让所有模块协同工作,达到最佳性能。
这种插件式设计的价值在于:任何现成的去雾骨干网络,不需要改动内部结构,只要在外围挂上Latent HNDif,就能获得扩散模型的生成能力。论文实验也对比了图像空间和潜在空间两种用法的效果差异。
实验验证:四大骨干网络的全面提升与SOTA表现
为了验证HNDif的通用性,论文选取了四个代表性去雾骨干网络作为底座:FocalNet、ConvIR、SGDN和RIDCP。这四个骨干分别代表了不同的技术路线——FocalNet基于Transformer的局部注意力,ConvIR基于卷积的迭代重建,SGDN基于生成对抗网络,RIDCP基于对比学习。选择这些差异化的骨干,可以充分验证HNDif作为插件的通用性。数据集方面覆盖了六个常用基准——SOTS-Indoor、SOTS-Outdoor、NH-HAZE、O-HAZE、Dense-HAZE、RW2AH,外加真实场景基准RTTS。扩散步数T设置为4,在效果和效率之间取得平衡。
定量结果相当稳定:在NH-HAZE上平均PSNR提升0.54dB,O-HAZE提升0.87dB,Dense-HAZE提升0.41dB,RW2AH提升0.40dB,SOTS-Indoor提升0.47dB,SOTS-Outdoor提升0.72dB。四个骨干的总体平均PSNR增益为0.57dB,SSIM增益为0.009。这种“每个数据集都涨点”的表现,说明HNDif并非针对某个数据集过拟合,而是确实学到了通用的雾霾先验。值得注意的是,O-HAZE和SOTS-Outdoor的提升幅度最大,这两个数据集包含较多浓雾场景,正好验证了HNDif在浓雾区域的生成能力优势。
在真实雾图RTTS上,HNDif增强后的模型在FADE、NIMA、BRISQUE三个无参考指标上都优于原始基线和对比方法。不过需要说明的是,在PaperDaily已收录的论文范围内,RTTS这三个指标暂未检索到足够的同基准数值,因此这里不宜外推成“绝对领先”,只能说在该论文的实验设置下表现更优。真实场景的泛化能力是去雾方法落地的关键,RTTS上的结果至少说明HNDif没有过拟合到合成数据。
消融实验也验证了三个关键设计的必要性。去掉噪声扩散、去掉雾扩散或去掉HANS后,PSNR都会下降,说明雾噪声联合扩散和自适应调度缺一不可。具体来说,去掉噪声扩散后,模型失去了生成细节的能力,浓雾区域恢复不足;去掉雾扩散后,模型无法有效去除雾霾,整体偏灰;去掉HANS后,噪声注入变得均匀,无法在浓雾区域提供足够的生成动力。此外,论文还分析了扩散步数T的影响:T从2增大到8时,PSNR逐步上升,但T=4之后增速放缓,因此默认T=4是一个兼顾速度与效果的合理选择。
论文还给出了计算开销数据:HNDif带来的参数增量和训练显存增量相对可控,换来的是0.57dB的平均PSNR增益,性价比在扩散类方法中属于第一梯队。具体来说,HNDif增加的参数量约占骨干网络的10%-20%,训练显存增加约30%,但推理时间增加约2倍(由于多步采样)。考虑到0.57dB的PSNR提升在去雾任务中已经相当可观,这个性价比是可以接受的。
局限与展望:HNDif的边界与未来方向
HNDif在基准数据集上的表现令人印象深刻,但仍有几处边界值得注意。第一,该方法依赖成对的有雾/清晰训练数据,在完全没有清晰参考的真实浓雾场景中,如何评价和优化仍然是个开放问题。虽然RTTS上的无参考指标表现不错,但缺乏清晰真值意味着无法进行精确的定量评估。第二,扩散步数T=4虽然已经很快,但推理时依然需要在潜在空间做多步迭代,相比纯回归网络还是有额外计算开销,在车载或者嵌入式设备上的实时性需要进一步压缩。第三,潜在先验的质量受图像编码器表达能力制约,如果输入雾霾浓度超出训练分布范围,先验估计的可靠性还需要更多验证。
从更长远的角度看,HNDif展示了一个很有价值的范式:把物理模型作为扩散过程的归纳偏置,而不是把扩散模型当作一个黑盒生成器。这种思路天然适用于视频去雾、夜间雾霾、雨雾混合等更复杂的退化场景。例如,在视频去雾中,可以利用时序一致性来约束扩散过程;在夜间雾霾中,可以引入光照模型来扩展ASM。未来如果能进一步减少扩散步数、压缩估计器体积,HNDif很可能从学术方法直接变成工程上可用的“去雾增强插件”。
龙迷三问
这篇论文到底在解决什么问题? 本文提出HNDif,将大气散射模型嵌入扩散过程的图像去雾新框架。正向过程用雾感知噪声调度器联合加雾加噪,反向联合去雾去噪;Latent HNDif还能生成潜在先验,即插即用地增强现有去雾网络。六个基准数据集上平均PSNR提升0.5
这篇工作最值得看的点是什么? HNDif在六个基准数据集上一致提升四种代表性去雾模型(FocalNet、ConvIR、SGDN、RIDCP),平均PSNR提升+0.57dB,SSIM提升+0.009。在RTTS真实世界基准上,RIDCP+HNDif达到最佳FADE(0.417)、NIMA(5.08)和BRISQUE(16.09)。
这篇工作的边界或风险在哪里? 优点:(1) 将大气散射模型作为归纳偏置嵌入扩散过程,物理可解释性强;(2) 雾感知噪声调度器根据雾密度自适应调整噪声水平,设计巧妙;(3) 潜在空间设计降低了计算开销,且可即插即用地集成到现有去雾网络中;(4) 在多个数据集和多种骨干网络上均取得一致性提升。缺点:(1) 仅针对大气散射模型设计,无法直接应用于运动模糊、雨滴、低光照等其他退化类型;(2) 需要额外的训练阶段(预训练骨干、训练先验生成器、联合微调),训练流程较复杂;(3) 引入额外参数和计算开销。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一种将大气散射模型嵌入扩散过程的物理引导去雾框架,通过联合雾-噪声扩散和雾感知噪声调度器实现高质量图像去雾。
实验合理度: ★★★★☆
PSNR、SSIM、FADE、NIMA、BRISQUE
学术研究价值: ★★★★☆
提出一种将大气散射模型嵌入扩散过程的物理引导去雾框架,通过联合雾-噪声扩散和雾感知噪声调度器实现高质量图像去雾;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
以FocalNet为骨干时,HNDif增加约4.08M参数和5.85G FLOPs;训练峰值VRAM从2854M增至3932M。在256×256裁剪块、batch size为4的NVIDIA RTX 4090上评估。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 仅针对大气散射模型设计,无法直接应用于运动模糊、雨滴、低光照等其他退化类型;
主要参考文献
[1] J.-T. He, F.-J. Tsai, Y.-T. Peng, M.-H. Chen, C.-W. Lin, Y.-Y. Lin. HNDif: Haze-Noise Diffusion for Image Dehazing. arXiv:2608.10995, 2026.
[2] HNDif Project Page: https://jin-ting-he.github.io/HNDiff/
[3] J. Ho, A. Jain, P. Abbeel. Denoising Diffusion Probabilistic Models. NeurIPS, 2020.
[4] Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon, B. Poole. Score-Based Generative Modeling through Stochastic Differential Equations. ICLR, 2021.
融会贯通
结合PaperDaily已收录论文的同基准对比来看,HNDif在RTTS上报告的FADE 0.417、NIMA 5.08、BRISQUE 16.09在当前库里暂时缺少足够的同基准数值,无法直接判断其排名。因此,这篇文章更适合被理解为一个“即插即用增强模块”的稳健性证明,而不是“碾压所有方法”的绝对领先结论。
另一个值得注意的点是:HNDif的增益来自“物理先验+生成模型”的互补——浓雾区域靠扩散生成补细节,清晰区域靠回归保真,这个分工逻辑比单纯堆模型参数更优雅。后续研究者在复现或对比时,应注意RTTS的测试协议和基线配置可能存在的差异,建议先复现对应骨干的增强版本,再做横向比较。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
雾里看花终隔一层,进群聊透才过瘾!『龙哥读论文』粉丝群等你来加入,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称 (如 图像处理+上海+清华+龙哥),根据格式备注可更快被通过。目前群内覆盖图像处理、大模型与智能体、自动驾驶与机器人、AI医疗与AI金融五大方向,每周多篇顶会论文硬核拆解,快上车一起把每篇论文都看得通透吧!