← 返回 PaperDaily 视觉与图像

ICF去噪新框架:对数域自监督,PSNR冲到21.41dB

这篇论文最有意思的地方,不是“又做了一个去噪器”,而是把ICF图像里最难缠的乘性均匀噪声,硬生生改写成了对数域里的可学问题。更关键的是,它还老老实实把实现里踩过的坑摊开讲了,属于既能看理论,也能学落地的那种文章。

ICF去噪新框架:对数域自监督,PSNR冲到21.41dB
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是“又做了一个去噪器”,而是把ICF图像里最难缠的乘性均匀噪声,硬生生改写成了对数域里的可学问题。更关键的是,它还老老实实把实现里踩过的坑摊开讲了,属于既能看理论,也能学落地的那种文章。


原论文信息如下:
论文标题:
Denoising ICF Images with Multiplicative Uniform Noise: A Self-Supervised Study Based on the Log-Domain Noisier2Inverse Framework
发表日期:
2026年06月
发表单位:
Yeungnam University
原文链接:
https://arxiv.org/pdf/2606.28268v1.pdf

ICF图像去噪的痛点:乘性均匀噪声与空间强相关,无需干净数据!

ICF(惯性约束聚变)图像去噪,表面上像是“把图像变干净”这么朴素的一件事,实际上难点多得像在泥地里走钢丝。最麻烦的不是噪声大,而是噪声的脾气很怪:它不是普通的加性噪声,而是乘性均匀噪声,也就是噪声会随着信号强弱一起缩放;更离谱的是,它还带着空间强相关,相邻像素之间并不“各走各路”。这就意味着,很多在自然图像上好用的去噪套路,到了 ICF 场景里容易直接翻车。
这篇工作最有意思的地方,不是简单换了个网络,而是先把问题“掰正”了:既然乘性噪声不好学,那就先进对数域,把乘法变成加法;既然真实噪声参数每张图都不一样,那就别拿一个全局参数硬套。说白了,就是不和物理规律硬拗,先把数学关系理顺,再谈训练。
封面
封面:Log-Domain Noisier2Inverse 在 ICF 乘性均匀噪声上的去噪结果。对比图一眼就能看出,这不是“稍微好一点”,而是从几乎看不出结构,拉回到了能看出目标边界和内部轮廓的程度。
这篇论文还有一个很实在的优点:它没有只讲“理论上可以”,而是把实现过程中踩过的坑也摊开了。比如对数变换后,真空背景接近 0 的像素会把数值稳定性搞崩;再比如噪声参数每张图都不同,若用固定全局分布去模拟,训练会直接学成“平均脸”。这类问题不讲,读者很容易觉得方法是“论文里很美,代码里很惨”;这篇工作反而把“惨”也记录下来了,反而更可信。🤨

方法概述

本论文的核心思路可以概括成一句话:把乘性噪声问题搬到对数域里,再用自监督方式训练去噪网络。原始图像里,观测值可以理解为“真实信号 × 噪声”;经过对数变换后,乘法关系就变成了“真实信号的对数 + 噪声的对数”,这一步让原本棘手的乘性噪声,变成更容易处理的加性噪声。
论文借用了 Noisier2Inverse 的思想。Noisier2Inverse 是一种自监督图像重建框架,核心不是拿干净标签去监督,而是人为再造一个“更吵一点”的输入,让网络学会从噪声中恢复信号。这里的关键点在于:只要人造噪声和真实噪声在分布上对齐,训练目标就能和有监督学习在理论上对应起来。论文把这个逻辑搬到对数域,并给出了完整证明。
网络本体并不花哨,用的是一个标准的 U-Net:编码器负责压缩语义,解码器负责恢复细节,跳连则把浅层细节直接送回来。真正的创新不在骨架,而在“数据怎么喂、域怎么变、噪声怎么对齐”。这类工作很典型:看着不像“新模型”,但真正难的是把方法变成能跑、能收敛、能出结果的系统。

核心设计

这部分是整篇论文最值钱的地方。先说人话:原始 ICF 图像里噪声是乘上去的,不是加上去的;而且真空背景接近 0,直接做对数会炸。于是论文先做数值稳定化,再做对数域重写,再构造自监督损失,最后才把网络训练起来。整个流程不是“拍脑袋拼装”,而是每一步都针对真实数据特性下药。

1)先把乘性噪声改写成加性噪声

论文中的基本假设是:观测图像可以写成“真实信号和噪声的乘积”。对这个式子取对数后,乘法就变成了加法。这个转换非常关键,因为 Noisier2Inverse 原本就是为加性噪声设计的;一旦到了对数域,原本不能直接套用的框架就有了落脚点。
图1:100张ICF乘性均匀噪声图像的每图噪声参数分布
图1:100张 ICF 乘性均匀噪声图像的每图噪声参数分布。左图是下界 ℓi,右图是上界 hi。可以看到,不同图像的噪声范围差异非常大,这也是后面“必须按图加载噪声参数”的根本原因。
这里还有一个常被忽略的细节:对数域里,噪声并不一定对称。论文统计后发现,真实噪声参数的分布范围很宽,固定一个高斯近似看上去“顺手”,实际上和真实分布并不一致。也就是说,训练时如果拿错了噪声画像,网络学到的就不是“还原信号”,而是“适应错误假设”。这事听起来很学术,落到工程上就是:分布不对,模型再大也白搭

2)自监督损失怎么来的

论文构造了一个“更吵”的对数域输入,把它喂给网络,让网络去预测原始对数域信号。训练时没有用干净图像做监督,而是用这个人造的 noisy-noisy 对来构造损失。理论上,只要人造噪声和真实噪声同分布,最小化这个损失就等价于在对数域里做有监督学习。
表1:两种噪声变体共享的超参数配置
表1:两种噪声变体共享的超参数配置。可以看到,网络结构并不夸张,关键是训练细节:小批量、早停、梯度裁剪、余弦退火和微调阶段都被用上了,说明这类任务真正考验的是稳定训练,而不是“堆更深的网”。
这里的理论价值不只是“证明一下很漂亮”。它真正告诉读者一件事:自监督并不是玄学,前提是构造出来的“伪监督信号”真的和真实噪声机制一致。如果这个前提不成立,网络就会学偏。论文后面的实验,恰好把这个结论验证得很直白。

3)数值稳定性不是小事

ICF 图像里有大面积接近真空的区域,像素值非常接近 0。对数一上去,直接就是负无穷;再从对数域指数回去,又可能溢出。论文采用了两阶段稳定化策略,本质上就是给极端值加一道保险:先避免 log 爆掉,再避免 exp 跑飞。别小看这一步,很多“理论正确”的方法,最后死就死在这种数值边角料上。
表2:早期实验中的代表性训练崩溃
表2:早期实验中的代表性训练崩溃。前期 PSNR 还能往上走,后面却突然塌掉,说明这个任务不是“调个学习率就完事”,而是需要早停、梯度裁剪和检查点保存一起上,才不至于前功尽弃。

4)为什么要按图加载噪声参数

这篇论文最“接地气”的修复之一,就是从固定全局噪声,改成读取每张图对应的 JSON 噪声参数。原因很简单:ICF 图像的噪声不是一个统一模板,而是每张图都可能有自己的上下界。固定全局分布会让网络学成“输出一个平均值”,看起来像是稳定了,实际上是彻底失去辨别力。
这类修复非常像真实工程:不是把模型换成更大,而是把数据管道修对。很多论文喜欢把性能提升归因于“更强结构”,这篇工作反而告诉读者,噪声建模对了,普通 U-Net 也能打出很像样的结果

实验结果分析

先看实验设计,整体是合理的。训练集只有 100 张 ICF 图像,且训练时不使用干净图像,这和自监督设定是对齐的;测试时才用 clean reference 做定量评估,也符合论文的目标。更重要的是,论文没有把所有提升都推给网络,而是把“数值稳定”“噪声分布匹配”“训练崩溃”这些看似琐碎的问题逐个拆开,这让结果可信度明显高于那种只报一个最终分数、过程却一笔带过的写法。
从结果看,最关键的不是“某个小数点后更优”,而是方法跨过了一个量级:输入基线只有 1.95 dB,最终方法能到 21.41 dB,提升接近 20 dB。这个差距已经不是“修修补补”,而是把原本几乎不可用的图像,拉回到可分析的范围。对 ICF 这种依赖细节判断结构的场景来说,这种提升非常实在。
表3:实现阶段的PSNR与SSIM演进
表3:实现阶段的 PSNR 与 SSIM 演进。可以看到,方法不是一步到位,而是从默认设置、数值修正、下采样尝试、参数优化一路爬上来。中间那次 Pixel-Shuffle Downsampling 甚至把结果拉差了,说明“看起来像在降相关性”的操作,不一定真的适合网络结构。
两种变体里,Variant B 也就是按图读取 JSON 噪声参数的版本,拿到了最好 PSNR;Variant A 用固定高斯噪声近似,PSNR 几乎一样,但 SSIM 略高一点。这个现象挺有意思:说明更精确的噪声对齐,主要提升的是重建的数值一致性,而结构相似性未必同步线性上升。换句话说,PSNR 和 SSIM 看的是不同维度,不能只盯一个分数下结论。
表4:ICF乘性均匀噪声上的完整方法对比
表4:ICF 乘性均匀噪声上的完整方法对比。这里的结果非常直白:Log-Domain Noisier2Inverse 几乎把另外两类基线按在地上摩擦。BM3D 虽然保住了一点结构感,但 PSNR 仍然很低;Noise2Self 更惨,空间相关性一上来,棋盘格伪影就把输出彻底毁了。
这也解释了一个很重要的结论:在非标准成像数据上,方法是否匹配噪声机制,比网络名字更重要。Noise2Self 失败,不是因为它“太老”,而是因为它依赖的像素独立假设被 r = 0.99 的强相关噪声直接打穿;BM3D 失败,则说明传统滤波在这种极端噪声和特殊结构下,很难同时兼顾结构和强度精度。
图2:各方法PSNR与SSIM对比
图2:各方法 PSNR 与 SSIM 对比。图里最醒目的不是哪条曲线“稍微高一点”,而是 Log-Domain Noisier2Inverse 直接把其他方法甩开一个明显档位。BM3D 的 SSIM 看着还行,但 PSNR 很低,属于“看起来顺眼,实际数值不对”;Noise2Self 则几乎被棋盘格伪影拖垮。
图3:变体A的去噪结果
图3:变体 A 的去噪结果。可以看到,网络已经能把大轮廓和目标边界恢复出来,但细节区域仍有一定损失。这个版本说明,固定高斯近似“能用”,但不是最贴近真实噪声的做法。
图4:变体B的去噪结果
图4:变体 B 的去噪结果。这个版本是论文的最佳结果,说明按图加载真实噪声参数,确实比粗糙近似更靠谱。它不是把网络“神奇地变强了”,而是把训练目标和真实噪声分布对齐了。
图5:BM3D在对数域中的结果
图5:BM3D 在对数域中的结果。它保住了大致结构,但细节恢复很有限,说明传统滤波在这个任务上更像“抹平噪声”,不是“恢复信息”。
图6:Noise2Self结果
图6:Noise2Self 结果。棋盘格伪影几乎统治了输出,说明当噪声的空间独立假设不成立时,这类方法会非常脆弱。

论文主体思路

*表格超出部分左右可以滑动
项目 内容
应用场景ICF 成像中的乘性均匀噪声去噪,面向 X 射线探测图像恢复。
问题建模把观测图像建模为真实信号与噪声的乘积,并通过对数变换转成加性噪声问题。
模型Backbone及选择原因U-Net,原因是结构简单、适合图像恢复任务,且便于与自监督目标结合。
损失函数对数域中的自监督重建损失,本质上学习“更吵输入”到原始对数信号的映射。
训练数据集100 张 ICF 噪声图像,训练时不使用干净图像。
测试数据集与每张图对应的 clean reference,仅用于定量评估。
训练方法Adam、余弦退火、梯度裁剪、早停、微调;并比较固定高斯与按图 Uniform 两种噪声加载方式。
实验效果相较噪声输入基线,PSNR 提升接近 20 dB;显著优于 BM3D 与 Noise2Self。
方法优势无需干净训练数据;能适配乘性噪声;理论上有自监督与有监督等价证明。
方法缺点对噪声分布匹配较敏感;对数域数值稳定性需要额外处理;对真实实验图像的泛化仍待验证。

总结与未来展望

这篇论文最值得肯定的,不是“又做了一个去噪网络”,而是把一个很容易被忽略的现实问题讲透了:当噪声是乘性的、空间相关的、而且每张图都不一样时,去噪不能只看模型结构,必须连噪声建模一起做对。这也是为什么它最后能在没有干净训练数据的前提下,仍然拿到很高的 PSNR。
不过,论文也没有把话说满。它自己就指出了几个边界:一是当前结果主要基于合成 ICF 图像;二是真实实验图像可能还有额外噪声、探测器伪影和强度分布偏移;三是对数域训练对低亮度区域仍比较敏感。换句话说,这套方法已经证明“这条路能走”,但要走到真实实验系统里,还得再过几道门槛。
如果后续要落地到真实 ICF 诊断,最自然的方向有两个:一个是把少量实验图像纳入微调,继续沿用按图加载噪声参数的思路;另一个是把损失函数进一步改造,让它对低对比度结构更敏感,避免内壳细节被“平均化”。这两条路都很务实,也都比单纯再堆一层网络更靠谱。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是 ICF 图像在乘性均匀噪声下的去噪问题,而且还要求训练时不依赖干净图像。方法的关键不是盲目堆模型,而是把问题转到对数域,再用自监督框架完成重建。

Variant A 和 Variant B 有什么区别?Variant A 用固定高斯噪声近似对数域噪声,属于“先凑合能跑”;Variant B 直接按每张图的 JSON 噪声参数加载 Uniform 噪声,更贴近真实分布,所以最终 PSNR 最好。简单说,前者是统一模板,后者是按图定制。

为什么 Noise2Self 会失败得这么明显?因为 Noise2Self 依赖像素独立假设,而这篇数据里的噪声空间相关性极强,相关系数 r = 0.99。假设一旦被打穿,模型就容易生成棋盘格伪影,输出看起来像“有处理”,其实结构已经乱了。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把乘性噪声搬进对数域,再把 Noisier2Inverse 改造成自监督去噪框架,这个思路不算“凭空造新物种”,但确实抓住了问题本质,属于聪明且有效的改造。

实验合理度:★★★★☆

对比了自监督、传统滤波和输入基线,且把失败过程也展示出来了,可信度不错;不过测试数据仍以合成 ICF 图像为主,真实场景验证还不够。

学术研究价值:★★★★☆

对非标准噪声、自监督重建和物理成像结合都有启发,尤其适合噪声建模复杂的实验成像任务。

稳定性:★★★☆☆

训练过程对数值稳定和噪声参数匹配很敏感,说明方法能跑,但还谈不上“拿来即用”的工业级稳。

适应性以及泛化能力:★★★☆☆

对 ICF 这类乘性、强相关噪声场景很合适,但换到噪声机制完全不同的图像上,未必还能保持同等效果。

硬件需求及成本:★★★☆☆

U-Net 本身不算重,但训练过程要处理对数域稳定性、早停和反复试错,算力成本中等,工程成本不低。

复现难度:★★★☆☆

理论和流程写得比较清楚,但真实复现仍依赖噪声参数、数据格式和稳定化细节,细节少一步就容易翻车。

产品化成熟度:★★★☆☆

适合科研和特定成像管线,若要进真实诊断系统,还需要实验图像验证、参数标定和鲁棒性测试。

可能的问题:方法对噪声分布匹配较敏感,真实实验图像泛化未验证;对数域数值稳定和低对比度细节恢复仍是短板。


主要参考文献

[1] Gyeongha Hwang, Bradley Thomas Wolfe, Naima Naheed. Denoising ICF Images with Multiplicative Uniform Noise: A Self-Supervised Study Based on the Log-Domain Noisier2Inverse Framework. arXiv:2606.28268v1, 2026.
[2] N. Moran, D. Schmidt, Y. Zhong, P. Coady. Noisier2Inverse: Self-Supervised Learning for Image Reconstruction With Correlated Noise. IEEE Access, 2025.
[3] J. Batson, L. Royer. Noise2Self: Blind Denoising by Self-Supervision. ICML, 2019.
[4] O. Ronneberger, P. Fischer, T. Brox. U-Net: Convolutional Networks for Biomedical Image Segmentation. MICCAI, 2015.

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。