← 返回 PaperDaily 视觉与图像

清华P2G把噪声拧成高斯,去噪最高提0.75dB

这篇论文把“真实噪声太难学”这件事,拆成了先高斯化、再去噪两步走,思路很顺手。更关键的是,它不是只会讲理论,还能直接给现成去噪器加 buff,实用性很强。

清华P2G把噪声拧成高斯,去噪最高提0.75dB
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文把“真实噪声太难学”这件事,拆成了先高斯化、再去噪两步走,思路很顺手。更关键的是,它不是只会讲理论,还能直接给现成去噪器加 buff,实用性很强。


原论文信息如下:
论文标题:
Poisson2Gaussian: Noise Gaussianization to Enhance Image Denoising
发表日期:
2026年06月
发表单位:
清华大学,北京航空航天大学
原文链接:
https://arxiv.org/pdf/2606.23098v1.pdf

让去噪器“读懂”真实噪声:P2G提出噪声“高斯化”新范式

去噪这件事,表面上像“把脏东西擦干净”,实际上更像“先搞清楚脏东西到底是什么,再决定怎么擦”。这篇论文的思路很直接:不要硬逼去噪器去学一团复杂噪声,而是先把真实噪声拧成更规矩的高斯噪声,再让现有去噪器出手。听起来像给模型换了个更好啃的食材,做法却相当讲究。
图1:P2G通过噪声高斯化提升去噪性能
图1:P2G通过噪声高斯化提升去噪性能。它的目标不是“猜噪声长什么样”,而是把混合泊松-高斯噪声(MPGN)变成更接近加性白高斯噪声(AWGN)的形式,让噪声的信号依赖性、异方差和偏斜性一起降下来。
如果把传统去噪器比作“保洁阿姨”,那真实世界的噪声就像一屋子会变形的泥点:光越弱,泥点越诡异;像素位置不同,泥点大小还不一样;甚至分布还不对称。P2G的厉害之处在于,它不急着擦,先把泥点统一成“标准模板”,这样后面的去噪器就不会一边擦一边怀疑人生。

为什么真实噪声(Poisson-Gaussian混叠)会让现有去噪器“头痛”?

先把背景捋清楚。很多经典去噪方法默认噪声是AWGN,英文全称是 Additive White Gaussian Noise,中文叫加性白高斯噪声。它有两个很省心的特点:一是噪声和图像内容基本没啥关系,二是分布比较对称,像个老老实实的钟形曲线。模型一看就懂,训练起来也顺滑。
但现实很不讲武德。低照度摄影、显微成像、天文成像里,噪声往往不是单纯高斯,而是混合泊松-高斯噪声,英文是 Mixed Poisson-Gaussian Noise, MPGN。其中泊松部分来自光子到达的随机性,属于“光本来就少,偏偏还要抽盲盒”;高斯部分则来自读出和电子噪声。结果就是:噪声会跟着信号强弱变化,方差不恒定,分布还容易偏斜。对模型来说,这种噪声不是“脏”,而是“脏得有个性”。
图2:噪声高斯化的动机与统计证据
图2:噪声高斯化的动机与统计证据。左边的统计分析显示,ISO 越高,信号依赖越强,噪声偏斜也越明显;右边的控制实验则说明,在相同训练策略下,越接近同方差、高斯、对称的噪声,越容易被去噪器学好。
论文里做了一个很关键的观察:真实数据中的高 ISO 场景,信号依赖更强,噪声偏斜也更明显。这说明问题不只是“噪声方差变大了”,而是噪声的形状本身就变复杂了。很多传统方法喜欢先做方差稳定变换(VST, Variance-Stabilizing Transformation,中文叫方差稳定变换),但这类方法更像是“把波浪拍平一点”,并没有真正把整条分布线拧顺,尤其在低光子计数下,近似会更吃力。
于是,P2G把问题换了个问法:既然复杂噪声难学,那能不能先把它变成更容易学的噪声?这就有了“噪声高斯化”这个核心概念。不是简单做统计近似,而是尽量让残差分布真的朝标准高斯靠拢。

P2G的核心:如何用一个可逆流将任意噪声“拧”成高斯?

P2G 的全称是 Poisson2Gaussian,中文可以理解成“从泊松到高斯”。它的核心不是一个单独的去噪网络,而是一个可逆的噪声重参数化模块,再加上一个下游去噪器。整个思路可以概括成两步:先把原始残差做高斯化,再让去噪器去处理这个更友好的输入。
图3:与P2G协同的去噪框架总览
图3:与P2G协同的去噪框架总览。训练开始前,先用一个预训练去噪器得到伪干净图像;训练时,P2G先把原始观测与伪干净图像之间的残差变换成更接近白高斯噪声的形式,再把这个变换后的结果送给去噪器。两者交替优化,P2G 负责“改造噪声”,去噪器负责“清理噪声”。
这里最有意思的是,P2G 不是靠拍脑袋设计一个固定映射,而是用了可逆流,也就是 normalizing flow。它的本事是:一边变换分布,一边还能精确算概率密度。换句话说,不只是“看起来像高斯”,而是尽量在密度层面也对齐高斯。论文强调这是通过概率密度匹配来实现的,而不是只匹配均值、方差这种低阶统计量。
为了让变换既能“拧得动”又不丢信息,P2G 采用了两类模块:Coupling 层CayleyMix 层。Coupling 层负责把一部分通道变成另一部分的函数,优点是可逆、好算;CayleyMix 则负责混合不同维度的信息,避免 Coupling 只在局部“搅拌”。可以把它理解成:Coupling 像搅拌勺,CayleyMix 像把锅整体转一转,防止食材只在局部打转。
论文还特别强调了一个数学上的好处:这个映射是信息保留的。也就是说,理论上不会因为“高斯化”把原始图像里该有的信息弄丢。对去噪来说,这很重要,因为一旦变换不是可逆的,模型很容易把信号和噪声一起洗掉,最后得到一张“看着干净但细节也没了”的图。
再往下看,P2G 不是单独训练完再交给去噪器,而是采用交替优化。这点很关键:先固定去噪器训练高斯化流,再固定高斯化流训练去噪器。这样两边会互相适应,避免某一边“自嗨式优化”。论文里也解释了为什么这不会破坏 N2N(Noise2Noise)的无偏性质:只要变换是可逆且信息保留,最优解的目标并不会变,只是输入变得更容易处理了。
图4:不同光子计数下的定量与定性评估
图4:不同光子计数下的定量与定性评估。左边用 KL 散度和 1-SFM 衡量残差是否更接近 i.i.d. AWGN;右边展示直方图和自相关图,能看到 P2G 后残差更像标准高斯,空间相关性也更弱。
这里还有两个指标值得顺手解释一下。KL 散度衡量两个分布差多远,越小越像;SFMSpectral Flatness Measure,中文可叫频谱平坦度,这里用 1-SFM 表示空间相关性,越小说明越接近白噪声。P2G 在这两个指标上都往好方向走,说明它不是只在“肉眼看起来更顺”,而是真的把残差往高斯白噪声的目标推进了。
如果把方法再压缩成一句话,那就是:P2G 先把“难学的噪声”变成“好学的噪声”,再让去噪器专心做去噪。这比直接让网络去面对复杂物理噪声,思路更像“先整理桌面,再开始写作业”。

实验结果:性能全面领先,能像“外挂”一样提升各类去噪器

实验部分的重点很明确:一是看 P2G 是否真的把噪声“拧顺”了,二是看这种高斯化是否能转化为实际去噪收益。论文在 SIDD Raw、FMDD、W2S 三个数据集上做了验证,还把它接到了 UNet 和 NAFNet 这类不同骨干上,检验它是不是只对某个模型“偏心”。
表1:SIDD Raw、FMDD和W2S上的定量比较
表1:SIDD Raw、FMDD和W2S上的定量比较。可以看到,P2G 在多个自监督方法里拿到了最好的 PSNR/SSIM,且在不同骨干上都能带来稳定增益,说明它不是某个网络的“特供补丁”,而是更通用的噪声处理思路。
从结果上看,P2G 相比普通 N2N 训练有明显提升:UNet 上提升大约 0.6–0.8 dB,NAFNet 上提升约 0.5–0.6 dB。别小看这几个小数点,在图像去噪里,这已经不是“心理安慰”,而是能看出纹理、边缘和细节保留差异的级别。更关键的是,它在多个数据集上都保持领先,说明增益不是偶然撞大运。
为了验证这种提升是不是“只是模型更大了”,论文还做了计算量对齐的对比:把 N2N 加宽、加重,让它在 FLOPs 和延迟上尽量对齐 P2G。结果这些 compute-matched baseline 还是打不过 P2G。这个结论很重要,说明提升主要来自噪声高斯化机制本身,不是单纯堆算力。
表2:FMDD与W2S上的细粒度评估
表2:FMDD与W2S上的细粒度评估。FMDD 按不同样本子集拆开后,P2G 依然能保持优势;W2S 按不同通道统计时,也能看到它在多数通道上优于对比方法,说明这种方法对场景变化有一定鲁棒性。
表2(b):W2S不同通道上的结果
表2(b):W2S不同通道上的结果。这里最直观的感觉就是:P2G 不是只会在一个数据集上“刷题”,而是在不同通道、不同成像条件下都能较稳定地给出更好的恢复效果。
图5:SIDD Raw和FMDD上的视觉对比
图5:SIDD Raw和FMDD上的视觉对比。P2G 的优势不只是数字更漂亮,图像里能看到边缘更清楚、细线条更完整,过度平滑和伪影也更少。对读者来说,这种结果最有说服力:不是“分数涨了”,而是“图真的更像样了”。
看起来很不错呢。尤其是和同骨干的 N2N 对比时,P2G 的提升并不是那种“多一点点看不出来”的级别,而是能稳定体现在细节恢复上的改进。对去噪任务来说,这种提升通常比单纯的峰值指标更值钱。
图6:消融实验结果
图6:消融实验结果。交替训练比只训去噪器或只训高斯化流更有效;同时,Coupling 和 CayleyMix 组合起来,效果也优于只保留其中一个模块。这个结论说明 P2G 的收益不是“某个环节碰巧好用”,而是整套设计互相配合的结果。
消融实验里还有一个很值得记住的点:只微调去噪器,几乎没什么提升;只训 P2G,虽然能涨一些,但容易很快饱和甚至不稳定;只有交替优化,才会把两边的能力真正焊在一起。这个结果挺像现实里的协作关系:单人闭门造车不如两边互相适配,模型也一样。

未来展望:计算效率待优化,持续逼近完美高斯化

这篇论文最有价值的地方,不只是给出一个新模块,而是把“真实噪声难学”这个老问题,换成了“先把噪声变好学”的新范式。它的启发很清楚:当原始问题分布太复杂时,未必非要让主模型硬扛,也可以先做一个可逆、可解释、尽量不丢信息的分布整形
不过,论文也很诚实地承认了两个现实问题。第一,变换后的残差还没有完全达到理想的 i.i.d. AWGN,说明“高斯化”仍然只是逼近,不是魔法。第二,额外的流模块和交替训练带来了计算与显存开销,推理延迟也会更高。换句话说,效果是涨了,但不是白送的。
所以,未来比较值得期待的方向有两个:一是继续提升高斯化的精度,让残差分布更接近理想白噪声;二是压缩额外开销,让这套方法更适合实际部署。要是能把“效果更好”和“速度别太慢”同时拿下,P2G 这类思路就不只是论文里好看,工程里也会更香。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“真实噪声太复杂,去噪器不好学”的问题。P2G 先把混合泊松-高斯噪声高斯化,再交给去噪器处理,相当于先把题目改成更适合模型做的版本。

AWGN、MPGN、VST 这些词分别是什么意思?AWGN 是加性白高斯噪声,最容易建模;MPGN 是混合泊松-高斯噪声,更符合真实成像;VST 是方差稳定变换,主要是把噪声方差“拍平”,但不一定能把整个分布真正变成高斯。

为什么交替训练比单独训练更好?因为高斯化流和去噪器是互相影响的。只训一边,另一边会跟不上;交替训练能让两者逐步适配,既保证噪声更像高斯,也让去噪器更会处理这种新输入。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“先高斯化再去噪”做成可逆流框架,这个思路挺新,而且不是只改损失函数的小修小补。

实验合理度:★★★★☆

既看统计指标,又看视觉结果,还做了计算量对齐的 baseline,整体比较扎实。

学术研究价值:★★★★☆

它把噪声建模和去噪学习之间的关系讲清楚了,对后续真实噪声处理有启发。

稳定性:★★★☆☆

效果不错,但交替训练和流模块会带来一定训练复杂度,稳定性还要看具体实现。

适应性以及泛化能力:★★★★☆

它对不同骨干、不同数据集都有增益,说明泛化性不错,但仍主要围绕真实成像噪声展开。

硬件需求及成本:★★★☆☆

推理要多走一层高斯化流程,训练还要交替优化,成本比普通单阶段去噪高。

复现难度:★★★☆☆

方法逻辑清楚,但涉及可逆流、交替训练和多数据集设置,工程细节不算省心。

产品化成熟度:★★★☆☆

适合真实噪声去噪场景,但要落地还得继续优化速度、显存和训练稳定性。

可能的问题:方法有效,但额外的流模块和交替训练增加了复杂度;高斯化尚未完全到位,离“完美白噪声”还有距离。


主要参考文献

[1] Abdelrahman Abdelhamed, Stephen Lin, and Michael S. Brown. A high-quality denoising dataset for smartphone cameras. CVPR, 2018.
[2] Abdelrahman Abdelhamed, Marcus Brubaker, and Michael Brown. Noise flow: Noise modeling with conditional normalizing flows. ICCV, 2019.
[5] Diederik P. Kingma and Prafulla Dhariwal. Glow: Generative flow with invertible 1×1 convolutions. NeurIPS, 2018.
[12] Kelui et al. NAFNet. ECCV, 2022.
[23] Noise2VST. CVPR, 2024.
[33] Noise2Noise. ICML, 2017.
原论文链接:https://arxiv.org/pdf/2606.23098v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。