← 返回 PaperDaily
视觉与图像
清华P2G把噪声拧成高斯,去噪最高提0.75dB
这篇论文把“真实噪声太难学”这件事,拆成了先高斯化、再去噪两步走,思路很顺手。更关键的是,它不是只会讲理论,还能直接给现成去噪器加 buff,实用性很强。
龙哥读论文
发布于 2026-08-14 21:47:09
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文把“真实噪声太难学”这件事,拆成了先高斯化、再去噪两步走,思路很顺手。更关键的是,它不是只会讲理论,还能直接给现成去噪器加 buff,实用性很强。
原论文信息如下:
让去噪器“读懂”真实噪声:P2G提出噪声“高斯化”新范式
去噪这件事,表面上像“把脏东西擦干净”,实际上更像“先搞清楚脏东西到底是什么,再决定怎么擦”。这篇论文的思路很直接:不要硬逼去噪器去学一团复杂噪声,而是先把真实噪声拧成更规矩的高斯噪声 ,再让现有去噪器出手。听起来像给模型换了个更好啃的食材,做法却相当讲究。
如果把传统去噪器比作“保洁阿姨”,那真实世界的噪声就像一屋子会变形的泥点:光越弱,泥点越诡异;像素位置不同,泥点大小还不一样;甚至分布还不对称。P2G的厉害之处在于,它不急着擦,先把泥点统一成“标准模板”,这样后面的去噪器就不会一边擦一边怀疑人生。
为什么真实噪声(Poisson-Gaussian混叠)会让现有去噪器“头痛”?
先把背景捋清楚。很多经典去噪方法默认噪声是AWGN ,英文全称是 Additive White Gaussian Noise ,中文叫加性白高斯噪声 。它有两个很省心的特点:一是噪声和图像内容基本没啥关系,二是分布比较对称,像个老老实实的钟形曲线。模型一看就懂,训练起来也顺滑。
但现实很不讲武德。低照度摄影、显微成像、天文成像里,噪声往往不是单纯高斯,而是混合泊松-高斯噪声 ,英文是 Mixed Poisson-Gaussian Noise, MPGN 。其中泊松部分来自光子到达的随机性,属于“光本来就少,偏偏还要抽盲盒”;高斯部分则来自读出和电子噪声。结果就是:噪声会跟着信号强弱变化,方差不恒定,分布还容易偏斜。对模型来说,这种噪声不是“脏”,而是“脏得有个性”。
论文里做了一个很关键的观察:真实数据中的高 ISO 场景,信号依赖更强,噪声偏斜也更明显。这说明问题不只是“噪声方差变大了”,而是噪声的形状 本身就变复杂了。很多传统方法喜欢先做方差稳定变换(VST, Variance-Stabilizing Transformation ,中文叫方差稳定变换 ),但这类方法更像是“把波浪拍平一点”,并没有真正把整条分布线拧顺,尤其在低光子计数下,近似会更吃力。
于是,P2G把问题换了个问法:既然复杂噪声难学,那能不能先把它变成更容易学的噪声? 这就有了“噪声高斯化”这个核心概念。不是简单做统计近似,而是尽量让残差分布真的朝标准高斯靠拢。
P2G的核心:如何用一个可逆流将任意噪声“拧”成高斯?
P2G 的全称是 Poisson2Gaussian ,中文可以理解成“从泊松到高斯”。它的核心不是一个单独的去噪网络,而是一个可逆的噪声重参数化模块 ,再加上一个下游去噪器。整个思路可以概括成两步:先把原始残差做高斯化,再让去噪器去处理这个更友好的输入。
这里最有意思的是,P2G 不是靠拍脑袋设计一个固定映射,而是用了可逆流 ,也就是 normalizing flow。它的本事是:一边变换分布,一边还能精确算概率密度。换句话说,不只是“看起来像高斯”,而是尽量在密度层面也对齐高斯。论文强调这是通过概率密度匹配 来实现的,而不是只匹配均值、方差这种低阶统计量。
为了让变换既能“拧得动”又不丢信息,P2G 采用了两类模块:Coupling 层 和 CayleyMix 层 。Coupling 层负责把一部分通道变成另一部分的函数,优点是可逆、好算;CayleyMix 则负责混合不同维度的信息,避免 Coupling 只在局部“搅拌”。可以把它理解成:Coupling 像搅拌勺,CayleyMix 像把锅整体转一转,防止食材只在局部打转。
论文还特别强调了一个数学上的好处:这个映射是信息保留的。也就是说,理论上不会因为“高斯化”把原始图像里该有的信息弄丢。对去噪来说,这很重要,因为一旦变换不是可逆的,模型很容易把信号和噪声一起洗掉,最后得到一张“看着干净但细节也没了”的图。
再往下看,P2G 不是单独训练完再交给去噪器,而是采用交替优化 。这点很关键:先固定去噪器训练高斯化流,再固定高斯化流训练去噪器。这样两边会互相适应,避免某一边“自嗨式优化”。论文里也解释了为什么这不会破坏 N2N(Noise2Noise)的无偏性质:只要变换是可逆且信息保留,最优解的目标并不会变,只是输入变得更容易处理了。
这里还有两个指标值得顺手解释一下。KL 散度 衡量两个分布差多远,越小越像;SFM 是 Spectral Flatness Measure ,中文可叫频谱平坦度 ,这里用 1-SFM 表示空间相关性,越小说明越接近白噪声。P2G 在这两个指标上都往好方向走,说明它不是只在“肉眼看起来更顺”,而是真的把残差往高斯白噪声的目标推进了。
如果把方法再压缩成一句话,那就是:P2G 先把“难学的噪声”变成“好学的噪声”,再让去噪器专心做去噪。 这比直接让网络去面对复杂物理噪声,思路更像“先整理桌面,再开始写作业”。
实验结果:性能全面领先,能像“外挂”一样提升各类去噪器
实验部分的重点很明确:一是看 P2G 是否真的把噪声“拧顺”了,二是看这种高斯化是否能转化为实际去噪收益。论文在 SIDD Raw、FMDD、W2S 三个数据集上做了验证,还把它接到了 UNet 和 NAFNet 这类不同骨干上,检验它是不是只对某个模型“偏心”。
从结果上看,P2G 相比普通 N2N 训练有明显提升:UNet 上提升大约 0.6–0.8 dB,NAFNet 上提升约 0.5–0.6 dB。别小看这几个小数点,在图像去噪里,这已经不是“心理安慰”,而是能看出纹理、边缘和细节保留差异的级别。更关键的是,它在多个数据集上都保持领先,说明增益不是偶然撞大运。
为了验证这种提升是不是“只是模型更大了”,论文还做了计算量对齐的对比:把 N2N 加宽、加重,让它在 FLOPs 和延迟上尽量对齐 P2G。结果这些 compute-matched baseline 还是打不过 P2G。这个结论很重要,说明提升主要来自噪声高斯化机制本身 ,不是单纯堆算力。
看起来很不错呢。尤其是和同骨干的 N2N 对比时,P2G 的提升并不是那种“多一点点看不出来”的级别,而是能稳定体现在细节恢复上的改进。对去噪任务来说,这种提升通常比单纯的峰值指标更值钱。
消融实验里还有一个很值得记住的点:只微调去噪器,几乎没什么提升;只训 P2G,虽然能涨一些,但容易很快饱和甚至不稳定;只有交替优化,才会把两边的能力真正焊在一起。这个结果挺像现实里的协作关系:单人闭门造车不如两边互相适配,模型也一样。
这篇论文最有价值的地方,不只是给出一个新模块,而是把“真实噪声难学”这个老问题,换成了“先把噪声变好学”的新范式。它的启发很清楚:当原始问题分布太复杂时,未必非要让主模型硬扛,也可以先做一个可逆、可解释、尽量不丢信息的分布整形 。
不过,论文也很诚实地承认了两个现实问题。第一,变换后的残差还没有完全达到理想的 i.i.d. AWGN,说明“高斯化”仍然只是逼近,不是魔法。第二,额外的流模块和交替训练带来了计算与显存开销,推理延迟也会更高。换句话说,效果是涨了,但不是白送的。
所以,未来比较值得期待的方向有两个:一是继续提升高斯化的精度,让残差分布更接近理想白噪声;二是压缩额外开销,让这套方法更适合实际部署。要是能把“效果更好”和“速度别太慢”同时拿下,P2G 这类思路就不只是论文里好看,工程里也会更香。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“真实噪声太复杂,去噪器不好学”的问题。P2G 先把混合泊松-高斯噪声高斯化,再交给去噪器处理,相当于先把题目改成更适合模型做的版本。
AWGN、MPGN、VST 这些词分别是什么意思? AWGN 是加性白高斯噪声,最容易建模;MPGN 是混合泊松-高斯噪声,更符合真实成像;VST 是方差稳定变换,主要是把噪声方差“拍平”,但不一定能把整个分布真正变成高斯。
为什么交替训练比单独训练更好? 因为高斯化流和去噪器是互相影响的。只训一边,另一边会跟不上;交替训练能让两者逐步适配,既保证噪声更像高斯,也让去噪器更会处理这种新输入。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“先高斯化再去噪”做成可逆流框架,这个思路挺新,而且不是只改损失函数的小修小补。
实验合理度: ★★★★☆
既看统计指标,又看视觉结果,还做了计算量对齐的 baseline,整体比较扎实。
学术研究价值: ★★★★☆
它把噪声建模和去噪学习之间的关系讲清楚了,对后续真实噪声处理有启发。
稳定性: ★★★☆☆
效果不错,但交替训练和流模块会带来一定训练复杂度,稳定性还要看具体实现。
适应性以及泛化能力: ★★★★☆
它对不同骨干、不同数据集都有增益,说明泛化性不错,但仍主要围绕真实成像噪声展开。
硬件需求及成本: ★★★☆☆
推理要多走一层高斯化流程,训练还要交替优化,成本比普通单阶段去噪高。
复现难度: ★★★☆☆
方法逻辑清楚,但涉及可逆流、交替训练和多数据集设置,工程细节不算省心。
产品化成熟度: ★★★☆☆
适合真实噪声去噪场景,但要落地还得继续优化速度、显存和训练稳定性。
可能的问题: 方法有效,但额外的流模块和交替训练增加了复杂度;高斯化尚未完全到位,离“完美白噪声”还有距离。
主要参考文献
[1] Abdelrahman Abdelhamed, Stephen Lin, and Michael S. Brown. A high-quality denoising dataset for smartphone cameras. CVPR, 2018.
[2] Abdelrahman Abdelhamed, Marcus Brubaker, and Michael Brown. Noise flow: Noise modeling with conditional normalizing flows. ICCV, 2019.
[5] Diederik P. Kingma and Prafulla Dhariwal. Glow: Generative flow with invertible 1×1 convolutions. NeurIPS, 2018.
[12] Kelui et al. NAFNet. ECCV, 2022.
[23] Noise2VST. CVPR, 2024.
[33] Noise2Noise. ICML, 2017.
原论文链接:https://arxiv.org/pdf/2606.23098v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群