← 返回 PaperDaily 视觉与图像

宁波联队新作:重尾残差下PG噪声稳健估算,PSNR再涨1.9dB

当你在暗光下按下快门,CMOS传感器捕获的RAW数据里,既有光子打上去的散粒噪声,又有电路本身的读取噪声,混合在一起,让那些在实验室里表现神勇的“高斯去噪器”瞬间歇菜。这篇论文不打新网络架构,而是从噪声建模的老祖宗——方差稳定化出发,用一招“甩锅”重尾残差的稳健拟合,愣是把GAT+预训练模型这条老路走通了,而且走得很稳。对于想省掉重新训练模型成本、直接用现有

原论文信息如下:
论文标题:
RPG-VST: Robust Poisson-Gaussian Variance Stabilization for Blind RAW Denoising

发表日期:
2026年07月

发表单位:
OmniVision-IDT联合实验室(宁波数字孪生研究院、东研院、浙江省工业智能与数字孪生重点实验室)& 香港理工大学

原文链接:
https://arxiv.org/pdf/2607.24291v1.pdf

RAW去噪的“隐形杀手”:重尾残差如何搞崩方差稳定化?

封面
很多搞图像处理的小伙伴都有个执念:直接用那些训练好的“高斯去噪器”来干RAW数据的活,省时又省力。这听起来很美,但现实是——CMOS传感器拍出来的RAW图,噪声压根不是高斯分布,而是Poisson-Gaussian (PG) 混合噪声。这里面既有光子打上去产生的散粒噪声,也有电路本身产生的读取噪声,而且噪声强度还跟信号强度绑在一起,这么一来,高斯去噪器就彻底歇菜了。
为了解决这个问题,学界搞出了一条经典的“物理捷径”——广义安斯库姆变换 (GAT)。简单说,GAT就是一个数学“翻译官”,把PG噪声的方差变成基本跟信号无关的常数,这样高斯去噪器就能直接上手了。但是在盲去噪(盲去噪就是没有任何参考或先验信息,直接从单张图上盲估噪声参数并去噪)的场景下,这个“翻译官”的靠谱程度大打折扣,隐藏着一个“隐形杀手”。
这个“杀手”就是重尾残差。要理解它,得先看看GAT怎么工作的。GAT需要两个关键参数:散粒噪声系数(ac)和读取噪声系数(bc)。在盲去噪场景下,得从当前单张图的纹理稀疏区域(通常是低纹理区域)来估算这俩参数。问题来了,RAW数据里那些纹理稀疏的区域,往往会混入一些“害群之马”,比如:残留纹理、过曝(clipping)的像素、坏点、行列噪点,还有读取噪声本身带来的噪声基底。
下图非常直观地揭示了这个问题:
图1a:在RAW图像的某个代表性区域中,平铺了每个tile(16×16像素块)的均值(横轴)与对数方差(纵轴)。绿色点是符合主流趋势的正常值,红色点则是残差较大的异常值(标准化残差|z|>3)。OLS拟合(橙色线)被这些异常值拉偏,而RPG使用的Student-t拟合(蓝色线)则紧紧跟随大多数正常点的趋势。
当这些“害群之马”数量不多、但残差特别大时,就会产生所谓的“重尾残差”。如果使用最偷懒的普通最小二乘法 (OLS) 来拟合PG模型,它会把每一个点的误差都“一视同仁”地计算进去。结果就是,那少数几个异常点(比如图1a中的红点)会严重扭曲整个模型参数,就像班里几个捣蛋鬼的成绩拉低了全班平均分一样。
参数一错,GAT就变成了不靠谱的“翻译官”。论文中的命题1从理论上精确说明了这个问题:当拟合的参数(ā, b̄)与真实参数(a*, b*)不一致时,经过GAT变换后的噪声方差会呈现明显的信号依赖性,即方差稳定化的目标(单位方差)无法实现。这会导致去噪器在某些区域下表现极差,产生严重的“尾部失败”(severe tails)——也就是虽然平均PSNR看起来还行,但总有几个图片被搞得一塌糊涂。
图1b和1c进一步展示了问题的严重性:
图1b:蓝色曲线是实际残差z的分布,黑色虚线是标准的高斯分布N(0,1)。可以看到,实际残差的尾部(|z|>3)远远厚于高斯分布,大约是高斯分布的9.4倍(左尾)和28.9倍(右尾)。这说明用高斯模型去假设残差分布是完全不合适的。
图1c:OLS拟合(橙色)的方差比随着信号强度变化明显偏离了±1dB的容忍区间,而RPG的稳健拟合(蓝色)则稳定地保持在单位方差附近,体现了其稳定性。

Student-t+物理约束:给PG拟合穿上防弹衣

既然问题出在重尾残差,那RPG-VST的核心思路就非常直接:给PG拟合过程穿上“防弹衣”,让它不再受少数异常点的摆布。
第一步,是对原始数据的预处理。原文对CFA各通道(如Bayer阵列的R、G1、G2、B)分别进行处理。在每个通道上,先屏蔽掉过饱和、近黑、坏点,然后把图像切成16×16的tile,只选最平坦的55%的tiles作为候选。然后对每个tile计算稳健统计量——用中值代替均值,用Winsorized方差代替普通方差,来压制残留纹理和孤立异常点。
第二步,引入“防弹衣”——Student-t分布损失函数替代传统的最小二乘法。Student-t分布最大的特点是其长尾特性——它天然地对异常值不敏感。放到PG拟合的语境下,如果一个tile的残差特别大(比如图1a中的红点),Student-t损失函数会通过其内部机制自动给它打上一个低权重,从而限制它对拟合结果的影响。
具体实现上,RPG-VST采用了对数方差残差的形式。它不直接拟合s²=aμ+b,而是拟合log(s²)与log(aμ+b)之间的差值。这样做的好处是能更直接地衡量方差稳定化效果,因为GAT的核心就是让方差变为常数。为了找到最优参数,论文使用迭代重加权最小二乘法 (IRLS) 来优化目标函数。这个过程中,权重会根据当前残差大小动态调整——残差越大,权重越小。
第三步,加上物理约束。这不是一个随便乱算的问题——散粒噪声和读取噪声的系数有着明确的物理界限。比如散粒噪声ac不能是负数,读取噪声bc也必须在合理的范围内。论文设置了强约束:ac∈[10⁻⁸, 2×10⁻²],bc∈[10⁻¹⁰, 10⁻²]。如果知道相机或ISO的先验,还可以进一步加一个弱先验正则项。
算法的完整流程可以用下面的伪代码总结:
    算法:RPG-VST 单图像盲RAW去噪流水线
    输入:RAW裁剪图 y,冻结的高斯去噪器 D
    输出:混合去噪结果 x_hyb
    
    1. 构建有效像素掩码和打包的CFA通道 {Ω_c}c∈C
    2. 提取低纹理区域集合 {F_c} 和稳健统计量 {(μ_t,c, s²_t,c)}
    3. 对于每个CFA通道 c ∈ C:
        a. 用目标(2)执行稳健PG拟合 (IRLS) → 获得 θ_hat
        b. 用同一组tile统计量执行OLS PG拟合 → 获得 θ_hat_OLS
    4. 根据式(3)计算 θ_hat 和 θ_hat_OLS 各自对应的稳定化域噪声水平 σ_z(θ)...
    5. 应用无参考门控(4)选择系数 → (θ_sel, σ_sel_z)
    6. 返回 x_hyb = 反向GAT( 去噪器( 前向GAT(y; θ_sel); σ_sel_z ); θ_sel )
    
    这种思路其实有一定的借鉴意义。Student-t分布本身是统计学中稳健性分析的标准工具,用于处理存在异常值的回归问题;而将其应用到GAT的参数估计上,确实是一个非常巧妙的工程适配。

    无参考门控:自动判断“鲁棒”还是“保守”?

    一个很有趣、也很实用的设计是RPG-VST的无参考门控 (σz gate)。为什么需要这么一道“保险门”呢?因为在某些极端情况下,比如拍摄环境非常暗、ISO极高时,整张图可能几乎就是读取噪声(read-noise dominated)和深阴影伪影。此时,即使稳健拟合也可能会出现误判,例如当散粒噪声极低时,稳健拟合可能会把读噪声推到边界值,而用一个偏高的散粒噪声来补偿,导致整体参数偏差很大。
    所以,本文用一个非常聪明的无参考方法来检测稳健拟合是否靠谱——看稳定化域的噪声水平。如果稳健拟合的σz比OLS拟合的σz更偏离单位方差,那就说明稳健拟合可能出错了,本文会明智地退回使用OLS拟合,也就是普通的Vanilla-GAT方案。
    选择标准就一句话:
    谁让稳定化域的噪声σz更接近1(线性尺度)或0(对数尺度),就选谁。|log(σz)|越小,说明方差稳定化做得越好。
    这个方法最妙的一点是:它完全不需要先验门槛、不需要干净参考图像,而且只依赖去噪之前的tile统计量,只产生一次去噪调用。与需要额外学习的解决方案相比,这是真正的零额外开销智能化。

    六大场景全胜:PSNR涨了,翻车率降了

    实验设置非常完整且规范。选用了三个主流RAW去噪基准数据集:SID Sony SID50(极低光照)、SIDD(智能机典型场景)和ELD(极低光照+4种相机+高ISO)。冻结了两个代表性预训练去噪器:SwinIR-c50和Restormer-σ25。对比方法只选了一个:Vanilla-GAT,就是直接用OLS做PG拟合的GAT方案,正好是RPG-VST门控的退路。
    评测指标有两个:平均PSNR和严重尾部次数。严重尾部定义为:相比什么都不做、直接扔给去噪器(Direct)的情况,若某张图片用该方法后PSNR反而下降了超过1dB(即PSNR_method - PSNR_Direct < -1dB),就算一次翻车。
    结果非常亮眼,来看论文的官方表格:
    表I:RPG-VST与Vanilla-GAT(即OLS拟合+GAT)的对比。每个单元格格式为“平均PSNR (dB) / 严重尾部次数”。RPG-VST在全部6个数据集-去噪器组合中均提升了平均PSNR,并在4个组合中减少了严重尾部次数。
    具体数据来看:
    在SID50+SwinIR上,PSNR从41.89提升到42.43 dB,严重尾部从13降到了5;在SIDD+SwinIR上,PSNR从48.39飙升到50.22 dB(+1.83 dB),严重尾部从44次骤降到7次;在SIDD+Restormer上,PSNR从44.90提升到46.82 dB(+1.92 dB),严重尾部从36次降到4次。尤其是在SIDD上的改善特别明显,说明稳健拟合和门控机制对那些“半干净”但去噪器表现不稳定的中等噪声场景格外有效。
    但在ELD+Restormer上,PSNR提升很小(+0.04 dB),翻车次数维持在109次不变。这揭示了一个之前就提到的一个弱点:当噪声主要由读取噪声主导,且阴影深陷时,两种拟合(稳健和OLS)都不太管用,已经超出了当前方差稳定化理论的处理能力。
    消融实验(表II)清晰展示了门控机制的价值:
    表II:门控消融实验。不使用门控时,鲁棒拟合在SID50和SIDD上表现良好,但在ELD上导致翻车次数从181激增到200。加入门控后,ELD的翻车次数从200降至167,整体表现最优。
    如果不加门控,ELD的翻车次数反而增多,说明稳健拟合在某些极端条件下是会“翻车”的。加上门控后,稳健拟合在SIDD和SID50上照常表现,在面对ELD这种极端情况时,门控会谨慎地退回到“保守一点”的OLS方案,从而避免了更多翻车。

    局限与启示:极端低光下如何突围?

    尽管RPG-VST效果显著,但它并不是万能药。论文诚实地揭示了局限性:在读取噪声占绝对主导(ELD+高ISO)的极端低光场景下,基于平铺的统计量和GAT的整个方法学都会达到理论天花板。无论门控怎么选择,如果两种候选方案都无效,门控是回天乏术的。
    从实践角度,本文有三个非常有价值的启示:
    1. 不要盲目相信平均PSNR。平均指标好,不代表每个样本都好。单张PSNR下挫1dB以上这样的“尾部失败”在实际应用中是不能接受的。RPG-VST专门针对这个痛点提供了解决方案。
    2. “无参考”场景中的门控设计很实用。传统方法需要干净参考图像来调节参数,这在真实世界中是不现实的。RPG-VST仅从估计出的噪声模型中的尺度一致性来判断——如果稳定化域的噪声偏离单位方差的量较小,那就是正确的门控方向。干净、高效。
    3. 稳健统计与现代深度学习的经典组合有惊喜。把Student-t分布这个经典统计学工具与Transformer(SwinIR、Restormer)组合,用稳健拟合来解决数据预处理阶段的污染问题。这在思路上一举实现了“冰”与“火”的融合,非常有借鉴价值。
    论文未来也指出了两个有前景的方向:跨CFA参数共享,以及更细粒度的tile级可靠性门控。对许多希望在不重新训练模型的情况下利用现有先进去噪器来提升RAW图像质量的团队,RPG-VST提供了一个稳定、可复现、理论扎实的工具箱。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:

    Q1:GAT到底是什么?它跟普通去噪有什么关系? A:GAT(Generalized Anscombe Transform,广义安斯库姆变换)是一个经典的统计变换,专门用来“稳住”信号依赖型噪声——比如相机RAW图像中散粒噪声和读取噪声混合的PG噪声。它把这些原始噪声映射到一个噪声方差基本与信号无关的“稳定化域”,在这个域里,普通的高斯去噪器(比如SwinIR、Restormer)就能直接发挥最好的效果。GAT可以理解成为一个专门为PG噪声设计的去噪“前处理模块”,再加上一个反变换把结果恢复回来。

    Q2:为什么直接用OLS拟合PG参数会出问题? A:因为OLS(普通最小二乘法)对所有的误差一视同仁,没有抗异常值的机制。在盲去噪场景中,RAW图里的低纹理区域往往不仅包含纯噪声,还混杂着残留纹理、坏点、过曝像素等。这些“残差”分布的尾部非常厚(重尾),少数几个异常tile就可以把OLS的拟合线拉偏。在稳定化域内,参数一偏,方差就不再单位化,去噪器就容易在某些区域完全失效(即“尾部失败”,PSNR反而比不处理时更低)。

    Q3:RPG-VST这个方法好复现吗?对开发者有什么实际价值? A:从论文描述看,RPG-VST完全是基于运算逻辑的设计,不需要额外训练网络,也不需要你调整去噪器参数量。核心算法就是稳健统计+几步迭代加权最小二乘法+一个门控判断。只要你有一套标准的高斯去噪器(如SwinIR或Restormer),再搭上RPG-VST的拟合脚本,就能让你的去噪器无痛适配RAW图像。对于相机ISP端、手机影像处理团队来说,这可以避免高昂的RAW去噪重新训练成本,直接拿来用就能显著提升效果,实际落地价值很高。

    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆

    将Student-t稳健回归引入GAT的PG参数估计,并设计无参考门控的自动选择机制,这是一个既有理论深度又能解决实际问题的组合创新,但本质上是经典统计工具的工程化应用,不属于原理性突破。

    实验合理度:★★★★★

    实验设计很规范。三个主流数据集、两个代表性冻结去噪器、6种组合全覆盖;对比方法清晰(Vanilla-GAT即普通GAT);同时提供了消融实验来证明门控的实际效果。直接定义的“PSNR翻车”指标(严重尾部)很值。

    学术研究价值:★★★★✰

    虽然论文没有提出全新的理论,但它提供了一个非常清晰的、通用的盲RAW去噪框架。特别指出了方差稳定化方法在处理重尾污染时的失败机制,并且用无参考门控来进行自动纠正,对这个方向的研究者有很重要的启发意义。

    稳定性:★★★★✰

    在SID、SIDD等多个主流数据集上的表现稳定,严重尾部大幅减少。但在ELD等读噪声主导的高ISO极端场景下,效果有限,尾部失败次数没有明显改善,表明在极端条件下稳定性仍是一个待解决的课题。

    适应性以及泛化能力:★★★★✰

    方法本身与去噪器无关,与CFA模式无关(可分别处理不同通道),且不依赖特定相机参数。理论上可以适配任意RAW格式和任意预训练高斯去噪器,通用性较好。但对读取噪声和极端阴影场景适应性不强。

    硬件需求及成本:★★★★★

    方法本身只处理tile统计和迭代几轮加权最小二乘,计算量极小。门控逻辑无额外计算。真正的计算瓶颈在于调用一次冻结的高斯去噪器(SwinIR或Restormer),但RPG-VST本身不影响这部分开销,整体来说几乎是零成本增强。

    复现难度:★★★★☆

    方法描述非常详细,算法伪代码完全公开,核心步骤标准,没有依赖特殊框架。只要用好常用的Python科学计算库(numpy, scipy等),复现起来不难。唯一的遗憾是目前论文显示没有提供官方开源代码仓库。

    产品化成熟度:★★★★✰

    本文的框架非常适合产品化落地。可以作为手机ISP管线中的一个预处理模块(自动检测噪声参数+门控)直接集成到拍照流程中。在中等光照或典型手机拍照场景中,效果改善明显。但对于专业级暗光相机的极端场景(ELD),还需要配合其他后处理或数据增强。

    可能的问题: 整体框架清晰、效果显著。但门控机制仅在两候选之间选择,当两个候选都不好时无法解决问题。此外,tile大小(16×16)和55%选择率是固定参数,对不同分辨率或噪声水平的适应性未做系统分析,可能有一定的局限性。


    主要参考文献

    [1] A. Foi, M. Trimeche, V. Katkovnik, and K. Egiazarian, “Practical poissonian-gaussian noise modeling and fitting for single-image raw-data,” IEEE Transactions on Image Processing, vol. 17, no. 10, pp. 1737–1754, 2008. (PG噪声建模与GAT的基础文献)
    [2] M. Makitalo and A. Foi, “Optimal inversion of the generalized anscombe transformation for poisson-gaussian noise,” IEEE Transactions on Image Processing, vol. 22, no. 1, pp. 91–103, 2013. (GAT逆变换的理论基础)
    [3] S. Herbreteau and M. Unser, “Self-calibrated variance-stabilizing transformations for real-world image denoising,” in Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025, pp. 10 496–10 506. (无需参考的自校准VST方法)
    [4] 原论文链接:https://arxiv.org/pdf/2607.24291v1.pdf

    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

    end
    看完这篇RPG-VST,是不是对RAW去噪里的"隐性杀手"有了新认识?
    觉得Student-t拟合+σz门控这波操作帅气,想跟更多小伙伴一起拆解顶会好文,探讨从传感器物理到落地部署的种种门道?
    欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
    『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
    在这里,继续深挖那些让算法更鲁棒的硬核设计!
    wechat_helper dianzan
    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。