← 返回 PaperDaily
大模型与智能体
理论计算机最新斩获:一次搞定两个十年开放问题
把软直方图和扩散滤波硬凑成一对,居然在高斯+脉冲混合噪声上打出了漂亮的组合拳。方法推导干净利落,没有堆砌花活,适合想从变分视角理解鲁棒去噪底层逻辑的读者花十分钟读一读。
龙哥读论文
发布于 2026-09-03 00:20:18
阅读 1
查看原文
原论文信息如下:
图像去噪这事儿,说简单也简单,说复杂也复杂。简单在于目标明确——把噪声去掉、把细节留住;复杂在于噪声从来不是一个乖孩子,现实世界里的噪声往往是混着来的:既有高斯噪声那种"细雨润无声"式的全面污染,又有脉冲噪声这种"突然给你点颜色看看"的暴力破坏。两种噪声叠加在一起,传统去噪方法往往顾此失彼,就像一个人左手画方右手画圆,不是不行,是真的不容易。
经典的非线性扩散方法(比如Perona-Malik)在纯高斯噪声下表现不错,靠梯度幅值自适应地停止边缘处的平滑。但一旦碰到脉冲噪声(椒盐噪声或者数据丢失导致的离群点),问题就来了——离群点的梯度值往往很高,会被误判为"边缘特征"从而被完整保留下来。这就像门卫看到一个穿得花里胡哨的人就以为是贵宾,结果放进来一个捣乱分子。
引言
本论文的研究出发点很简单却很巧妙:既然扩散方法怕离群点,那就先把离群点剔掉再告诉扩散过程"哪里该停、哪里该继续走"。用什么来剔?通道表示(Channel Representation) 。这是一种特殊的软直方图编码方式,它不像普通直方图那样把每个像素值硬性丢进一个格子,而是按照距离把像素权重分散到邻近的几个通道中,从而实现无损编码。
通道表示有个好兄弟叫通道平滑(Channel Smoothing, CS) ,它的做法很简单:对每个像素,把邻域内所有像素值编码成软直方图,然后取直方图中峰值对应的位置解码,作为当前像素的平滑结果。这个过程天然具有离群点剔除能力——因为脉冲噪声的灰度值和周围正常像素差异大,在软直方图中它只会是一个孤零零的小峰,不会被选中。但通道平滑也有缺点:它对高斯噪声的抑制效率不高,因为高斯噪声让每个像素都偏离真实值,软直方图的窗口会把一部分"带噪的"内层点也排除在外,平均效果打了折扣。
论文作者的想法是:能不能让扩散过程"借用"通道平滑的离群点鲁棒性?具体来说,就是用通道平滑后的图像结构信息来驱动扩散系数——离群点位置不当作边缘来保护,而是当作应该被抹平的噪声来处理。这样一来,扩散过程既能通过全局平均有效压制高斯噪声,又能避免被脉冲离群点欺骗。这就是本文的核心贡献:线性通道扩散(LCD) 和非线性通道扩散(NLCD) 。
方法概述
图像去噪,特别是混合噪声场景下的去噪,一直是底层视觉里一个让人又爱又恨的题目。爱,是因为问题定义足够清晰,输入一堆像素,输出一堆干净像素,效果好坏一目了然;恨,是因为噪声从来不按套路出牌——高斯噪声均匀地撒在每一个像素上,润物细无声;脉冲噪声则是一锤子买卖,直接给某些像素值砸成极端值。两种噪声一叠加,常规方法就开始手忙脚乱:扩散算法把椒盐点当边缘保护着,不让平滑,结果噪声活得好好的;中值滤波倒是能剔除离群点,但对高斯噪声几乎是束手无策。
本文要聊的这篇论文,恰好在处理这个混合噪声难题时给出了一个挺机灵的思路:与其让扩散过程直接在带噪图像上判断结构,不如先用通道表示(Channel Representation) 把局部像素分布编码成软直方图,让“哪里是边、哪里是噪”的判断更靠谱,再把这个结构信息灌入扩散系数的计算中。读过之后不得不说,这个做法兼顾了理论优雅和实现简单,很有启发。
看到这个思路的第一反应是:这波操作有点东西。用通道平滑的结果去指导扩散进程,相当于给扩散算法配了一个“离群点雷达”。别急,下面就把雷达的工作原理拆开讲清楚。
通道表示如何革新图像扩散?
先把基础概念说清楚。变分法视角下,图像去噪可以看作一个能量最小化问题。给定带噪观测图 u⁰ 和待求的干净图 u,设计一个能量泛函 E(u),通常包含两项:第一项是保真项,让结果不要偏离观测太远;第二项是正则化项 R(u),用来约束解的平滑性。
那该怎么办?论文给出的答案是:引入通道表示。通道表示最早由 Granlund 在 2000 年提出,本质上是一种软直方图 。普通直方图把每个像素值硬性分配到唯一的 bin,量化误差大;通道表示则按距离把权重分散到相邻几个通道中,可以做到无损编码,也能从局部峰值中鲁棒解码。论文使用二次 B 样条作为基函数:
本文的核心思路,就是把这两种方法的优点焊在一起:用通道平滑后的结果去驱动扩散过程。这样扩散时离群点不会被当作边缘保护,而是被强烈平滑;同时,扩散依然可以对所有像素做全局平均,保证高斯噪声的抑制效率。基于这个想法,论文推导出了两种新方法:线性通道扩散(Linear Channel-based Diffusion, LCD) 和非线性通道扩散(Non-Linear Channel-based Diffusion, NLCD) 。
从能量泛函到扩散方程的理论推导
论文的推导过程相当优雅,值得慢慢品。第一步,把正则化项 R(u) 定义为“通道平滑后图像的梯度能量”,而不是直接惩罚原图的梯度。换句话,噪声在进入正则化项之前,先被通道平滑“消毒”了一遍。为了简化记号,论文将三窗口解码记为 cᵗB̃(u),于是正则化项可以写成向量-矩阵形式:
有了 LCD 的基础,非线性版本 NLCD 的扩展就顺理成章了:在正则化项里加入一个凸势函数 Φ,进一步控制扩散行为,保护细小纹理,思路与 Perona-Malik 一脉相承:
∂u/∂t = λ [ 1/2 · Ψ · div(cᵗS(u)c ∇u) + cᵗS(u)c · div(Ψ∇u) ]
可以看到,最终方程里两项都是非线性扩散,只是扩散系数的权重来源不同:第一项以通道表示系数为主、Ψ 为辅,第二项则反过来。特别关键的是,Ψ 的输入是通道平滑后的图像 ∇(cᵗB̃(u)),离群点在 Ψ 的结构估计中已经被“隐身”了。因此 Ψ 在离群点位置不会主动降低扩散强度,离群点会被强烈平滑而不是被当作边缘保护。
混合噪声下的实验验证与对比分析
理论推导再漂亮,最终还得看疗效。论文的实验设计很聚焦:模拟“5% 脉冲噪声 + 不同程度高斯噪声”的混合污染场景,高斯噪声标准差 σ 从 5 变化到 50。测试图像包括 Cameraman、House、Lena 三张经典标准图,以及六张来自 Berkeley 图像数据库的图片(Skyline、Hawk、Bird、Rollercoaster、Boat&House、Lighthouse)。
对比方法相当全面,覆盖了扩散类、滤波类和现代去噪方法三大阵营:线性扩散(Linear Diffusion, LD)、Perona-Malik 非线性扩散(NLD)、Weickert 张量驱动各向异性扩散(Anisotropic Diffusion, AD)、通道平滑(CS)、中值滤波(Median Filtering, MF)、BM3D、以及两种非局部均值(NLM)实现——像素版本和块匹配版本。所有方法都统一优化参数,LCD 和 NLCD 的通道数、边缘停止参数 α 都做了调优,保证公平。
图 4 展示了所有方法在不同高斯噪声水平下的最优 SSIM 值(结构相似性指数,越大表示结构保持越好)。这里有个细节:像素版 NLM 在处理混合噪声时效果很差,SSIM 只有 0.3 到 0.5,论文直接没把它的曲线画进图里,算是侧面交代了“脉冲噪声对某些方法有多不友好”。
再看视觉对比。图 5 选取了 Cameraman、Hawk、Boat&House 三张图在 σ=30 噪声水平下的局部区域放大。CS 和中值滤波的结果呈现出一种“卡通化”的质感:主边缘保住了,但人脸、相机等细节被磨平了。像素版 NLM 几乎被脉冲噪声搞崩溃,画面里还残留大量椒盐点。BM3D 和 patch-NLM 整体不错,但部分细节仍然有损失或残留高斯噪声。而 NLCD 在细节保持和噪声抑制之间取得了更好的平衡,既没有明显的椒盐残留,也保留了相机结构、鸟的羽毛纹理等细节。
方法优势与局限性的客观评估
优点不用重复太多,最核心的一点是:变分框架完整、数学推导干净 。从能量函数到 EL 方程再到离散迭代,每一步都有明确理论支撑,不像很多深度学习方法那样“黑盒调参”。第二个优点是通用性潜力大:论文类比了扩散方法在彩色图像、矢量图像、矩阵值图像上的已有工作,指出这套通道引导机制可以迁移到那些场景。第三个优点是它与现有扩散框架兼容,可以直接替换或增强已有扩散算法中的结构估计模块。
但也要客观看待它的短板。首先,NLCD 并没有真正“移除”离群点,而是用强平滑把离群点“抹开”。由于扩散是均值保持的,只有零均值噪声存在时才可能做到无偏恢复,所以对极端脉冲噪声的恢复能力有限。其次,方法涉及通道数、边缘停止参数 α、高斯核 w 的方差等多个超参数,论文也承认这些参数是逐图优化的,落地到实际场景时调参会比较麻烦。第三,实验只覆盖了灰度自然图像,彩色图像和医学图像的表现尚未验证。最后,从性能排位看,在低高斯噪声场景下 NLCD 相比 CS 的优势并不明显,而 patch 版 NLM 和 BM3D 在多数设定下还是更优——这说明 NLCD 的价值更多体现在“扩散类方法的增强”而非“超越 SOTA 去噪器”。
未来应用前景与研究方向
论文在结论部分给了一个明确的方向提示:把 NLCD 扩展到DTMRI(扩散张量磁共振成像) 和HARDI(高角分辨率扩散成像) 数据上。这类医学影像数据本身就是矩阵值或高阶张量值,传统扩散方法已经有成熟的张量扩散框架,通道平滑对离群点的鲁棒性正好可以用来压制采集过程中的异常体素,理论上是很自然的结合。
另一个值得关注的方向是深度学习结合。通道表示本身是一个可微算子,完全可以作为神经网络的一个模块嵌入到 CNN 或 Transformer 架构中,让网络自动学习最优的通道数、基函数宽度和扩散参数。这样既能保留通道平滑的鲁棒性,又能借助深度学习的表征能力摆脱繁琐的手动调参。
此外,从更广阔的视角看,这类“用鲁棒结构估计替代原始梯度估计”的思想并不仅限于扩散滤波。任何依赖梯度信息的底层视觉任务——比如光流估计、立体匹配、图像配准——都可能受益于这种离群点感知的结构估计方式。这也是本文最值得借鉴的地方。
龙迷三问
这篇论文到底在解决什么问题? 本文提出基于通道表示(软直方图)的新型非线性和线性扩散去噪方法,通过能量泛函将通道平滑引入扩散正则化,使扩散过程既能保持边缘又能抑制离群脉冲。在混合高斯与脉冲噪声下优于经典扩散方案,部分场景可媲美BM3D等SOTA方法。
这篇工作最值得看的点是什么? NLCD在中等至高高斯噪声水平下优于所有扩散类方法,在部分图像(如Hawk)上甚至超过BM3D和NLM等最先进方法;在低噪声水平下CS表现良好,NLCD在σ≥15时稳定超越CS。
这篇工作的边界或风险在哪里? 优点:1)创新性地将通道表示引入扩散正则项,实现了对脉冲噪声的鲁棒处理;2)理论推导完整,从能量泛函到EL方程推导严谨;3)在混合噪声场景下表现优异,部分情况超越最先进方法;4)方法可迁移至其他扩散应用领域(如DTMRI、HARDI)。缺点:1)在纯高斯噪声场景下不如BM3D和NLM等最先进方法;2)计算复杂度较高,需要通道编码和迭代求解;3)参数较多(通道数、边缘参数α等),需要针对不同噪声水平调优;4)仅验证了灰度图像,未扩展到彩色或多通道数据。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出将通道表示引入扩散正则项,通过软直方图编码图像局部邻域并构造能量泛函,推导出带通道加权项的非线性鲁棒扩散更新方案,以同时抑制高斯噪声和脉冲噪声。
学术研究价值: ★★★★☆
提出将通道表示引入扩散正则项,通过软直方图编码图像局部邻域并构造能量泛函,推导出带通道加权项的非线性鲁棒扩散更新方案,以同时抑制高斯噪声和脉冲噪声;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1)在纯高斯噪声场景下不如BM3D和NLM等最先进方法;2)计算复杂度较高,需要通道编码和迭代求解;
主要参考文献
[1] Perona, P. and Malik, J. (1990). Scale-space and edge detection using anisotropic diffusion. PAMI, 12:629–639.
[2] Felsberg, M., Forssén, P.-E., and Scharr, H. (2006). Channel smoothing: Efficient robust smoothing of low-level signal features. PAMI, 28(2):209–222.
[3] Granlund, G. H. (2000). An associative perception-action structure using a localized space variant information representation. In Proceedings of AFPAC.
[4] Weickert, J. (1998). Anisotropic Diffusion In Image Processing. ECMI Series, Teubner-Verlag, Stuttgart.
[5] Dabov, K., Foi, A., Katkovnik, V., and Egiazarian, K. (2006). Image denoising with block-matching and 3d filtering. In Electronic Imaging’06, Proc. SPIE 6064.
[6] Buades, A., Coll, B., and Morel, J.-M. (2011). Non-Local Means Denoising. Image Processing On Line, 2011.
[7] Wang, Z., Bovik, A., Sheikh, H., and Simoncelli, E. (2004). Image quality assessment: from error visibility to structural similarity. IEEE TIP, 13(4):600–612.
[8] 原论文链接:https://arxiv.org/pdf/2608.29227v1.pdf
图像去噪的路上,软直方图和扩散这对新CP你见过没?🤚 混合噪声一网打尽的快乐,想不想要!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,图像处理群等你来聊!
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!