← 返回 PaperDaily
视觉与图像
告别一键硬修!SuperSharpen把盲去模糊变成“手动挡”,细节更真实
这篇工作把扩散模型去模糊从“一键生成”变成了“手动调档”,引入了类似音量旋钮的模糊度量(BM),让用户自己决定要锐化多少、生成多少细节。还实打实对比了ControlNet适配和全量微调两条路线,结论清晰,落地感强,值得做图像恢复和摄影后处理的朋友读一读。
龙哥读论文
发布于 2026-08-27 00:20:19
阅读 4
查看原文
原论文信息如下:
拍过照片的朋友都有过这种经历:明明对焦对得很认真,快门按下去之后放大一看,画面还是有点“肉”,像隔着一层磨砂玻璃。尤其是光线不足、快门速度偏慢的时候,镜头轻微失焦、机身抖动、RAW降噪算法对细节的揉搓,都会让一张本来很好的照片变得松垮、模糊、缺乏质感。传统去模糊方法要么假设已知模糊核,要么一步到位端到端硬修,但效果往往顾此失彼:修得太猛了,纹理全是编出来的;修得太轻了,又像没修一样。更气人的是,绝大多数生成式修复模型都像一个固执的自动挡司机——你只能接受它给出的结果,没法告诉它“这次多用点力”或者“这次保守一点”。
本文提出的SuperSharpen(SupS)就是来解决这个“手动挡”问题的。它基于隐扩散模型做盲去模糊,核心创新在于引入了一个叫模糊度量(Blur Measure,简称BM) 的东西,相当于给用户一个旋钮:训练时BM表示退化管道带来的模糊程度,推理时用户可以根据自己的喜好,手动调整BM大小来控制恢复强度——想要锐利一点就调大BM,想要最大程度保留原图就调小BM。论文把这种可控性比较实在地做出来了,模糊照片的克星:SuperSharpen如何实现可控去模糊?
你有没有过这种时刻:兴冲冲地翻出相机,对焦、构图、按下快门,一气呵成,回家把照片拖进电脑,放大一看——完了,画面怎么这么“肉”?就像隔着一层毛玻璃,纹理糊成一团,锐度全无。镜头失焦、机震、慢快门、低光环境下的长曝光,甚至RAW文件降噪算法对高频细节的“温柔揉搓”,都可能成为画质杀手。更让人头大的是,传统去模糊路线还分两派:一派是“已知模糊核,照方抓药”的非盲去模糊,另一派是“啥都不知道,眯着眼睛盲猜”的盲去模糊。前者在实际场景里基本指望不上,因为模糊核哪能那么容易测出来;后者呢,端到端模型倒是简单粗暴,但修出来的图常常又软又平,像是把一堆可能答案做了个平均,细节全丢了。
生成式模型出来以后,大家发现这事儿有救了——扩散模型这类生成式先验,能根据低质量输入“脑补”出真实感细节。但新的问题又来了:几乎所有基于扩散模型的修复方法都是一键生成,用户根本没得选。生成的细节太跳脱?那就忍一忍吧;修得不够狠?也没有办法再拉一把。就像一台固执的自动挡汽车,你只能接受它给的档位,不能自己控制力度。
DxO Labs(法国知名影像处理厂商)联合Télécom Paris的团队,这次带来的SuperSharpen(SupS) ,就是来填这个“手动挡”空白的。它专门针对专业摄影里那种轻度、空间均匀的模糊——比如轻微失焦、降噪/ISP处理带来的细节平滑——做成了一套基于扩散模型的盲去模糊方案,核心卖点是一个叫做模糊度量(Blur Measure,简称BM) 的旋钮:训练时BM描述退化管道带来的模糊水平,推理时用户自己拧这个旋钮,想要多锐利就拧多大。用大白话说,你终于可以告诉AI:“这次给我修狠一点”或者“轻点,别乱编”。
更难得的是,论文没有停留在“我提出了一个可调参的扩散修复模型”这句话上,而是老老实实把两条主流技术路线拉出来同台竞技:一条是时下最火的ControlNet适配器方案(SupS-CN),另一条是直接把整个扩散模型去噪器做全量微调的方案(SupS-FT)。训练、评测、定性比对一个不少,结论也相当干脆——全量微调在保真度上更胜一筹,编造出来的不自然纹理更少。这种“不绕弯子、直接对比”的做法,对做图像恢复和摄影后处理的朋友来说,阅读体验非常舒爽。
扩散模型遇上盲去模糊:两种条件化策略的较量
先花三十秒把扩散模型的基本功捋一捋。无论是最早的DDPM(Denoising Diffusion Probabilistic Models,去噪扩散概率模型),还是后来大放异彩的潜在扩散模型(Latent Diffusion Model,LDM),核心套路都一样:前向过程不断往干净图像上加噪声,直到它变成一坨纯高斯噪声;反向过程则训练一个神经网络,让它学会从噪声里一步步把原图“捞”回来。SuperSharpen的基础骨架选择了Stable Diffusion 2.1,这是一个典型的潜在扩散模型,先用一个变分自编码器(VAE)把图像压缩到低维潜在空间,再在潜在空间里做前向加噪、反向去噪,计算效率比直接在像素域操作高出一大截。
标准的无条件扩散模型,训练目标就是让网络预测加进去的噪声。用到的损失函数长这样:
公式1:无条件扩散模型的噪声预测损失。其中 z₀ 是干净图像的潜在编码,εₜ 是 t 时刻添加的高斯噪声,ε_θ(zₜ, t) 是网络对噪声的预测。
但是盲去模糊是条件生成啊——不能让模型自由发挥,得让它看着低质量图像来去噪。于是论文把低质量图像的潜在编码 z_LQ 也塞进网络,训练目标就变成了下面这样:
公式2:条件扩散模型的噪声预测损失。相比公式1,网络额外接收低质量图像的潜在表示 z_LQ 作为输入,相当于给生成过程装上了一双“盯着模糊图”的眼睛。
同样是把 z_LQ 作为条件,怎么“喂”给模型,却是两条路线之争。
第一条路线,SupS-CN ,走的是ControlNet适配器路线。ControlNet最早是为文生图设计的:把扩散模型的主干冻住,在旁边加一个可训练的分支网络,通过残差连接把条件信息注入到主干每一层。SupS-CN的做法就是把这个分支网络输入改成“低质量潜码 z_LQ + 带噪潜码 zₜ + 模糊度量BM”的拼接,然后让它去影响冻结的Stable Diffusion U-Net。这招在图像修复圈子里被DiffBIR等模型发扬光大,好处是只训练适配器,省算力,且不容易破坏预训练生成先验。
第二条路线,SupS-FT ,则直接对扩散模型去噪器本身做全量微调。不搞旁路了,直接把U-Net的输入通道扩展,让“低质量潜码 + 模糊度量”作为额外的条件通道,和噪声潜码一起送进网络。整个扩散先验在训练中都会被调整,代价是训练开销更大,但换来的是模型对输入条件更深层的适应。图1把两条路线的训练设置画得明明白白。
图1:训练与推理设置。(a) SupS-CN的ControlNet条件化训练:只有适配器(橙色)可训练,扩散主干(蓝色)冻结;(b) SupS-FT的全量微调训练:整个扩散去噪器(绿色)都参与训练;(c) SupS-FT的推理流程:由用户给定模糊度量BM,迭代去噪生成高质量图像。两种设置下,VAE编码器E始终冻结。
训练时,z_LQ和zₜ拼接后送进网络,模型在每一步去噪时都能直接“看到”低质量图像的信息;推理时也一样,低质量潜码会在每个反向采样步骤反复注入。这种“持续监督”机制,是让生成结果不跑偏的关键。
那两条路线到底谁更强?论文的实验结论相当直接:SupS-FT在感知质量上全面占优,尤其是LPIPS指标大幅领先,而且生成的高频纹理更贴近真实图像结构,不像SupS-CN那样偶尔会“脑补”出一些看起来挺锐但实际站不住脚的假细节。原因也很好理解:ControlNet适配器毕竟只是“挂”在冻结先验上,条件信号得借道而行,经过一层层残差注入,控制力会被稀释;全量微调则让整个先验都朝着“看见模糊图、输出清晰图”的方向重塑,条件与生成之间的耦合自然更深。
模糊度量:让用户掌控恢复强度的秘密武器
把低质量图像作为条件输入,只是解决了“怎么把模糊图送进扩散模型”的问题。SuperSharpen真正的点睛之笔,是那个让用户手动控制恢复强度的模糊度量(BM) 。
但这里的BM并不是一个简单的图像模糊程度评分,它有一个非常讲究的计算过程。论文采用的训练数据退化管道继承自Real-ESRGAN——包括各向同性/非各向同性模糊、缩放、加噪、JPEG压缩等多种退化混合。这种复合退化本身就很难用单一标量描述。作者想了个聪明的办法:把整个退化管道看成一个黑箱算子 A,在里面输入一堆脉冲信号,测量它的平均脉冲响应,再用一个各向同性高斯核去拟合这个响应。拟合出来的高斯核标准差σ,就是这次退化对应的模糊度量BM。整个过程如图2所示。
图2:模糊度量BM的计算流程。在退化管道中注入多个脉冲信号,测量其平均脉冲响应,再用各向同性高斯核拟合,最终把高斯核的标准差作为BM值。
公式3:模糊度量BM的估计。给定退化管道的平均脉冲响应 h,在 [σ_min, σ_max] 区间内搜索一个各向同性高斯核 g_σ,使得它与 h 的均方误差(MSE)最小。搜索区间设置为 [0.1, 10.0]。
数学上不复杂,但设计心思很巧妙:退化管道明明包含各种复杂的混合退化,BM却用一个“等效高斯模糊程度”把它们压成一个标量,在训练时让模型知道“这次退化大概有多狠”。到了推理阶段,BM更是完全解放了——它不再需要匹配真实物理模糊,而是变成一个纯用户旋钮。想要输出更锐利、更多高频细节,就把BM调大;想尽量贴近原图、少生成额外内容,就把BM调小。图5非常直观地展示了这个旋钮的效果。
图5:真实图像上不同模糊度量BM值的定性结果。BM值越大,去模糊力度越强,纹理细节越丰富;BM值越小,输出越接近原始输入。可以看到,BM=8.0时画面明显更锐利,而BM=0.7时几乎接近原图。
这里还藏了一个数据增强的小细节:为了让模型在不同BM条件下都能输出合理结果,训练时先把高清图做一次随机高斯模糊增强,再走退化管道。训练前期所有样本都做这个增强,后期只对10%的样本做,逼迫模型既学会“去模糊”也学会“保持原样”。这个“脚踏两只船”的训练策略,正是可控性的根基。
实验结果:合成与真实世界的双重验证
说了这么多,效果到底怎么样?论文的实验设计走的是“合成数据定量 + 真实数据定性”双轨制。
训练阶段,作者选用了大规模图像恢复数据集LSDIR,用Real-ESRGAN风格的退化管道合成低质量图。但注意,SuperSharpen的目标是轻度模糊、同分辨率修复,所以作者把退化参数整体调温和了,scale factor也设为1。模型用AdamW优化器,在4张H100 GPU上训了13天:SupS-CN训27万步,SupS-FT训38万步,batch size为24,输入裁剪512×512,学习率从10⁻⁴衰减到10⁻⁵。
合成测试用的数据集是Urban100,退化方式为各向同性高斯模糊(标准差在0.7到7.5之间)+轻度高斯噪声(标准差0到7)。对比方法挑的都是生成式修复赛道的当红选手:DiffBIR、PASD、SeeSR、ResShift。这几位虽然主打超分辨率,但scale factor设为1时也能用于去模糊。定量指标既有全参考指标(PSNR、SSIM、LPIPS),也有无参考指标(MUSIQ、MANIQA、CLIP-IQA)。
表1给出了完整的定量结果。信息量很大,值得逐行品一品。
表1:Urban100合成退化图像的定量比较。加粗为最优,下划线为次优。全参考指标上,HQ(高质量原图)的PSNR未标注,SSIM=1.00、LPIPS=0.00作为基准。无参考指标上,所有方法都超过了HQ——这说明无参考指标对修复图的“审美”偏好与真实清晰度并不完全一致。
先说感知质量。SupS-FT的LPIPS达到0.1714,直接拿下全场第一;SupS-CN以0.2020紧随其后,两者都把DiffBIR(0.2278)、PASD(0.2138)甩在身后。LPIPS越低代表感知上越接近真实清晰图像,这个指标最能反映“好不好看”的主观体验,所以SupS-FT在视觉观感上的优势是有数据支撑的。
再看无参考指标。SupS-CN在MUSIQ、MANIQA、CLIP-IQA三项全部第一,说明它生成的纹理“很讨质量评估模型的欢心”。但有趣的是,PASD在PSNR和SSIM上最高(21.93 / 0.6518),这说明它的输出像素级误差最小——代价是细节偏平。这正是扩散模型修复的老大难:像素空间越接近,反而显得“糊”;感知质量越好,PSNR往往又上不去。SuperSharpen的定位很明确,它优先保感知质量。
定性结果也一样。图3的合成模糊对比里,DiffBIR、SupS-CN和SupS-FT是视觉上最锐利的三家,但细看纹理结构,SupS-FT生成的纹理与真实高清图(HQ)最一致,不自然的结构最少。
图3:合成模糊图像的定性比较。DiffBIR、SupS-CN和SupS-FT都能产生足够锐利的结果,但SupS-FT产生的纹理更少出现不合常理的结构。
真实世界的验证同样有看头。论文选用了Adobe5K——一个用真实单反相机拍摄的RAW图像数据集。这些图本身就带着镜头光学缺陷带来的模糊,再经过DxO自家的DeepPRIME降噪去马赛克流程处理后,部分细节会被进一步抹平。之所以选它,是因为大多数去模糊数据集都聚焦运动模糊或非均匀散焦模糊,而SuperSharpen要啃的正是空间均匀、轻微失焦+处理平滑这类“冷门”模糊。
因为没有真实清晰参照图,真实数据只做定性比较。图4的结果挺能说明问题:ResShift和PASD修完之后还是软绵绵的;SeeSR生成的内容太少,画面显得“平”;DiffBIR纹理倒是锐了,但很多细节是编的,跟原图对不上。而SupS-CN和SupS-FT在“锐度”和“保真度”之间取得了更好的平衡,输出更自然。
图4:真实模糊图像的定性比较。SupS模型在照片真实感和对输入的保真度之间取得了更好的折中。LQ为低质量输入,对比方法包括ResShift、PASD、SeeSR、DiffBIR。
综合来看,实验结果清晰地指向一个结论:如果目标是“让照片变清晰且不像AI乱改的原图”,全量微调的SupS-FT是最稳的选择。这与论文在方法和机制层面的分析完全闭环:ControlNet适配器受制于冻结先验,而全量微调让模型真正学会了如何把模糊图映射到清晰图。
局限与展望:SuperSharpen的边界在哪里?
没有哪篇论文是十全十美的,SuperSharpen也有很明确的边界感。
首先是建模范围。论文从设计之初就锁定了空间均匀模糊 ,也就是整幅画面的模糊程度大致相同、方向一致的场景,包括轻微失焦和降噪/ISP处理带来的平滑。运动模糊、景深造成的非均匀散焦、局部区域模糊,所有这些都没法处理。换句话说,这是一把专门拧“均匀模糊”螺丝的螺丝刀,不是瑞士军刀。
其次是内容敏感性。作者在结论里直言,当前方法在文字和人脸这类极其敏感的内容上可能产生伪影。想想也合理,扩散模型生成文字经常缺胳膊少腿,人脸一旦“脑补”过头就会出现“恐怖谷”效应。另外,当BM取值非常接近0时,模型相当于几乎不做修复,这时候对原始身份的保持还不够理想——输出的图像可能在某些局部偏离输入的人脸特征。
还有一个实际部署的问题:论文在4张H100上训了13天,推理时扩散模型需要多次迭代去噪,速度谈不上实时。对于DxO这样面向专业摄影软件的公司,把SuperSharpen塞进PhotoLab工作流,需要解决推理速度、显存占用和设备适配的问题。当然,DxO本身就是做图像处理引擎的,算法工程化能力很强,未来若能把这项技术以插件或云端服务的形态落地,那对摄影后期的价值将是实打实的。
展望未来,把BM从“全局标量”扩展成“空间变化图”是很有吸引力的方向——那样就能处理局部模糊,也更贴近真实摄影场景。在BM与物理模糊核之间建立更精确的映射,或者引入身份保持约束,也能进一步缩小与商用的距离。这条“可控修复”的路,SuperSharpen算是开了一个好头。
龙迷三问
这篇论文到底在解决什么问题? 本文提出SuperSharpen(SupS),一种基于隐扩散模型的可控盲去模糊方法,通过模糊度量(BM)让用户在推理时自由调节恢复强度。
这篇工作最值得看的点是什么? SupS-FT在LPIPS上取得最佳结果(0.1714),SupS-CN在无参考指标上表现最优(MUSIQ 71.74, MANIQA 0.6493, CLIP-IQA 0.7299)。在真实图像上,SupS模型在细节生成和输入保真度之间取得更好平衡。
这篇工作的边界或风险在哪里? 优点:1) 提出模糊度量实现显式可控恢复强度;2) 系统比较两种条件化策略,发现微调优于ControlNet;3) 在合成和真实数据上均验证有效性。缺点:1) 仅处理空间均匀模糊,不适用于运动模糊;2) 对文本和人脸等敏感内容可能产生伪影;3) 模糊度量接近零时无法保持身份信息。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出SuperSharpen,一种基于潜在扩散模型的盲去模糊方法,通过引入模糊度量(BM)作为条件输入,实现对恢复强度的显式控制,并对比了ControlNet适配器与全微调两种条件化策略。
实验合理度: ★★★★☆
全参考指标PSNR、SSIM、LPIPS;无参考指标MUSIQ、MANIQA、CLIP-IQA。
学术研究价值: ★★★★☆
提出SuperSharpen,一种基于潜在扩散模型的盲去模糊方法,通过引入模糊度量(BM)作为条件输入,实现对恢复强度的显式控制,并对比了ControlNet适配器与全微调两种条件化策略;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
训练在4×H100 GPU上进行13天,SupS-CN训练270k迭代,SupS-FT训练380k迭代,批量大小为24,裁剪尺寸512×512。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1) 仅处理空间均匀模糊,不适用于运动模糊;2) 对文本和人脸等敏感内容可能产生伪影;3) 模糊度量接近零时无法保持身份信息。
[1] Rombach R, Blattmann A, Lorenz D, et al. High-Resolution Image Synthesis with Latent Diffusion Models[C]. CVPR, 2022.
[2] Zhang L, Rao A, Agrawala M. Adding Conditional Control to Text-to-Image Diffusion Models[C]. ICCV, 2023.
[3] Lin X, He J, Chen Z, et al. DiffBIR: Toward Blind Image Restoration with Generative Diffusion Prior[C]. ECCV, 2024.
[4] Wang X, Xie L, Dong C, et al. Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data[C]. ICCV, 2021.
[5] Li Y, Zhang K, Liang J, et al. LS-DIR: A Large Scale Dataset for Image Restoration[C]. CVPR, 2023.
[6] 原论文链接: https://arxiv.org/pdf/2608.23343v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
📷 拍糊的照片还有救吗?想聊更多图像恢复、去模糊和扩散模型的骚操作?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像恢复+上海+清华+老王) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,等你来唠~
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!