← 返回 PaperDaily
视觉与图像
江苏大学ACM MM新作:图像恢复"按需使劲",LPIPS降12.8%
图像修复这事儿,有点像老小区改造:有的地方墙皮脱落要重刷,有的地方只脏了一小块。可现在的扩散修复模型偏爱"一刀切",全图一样的约束力度、一样的步长节奏,既不省算力还容易把好区域修出问题。江苏大学这篇ACM MM 2026论文,用局部认知不确定性给模型装了一双"会看重点的眼睛",该补的补、该跳的跳,LPIPS平均降12.78%、采样时间省8.42%,还能即插即
龙哥读论文
发布于 2026-08-14 08:31:05
阅读 8
查看原文
原论文信息如下:
扩散模型图像恢复的困境:固定约束与均匀采样的局限
扩散模型在图像生成领域大杀四方之后,研究者们自然想到:能不能拿预训练好的扩散模型,直接当"万能图像先验"来用?这就是扩散模型图像恢复(Diffusion Model-based Image Restoration,DMIR)的基本思路。这类方法不需要针对每种退化重新训练模型,而是靠一个预训练的生成模型,在逆向采样过程中通过数据一致性约束,把受损图像一步步"拽"回高质量的自然图像分布。
但问题来了。现有DMIR方法在干预逆向采样时,几乎都是"全局一刀切" 的操作:空间上,对所有像素用同样的约束权重;时间上,每一步都用同样的步长。这就像请了一位只擅长做"平均脸"的修图师,不管照片哪儿坏了、坏得多严重,统一滤镜一上——结果好区域被磨皮磨掉了纹理,坏区域又没修干净。
细品一下,这里面藏了两个核心痛点。第一个是感知-失真权衡 :真实图像的退化往往是不均匀的,有的区域纹理已经很清晰了,有的区域还糊成一团。如果全图用同一个约束强度,那对已经恢复好的区域来说就是过度约束,容易产生伪影、把原本的细节洗掉;而对严重退化的区域来说又约束不够,结构可能跑偏。第二个痛点是采样冗余 :从常微分方程(ODE)视角看,扩散逆向过程在不同阶段的动态变化速度其实差异很大。结构大体定型之后,后面的密集迭代对最终结果几乎没什么贡献,纯粹在烧GPU。可你要是简单粗暴地减少步数,又会引入离散化误差,细节越修越崩。
江苏大学和西安理工大学这篇ACM MM 2026论文,核心想法就是打破这种静态的刚性设计,让采样过程"感知自身状态、主动调整策略" 。怎么感知?靠局部认知不确定性。既然每个像素在每一步的恢复难度不一样,那就让不确定性当"信号灯":空间上按需分配约束强度,时间上按需决定要不要跳步。下面拆开看具体怎么做。
先放一张论文的定性对比图(图1),可以直观感受一下LEADer在超分、去噪、去模糊等任务上的效果,以及它如何即插即用到不同基线方法中。
局部认知不确定性:从信息几何看扩散采样
这里先澄清一个关键概念:什么是认知不确定性?在贝叶斯框架下,不确定性通常分两类。一类叫偶然不确定性(aleatoric uncertainty),是数据本身固有的随机噪声,没法通过增加知识来消除;另一类叫认知不确定性(epistemic uncertainty),来自模型对未知区域的"无知程度"。本文关注的就是后者:模型对当前恢复结果有多不确定,本质上反映了先验在该局部区域是否"有底气"。
论文从信息几何视角出发,把扩散模型的逆向采样过程看成在数据流形上的概率流动。给定当前带噪状态 xt,模型对干净图像 x0 的后验协方差就刻画了估计的不确定性大小。具体来说,这个协方差可以写成:
用人话说,这个协方差矩阵的每个对角元素,就是对应像素位置的不确定性估计。其背后逻辑是:如果当前状态处于概率密度的高曲率区域(即Ft的范数大),说明分布很"尖锐",模型对估计结果比较有把握,不确定性就低;反过来,如果处于平坦区域,模型自己都不知道该往哪儿走,不确定性就高。
这个定义好在哪?第一,它是逐像素 的,天然支持空间自适应;第二,它是随时间变化 的,能反映采样过程不同阶段的动态特征。论文用Σt的迹(即所有像素不确定性之和)作为全局的不确定性度量Ut,这个量正是后续时间域跳步策略的核心指标。图2展示了LEADer的整体架构,可以清楚地看到UCPM和SATP两个模块在整个采样流程中的位置和衔接关系。
UCPM:空间维度的自适应先验调制
先回顾一下DMIR方法的基线:以DDNM(Denoising Diffusion Null-Space Model)为代表的零空间投影方法,把图像空间拆分成两个正交的部分——范围空间(range space)和零空间(null space)。范围空间对应测量数据y能直接约束的部分,而零空间是数据管不到的区域,只能靠生成先验去"脑补"。经典的分解方式是:
问题就出在这个"先验引导的细化"上。DDNM等标准方法对零空间的所有像素一视同仁,而真实图像的退化程度在不同区域差异巨大。有些地方退化很轻,信息基本保留完整,此时过多依赖先验反而会把真实细节"洗掉",产生过平滑;有些地方退化严重,先验本身也不可靠,此时如果约束不到位,生成结果就会偏离真实结构。这就是感知-失真权衡的核心矛盾。
UCPM(Uncertainty-Calibrated Prior Modulation,不确定性校准先验调制)的解决思路很直接:让Σt决定每个像素该信数据还是信先验。实现上,论文构造了一个局部二次函数来逼近当前估计附近的优化目标,包括数据保真项和几何正则项,然后通过求最优解得到调制后的估计。这个过程经过一系列推导之后,归结成一个优雅的闭式解:
其中Λt*是一个由Σt和海森矩阵共同决定的调制矩阵。直观理解就是:不确定性大的像素,就让数据的约束更强一点;不确定性小的像素,就多保留先验生成的精细结构。更妙的是,由于这个操作发生在零空间内部,它不会破坏已经由测量数据锁定的范围空间分量,也就是说严格的数据一致性被保证 了。论文在定理层面证明了无论先验怎么调制,最终结果在测量方向上永远与y一致。
这个设计最精彩的地方在于它没有引入任何需要学习的参数,完全基于每个采样时刻的模型输出计算不确定性,所以可以像插件一样直接嵌进各种现有DMIR管线里,不需要重新训练,也不会给显存带来什么负担。
SATP:时间维度的智能轨迹剪枝
解决了"在哪儿使劲"的问题,还得解决"什么时候可以省劲"的问题。前面提到,扩散逆向采样沿时间轴是非均匀变化的:早期阶段主要恢复图像的全局结构和低频信息,变化剧烈,需要密集采样;后期阶段结构基本定型,每步只做微小的细节调整,这时候还按部就班地一步步来就有点"磨洋工"了。
SATP(State-Aware Trajectory Pruning,状态感知轨迹剪枝)的做法是:用全局不确定性迹Ut = Tr(Σt)作为采样过程"到底稳没稳住"的指标,进而决定下一步可以跨多大。直觉上,如果当前时刻模型对图像各像素的估计还很"心虚"(不确定性高),说明状态变化大,步子就得迈小一点;如果已经很"笃定"(不确定性低),说明后面基本就是细微润色了,步子迈大一点也不会出错。
具体实现时,论文设定了一个信息损失预算B,并假设跳步引入的误差近似为:
从公式可以看出,Ut越大,ΔtActive越小,保证在采样早期不激进;Ut越小,步长越大,后期直接大步流星地跳。每次跳步之后,由于跳过了中间若干状态,论文用DDIM(Denoising Diffusion Implicit Model)更新公式从当前状态直接推进到tNext时刻的状态,并且噪声项用当前时刻的噪声估计来近似,保证跳步后的状态仍然和原轨迹处于同一概率流形附近。
这里有个值得注意的点:论文提出了一个定理,保证在一定的Lipschitz连续条件下,LEADer跳步采样得到的结果与全步长密集采样结果的差异存在一个显式的上界,误差累积被控制在可控范围内。这就不是一般的经验性提速了,而是有理论兜底的加速。
理论保证与实验验证:质量与效率的双重提升
前面提到,本文给出了两个核心的理论保证。第一个是数据一致性定理:对任何退化矩阵A,只要零空间投影存在,经过UCPM调制后的结果就一定满足‖y - Ax̂‖2² = 0,也就是在测量方向上与观测数据严格一致。这个性质保证了UCPM的空间自适应不会以偏离数据为代价。第二个是误差界定理:在采样轨迹满足Lipschitz连续的条件下,LEADer的跳步采样与原始密集采样的累计误差有一个明确的指数型上界,说明跳步不是"瞎跳",而是在不破坏收敛性的前提下进行。
实验部分,论文做得很扎实。如图3所示,LEADer在五个典型任务上都有直观的改善效果,包括图像超分辨率、高斯去噪、去模糊、修复和着色。同时论文还对比了DDNM在加装LEADer前后,中间估计x̂0|t在不同采样步数下的变化情况,直观展示了LEADer如何更快地收敛到更干净的结果。
定量实验在CelebA-HQ 1K和ImageNet 1K两个数据集上进行,对比的基线包括DDNM、DPS、ΠGDM、DDPG、ProjDif等多个主流DMIR方法。表1展示了完整的结果。
从表1可以看到几个关键的量化结论。第一,LEADer在几乎所有任务和所有指标上都取得了提升,其中LPIPS平均下降12.78%,说明感知质量改善明显;第二,采样时间平均减少8.42%,在部分任务上甚至能达到20%以上的加速;第三,加装LEADer后模型在PSNR和SSIM上基本不掉点,甚至偶有提升——这说明"省力"和"效果好"这次没有打架,而是相辅相成。
论文还做了超参数敏感性分析(表3),探究误差预算B对性能的影响,实验表明在B的合理取值范围内性能保持稳定,说明SATP对超参数不敏感。表4展示了内存占用的对比,加装LEADer仅增加极少的显存开销。表5的FID对比进一步验证了LEADer在生成质量上的优势。
消融实验(表2和图5)也验证了每个组件的必要性:去掉UCPM后感知质量明显下降,去掉SATP后采样时间显著增加,两个模块合在一起才能兼顾质量与效率。图6展示了在CelebA-HQ 1K和ImageNet 1K上PSNR、LPIPS和采样时间的细粒度对比,可以更清楚地看到LEADer在不同任务上的一致增益。图7则展示了SATP在采样过程中Ut和ΔtActive的动态变化曲线,可以直观看到不确定性下降时步长自动变大的自适应行为。
从图7可以看出,在采样初期Ut维持在一个较高水平,此时ΔtActive约为1,即逐步行进不跳步;随着采样推进,Ut逐渐下降,ΔtActive自动增大到2-3,实现近似"后期加速收敛"的效果。这个曲线很直观地说明了SATP的"主动性"来自哪里——不是靠预设的调度,而是靠对当前采样状态的实时感知。
还有一个值得注意的细节:LEADer在ImageNet 1K上的加速比和在CelebA-HQ上基本一致,说明这个自适应策略在不同数据分布上都能保持稳定的行为,不是针对某个数据集过拟合的产物。
龙迷三问
这篇论文到底在解决什么问题? 江苏大学等团队提出LEADer框架,用局部认知不确定性同时校准空间先验与时间步长,可即插即用于多种扩散图像恢复方法,平均LPIPS降7.13%-12.78%、采样时间省3.04%-8.42%。
这篇工作最值得看的点是什么? LEADer集成到多种DMIR基线方法后,在CelebA-HQ 1K上PSNR平均提升0.88%至2.38%,LPIPS降低7.13%至12.78%,同时采样时间减少3.04%至8.42%。在ImageNet 1K上也取得一致提升。
这篇工作的边界或风险在哪里? 优点:1)提出新颖的局部认知不确定性量化方法,从信息几何角度分析扩散模型采样过程;2)UCPM和SATP两个模块设计巧妙,分别解决空间和时间维度的自适应问题;3)即插即用设计,可无缝集成到多种DMIR基线;4)理论分析完善,提供数据一致性和误差界保证。缺点:1)不确定性计算需要二阶导数,计算复杂度较高;2)对超参数B(信息损失预算)敏感,需要仔细调优;3)在极低步数下加速效果有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一个基于局部认知不确定性的主动扩散采样框架(LEADer),通过空间域的不确定性校准先验调制(UCPM)和时间域的状态感知轨迹剪枝(SATP),实现自适应图像恢复和加速采样。
实验合理度: ★★★★☆
PSNR(峰值信噪比)、LPIPS(学习感知图像块相似度)、平均每图运行时间(Time)
学术研究价值: ★★★★☆
提出一个基于局部认知不确定性的主动扩散采样框架(LEADer),通过空间域的不确定性校准先验调制(UCPM)和时间域的状态感知轨迹剪枝(SATP),实现自适应图像恢复和加速采样;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
在NVIDIA GeForce RTX 3090 GPU上,单张图像处理时间从3.42秒到5.43秒不等,相比基线方法减少3.04%至8.42%的采样时间。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: ;3)即插即用设计,可无缝集成到多种DMIR基线;4)理论分析完善,提供数据一致性和误差界保证。缺点:1)不确定性计算需要二阶导数,计算复杂度较高;2)对超参数B(信息损失预算)敏感,需要仔细调优;
主要参考文献
[1] Jiaqi Zhang, Zheng Pang, Rongrong Gao, Qiyuan Zhang, Yang Yang. Local Epistemic Uncertainty Guided Active Sampling for Plug-and-play Difusive Image Restoration. ACM MM 2026.
[2] Hyungjin Chung, Jeongsol Kim, Michael T. Mccann, Marc Louis Klasky, Jong Chul Ye. Diffusion posterior sampling for general noisy inverse problems. ICLR 2023.
[3] Yinhuai Wang, Jiwen Yu, Jian Zhang. Zero-shot image restoration using denoising diffusion null-space model. ICLR 2023.
[4] Jiaming Song, Chenlin Meng, Stefano Ermon. Denoising diffusion implicit models. ICLR 2021.
[5] Jonathan Ho, Ajay Jain, Pieter Abbeel. Denoising diffusion probabilistic models. NeurIPS 2020.
融会贯通
结合PaperDaily已收录论文的对比来看,LEADer在同基准(CelebA-HQ/ImageNet 1K + PSNR/LPIPS)上的表现方向与领域内的主流结论基本一致:扩散模型图像恢复的核心瓶颈确实在于"先验与数据之间的平衡方式"。DDNM类方法胜在数据一致性严格、实现简单,但对退化不均匀场景的适应性不足;DPS类方法梯度引导灵活,但稳定性堪忧;而LEADer用不确定性作为中间信号,在两种范式之间搭了一座桥。要注意的是,上述观察仅限于PaperDaily收录文献范围内的辅助判断,不同论文的实验设置(数据集划分、退化参数、基线调参)可能存在差异,直接跨论文比较数值高低并不完全公平。
更深一层看,这篇论文的启示或许不只限于图像恢复。任何依赖扩散模型逆向采样的应用——比如文生图编辑、视频修复、三维重建——都面临同样的"哪里该信先验、哪里该信数据"以及"哪一步值得算、哪一步可以省"的问题。LEADer提供了一种思路:用模型自身的概率结构来感知不确定性,再据此分配计算资源。这种"让模型自己决定怎么算"的自适应推理范式,在扩散模型应用日趋广泛的当下,可能比一个具体的图像恢复方法更有延展价值。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!