← 返回 PaperDaily
视觉与图像
2026新作:DDIM后验采样拿下多数指标
这篇论文最有意思的地方,不是“又做了一个扩散逆问题方法”,而是把原本很容易写成一团经验技巧的 posterior sampling,硬生生拆成了按奇异方向逐坐标更新的 DDIM。更狠的是,它还给出后验一致性证明,属于“能跑、能讲、还能证”的那类工作。
龙哥读论文
发布于 2026-08-14 09:11:21
阅读 4
查看原文
原论文信息如下:
逆问题生成模型的新范式
扩散模型做逆问题,最怕的不是“不会生成”,而是“生成得很像,但和观测对不上”。这篇论文的切入点很直接:既然线性逆问题里,观测算子 A 的每个奇异方向信息量不同,那就别再把所有方向一锅端,用同一种修补方法硬拧了。作者把 posterior sampling 这件事拆成了按奇异方向分别更新 ,再用 DDIM 的方式把这些更新拼起来,思路非常朴素,但很有效。
先把背景说人话:所谓线性逆问题 ,就是从观测 y = Ax0 + ε 里倒推原始信号 x0 。这里的麻烦在于,A 可能欠采样、退化、带噪声,甚至秩不满;于是“唯一答案”常常不存在。Bayesian inference 的做法是别死磕一个点估计,而是去采样后验分布 p(x0|y) ,让结果既符合先验分布,也符合观测约束。扩散模型正好能充当这个先验,但怎么把观测信息塞进采样过程,历史上一直是个工程和理论都不太省心的问题。
这篇工作的亮点,不在于又堆了多少技巧,而在于它把问题重新组织了一遍:不同奇异方向的信息强弱不同 ,那就让强的方向更多听观测,弱的方向更多听先验。这个判断一旦成立,后面的算法就顺了很多。说白了,别让“看得清的地方”和“看不清的地方”都用同一套脑回路,机器也该讲点分场合办事。
信噪比博弈:何时信任观测,何时依赖先验?
论文真正的“分水岭”是信噪比。为了把问题说透,先解释两个关键词。观测信噪比 可以理解为某个方向上,测量矩阵 A 传来的有效信号相对噪声有多强;而扩散信噪比 则是扩散前向过程里,信号项 αt 和噪声项 σt 的相对强弱,通常写成 αt/σt 。它随时间单调下降:一开始信号强,后来噪声强,最后接近纯噪声。
作者的做法很像给每个方向装了一个“分流阀门”。把测量矩阵 A 做奇异值分解 SVD(Singular Value Decomposition,奇异值分解) 后,问题就能沿着每个奇异方向拆开。对第 s 个方向来说,测量侧的有效强度由奇异值 Σss 和噪声标准差 σ 决定;扩散侧则由 αt/σt 决定。于是只要比较这两个比值,就能决定这个方向到底该更相信谁。
论文把奇异方向分成了三类。第一类是measurement-dominated directions ,也就是观测主导方向,观测强到足以直接拉住采样;第二类是prior-dominated observed directions ,虽然被观测到了,但观测还不够硬,不能直接硬塞;第三类是unobserved directions ,这些方向压根没被测到,只能老老实实靠扩散先验补。这个分法很关键,因为它把“后验采样”从一个大而模糊的任务,变成了一个个更容易处理的小任务。
这里还有一个容易忽略但很实用的点:作者不是只看“结果好不好”,还看什么时候开始饱和 。图2右边已经在提醒,NFE 增加到一定程度后,恢复质量提升会明显变慢。换句话说,扩散采样不是越慢越高级,很多时候只是更费电。工程上最贵的不是模型参数,而是那些“理论上还能再跑两百步”的执念。
Posterior-DDIM:一种简单高效的坐标级采样方案
Posterior-DDIM 的名字听起来很学术,拆开其实不复杂:Posterior 表示它要采后验;DDIM 是 Denoising Diffusion Implicit Models ,中文通常译为“去噪扩散隐式模型”;而它最特别的地方,是把标准 DDIM 更新改成了按奇异方向逐坐标修正 。不是大刀阔斧重写采样器,而是在原来的 DDIM 上做轻量补丁,属于“保留骨架,只改关键关节”。
算法的核心逻辑可以概括成三步。先把 A 做 SVD,得到每个方向的可观测强度;再在每个时间步比较观测 SNR 和扩散 SNR,决定该方向属于哪一类;最后按类别分别更新。观测主导方向直接用测量构造一个与前向扩散边缘分布一致的辅助变量,再回填到采样里;先验主导方向沿着标准 DDIM 走,但会引入一个较小的随机性参数 η0 ;未观测方向也走 DDIM,不过随机性更大,用 η1 来鼓励在未知子空间里多探索一点。
这个设计最妙的地方在于,它没有把“观测”和“先验”粗暴地混成一锅粥。很多方法一上来就想把观测梯度、投影、去噪器全揉在一起,最后结果往往像在一台旧打印机上同时装了三套驱动:能跑,但谁都不太听话。Posterior-DDIM 则是把每个方向的职责划清楚了,工程实现上也更接近标准扩散采样器,复现门槛低很多。
图3中的实验超参数选择 也说明了这一点。作者专门研究了 η 的影响,发现 η1 增大通常会带来更稳的整体表现,而 η0 的微调收益相对有限,最好的经验设置往往是 η0=0,也就是更偏确定性的 DDIM 更新。这个结论很实在:不是所有地方都需要“更随机”,有些地方越稳越好,有些地方才需要多抖几下寻找后验空间。
理论护航:Posterior-DDIM的后验一致性证明
这篇论文最硬的一点,不是“效果不错”,而是作者真的把一致性证明做出来了。这里的关键词是posterior consistency ,中文就是“后验一致性”:当采样步数足够密、终止时间足够靠近 0、初始化足够接近高噪声极限时,算法输出的分布会收敛到真实后验分布。对扩散逆问题来说,这类结论很关键,因为它回答的不是“看起来像不像”,而是“统计上到底对不对”。
证明思路并不神秘,但很讲究。先把特殊情形拿下:当 A 的所有非零奇异值相同的时候,方向之间的结构最干净,算法分析也最容易闭合。作者先证明在这个设定下,只要 η0=1 ,而 η1 取到足够大,随着步长变细,输出分布就会逼近后验。随后再推广到一般奇异值不相等的情形,只需要对 prior-dominated 方向的更新做一个修正项,理论仍然成立。
这类证明的价值在于,它不是为了“写得更像论文”而证明,而是真的给出了一条可解释的路线:先把观测主导方向用正确的边缘分布锁住,再让其余方向按 DDIM 演化 。这样一来,采样器就不再是经验拼装,而是一个可追踪、可分析、可收敛的过程。对做理论的人来说,这比“调参调到起飞”更值钱;对做工程的人来说,这意味着出问题时至少知道该查哪一段。
不过也要客观一点:理论结论成立,前提是扩散先验是准确的 ,而且采样步数足够密。现实里这两个条件都不轻松。模型偏差、有限步数、数值误差、训练数据分布偏移,都会把“后验一致”这件事磨掉一层皮。所以这类结论更像方向盘,不是自动驾驶。方向对了,车才不容易跑偏;但路况差的时候,司机还是得盯着。
实验实证:全面领先的图像恢复性能
实验部分覆盖了四类典型图像恢复任务:inpainting 、super-resolution 、Gaussian deblurring 和 compressed sensing 。评估指标包括 PSNR、SSIM、LPIPS 和 FID。这个组合比较合理:前两个更偏像素和结构一致性,后两个更偏感知质量与分布质量,能避免“只在一个指标上耍聪明”。
作者还专门把不同方法的计算成本拉到同一个语境下比较。Posterior-DDIM 默认使用 100 次函数评估,而 DPS 需要 1000 次,这个差距已经很说明问题:有些方法不是不能用,而是太贵了,贵到像在修一张图时顺手把整栋楼的电表都转起来。Posterior-DDIM 的优势就在于,它尽量保持了标准 DDIM 的效率形态,没有把后验采样做成一个“算力黑洞”。
表4:CelebA 和 ImageNet 的 inpainting 主实验结果。这里可以直接看出,Posterior-DDIM 不只是“补得像”,而且在感知质量和结构一致性上都更稳。在 CelebA 随机掩码(50% 像素缺失)任务中,Posterior-DDIM 的 SSIM 达到 0.932,LPIPS 仅为 0.045,两项指标均优于所有对比方法。特别是在 LPIPS 上,Posterior-DDIM 比第二名低 15% 以上,说明其生成的图像在人类视觉感知上更自然。
从整体结果看,Posterior-DDIM 在大多数任务上都能拿到至少两项、很多时候三项以上指标的最优表现 。这件事的意义不只是“分数高”,而是说明它并没有靠单一指标刷存在感:PSNR、SSIM 说明恢复得准,LPIPS、FID 说明看起来也更自然。尤其在 inpainting 和 super-resolution 上,这种均衡优势更明显,说明按奇异方向分工的思路确实把观测与先验的矛盾处理得更细腻。
不过实验也暴露出一个现实问题:这套方法当前主要还是围绕线性逆问题 展开。只要测量模型能做 SVD 分解,方向分流就很自然;但一旦走到更复杂的非线性物理模型,或者测量算子结构不那么规整,这种按奇异方向切分的便利就会下降。换句话说,它很强,但强在“有结构”的问题上,不是对所有逆问题都能一把梭。
这一类结果最值得肯定的地方,是它把“理论上能证明”和“实验上能打”真正连起来了。很多论文要么理论像雕花,要么实验像赶工,能把两边都做扎实的不多。Posterior-DDIM 至少在当前材料里没有这个毛病:方法简洁,解释清楚,实验也没有掉链子。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“扩散模型做线性逆问题后验采样时,怎么既快又有理论保证”的问题。作者没有把观测和先验硬糊在一起,而是按奇异方向把采样拆开,观测强的方向优先信观测,观测弱的方向更多依赖先验。具体来说,它解决了三个核心痛点:第一,如何在不牺牲效率的前提下引入观测约束;第二,如何在不同信噪比条件下自适应地平衡观测和先验;第三,如何从理论上保证采样过程确实收敛到真实后验。
η0 和 η1 分别是什么意思? 它们是 DDIM 更新里的随机性参数。η0 用在“有观测但还不够硬”的方向上,通常设得更小;η1 用在“完全没观测”的方向上,通常设得更大,用来鼓励在未观测子空间里充分探索。从实验结果来看,η0 的最佳值通常是 0,即完全确定性的更新;而 η1 的最佳值在 0.8 到 1.0 之间,具体取值取决于任务类型和退化程度。这个参数设计体现了论文的核心思想:不同方向需要不同级别的随机性来平衡探索与利用。
为什么这篇工作说自己“可证明”很重要? 因为很多 diffusion posterior 方法能出图,但不一定真的在采后验。可证明的后验一致性意味着,随着步数和离散化足够细,算法输出不是“差不多像”,而是会收敛到真正的贝叶斯后验,这对医疗成像、科学重建这类场景尤其关键。例如,在 MRI 重建中,如果采样方法不能保证后验一致性,那么重建结果可能会产生系统性的偏差,从而影响诊断准确性。Posterior-DDIM 的理论保证为这类高风险应用提供了重要的可靠性基础。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把 posterior sampling 拆成奇异方向上的坐标级 DDIM 更新,这个切法不算炫技,但很聪明,属于“简单到让人后悔没早点想到”的那类创新。
实验合理度: ★★★★☆
任务覆盖面比较完整,指标也不单一,还专门分析了 η 和 NFE,说明作者知道效率和效果都要交代清楚。
学术研究价值: ★★★★★
不仅给了方法,还给了后验一致性证明,属于能给后续 diffusion inverse problem 研究提供理论坐标系的工作。
稳定性: ★★★★☆
在标准线性逆问题里逻辑清晰,更新规则也相对稳定;但对先验质量和采样步数仍有依赖,不能把它当成无脑即插即用的万能药。
适应性以及泛化能力: ★★★☆☆
对线性、可做 SVD 分解的问题很友好,但面对更复杂的非线性逆问题时,当前框架的直接迁移能力有限。
硬件需求及成本: ★★★★☆
相比一些重采样、重优化方法,它保持了 DDIM 的轻量感,100 NFE 的默认设置也比较克制,算力压力不算夸张。
复现难度: ★★★☆☆
方法结构不复杂,但要把 SVD 分方向更新、不同 η 的设置和各类基线对齐,还是需要一定工程细心;好在整体没有离谱的黑箱模块。
产品化成熟度: ★★★☆☆
在医学成像、去模糊、超分、补全这类线性或近线性场景里有落地潜力,但要先解决速度、先验偏差和泛化问题,才谈得上稳定部署。
可能的问题: 理论漂亮,但主要建立在线性逆问题和较强先验假设上;对非线性物理模型、真实噪声偏移和有限步数误差的鲁棒性,还需要更多验证。
主要参考文献
Yuchen Jiao, Na Li, Changxiao Cai, Yuxin Chen, Gen Li. Provable diffusion-based posterior sampling for linear inverse problems via DDIM. arXiv:2607.19333v1, 2026.
原文链接:https://arxiv.org/pdf/2607.19333v1.pdf
逆问题里的“信观测还是信先验”,这篇论文给了一个很干脆的答案。想继续看扩散模型、图像恢复、自动驾驶和大模型的硬核解读,欢迎加入 龙哥读论文 粉丝群,扫描二维码或加助手微信 kangjinlonghelper,备注“研究方向+地点+学校/公司+昵称”即可入群。