← 返回 PaperDaily 视觉与图像

哈佛最新研究:扩散模型分数函数被"拆穿",小波展开无需训练直接去噪

这篇论文把扩散模型里最"玄学"的分数网络,用小波基展开成了完全可解析的形式——不用梯度训练,闭式岭回归直接算出最优去噪器。更妙的是,三种相关性结构把"数据里哪些统计量最重要"变成了可量化的诊断工具。理解扩散模型内部机制,这篇值得一读。

哈佛最新研究:扩散模型分数函数被"拆穿",小波展开无需训练直接去噪

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Where the Score Lives: A Wavelet View of Diffusion
发表日期:
2026年6月
发表单位:
哈佛大学 Kempner 自然与人工智能研究所
原文链接:
https://arxiv.org/pdf/2606.08309v1.pdf
开源代码链接:
未提供
项目链接:
未提供
开源数据集链接:
未提供

扩散模型这两年是真火。从AI绘画到AI视频,背后几乎都是扩散模型在发力。但有个问题一直挺尴尬的:大家都用它,可它内部到底怎么工作的,尤其是那个负责"打分"的分数函数(score function),对很多人来说就是个黑箱。神经网络一波前向传播,出来个梯度方向,谁也不知道它内部到底关注了图像的什么特征。今天这篇来自哈佛大学Kempner研究所的论文,有点意思。作者用一个数学工具——小波变换,把扩散模型的分数函数"拆开"了,还拆出了闭式解。也就是说,不靠梯度下降,直接拿公式算,就能得到一个相当能打的去噪器。这个操作不仅让分数函数变得可解释,还给研究扩散模型的"创造性"来源提供了新视角。
先说清楚一个问题,扩散模型里那个"分数函数"到底是什么。简单理解,它就是指导"去噪"方向的导航仪。给定一张加了噪声的图片,分数函数告诉模型:往哪个方向调整,图片更接近真实数据分布。传统做法是用一个神经网络(比如U-Net、CNN)去逼近这个函数,训练过程就是梯度下降加反向传播,一顿操作猛如虎,但训练出来的网络内部表征却很难解读。

扩散模型的"黑箱"困境:分数函数到底学到了什么?

扩散模型的生成过程可以这样理解:先把一张干净图片逐步加噪声,直到变成一个纯噪声;然后训练一个网络,学习如何逆向"去噪"。这个逆向过程的核心就是估计分数函数——即对数概率密度关于输入图像的梯度。从数学上讲,分数函数告诉生成过程每一步应该朝哪个方向移动,才能让随机噪声收敛到有意义的图像。
问题在于,这个分数函数通常用一个深度神经网络来近似。CNN有平移等变的归纳偏置,U-Net有多尺度特征融合的能力,Transformer有全局注意力机制。不同的架构在相同数据集上训练,表现出的生成行为也各不相同。有些模型在训练集之外表现出惊人的"创造性",有些则只会机械地记忆训练样本。到底是什么因素导致了这些差异?是架构的归纳偏置?还是数据分布的统计特性?
图4:噪声状态可视化。从干净图像(左,σ=0)到高度噪声图像(右,σ=4)
噪声状态可视化。从干净图像(左,σ=0)到高度噪声图像(右,σ=4)
之前的研究尝试从不同角度回答这个问题。有的学者发现CNN的平移等变性会诱导一种"补丁马赛克"式的创造力;有的研究者证明当分数网络是线性的且具备平移等变性时,扩散模型学到的是数据的平稳高斯过程近似;还有人通过实验发现,不同架构在相同数据上训练后,生成样本的统计特性差异显著。但这些工作大多停留在现象描述层面,缺乏一个统一的数学框架来精确刻画分数函数的结构。
这篇来自哈佛大学Kempner研究所的工作,思路有点"反着来"的意味。作者不用神经网络去暴力拟合分数函数,而是把分数函数放在一个二维正交小波基下展开。小波这玩意儿有一个非常优雅的性质:它在空间和频率上同时具备局部化能力,特别适合描述图像这种既有平滑区域又棱角分明的信号。作者证明,在这种展开方式下,分数函数的每一个展开系数都可以写成数据分布矩的闭式函数——也就是说,不用梯度下降,不用反向传播,直接用训练数据的统计量就能算出最优的去噪方向。这个操作把扩散模型内部最"玄"的那部分,变成了一个看得见摸得着的数学对象。
更有意思的是,作者还设计了三种不同复杂度的小波系数相关性结构,用来诊断"数据分布中的哪些统计量对去噪真正重要"。独立模型假设每个小波系数各管各的,带耦合模型让同一位置三种方向的小波系数互相影响,局部耦合模型则进一步允许相邻位置的小波系数协同工作。实验结果给出了一个有点出人意料的结论:局部耦合最可靠,带耦合需谨慎。也就是说,跨方向的系数交互在低信噪比时反而可能帮倒忙,而跨位置的局部空间关联才是支撑去噪性能的关键因素。这个发现对于理解U-Net为什么好使、以及如何设计更高效的扩散模型架构,都有直接的参考价值。
整篇论文读下来,最让人印象深刻的还不是闭式解本身,而是它提供了一种"架构无关"的分析视角。不管你是用U-Net还是CNN,分数函数在数学上都是同一个对象;小波展开给了你一个通用的坐标系,可以在里面公平地比较不同架构到底各自抓住了数据的什么特征。这种"降维打击"式的分析思路,比堆一堆榜单数字要有意思得多。

小波展开:给分数函数一个可解析的"显微镜"

要理解这篇论文的巧妙之处,得先搞清楚小波基到底是个什么东西。小波(Wavelet)是一种数学函数,它可以像拼积木一样,通过伸缩和平移组合出各种各样的信号。和傅里叶变换只告诉你"某个频率分量有多大"不同,小波变换还能告诉你"这个频率分量在什么位置出现"。这种同时在频率和空间两个维度上定位的能力,让小波特别适合分析图像这种非平稳信号——图像的边缘、纹理、平滑区域,在小波域里会被分离到不同的尺度和方向子带上。
论文作者选用了Daubechies小波族。这是一种紧支撑正交小波,核心性质是:小波函数和尺度函数满足所谓的"两尺度关系",即父函数可以被自身的缩放平移版本线性组合出来。基于这个关系,可以构造出L²(R²)空间的一组标准正交基。在二维情形下,通过张量积可以得到一个尺度原子和三个方向细节原子——分别对应水平、垂直和对角方向的高频细节。小波系数在空间上是有序排布的,这跟卷积神经网络里特征图的排布方式非常相似。
图2:分数函数的小波展开示意
图2:分数函数的小波展开。给定图像X_t的分数函数可以用正交小波基展开,表示为一组系数c_i(X_t)与对应小波w_i的加权和。图中展示了在单个空间位置k上的小波原子,系数呈现为按空间排列的"特征图",空间位置的求和隐含在卷积算子中。
把分数函数在小波基下展开,数学上就是把一个复杂的向量场函数分解成一组正交分量。关键在于,作者没有像传统方法那样用神经网络直接学习这些展开系数,而是假设每个系数可以表示为图像小波系数的多项式函数。这样一来,整个分数函数估计问题就变成了一个线性回归问题——极小化均方误差的闭式解可以解析地写出来。
更关键的一步在下面的推导中。作者利用了Stein恒等式(Stein's Identity),这是统计学中一个非常经典的工具。它揭示了分数函数(对数密度梯度)和某个测试函数关于分布期望之间的关系:对某个光滑的向量场f(X)求散度再取期望,等价于分数函数与f的内积的相反数。这个恒等式把看似难以直接计算的分数函数与测试函数的内积,转化成了关于数据分布本身的期望——而后者只需要从训练数据中估计矩就能得到。换句话说,整个分数函数的估计问题,最终归结为计算数据分布的矩,矩可以样本均值来逼近,然后闭式地解出岭回归的最优权重。

三种相关性结构:从独立到局部耦合的递进诊断

小波展开给了作者一个"显微镜",但用什么放大倍率去观察还得自己定。自然图像在小波域里并不是随机的,系数之间存在多种统计依赖:不同尺度之间有幂律衰减关系,同一空间位置不同方向的系数会共同激活(比如边缘跨越了水平和垂直两个方向),相邻位置的系数沿着图像轮廓呈现空间连续性。论文的核心诊断工具,就是设计三种递进式的系数依赖结构,看看哪一种结构最能解释和逼近真实分数函数的行为。
第一种是独立模型(Independent)。它假设每个小波系数独立地被估计,不考虑任何跨系数或跨位置的交互。每个展开系数只用自己对应的小波系数的高次幂(直到D次)来预测。这种模型是"最坏情况"的基线:当噪声很大、数据分布接近各向同性高斯时,独立假设是合理的;而当噪声减小、图像结构开始显现时,独立模型会暴露出它无法利用跨系数结构的弱点。它的性能差距恰好度量了那些被忽略的依赖关系对去噪的贡献量。
第二种是带耦合模型(Band-tied)。在固定尺度和位置下,把水平、垂直、对角三个方向的小波系数放在一起考虑。每个展开系数不仅要看自己的值,还要看同位置其他两个方向的值。这个设计的灵感来自CNN和U-Net的通道混合机制:在网络的某一层,不同通道的特征在同一个空间位置被线性组合,本质上就是一种跨方向的信息整合。作者希望用这个模型来回答:仅仅在单一空间点上的跨方向交互,能不能解释U-Net在去噪上的优势?
第三种是局部耦合模型(Local-coupled)。在固定尺度和方向下,允许某个位置的系数依赖其空间邻域内其他位置的系数。邻域范围用一个Chebyshev半径r来控制——r=1表示只看上下左右对角八个邻居,r增大则感受野扩大。这个设计模仿了卷积滤波器的滑动窗口机制,也模仿了U-Net中逐渐增大的感受野。它回答的问题是:在去噪过程中,模型到底需要多少空间上下文信息才能做出正确的判断?
(a) 独立特征结构示意
(a) 独立特征结构:每个小波系数仅由对应位置的系数自身的多项式特征来预测,不引入跨系数或跨位置交互
(b) 带耦合与(c) 局部耦合结构示意
(b) 带耦合:同一位置三种方向的小波系数(水平、垂直、对角)互相影响;(c) 局部耦合:同一方向下相邻空间位置的小波系数产生交互
这三种结构放在一起,就构成了一套递进式的诊断工具。从独立到带耦合,增加的是同一位置不同方向的交互;从带耦合到局部耦合,增加的是不同位置之间的空间交互。任何一级模型相对于前一级的性能提升,都能直接归因于该级引入的那一类统计依赖。这种"控制变量法"在深度学习时代非常珍贵,因为神经网络训练充满了各种说不清的隐变量,你很难断言某个性能提升到底来自哪个机制。

闭式岭回归:无需梯度训练的可解释去噪器

把小波系数模型化为多项式特征之后,训练过程就不再有"梯度下降"什么事了。假设我们有一个带噪声的样本X_t,它的每个小波系数记为y,我们构造多项式特征向量φ(X_t)(比如包含y, y², y³这些项),然后用一个线性权重α来预测分数函数在小波基下的展开系数。目标函数是标准的均方误差加岭正则化。由于小波基是正交的,这个看似复杂的多输出回归问题可以完全解耦成每个小波基函数上的独立岭回归。
正则化可以这样理解:岭回归相当于给每个特征方向上的权重加了"价格"。数据方差大的方向,权重被压缩;数据方差小的方向,权重可以放宽。作者在论文里做了个几何解释:对特征协方差矩阵做特征分解,岭回归的解等价于沿着每个特征方向用1/(λ+γ)重新加权。λ小(低方差)的方向,网络倾向于放大修正;λ大(高方差)的方向,则倾向于压制。这与自然图像在小波域的"幂律衰减"特性高度一致——图像的结构信息集中在少部分大系数上,而噪声能量均匀分布在所有系数上。所以最优去噪器学会的其实就是:在低方差方向做"纠偏",在高方差方向做"稳住"。
这里必须提到一个关键的数学工具——Stein恒等式。它把看似需要知道不可观测的分数函数才能计算的期望,转换成了不需要知道分数函数的等价形式。具体来说,对于一个随机变量X服从分布p_t,如果f是一个光滑向量场且边界通量为零,那么E[s_t(X)·f(X)] = −E[∇·f(X)]。左边是我们希望的"以f为特征、对分数函数做投影"的量,右边则是完全可计算的函数散度。这个恒等式的应用直接让求解最优α变得可行,不需要对分数函数做任何中间估计。
最终的训练算法非常朴素。首先从干净数据中采样一批图像,按前向扩散过程在不同噪声水平t上加噪,得到一批X_t样本。然后对每个X_t做小波变换,计算多项式特征φ_i(X_t),以及φ_i的梯度与小波基w_i的内积。接着对每个系数i分别装配一个岭回归系统:左边是特征外积的样本均值加γI,右边是导出的矩向量。最后用闭式公式求出最优权重α。整个过程不需要迭代优化,不需要学习率调度,也不需要反向传播,只需要统计矩估计和矩阵求逆,所有计算都可以在CPU上快速完成。对于32x32的图像,这个过程只需几秒钟到几分钟,和训练一个深度神经网络动辄几小时甚至几天形成鲜明对比。
最终的求解公式如下。对每个小波基函数索引i,最优权重等于特征协方差矩阵(加上岭正则)的逆,乘以一个由Stein恒等式导出的矩向量。这个形式统一了所有三种相关性结构。
分数函数的小波展开公式
式(5):分数函数的小波展开。分数函数s^(t)(X_t)可以表示为无穷个小波基函数w_i的线性组合,组合系数c_i(X_t)是分数函数与小波基的内积。
对展开系数求梯度的公式
式(8):对展开系数α_i求梯度并令其为零。由于小波基的正交性,损失函数对每个α_i的梯度可以独立求解,互不干扰。
闭式解公式
式(15):最优展开系数的闭式解。α_i^(*)等于特征外积期望矩阵的逆乘以一个矩向量,后者由Stein恒等式从分数函数的内积转化为可计算的梯度散度期望。
这些闭式解的一个额外好处是:它们天然携带"可解释性"。每个小波系数上的最优权重α可以直接可视化,看出模型在不同尺度、不同方向、不同位置上更倚重数据的哪些统计特征。这对于分析扩散模型内部的"兴趣焦点"非常有帮助。
图3:小波系数的近似方式
图3:小波系数的近似方式。未知的真实系数c_i(X_t)被近似为特征φ_i(X_t)与参数α_i^(t)的内积。图中展示的是独立三次多项式特征。

实验结果:局部耦合最可靠,带耦合需谨慎

实验部分在MNIST数据集上进行,图像分辨率分别设置为32x32和64x64。之所以选MNIST,是因为这个数据集足够简单,可以把分数函数的统计特性看得比较清楚;同时又比合成数据更接近真实图像的分布结构。作者首先对比了三种相关性结构在不同噪声水平下的去噪均方误差(MSE)。
图5:MNIST-32上的去噪MSE对比
图5:MNIST-32上的去噪MSE对比。(a)独立多项式特征在不同次数(1、2、3)下的表现;(b)带耦合特征;(c)局部耦合特征;(d)多种训练的U-Net分数网络的表现对比。
图5揭示的规律相当清晰。独立模型在低噪声区域(σ较小时)表现尚可,但随着噪声增加,误差快速升高,说明它缺乏处理复杂图像结构的能力。带耦合模型在低信噪比区域反而出现了性能回退,某些设置下比独立模型更差。这个结果有点反直觉:理论上更多信息应该至少不损害性能,但由于带耦合引入了更多的参数、在有限样本下估计的混合矩方差变大,导致在高噪声区域过拟合。相比之下,局部耦合模型在所有噪声水平下都稳定地优于独立模型,且在低噪声区域优势明显。局部耦合是三种结构中最可靠的,带耦合则需要谨慎使用——它可能提升峰值性能,也可能在低信噪比区域拖后腿。
图6:MNIST-64上的去噪MSE对比
图6:MNIST-64上的去噪MSE。(a)独立特征;(b)带耦合。与图5相比,在更大图像上高次多项式更具优势。
分辨率从32提高到64之后,高次多项式带来的性能增益明显变大。这说明图像分辨率越高,分数函数的非线性程度越强,仅靠一阶线性逼近是不够的。小波基在更高分辨率下能够更充分地展现"多尺度"优势,因为不同尺度的图像特征被分离到不同的子带,每个子带上的统计建模更干净。
图7a:MNIST-32 线性基线与小波模型对比
(a) MNIST-32:线性基线与小波模型(D=3)的对比
图7b:MNIST-64 线性基线与小波模型对比
(b) MNIST-64:线性基线与小波模型(D=3)的对比。图7整体说明,在更大图像上小波分解显著优于线性基线,在较小图像上略有劣势。
一个更有意思的对比是,作者将最简单的一阶线性基线(即直接线性回归)与小波模型进行比较。在32x32的MNIST上,线性基线的表现竟然相当接近小波模型;但当分辨率提升到64x64时,小波模型的表现显著优于线性基线。这暗示在低分辨率下图像信息接近线性可分,而高分辨率下多尺度结构的重要性才真正凸显出来。
图9:独立模型去噪结果可视化
图9:独立多项式模型在不同图像尺寸(列)、不同噪声水平(每组3行)、不同多项式次数D下的去噪结果可视化。
在去噪结果的可视化图上,模型的性能差异变得更加直观。独立模型在低噪声水平下基本能恢复出数字的轮廓,但在高噪声区域则出现严重的结构模糊和伪影。带耦合模型在高噪声区域的输出质量明显下降,原本清晰的图像边缘变得破碎。而局部耦合模型在不同噪声水平下都保留了更完整的结构信息,特别是在图像的边缘和纹理细节方面表现突出。
图10:带耦合模型去噪结果可视化
图10:带耦合模型在32x32图像上、不同噪声水平(每组3行)、不同多项式次数D下的去噪结果。
在整体生成质量方面,作者还对比了不同配置的训练EDM扩散模型。从图11中可以观察到,U-Net的结构设计(深度、宽度、注意力层数量)对生成样本的风格和多样性有明显影响。这与小波模型所揭示的规律是一致的:不同的统计依赖结构会直接导致不同的生成行为。
图11:不同U-Net配置生成的MNIST样本
图11:不同U-Net-CNN EDM扩散模型生成的MNIST样本。每一行展示一个模型配置的输出,左起为不同配置的变体。

从理论到实践:对扩散模型架构设计的启示

这篇论文的最大价值不在于提出一个能打榜的新模型,而在于它提供了一个可解析的理论框架,让我们能从一个更高的视角审视扩散模型的架构设计。
第一个启示是,CNN在图像扩散模型中成功的原因可能比我们想象的更朴素。长期以来,人们把它归功于"平移等变性"这个高级的代数性质。但这篇论文的局部耦合实验暗示,真正关键的可能只是"感受野内的空间交互"——也就是模型在多大范围内聚合相邻信息来做去噪决策。小波模型没有显式的平移等变结构,但通过局部耦合就能逼近U-Net在低中噪声区域的性能。换句话说,U-Net的优势可能更多来自"局部处理"而非"对称性"。
第二个启示是,带耦合的负面结果提醒我们,通道混合并非越多越好。在很多Transformer化的扩散模型里,每个空间位置都会对全部通道做注意力加权,这种全局的跨通道交互在低信噪比阶段可能不仅仅是算力浪费,甚至可能成为噪声传播的通道。设计者或许应该在网络的早期阶段尽量限制通道间的信息混合,把全局交互推迟到信噪比更高的阶段。
第三个启示关于学习范式。小波模型不需要梯度训练就能匹配相当一部分U-Net的性能,说明当前大型扩散模型的许多能力可能来自数据本身的统计规律,而非网络的复杂架构。这给"知识蒸馏"和"模型压缩"提供了新的思路:也许可以用小波模型给深度网络做"软标签",把可解释的分数函数知识迁移到更高效的架构上。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?哈佛大学提出用小波基解析展开扩散模型分数函数,借助Stein恒等式将分数学习转化为闭式岭回归,无需梯度训练即可去噪。在MNIST上验证三种相关性结构,揭示局部耦合最可靠、带耦合锐化边缘但高噪声下MSE变差等规律。
这篇工作最值得看的点是什么?在MNIST-32和MNIST-64上,局部耦合模型在所有噪声水平下均优于独立基线;高阶多项式提升重建质量;与训练好的U-Net相比,在低到中等噪声水平下差距显著缩小,且无需梯度训练。
这篇工作的边界或风险在哪里?优点:(1) 提供可解析求解的分数函数参数化,无需梯度训练;(2) 通过三种结构化依赖族(独立、带耦合、局部耦合)提供可解释的moment-level诊断;(3) 对图像分辨率增加具有鲁棒性;(4) 闭式解使得计算高效。缺点:(1) 在MNIST-32上性能略逊于线性基线;(2) 带耦合在高噪声下MSE反而升高;(3) 仅测试了灰度图像,未扩展到RGB;(4) 与训练好的U-Net相比在高噪声水平下仍有明显差距。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将扩散模型的分数函数在小波正交基上展开,利用Stein恒等式将每个小波系数的学习转化为闭式岭回归问题,从而无需梯度训练即可获得可解释的分数估计器。

实验合理度:★★★★☆

均方误差(MSE),用于衡量去噪重建质量

学术研究价值:★★★★☆

将扩散模型的分数函数在小波正交基上展开,利用Stein恒等式将每个小波系数的学习转化为闭式岭回归问题,从而无需梯度训练即可获得可解释的分数估计器;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

每个噪声水平下只需一次闭式岭回归求解,计算复杂度主要取决于小波系数数量和特征维度;在MNIST-32上独立模型每个系数仅需D+1个特征(D=3时为4个),计算效率远高于训练神经网络。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 在MNIST-32上性能略逊于线性基线;(2) 带耦合在高噪声下MSE反而升高;(3) 仅测试了灰度图像,未扩展到RGB;

主要参考文献

[1] Finn E, Wang B, Keller T A, et al. Where the Score Lives: A Wavelet View of Diffusion[J]. arXiv preprint arXiv:2606.08309, 2026.
[2] Hyvärinen A. Estimation of non-normalized statistical models by score matching[J]. Journal of Machine Learning Research, 2005, 6(Apr): 695-709.
[3] Mallat S G. A theory for multiresolution signal decomposition: the wavelet representation[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 1989, 11(7): 674-693.
[4] Donoho D L, Johnstone J M. Ideal spatial adaptation by wavelet shrinkage[J]. Biometrika, 1994, 81(3): 425-455.
[5] Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models[J]. Advances in Neural Information Processing Systems, 2020, 33: 6840-6851.
[6] Song Y, Sohl-Dickstein J, Kingma D P, et al. Score-based generative modeling through stochastic differential equations[C]. International Conference on Learning Representations, 2021.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球