← 返回 PaperDaily 视觉与图像

最新证明:扩散本质是注意力,免训去噪网络还快8.5倍

主流生成两座大山——扩散模型和Transformer注意力,这篇论文却用凸优化推出了一个有点反常识的结论:扩散模型的最优去噪解,本质上就是自注意力;Softmax也因此有了统计检测层面的解释。更实用的是,利用等价性可以跳过昂贵的去噪网络训练,直接基于近邻潜向量插值生成,单张耗时仅0.02秒、实现8.5倍加速。理论派和实践派都值得一读。

最新证明:扩散本质是注意力,免训去噪网络还快8.5倍
原论文信息如下:
论文标题:
Denoising Diffusion Generative Models Secretly Calculate Attentions
发表日期:
2026年9月
发表单位:
未明确提供
原文链接:
https://arxiv.org/pdf/2609.00885v1.pdf

如果要给过去五年的生成式AI排个座次,扩散模型大概率要坐在前排:从文生图到视频生成,它几乎是工业级产品的默认引擎。而另一边的Transformer,靠着注意力机制拿下了自然语言处理和视觉理解的大半江山。大家早就习惯了这样一种分工——扩散负责“造”,注意力负责“懂”。

但假如有篇论文跳出来告诉你,扩散模型在生成图像时,其实一直在偷偷计算注意力,而且这个等价关系还能帮你省掉一大截训练和推理成本,你会不会想停下来多看两眼?

这就是今天要聊的工作。作者从有限数据集训练场景出发,用最朴素的均方误差损失和Gaussian噪声假设,直接推导出了扩散模型最优去噪器的闭式解。结果发现,这个解的样子,和Transformer里的注意力公式长得几乎一模一样。

扩散模型竟然在偷偷计算注意力?

看到这个结论,很多人的第一反应大概是:又在强行拉郎配吧?一边是每天和随机噪声较劲的图像生成引擎,一边是抱着 Query、Key、Value 三个线性投影不撒手的序列建模工具,这俩怎么想都不该是一回事。
但如果把目光从“网络长什么样”挪到“网络到底在解什么数学题”上,画风就变了。现实中,扩散模型训练的素材永远是有限数据集。训练集再大,也不可能是整个像素空间连续分布;模型唯一见过的真实图像就是那一批样本。那它凭什么去生成“没见过”的新图?说白了,它只能在这些样本之间做组合、插值和迁移。
关键问题就变成:给一个带噪输入,模型按什么权重去组合训练样本?这个问题本质上是统计检测里的“从高斯噪声中恢复已知信号”。而本文用一步凸优化直接求出了最优解,发现答案的配方和 Transformer 里的注意力几乎一样:算相似度 → 送进 softmax → 对样本做加权求和。论文标题起得相当客气——扩散模型不是“长得像”注意力,而是一直在背地里偷偷计算注意力。
先看论文给出的几何直觉。下图里,s₁、s₂、s₃ 是训练时见过的真实信号,y 是采样阶段随机给的噪声输入。扩散模型的去噪器要回答的是“y 最可能是由哪些训练信号加噪来的”:
图1:扩散系统的几何示意图
扩散系统的几何示意。图中用 s₁、s₂、s₃ 三个训练信号说明问题,我们关心随机输入 y 的输出结果,可以证明它等于训练信号的注意力组合。

从数学上证明:扩散=注意力

要把两个大热门架构绑在一起,不能靠嘴硬,得靠推导。论文的思路从扩散模型最基本的加噪过程出发:假设原始干净图像是 x₀,每往后面走一步就叠加一点高斯噪声,做 t 步之后,带噪图像和原始图像之间满足下面这个简洁关系:
前向加噪公式
式中 α 是小于 1 的衰减系数,t 越大,原始信号占比 √(αᵗ) 越小,噪声占比 √(1-αᵗ) 越大。随着 t 趋向无穷,x_t 会几乎变成纯噪声。训练时,扩散模型就拿着无数个不同噪声程度的 x_t,让神经网络把原始的 x₀ 猜回来,损失函数是最朴素的均方误差。
到这里还没有什么异常。真正的转折发生在“训练数据有限”这个条件上。如果训练集只有 D = {s₁, …, s_N} 这 N 张图,那么任意一个带噪输入 y 到底来自哪张干净图,本身就服从一个离散混合分布。把高斯噪声添加过程套进去,y 的概率密度可以写成:
混合高斯分布公式
这个式子看起来复杂,意思却直白:y 可能是从任意一张训练图 s 加噪得到的,只是概率有高有低。扩散模型常用的另一种“得分函数”理论也能推出类似结果,本文不绕弯子,直接从 DDPM 的损失函数开刀。
DDPM优化目标
DDPM 的优化目标就是让模型输出的去噪结果尽量接近真实信号 s_i。如果网络被无限训练,对任意输入 y 而言,它最终会把损失压到理论极限。关键在于:这个理论极限是可以直接算出来的,根本不需要神经网络。固定 y 后,损失变成对所有训练样本按概率 p(y|s_i) 加权的凸优化问题,其最优解 z* 的梯度表达式清晰说明:
凸优化梯度推导
把梯度置零,就能解出唯一最优去噪器:
最优闭式解公式
注意看分子分母(11)式的结构:每个训练样本 s_i 先算一个“y 和 s_i 距离有多大”的高斯核权重,然后对所有样本做加权平均。这已经是注意力的一半了——只不过密钥还是欧氏距离的指数项,而不是点积。
接下来论文借了一个很常见的“能量近似”:在图像数据集里,大多数样本的总能量(即向量模长)都处在差不多的量级。当噪声方差 σ² 较小时,真正起作用的只有 y 附近那一小撮样本,它们模长近似相等的假设就更站得住。于是,把距离展开成平方项,模长部分在分子分母中相互抵消,优美的注意力公式就自己冒出来了:
扩散等于注意力公式
z* ≈ Attention { y, {s_i} },这里的 是向量内积。换句话说,当扩散模型把去噪网络训练到完美时,它对带噪输入 y 的最佳响应,就是对数据库中所有干净样本做一次 softmax 加权求和——这正是 Transformer 里自注意力层最核心的计算形态。
更有意思的是,论文顺着这条线还顺手给 softmax 找到了“出身”。如果把数据库里的每个样本 s_i 换成都市独热编码 I_i,那么注意力公式算出来的结果恰好就是 softmax(y)。也就是说,softmax 并不是一个拍脑袋发明的激活函数,它本质上就是“从高斯噪声中最优恢复独热编码”的统计检测器,注意力、softmax、扩散模型在这一层完成了统一。
softmax等价注意力公式
扩散模型的实际采样是一个 σ 从大到小递减的迭代过程。论文画出了单个随机点在这个过程中的运动轨迹(图2):一开始 σ 很大,所有样本的权重都差不多,y 会被拉到数据集中心附近的平均点 M 附近;随着 σ 减小,距离差异开始被指数放大,y 逐渐向某个真实样本附近的高密度区域收敛,最后形成一个只包含少数近邻的稀疏组合。这个收敛曲线本身就解释了扩散模型为什么能“从一团噪声慢慢变成一张清晰图”。
图2:随机点收敛到稀疏解的过程
图2:随机点 y 在 σ 递减过程中通过逐步注意力计算收敛到稀疏解。M 是所有 s_i 的均值,起点 y 在 σ 很大的早期阶段会先经过 M 附近。

自编码器、注意力与流形投影的统一视角

光把扩散和注意力拉等号还不够刺激,论文还想再拉一个大家伙入伙——自编码器(AutoEncoder,AE)。现在主流扩散模型基本都是两段式结构:外面套一个 VAE 或类似的自编码器做图像和潜空间之间的转换,内部再嵌套一个带注意力模块的去噪网络。论文接下来要证明的是:自编码器和注意力本质上也在做同一件事。
图3:自编码器结构示意图
图3:自编码器结构示意。输入输出都是 m 维向量,中间压缩成 k 维的码层向量,瓶颈结构迫使模型学习数据的关键特征。
先回忆一个经典假设:真实世界中的图像虽然生活在高维像素空间里,但有效的变化维度其实很低,它们聚集在一个低维数据流形附近。自编码器用瓶颈结构训练,本质上就是在估计这个数据流形。论文用一个很巧妙的局部线性化视角做了证明:自编码器的输入端维度 m,码层维度 k,那么在输入空间的局部区域里,至少存在 m-k 个扰动方向不会改变码层输出,这些方向构成一个局部零空间 N(s)。与之正交的 k 维子空间 M(s),就是自编码器估计出来的数据流形切平面。
图4:自编码器沿局部零空间投影到数据流形
图4:当数据集足够稠密时,自编码器经过充分训练后可以沿着局部零空间走出一条弯曲路径,最终把一个偏离流形的输入 y 垂直投影回数据流形 F。
那么注意力又是怎么跟数据流形扯上关系的?当 σ 足够小,注意力实际上只会激活 y 附近的 k 个近邻样本,这些近邻张成一个 k-1 维的仿射子空间。论文用几何分解证明:注意力对 y 的加权输出,等价于先把 y 正交投影到这个近邻样本张成的子空间上,再对子空间里的点做凸组合。换句话说,输入点在近邻方向以外怎么动,注意力结果都不变——这不就是自编码器局部零空间的翻版吗?
图5:注意力机制的几何投影示意
图5:注意力几何示意。偏离数据流形 F 的点 y,会通过附近样本的仿射子空间被正交投影到流形上,输出结果同样落在数据流形附近。
所以,注意力靠“softmax 加权近邻”,自编码器靠“瓶颈压缩加解码重建”,一个像查字典,一个像信息漏斗,但它们最终都在做同一件事:把任意输入投影回数据流形。三者差异主要在于计算资源分布的位置:自编码器把成本压在训练阶段,推理只是一次前向;注意力则完全不需要训练,所有代价都集中在测试阶段,需要在超长上下文中做海量点积。理解了这一点,后面的“偷懒”方案就顺理成章了。

无需训练去噪网络:基于近邻插值的极速生成

如果扩散模型的最优去噪器真的就是注意力组合,那为什么还要花天价算力去训练一个 U-Net 或 DiT 去逼近这个组合?直接把这个组合算出来不就行了?这正是论文提出的低复杂度生成框架。
当然,直接在原始像素空间做近邻搜索并不现实。这里的实操玩法是:用训练好的外层自编码器,把整个训练集图像压缩到低维潜空间,得到潜变量码本;生成时,先构造一个随机潜变量作为查询,在潜空间码本里找出离它最近的若干个图(这里又称“树交叉注意力”,Tree Cross Attention),用 softmax 权重插值出最终潜变量,再交给外层解码器还原成图像。整个过程把原来几百上千步的神经网络去噪循环,替换成了一次查询加若干次轻量编码解码。
图6:本文提出的基于注意力的生成架构
图6:本文提出的基于注意力的生成架构。图像先经过自编码器编码进入潜空间,在潜变量码本中做近邻注意力组合,再经解码器还原;必要时还可以把生成结果再编码送回,做几次流形投影修正。
有人会担心:直接在码本里遍历计算注意力,复杂度不是跟着数据集大小线性涨吗?对图片这种动辄百万量级的库来说,依然很贵。论文给出的回应是“树交叉注意力”:把码本按相似度组织成树结构,新查询只需要在每一层比较少量分支,就能锁定自己所在的高相似区域,复杂度从 O(|D|·d) 降到 O(log|D|·d)。可以说,训练要省,推理也要省,两头都算得明明白白。
这套方案在图7中得到了直观的可视化验证。论文在 FFHQ 人脸数据集上展示了一个查询向量对应的 Top-3 近邻空间注意力权重图:不同近邻被激活的位置并不一样,有的重点贡献眼睛区域,有的贡献头发区域,这恰好模拟了“生成一张人脸时,不同训练样本在不同空间位置分别给出‘参考答案’”的语义。这个结果让扩散去噪过程的注意力本质显得非常具体。
图7:FFHQ数据集上Top-3近邻的空间注意力权重图
图7:FFHQ 数据集上查询潜变量的 Top-3 近邻空间注意力权重图。每张热度图展示了对应近邻图像的空间贡献范围,说明不同样本会负责生成结果的不同区域。

实验结果:质量与速度的权衡

理论讲得再漂亮,最终还是要看生成效果。论文在一系列常见图像数据集上做了验证,包括 FFHQ、CelebA、MNIST 和 Fashion-MNIST。评价指标用的是 FID(Fréchet Inception Distance),它统计生成图像集合与真实图像集合在深层特征分布上的距离,值越低,说明生成分布越接近真实分布。
为了让对比尽量公平,论文先给定了几组基线扩散模型的训练配置和使用配置。下表展示了基线模型 DiffAE、DDPM、DDIM 在实验中的具体设置:
表I:基线扩散模型的训练配置
表I:基线扩散模型的训练与架构配置。从数据、步数到网络结构都列出细节,方便读者复现对照。
相对应地,论文也给出了本文提出的潜空间近邻生成模型的完整配置:
表II:本文提出的潜空间模型架构与训练配置
表II:本文提出的潜空间近邻插值模型架构与配置。该表同时衔接后续表III的定量结果,说明不同模块的具体实现方式。
表III给出基线模型和本文方法在不同数据集上的 FID 定量对比结果。可以看到,在完全不训练额外去噪网络的前提下,本文方法的 FID 和基线模型处于同一水平量级。必须强调,这里没有进行全库绝对数值排名,因为不同数据集的采样设置与验证协议可能存在差异;而从趋势看,本文方法最大的优势不是把 FID 压到极限,而是在基本守住生成质量的同时,砍掉了绝大部分训练与采样开销。
表III:基线方法与本文方法FID定量对比
表III:基线方法与本文方法的 FID 定量对比结果。不同数据集上的具体差异以论文原表为准,需要特别说明的是,当前无法直接与 PaperDaily 已收录论文中的同基准最优数值做严格硬比,因为各设置的训练与采样协议不尽相同。
既然提出了近邻插值方案,σ 和 Top-K 这两个超参数自然值得好好调一调。消融实验同样在 FFHQ 数据集上完成,表格展示了不同 σ 和不同近邻数量 K 对采样结果的影响。σ 控制着注意力权重的锐利程度,K 控制着参与插值的样本数量。K 太小,单一近邻的主导性太强,生成结果容易退化成“照抄”某一张训练图;K 太大,大量低权重样本混进来,图会变得模糊。两个参数需要小心配合,才能让人脸生成在清晰度和多样性之间找到平衡点。
表IV:FFHQ数据集上σ和Top-K设置的消融实验
表IV:本文采样方法在 FFHQ 数据集上不同 σ 与 Top-K 设置的消融研究。
定量之外,论文提供了大量定性可视化结果。图8按行展示查询图、生成结果和从潜空间里检索到的 Top-3 近邻,可以清楚地看出生成结果并非直接复制某个近邻,而是在三个近邻的“中间地带”生成的合法新样本。这种性质很接近扩散模型应有的组合创造力。
图8:FFHQ、MNIST与Fashion-MNIST上的定性对比
图8:FFHQ、MNIST 和 Fashion-MNIST 上的定性对比。每行从左到右依次为查询图像、生成图像、潜空间检索出的 Top-3 近邻图像。
图9和图10分别展示了 FFHQ 64×64 和 CelebA 128×128 分辨率下的批量生成样本。人脸五官姿态各异、肤色发型覆盖范围不小,说明这套轻量级框架并不是只能在玩具数据上自嗨,在真实人脸分布上也能生成出具备足够多样性的结果。
图9:FFHQ 64×64生成样本展示
图9:FFHQ 64×64 分辨率下的生成样本。
图10:CelebA 128×128生成样本展示
图10:CelebA 128×128 分辨率下的生成样本。
从速度角度看,论文在生成阶段省去了反复调用网络的计算链。结合此前已公开的实验描述,这套方案可以将单张图像的生成时间压到约 0.02 秒,相比常规扩散采样获得约 8.5 倍的加速。相比 FID 几个点的此消彼长,这种计算开销上的数量级差异才是真正具备工程吸引力的地方。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?论文证明扩散模型在有限数据集上的最优去噪器本质上就是注意力机制,进而揭示扩散、注意力与自编码器在流形投影意义上统一。
这篇工作最值得看的点是什么?在MNIST数据集上FID显著优于扩散模型(8.60 vs 19.30),在Fashion-MNIST和CelebA上FID与扩散模型相当(14.60 vs 13.00;32.15 vs 30.49),但在FFHQ数据集上FID明显逊于扩散模型(16.58 vs 8.60)。
这篇工作的边界或风险在哪里?优点:1) 理论推导深入,揭示了扩散模型与注意力机制之间的数学等价性,具有较高的理论价值;2) 提出了一种无需训练内部去噪网络的轻量级生成算法,显著降低了计算复杂度和训练成本;3) 在多个数据集上验证了方法的有效性。缺点:1) 在高质量、复杂数据集(如FFHQ)上生成质量与扩散模型相比有明显差距;2) 方法依赖于潜空间近邻的质量和密度,对数据集要求较高;3) 理论推导中假设条件(如信号能量近似恒定、数据集足够稠密)在实际中可能不完全成立;4) 缺乏与更多最新生成方法的对比实验。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

通过理论推导证明扩散模型的去噪过程在闭式解上等价于注意力机制,并据此提出一种无需训练内部去噪网络、仅基于潜空间近邻插值与空间注意力融合的低复杂度图像生成算法。

实验合理度:★★★★☆

FID(Fréchet Inception Distance)

学术研究价值:★★★★☆

通过理论推导证明扩散模型的去噪过程在闭式解上等价于注意力机制,并据此提出一种无需训练内部去噪网络、仅基于潜空间近邻插值与空间注意力融合的低复杂度图像生成算法;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在FFHQ数据集上生成一张图像,扩散方法需要0.17秒,而所提方法仅需0.02秒,实现了8.5倍的加速。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1) 在高质量、复杂数据集(如FFHQ)上生成质量与扩散模型相比有明显差距;2) 方法依赖于潜空间近邻的质量和密度,对数据集要求较高;

主要参考文献

[1] F. Haddadi et al. Denoising Diffusion Generative Models Secretly Calculate Attentions. arXiv:2609.00885, 2026.
[2] A. Vaswani et al. Attention Is All You Need. NeurIPS, 2017.
[3] J. Ho, A. Jain, P. Abbeel. Denoising Diffusion Probabilistic Models. NeurIPS, 2020.
[4] J. Song, C. Meng, S. Ermon. Denoising Diffusion Implicit Models. ICLR, 2021.
[5] D. P. Kingma, M. Welling. Auto-Encoding Variational Bayes. ICLR, 2014.

融会贯通

把这篇论文放进 PaperDaily 已有的扩散模型研究版图里看,会发现它走了一条不太一样的路线:多数工作努力把扩散模型的质量再往上推、采样步数再往下降,而这篇论文直接去“抄底”扩散模型的理论根基,用注意力关系统一了三座大山。理论上足够漂亮,实践上给出了一个不需要训练内部去噪网络的近邻注意力生成方案。结合 PaperDaily 已收录的其他同数据集结果来看,本文在不同基准上的绝对 FID 数值优势并不算明显,甚至可能因设置不同而出现波动,因此更合适的定位是“以计算复杂度的大幅下降换取可比生成质量”——这个 trade-off 对真实部署场景有着极强的吸引力。
未来沿着这个方向,值得关注的有三个延伸:一是把近邻注意力码本扩展到更大规模、更细粒度的多模态数据,看看“插值生成”的上限在哪里;二是结合聚类和哈希技术,进一步压榨树交叉注意力的检索成本;三是利用“注意力闭式解”的统计意义去指导新一代高效去噪网络设计。对做工程的朋友来说,这套思路带来一个直接启发:有时候与其把网络越训越大,不如先问一句——我要解的那个数学问题,是不是早就存在闭式解了。

end
扩散=注意力,生成快到飞起!
看完这篇理论+加速双开的解读,想不想来群里和龙哥一起拆更多顶会论文?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像生成+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,扩散模型同好都在等你~
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。