要把两个大热门架构绑在一起,不能靠嘴硬,得靠推导。论文的思路从扩散模型最基本的加噪过程出发:假设原始干净图像是 x₀,每往后面走一步就叠加一点高斯噪声,做 t 步之后,带噪图像和原始图像之间满足下面这个简洁关系:式中 α 是小于 1 的衰减系数,t 越大,原始信号占比 √(αᵗ) 越小,噪声占比 √(1-αᵗ) 越大。随着 t 趋向无穷,x_t 会几乎变成纯噪声。训练时,扩散模型就拿着无数个不同噪声程度的 x_t,让神经网络把原始的 x₀ 猜回来,损失函数是最朴素的均方误差。到这里还没有什么异常。真正的转折发生在“训练数据有限”这个条件上。如果训练集只有 D = {s₁, …, s_N} 这 N 张图,那么任意一个带噪输入 y 到底来自哪张干净图,本身就服从一个离散混合分布。把高斯噪声添加过程套进去,y 的概率密度可以写成:这个式子看起来复杂,意思却直白:y 可能是从任意一张训练图 s 加噪得到的,只是概率有高有低。扩散模型常用的另一种“得分函数”理论也能推出类似结果,本文不绕弯子,直接从 DDPM 的损失函数开刀。DDPM 的优化目标就是让模型输出的去噪结果尽量接近真实信号 s_i。如果网络被无限训练,对任意输入 y 而言,它最终会把损失压到理论极限。关键在于:这个理论极限是可以直接算出来的,根本不需要神经网络。固定 y 后,损失变成对所有训练样本按概率 p(y|s_i) 加权的凸优化问题,其最优解 z* 的梯度表达式清晰说明:把梯度置零,就能解出唯一最优去噪器:注意看分子分母(11)式的结构:每个训练样本 s_i 先算一个“y 和 s_i 距离有多大”的高斯核权重,然后对所有样本做加权平均。这已经是注意力的一半了——只不过密钥还是欧氏距离的指数项,而不是点积。接下来论文借了一个很常见的“能量近似”:在图像数据集里,大多数样本的总能量(即向量模长)都处在差不多的量级。当噪声方差 σ² 较小时,真正起作用的只有 y 附近那一小撮样本,它们模长近似相等的假设就更站得住。于是,把距离展开成平方项,模长部分在分子分母中相互抵消,优美的注意力公式就自己冒出来了:z* ≈ Attention { y, {s_i} },这里的 是向量内积。换句话说,当扩散模型把去噪网络训练到完美时,它对带噪输入 y 的最佳响应,就是对数据库中所有干净样本做一次 softmax 加权求和——这正是 Transformer 里自注意力层最核心的计算形态。更有意思的是,论文顺着这条线还顺手给 softmax 找到了“出身”。如果把数据库里的每个样本 s_i 换成都市独热编码 I_i,那么注意力公式算出来的结果恰好就是 softmax(y)。也就是说,softmax 并不是一个拍脑袋发明的激活函数,它本质上就是“从高斯噪声中最优恢复独热编码”的统计检测器,注意力、softmax、扩散模型在这一层完成了统一。扩散模型的实际采样是一个 σ 从大到小递减的迭代过程。论文画出了单个随机点在这个过程中的运动轨迹(图2):一开始 σ 很大,所有样本的权重都差不多,y 会被拉到数据集中心附近的平均点 M 附近;随着 σ 减小,距离差异开始被指数放大,y 逐渐向某个真实样本附近的高密度区域收敛,最后形成一个只包含少数近邻的稀疏组合。这个收敛曲线本身就解释了扩散模型为什么能“从一团噪声慢慢变成一张清晰图”。图2:随机点 y 在 σ 递减过程中通过逐步注意力计算收敛到稀疏解。M 是所有 s_i 的均值,起点 y 在 σ 很大的早期阶段会先经过 M 附近。
自编码器、注意力与流形投影的统一视角
光把扩散和注意力拉等号还不够刺激,论文还想再拉一个大家伙入伙——自编码器(AutoEncoder,AE)。现在主流扩散模型基本都是两段式结构:外面套一个 VAE 或类似的自编码器做图像和潜空间之间的转换,内部再嵌套一个带注意力模块的去噪网络。论文接下来要证明的是:自编码器和注意力本质上也在做同一件事。图3:自编码器结构示意。输入输出都是 m 维向量,中间压缩成 k 维的码层向量,瓶颈结构迫使模型学习数据的关键特征。先回忆一个经典假设:真实世界中的图像虽然生活在高维像素空间里,但有效的变化维度其实很低,它们聚集在一个低维数据流形附近。自编码器用瓶颈结构训练,本质上就是在估计这个数据流形。论文用一个很巧妙的局部线性化视角做了证明:自编码器的输入端维度 m,码层维度 k,那么在输入空间的局部区域里,至少存在 m-k 个扰动方向不会改变码层输出,这些方向构成一个局部零空间 N(s)。与之正交的 k 维子空间 M(s),就是自编码器估计出来的数据流形切平面。图4:当数据集足够稠密时,自编码器经过充分训练后可以沿着局部零空间走出一条弯曲路径,最终把一个偏离流形的输入 y 垂直投影回数据流形 F。那么注意力又是怎么跟数据流形扯上关系的?当 σ 足够小,注意力实际上只会激活 y 附近的 k 个近邻样本,这些近邻张成一个 k-1 维的仿射子空间。论文用几何分解证明:注意力对 y 的加权输出,等价于先把 y 正交投影到这个近邻样本张成的子空间上,再对子空间里的点做凸组合。换句话说,输入点在近邻方向以外怎么动,注意力结果都不变——这不就是自编码器局部零空间的翻版吗?图5:注意力几何示意。偏离数据流形 F 的点 y,会通过附近样本的仿射子空间被正交投影到流形上,输出结果同样落在数据流形附近。所以,注意力靠“softmax 加权近邻”,自编码器靠“瓶颈压缩加解码重建”,一个像查字典,一个像信息漏斗,但它们最终都在做同一件事:把任意输入投影回数据流形。三者差异主要在于计算资源分布的位置:自编码器把成本压在训练阶段,推理只是一次前向;注意力则完全不需要训练,所有代价都集中在测试阶段,需要在超长上下文中做海量点积。理解了这一点,后面的“偷懒”方案就顺理成章了。
下面是龙哥对于大家可能的一些问题的解答:这篇论文到底在解决什么问题?论文证明扩散模型在有限数据集上的最优去噪器本质上就是注意力机制,进而揭示扩散、注意力与自编码器在流形投影意义上统一。这篇工作最值得看的点是什么?在MNIST数据集上FID显著优于扩散模型(8.60 vs 19.30),在Fashion-MNIST和CelebA上FID与扩散模型相当(14.60 vs 13.00;32.15 vs 30.49),但在FFHQ数据集上FID明显逊于扩散模型(16.58 vs 8.60)。这篇工作的边界或风险在哪里?优点:1) 理论推导深入,揭示了扩散模型与注意力机制之间的数学等价性,具有较高的理论价值;2) 提出了一种无需训练内部去噪网络的轻量级生成算法,显著降低了计算复杂度和训练成本;3) 在多个数据集上验证了方法的有效性。缺点:1) 在高质量、复杂数据集(如FFHQ)上生成质量与扩散模型相比有明显差距;2) 方法依赖于潜空间近邻的质量和密度,对数据集要求较高;3) 理论推导中假设条件(如信号能量近似恒定、数据集足够稠密)在实际中可能不完全成立;4) 缺乏与更多最新生成方法的对比实验。如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
[1] F. Haddadi et al. Denoising Diffusion Generative Models Secretly Calculate Attentions. arXiv:2609.00885, 2026.[2] A. Vaswani et al. Attention Is All You Need. NeurIPS, 2017.[3] J. Ho, A. Jain, P. Abbeel. Denoising Diffusion Probabilistic Models. NeurIPS, 2020.[4] J. Song, C. Meng, S. Ermon. Denoising Diffusion Implicit Models. ICLR, 2021.[5] D. P. Kingma, M. Welling. Auto-Encoding Variational Bayes. ICLR, 2014.