← 返回 PaperDaily 视觉与图像

NeurIPS 2026新作:扩散模型换个散度,30%污染下FID直降15点

扩散模型最怕的不是算力,而是数据里混进来的“脏样本”。这篇论文很实在:不改大结构,只把去噪损失换成散度诱导的加权形式,就把鲁棒性做出来了。

NeurIPS 2026新作:扩散模型换个散度,30%污染下FID直降15点
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
扩散模型最怕的不是算力,而是数据里混进来的“脏样本”。这篇论文很实在:不改大结构,只把去噪损失换成散度诱导的加权形式,就把鲁棒性做出来了。


原论文信息如下:
论文标题:
Robust Diffusion Models via Divergence-Induced Weighted Denoising
发表日期:
2026年06月
发表单位:
LunarAI LLC; Temple University
原文链接:
https://arxiv.org/pdf/2606.22521v1.pdf

扩散模型也怕“毒数据”:标准MSE训练为何在数据污染下失效?

扩散模型这几年很风光,但它有个很现实的软肋:训练数据一脏,生成质量就容易跟着“跑偏”。原因并不玄乎,标准扩散训练本质上是在做去噪回归,常见做法是对每个样本一视同仁地最小化均方误差(MSE)。这在干净数据上没问题,可一旦混进模糊、噪声、局部破坏甚至异常分布的样本,模型还是照单全收,结果就是坏样本也能拿到和好样本一样的梯度话语权。
这篇论文盯住的就是这个老问题:不是扩散模型不够强,而是训练目标太“老实”。坏样本在MSE下不会自动被识别出来,反而会持续污染优化方向。论文提出的思路很直接:别再让所有样本平等发言了,给损失函数加一个“筛子”,让大误差样本自动降权。
封面
封面:30%污染下,NED在CIFAR-10上把FID压得更稳,说明“换个损失”这件事在扩散模型里不是小修小补,而是能真刀真枪改善鲁棒性的。

救命稻草:从f-散度出发,用梯度权重“屏蔽”坏样本

这篇论文的核心,不是发明了一个全新的扩散框架,而是把训练目标从“固定MSE”改成了由 f-散度(f-divergence)诱导的非线性损失。f-散度可以理解为一类衡量两个分布差异的方法,KL散度、Hellinger散度、负指数散度(Negative Exponential Divergence,NED)都属于这类家族。
论文把扩散模型每一步的去噪误差,改写成一个标量 mismatch mt,再把原来的线性损失 mt 替换成 hG(mt)。这里的 G 就是散度生成函数,hG 则是它诱导出来的局部散度映射。更直白一点说,不再让误差越大、话语权越大,而是让“离谱样本”自动降权
这套东西最妙的地方在于,它不是拍脑袋做鲁棒损失,而是从散度理论里推出来的。标准MSE对应 KL 散度;Hellinger 散度会带来指数型权重;NED 则会进一步压制高误差样本。于是训练过程就像多了个“样本门卫”,谁太离谱,谁就少说话。

理论根基:高斯反向核下的对数正态似然比与局部条件散度

论文的理论部分,真正的巧劲在于把扩散模型每一步的反向高斯核拿出来分析。由于 DDPM 的反向过程通常是高斯分布,论文证明了每一步的似然比会服从一个对数正态分布,而这个分布只由一个标量 mismatch 决定。这个结论很关键,因为它把原本高维、复杂的路径问题,压缩成了一个一维标量函数问题。
论文里有个核心想法:先把数据分布和模型分布的边缘散度,提升到路径空间上做上界分析。这样做的好处是,虽然边缘分布本身不好算,但路径空间里每一步的局部差异可以拆开处理。再结合高斯反向核的结构,最终得到一个局部条件散度目标:每一步都对应一个标量散度,最后把它们加起来,形成训练目标。
表1:三种经典散度的局部映射与影响力权重
表1:三种经典散度的局部映射与影响力权重。这里的 Um 是 Lemma 2.1 里定义的对数正态似然比,h′G(m) 可以理解成“样本梯度权重”。KL 的权重恒为 1,Hellinger 和 NED 则会随着 mismatch 增大快速衰减。
这部分理论推导看起来有点“数学洁癖”,但它不是为了炫技。它真正解决的是:为什么一个简单的非线性权重,能在扩散训练里稳定地压制脏样本。答案就是,权重不是随便拍出来的,而是由散度的导数自然给出的影响函数,和鲁棒统计里的 M-estimation 很像。
如果把这件事翻译成人话:模型不是不学习,而是对“看起来不太对劲”的样本少学一点。在污染数据场景里,这种少学一点,往往就是救命的一点。

三大散度的“影响力武器”:Hellinger vs. NED vs. KL,谁更抗造?

论文里比较了三种代表性选择:KL、Hellinger(HD)和 NED。KL 最“老实”,权重恒定,谁来都一样;HD 开始有了鲁棒意识,对大误差样本做指数衰减;NED 则更狠一点,在同样的指数衰减基础上还带有更强的抑制项。论文的结论很明确:越是污染严重,越需要这种会挑样本的损失
图2:KL、HD 和 NED 的影响力权重对比
图2:KL、HD 和 NED 的影响力权重对比。KL 的权重是一条直线,意思是“全员平等”;HD 和 NED 都会随着 mismatch 增大而快速下降,其中 NED 更激进,说明它对异常样本的容忍度更低,也更适合脏数据场景。
这里最值得注意的是:论文并没有把“鲁棒”理解成简单的剪裁或 Huber 替换,而是把鲁棒性和散度结构绑定起来。这样做的好处是,修改目标函数时不需要额外设计一堆启发式阈值,理论上也更容易解释。坏处也有:NED 的权重需要数值积分近似,不像 KL 那样一行公式写完就能跑。
图6:标准鲁棒损失与散度诱导目标的FID退化对比
图6:标准鲁棒损失与散度诱导目标的FID退化对比。NED 在污染从干净到 30% 的过程中退化最少,说明这种“散度诱导的权重”比单纯的 Huber 或 clipped MSE 更能扛住脏样本冲击。

实验结果:30%污染下FID狂砍15点,鲁棒性显著提升

实验设置很克制:同样的 DDPM U-Net、同样的训练步数、同样的采样器,唯一变化就是损失函数。这样做的好处是,结果归因很干净,基本可以把性能差异直接归到“散度诱导的加权方式”上,而不是架构、训练策略或者采样器偷跑。
表2:CIFAR-10 在不同污染比例下的FID结果
表2:CIFAR-10 在不同污染比例下的 FID 结果。干净数据时三者差距不大,符合理论里“低 mismatch 区间几乎等价”的判断;但污染一上来,KL 的 FID 明显恶化,NED 则更稳。尤其在 30% 污染下,NED 从 93.0 降到 77.5,直接少了 15.5 个点。
更值得注意的不是均值,而是方差。论文报告里,HD 和 NED 的跨随机种子波动明显更小,说明它们不只是“平均分更高”,而是训练过程本身更稳。对于生成模型来说,这点很现实:如果模型每次训练都像抽盲盒,工程上很难放心上线。
图4:不同污染水平下三种方法的FID箱线图
图4:不同污染水平下三种方法的 FID 箱线图。HD 和 NED 的箱体更窄,说明结果更集中、训练更稳定;KL 的波动更大,典型表现就是“今天能跑,明天也能跑,但跑出来像不像就看天意”。
和标准鲁棒损失比,散度诱导目标也占了便宜。论文在 CIFAR-10 上对比了 Huber 和 clipped MSE,结果显示在中高污染场景下,HD 和 NED 明显更强。这个结论挺有意思:传统鲁棒损失并不是没用,而是它们是从“回归损失修补”的思路出发;而这里的办法,是从扩散训练的概率结构里直接长出来的,路线更对口。
表3:散度诱导目标与标准鲁棒损失的对比
表3:散度诱导目标与标准鲁棒损失的对比。可以看到,在 20% 和 30% 污染时,HD 和 NED 明显优于 Huber 与 clipped MSE,说明“仅做阈值裁剪”并不足以解决扩散训练中的污染问题。
图5:30%污染下生成样本可视化对比
图5:30%污染下生成样本可视化对比。KL 的样本里能看到比较明显的脏块和马赛克痕迹,而 HD 和 NED 生成的图像更干净。这个视觉结果和 FID 的趋势是一致的,不是“指标好看,眼睛难看”的那种虚假进步。
再看 CIFAR-100,结论也没翻车。论文给出的结果表明,NED 在污染场景下同样能把 FID 压下来,说明这种方法不是只在 CIFAR-10 上“碰巧灵”。虽然这里依旧是小模型、小步数、控制实验,但至少证明了一个方向:扩散模型的鲁棒性,确实可以通过损失函数结构被系统性改善
表4:CIFAR-100上的FID结果
表4:CIFAR-100 上的 FID 结果。虽然绝对数值仍受模型规模和训练预算影响,但 NED 在污染下依然保持优势,说明方法具有一定跨数据集一致性。

实操指南:仅改一行代码,即可轻松为你的扩散模型“上保险”

这篇论文最适合工程同学的地方,就是改动非常小。它不是那种“理论很美,代码要重写一遍”的工作,而是把原本的 MSE 损失替换成 hG(mt),或者等价地,在反向传播时给每个样本乘上一个由 h′G(mt) 决定的权重。
如果做成伪代码,大概就是这个意思:
    输入:训练数据 D、散度生成函数 G、噪声日程 {βt}
    初始化:扩散去噪网络 εθ
    
    重复直到收敛:
    1. 从数据集中采样 x0,随机采样时间步 t,采样高斯噪声 ε
    2. 按照扩散前向过程构造 xt
    3. 计算去噪残差对应的 mismatch:mt = wt · ||ε - εθ(xt, t)||²
    4. 根据散度选择影响力权重:
       - KL:h′G(mt) = 1
       - Hellinger:h′G(mt) = exp(-mt / 4)
       - NED:用数值积分近似 h′G(mt)
    5. 用 h′G(mt) 重新缩放梯度,更新 θ
    表面上只是“换个损失函数”,实际上等于给扩散模型加了一个样本级别的自适应过滤器。这类改法的优点是部署门槛低,原有训练框架基本不用动;缺点也很现实:NED 需要做数值积分,虽然论文测得额外开销很小,但在极端高吞吐训练里,工程团队还是会关心这个细节。
    如果只看结论,这篇论文其实很朴素:扩散模型不是不能抗脏数据,而是需要把“样本该不该信”这件事写进目标函数里。它没有靠更大的模型、更复杂的采样器,也没有堆一堆花里胡哨的 trick,而是从概率散度出发,把鲁棒性做成了一个可解释、可复现、可落地的小改动。这个思路,挺硬。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:

    这篇论文到底解决了什么问题?它解决的是扩散模型在数据污染下训练不稳的问题。标准MSE会把坏样本和好样本一视同仁,论文则通过 f-散度诱导的加权损失,让高误差样本自动降权,从而提升鲁棒性。

    Hellinger、NED、KL 这几个名字分别是什么意思?KL 是 Kullback–Leibler 散度,最常见也最“平均主义”;Hellinger 散度是更偏鲁棒的一类 f-散度,会对大误差样本做指数衰减;NED 是 Negative Exponential Divergence,中文可译为负指数散度,论文里它的抑制更强,适合污染更重的场景。

    为什么说它“只改一行代码”也能起作用?因为训练框架、网络结构、采样器都没变,变的只是损失函数的形式。原来是对每个样本的 MSE 直接求和,现在是先通过 hG 把误差映射成更平滑的目标,再用导数 h′G 控制梯度权重,所以本质上是“训练时少信坏样本一点”。

    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆

    把鲁棒统计里的散度思想搬进扩散训练,思路不算凭空造新词,但落点很准,而且把“样本权重”解释得很自然。

    实验合理度:★★★★☆

    控制变量做得比较干净,架构和训练预算一致,只改损失函数,能比较清楚地看到鲁棒性收益。

    学术研究价值:★★★★☆

    它把扩散训练和 f-散度、影响函数、鲁棒估计连起来了,后续做更一般的鲁棒生成建模时,这条线很有参考价值。

    稳定性:★★★★☆

    HD 和 NED 在实验里更稳,说明方法确实能压住污染带来的波动;但对极端脏数据和更大规模训练的稳定性,还需要更多验证。

    适应性以及泛化能力:★★★☆☆

    思路本身通用,但目前主要还是在 CIFAR 级别验证;换到大模型、大数据、复杂条件生成任务时,效果还不能直接拍胸脯。

    硬件需求及成本:★★★★☆

    HD 额外开销几乎可以忽略,NED 需要数值积分,但论文里说总开销很小,属于“值得为鲁棒性付一点小钱”。

    复现难度:★★★☆☆

    思路简单,但 NED 的数值近似、污染构造和训练细节要对齐,才能复现实验中那种比较稳定的收益。

    产品化成熟度:★★★☆☆

    适合“训练数据可能不干净”的生成场景,尤其是数据采集成本高、清洗不彻底的业务;但要进生产,还得看更大规模和更多任务上的稳定性。

    可能的问题:方法主要在小规模图像扩散上验证,NED 还依赖数值积分,且对“污染类型更复杂、任务更大”的场景是否同样有效,还缺更强证据。


    主要参考文献

    Lei Li, Yuexiao Dong. Robust Diffusion Models via Divergence-Induced Weighted Denoising. arXiv preprint, 2026.
    Jonathan Ho, Ajay Jain, Pieter Abbeel. Denoising Diffusion Probabilistic Models. NeurIPS, 2020.
    Ayanendranath Basu, Sahadeb Sarkar, A. N. Vidyashankar. Minimum Negative Exponential Disparity Estimation in Parametric Models. 1997.
    Frank R. Hampel et al. Robust Statistics: The Approach Based on Influence Functions. 1986.

    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

    end
    扩散模型不怕训练,怕的是“脏数据”悄悄混进来。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,一起把去噪、鲁棒训练和生成模型聊透。
    wechat_helper dianzan
    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。