← 返回 PaperDaily 视觉与图像

NVIDIA离散扩散新作:1024文生图冲上SOTA

NVIDIA 这篇没有走“越大越强”的老路,而是盯着离散扩散最烦的两个痛点下手:不会自我修正、词表一大就学不动。结果很直接,1024 分辨率文生图拿到 SOTA,训练还更省显存。

NVIDIA离散扩散新作:1024文生图冲上SOTA
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
NVIDIA 这篇没有走“越大越强”的老路,而是盯着离散扩散最烦的两个痛点下手:不会自我修正、词表一大就学不动。结果很直接,1024 分辨率文生图拿到 SOTA,训练还更省显存。


原论文信息如下:
论文标题:
Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis
发表日期:
2026年06月
发表单位:
NVIDIA
原文链接:
https://arxiv.org/pdf/2606.29814v1.pdf

颠覆传统!离散扩散模型也能“自我修正”

离散扩散做文生图,最大的尴尬不是“不会画”,而是“画错了还不能改”。连续扩散模型像边画边擦的素描师,离散扩散模型更像一次性落子:某个 token 一旦放出去,后面基本就钉死了。问题来了,图像 token 之间偏偏又不是互不相干的麻将牌,早一步错了,后面很容易连锁翻车。
这篇来自 NVIDIA 的 Nemotron-Labs-Diffusion-Image,干的事很直接:让离散扩散模型也学会“回头看一眼”。它不是只会补空白,而是允许已经解开的 token 再被修改,等于给生成过程加了一个自我修正按钮。
Figure 1:Nemotron-Labs-Diffusion-Image 是一个用于文生图的掩码离散扩散模型,在 1024 分辨率文生图任务上达到领先水平。
图1:Nemotron-Labs-Diffusion-Image 的整体效果展示。模型从 MJHQ 数据集的提示词出发,生成 1024 分辨率图像,并在多个基准上拿到很强的结果。

不止是SOTA,更是一套“修图”新范式

先把术语捋顺。MDMMasked Discrete Diffusion Model,中文就是“掩码离散扩散模型”:先把整张图变成离散 token 序列,再从全 mask 开始,逐步把 token 补出来。它和自回归模型不同,不是一个字一个字、一个 token 一个 token 地顺着写,而是一轮能并行补很多位置,所以速度和灵活性更好。
这类模型的优势很实在:一是并行解码更快,二是天然适合补全和局部编辑,三是和大语言模型的离散 token 范式更接近。问题也很现实:离散 token 一旦解开,标准 MDM 就默认它是对的。如果前面一步看走眼,后面只能默默吞下去,像修图软件里把“撤销”键拔了。
Nemotron-Labs-Diffusion-Image 的思路很像“先画草稿,再反复打磨”。训练时不只学被 mask 的位置,还让可见 token 也参与“纠错”训练;推理时则允许模型在置信度足够高时,改写已经生成出来的 token。这个设计的本质不是把离散扩散变复杂,而是把它补成了一个更像连续扩散的迭代修正系统

突破瓶颈:大规模词汇表下的训练“滑铁卢”

离散图像生成里,词表越大,理论上 tokenizer 越细腻,重建图像越像真图;但现实是,词表一大,单个 token 的训练信号就会变得很稀。说白了,100K 级词表不是“更聪明”,而是“更难喂饱”。
原论文把这个矛盾讲得很直白:大词表会降低离散化误差,但也会引入codebook sparsity,也就是“词表稀疏”。每个 token 出现得越来越少,模型很难学到稳定的分布。更麻烦的是,标准交叉熵把“不是答案的 token”全都当成负样本,不管它们是不是和真值长得很像。结果就是,语义上很接近的 token 也被一视同仁地打成反派,训练信号又硬又粗。
Figure 2:相邻 token 的语义相似性。
图2:通过 K-means 聚类可视化相邻 token 的重建结果。可以看到,同一簇里的 token 往往长得很像,但普通交叉熵并不会奖励这种“长得像也算缘分”的关系。
这就是本论文第二个核心问题:怎么在不牺牲词表规模的前提下,让大词表真的学得动。论文给出的答案不是继续硬卷参数,而是换一个更懂“语义邻居”的损失函数。

创新点一:Token编辑——让AI生成的图像也能“改错”

这里先把原始训练目标放出来。标准 MDM 的思路是:随机遮住一部分 token,只在被遮住的位置上计算损失。原文中的基础目标可以写成下面这样。
标准 MDM 的训练目标
这个式子里,t 是扩散时间步,yt 是当前被 mask 后的序列, 是模型预测分布。问题在于,它只关心“被遮住的位置”,对没遮住的位置默认不管,等于训练时告诉模型:没坏的地方别碰。听起来稳,实际上也把“纠错”能力一并阉割了。
Nemotron-Labs-Diffusion-Image 的 token 编辑机制,就是专门补这个洞。训练时,除了 mask 一部分 token,还会额外污染一部分可见 token,让模型学会“看见错误、主动修改”。推理时,模型会根据置信度阈值判断:如果某个已经解开的 token 明显更像另一个候选,就把它改掉。这个过程很像修图师先局部放大,再把边缘毛刺一刀刀修平。
引入 token 编辑后的训练目标
新目标和原目标最大的区别,是损失不再只看 mask 位,而是对所有 token 位置都施加监督。这样模型在训练时就知道:有些“看起来已经对了”的 token,其实也可能需要被修正。
Figure 3:Nemotron-Labs-Diffusion-Image 的整体架构。
图3:整体架构图。和一些编码器—解码器式方案不同,这里采用的是单个 decoder-only transformer同时处理文本和图像 token。好处也很现实:上下文更长、训练更容易做 sequence packing,而且还能直接从预训练的 diffusion language model 初始化,少走很多弯路。
这一步挺关键。离散扩散想学得像连续扩散一样“边生成边修正”,光靠多采样几步不够,必须让模型在训练阶段就见过“自己也会犯错”的场景。否则推理时突然让它改错,它大概率只会装作没看见。
Figure 5:有无 token 编辑的生成样本定性对比。
图5:有无 token 编辑的生成结果对比。可以看到,开启编辑后,局部纹理、边缘和一些小伪影会更稳,图像整体更像“认真修过”的结果,而不是“差不多就交卷”。
(b) 不同采样步数下,有无 token 编辑的 HPSv3 分数对比。
图6(b):不同采样步数下的质量曲线。token 编辑带来的收益很实在,不只是分数更高,而且在少步数时退化更平滑。换句话说,32 步带编辑的效果,接近 64 步不带编辑,这对推理成本是直接利好。

创新点二:分组交叉熵太牛了!连“长得像”的邻居也一起学

第二个核心创新是 GCE,全称 Grouped Cross-Entropy,中文叫“分组交叉熵”。它解决的不是“能不能学”,而是“词表太大时,怎么学得不那么费劲”。
标准交叉熵只给真值 token 一个正反馈,其他 token 全是负反馈。可在大词表下,很多“非真值”其实只是语义上很近,并不该被打成完全错误。论文的做法很聪明:先用 K-means 把 token 按 embedding 空间聚成多个簇,再在簇级别做交叉熵,让同簇的邻居也能得到正信号。
GCE 的核心目标函数
这个式子可以拆成两层意思:第一层还是 token 级别的 top-1 监督,保证答案不跑偏;第二层是簇级别监督,告诉模型“这个 token 虽然不是唯一正确答案,但和答案在同一语义圈里”。这样一来,模型不会把所有相似 token 一刀切地推远。
Figure 4:分组交叉熵与标准交叉熵、SNCE 的对比。
图4:左边是标准交叉熵,中间是 SNCE,右边是 GCE。SNCE 依赖固定软标签,而 GCE 通过多层聚类把“相似 token”组织起来,既保留了硬标签的稳定性,又补上了语义邻居的监督。
更妙的是,GCE 不是只停留在概念层面。论文还给了一个自定义 fused operator,把原本很吃显存的实现压了下来。对大词表来说,这种工程优化不是锦上添花,而是“能不能训得动”的分水岭。
GCE 中聚类项的梯度形式
梯度公式的含义也很清楚:落在目标簇里的 token 会得到正向梯度,其他 token 得到负向梯度。也就是说,模型学的不再只是“唯一正确答案”,而是“正确答案附近那一圈也别太离谱”。这比纯 one-hot 训练更符合图像 token 的语义结构。

全面评测:多项指标全面领先,效率与质量兼得

实验部分的看点不只在分数高,更在于它不是靠“堆大”硬冲出来的。模型总参数 8B,词表 131K,训练从 256 分辨率逐步升到 1024 分辨率,说明作者在高分辨率、长上下文、大词表这三件最难缠的事上,都做了系统化安排。
Table 1:GenEval 基准上的文生图性能对比。
表1:在 GenEval 上,Nemotron-Labs-Diffusion-Image 的 Overall 达到 0.90,明显高于同类离散生成模型,也压过了不少统一多模态模型。尤其在位置、颜色属性等更考验组合理解的子项上,优势更明显。
Table 2:DPG 与 MJHQ-30k 上的性能对比。
表2:在 DPG 和 MJHQ-30k 上,这个模型继续保持强势。原文还给出一个加了微调版本的结果,HPSv3 达到 10.76,说明 token 编辑和大词表训练并不是只在单一指标上“刷存在感”,而是确实提升了高分辨率图像质量。
再看消融实验,结论很一致:token 编辑有效,GCE 有效,优化后的算子也有效。这三件事不是各自发光,而是互相补位。token 编辑解决推理时的错误累积,GCE 解决训练时的大词表稀疏,优化算子则把训练成本压住,三者一起把“能训、能跑、能出图”这条链打通了。
Table 3:ImageNet256 上的分组交叉熵消融实验。
表3:在 ImageNet256 的类条件生成任务上,GCE 相比标准交叉熵和 SNCE 都更优。这个结果很重要,因为它说明 GCE 不是只对某个特定大模型有效,而是在更受控的实验里也能稳定起作用。
Table 4:不同损失实现方式的性能对比。
表4:优化后的 GCE 在延迟和显存上明显比朴素实现更好,最终的前向+反向开销接近普通交叉熵。这个结果很有工程味:算法不只要“想得美”,还得“跑得动”。
如果把这些结果连起来看,这篇论文真正厉害的地方不是某一个单点创新,而是把离散扩散最常见的两处短板——不会修正、学不动大词表——都补上了,而且补得还算工程友好。不是那种“论文里能跑,产品里先别碰”的方案。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决两个痛点:一是离散扩散模型生成时不能像连续扩散那样自我修正,二是大词表训练时信号太稀、优化太难。前者靠 token 编辑补上,后者靠 GCE 补上。

GCE 和普通交叉熵有什么区别?普通交叉熵只奖励唯一真值 token,GCE 还会按聚类把语义相近的 token 一起纳入监督。简单说,就是不再只认“唯一答案”,而是把“答案附近的邻居”也照顾到。

token 编辑会不会让生成变慢?会有一定额外开销,但论文给出的实验表明,开启 token 编辑后可以用更少采样步数达到接近的质量,整体上是把“每步更贵”换成了“总步数更少”,算下来并不亏。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是凭空发明新范式,但把 token 编辑和分组监督塞进离散扩散里,切中了真实痛点,属于“把老问题修得很对”的创新。

实验合理度:★★★★☆ 主结果、消融、效率测试都齐了,而且把 token 编辑和 GCE 分开验证,逻辑比较完整。

学术研究价值:★★★★☆ 对离散图像生成很有启发,尤其是大词表训练和自我修正这两个方向,后续很可能继续被借鉴。

稳定性:★★★☆☆ 方向不错,但 token 编辑阈值、聚类方式和词表规模都可能影响表现,离产品级稳定还有一段路。

适应性以及泛化能力:★★★☆☆ 在高分辨率文生图和类条件生成上都有效,但是否能无缝迁移到更多任务,还需要进一步验证。

硬件需求及成本:★★★☆☆ 8B 模型、64 张 H100 训练,门槛不低;好在自定义算子把显存压力压下来了。

复现难度:★★★☆☆ 方法细节不少,尤其是编辑策略和 GCE 实现;如果代码不开源,复现会有点折腾。

产品化成熟度:★★★☆☆ 适合高质量离散文生图研究和原型验证,离大规模稳定部署还需要更多工程打磨。

可能的问题:创新点扎实,但整体仍依赖大模型、大算力和复杂训练策略,离“轻量通用方案”还有距离。


主要参考文献

1. Shufan Li, Greg Heinrich, Hanrong Ye, Yonggan Fu, Aditya Grover, Jan Kautz, Pavlo Molchanov. Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis. arXiv:2606.29814v1, 2026.
2. 论文原文链接:https://arxiv.org/pdf/2606.29814v1.pdf

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,方便更快通过并邀请进群。
图像生成、扩散模型、Agent、机器人、医疗、金融都能聊,前沿论文和开源资源一起刷,别让自己在信息差里慢半拍。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。