← 返回 PaperDaily
视觉与图像
NVIDIA离散扩散新作:1024文生图冲上SOTA
NVIDIA 这篇没有走“越大越强”的老路,而是盯着离散扩散最烦的两个痛点下手:不会自我修正、词表一大就学不动。结果很直接,1024 分辨率文生图拿到 SOTA,训练还更省显存。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读:
NVIDIA 这篇没有走“越大越强”的老路,而是盯着离散扩散最烦的两个痛点下手:不会自我修正、词表一大就学不动。结果很直接,1024 分辨率文生图拿到 SOTA,训练还更省显存。
原论文信息如下:
颠覆传统!离散扩散模型也能“自我修正”
离散扩散做文生图,最大的尴尬不是“不会画”,而是“画错了还不能改”。连续扩散模型像边画边擦的素描师,离散扩散模型更像一次性落子:某个 token 一旦放出去,后面基本就钉死了。问题来了,图像 token 之间偏偏又不是互不相干的麻将牌,早一步错了,后面很容易连锁翻车。
这篇来自 NVIDIA 的 Nemotron-Labs-Diffusion-Image,干的事很直接:让离散扩散模型也学会“回头看一眼”。它不是只会补空白,而是允许已经解开的 token 再被修改,等于给生成过程加了一个自我修正按钮。
不止是SOTA,更是一套“修图”新范式
先把术语捋顺。MDM 是 Masked Discrete Diffusion Model,中文就是“掩码离散扩散模型”:先把整张图变成离散 token 序列,再从全 mask 开始,逐步把 token 补出来。它和自回归模型不同,不是一个字一个字、一个 token 一个 token 地顺着写,而是一轮能并行补很多位置,所以速度和灵活性更好。
这类模型的优势很实在:一是并行解码更快,二是天然适合补全和局部编辑,三是和大语言模型的离散 token 范式更接近。问题也很现实:离散 token 一旦解开,标准 MDM 就默认它是对的。如果前面一步看走眼,后面只能默默吞下去,像修图软件里把“撤销”键拔了。
Nemotron-Labs-Diffusion-Image 的思路很像“先画草稿,再反复打磨”。训练时不只学被 mask 的位置,还让可见 token 也参与“纠错”训练;推理时则允许模型在置信度足够高时,改写已经生成出来的 token。这个设计的本质不是把离散扩散变复杂,而是把它补成了一个更像连续扩散的迭代修正系统。
突破瓶颈:大规模词汇表下的训练“滑铁卢”
离散图像生成里,词表越大,理论上 tokenizer 越细腻,重建图像越像真图;但现实是,词表一大,单个 token 的训练信号就会变得很稀。说白了,100K 级词表不是“更聪明”,而是“更难喂饱”。
原论文把这个矛盾讲得很直白:大词表会降低离散化误差,但也会引入codebook sparsity,也就是“词表稀疏”。每个 token 出现得越来越少,模型很难学到稳定的分布。更麻烦的是,标准交叉熵把“不是答案的 token”全都当成负样本,不管它们是不是和真值长得很像。结果就是,语义上很接近的 token 也被一视同仁地打成反派,训练信号又硬又粗。
这就是本论文第二个核心问题:怎么在不牺牲词表规模的前提下,让大词表真的学得动。论文给出的答案不是继续硬卷参数,而是换一个更懂“语义邻居”的损失函数。
创新点一:Token编辑——让AI生成的图像也能“改错”
这里先把原始训练目标放出来。标准 MDM 的思路是:随机遮住一部分 token,只在被遮住的位置上计算损失。原文中的基础目标可以写成下面这样。
Nemotron-Labs-Diffusion-Image 的 token 编辑机制,就是专门补这个洞。训练时,除了 mask 一部分 token,还会额外污染一部分可见 token,让模型学会“看见错误、主动修改”。推理时,模型会根据置信度阈值判断:如果某个已经解开的 token 明显更像另一个候选,就把它改掉。这个过程很像修图师先局部放大,再把边缘毛刺一刀刀修平。
这一步挺关键。离散扩散想学得像连续扩散一样“边生成边修正”,光靠多采样几步不够,必须让模型在训练阶段就见过“自己也会犯错”的场景。否则推理时突然让它改错,它大概率只会装作没看见。
创新点二:分组交叉熵太牛了!连“长得像”的邻居也一起学
第二个核心创新是 GCE,全称 Grouped Cross-Entropy,中文叫“分组交叉熵”。它解决的不是“能不能学”,而是“词表太大时,怎么学得不那么费劲”。
标准交叉熵只给真值 token 一个正反馈,其他 token 全是负反馈。可在大词表下,很多“非真值”其实只是语义上很近,并不该被打成完全错误。论文的做法很聪明:先用 K-means 把 token 按 embedding 空间聚成多个簇,再在簇级别做交叉熵,让同簇的邻居也能得到正信号。
更妙的是,GCE 不是只停留在概念层面。论文还给了一个自定义 fused operator,把原本很吃显存的实现压了下来。对大词表来说,这种工程优化不是锦上添花,而是“能不能训得动”的分水岭。
全面评测:多项指标全面领先,效率与质量兼得
实验部分的看点不只在分数高,更在于它不是靠“堆大”硬冲出来的。模型总参数 8B,词表 131K,训练从 256 分辨率逐步升到 1024 分辨率,说明作者在高分辨率、长上下文、大词表这三件最难缠的事上,都做了系统化安排。
再看消融实验,结论很一致:token 编辑有效,GCE 有效,优化后的算子也有效。这三件事不是各自发光,而是互相补位。token 编辑解决推理时的错误累积,GCE 解决训练时的大词表稀疏,优化算子则把训练成本压住,三者一起把“能训、能跑、能出图”这条链打通了。
如果把这些结果连起来看,这篇论文真正厉害的地方不是某一个单点创新,而是把离散扩散最常见的两处短板——不会修正、学不动大词表——都补上了,而且补得还算工程友好。不是那种“论文里能跑,产品里先别碰”的方案。
龙迷三问
这篇论文到底解决了什么问题?它主要解决两个痛点:一是离散扩散模型生成时不能像连续扩散那样自我修正,二是大词表训练时信号太稀、优化太难。前者靠 token 编辑补上,后者靠 GCE 补上。
GCE 和普通交叉熵有什么区别?普通交叉熵只奖励唯一真值 token,GCE 还会按聚类把语义相近的 token 一起纳入监督。简单说,就是不再只认“唯一答案”,而是把“答案附近的邻居”也照顾到。
token 编辑会不会让生成变慢?会有一定额外开销,但论文给出的实验表明,开启 token 编辑后可以用更少采样步数达到接近的质量,整体上是把“每步更贵”换成了“总步数更少”,算下来并不亏。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 不是凭空发明新范式,但把 token 编辑和分组监督塞进离散扩散里,切中了真实痛点,属于“把老问题修得很对”的创新。
实验合理度:★★★★☆ 主结果、消融、效率测试都齐了,而且把 token 编辑和 GCE 分开验证,逻辑比较完整。
学术研究价值:★★★★☆ 对离散图像生成很有启发,尤其是大词表训练和自我修正这两个方向,后续很可能继续被借鉴。
稳定性:★★★☆☆ 方向不错,但 token 编辑阈值、聚类方式和词表规模都可能影响表现,离产品级稳定还有一段路。
适应性以及泛化能力:★★★☆☆ 在高分辨率文生图和类条件生成上都有效,但是否能无缝迁移到更多任务,还需要进一步验证。
硬件需求及成本:★★★☆☆ 8B 模型、64 张 H100 训练,门槛不低;好在自定义算子把显存压力压下来了。
复现难度:★★★☆☆ 方法细节不少,尤其是编辑策略和 GCE 实现;如果代码不开源,复现会有点折腾。
产品化成熟度:★★★☆☆ 适合高质量离散文生图研究和原型验证,离大规模稳定部署还需要更多工程打磨。
可能的问题:创新点扎实,但整体仍依赖大模型、大算力和复杂训练策略,离“轻量通用方案”还有距离。
主要参考文献
1. Shufan Li, Greg Heinrich, Hanrong Ye, Yonggan Fu, Aditya Grover, Jan Kautz, Pavlo Molchanov. Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis. arXiv:2606.29814v1, 2026.
2. 论文原文链接:https://arxiv.org/pdf/2606.29814v1.pdf

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称,方便更快通过并邀请进群。
图像生成、扩散模型、Agent、机器人、医疗、金融都能聊,前沿论文和开源资源一起刷,别让自己在信息差里慢半拍。

