← 返回 PaperDaily 大模型与智能体

NVIDIA新作:双塔扩散语言模型提速2.42倍

NVIDIA这篇不是简单给扩散语言模型“加速”,而是直接把上下文表示和去噪职责拆开,思路很工程,也很务实。30B 混合架构上还能保住 98.7% 质量、提速 2.42 倍,这种结果值得认真看。

NVIDIA新作:双塔扩散语言模型提速2.42倍
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
NVIDIA这篇不是简单给扩散语言模型“加速”,而是直接把上下文表示和去噪职责拆开,思路很工程,也很务实。30B 混合架构上还能保住 98.7% 质量、提速 2.42 倍,这种结果值得认真看。


原论文信息如下:
论文标题:
Nemotron-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context
发表日期:
2026年06月
发表单位:
NVIDIA
原文链接:
https://arxiv.org/pdf/2606.26493v1.pdf
开源代码链接:
https://huggingface.co/collections/nvidia/nemotron-twotower
最有意思的地方在于,这篇工作不是继续给自回归模型“抠一字一字往外蹦”的老路修修补补,而是直接换了个思路:把上下文表示去噪生成拆开,各干各的活。听起来像是把一个人掰成两个岗位,结果还真把速度和质量都保住了。
封面
图1:Nemotron-TwoTower 总览。左边是冻结的自回归上下文塔,右边是训练中的扩散去噪塔;右图则展示了质量与吞吐量之间的权衡关系。

打破自回归瓶颈:扩散语言模型的新范式

自回归语言模型的核心问题很朴素:一次只生成一个词。这就像排队打饭,前一个人不走,后一个人就只能干等。模型再大、显卡再强,推理时还是被“一个 token 一个 token 往外吐”的节奏卡住,吞吐量很难飞起来。
扩散语言模型走的是另一条路:先把一段文本打成“马赛克”,再在多轮迭代里逐步修复。它不是一口气从左到右写完,而是并行地猜、反复地改。这样做的好处很直观:一轮里可以同时处理多个位置,理论上更快,也更适合做块级生成和细粒度控制。
但过去很多扩散语言模型有个老毛病:同一个网络既要表示上下文,又要负责去噪。这就像让一个厨师同时当采购、切菜、颠勺和结账,忙是忙了,最后每个环节都不够专。NVIDIA 这篇论文的出发点很简单,也很工程:既然这两个职责本来就不一样,为什么非要塞给同一套参数?
图1:TwoTower 总体架构
图1:TwoTower 总体架构。冻结的 AR 上下文塔负责处理已确认的前缀和历史块,训练中的扩散去噪塔负责对当前噪声块进行迭代修复;两者按层对齐,通过跨注意力和状态传递衔接起来。
这篇工作里,AR 指的是 Autoregressive,自回归MoEMixture of Experts,专家混合KV cache 则是注意力层保存的键值缓存,用来避免每次都把历史上下文重算一遍。论文还提到 adaLN,全称是 adaptive LayerNorm,自适应层归一化,它在这里用来把扩散时间步注入到去噪器里。

解耦双塔设计:冻结上下文塔,训练去噪塔

TwoTower 的核心就是“分工”。论文直接拿一个已经预训练好的 Nemotron-3-Nano-30B-A3B 复制两份:一份做上下文塔,一份做去噪塔。上下文塔完全冻结,只负责像一个老练的秘书一样,稳定记录“前面已经确认了什么”;去噪塔则专门学习如何把当前块里的 [MASK] 逐步补齐。
这种拆法不是为了“形式上好看”,而是为了避免一个模型同时承受两种相互冲突的训练目标。自回归表示希望严格遵守因果顺序,扩散去噪却希望在当前块里尽可能多地看到双向信息。两种任务混在一起,参数很容易左右互搏。论文的判断很明确:让上下文塔继续保留原来的自回归能力,让去噪塔专心做扩散修复,比“一个锅里炖两种菜”更稳。
更关键的是,两座塔不是简单并排放着,而是逐层对齐。去噪塔的第 i 层,会去看上下文塔对应第 i 层的表示,而不是只偷看最后一层的“总摘要”。这点很重要,因为不同层的语义粒度不一样:有的层更像词法,有的层更像句法,有的层更像任务级意图。层对齐的跨注意力,让去噪塔拿到的是一套更细的“分层导航图”。
算法1:TwoTower 块级生成流程
算法1:TwoTower 块级生成流程。先用上下文塔把 prompt 和已提交 token 的状态建好,再对每个新块进行多轮去噪,最后把块提交回上下文塔继续往后生成。
这里的实现细节也挺“工程味”:注意力层在当前噪声块内允许双向看,Mamba-2 层则保持因果。论文还试了一个双向 Mamba 版本,结果质量提升很小,但计算量会明显上去,所以最后没把这条路当主方案。这个取舍很现实:不是所有“更对称”的设计都更划算,有些只是更贵。
去噪塔还会接收扩散时间步的条件信息,也就是前面提到的 adaLN。直白点说,就是让模型知道自己现在处在“轻度污染”还是“重度打码”阶段。这个信号看起来很小,但对采样质量有帮助,因为同样是补词,初始阶段和收尾阶段的策略本来就不一样

块级扩散:高效并行生成与迭代优化

TwoTower 不是按单个 token 生成,而是按生成。一个块里有 S 个 token,先全部打上 [MASK],然后在 T 轮里逐步修复。这个过程可以理解成:不是一笔一划写作文,而是先把一整段草稿框出来,再多轮修改。
论文采用的是masked diffusion,中文可以理解为“掩码扩散”。前向过程就是不断把真实 token 变成 [MASK],反向过程则是根据上下文和噪声程度,把被遮住的位置一个个猜回来。这里的损失本质上还是在训练模型对被遮挡位置做条件预测,只不过预测对象不是整句,而是块内的局部残缺片段。
采样时,论文没有机械地要求每一轮都固定改几个 token,而是用了一个置信度阈值机制:模型先并行预测所有被遮住的位置,置信度足够高的先提交,剩下不确定的继续留在“待修复区”。这样一来,容易的位置先解决,难的位置多磨几轮,整体就更像“先捞大鱼,再补小鱼”。
图2:分类别质量与吞吐量对比
图2:Nemotron-3-Nano-30B-A3B 自回归基线与 Nemotron-TwoTower 的分类别对比。左边是各类基准的平均准确率,右边是相对生成吞吐量;TwoTower 在保住大部分质量的同时,把生成速度提到了 2.42 倍。
这张图的意义很直接:扩散语言模型不是只能做“演示效果”,它真的能在大模型上把生成速度拉上去。更难得的是,提升不是靠把模型砍小,也不是靠牺牲到“看不出像人话”,而是在 30B 级别的混合架构上,仍然保持了接近基线的整体能力。对工程侧来说,这个结果比口号值钱得多,因为它说明扩散式文本生成可以从概念走向可部署的加速方案
Nemotron-TwoTower 模型卡片
Hugging Face 上公开的模型卡片也说明了这个项目已经不是“论文里画饼”的状态,而是已经把代码和权重放出来了。对想做复现、评测或者二次开发的人来说,开源权重比“看着漂亮的图”有用得多。

质量与速度兼得:2.42倍提速,98.7%质量保持

这篇论文最硬的结果,是在 30B 混合 MoE 背骨上,TwoTower 保住了98.7% 的基线质量,同时把 wall-clock generation throughput 提高到2.42×。这里的 wall-clock throughput 说白了就是“真实墙钟时间里的生成速度”,不是实验室里只看单步、不管缓存、不管调度的纸面速度。
图3:采样动态
图3:释放版 TwoTower 的采样动态。上图看不同任务里每个块在第几轮扩散步骤完成,下图看 token 在块内的提交顺序。整体上,很多块会在前几步就完成,而且更靠前的位置通常更早被提交。
图4:平均每步提交 token 数
图4:平均每个扩散步骤提交的 token 数。第一步提交最多,后面逐步下降,说明采样器会优先处理高置信度位置,把难点留到后面慢慢磨。
这组动态图很关键,因为它解释了“为什么多轮去噪还会更快”。答案不是玄学,而是前几轮会一次提交很多 token,并不是每轮都死板地只改一点点。也就是说,扩散模型虽然“轮数多”,但每轮解决的量也大,最后算下来比单 token 自回归更省墙钟时间。
当然,这个结果不是白捡的。论文自己也承认,去噪塔会带来额外的固定权重开销;虽然序列长度相关的缓存开销仍然和 AR 基线类似,但模型常驻显存会更高。换句话说,TwoTower 不是“免费午餐”,而是用更多固定参数换更高吞吐。对大显存推理环境,这笔账可能很划算;对小显存设备,就得掂量了。

实验剖析:设计选择、块大小与采样动态

这篇论文的实验部分,最大的优点不是“堆了很多表”,而是把几个关键设计点都拆开验证了。先看设计选择,再看块大小,最后看采样动态,逻辑很顺,基本能回答一个工程师最关心的问题:到底是哪一步真有用,哪一步只是看着热闹
表1:设计选择消融
表1:设计选择消融。先用双向注意力与因果 Mamba 作为起点,再加入双向 Mamba、时间条件和第二阶段数据继续训练。结果显示,时间条件和第二阶段数据带来的收益更稳定,而双向 Mamba 的收益很有限。
表2:双塔解耦消融
表2:双塔解耦消融。冻结上下文塔、单独训练去噪塔的方案表现最好;继续做自回归训练,或者把两塔绑在一起联合训练,效果都明显更差。这个结果基本把“职责不分家”的幻想打碎了。
表3:训练块大小消融
表3:训练块大小消融。块越小,质量通常越好,但吞吐会下降;块越大,吞吐更快,但质量会掉得更明显。论文最后把 16 作为默认值,就是在质量和速度之间挑了个相对均衡的位置。
从这些表里能看出,TwoTower 的有效性不是靠某一个“神奇模块”撑起来的,而是几个判断叠加后的结果:冻结上下文塔保底、层对齐跨注意力补信息、时间条件增强去噪、块大小控制速度与质量的平衡。这套组合拳打得比较老实,没有那种“一个 trick 解决一切”的油腻感。
图5:平均完成步数
图5:平均每个块在第几步完成。不同任务的曲线会在不同块索引处结束,说明任务长度不同,但整体趋势一致:很多块都在前几步完成。
图6:各步完成比例
图6:在完整任务集上,不同扩散步完成的块比例。大多数块都在前几步结束,后面留下的是少量更难的尾部样本。
图7:全任务 token 提交分布
图7:所有生成块上的 token 提交分布。越靠前的位置越容易更早提交,形成明显的左上三角形结构,说明模型仍然保留着很强的自回归左到右偏置。
还有一个很有意思的现象:虽然 TwoTower 是扩散式生成,但采样行为并没有变成“完全无序的并行乱填”。相反,它仍然表现出很强的左到右提交倾向。这个现象说明,预训练自回归骨干留下的归纳偏置并没有被抹掉,反而在扩散框架里继续影响生成顺序。换句话说,模型不是突然学会了“无视顺序”,而是学会了在保留顺序感的同时批量修复

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?解决的是扩散语言模型里最常见的“一个模型干两份活”问题。TwoTower 把上下文表示和去噪生成拆开,让冻结的自回归塔保留原有能力,让训练中的去噪塔专心做块级修复,从而在大模型上同时拿到较好的质量和更高吞吐。

文中的 block、KV cache、adaLN 分别是什么意思?block 是一次一起去噪的一段 token;KV cache 是注意力层保存的历史键值,避免重复算上下文;adaLN 是自适应层归一化,用来把扩散时间步注入模型,让去噪器知道当前噪声有多重。

这套方法适合直接上产品吗?在大显存、追求高吞吐的文本生成场景里,这条路线很有价值;但它会增加固定模型权重开销,而且块大小、阈值、采样步数都要调,离“拿来即用”还有一步。更像是一条值得工程化打磨的路线,而不是一键替换所有生成模型的万能钥匙。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把预训练 AR 上下文和扩散去噪明确拆成双塔,这个思路不算天外飞仙,但在大规模混合架构上做得比较完整,且有明确收益。

实验合理度:★★★★☆。消融围绕关键设计展开,块大小、时间条件、双向 Mamba、塔解耦都测了,结论比较连贯,不像有些论文实验堆得热闹却没回答问题。

学术研究价值:★★★★☆。它证明了扩散语言模型可以借助预训练 AR 表示走向更实用的推理路径,对后续做混合生成范式的人很有启发。

稳定性:★★★☆☆。思路稳定,但采样阈值、块大小和任务类型都会影响表现,离“随便一设就稳”还有距离。

适应性以及泛化能力:★★★☆☆。在 30B 混合骨干上成立,但是否能平滑迁移到更多架构、更多任务,还需要进一步验证。

硬件需求及成本:★★★☆☆。吞吐提升不错,但双塔常驻带来更高固定显存占用,适合资源相对充足的推理环境。

复现难度:★★★☆☆。代码和权重已公开是加分项,不过 30B 级别训练与评测门槛不低,普通团队复现成本仍然不小。

产品化成熟度:★★★☆☆。适合高吞吐文本生成、离线批量生成等场景;如果是低成本端侧部署,还得继续压缩和优化。

可能的问题:双塔方案有效,但固定显存更高、采样参数更敏感,且块级扩散的收益依赖任务类型,通用部署仍需更多验证。


主要参考文献

Fitsum Reda, John Kamalu, Roger Waleffe, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro. Nemotron-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context. arXiv:2606.26493v1, 2026.
项目与模型地址:https://huggingface.co/collections/nvidia/nemotron-twotower
原文链接:https://arxiv.org/pdf/2606.26493v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。