← 返回 PaperDaily 大模型与智能体

模型太大跑不动?试试“循环”一下:递归缩放让6层Transformer媲美30层,参数省5倍!

拼参数时代要终结了?EPFL等机构提出递归掩码扩散模型(R-MDM),让模型在每次去噪时“循环思考”多次。仅6层循环5次的模型,效果竟吊打30层大模型,推理还快了2.7倍!这不就是AI界的“以小博大”新范式吗?

模型太大跑不动?试试“循环”一下:递归缩放让6层Transformer媲美30层,参数省5倍!
🐉 龙哥读论文知识星球来了!
AI模型越来越大,算力越来越贵?星球无上限拆解AI领域论文、资讯、招聘、招博、开源代码,揭秘各种“以小博大”的高效模型设计技巧,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
拼参数时代要终结了?EPFL等机构提出递归掩码扩散模型(R-MDM),让模型在每次去噪时“循环思考”多次。仅6层循环5次的模型,效果竟吊打30层大模型,推理还快了2.7倍!这不就是AI界的“以小博大”新范式吗?


原论文信息如下:
论文标题:
Recursive Scaling in Masked Diffusion Models
发表日期:
2026年06月
发表单位:
EPFL, University of Cambridge, University of California, Los Angeles
原文链接:
https://arxiv.org/pdf/2606.18022v1.pdf

掩码扩散模型也能“递归思考”?

聊到扩散模型,大家首先想到的是图像生成中的 DDPM,但近年来在离散序列生成领域,掩码扩散模型(Masked Diffusion Models, MDMs)正异军突起。传统自回归(AR)模型从左到右逐个生成 token,每步只能看到左边信息,而 MDM 则不同:它可以在每个去噪步骤中,对整个(部分掩码的)序列进行双向注意力操作,一次性并行预测所有掩码位置。这就像考题全卷的“填空版”——所有空同时填,然后一步步修正,而不是像 AR 那样一个字一个字地写。
那么问题来了:当模型填完一次空之后,能不能像人类检查试卷一样,“回过头来”再仔细想想,把刚才不确定的地方再推理一遍?这听起来很直觉,但在深度学习里,传统做法是堆更多参数、加深网络,让模型一次推理得更好。而今天介绍的这篇来自 EPFL、剑桥大学和 UCLA 的工作——《Recursive Scaling in Masked Diffusion Models》(arXiv 2606.18022),提出了一个反直觉的方案:让同一个浅层模型在每次去噪时“递归”地反复使用自己,相当于用少量参数模拟出深层网络的效果,达到“小模型、大能力”的惊艳提升。
图1:标准能力提升通常来自扩大模型规模,而本文的方法通过让MDM递归循环自己的预测来提升生成质量。模型并行预测所有token,然后迭代细化序列,纠正早期错误,从而用更少的解码步骤实现更高质量的样本。
图1:标准能力提升通常来自扩大模型规模,而本文的方法通过让MDM递归循环自己的预测来提升生成质量。
论文的核心思想就是:递归深度(Recursive Depth)可以作为继参数数量和去噪步数之后的第三缩放轴。用符号 (K⊗L) 表示 K 层共享块循环 L 次,这样有效深度为 KL,但参数只等于 K 层的模型。而传统非递归基线是 (KL⊗1),即用 KL 层独立参数。两者 FLOPs 相同(因为计算量一样),但参数差 L 倍。实验表明,在 Sudoku、Countdown 等结构化生成任务中,(6⊗5) 的模型(仅10.6M参数)就能媲美 30 层单次模型(53.1M参数)的性能。而且,递归还能减少所需的去噪步数,在相同计算预算下达到 2.7 倍推理加速。
听起来是不是有点魔幻?别急,我们一步步拆解。

递归深度:全新的模型缩放轴

要理解递归深度,我们先回顾一下传统做法。过去几年,AI 能力的提升几乎等于“参数量的扩张”:从 2017 年 Transformer 的几千万参数,到 GPT-3 的 1750 亿,再到更大的模型。但参数越多,训练成本、部署成本也指数级上升。于是很多人开始思考:能不能用计算换参数? 也就是同样的参数多算几次,效果能否赶上参数量翻倍?
这个想法在自回归模型中已有探索,比如 Universal Transformer 和 ALBERT,以及最近的一些 looped transformer 研究。但 MDM 有一个天然优势:每个递归循环内使用的是全双向注意力,所有 token 可以同时交互,不像 AR 模型只能从左到右传播信息。因此,在 MDM 里递归的每次迭代可能效率更高。
具体怎么实现?看下图2:
图2:标准单次MDM与递归变体的对比。递归模型在细化步骤中复用了相同的Transformer块,可以可选地使用步嵌入(step embedding)来区分不同循环。推理时,每个去噪步骤内部都有递归循环来细化预测。
图2:标准单次MDM与递归变体的对比。递归模型在细化步骤中复用了相同的Transformer块。
递归模型的核心流程如下:给定第 t 步的部分掩码序列 x_t,首先经过嵌入层和位置编码得到初始隐藏状态 h^(0)。然后,一个 K 层的共享 Transformer 块 f_θ 被重复应用 L 次,每次输入是上一轮输出的隐藏状态 h^(ℓ-1) 加上可选的步嵌入 v^(ℓ)。最终,从最后一轮输出 h_out^(L) 通过共享的语言模型头 W_θ 预测所有位置的 logits。注意:所有 L 次的 Transformer 块权重完全相同——这正是参数共享的关键,使得参数量与 K 层模型一样,而计算量是 KL 层。
这里有一个细节:步嵌入(step embedding)是什么?因为模型在循环时,需要知道自己当前处于第几次循环。步嵌入将循环索引 ℓ 归一化到 [0,1] 区间 s_ℓ = (ℓ-1)/(L-1),然后通过一个小的 MLP 映射成 d 维向量,加到隐藏状态上。这样模型可以感知当前循环的阶段,从而调整计算行为。比如早期循环适合粗粒度探索,后期循环适合细致修正。
训练时,作者探索了四种损失变体:全步损失(ALL)平均所有循环的交叉熵,提供更密集的梯度信号;终步损失(FINAL)只监督最后一轮输出;加权损失(WEIGHTED)截断损失(TRUNCATED)则分别给不同循环分配不同权重或只监督最后几轮。实验发现,全步损失通常表现最好,因为它让所有循环都直接参与学习,避免了梯度消失问题。
这种设计在数学上非常优雅:模型的计算量(FLOPs)与有效深度 KL 成正比,但参数量只与 K 成正比。如果递归真的能学到比深层参数更高效的表示,那么就能实现“用更少参数换更多计算”的帕累托改进。

惊艳结果:小模型,大效果,快推理

光说不练假把式。我们直接看实验结果。论文在三个任务上测试了递归模型(R-MDM):数独 (Sudoku)Countdown(一种算术规划游戏)和 Text8(字符级语言建模)。主要衡量指标:Valid Puzzle Rate (VPR) —— 生成合法数独棋盘的比例;Reaches Target Rate (RTR) —— Countdown 中通过加减乘除运算得到目标值的成功率。
首先看等参数对比(iso-parameter):固定参数量,递归模型(K⊗L) vs 单次模型(K⊗1)。图3展示了在 9×9 数独和不同难度的 Countdown 上的结果。
图3:递归细化深度 (L) 对 9×9 数独和 Countdown(目标长度3/4/5)任务性能的影响。增加 L 持续提高成功率,在更难的问题上收益最大。
图3:递归细化深度 (L) 对 9×9 数独和 Countdown(目标长度3/4/5)任务性能的影响。
可以看出,在数独任务上,递归模型在低解码步数(T 较小)时效果显著优于非递归基线;随着 T 增大,差距缩小但递归仍然保持优势。Countdown 上更明显:对于3位数难度,当 T=10 时,递归模型 L=3 已经达到 92.4% 成功率,而基线只有 59.4%!对于最难的五位数,递归 L=10 在 T=30 时达到 56.4%,而基线仅有 15.6%。这几乎是 3.6 倍的提升!
接下来是更严格的等 FLOPs 对比(iso-FLOP):递归模型 (K⊗L) 与 KL 层非递归模型 (KL⊗1) 比较,两者计算量相同,但递归模型参数量少 L 倍。结果见图5。
图5:在匹配有效模型深度(iso-FLOP)下,递归对 9×9 数独和不同长度 Countdown 任务的影响。
图5:在匹配有效模型深度(iso-FLOP)下,递归对 9×9 数独和不同长度 Countdown 任务的影响。
最令人印象深刻的是:在数独上,一个 6 层循环 5 次的模型((6⊗5),10.6M参数)在 T=5 步时达到 93.6% VPR,而 30 层非递归模型(53.1M参数)只有 77.8%。递归模型不仅以 1/5 的参数达到了更高精度,甚至在低步数区域碾压了所有非递归模型。这意味着递归提供了本质上更优的表征——共享参数在多次循环中学会了更协同有效的信息处理,而独立参数的网络可能只能进行“一次性”推理。
表1:图5中iso-FLOP模型对的参数计数。递归模型使用固定K层骨干 (K⊗L);基线展开 KL 层无权重共享 (KL⊗1)。
表1:图5中iso-FLOP模型对的参数计数。
更惊人的是计算效率的突破(图7)。在数独上,非递归基线需要 40 次去噪步才能达到 95% 的 VPR,而递归模型(使用反向课程训练:先从高循环数开始再递减)仅需 15 次总前向传递(T=5, L=3)就能达到同等质量,加速 2.7 倍!而且递归模型最终还能突破基线的饱和点(基线最高 95.8%,递归可达 98.2%)。
图7:在9×9数独上,有效解谜率 vs 总计算预算(前向传递次数 x = T×L)。将计算预算分配给递归深度(在反向课程下训练)比增加非递归基线的解码步数 T 更高效。
图7:在9×9数独上,有效解谜率 vs 总计算预算。将计算预算分配给递归深度比增加非递归基线的解码步数 T 更高效。
这些结果直击痛点:递归不仅节省参数,还节省推理时间。在图8的 Pareto 前沿图中,我们也能看到递归模型占据绝对优势——在参数量和所需解码步数两个维度上都优于非递归模型。
图8:在9×9数独上达到95% VPR(上图)和在Countdown 4上达到70% RTR(下图)时,模型参数量与所需解码步数 T 的 Pareto 前沿。递归模型(固定步训练和评估)优于参数量更大的非递归变体。
图8:在9×9数独上达到95% VPR(上图)和在Countdown 4上达到70% RTR(下图)时,模型参数量与所需解码步数 T 的 Pareto 前沿。

25×25超大数独:递归的威力

为了检验递归在更复杂问题上的表现,论文还测试了 25×25 数独(625个格子!)。图4显示,在 80% 掩码的情况下,单次基线几乎完全失败(T=5 时仅6.6%有效解),而递归模型 L=3 达到70.6%,L=5 高达91.8%!70%掩码时,递归模型仅需1步去噪就能100%有效,而基线需要50-100步。这个结果说明递归在需要多步约束传播的任务中尤其强大。
图4:在不同掩码条件下,固定训练和采样递归深度 (L) 对 25×25 数独重建的影响。在所有掩码率下,递归都提高了有效解谜率。
图4:在不同掩码条件下,固定训练和采样递归深度 (L) 对 25×25 数独重建的影响。

灵活推理:计算资源不同,表现同样出色

想象一个很实用的场景:你有一个强大的模型部署在云端,但有时用户的设备只想快速得到一个“差不多”的回答,有时却需要最精确的结果。传统模型很难灵活调整推理深度,通常只能通过改变去噪步数来粗调。而递归模型提供了一种精细且正交的控制方式:你可以在推理时动态调整递归循环次数 L_s,而无需重新训练模型。
图6展示了这种灵活性:一个用 L_t=5 训练的模型,在采样时可以用 L_s=1 到 10 的不同循环次数。有趣的是,当 L_s 超过 L_t 时(即使用比训练时更多的循环),性能还能继续提升!这意味着你可以在训练时用一个适中的循环数,部署时根据需求选择计算量——低延迟场景用少循环,高质量场景用多循环。
图6:训练递归深度 (L_t) 和采样递归深度 (L_s) 之间的交叉递归权衡。上方热图为单步解码,下方为5步解码。
图6:训练递归深度 (L_t) 和采样递归深度 (L_s) 之间的交叉递归权衡。
另外,递归和去噪步数是可以互补的。前面我们提到递归可以部分替代去噪步数:固定计算预算 x = T × L,把预算更多地分配给递归(用更少的去噪步、更多的循环次数)往往比增加去噪步更高效。这说明递归能更好地利用每次前向传递的信息,因为循环内的全局交互可以快速解决约束冲突,而增加去噪步则需要更慢的逐步修正。

并非万能:任务依赖性分析

龙哥必须客观:递归不是万能的。当在 Text8(字符级语言建模)上测试时,结果出现了反转。见表11。
表11:Text8 评估结果。报告5次采样运行(每次100个样本)的均值和标准差。
表11:Text8 评估结果。
在字符级语言建模中,非递归基线 NLL 为 4.742,而递归模型 L=3 和 L=5 分别退化到 5.429 和 5.530。也就是说,递归在这类任务上起了反作用。为什么?
分析起来:Text8 是自然语言,token 间的约束大多是局部的、平滑的(比如字符 n-gram 规律),而不像数独那样有严格的全局约束。递归循环带来的额外计算并没有在局部模式上提供帮助,反而可能引入了不必要的干扰。此外,作者也指出 NLL 指标可能具有误导性——低 NLL 不一定意味着生成文本更连贯,事实上他们观察到递归模型生成的样本反而更连贯(见附录 F),但 NLL 却更差。这说明语言建模的递归收益需要在更高层次的语义任务上进一步验证。
插图
这就引出了一个重要结论:递归深度最擅长解决具有显式多步依赖和全局约束的结构化问题。比如数独(约束满足)、Countdown(算术规划)这类任务,每次递归都扮演了“约束传播”的一轮,相当于执行了一次逻辑推理。而对语言生成这种“局部模式记忆”为主的任务,堆叠更多递归可能适得其反。

总结与展望

这篇论文首次系统性地将递归深度引入掩码扩散模型,证明了其作为参数缩放和推理加速第三轴的有效性。核心贡献是提出了 Recursive Masked Diffusion Models (R-MDMs),通过参数共享的递归循环,在结构化任务上实现了参数效率 5 倍、推理速度 2.7 倍的提升。同时,递归还提供了灵活的推理时计算控制。
未来方向也很清晰:如何将递归收益扩展到更通用的语言建模?可能的方式包括在更大规模的预训练模型上应用、结合更复杂的调度策略(如自适应循环次数)、或者引入专门的递归损失函数。此外,递归与思维链(Chain-of-Thought)的集成也值得探索——MDM 的递归循环可以看作一种隐式的推理链,而显式的文本链可能与之互补。
总之,这篇工作向社区传递了一个重要信号:不要只盯着参数数量,计算重用同样是一种力量。在边缘设备受限的场景下,递归可能是让“小模型办大事”的关键技术。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1: 递归深度 (K⊗L) 和传统深层模型 (KL⊗1) 的计算量一样,但为什么递归反而更有效?A: 关键在于参数共享。传统深层模型的每层参数独立,可能学到冗余的表示;而递归模型被迫在多次循环中复用同一组参数,这迫使参数变得更通用、更鲁棒。同时,递归的每个循环都能利用全局双向注意力同时更新所有 token,相当于在每次迭代中执行了一次“全局约束满足”,这比串联 K*L 层一次前向传播更高效。从优化角度看,递归模型的全步损失提供了密集的监督信号,减轻了梯度消失。

Q2: 为什么递归在 Text8 上不 work?是不是递归的局限性?A: 确实体现了任务依赖性。Text8 是字符级语言模型,局部统计规律占主导(如"th" 经常一起出现),不需要长距离全局推理。递归的优点是全局约束传播,对语言建模可能过度处理。而且论文指出 NLL 指标可能有问题——递归模型的生成样本反而更连贯,但 NLL 更差。所以不能简单说递归不好,只是对于纯局部模式的任务,递归带来的额外计算可能是浪费。未来在 BPE 级别、更长上下文的语言模型上可能有不同表现。

Q3: 文中提到的“步嵌入”具体是怎么工作的?一定要用吗?A: 步嵌入是可选的,使用步嵌入(learned 或 fixed)通常比不用效果好,尤其是当采样时的递归次数与训练时不同时。它的作用类似 RoPE 对位置编码,但针对的是递归循环而不是序列索引。具体是用一个 MLP 将归一化的循环进度 s_ℓ 映射为 d 维向量,加在隐藏状态上。这样模型就能感知当前是第几次循环,从而调整行为。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

将递归深度作为MDM的第三缩放轴,思路新颖,填补了递归在离散扩散模型中的空白。

实验合理度:★★★★★

对比设置清晰(iso-parameter, iso-FLOP),在多个任务上系统验证,消融充分。

学术研究价值:★★★★★

开创性地将递归与掩码扩散结合,为“计算换参数”提供了坚实证据,对理解生成模型的计算-参数权衡有重要理论意义。

稳定性:★★★☆☆

在结构化任务上表现稳定,但在文本任务上不如基线,稳定性受限于任务特性。

适应性以及泛化能力:★★★☆☆

对结构化问题泛化强(数独、算术规划);对自然语言泛化一般,适用场景有明显偏好。

硬件需求及成本:★★★★★

非常友好!递归模型参数少,训练成本与等FLOPs模型一致,推理时可通过减少去噪步数节省大量计算。

复现难度:★★★★☆

论文提供了完整的架构细节和超参数表,但代码未开源。实现递归循环和步嵌入并不复杂,主要挑战在于选择合适训练调度。

产品化成熟度:★★★☆☆

目前在心算、数独等玩具任务上效果惊艳,但离实际应用还有距离。其推理灵活性是很大的优势,但任务依赖性问题需要解决。

可能的问题:递归模型在非结构化语言任务上的退化令人担忧,需要更大规模验证;步嵌入在训练-采样循环数差距大时失效;对于超大规模模型,递归是否还能保持优势未知。


主要参考文献

[1] Carballo-Castro, A., et al. Recursive Scaling in Masked Diffusion Models. arXiv:2606.18022, 2026.
[2] Austin, J., et al. Structured Denoising Diffusion Models in Discrete State-Spaces. NeurIPS 2021.
[3] Saunshi, N., et al. Looped Transformers as Programs. ICLR 2025.
[4] Dehghani, M., et al. Universal Transformers. ICLR 2019.
[5] He, M., et al. Generative Quantization and Autoregressive Correction for Solving Sudoku. arXiv:2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
递归一下,模型变小,推理变快,这感觉不错吧?来群里和龙哥一起讨论更多“以小博大”的AI黑科技!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。