← 返回 PaperDaily 视觉与图像

大模型不需要深:一个递归技巧让数独生成器小5倍快3倍

模型大≠能力强?这篇来自洛桑联邦理工学院(EPFL)等机构的工作,直接把「递归循环」这一此前只在自回归模型里验证过的思路,正式引入了掩码扩散模型(MDM)。结果相当亮眼:一个6层Transformer循环5次,参数省5倍,模型小了,效果反而吊打30层模型!更绝的是,推理时去噪步数还能砍掉近3倍。龙哥觉得,这可能是近期最实用的模型「瘦身」思路之一。

大模型不需要深:一个递归技巧让数独生成器小5倍快3倍
🐉 龙哥读论文知识星球来了!
想低成本复现这种参数/步数双省的效果?星球每日拆解模型架构优化、参数效率提升文章,无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
xingqiu_header

龙哥导读:
模型大≠能力强?这篇来自洛桑联邦理工学院(EPFL)等机构的工作,直接把「递归循环」这一此前只在自回归模型里验证过的思路,正式引入了掩码扩散模型(MDM)。结果相当亮眼:一个6层Transformer循环5次,参数省5倍,模型小了,效果反而吊打30层模型!更绝的是,推理时去噪步数还能砍掉近3倍。龙哥觉得,这可能是近期最实用的模型「瘦身」思路之一。


原论文信息如下:
论文标题:
Recursive Scaling in Masked Diffusion Models

发表日期: 2026年06月

发表单位: EPFL (洛桑联邦理工学院), University of Cambridge (剑桥大学)

原文链接: https://arxiv.org/pdf/2606.19259v1.pdf

R-MDM:将递归引入掩码扩散模型的第三个维度

说到扩散模型,大家可能会想到连续图像生成的扩散模型(Diffusion Models),但近年来离散序列生成领域也出了个新星——掩码扩散模型(Masked Diffusion Model,MDM)。MDM 的工作方式很酷:它从全被蒙住的序列(全部是[MASK])开始,每一步通过双向注意力机制同时预测所有被遮住的 token,经过若干去噪步就能并行地生成完整序列。这跟自回归模型(AR)从左到右一个个吐 token 完全不同,MDM 天生适合需要全局依赖的任务(比如数独、算术规划),而且推理可以并行,速度杠杠的。
以往想提升 MDM 的能力,大家想到的无非两条路:加大模型参数量(更深、更宽) 或者 增多去噪步数。但这篇来自洛桑联邦理工学院(EPFL)和剑桥大学的工作,却刚正不阿地告诉我们:还有第三条路——递归深度(Recursive Depth)。他们提出的 R-MDM(Recursive Masked Diffusion Model),在每次去噪过程中,把同一个 transformer block 反复应用 L 次,权重完全共享,不增加额外参数,但有效深度变成了 K×L。这个操作一下子给模型增加了两个惊喜:参数效率飙升,去噪步数也能省!
图1:常规能力提升往往靠增大模型,而本文方法通过循环MDM自身的预测来提升生成质量。模型并行预测所有token,然后迭代精炼序列,纠正早期错误,用更少的解码步获得更高质量的样本。
图1:常规能力提升往往靠增大模型,而本文方法通过循环MDM自身的预测来提升生成质量。模型并行预测所有token,然后迭代精炼序列,纠正早期错误,用更少的解码步获得更高质量的样本。
背后的直觉很简单:MDM 的每一步去噪,自注意力可以同时看到所有位置;如果把这个过程在同一个模型里重复几次,每次都是基于当前所有位置的最新预测再做一次全局交互,那模型就有机会自我纠错、充分传播约束。而自回归模型不行,你每次递归只能向右看一个位置,效率差多了。所以 MDM 天生适合递归。

递归深度=参数稀疏+步数压缩:双倍效率

咱们先理清概念:在 R-MDM 中,有一个共享的 K 层 transformer 块 fθ,在每次去噪步骤中,这个块会被循环应用 L 次。也就是说,输入经过 embedding 后,先经过 fθ 得到隐状态 h(1),然后再把 h(1) 送给 fθ 得到 h(2),以此类推,直到 h(L),最后通过共享的 LM head 输出 logits。参数总量 = 一个 K 层模型 + 一个 step embedding 的小 MLP(增加 O(d²) 参数,忽略不计)。
那它怎么实现“双倍效率”呢?首先,参数稀疏:一个 (6 ⊗ 5) 的模型(6层递归5次)只有 10.6M 参数,但有效深度达到了 30 层。而一个常规的 (30 ⊗ 1) 模型有 53.1M 参数,是前者的 5 倍。两者 FLOPs 相同(因为都是跑 30 层的计算量),但参数相差巨大。实验结果证明,在数独这类任务上,小参数递归模型的表现完全不输甚至超过大参数非递归模型。这就是用计算换参数——训练时多花点时间反复用同一组权重,但存模型时小得多。
其次,步数压缩:递归可以替代一部分去噪步。去噪步(T)和递归步(L)是两种不同的迭代方式。去噪步是在不同的噪声水平间逐步揭晓序列;递归步则是在同一个噪声水平内反复精炼。实验发现,一个带递归的模型可以用更少的去噪步达到和传统模型相同的生成质量。比如,在 9×9 数独上,带递归的模型(T=5, L=3)总共只需 15 次前向传播就能达到 95% 的有效率,而传统模型需要 T=40 次前向传播。这相当于把推理计算量压缩了 2.7 倍!
更妙的是,这两个效率还能同时享受:你既可以用小参数模型达到大参数模型的性能,又可以用少数去噪步达到多次去噪的效果。这就是论文标题“递归缩放”的核心:递归作为第三个独立的缩放轴,与模型参数、去噪步数正交。
图2:标准一次通过MDLM与递归变体的对比。递归模型在精炼步骤中重复使用相同的transformer块,可选地加上步嵌入。在推理时,每个去噪步内部有一个递归循环来精炼预测。
图2:标准一次通过MDLM与递归变体的对比。递归模型在精炼步骤中重复使用相同的transformer块,可选地加上步嵌入。在推理时,每个去噪步内部有一个递归循环来精炼预测。
训练时,作者试了多种目标函数:All-steps loss(对所有递归步的交叉熵取平均)、Final-step loss(只监督最后一步)、Weighted loss(加权)、Truncated loss(只监督最后k步)。结果发现 All-steps loss 最稳,因为给每一步都提供了梯度信号,类似于深度监督。另外还设计了步嵌入(step embedding),用一个位置编码告诉模型当前是第几次递归,帮助模型在不同递归步表现出不同的行为(早期聚焦不确定性,后期聚焦精炼)。

如何用L次递归的浅模型超越L倍参数的深模型?

这个问题对应论文的 RQ1:递归能否替代参数缩放?作者设计了两类对比实验:等参数对比(iso-parameter)等计算量对比(iso-FLOP)
等参数对比:固定参数量,比较有递归 vs 无递归。结果一目了然:在 9×9 数独上,一个 (6 ⊗ 5) 的递归模型(10.6M 参数)比一个同样 10.6M 参数的非递归模型(6层)强得多,尤其是在少去噪步(T=5)的场景下,递归模型有效谜题率(VPR)高达 93.6%,而非递归只有不到 60%(看图 3)。Countdown 任务上,递归效果的提升更夸张:Countdown-5 任务,在 T=30 步时,递归模型 L=10 达到 56.4%,非递归基线只有 15.6%。
图3:递归精炼深度(L)对Sudoku 9×9和Countdown在不同目标长度(3,4,5位数)下的任务性能影响。增大L一致地提高成功率,难度越大收益越明显。
图3:递归精炼深度(L)对Sudoku 9×9和Countdown在不同目标长度(3,4,5位数)下的任务性能影响。增大L一致地提高成功率,难度越大收益越明显。
等计算量对比:这才是最令人兴奋的。把 (6 ⊗ 5) 递归模型(10.6M)和 (30 ⊗ 1) 非递归模型(53.1M)对比——两者前向传播次数一样(都是 30 层 transformer 的计算量),但参数差了 5 倍。结果呢?在数独 T=5 时,递归模型 VPR 93.6%,30 层模型只有 77.8%,递归模型完胜!这意味着你可以用更小的显存占用和更少的参数存储,得到比大模型还好的效果。论文图 5 汇总了数独和 Countdown 上的等计算量对比。
图5:在匹配有效模型深度(等计算量)下递归的效果,Sudoku 9×9和Countdown不同目标长度。
图5:在匹配有效模型深度(等计算量)下递归的效果,Sudoku 9×9和Countdown不同目标长度。
值得一提的是,25×25 超大型数独上,递归的威力更加突出。80% 遮挡的条件下,非递归基线几乎全部失败(T=5 时 VPR 6.6%),而递归模型 L=5 达到了 91.8%。这说明任务的结构化程度越高、难度越大,递归的价值就越大。
图4:递归精炼深度(训练和采样固定L)对25×25数独在不同遮挡条件下的重建效果。所有遮挡条件下,递归都提高了有效谜题恢复率。
图4:递归精炼深度(训练和采样固定L)对25×25数独在不同遮挡条件下的重建效果。所有遮挡条件下,递归都提高了有效谜题恢复率。
下面这个表格展示了等计算量模型对的参数量对比,一目了然:
表1:图5中等计算量模型对的参数量。递归模型使用固定K层骨干((K⊗L));基线展开KL层且无权重共享((KL⊗1))。
表1:图5中等计算量模型对的参数量。递归模型使用固定K层骨干((K⊗L));基线展开KL层且无权重共享((KL⊗1))。

一个模型两面吃:递归如何节省参数又省去噪步数?

RQ2 回答另一个灵魂拷问:递归能不能减少所需去噪步数?答案是:能,而且非常显著。
首先,作者验证了推理时递归步数的灵活性:一个在训练中用 Lt 步递归训练的模型,在推理时可以自由选择不同的 Ls 步递归,不会崩溃。图 6 的热力图显示,适当地外推(Ls > Lt)甚至能进一步提升性能,但 Ls 远小于 Lt 会显著变差,因为模型学会了依赖后续循环来精炼。
图6:训练递归深度(Lt)与采样递归深度(Ls)之间的交叉递归权衡,针对9×9数独任务。上方热图是单步解码,下方是5步解码。
图6:训练递归深度(Lt)与采样递归深度(Ls)之间的交叉递归权衡,针对9×9数独任务。上方热图是单步解码,下方是5步解码。
然后重点来了:把计算预算固定,比较把计算分配到递归步 vs 分配到去噪步。图 7 展示:给定总前向传播次数 x = T × L,递归模型在数独上完胜基线。比如,总前向传播 10 次,基线(T=10, L=1)VPR 85.0%,而递归模型(T=1, L=10)VPR 94.2%,绝对提升 9.2%。最惊艳的是,递归模型(L=3, T=5)只需总前向传播 15 次就达到 95.6% VPR,而基线需要 40 次才能达到 95.8% VPR——相当于推理计算量降到原来的 37.5%!
图7:总计算预算(前向传播次数 x = T×L)与有效谜题率的关系(Sudoku 9×9)。(使用逆课程训练Schedule 10→1)将计算预算分配到递归深度可以比非递归基线缩放去噪步更高效。
图7:总计算预算(前向传播次数 x = T×L)与有效谜题率的关系(Sudoku 9×9)。(使用逆课程训练Schedule 10→1)将计算预算分配到递归深度可以比非递归基线缩放去噪步更高效。
最后一张 figure 8 是参数-步数帕累托前沿,总结了递归模型在参数和步数两个维度上的优势。比如,在数独上要达到 95% VPR,最优非递归模型需要 18 层(31.9M)和 T=20 步,而递归模型 (6⊗3) 仅需 10.8M 参数和 T=10 步,参数量减少 2/3,步数减半。简直就是“两面吃”——既省参数又省步数。
图8:模型参数量与达到目标性能所需解码步数T之间的帕累托前沿。上:Sudoku 9×9需要95% VPR;下:Countdown 4需要70% RTR。递归模型(训练和评估用固定步)以更少的参数超越非递归变体。
图8:模型参数量与达到目标性能所需解码步数T之间的帕累托前沿。上:Sudoku 9×9需要95% VPR;下:Countdown 4需要70% RTR。递归模型(训练和评估用固定步)以更少的参数超越非递归变体。
插图

只在于结构化:为什么递归在Sudoku上奏效,在Text8上不行?

看到这里你可能会问:递归这么好,那是不是所有任务都能用?实验结果给了我们一盆清醒的冷水——在 Text8 字符级语言建模上,递归模型的表现反而比单次通过模型差。表 11 显示,基线 NLL 4.742,L=3 递归模型 NLL 5.429,L=5 递归模型 NLL 5.530。这是为什么?
深度思考一下:Text8 是连续的自然语言字符序列,相邻字符的依赖主要是局部的、从左到右的,全局约束很少。而递归的精髓在于——每次循环利用双向注意力对整个序列做全局交互和约束传播。在自然语言上,这种全局交互并不关键,反而可能引入多余的迭代,让模型过度平滑或陷入次优解。更关键的是,语言建模的评价指标 NLL(负对数似然)偏向于自信预测,而递归模型可能会产生更平滑、更保守的预测,导致 NLL 更高,但实际生成文本可能更连贯(论文附录中确实展示了定性样本,递归模型生成的文本更通顺)。所以“不好”可能只是指标上的假象。
表11:text8评估结果。报告5次采样运行(每次100个样本)的均值和标准差。
表11:text8评估结果。报告5次采样运行(每次100个样本)的均值和标准差。
这和自回归模型中的循环 transformer 文献结论一致(Saunshi et al. 2025, Geiping et al. 2025):递归在需要迭代推理、全局约束的任务上效果显著,但在类语言模型这类以局部模式为主的生成任务上优势不明显。因此,递归最适用的场景是结构化推理——数独、算术规划、逻辑推理、代码生成等。如果任务是纯粹的连续文本生成,递归可能不是最好的选择。
这个发现很重要:它告诉我们,不是所有问题都值得用递归,选择正确的武器打正确的仗。

龙迷三问

下面是龙哥针对大家可能的一些疑问做的解答:

什么是“递归深度”?和普通模型深度、去噪步数有什么区别?递归深度(L)是指在一次去噪步骤中,同一个 transformer block 被重复应用的次数。普通模型深度(K)是不同层数,去噪步数(T)是在不同噪声水平之间迭代的次数。R-MDM 的递归深度是第三个正交维度:K×L 是有效推理深度,但参数量只相当于 K 层。三者可以独立缩放。

为什么递归在数独上那么强,在 Text8 上却弱了?因为递归本质上是通过多次全局双向注意力来传播约束和纠正错误。数独具有严格的行/列/宫约束,每一步都需要考虑全局影响;而字符级语言生成主要依赖局部依赖,递归带来的全局交互帮助不大,甚至可能引入冗余计算导致指标变差。结论:递归最适合那些需要迭代推理和全局约束的结构化任务。

R-MDM 训练时怎么选择递归步数?推理时能灵活改吗?训练时可以用固定递归步,也可以用课程学习逐步变化,或者从分布中采样。推理时高度灵活:只要不是 Ls 远小于 Lt,模型都能正常工作,甚至适当外推(Ls > Lt)还能进一步提升性能。这给用户留下了在推理时根据计算预算自由调节的空间。

如果你还有想了解的,欢迎在评论区留言讨论~

龙哥点评

论文创新性:★★★★☆

将递归机制系统性地引入掩码扩散模型,并证明其作为第三个缩放轴的有效性,思路新颖。虽然递归在自回归模型中已有探究,但作者巧妙利用了 MDM 双向注意力的优势,赋予递归全新的意义,创新性足够。

实验合理度:★★★★☆

实验设计严谨,覆盖等参数、等计算量、跨任务、跨问题规模、递归灵活性、参数-步数帕累托前沿等多个维度。且使用了 5 次独立采样报告均值和标准差,统计可靠。缺少在更大规模语言模型上的验证(但受限于计算资源,可理解)。

学术研究价值:★★★★★

首次将递归作为 MDM 的独立缩放维度系统研究,开辟了新的优化方向。其“用计算换参数、递归替代去噪步”的思想对资源受限的模型部署有重要启发,也为理解生成模型中迭代计算的角色提供了新的视角。

稳定性:★★★☆☆

在结构化任务上非常稳定,推理时递归步数可以灵活调整而不崩溃。但在 Text8 等非结构化任务上表现下降,稳定性依赖于任务类型。另外,论文仅评估了特定调度下的稳定性,更广泛的鲁棒性测试(如噪声干扰、分布外样本)缺失。

适应性以及泛化能力:★★★☆☆

在数独、Countdown 等结构化任务上泛化出色(特别是 25×25 超大规模),在 Text8 上泛化不佳。显示出任务导向的适应性局限。未来需要验证在更多类型的数据(如代码、数学问题、对话等)上的表现。

硬件需求及成本:★★★★☆

训练时需要循环多次,训练时间成本增加(L 倍前向计算),但参数少,显存占用更小。推理时可以通过调节 L 与 T 的分配来优化延迟,大多数情况下可以实现比非递归模型更快的推理(匹配性能时步数更少)。整体硬件需求中等偏低。

复现难度:★★★★☆

方法清晰,附录中提供了详细的架构和超参数。训练时只需要修改标准 MDM 框架加入循环和 step embedding。但需注意循环次数对齐等细节。论文未提及是否开源代码,如果开源则复现难度极低(目前尚未找到公开仓库)。

产品化成熟度:★★★☆☆

结构化的推理增强思路适合集成到需要符号推理的产品(如数独求解器、数学解题器)。但自然语言产品中优势不明显。目前仅在小型任务上验证,距离大规模产品落地还需更多工程化实践。

可能的问题:1)递归能否推广到更大的语言模型(如 MDM 在 1B+ 规模)尚不明确;2)训练时增加了 L 倍前向计算,总训练成本可能抵消参数节省的红利;3)在非结构化语言任务上效果下降,限制了通用性;4)步嵌入采用归一化进度 sℓ,可能限制了模型对绝对循环位置的区分能力。


主要参考文献

[1] Carballo-Castro, A., Piskorz, J., Rauba, P., van der Schaar, M., Frossard, P. Recursive Scaling in Masked Diffusion Models. arXiv:2606.19259, 2026.
[2] Austin, J., et al. Structured Denoising Diffusion Models in Discrete State-Spaces. NeurIPS 2021.
[3] Sahoo, S., et al. Simple and Effective Masked Diffusion Language Models. NeurIPS 2024.
[4] Saunshi, N., et al. Looped Transformers as Dynamic Computation. ICML 2025.
[5] Svete, A., Sabharwal, A. Parallel Generation with Masked Diffusion: Expressive Power. ICLR 2026.
[6] Giannou, A., et al. Looped Transformers are Turing Complete. NeurIPS 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。