← 返回 PaperDaily
视觉与图像
告别每步都算谱分解!Meta让Muon在15B DiT上跑出性价比
训练扩散Transformer最烧钱的不是模型,而是优化器?Meta这篇新作把Muon优化器从1.3B一路验证到15B,生成质量稳定赢过AdamW最高19.1%,又用「周期性行式」设计把优化器通信量砍掉66.7%。质量不掉、速度反超,训练成本敏感的同学值得细读。
龙哥读论文
发布于 2026-08-26 00:20:10
阅读 3
查看原文
原论文信息如下:
如果问2026年训练扩散模型最心疼的是什么,答案大概率不是模型设计,而是显卡账单。动辄几十万张H100烧出来的训练集群,每一步都在烧钱,而优化器作为每次参数更新的「方向盘」,却在很长一段时间里被当成了固定配件:AdamW打天下,从语言模型打到图像生成,从几亿参数打到几千亿参数。
但AdamW真的那么完美吗?前两年Muon优化器横空出世,亮出「矩阵感知」的招牌,在LLM训练上打出了比AdamW更省步数的战绩。可Muon有个致命伤:每一步都要对动量矩阵做一次5步Newton-Schulz迭代(简称NS5),还要在全卡之间广播完整的动量矩阵。这玩意儿在小模型上没什么感觉,一旦到了十亿、百亿参数规模,额外的计算和通信开销能把Muon省下来的步数优势全部吃回去,甚至倒贴。
Meta的研究团队这次直接把问题摆上台面:Muon在扩散Transformer(DiT)上从1.3B一路扩到15B,到底行不行?如果行,能不能把系统开销压下来,让省下来的优化步数真正变成省下来的GPU时?他们给出的答案是「周期性行式Muon」——每三步才做一次完整的NS5谱变换,中间两步用极其便宜的行归一化(RowNorm)顶着。听起来像偷工减料?实验结果却相当能打:生成质量保持基本持平,优化器时间直接砍掉一半,通信量暴降66.7%。
这篇文章,龙哥就带大家拆一拆:Muon在扩散模型上到底凭什么赢,昂贵在哪儿,Meta又是怎么把「贵」的部分从每步必做变成三步一做的。
Muon优化器在扩散Transformer上到底行不行?
先给不熟悉Muon的读者补个背景。AdamW的核心思想是对每个参数单独估计梯度的一阶矩和二阶矩,然后做逐元素归一化。这种操作的好处是完全「坐标可分」——每个参数的更新只依赖它自己的统计量,分布式训练里每个卡只要握有自己的分片就能算,几乎不产生额外的通信。
Muon的思路截然不同。它把二维权重矩阵当成一个整体,对动量的奇异值结构做「整形」,在更新方向上引入全局的谱结构。用数学点的话说,Muon每次更新都在逼近动量矩阵的极分解(polar factor),让更新方向更像一个「旋转」而不是逐元素缩放。这在优化理论上很漂亮:对于深层网络的矩阵参数,全局的旋转往往比逐元素的各向异性缩放更符合优化的几何需求。
问题在于「整形」的实现。论文用的是5步Newton-Schulz迭代,即NS5。每一步都涉及矩阵乘法,对于一个大小的矩阵,总计算量是AdamW的Θ(J·r)倍——这里r是矩阵的短边维度,通常就是隐藏层宽度。模型越大,r越大,这个倍数就越吓人。更要命的是,NS5需要把分布在各个GPU上的动量分片全部聚合成完整矩阵,算完再切回去。这种「全动量广播」在分布式训练里是纯纯的通信负担。
所以问题就变成了:Muon的优化优势到底能不能盖过它的系统开销?在小模型上,这或许可以靠算力硬顶过去;但在十亿参数以上的DiT上,每一步都做NS5和全量通信,成本高到可能让Muon的「省步数」变成「费时间」。
从1.3B到15B:Muon的扩展性验证
论文的第一步工作,是先建立一个干净的基准:Muon和AdamW在扩散Transformer上,从1.3B、4B、9B到15B四个规模,各训6万步,全局batch size固定4096,所有模型在GPIC数据集上从零开始训练。这是一次非常「工业化」的验证——不是在一个模型上碰运气,而是看趋势。
结果很清晰:四个规模上,Muon的验证损失全程低于AdamW ,生成质量最佳FD-DINO平均提升12.9%~19.1%。这说明Muon的优化优势不是小模型的偶然现象,而是能跨规模稳定复现的算法特性。
但把验证损失按真实墙钟时间重画一遍,情况就微妙了。图1(c)显示,在同样的训练时长下,AdamW反而更早到达中等质量水平。原因不复杂:Muon每一步的计算和通信开销太大,把优化步数上的优势抵消掉了。也就是说,Muon是个「算法上优秀、系统上昂贵」的偏科生。
周期性行式Muon:如何用1/3的谱变换保住95%的收益
既然NS5每一步都做太贵,那能不能隔几步做一次?Meta团队的选择是:每K步做一次完整的NS5谱刷新,其余K-1步改用一种极便宜的行级归一化操作RowNorm 。K默认取3,也就是每隔两步做一次NS5。
这里的核心洞察是:RowNorm不是在近似NS5,而是在两种不同的矩阵几何之间交替 。NS5的极分解施加的是全局谱约束——所有行和奇异方向耦合在一起;RowNorm则是逐行独立归一化,只控制每一行的长度、不改变方向,对应的是ℓ2,∞几何。论文证明,极分解方向在矩阵远离秩退化时是局部Lipschitz稳定的——动量变化不大,极好的,龙哥已理解全部需求。以下是生成的公众号文章主体HTML内容,严格遵循了左对齐、无首行缩进、图片公式表格占位、子标题格式、字数范围等所有约束。
从1.3B到15B:Muon的扩展性验证
先别急着看方法,得先把底数摸清楚:Muon在真正的大规模扩散Transformer上,到底能不能打?论文的第一步就是在GPIC数据集上,从零开始训练了四个规模的DiT模型——1.3B、4B、9B和15B参数,统一用512×512分辨率,全局batch size 4096,所有模型训练60000步。GPIC是包含1亿图文对的大规模数据集,图文来自Flickr和Wikimedia,caption由Qwen3-VL-4B-Instruct生成。这配置说是“工业化验证”一点都不夸张。
训练目标本身并不复杂。DiT的经典训练方式是给定干净样本、扩散时间步和噪声,构造带噪输入,让模型去预测速度目标,损失函数是简单的均方误差。所有辅助条件比如文本嵌入,这里暂时忽略不计。AdamW作为基线,对全部参数做逐坐标自适应更新;Muon则对二维权重矩阵做矩阵感知更新,而偏置、归一化参数等非矩阵参数仍然交给AdamW。
图1:DiT训练使用的速度预测损失函数。其中θ为模型参数,x为干净样本,a为扩散时间步,ε为噪声,x_a为加噪后的输入,v_θ为模型预测的速度,v*为真实速度目标。
那么战况如何?从验证损失来看,四个规模上Muon全程压着AdamW打,从未被反超。生成质量上,以FD-DINO作为主要指标,Muon的最佳观测值比AdamW提升了12.9%到19.1%。这个优势不是偶发的,而是随着训练推进一直稳定存在。单看这里,Muon确实是个好优化器,算法层面的扩展性没有毛病。
但是!一旦把横轴从训练步数换成真实墙钟时间,画风突变。由于Muon每一步都要做NS5谱变换和全动量通信,单步开销远高于AdamW,它的验证损失曲线整体右移。在同样的墙钟时间内,AdamW反而能更早达到中等损失水平。这意味着Muon的“省步数”优势被“费时间”给抵消了。训练成本敏感的同学看到这儿应该心头一紧——这就是论文接下来要解决的核心问题。
图2:不同模型规模下的生成质量对比。报告了最终检查点和训练中最佳检查点相对于AdamW的FD-DINO提升幅度。可以看到Muon在所有规模上都有显著优势。
周期性行式Muon:如何用1/3的谱变换保住95%的收益
既然每一步都做全量谱变换太奢侈,一个自然的想法冒出来:能不能每K步只做一次完整的NS5,中间用便宜操作顶住?论文把这个想法落成了——周期性行式Muon(Periodic Row-wise Muon)。
具体怎么做的?给定周期K和行归一化乘子γ,刷新指示器ρ_t决定当前步走哪条分支:如果t是K的倍数,就走昂贵的NS5谱刷新;否则用γ乘以行归一化(RowNorm)操作,直接作用在当前动量上。默认配置K=3,γ=0.15,意味着每三步才做一次完整谱变换,另外两步全用RowNorm。
图3:周期性行式Muon的更新规则。其中ρ_t为刷新指示器,NS5表示5步Newton-Schulz迭代,R_ε为行归一化操作,γ为行归一化乘子。
这里得解释一下牛顿-舒尔茨迭代(Newton-Schulz iteration,简称NS5),它是一种不需要显式做奇异值分解就能逼近矩阵极分解的迭代算法,通过五次矩阵乘法和缩放逐步把动量矩阵矫正成近似正交的方向。而RowNorm要朴素得多,对于动量矩阵的每一行,直接除以该行的模长,把每行的长度缩放到1附近,保留原始方向。论文特别强调了一个意味深长的观点:RowNorm不是NS5的低配近似,而是一种独立的矩阵几何。NS5施加的是全局谱约束,所有行和奇异方向耦合在一起;RowNorm则是逐行独立的ℓ2,∞几何,每行只控制幅度不改变方向。两种几何交替使用,反而比单纯近似更合理。
那γ是干什么用的?由于NS5和RowNorm这两种归一化映射的约束集合不同,即便它们的Frobenius范数都为√r,也不意味着有相同的稳定更新幅度。直接沿用Muon的学习率,等价于默默假设γ=1,这缺乏理论支撑。所以论文引入γ单独校准行归一化分支的有效步长,用固定的γ保持两者学习率调度之间的恒定比例。
图4:行归一化RowNorm的计算公式。X_i:为动量矩阵的第i行,分母为改行的模长与阈值ε的较大值,保证数值稳定性。
从理论上讲,周期性谱刷新是有依据的。论文给出了一个极分解方向的局部稳定性上界:当矩阵远离秩退化时,动量发生中等变化,理想极分解方向的变化也是受控的。这意味着不需要每一步都做全量谱变换,每隔几步刷新一次,中间用RowNorm稳一稳,足够了。
图5:极分解方向局部稳定性的理论上界。其中P(A)和P(B)分别为矩阵A和B的极分解因子,σ_min为最小奇异值。该不等式说明只要矩阵不接近秩退化,极分解方向对动量变化是鲁棒的。
那么K和γ怎么选?论文做了系统的网格搜索。结果发现K从2增加到3,可以把NS5刷新次数减少33%,而FD-DINO只恶化2.8%;但K从3增加到4,虽然再节省25%的刷新次数,FD-DINO却恶化了8.2%。这就像一个临界点:K=3是性价比最优的甜点区。
图6:K和γ的消融实验选择。(a) 不同K和γ下,后期FD-DINO在2万、2.5万和3万检查点上的平均值。(b) 各刷新周期下最优平均FD-DINO随γ的变化。K=3时FD-DINO仅比K=2恶化2.8%,但NS5刷新次数减少33%;K=4虽然再省25%刷新次数,但FD-DINO恶化8.2%。最终选择K=3,γ=0.15。
分布式协同设计:把通信藏进计算里
算法层面省下了计算,系统层面还得让通信跟着降下来。在分布式训练中,Muon的NS5变换不是分片友好的——每个rank手里的动量分片,无法独立计算出完整的谱更新结果。标准的做法是做全量all-gather,把分布在所有rank上的动量分片聚合成完整矩阵,每张卡上复制一份,各自算NS5,算完只保留自己那份切片,其余全部丢弃。这种“全动量广播”的通信开销,是Muon在系统层面的主要痛点。
周期性行式Muon的分布式设计,核心思想是“两条分支,两套通信策略”。刷新步用桶化all-gather流水线,把动量矩阵分成通信桶,当前桶的动量一旦完成all-gather,立刻重建完整矩阵算NS5,同时异步发起下一个桶的all-gather。这样通信和计算可以重叠起来,暴露给用户的通信延迟大幅缩短,同时任何时刻只需物化有限数量个动量矩阵。
图7:全动量通信量的估算公式。其中b为每个动量元素的字节数,p为分片组内的rank数量,m×n为动量矩阵尺寸。
非刷新步的RowNorm就更省了。如果矩阵是矮胖型,即m≤n,那每行归一化完全在本地完成,零优化器通信。但如果是瘦高型,即m>n,行方向跨多个rank,需要算全局行范数。这时候论文的做法是:各rank先算自己的部分平方和,只对范数统计量做all-reduce,而不是把整个矩阵广播出去。这段统计量通信还可以藏到其他矩阵的本地计算后面。公式(8)展示了瘦高型矩阵的分布式RowNorm计算方式:每个rank计算自己行分片对应列的平方和,再通过sum all-reduce合并得到全局范数。
图8:瘦高型矩阵分布式行归一化的统计量计算公式。S_p表示rank p拥有的原始行索引集合,q_j^(p)为本地列分量的平方和,ν_j为全局列范数。
最终的计算量账本也清晰了。每个周期K步里,矩阵处理的平均计算量从纯Muon的一次NS5,变成了每周期一次NS5加K-1次RowNorm;通信量按K倍比例压缩。对于矮胖型矩阵,RowNorm的通信量为零;瘦高型矩阵的行范数通信量也只有全量通信的O(1/m)分之一。公式(9)给出了周期平均计算量和通信量的精确表达。
图9:周期平均计算量与通信量公式。C_NS5为一次NS5的计算量,C_RN为一次RowNorm的计算量,V_AG为刷新步的通信量,V_RN为非刷新步的通信量,K为刷新周期。
实验结果:质量不掉,速度翻倍
到了最激动人心的验证环节。论文在1.3B、4B、9B、15B四个规模上,把AdamW、vanilla Muon和周期性行式Muon用相同算力、相同数据、相同步数严格对比。评估指标横跨分布距离、保真度、多样性、对齐度和组合能力,可以说是把生成质量从多个角度测了个遍。
先看硬指标。表1全面对比了四个规模在60000步最终检查点上的表现。1.3B规模上,周期性行式Muon的FD-DINO达到45.65,不仅优于AdamW的53.93,还反超了vanilla Muon的46.08;最亮眼的组合能力上,GenEval2的AM分数从AdamW的38.66直接拉到45.89。9B规模更是夸张,GenEval2的AM从45.93飙到57.33,GM从9.66涨到15.97,组合成图的能力明显上了一个台阶。
表1:最终60000步对比结果。粗体表示同模型大小下优化器中的最佳结果。指标涵盖FD-DINO、FID、MMD-DINO(分布距离),Precision、Recall、Coverage、Density(保真度与多样性),HPSv2(对齐度),GenEval2 AM与GM(组合能力)。
再看效率账。表2显示,在1.3B模型上,周期性行式Muon相比vanilla Muon,端到端单步时间从1.873降到1.419,优化器时间从0.835降到0.443。15B模型上优化器时间降幅达54.3%,端到端步时间降23.4%。通信量和all-gather次数更是大幅缩水,单步通信量从28.62 GiB/rank降到9.54 GiB/rank,逻辑通信量减少三分之二。
表2:32节点H100上的系统效率对比。Step time为端到端单步时间,Opt. time为优化器时间,Opt. share为优化器时间占比,AG/step为每步all-gather次数,AR/step为每步all-reduce次数,Comm. volume为单卡每步通信量。
图4展示了15B模型上的profiler轨迹。可以直观看到,周期性行式Muon把每三步中两步的NS5阶段和全动量all-gather替换成了短小的RowNorm更新,刷新步的通信则与NS5计算重叠,范数统计通信与本地计算重叠。红蓝区块的对比一目了然——大块的纯通信和纯计算被“拼”在了一起。
图10:15B模型的简化profiler轨迹。周期性行式Muon将大部分NS5阶段和全动量all-gather替换为RowNorm更新,并通过通信与计算重叠大幅缩短暴露时间。
最终各方位的战绩汇总在图2和图3里。在最佳FD-DINO对比中,周期性行式Muon在1.3B和4B上与vanilla Muon差距小于0.5%,但9B上反超4.5%,15B上反超2.7%;在到达最佳生成质量所需的有效训练时间上,四个规模分别省下33.7%、36.1%、64.8%和57.4%。可以说,这台“省油发动机”不仅跑得远,还真的省油。
图11:可选检查点选择下的生成质量前沿。周期性行式Muon以更少的有效训练时间达到可比的最高生成质量,在9B和15B上还实现了反超。
局限与未来:还有哪些路要走
论文虽然结果漂亮,但必须冷静看待几个局限。第一,K和γ目前是通过网格搜索确定的经验值,不存在自适应的调整机制,换模型规模、换数据集可能都得重新调一遍。第二,实验只覆盖了扩散Transformer这一种架构,在纯语言模型、混合模态模型上的表现仍是未知数。第三,15B参数的验证是否足以代表“真正的超大规模”,在百亿甚至千亿参数时代,通信模式可能又会变。
另外有一点值得关注:论文是在FSDP2分片执行路径下做的系统设计,如果换用张量并行、流水线并行等其他并行范式,通信拓扑和通信量计算完全不同,结论不一定能直接迁移。这里的“成本优势”是绑定在特定分布式策略上的。未来一个有意思的方向是让K和γ在训练过程中自适应——比如损失下降快时多刷几次,平台期少刷几次,把每一分算力都花在刀刃上。
龙迷三问
这篇论文到底在解决什么问题? Meta与南加州大学联合验证Muon优化器在1.3B~15B扩散Transformer上的扩展性,相比AdamW生成质量提升12.9%~19.1%。
这篇工作最值得看的点是什么? Periodic Row-wise Muon在1.3B-15B规模上,最佳FD-DINO较AdamW提升12.9%-19.1%;与vanilla Muon相比,1.3B-4B模型最佳生成质量差距在0.5%以内,9B和15B分别提升4.5%和2.7%;优化器时间减少46.9%-54.3%,端到端步时间减少15.7%-24.3%,通信量减少66.7%。
这篇工作的边界或风险在哪里? 优点:(1) 系统性地验证了Muon在1.3B-15B DiT上的可扩展性;(2) 提出的Periodic Row-wise Muon在保持生成质量的同时大幅降低系统开销;(3) 分布式协同设计(分桶all-gather、通信计算重叠、分片RowNorm)具有实用价值。缺点:(1) 仅在一个DiT家族、一个数据集和32节点H100配置上评估;(2) 使用固定的全局K和γ,未探索逐层或自适应调度;(3) refresh步骤仍保留全动量通信和物化开销。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出周期性行式Muon优化器,通过每隔K步执行一次完整的NS5谱变换、其余步骤使用低计算和通信成本的行归一化更新,并配合分布式协同设计,在保持生成质量的同时大幅降低大规模DiT训练的系统和通信开销。
实验合理度: ★★★★☆
FD-DINOv2, FID, MMD-DINO, Precision, Recall, Coverage, Density, HPSv2.1, GenEval2 (AM和GM)
学术研究价值: ★★★★☆
提出周期性行式Muon优化器,通过每隔K步执行一次完整的NS5谱变换、其余步骤使用低计算和通信成本的行归一化更新,并配合分布式协同设计,在保持生成质量的同时大幅降低大规模DiT训练的系统和通信开销;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
NS5每矩阵计算复杂度为Θ(5r²c),RowNorm为Θ(rc);Periodic Row-wise Muon将优化器时间减少46.9%-54.3%,端到端步时间减少15.7%-24.3%。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 仅在一个DiT家族、一个数据集和32节点H100配置上评估;
[1] Chenghao Li, Xiao Han, et al. Scaling Muon for Diffusion Transformers. arXiv:2608.20818, 2026.
[2] Jordan Keller, et al. Muon: An optimizer for hidden layers in neural networks. 2024.
[3] Loshchilov I, Hutter F. Decoupled weight decay regularization. ICLR, 2017.
[4] Peebles W, Xie S. Scalable diffusion models with transformers. ICCV, 2023.
[5] Lau T, Su W. Symmetry-compatible optimizer design. 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
🎉 训练大模型太烧钱?这篇论文连优化器的通信钱都帮你省了!想和龙哥一起追踪最新AI训练黑科技,破解大模型降本增效的密码?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 大模型训练+上海+Meta+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!