← 返回 PaperDaily
大模型与智能体
8张H20实测:Muon在RL后训练里真能赢AdamW?
Muon 在预训练里已经很能打,但到了强化学习后训练阶段,表现却一直不清不楚。这篇论文不讲玄学,直接拿三种优势估计器和学习率做对照,结果很扎眼:有的场景能涨 88%,有的场景却几乎没戏。
龙哥读论文
发布于 2026-08-14 09:11:18
阅读 3
查看原文
原论文信息如下:
Muon在强化学习中“水土不服”?这篇论文找到了决定性的变量
Muon 这几年在预训练里风头很足,靠着“别只盯着每个参数自己怎么缩放,改成看整个矩阵的方向”这套思路,省算力、提效率都挺能打。可问题来了:预训练能打,不代表强化学习后训练也能打 。这篇论文干的事很直接——别空谈“能不能迁移”,直接拿 agentic reinforcement learning(面向智能体的强化学习后训练)开刀,看 Muon 到底在哪些条件下会发光,在哪些条件下会翻车。
这里先把几个基础概念说人话。强化学习后训练 指的是模型已经有了基础能力,再通过奖励信号继续优化。agentic RL 则更像“让模型在环境里连续行动”,不是答一道题就结束,而是要一步一步探索、试错、修正。ALFWorld 就是这类任务的典型环境:模型要在家庭场景里完成找物、清洁、加热、冷却等多步任务,奖励又很稀疏,成功与否往往要走到最后才知道。
论文的核心矛盾也很明确:Muon 在大模型预训练里很香,但在 RL 后训练里到底是不是“纸面强、实战弱” ?作者没有靠猜,而是把优化器、优势估计器和学习率三件事一起拆开看。结果很有意思:决定 Muon 是否好用的,不只是优化器本身,而是它和 credit assignment 结构、学习率之间的“化学反应”。
三种优势估计器下的Muon表现天差地别
先说结论:Muon 并不是“统一增益包” 。同样是 ALFWorld,同样是 Qwen2.5-0.5B-Instruct,同样是 200 次更新,换个优势估计器,效果就会明显变脸。
论文比较了三类 group-based RL 方法。GRPO 是 Group Relative Policy Optimization(组相对策略优化),主要用整条轨迹的回报做组内相对优势;GiGPO 是 Group-in-Group Policy Optimization(组中组策略优化),在 episode-level 优势之外,再加一个 step-level 的局部信用分配;GraphGPO 则把多条轨迹汇成状态转移图,给每条转移分配更细粒度的信用。说白了,三者的区别就在于:到底是只看“整局赢没赢”,还是愿意多看几步“哪一步起了作用” 。
具体看数字,GiGPO 在 3×10-5 下,Muon 的 final-window success 从 0.290 提到 0.546,提升幅度接近 88%。这不是“浮动一下”的小修小补,而是肉眼可见的改观。GRPO 也有提升,但幅度明显更小;GraphGPO 则在 10-5 时表现最平衡,AUC 提升更明显,说明它更像“早学会、早稳定”的路线。
这背后其实不神秘。Muon 的核心做法是对带动量的矩阵更新做近似谱归一化,保留方向、压平奇异值幅度。翻译成人话,就是它不太在乎“某个方向上更新有多猛”,更关心“更新方向是否靠谱”。如果优势估计器给出的梯度信号本来就比较干净,Muon 这种“把方向拎出来再整理一遍”的方式就容易出效果;如果梯度噪声太大,它也可能把噪声一起抬起来,结果就会翻车。
为了更深入地理解这种差异,我们需要拆解一下三种优势估计器的内部机制。GRPO 的做法是:对于每个 prompt,采样一组轨迹(比如 8 条),然后计算每条轨迹的累计回报,再在组内做归一化得到优势。它的优点是简单、稳定,但缺点也很明显——它假设整条轨迹里所有动作的贡献是一样的,这在长时序任务中会引入大量噪声。比如在 ALFWorld 里,模型可能前 10 步都在乱逛,第 11 步偶然找到了关键物品,但 GRPO 会把这 11 步的“功劳”平均分配,导致真正关键的那一步被稀释。GiGPO 则是在 GRPO 的基础上,把轨迹按状态相似性进一步分组。具体来说,它会在轨迹中识别出“锚点状态”(anchor states),这些状态在多条轨迹中反复出现。然后,GiGPO 把经过同一锚点状态的不同动作放在一起做组内对比,从而分离出“在这个状态下,哪个动作更可能导向成功”。这种 step-level 的信用分配,相当于给每个关键决策点单独打分,而不是笼统地给整条轨迹打分。GraphGPO 则更进一步:它把多条轨迹合并成一个状态转移图,图中的节点是状态,边是动作,边的权重由转移频率和后续回报共同决定。然后,它用图上的反向传播算法(类似 value propagation)来给每条边分配信用。这种方法的优势在于能捕捉到跨轨迹的长期依赖——比如某个动作虽然在当前轨迹里没直接导致成功,但在其他轨迹里经常出现在成功路径上,GraphGPO 就能给它更高的信用分。这三种方法在信用分配的细粒度上构成了一个清晰的谱系:GRPO 最粗(episode-level),GiGPO 居中(step-level),GraphGPO 最细(transition-level)。而 Muon 的效果恰好与这个细粒度正相关:信用分配越细,梯度信号越干净,Muon 的谱归一化就越能发挥“去噪提纯”的作用。
深入GiGPO:为何步骤级信用分配让Muon大放异彩
GiGPO 是这篇论文里最值得盯住的地方。它的巧妙之处在于:它不是推翻 GRPO,而是在 GRPO 的基础上多加了一层 step-level 组内对比 。这样一来,整条轨迹的结果还在看,具体每一步的动作也开始被纳入信用分配。对于长时序、稀疏奖励的 agent 任务,这种设计很重要,因为“最后成功”往往是很多中间动作共同堆出来的,不是最后一步突然开窍。
论文里把 GiGPO 解释得很清楚:总优势 A 由 episode-level 的 AE 和 step-level 的 AS 组成,形式上可以写成 A = AE + ωAS。其中 ω 是 step-level 项的权重。当 ω = 0 时,GiGPO 就退化成 GRPO 。这点很关键,因为它让作者能在同一条代码路径里做“开关式”对照,而不是拿两个不同实现互相比,避免实验解释变得像绕口令。
这就解释了为什么 GiGPO 里 Muon 的提升最明显。ALFWorld 这种任务里,很多状态会在多条轨迹中反复出现,论文也提到重复状态占比不低。GiGPO 把这些 anchor states 重新分组,等于在“谁做对了哪一步”这件事上提供了更细的对照。对 Muon 来说,这很友好:它擅长处理方向更明确的矩阵更新,而不是在一团乱麻里硬找主方向。
为了进一步验证这个猜想,论文还做了一个很有意思的分析:他们统计了 GiGPO 下不同 ω 取值时,梯度矩阵的奇异值分布。结果发现,当 ω 从 0 增加到 1 时,梯度矩阵的有效秩(effective rank)显著上升。有效秩衡量的是矩阵中“有信息量”的方向数量——有效秩越高,说明梯度信号分布在更多维度上,而不是集中在少数几个主导方向上。Muon 的谱归一化正好擅长处理这种高有效秩的情况:它把各个方向的更新幅度拉平,让所有有信息量的方向都能被充分利用。相比之下,AdamW 的逐参数自适应学习率在这种场景下反而可能造成“维度不平衡”——某些方向的学习率被过度放大,另一些则被过度抑制。这从另一个角度解释了为什么 Muon 在 GiGPO 下表现更好:step-level credit 分配提升了梯度矩阵的有效秩,而 Muon 的设计恰好与这种高有效秩的梯度结构相匹配。
学习率与优化器的“化学反应”:Muon为何能超越AdamW
这篇论文最值得警惕的一点是:Muon 的收益不是“白捡”的 。学习率一变,结论就会跟着变。作者专门拿高学习率 AdamW 做了控制实验,结果非常干脆:AdamW 在 10-5 和 3×10-5 下都直接把后续验证成功率打成了 0;而 Muon 在相同量级上还能保住任务成功,并且继续往上学。
GraphGPO 的结果尤其说明问题。它本来就已经很强,AdamW 在晚期窗口里已经接近饱和,所以 Muon 的后期提升不如 GiGPO 那么夸张,但 AUC 和早期阈值跨越还是更好。这说明 Muon 的优势不只是“把最后一点分数抠出来”,还包括“更快到达可用解”。对于工程落地来说,这种早学会的特性往往比最后多 1 个点更值钱,因为训练时间、调参成本和失败风险都更低。
为了更系统地理解学习率的影响,论文还做了一个学习率扫描实验,覆盖了从 5×10-6 到 5×10-5 的五个档位。结果发现,Muon 的最优学习率区间比 AdamW 更宽:在 1×10-5 到 3×10-5 之间,Muon 都能保持稳定的性能提升,而 AdamW 只在 1×10-5 附近表现良好,一旦超出这个范围就会急剧恶化。这种“宽窗口”特性在实际工程中非常宝贵,因为它意味着调参成本更低。不过,论文也指出一个反直觉的现象:在极低学习率(5×10-6)下,Muon 反而比 AdamW 差。作者推测,这是因为极低学习率下梯度信号本身就很弱,Muon 的谱归一化会进一步压缩本就不多的幅度信息,导致有效更新量不足。这再次说明,Muon 不是“万能药”,它的优势需要特定的学习率区间来配合。
Muon的“超能力”源自何处?梯度SNR猜想与未来展望
论文没有把机制吹成“玄学突破”,而是给了一个比较克制、也比较靠谱的解释:Muon 的效果,可能和梯度信噪比(gradient SNR)有关 。这里的 SNR 可以理解成“真正有用的学习信号”相对于“随机噪声”的强弱比。Muon 会把矩阵更新的奇异值幅度压平,相当于把弱方向也扶一把;如果这些弱方向本来就带着有效信号,那就赚了;如果弱方向主要是噪声,那就容易把噪声也一起放大。
这也是为什么论文会强调:优势估计器设计,和优化器设计不是两张皮 。以前很多讨论习惯把优化器当成“通用插件”,仿佛只要把 AdamW 换成 Muon,剩下的就自动变好。现实没这么配合。credit assignment 结构越细,Muon's spectral update 越可能吃到干净梯度;任务越噪、越短视,Muon 反而可能踩空。这种结论不算热血,但很有工程味儿:真正决定效果的,往往不是单个模块,而是模块之间是不是互相喂对了信号。
当然,这个机制目前还是猜想,不是被严格证明的定理。论文自己也承认,实验没有直接测 gradient SNR,也没有测更新矩阵的谱结构,所以现在更像是“解释得通的工作假说”。但这种假说有价值,因为它把后面该怎么做说清楚了:以后不能只看最终成功率,还要看梯度谱、有效秩、不同优势估计器下的更新方向分布,这样才能判断 Muon 到底是在帮忙,还是在帮倒忙。
从落地角度看,这篇论文也给了一个很现实的提醒:优化器不是越新越好,关键是它和训练范式是否匹配 。Muon 在预训练里像“省电又能跑”的发动机,但放到 RL 后训练里,必须看 credit assignment、学习率、KL 约束、任务时序结构这些东西是否配套。否则就会出现很经典的场面:论文里看着很美,线上一跑,策略先把自己学没了。
论文还讨论了 Muon 在分布式训练中的实现细节。由于 Muon 需要对整个权重矩阵做 Newton-Schulz 迭代来近似计算矩阵平方根逆,这要求权重矩阵在设备间不能分片(NO_SHARD),否则迭代过程会出错。这意味着,使用 Muon 时,每个设备上必须持有完整的权重矩阵副本,这对显存提出了更高要求。论文使用的 8 张 NVIDIA H20 每张有 96GB 显存,对于 0.5B 模型来说还算宽裕,但如果扩展到更大的模型(比如 7B 或 70B),这种全矩阵存储的开销可能会成为瓶颈。作者也提到,未来可以探索分块(block-wise)的 Muon 实现,或者用更高效的矩阵近似算法来降低内存占用。此外,论文还指出,Muon 的 Newton-Schulz 迭代次数是一个重要的超参数:迭代次数太少会导致近似精度不足,迭代次数太多则会增加计算开销。在实验中,作者使用了 6 次迭代,这是一个在精度和效率之间取得平衡的经验值。
龙迷三问
这篇论文到底解决了什么问题? 它回答的是一个很实际的问题:Muon 在强化学习后训练里到底有没有用,还是只适合预训练。论文的答案不是“有用”或“没用”这么粗暴,而是“要看优势估计器和学习率”。具体来说,当使用细粒度的信用分配方法(如 GiGPO 的 step-level credit)时,Muon 可以带来显著提升(最高 88%);但当信用分配较粗(如 GRPO)或学习率不匹配时,Muon 的优势会大幅缩水甚至消失。
GiGPO、GRPO、GraphGPO 分别是什么关系? 三者都是 group-based RL 方法,但信用分配粒度不同。GRPO 主要看整条轨迹,GiGPO 在此基础上再加步骤级信用,GraphGPO 则把多条轨迹汇成图来做更细的转移级分配。它们构成了一个从粗到细的谱系,而 Muon 的效果恰好与这个细粒度正相关。
为什么论文老提学习率和梯度 SNR? 因为 Muon 不是只改“更新大小”,而是在改“更新方向的结构”。学习率决定这套结构能不能稳稳落地,梯度 SNR 则决定被放大的方向到底是有效信号还是噪声。两者一旦不匹配,Muon 也会从“神兵利器”变成“训练搅拌器”。论文的实验表明,Muon 的最优学习率区间比 AdamW 更宽(1×10-5 到 3×10-5),但在极低学习率下反而更差。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
创新点不在于发明了一个全新优化器,而在于把 Muon 放到 agentic RL 里做了系统性验证,并且把“是否有效”绑定到优势估计器与学习率上,结论有辨识度。
实验合理度: ★★★☆☆
同一模型、同一环境、同一训练框架下做 matched comparison,控制得比较干净;但整体仍是单种子、单模型、单任务集,统计力度还不够硬。
学术研究价值: ★★★★☆
它把“优化器是否适合 RL 后训练”这个模糊问题拆成了可验证的组合因素,对后续研究 Muon、credit assignment 和梯度谱关系很有启发。
稳定性: ★★★☆☆
在 GiGPO 和 GraphGPO 的部分设置里表现不错,但对学习率较敏感,且高率 AdamW 会直接崩掉;说明它不是“随便一调就能稳跑”的类型。
适应性以及泛化能力: ★★★☆☆
目前只在 ALFWorld 和 0.5B 模型上验证,跨任务、跨模型、跨种子是否同样成立,还不能下太满的结论。
硬件需求及成本: ★★☆☆☆
论文使用 8 张 NVIDIA H20,且 Muon 需要 full matrix、NO_SHARD 才能做 Newton–Schulz 迭代,内存压力不小,离轻量部署还有距离。
复现难度: ★★★☆☆
训练框架和关键超参给得比较全,但涉及 agentic RL、rollout、验证窗口和 Muon 的矩阵实现,工程门槛仍然不低。
产品化成熟度: ★★☆☆☆
更像研究结论而不是可直接上线的方案。要产品化,至少还得补多种子验证、跨任务验证和分布式 Muon 的工程实现。
可能的问题: 单种子、单模型、单环境,机制解释也还停留在 SNR 假说层面;结论有意思,但还没到“盖棺定论”的程度。
主要参考文献
Ruan, K.; Lin, J.; Huang, Z.; Zhou, Z.; Wei, Q.; Wang, X.; and Sun, H. 2026. When Does Muon Help Agentic Reinforcement Learning? arXiv preprint arXiv:2607.16169v1.
Jordan, K.; Jin, Y.; Boza, V.; You, J.; Cesista, F.; Newhouse, L.; and Bernstein, J. 2024. Muon: An Optimizer for Hidden Layers in Neural Networks.
Feng, L.; Xue, Z.; Liu, T.; and An, B. 2025. Group-in-Group Policy Optimization for LLM Agent Training. NeurIPS.
Cheng, X.; He, S.; Feng, L.; Xu, H.; Yan, M.; Feng, L.; and An, B. 2026. Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning. ICML 2026.
Shridhar, M.; Yuan, X.; Côté, M.-A.; Bisk, Y.; Trischler, A.; and Hausknecht, M. 2021. ALFWorld: Aligning Text and Embodied Environments for Interactive Learning. ICLR.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!