← 返回 PaperDaily
大模型与智能体
Muon为何像残差连接?浙大新解读来了
Muon这类优化器经常被讲得很玄,这篇论文反而把话说得很人话:它像训练中的“隐式残差连接”。两阶段线性实验虽然简单,但能把“局部更慢、下游更快”这件事讲清楚,值得读。
龙哥读论文
发布于 2026-08-17 00:20:04
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: Muon这类优化器经常被讲得很玄,这篇论文反而把话说得很人话:它像训练中的“隐式残差连接”。两阶段线性实验虽然简单,但能把“局部更慢、下游更快”这件事讲清楚,值得读。
原论文信息如下:
Muon优化器为何强大?一种隐式残差连接的新视角
Muon这类优化器最有意思的地方,不是“名字听起来很科幻”,而是它经常能在大模型和视觉模型里跑出很强的结果,但解释起来却像在拆一台黑箱咖啡机:大家都知道它能煮出好咖啡,却很难一句话说清它到底凭什么。
这篇来自浙江大学的工作没有继续堆更复杂的数学外壳,而是给了一个非常朴素、但很有画面感的解释:Muon可以被看成训练过程中的“隐式残差连接” 。换句话说,它不只是让当前这一步下降得更稳,还在悄悄帮后面的层留路,给下游计算留出更好用的表征。
先把话说人话一点:残差连接的核心不是“加法”本身,而是它把原始信息 和变换后的信息 一起交给后面的层。后面的层不用赌命,只靠新特征硬扛到底,而是可以挑着用、混着用、甚至直接忽略一部分。Muon 的作者认为,正交化更新在训练时也制造了类似的效果:它牺牲一点“当前步和梯度完全贴合”的效率,却让参数演化出来的表示更像一条顺手的“捷径”,更容易被后续层利用。
这里的关键词有两个。一个是正交化 ,就是把更新方向“整理”得更规整,避免某几个方向过于强势;另一个是残差连接 ,英文是 Residual Connection,中文通常译作残差连接或跳连,经典形式来自 ResNet。论文把这两个概念放到一起,不是说 Muon 真在网络里插了一条残差支路,而是说它在优化轨迹上起到了类似“保留可用信息”的作用。
从局部到全局:Muon如何通过正交化平衡梯度与表征
这篇论文最关键的观点,其实可以浓缩成一句话:Muon不是单纯追求“当前层最快下降”,而是在“当前层下降”和“下游层好用”之间做平衡 。这就像装修房子:只顾眼前把墙砸得最痛快,未必能让后面家具摆得舒服;有时候慢一点、规整一点,反而整体更顺。
在普通 SGD 里,参数更新更像“哪里梯度大就往哪里冲”;而 Muon 会先把更新方向做正交化处理。正交化之后,更新不再一味追着原始梯度跑,某种程度上会损失一点“梯度忠诚度”,也就是论文里说的 gradient fidelity ,中文可理解为对梯度方向的忠实程度。
但代价并不是白交的。正交化会让更新更“平均”,更少被少数强方向绑架,这样训练出来的中间表示往往更平滑、更平衡,也更容易被后续层继续加工。论文把这部分称为 representation preservation ,即表征保留。翻成大白话就是:前面学出来的东西不容易被训练过程折腾坏,后面的层还能接着用。
因此,Muon 的核心不是“更猛”,而是“更会留后手”。它在局部优化上可能不如 SGD 那么快,但它可能把表示学得更适合后续层接力,这就给了它一种看起来有点反直觉的优势:当前慢一点,整体反而快一点 。
受控实验揭秘:Muon牺牲局部优化,却赢得端到端加速
这篇论文最讨巧的地方,是没有直接拿大模型训练曲线来“讲道理”,而是先搭了一个非常干净的线性两层网络实验,把变量尽量收紧。这样做的好处很明显:如果结论成立,就更容易把“为什么会这样”说清楚;坏处也很明显:模型太干净了,离真实深网还有距离。所以这部分更像机制验证,不是产品级大阅兵。
实验分成两阶段。第一阶段只训练第一层 W1,目标是把它往某个局部目标 W1★ 靠近;第二阶段冻结 W1,重新训练 W2 去逼近整体目标 A。这里的设计很妙,因为第二阶段用的是同一个 SGD,谁快谁慢,基本就能归因到第一阶段学出来的表示是否“顺手”。
结果挺有意思。第一阶段里,SGD 确实更快贴近局部目标,说明 Muon 在这一步上吃了“正交化带来的速度税”;但到了第二阶段,Muon 学出来的 W1 更容易被下游 W2 利用,最后总优化反而更省步数。论文给出的直观解释是:Muon 让 W1 的奇异值谱更平、更不偏科,因而下游优化问题更好条件化。
这就是这篇论文最核心的反直觉点:局部看,Muon 慢;全局看,Muon 可能更快 。如果只盯着第一阶段的损失,Muon 像是在“磨洋工”;但如果把下游层的接力效率算进去,它其实是在给整个系统铺路。
论文后半段又做了一个 τ 调度实验,意思是把两层训练切成一段一段交替进行,看看这种“局部—全局”的张力是否还会出现。结果显示,无论是完全联合训练,还是更长时间冻结某一层,Muon 在总步数上都持续占优。这个现象说明,它的优势并不只存在于最理想化的两阶段设定里,而是可以在更接近训练节奏的交替更新中复现。
从优化器设计的角度看,这篇论文给出的启发并不花哨,但很实用:优化器不该只看“这一小步降了多少”,还要看“这一步训练出来的表示,后面好不好接” 。这对有多层耦合结构的模型尤其重要,比如 Transformer 里的某些矩阵参数、长链路的深层网络、以及那些前后层高度依赖的模块。
不过,论文也没有装作自己已经把 Muon 讲透了。它的局限性同样很明确:实验是线性的、受控的、机制导向的 ,这非常适合证明“可能机制”,但还不足以直接推出“真实大模型里一定就是这个原因”。所以更稳妥的结论应该是:这篇工作提供了一个很有解释力的视角,但不是最终判决书。
如果把它放到工程现实里看,Muon 未来最值得继续验证的地方有三个:一是它在非线性深网里是否仍然能稳定带来“下游更好接手”的效果;二是这种效果是否依赖特定层类型或特定谱结构;三是它和残差架构、权重衰减、学习率调度之间会不会互相放大或互相打架。只要这几个问题没回答完,就不能把它当成“万能优化器”。
龙迷三问
这篇论文到底解决了什么问题? 它不是在重新发明 Muon,而是在解释 Muon 为什么强。论文给出的答案是:Muon 通过正交化更新,在训练中扮演了“隐式残差连接”的角色,虽然局部下降可能慢一点,但更容易留下下游可用的表征。
论文里的 gradient fidelity 和 representation preservation 分别是什么意思? 前者指更新方向对当前梯度有多“忠实”,越忠实通常当前损失降得越快;后者指训练出来的表示有多容易被后续层继续利用。论文认为 Muon 就是在这两者之间做权衡。
这类线性实验有什么价值,难道不太简单了吗? 简单正是它的价值。复杂深网里变量太多,很难判断到底是优化器、结构还是数据在起作用;线性受控实验能把机制单独拎出来,先证明“这个解释站得住”,再谈能不能推广到更复杂模型。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆ 这个视角不算“把宇宙翻个面”的级别,但把 Muon 和残差连接扯到一起,解释得还挺顺,属于有启发、也有辨识度的工作。
实验合理度: ★★★★☆ 两阶段线性实验和 τ 调度都很克制,变量控制得不错,能支撑机制判断;但毕竟不是大模型实证,外推要谨慎。
学术研究价值: ★★★☆☆ 价值主要在解释框架和后续设计启发,不是新算法本身。对优化器研究者来说,属于能开脑洞、能接着做的那类文章。
稳定性: ★★★☆☆ 机制上说得通,但目前证据更多来自受控设定,离“拿来就能稳稳落地”还有距离,尤其在复杂非线性网络里还要再看。
适应性以及泛化能力: ★★★☆☆ 这篇论文明确承认自己还没证明在所有深网里都成立。适用面可能不错,但泛化边界还没完全摸清。
硬件需求及成本: ★★★★★ 研究本身几乎不吃硬件,线性实验成本很低;如果未来做成实际训练策略,成本主要取决于原模型训练配置。
复现难度: ★★★★☆ 理论和实验都比较清楚,复现门槛不高;真正难的是把这种机制在更复杂模型里验证出来。
产品化成熟度: ★★★☆☆ 作为优化器解释与研究思路已经够用了,但作为产品级训练策略,还需要更多非线性、跨任务和大规模验证。
可能的问题: 解释很漂亮,但证据主要是线性受控实验;离“真实大模型里 Muon 就是隐式残差连接”还差一口气。
主要参考文献
Hao Huang. Muon as a Residual Connection. arXiv:2607.01124, 2026.
Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. Deep Residual Learning for Image Recognition. CVPR 2016.
Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. Identity Mappings in Deep Residual Networks. ECCV 2016.
Jeremy Bernstein and Laker Newhouse. Old Optimizer, New Norm: An Anthology. arXiv:2409.20325, 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
Muon这类优化器、残差连接、Transformer与大模型训练的讨论,群里都很适合聊。