← 返回 PaperDaily 大模型与智能体

Muon为何像残差连接?浙大新解读来了

Muon这类优化器经常被讲得很玄,这篇论文反而把话说得很人话:它像训练中的“隐式残差连接”。两阶段线性实验虽然简单,但能把“局部更慢、下游更快”这件事讲清楚,值得读。

Muon为何像残差连接?浙大新解读来了
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
Muon这类优化器经常被讲得很玄,这篇论文反而把话说得很人话:它像训练中的“隐式残差连接”。两阶段线性实验虽然简单,但能把“局部更慢、下游更快”这件事讲清楚,值得读。


原论文信息如下:
论文标题:
MUON AS A RESIDUAL CONNECTION
发表日期:
2026年07月
发表单位:
Zhejiang University
原文链接:
https://arxiv.org/pdf/2607.01124v1.pdf
项目链接:
没有

Muon优化器为何强大?一种隐式残差连接的新视角

Muon这类优化器最有意思的地方,不是“名字听起来很科幻”,而是它经常能在大模型和视觉模型里跑出很强的结果,但解释起来却像在拆一台黑箱咖啡机:大家都知道它能煮出好咖啡,却很难一句话说清它到底凭什么。
这篇来自浙江大学的工作没有继续堆更复杂的数学外壳,而是给了一个非常朴素、但很有画面感的解释:Muon可以被看成训练过程中的“隐式残差连接”。换句话说,它不只是让当前这一步下降得更稳,还在悄悄帮后面的层留路,给下游计算留出更好用的表征。
封面
图1:论文主图,展示了在 τ 调度下,Muon 与 SGD 在组合损失上的收敛轨迹对比。它是整篇文章最直观的“证据图”。
先把话说人话一点:残差连接的核心不是“加法”本身,而是它把原始信息变换后的信息一起交给后面的层。后面的层不用赌命,只靠新特征硬扛到底,而是可以挑着用、混着用、甚至直接忽略一部分。Muon 的作者认为,正交化更新在训练时也制造了类似的效果:它牺牲一点“当前步和梯度完全贴合”的效率,却让参数演化出来的表示更像一条顺手的“捷径”,更容易被后续层利用。
这里的关键词有两个。一个是正交化,就是把更新方向“整理”得更规整,避免某几个方向过于强势;另一个是残差连接,英文是 Residual Connection,中文通常译作残差连接或跳连,经典形式来自 ResNet。论文把这两个概念放到一起,不是说 Muon 真在网络里插了一条残差支路,而是说它在优化轨迹上起到了类似“保留可用信息”的作用。

从局部到全局:Muon如何通过正交化平衡梯度与表征

这篇论文最关键的观点,其实可以浓缩成一句话:Muon不是单纯追求“当前层最快下降”,而是在“当前层下降”和“下游层好用”之间做平衡。这就像装修房子:只顾眼前把墙砸得最痛快,未必能让后面家具摆得舒服;有时候慢一点、规整一点,反而整体更顺。
残差连接的基本形式
图2:残差连接的基本公式。xl+1=xl+Block(xl)。这里的意思很简单:上一层的表示不被直接抹掉,而是和新变换结果一起传下去。论文借这个结构来类比 Muon 的训练行为。
在普通 SGD 里,参数更新更像“哪里梯度大就往哪里冲”;而 Muon 会先把更新方向做正交化处理。正交化之后,更新不再一味追着原始梯度跑,某种程度上会损失一点“梯度忠诚度”,也就是论文里说的 gradient fidelity,中文可理解为对梯度方向的忠实程度。
但代价并不是白交的。正交化会让更新更“平均”,更少被少数强方向绑架,这样训练出来的中间表示往往更平滑、更平衡,也更容易被后续层继续加工。论文把这部分称为 representation preservation,即表征保留。翻成大白话就是:前面学出来的东西不容易被训练过程折腾坏,后面的层还能接着用。
因此,Muon 的核心不是“更猛”,而是“更会留后手”。它在局部优化上可能不如 SGD 那么快,但它可能把表示学得更适合后续层接力,这就给了它一种看起来有点反直觉的优势:当前慢一点,整体反而快一点
下游层的组合更新近似
图3:论文用这个近似式说明,当前层的更新会通过乘法关系影响到后续层。也就是说,前一层并不是孤立地“自己学自己”,它的形态会直接决定后面层好不好接手。

受控实验揭秘:Muon牺牲局部优化,却赢得端到端加速

这篇论文最讨巧的地方,是没有直接拿大模型训练曲线来“讲道理”,而是先搭了一个非常干净的线性两层网络实验,把变量尽量收紧。这样做的好处很明显:如果结论成立,就更容易把“为什么会这样”说清楚;坏处也很明显:模型太干净了,离真实深网还有距离。所以这部分更像机制验证,不是产品级大阅兵。
两层线性网络
图4:两层线性网络的设定,输出由 W2W1x 给出。这个结构足够简单,因此特别适合观察“前一层怎么训练,会不会影响后一层接手难度”。
实验分成两阶段。第一阶段只训练第一层 W1,目标是把它往某个局部目标 W1★ 靠近;第二阶段冻结 W1,重新训练 W2 去逼近整体目标 A。这里的设计很妙,因为第二阶段用的是同一个 SGD,谁快谁慢,基本就能归因到第一阶段学出来的表示是否“顺手”。
第一阶段局部目标
图5:第一阶段的局部目标,只要求 W1 靠近 W1★。这个设定本身对 SGD 很友好,因为 SGD 就是按梯度最直接地往目标冲。
第二阶段全局目标
图6:第二阶段的全局目标,只训练 W2 去补齐整体映射。这里的关键不是“W1 离目标多近”,而是“W1 这个表示好不好接”。
结果挺有意思。第一阶段里,SGD 确实更快贴近局部目标,说明 Muon 在这一步上吃了“正交化带来的速度税”;但到了第二阶段,Muon 学出来的 W1 更容易被下游 W2 利用,最后总优化反而更省步数。论文给出的直观解释是:Muon 让 W1 的奇异值谱更平、更不偏科,因而下游优化问题更好条件化。
下游优化梯度
图7:下游层的梯度形式。可以看到,W1 的性质会直接进入梯度表达式,所以 W1 好不好用,不是抽象话题,而是会实打实地影响后续收敛速度。
误差递推
图8:误差递推关系。它把“表示更平滑”这件事翻译成了数学语言:误差会被一个由 W1TW1 决定的矩阵缩放。条件数越友好,后面越省力。
这就是这篇论文最核心的反直觉点:局部看,Muon 慢;全局看,Muon 可能更快。如果只盯着第一阶段的损失,Muon 像是在“磨洋工”;但如果把下游层的接力效率算进去,它其实是在给整个系统铺路。
表格截图
表1:两阶段线性实验结果。SGD 在第一阶段局部误差更低,但 Muon 的 W1 更平坦,第二阶段所需步数更少,说明它更利于下游层优化。

理论与实践:Muon对优化器设计的启示及局限性

论文后半段又做了一个 τ 调度实验,意思是把两层训练切成一段一段交替进行,看看这种“局部—全局”的张力是否还会出现。结果显示,无论是完全联合训练,还是更长时间冻结某一层,Muon 在总步数上都持续占优。这个现象说明,它的优势并不只存在于最理想化的两阶段设定里,而是可以在更接近训练节奏的交替更新中复现。
组合损失
图9:τ 调度下优化的组合损失。这个设定更像真实训练:不是先把一层彻底训完再训另一层,而是不断交替推进。
损失差距图
图10:完整 τ 扫描下的损失差距。负值表示 SGD 领先,正值表示 Muon 领先。图里最有意思的是,Muon 的优势会在后续片段里逐步冒出来,而不是一上来就碾压。
早期损失差距放大图
图11:损失差距的早期放大图。早期确实能看到 SGD 在局部 W1 段更占便宜,这正好印证了“梯度忠实度”与“表征可用性”之间的拉扯。
机制诊断图
图12:τ=200 时的机制诊断图。上半部分看谱平坦度,下半部分看损失差距,橙色虚线还做了 replay 检验,用来判断 Muon 的后期优势到底是不是只是“前面慢一点,后面补回来”这么简单。
从优化器设计的角度看,这篇论文给出的启发并不花哨,但很实用:优化器不该只看“这一小步降了多少”,还要看“这一步训练出来的表示,后面好不好接”。这对有多层耦合结构的模型尤其重要,比如 Transformer 里的某些矩阵参数、长链路的深层网络、以及那些前后层高度依赖的模块。
谱约束信赖域
图13:谱约束视角下的优化问题。它说明 Muon 的正交化并不是随手一拍脑袋,而是可以被放进“受限优化”的框架里理解。
最优更新
图14:最优更新形式。这个结果把“正交化更新”解释成一个明确的最优解,而不是经验主义拍脑袋。
不过,论文也没有装作自己已经把 Muon 讲透了。它的局限性同样很明确:实验是线性的、受控的、机制导向的,这非常适合证明“可能机制”,但还不足以直接推出“真实大模型里一定就是这个原因”。所以更稳妥的结论应该是:这篇工作提供了一个很有解释力的视角,但不是最终判决书。
如果把它放到工程现实里看,Muon 未来最值得继续验证的地方有三个:一是它在非线性深网里是否仍然能稳定带来“下游更好接手”的效果;二是这种效果是否依赖特定层类型或特定谱结构;三是它和残差架构、权重衰减、学习率调度之间会不会互相放大或互相打架。只要这几个问题没回答完,就不能把它当成“万能优化器”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它不是在重新发明 Muon,而是在解释 Muon 为什么强。论文给出的答案是:Muon 通过正交化更新,在训练中扮演了“隐式残差连接”的角色,虽然局部下降可能慢一点,但更容易留下下游可用的表征。

论文里的 gradient fidelity 和 representation preservation 分别是什么意思?前者指更新方向对当前梯度有多“忠实”,越忠实通常当前损失降得越快;后者指训练出来的表示有多容易被后续层继续利用。论文认为 Muon 就是在这两者之间做权衡。

这类线性实验有什么价值,难道不太简单了吗?简单正是它的价值。复杂深网里变量太多,很难判断到底是优化器、结构还是数据在起作用;线性受控实验能把机制单独拎出来,先证明“这个解释站得住”,再谈能不能推广到更复杂模型。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆ 这个视角不算“把宇宙翻个面”的级别,但把 Muon 和残差连接扯到一起,解释得还挺顺,属于有启发、也有辨识度的工作。

实验合理度:★★★★☆ 两阶段线性实验和 τ 调度都很克制,变量控制得不错,能支撑机制判断;但毕竟不是大模型实证,外推要谨慎。

学术研究价值:★★★☆☆ 价值主要在解释框架和后续设计启发,不是新算法本身。对优化器研究者来说,属于能开脑洞、能接着做的那类文章。

稳定性:★★★☆☆ 机制上说得通,但目前证据更多来自受控设定,离“拿来就能稳稳落地”还有距离,尤其在复杂非线性网络里还要再看。

适应性以及泛化能力:★★★☆☆ 这篇论文明确承认自己还没证明在所有深网里都成立。适用面可能不错,但泛化边界还没完全摸清。

硬件需求及成本:★★★★★ 研究本身几乎不吃硬件,线性实验成本很低;如果未来做成实际训练策略,成本主要取决于原模型训练配置。

复现难度:★★★★☆ 理论和实验都比较清楚,复现门槛不高;真正难的是把这种机制在更复杂模型里验证出来。

产品化成熟度:★★★☆☆ 作为优化器解释与研究思路已经够用了,但作为产品级训练策略,还需要更多非线性、跨任务和大规模验证。

可能的问题:解释很漂亮,但证据主要是线性受控实验;离“真实大模型里 Muon 就是隐式残差连接”还差一口气。


主要参考文献

Hao Huang. Muon as a Residual Connection. arXiv:2607.01124, 2026.
Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. Deep Residual Learning for Image Recognition. CVPR 2016.
Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. Identity Mappings in Deep Residual Networks. ECCV 2016.
Jeremy Bernstein and Laker Newhouse. Old Optimizer, New Norm: An Anthology. arXiv:2409.20325, 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦! 

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。Muon这类优化器、残差连接、Transformer与大模型训练的讨论,群里都很适合聊。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。