Muon为何像残差连接?浙大新解读来了
Muon这类优化器经常被讲得很玄,这篇论文反而把话说得很人话:它像训练中的“隐式残差连接”。两阶段线性实验虽然简单,但能把“局部更慢、下游更快”这件事讲清楚,值得读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
Muon这类优化器经常被讲得很玄,这篇论文反而把话说得很人话:它像训练中的“隐式残差连接”。两阶段线性实验虽然简单,但能把“局部更慢、下游更快”这件事讲清楚,值得读。
这篇论文最有意思的地方,不是“找正规元”这件事本身,而是它把问题拆成了一个可以高效算的循环行列式。更狠的是,作者还把确定性算法做到了近二次时间,属于数学味很浓、工程脑也能看懂的那种漂亮活。
AI生成图像检测这条线,最怕的不是模型差,而是对手升级太快。Flet不再死磕“静态特征”,而是直接把检测器做成能跟着新生成器一起变的系统,这个思路很对路。
Apple Research这篇论文不玩“更大的索引”,而是直接让模型学会“怎么搜”。SupportNet学支持函数,KeyNet直接回归最优键,思路很狠,工程上也很实用。
这篇不是简单“看光谱”,而是把JWST/NIRSpec的原始分辨率数据直接拿来做大气反演,连同位素都往里抠。结果把VHS 1256-1257 b的云层、垂直混合和18O贫化一起摆上台面,信息量很足。
这篇论文最有意思的地方,不是又讲了一遍Goldstone定理,而是把“为什么会少一个模”说成了几何问题。它把时空对称性破缺、Berry曲率、逆Higgs约束和type-B模串成了一条线,最后还拿双组分BEC做了能落地的验证。
这篇论文最有意思的地方,不是它把YPtBi做得更“脏”或者更“纯”,而是无论怎么折腾,这个j=3/2超导态的转变温度都几乎不动。材料物理里这种“抗造”表现,通常都不是省油的灯。
这篇论文不玩“另起炉灶”,而是直接给RoCEv2做增量升级:多路径喷发、选择性确认、快速故障切换一口气补齐。对大规模AI训练来说,网络不是配角,卡住一次就是全员陪跑。
BESIII这次不是“发现了什么”,而是把一条本来可能藏着奇特强子态的通道认真扫了一遍:8.5 fb⁻¹、15个能量点、全重建、上限测量,数据味道很足。结果虽然没炸出显著峰,但对奇特强子态搜索来说,这种“没找到”本身也很有信息量。
这篇论文最有意思的地方,不是把视频放大,而是把“放大倍率”和“生成成本”硬生生拆开了。AVSR-Diff 用固定低分辨率潜空间做扩散,再用连续解码补细节,2×到8×都能跑,内存还几乎不涨,工程味很足。
这篇论文最有意思的地方,不是又把一个榜单刷高了,而是把“没有标准答案”的优化题,硬生生改造成了可训练的强化学习环境。原始分数不靠谱、频繁样本会抢戏,RiVER都给它摁住了。
这篇论文最有意思的地方,不是又把 Calogero 模型“套”上了一层超对称外衣,而是直接换了一种更难缠的不可分解多重态,结果反而把自旋、耦合和超共形结构一起串起来了。对喜欢看理论物理“怎么把复杂系统拼成一个整体”的读者,这篇很对味。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球