← 返回 PaperDaily 大模型与智能体

神经标度普适性来了:1/3、1/6都稳了?

这篇 MIT 的论文不跟你争“指数到底是不是 1/3”,它直接把焦点挪到更实用的地方:系数。指数像规矩,系数像手感;前者决定大方向,后者才真管模型怎么长、算力怎么花。

神经标度普适性来了:1/3、1/6都稳了?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇 MIT 的论文不跟你争“指数到底是不是 1/3”,它直接把焦点挪到更实用的地方:系数。指数像规矩,系数像手感;前者决定大方向,后者才真管模型怎么长、算力怎么花。


原论文信息如下:
论文标题:
Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients
发表日期:
2026年06月
发表单位:
Massachusetts Institute of Technology
原文链接:
https://arxiv.org/pdf/2606.25008v1.pdf

预训练损失为何是幂律形式?

很多人看大模型训练曲线,第一反应都是:怎么又在慢慢磨?损失降得像老牛拉车,偏偏还真能被一条“幂律曲线”描述。这里的“幂律”可以简单理解成:不是线性下降,也不是指数式跳水,而是按某种固定幂次缓慢变小,越往后越难抠出收益。这个现象之所以重要,是因为它直接决定了训练到底是“多喂数据就行”,还是“多跑几步更关键”。
这篇论文的核心观点很直接:当前大语言模型的幂律行为,未必主要来自数据本身的幂律结构,更可能来自几个很“通用”的机制。作者把它概括成一个词:神经标度普适性。意思是说,很多模型在不同数据、不同细节下,指数可能都差不多,真正会变的反而是系数。指数像“规矩”,系数像“手感”;规矩不太动,手感却能决定最后到底能省多少算力、能不能挑到更合适的模型形状。
封面
图5:神经标度普适性把“幂律”从单一规律,变成了一类可讨论的机制框架。它告诉人们:指数可能很稳定,但系数才是工程里真正的“油门和方向盘”。

揭秘神经标度“三部曲”:时间、宽度与深度

论文把预训练损失拆成三块:训练不充分带来的部分、表示能力不够带来的部分、以及层间变换能力不够带来的部分。听起来像三道关卡,实际上就是模型训练里最常见的三类瓶颈。第一类是“时间”——优化跑得越久,损失越低;第二类是“宽度”——embedding 维度不够,概念塞不下;第三类是“深度”——层数不够,表示虽然有了,但变换不到位。
图1
图1:损失可以拆成三项主导贡献:训练不充分、表示受限、变换受限。数据结构更多是在改“系数”,而不是改“指数”。
先看时间这条线。文中引入了一个很关键的量:动态时间 τ,它不是日历上的时间,而是和学习率积分相关的优化“有效时间”。公式可以理解成:学习率越大、更新越多,动态时间就越往前走。
公式:动态时间的定义
这里的 η 表示学习率,t 表示训练步数。作者强调,Softmax 在学习“低熵、尖峰”的目标分布时会变得很强非线性,于是损失会出现约 1/3 次幂 的下降规律。换句话说,不是模型突然开窍,而是 Softmax 的“脾气”决定了它只能这样慢慢磨。
再看宽度。模型的 embedding 维度 m 有限,但语言里要学的特征远远不止这么点,于是这些特征会在同一个空间里“挤公交”,这就是论文提到的 superposition(叠加)。superposition 的中文常译为“叠加”或“超位置”,这里更接近“多个特征挤在有限维度里互相干扰”的意思。结果就是:宽度越大,代表能力越强,残余损失大致按 1/m 下降。
最后是深度。层数 ℓ 决定了表示能被“变换”成什么样。论文援引前人的分析指出,Transformer 的各层并不是那种一层接一层“越搭越深”的豪华楼梯,而更像在做逐步修正、层层平均误差。于是深度增加时,损失也会出现近似 1/ℓ 的下降。这个结论很朴素:层数不是越多越神,关键在于每层到底有没有真干活。
图2
图2:Pythia 和 Chinchilla 的实验证据支持固定指数的三条标度律。虚线来自拟合系数,说明“指数固定、系数可调”这套说法不是空口白话。
公式:总损失分解
这条总公式的意思很清楚:总损失 = 时间项 + 宽度项 + 深度项 + 不可约损失。不可约损失 L0 可以理解成“就算模型再努力,也不可能完全消掉的底噪”。真正值得优化的,是前面三项的系数 cτ、cm、cℓ。

数据用不完?从“数据受限”到“步数受限”

很多训练经验都会说一句很熟的话:数据不够了。论文对此提出了一个挺“反直觉但很实用”的判断——大规模预训练在很多情况下更像是步数受限,而不是严格意义上的“数据受限”。也就是说,真正限制继续降损失的,常常不是有没有新语料,而是优化步骤有没有继续往前跑。
公式:数据规模与动态时间关系
这里 D 表示训练数据量,B 表示 batch size,η 表示峰值学习率。直白点说:如果训练方式接近在线学习,每一步都在吃新 token,那么数据量 D 和动态时间 τ 会近似成正比。于是前面那条时间幂律,就能自然“搬运”成数据规模幂律。
公式:数据规模形式的总损失
这就带来一个很关键的结论:如果数据足够大、训练策略足够像在线学习,那么继续提升性能,未必一定要无限扩充“全新数据”,而是可以通过更多优化步数、重复利用高质量数据、调好学习率和 batch size 来继续压损失。换句话说,数据量不是唯一主角,数据质量和优化节奏同样重要。
图2重复不展示
图2中的 Chinchilla 结果也支持这一点:把数据量换成动态时间后,损失曲线依然能被同样的固定指数公式解释。这里最有意思的不是“又拟合上了”,而是它把“多吃数据”这件事,重新翻译成了“把训练节奏跑对”。
论文还顺手给了一个很现实的提醒:数据规模系数 cD 不是天上掉下来的,它和学习率、batch size、调度形状都有关系。也就是说,两个团队用同样的数据,最后训练曲线也可能差不少,原因不一定是“模型天赋不同”,而可能只是优化细节没调顺。

系数比指数更重要:如何塑造最优模型?

如果说指数决定“长什么样”,那系数决定“长多大、怎么长”。论文最实用的一部分,就是把系数和模型设计直接挂钩。先看模型形状。大模型参数量大致满足 N≈12m2ℓ,也就是宽度和深度一起决定总参数。把这个约束带进损失公式后,可以求出最优宽深比:
公式:最优宽深比
也就是说,最优形状不是拍脑袋拍出来的,而是由 cm 和 cℓ 的比值决定。更有意思的是,在这个最优点上,宽度项和深度项的损失贡献满足一个固定比例:
公式:宽度与深度损失比例
这个 2:1 的比例很妙,说明最优模型并不是让宽和深“平分秋色”,而是有一个偏向性的平衡。论文进一步推导出,最优形状下模型大小损失会变成 1/3 次幂标度:
公式:最优形状下的模型大小标度 公式:模型大小系数
这意味着,只要知道 cm 和 cℓ,就能算出 cN,也就是“给定参数预算时,能把损失压到什么程度”。这对架构设计的意义非常直接:改激活函数、改注意力机制、改归一化方式,本质上都可能是在改这些系数,而不是改那个看上去很玄的指数。
图3
图3:Chinchilla、Pythia、GPT-3 和 Farseer 的模型形状都靠近论文预测的最优宽深比。红线附近说明,工程上常见的设计经验,其实和理论最优并不远。
更进一步,论文还把“给定计算量怎么分配参数和数据”也推出来了。compute 近似满足 C≈6ND,于是最优 token-to-parameter ratio 也能由系数决定:
公式:最优token-参数比 公式:计算最优点损失贡献比 公式:三项损失贡献比例
这组比例很像“预算分账”:数据项、宽度项、深度项在最优点上分别按 3:2:1 分配贡献。最后,计算最优前沿上的损失会变成 1/6 次幂标度:
公式:计算最优损失 公式:计算系数
这就很适合工程上做预算规划:知道 cD、cN、cC 后,基本就能判断“同样的算力,怎么分数据和参数更划算”。
图4
图4:在 Chinchilla 和 Farseer 上,计算最优点都遵循了 1/6 计算标度。星号标出了每个 isoFLOP 曲线上的最优点,挺像在算力迷宫里找到了出口。

验证与展望:数据如何影响系数?

这篇论文最“像研究”的地方,不是把几个公式摆出来,而是认真去看:系数到底在不同模型家族里怎么变。作者用 Pythia、Chinchilla、Farseer 三类模型做拟合,发现同样的固定指数形式能解释数据,但系数会随着模型家族而变化。也就是说,世界不是“指数各不相同”,而更像“指数统一,系数分家”。
表1
表1:Pythia 模型拟合得到的标度常数。这里最值得看的是 cτ、cm、cℓ 的差异,它们直接反映了数据和结构细节对训练曲线的影响。
表2
表2:Chinchilla 模型拟合得到的标度常数。它们进一步支撑了“数据规模、宽度、深度三项可以用固定指数拆开”的观点。
表3
表3:用最优形状形式重新拟合 Chinchilla 后得到的常数。这个表的意义在于:一旦站在最优宽深比上,很多关系会更清晰。
表4
表4:Farseer 模型在最优形状形式下的拟合结果。不同家族之间数值不同,但规律相当一致,这正是“普适性”最有说服力的地方。
图6
图6:不同模型家族的系数和最优比值并不完全相同,但波动范围总体可控。bootstrap 的置信区间也说明,这些差异并不是“看图说话”,而是能被统计检验到的。
从研究视角看,这篇论文真正留下的问题,不是“指数是不是 1/3”这种已经快被聊成家常菜的话题,而是:到底是什么在决定这些系数。作者给出的方向包括数据组成、架构选择、优化器、学习率、batch size、调度策略等。换句话说,未来提升效率的战场,可能不在“重新发明一个指数”,而在“把系数调得更漂亮”。
论文还提到,不同架构改动,比如 mixture of experts、looped transformer、attention residual network,未必会改变这三条标度律本身,但很可能改变系数。这个判断非常实在:理论上不一定掀桌子,工程上却可能悄悄改掉“每一分钱算力能换来多少收益”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它没有去争“幂律到底存不存在”,而是把问题往前推进了一步:如果指数相对固定,那更应该研究系数怎么来、怎么变、怎么影响最优模型形状和算力分配。这个方向比单纯盯指数更接近工程落地。

文中的动态时间 τ 是什么意思?τ 不是自然时间,而是把学习率积分进去后的“有效优化时间”。可以把它理解成:训练步数只是表面,真正决定模型学了多少的,是优化到底走了多远。

为什么论文一直强调系数,而不是指数?因为指数往往决定“规律长什么样”,但系数决定“最优宽深比、最优 token/参数 比、给定算力下能达到的损失”。对实际训练来说,后者更像手里的方向盘,拧对了才是真的省钱省时间。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 这篇文章的创新点不在新模型,而在把已有的三条标度律统一进一个“普适性”框架里,视角挺漂亮。

实验合理度:★★★★☆ 选了 Pythia、Chinchilla、Farseer 三类模型交叉验证,拟合逻辑也比较严谨;不过整体仍偏“解释型”论文,不是那种强因果验证。

学术研究价值:★★★★☆ 它把研究重点从“指数是什么”转到“系数怎么决定”,对后续做架构、数据和优化器研究都很有启发。

稳定性:★★★☆☆ 结论主要建立在大规模预训练和特定模型家族上,小模型或特殊任务上未必能原样套用。

适应性以及泛化能力:★★★☆☆ 对当前主流 Transformer 语言模型很有参考价值,但跨任务、跨模态、跨训练范式时还需要再验证。

硬件需求及成本:★★★☆☆ 理论本身不吃算力,但验证这些系数和标度律,前提还是得有相当规模的训练日志和模型族。

复现难度:★★★☆☆ 公式不难,难的是数据和训练记录的完整性;没有足够模型点位,系数就不太好稳稳拟合。

产品化成熟度:★★★☆☆ 适合做训练规划和经验指导,但要直接变成一套通用自动配方,还需要更多场景验证。

可能的问题:论文更像“理论路线图”,对系数来源的机制解释还不够细,离真正可控的训练设计还有一步。


主要参考文献

[1] Joel Hestness, et al. Deep learning scaling is predictable, empirically. arXiv:1712.00409, 2017.
[2] Jared Kaplan, et al. Scaling laws for neural language models. arXiv:2001.08361, 2020.
[4] Jordan Hoffmann, et al. Training compute-optimal large language models. 2022.
[15–17] 论文所引三篇工作分别讨论 Softmax 非线性、叠加效应和层间误差平均带来的固定指数标度律。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。