← 返回 PaperDaily 大模型与智能体

NeurIPS 2026新研究:复读10%数据,344M模型算力竟白烧33%

这篇论文专门盯住一个很现实的问题:训练语料里那些“删不干净的重复”,到底会怎么偷走算力。它不只说“重复不好”,还给出了最伤人的重复区间、模型规模趋势,以及一个能把损失翻成算力浪费的尺子,挺实用。

NeurIPS 2026新研究:复读10%数据,344M模型算力竟白烧33%
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文专门盯住一个很现实的问题:训练语料里那些“删不干净的重复”,到底会怎么偷走算力。它不只说“重复不好”,还给出了最伤人的重复区间、模型规模趋势,以及一个能把损失翻成算力浪费的尺子,挺实用。


原论文信息如下:
论文标题:
Internal Data Repetition Destroys Language Models
发表日期:
2026年06月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2606.24998v1.pdf
语言模型训练这件事,表面上像在“喂书”,实际上更像在“打饭”:菜不够了,只能反复把同一盘菜端上来。问题是,重复这口饭到底只是“有点腻”,还是会把模型真喂坏?这篇论文就专门盯住这个看似不起眼、实则很扎心的问题:内部数据重复到底会怎样偷走训练算力。
封面
图1:论文封面图。核心结论很直接:同样是重复数据,重复多少次、重复的是多大一块数据,对模型伤害并不一样,最危险的往往不是“最多重复”,而是“中间那档最会作妖”的重复结构。
先把几个关键词掰开说。这里的 重复不是泛泛而谈的“语义相似”,而是文档级别的精确复读:同一篇文档被原封不动地放进训练流里多次。论文里还引入了两个很关键的缩写。CEGCompute-Equivalent Gain,中文可理解为“算力等效收益”;CELCompute-Equivalent Loss,就是“算力等效损失”。它们不是在比谁更会背书,而是在问:如果没有这些重复,模型要多花多少算力才能达到同样的效果

语言模型“读报”也厌烦:同一个故事反复讲,脑子会变笨?

把大模型想成一个勤奋但容易烦躁的学生,训练数据就是它每天要看的题库。题库如果越来越少,就只能反复刷旧题。理论上,重复能帮模型“记住”一些东西;但重复太狠,又会让模型把有限的容量花在死记硬背上,最后对新题的泛化能力下降。论文要证明的,就是这种“重复伤害”并不是玄学,而是可以被系统量化的。
这项工作之所以值得看,是因为它不是拿老掉牙的训练设定来讲故事,而是放在了更现代的“算力优先”框架里。也就是说,不再问“重复会不会让参数效率下降”,而是问重复到底浪费了多少 FLOPs。这就像以前只说“你这顿饭吃得不值”,现在直接算账:白白烧掉了多少锅气
表1:Qwen3-style模型配置
表1:实验中使用的 Qwen3-style 模型配置。论文用不同规模的解码器式 transformer 做实验,从几十兆参数一路测到 344M 参数,方便观察“模型越大,重复伤害会不会变形”。
实验的基本设定也很讲究:总训练预算固定,重复 token 的比例固定为 10%,只改变“重复结构”——也就是同样一袋重复数据,是拿一小撮文档疯狂复读,还是拿一大撮文档少量复读。这样就能把“重复多少”与“重复多密”拆开,不让变量乱成一锅粥。

复读有害论:10%的数据换着花样重复,损失最大能翻上30%

公式:训练总算力
图2:训练总算力公式。这里的 N 是参数量,T 是训练 token 数,OT 是 overtraining multiplier(过训练倍数),中文可理解为“训练得比算力最优点更久多少”。公式的意思很朴素:在这套 Chinchilla 风格预算里,总算力跟模型大小的平方关系很紧,模型一大,烧钱速度就开始像开了涡轮。
公式:重复token预算
图3:重复 token 预算关系。fT≈RDr 说明:重复 token 总量由“重复次数 R”和“重复池大小 Dr”共同决定。别看总重复 token 占比固定,真正伤人的,往往是这两个变量怎么搭配。
公式:重复池大小
图4:重复池大小的近似表达式。Dr≈fT/R,也就是在重复 token 比例固定时,重复次数越高,重复池就越小;反过来,重复次数越低,重复池就越大。这个关系很关键,因为论文后面发现:最伤模型的,不是极端小池狂刷,也不是大池少刷,而是中间那段“刚刚好会把模型整烦”的区域
论文最直接的发现很有戏剧性:在固定计算预算下,验证损失不是随着重复次数单调变坏,而是先升后降,像一座小山包。也就是说,重复次数少时伤害不大,重复次数特别多时也会“部分回落”,真正的峰值出现在中间某个重复频率。这个现象不是个别模型的偶然抽风,而是在多个模型规模和多个训练强度下都能看到的稳定模式。
图5:验证损失随重复次数变化的高斯拟合
图5:验证损失随重复次数变化的高斯拟合。每个子图固定一个模型规模,不同曲线对应不同的 OT。可以看到,损失峰值都落在中间区域,而不是两端。换句话说,“适量复读”比“疯狂复读”或者“轻微复读”更容易把模型搞难受,这事儿听起来有点反直觉,但图里就是这么写的。
更扎心的是,论文给出的峰值增幅并不算夸张到“肉眼爆炸”,但已经足够让算力账本难看。原始损失峰值相对无重复基线大约上浮 1.0% 到 4.2%,中位数约 3.1%。听起来像“只多了几个百分点”,但训练曲线一旦被拉到算力等效视角,这几个百分点就会变成很肉疼的浪费。

“精准定位”伤害峰值:模型越大,被“中频复读”坑得越惨

图6:峰值位置的尺度规律
图6:峰值位置的尺度规律。上排显示,峰值重复次数 Rpeak 会随着模型变大而下降;下排显示,峰值时的重复池大小 Drpeak 会随着模型变大而上升。翻译成人话就是:小模型更怕“同一篇文档被刷很多遍”,大模型则更容易被“更大的重复池、较少的重复次数”坑到
这部分最有意思的地方,不只是“有峰值”,而是峰值位置还能被拟合成幂律趋势。也就是说,随着模型规模增长,最危险的重复结构不是乱跑,而是有规律地移动。论文给出的经验拟合表明,峰值重复次数与模型规模近似满足幂律关系,这让“重复伤害”从经验感受变成了可以预测的量。
以实验中的两个代表模型为例,34M 参数模型的峰值大约出现在 R≈1400,对应的重复池大约是 5×104 token;而 344M 参数模型的峰值大约出现在 R≈155,对应重复池大约是 4.5×106 token。也就是说,模型越大,最怕的不是“更疯狂的复读”,而是“更大块头的数据被不那么疯狂地反复拷打”。
公式:高斯峰拟合
图7:用于定位峰值的高斯拟合形式。论文先在对数重复次数空间里拟合一个“山包”,再把山顶位置当作 Rpeak。这样做的好处是,离散采样点不必硬猜哪个点最危险,模型规模和训练强度下的峰值也更容易比较。
这里还得提醒一句,论文的峰值趋势不是“无限外推的宇宙真理”。作者自己也说明了:由于重复 token 占比固定,模型一旦再继续变大,峰值可能会跑到不再符合当前实验设定的区域。因此,这条规律更适合被理解为当前规模范围内的经验法则,而不是拿去给超大模型直接算命。

计算等效损失:究竟浪费了多少算力?一个新尺子告诉你

公式:无重复缩放律
图8:无重复基线的算力缩放律。论文先拟合出 L(C)=2.365+6.647×105C-0.317,意思是:如果没有重复,损失会怎样随着算力下降。这里的 L 是验证损失,C 是训练算力。这个式子就是后面算 CEG、CEL 的标尺。
公式:CEG与CEL
图9:算力等效收益与算力等效损失的定义。CEG=C*(L)/Cactual,表示达到同样损失时,“无重复”训练需要的算力与实际算力之比;CEL=1-CEG,就是损失掉的那部分算力价值。这个指标的好处是,能把“损失多了 2%”翻译成“等价浪费了多少 FLOPs”,终于不再只会说空话。
图10:Compute-Equivalent Gain曲线
图10:不同模型规模与训练强度下的 CEG 曲线。虚线是 CEG=1,表示没有算力等效损失;曲线在中间重复次数附近明显下探,说明这时最浪费算力。最关键的结论是:344M 参数模型的最差设置,CEG 约为 0.67,也就是等价于“如果没有重复,只用约 67% 的算力就能达到同样效果”。换句话说,这 33% 的算力,像是被重复数据悄悄顺走了
这里的一个重要提醒是:为什么看起来只有几个百分点的损失增幅,最后却能换算成这么大的算力浪费?原因在于无重复缩放律通常比较“平”,损失曲线对算力的斜率并不陡。曲线越平,同样一点点损失抬升,就越可能对应一大段算力差距。所以,损失空间的小波动,到了算力空间可能会被放大

为什么会有这个峰值?一个统计学上的解释

论文没有把结论停留在“实验就是这么显示的”,而是进一步拿一个简化的线性回归模型来解释。这个模型很朴素:数据里有一部分真实信号模型看不见,只能通过可见特征去猜;而重复样本因为被反复喂给模型,会让这些样本在统计上变得特别“重”。于是模型会在记住重复样本泛化到未见样本之间来回拉扯,最后就可能出现中间最坏的峰值。
公式:线性模型标签
图11:线性回归里的标签分解。y=Xinβin+Xoutβout,表示标签由“模型看得见的部分”和“模型看不见的部分”共同决定。重复样本之所以麻烦,就是因为它会把看不见的那部分信号在训练中放大成一种偏置。
公式:参数估计偏移
图12:参数估计会被重复样本“拽偏”。β̂in=βin+ar,其中 ar 就是重复带来的别名项。直白点说,模型本来想学“真规律”,结果重复样本把它往某些偶然相关上拖了一把。
公式:重复块协方差
图13:重复样本在协方差上会形成“块状共振”。Σr=In⊕⊕i=1d1r1r⊤ 的意思是:独立样本各干各的,重复样本则在同一块里共享同一份隐藏信号。再乘上输入矩阵后,重复项会带来 级别的放大效应,这就是为什么重复结构会比“多来点独立样本”危险得多。
这套推导的价值在于,它解释了为什么峰值会出现在中间:重复太少时,影响不够大;重复太多时,重复块又会进入某种饱和或“自洽”状态;中间那档最容易把模型推到既记住了噪声、又没真正学好泛化的位置。所以这个峰值不是“模型脾气差”,而是数据分布和有限容量之间的统计博弈。
图14:重复样本下的测试损失热力图
图14:线性回归中的重复样本测试损失热力图。左边是闭式理论,右边是直接模拟。两边都显示:随着模型可见维度变大,最坏峰值会往更大的重复池移动。这说明论文前面在语言模型里看到的趋势,并不是某个训练 trick 的偶然结果,而是更一般的统计结构。
图15:重复样本下的样本效率
图15:重复样本下的样本效率。理论和模拟都表明,效率损失同样是非单调的,峰值出现在中间。这个结果和语言模型那边的 CEG 曲线互相呼应,等于给“重复伤害”补了一张统计学身份证。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它研究的是语言模型预训练里“内部重复数据”的真实代价。论文不是泛泛说重复不好,而是精确回答:在固定算力下,某种重复结构会让模型多浪费多少 FLOPs,以及最危险的重复点落在哪个区间。

CEG 和 CEL 分别是什么意思?CEG 是 Compute-Equivalent Gain,中文可叫“算力等效收益”;CEL 是 Compute-Equivalent Loss,中文可叫“算力等效损失”。前者看同样损失需要多少“无重复算力”,后者看重复把多少算力白白打了水漂。

为什么重复会出现“中间最坏”的峰值?因为重复太少时,重复样本对参数的拉扯不够强;重复太多时,模型会在某种程度上进入“对这块数据过度自洽”的状态;中间那一档既足够强、又还没完全饱和,最容易把模型推到泛化最差的位置。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

把“重复有害”这件老话,升级成了算力等效损失的现代版度量,思路挺新,但核心现象本身并不算第一次被发现。

实验合理度:★★★★☆

控制变量做得比较干净,固定重复 token 占比,只改重复结构,这样才能看出“谁更坏”。不过算力等效指标依赖缩放律拟合,绝对值还得留点余地。

学术研究价值:★★★★☆

对数据去重、预训练预算和重复结构的研究很有启发,尤其适合数据稀缺时代。它把“重复”从道德问题变成了可度量的计算问题。

稳定性:★★★☆☆

结论在所测规模上是稳定的,但最坏峰值和等效损失仍受模型规模、缩放律拟合和数据设定影响,离“放之四海皆准”还有距离。

适应性以及泛化能力:★★★☆☆

对精确重复场景很有用,但真实互联网语料更常见的是近重复、模板化和语义重复,落地时还要再做一层现实映射。

硬件需求及成本:★★☆☆☆

实验本身训练了多组模型,成本不低;但方法主要是分析框架,不是额外重型模型,适合做数据治理时的评估工具。

复现难度:★★★☆☆

数据和训练流程并不算离谱,但要复现所有规模、所有重复结构和缩放律拟合,还是需要不少算力和工程时间。

产品化成熟度:★★★☆☆

适合用来指导训练语料清洗、重复池设计和算力预算评估,但还不适合直接拿来当唯一决策标准,尤其是在复杂真实语料上。

可能的问题:结论主要基于精确重复和特定规模实验,真实语料中的近重复、跨域混杂和更大模型外推仍需验证;CEL 依赖缩放律拟合,绝对数值别当圣旨。


主要参考文献

[1] Jessica Chudnovsky, Joshua Kazdan, Noam Levi, et al. Internal Data Repetition Destroys Language Models. arXiv, 2026.
[2] Guilherme Penedo, Hynek Kydlick, Loubna Ben Allal, et al. The FineWeb datasets: Decanting the web for the finest text data at scale. NeurIPS Datasets and Benchmarks Track, 2024.
[3] Jeffrey Li, Alex Fang, Georgios Smyrnis, et al. DataComp-LM: In search of the next generation of training sets for language models. NeurIPS Datasets and Benchmarks Track, 2024.
[4] https://arxiv.org/pdf/2606.24998v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
复读机别只会复读人类说过的话,来群里复读前沿论文的精华,少走弯路,多涨见识😏
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。