← 返回 PaperDaily
大模型与智能体
NeurIPS 2026新研究:复读10%数据,344M模型算力竟白烧33%
这篇论文专门盯住一个很现实的问题:训练语料里那些“删不干净的重复”,到底会怎么偷走算力。它不只说“重复不好”,还给出了最伤人的重复区间、模型规模趋势,以及一个能把损失翻成算力浪费的尺子,挺实用。
龙哥读论文
发布于 2026-08-27 00:20:08
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文专门盯住一个很现实的问题:训练语料里那些“删不干净的重复”,到底会怎么偷走算力。它不只说“重复不好”,还给出了最伤人的重复区间、模型规模趋势,以及一个能把损失翻成算力浪费的尺子,挺实用。
原论文信息如下:
语言模型训练这件事,表面上像在“喂书”,实际上更像在“打饭”:菜不够了,只能反复把同一盘菜端上来。问题是,重复这口饭到底只是“有点腻”,还是会把模型真喂坏?这篇论文就专门盯住这个看似不起眼、实则很扎心的问题:内部数据重复 到底会怎样偷走训练算力。
先把几个关键词掰开说。这里的 重复 不是泛泛而谈的“语义相似”,而是文档级别的精确复读 :同一篇文档被原封不动地放进训练流里多次。论文里还引入了两个很关键的缩写。CEG 是 Compute-Equivalent Gain ,中文可理解为“算力等效收益 ”;CEL 是 Compute-Equivalent Loss ,就是“算力等效损失 ”。它们不是在比谁更会背书,而是在问:如果没有这些重复,模型要多花多少算力才能达到同样的效果 。
语言模型“读报”也厌烦:同一个故事反复讲,脑子会变笨?
把大模型想成一个勤奋但容易烦躁的学生,训练数据就是它每天要看的题库。题库如果越来越少,就只能反复刷旧题。理论上,重复能帮模型“记住”一些东西;但重复太狠,又会让模型把有限的容量花在死记硬背上,最后对新题的泛化能力下降。论文要证明的,就是这种“重复伤害”并不是玄学,而是可以被系统量化的。
这项工作之所以值得看,是因为它不是拿老掉牙的训练设定来讲故事,而是放在了更现代的“算力优先”框架里。也就是说,不再问“重复会不会让参数效率下降”,而是问重复到底浪费了多少 FLOPs 。这就像以前只说“你这顿饭吃得不值”,现在直接算账:白白烧掉了多少锅气 。
实验的基本设定也很讲究:总训练预算固定,重复 token 的比例固定为 10%,只改变“重复结构”——也就是同样一袋重复数据,是拿一小撮文档疯狂复读,还是拿一大撮文档少量复读。这样就能把“重复多少”与“重复多密”拆开,不让变量乱成一锅粥。
复读有害论:10%的数据换着花样重复,损失最大能翻上30%
论文最直接的发现很有戏剧性:在固定计算预算下,验证损失不是随着重复次数单调变坏,而是先升后降,像一座小山包。也就是说,重复次数少时伤害不大,重复次数特别多时也会“部分回落”,真正的峰值出现在中间某个重复频率。这个现象不是个别模型的偶然抽风,而是在多个模型规模和多个训练强度下都能看到的稳定模式。
更扎心的是,论文给出的峰值增幅并不算夸张到“肉眼爆炸”,但已经足够让算力账本难看。原始损失峰值相对无重复基线大约上浮 1.0% 到 4.2% ,中位数约 3.1% 。听起来像“只多了几个百分点”,但训练曲线一旦被拉到算力等效视角,这几个百分点就会变成很肉疼的浪费。
“精准定位”伤害峰值:模型越大,被“中频复读”坑得越惨
这部分最有意思的地方,不只是“有峰值”,而是峰值位置还能被拟合成幂律趋势。也就是说,随着模型规模增长,最危险的重复结构不是乱跑,而是有规律地移动。论文给出的经验拟合表明,峰值重复次数与模型规模近似满足幂律关系 ,这让“重复伤害”从经验感受变成了可以预测的量。
以实验中的两个代表模型为例,34M 参数模型的峰值大约出现在 R≈1400 ,对应的重复池大约是 5×104 token;而 344M 参数模型的峰值大约出现在 R≈155 ,对应重复池大约是 4.5×106 token。也就是说,模型越大,最怕的不是“更疯狂的复读”,而是“更大块头的数据被不那么疯狂地反复拷打”。
这里还得提醒一句,论文的峰值趋势不是“无限外推的宇宙真理”。作者自己也说明了:由于重复 token 占比固定,模型一旦再继续变大,峰值可能会跑到不再符合当前实验设定的区域。因此,这条规律更适合被理解为当前规模范围内的经验法则 ,而不是拿去给超大模型直接算命。
计算等效损失:究竟浪费了多少算力?一个新尺子告诉你
这里的一个重要提醒是:为什么看起来只有几个百分点的损失增幅,最后却能换算成这么大的算力浪费?原因在于无重复缩放律通常比较“平”,损失曲线对算力的斜率并不陡。曲线越平,同样一点点损失抬升,就越可能对应一大段算力差距。所以,损失空间的小波动,到了算力空间可能会被放大 。
为什么会有这个峰值?一个统计学上的解释
论文没有把结论停留在“实验就是这么显示的”,而是进一步拿一个简化的线性回归模型来解释。这个模型很朴素:数据里有一部分真实信号模型看不见,只能通过可见特征去猜;而重复样本因为被反复喂给模型,会让这些样本在统计上变得特别“重”。于是模型会在记住重复样本 和泛化到未见样本 之间来回拉扯,最后就可能出现中间最坏的峰值。
这套推导的价值在于,它解释了为什么峰值会出现在中间:重复太少时,影响不够大;重复太多时,重复块又会进入某种饱和或“自洽”状态;中间那档最容易把模型推到既记住了噪声、又没真正学好泛化的位置 。所以这个峰值不是“模型脾气差”,而是数据分布和有限容量之间的统计博弈。
龙迷三问
这篇论文到底解决了什么问题? 它研究的是语言模型预训练里“内部重复数据”的真实代价。论文不是泛泛说重复不好,而是精确回答:在固定算力下,某种重复结构会让模型多浪费多少 FLOPs,以及最危险的重复点落在哪个区间。
CEG 和 CEL 分别是什么意思? CEG 是 Compute-Equivalent Gain,中文可叫“算力等效收益”;CEL 是 Compute-Equivalent Loss,中文可叫“算力等效损失”。前者看同样损失需要多少“无重复算力”,后者看重复把多少算力白白打了水漂。
为什么重复会出现“中间最坏”的峰值? 因为重复太少时,重复样本对参数的拉扯不够强;重复太多时,模型会在某种程度上进入“对这块数据过度自洽”的状态;中间那一档既足够强、又还没完全饱和,最容易把模型推到泛化最差的位置。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
把“重复有害”这件老话,升级成了算力等效损失的现代版度量,思路挺新,但核心现象本身并不算第一次被发现。
实验合理度: ★★★★☆
控制变量做得比较干净,固定重复 token 占比,只改重复结构,这样才能看出“谁更坏”。不过算力等效指标依赖缩放律拟合,绝对值还得留点余地。
学术研究价值: ★★★★☆
对数据去重、预训练预算和重复结构的研究很有启发,尤其适合数据稀缺时代。它把“重复”从道德问题变成了可度量的计算问题。
稳定性: ★★★☆☆
结论在所测规模上是稳定的,但最坏峰值和等效损失仍受模型规模、缩放律拟合和数据设定影响,离“放之四海皆准”还有距离。
适应性以及泛化能力: ★★★☆☆
对精确重复场景很有用,但真实互联网语料更常见的是近重复、模板化和语义重复,落地时还要再做一层现实映射。
硬件需求及成本: ★★☆☆☆
实验本身训练了多组模型,成本不低;但方法主要是分析框架,不是额外重型模型,适合做数据治理时的评估工具。
复现难度: ★★★☆☆
数据和训练流程并不算离谱,但要复现所有规模、所有重复结构和缩放律拟合,还是需要不少算力和工程时间。
产品化成熟度: ★★★☆☆
适合用来指导训练语料清洗、重复池设计和算力预算评估,但还不适合直接拿来当唯一决策标准,尤其是在复杂真实语料上。
可能的问题: 结论主要基于精确重复和特定规模实验,真实语料中的近重复、跨域混杂和更大模型外推仍需验证;CEL 依赖缩放律拟合,绝对数值别当圣旨。
主要参考文献
[1] Jessica Chudnovsky, Joshua Kazdan, Noam Levi, et al. Internal Data Repetition Destroys Language Models. arXiv, 2026.
[2] Guilherme Penedo, Hynek Kydlick, Loubna Ben Allal, et al. The FineWeb datasets: Decanting the web for the finest text data at scale. NeurIPS Datasets and Benchmarks Track, 2024.
[3] Jeffrey Li, Alex Fang, Georgios Smyrnis, et al. DataComp-LM: In search of the next generation of training sets for language models. NeurIPS Datasets and Benchmarks Track, 2024.
[4] https://arxiv.org/pdf/2606.24998v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!