← 返回 PaperDaily 大模型与智能体

NYU最新研究:仅用8K短数据训练,让LLM在128K长上下文推理中准确率飙升90%!

大模型在短数据上训练得再溜,一遇到超长上下文立马就“脑子一片空白”。纽约大学团队别出心裁,用“随机位置”这招,让模型在短文本训练时就能“看见”长文本的位置编码,再配合“长度课程”循序渐进的练习,仅用<8K的短数据训练,就在128K长上下文推理中准确率飙升到90%。这招堪称四两拨千斤,性价比极高!

NYU最新研究:仅用8K短数据训练,让LLM在128K长上下文推理中准确率飙升90%!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
大模型在短数据上训练得再溜,一遇到超长上下文立马就“脑子一片空白”。纽约大学团队别出心裁,用“随机位置”这招,让模型在短文本训练时就能“看见”长文本的位置编码,再配合“长度课程”循序渐进的练习,仅用<8K的短数据训练,就在128K长上下文推理中准确率飙升到90%。这招堪称四两拨千斤,性价比极高!


原论文信息如下:
论文标题:
Randomized YaRN Improves Length Generalization for Long-Context Reasoning
发表日期:
2026年06月
发表单位:
纽约大学(New York University)
原文链接:
https://arxiv.org/pdf/2606.23687v1.pdf
今天这篇来自纽约大学的论文,题目是Randomized YaRN Improves Length Generalization for Long-Context Reasoning,作者是 Manas Mehta、Fangcong Yin 和 Greg Durrett。他们找到一种“四两拨千斤”的训练方法,让大模型只用不到8K的短数据练一练,就能在128K的长上下文推理任务上照常发挥,准确率很高!

大模型一遇长上下文就“失忆”?试试这种新型位置编码训练法

要搞懂这篇论文,得先明白大模型处理长文本的“死穴”。主流模型预训练时受限于算力,只能看到短序列(2K到8K token)。训练完了,你想让它理解几十万字的文档,它就懵了——因为位置编码没见过这么长的位置索引,模型没法把单词之间的顺序关系捋清楚。
最朴素的方法是拿海量长文本数据去微调,但烧钱烧时间,且不一定能真正泛化到更长的上下文。另一条路是直接改位置编码,比如YaRN(Yet another RoPE extensioN,一种高效的上下文窗口扩展方法),它通过巧妙插值让模型“理解”更长的位置。但YaRN在简单的“大海捞针”任务上不错,一到需要多跳推理的复杂长上下文任务,效果就大打折扣。
纽约大学团队的洞察在于:模型没见过的位置编码,在训练时连一次都没看到过,那它怎么可能在推理时用好呢?所以他们提出一个极其聪明的训练策略——在短文本训练阶段,就给模型“人工制造”一些长文本的位置编码样本,强迫它提前适应。

仅需短数据训练,就能在128K上下文中精准推理

先看看效果。论文在两个考验长上下文推理能力的基准上做了测试:BABILong(多跳推理任务,需从海量无关文本中找出三个支撑事实并推理)和多轮共指消解(MRCR,需在长对话中定位并复现指定回答)。
训练数据有多“短”?对BABILong,用了4K个样本,上下文长度0K到8K。对MRCR,只用了60个样本,上下文4-8K。然后直接在这些短数据上训练,推理时却要处理16K、32K、64K甚至128K的超长上下文。
图1:Randomized YaRN训练大模型进行长度泛化的方法示意图:(1) 随机位置采样:从更长的长度分布中随机采样位置,将对应的YaRN编码分配给短上下文训练数据中的每个token,让模型暴露于分布外(OOD)的位置编码;(2) 长度泛化课程:逐步增加采样长度分布,形成训练课程。
图1:Randomized YaRN训练大模型进行长度泛化的方法示意图:(1) 随机位置采样:从更长的长度分布中随机采样位置,将对应的YaRN编码分配给短上下文训练数据中的每个token,让模型暴露于分布外(OOD)的位置编码;(2) 长度泛化课程:逐步增加采样长度分布,形成训练课程。
具体数字看表格。下表展示了在BABILong上的结果,“ID”表示训练时的分布内长度(0K-8K),“OOD”表示分布外长度(16K-128K)。Randomized YaRN在Qwen2.5-7B-Instruct和Olmo3-7B-Instruct两个模型上,OOD平均精度分别达到90.3%和88.0%,远超其他基线(最好的对比方法Trained YaRN只有81.3%和83.2%)。尤其是在最远的128K长度上,Randomized YaRN比最好的Trained YaRN高出16.7个百分点(Qwen2.5上83.9% vs 67.2%),简直是碾压。
表1:BABILong上的分布内(ID)和分布外(OOD)评估。Randomized YaRN在Qwen2.5和Olmo3模型上均超越所有基线,尤其在远OOD长度128K上表现突出。
表1:BABILong上的分布内(ID)和分布外(OOD)评估。Randomized YaRN在Qwen2.5和Olmo3模型上均超越所有基线,尤其在远OOD长度128K上表现突出。
在MRCR上,优势同样显著。Randomized YaRN在OOD平均精度上比Trained YaRN高出13.4个百分点(Qwen2.5上72.7% vs 59.3%),比标准LoRA也高出8.3个百分点。在最难的长度64-128K上,Randomized YaRN达到68.8%,而Trained YaRN只有44.1%,差距超过24个点。
表2:MRCR上的分布内(ID)和分布外(OOD)评估。Randomized YaRN在OOD长度上持续优于所有基线。
表2:MRCR上的分布内(ID)和分布外(OOD)评估。Randomized YaRN在OOD长度上持续优于所有基线。
更关键的是,Randomized YaRN使用的训练数据量极小。MRCR只用了60条例子,BABILong用了4000条(全是不超过8K的短文本)。这种“低资源、高回报”的特性,在实际应用中极具吸引力。

方法揭秘:随机位置采样+长度课程学习,两步搞定

核心就两招:随机位置编码采样(RPE)长度课程学习

第一步:随机位置编码采样(RPE)

RPE基本思想是:在训练时,对于长度为L的序列,不从1到L分配位置索引,而是从一个更大的范围{1, ..., L'}中随机无放回地抽取L个位置排序后依次分配给各个token。这样,原本只能看到1到L位置编码的模型,现在能看到1到L'范围内的编码了。
但RPE直接替换RoPE编码,而RoPE在高频和低频维度上对长距离的表示能力不同。于是纽约大学团队把RPE“嫁接”到YaRN编码上。YaRN通过NTK-by-parts插值和注意力温度缩放,能更好地处理长上下文。Randomized YaRN的做法是:训练时,每个token的位置编码是YaRN(采样位置 i; 缩放因子 s)。这样,模型在短序列训练中就能接触到长序列才会出现的YaRN旋转角度分布。

第二步:长度课程学习

如果一上来就把最大采样长度L_t设成128K,模型很可能直接“晕掉”。论文设计了一个逐渐增长的最大采样长度序列:比如训练5个epoch,L_t依次为8K、16K、24K、32K、32K。这样模型先适应小幅度长距离编码,再逐步挑战更大的跨度。
表3:长度课程对RPE训练和Randomized YaRN在Qwen2.5-7B-Instruct上MRCR任务的消融实验。两种方法在缺少课程时性能大幅下降。
表3:长度课程对RPE训练和Randomized YaRN在Qwen2.5-7B-Instruct上MRCR任务的消融实验。两种方法在缺少课程时性能大幅下降。
从表3的消融实验可以看出,课程学习有多重要。去掉课程后,RPE的OOD平均精度从75.1%暴跌到56.8%,Randomized YaRN也从77.3%降到69.4%。
完整的训练流程是:训练时使用YaRN编码 + 随机位置采样 + 长度课程;推理时则使用标准的YaRN编码(不采样),只设置相应的缩放因子s'。论文还发现,推理时使用比训练时更大的缩放因子s' > s,可以进一步解锁更长上下文的泛化能力。
图2:Olmo3-7B-Instruct在BABILong上的学习率扫描结果。OOD平均准确率如图中数据点所示。
图2:Olmo3-7B-Instruct在BABILong上的学习率扫描结果。OOD平均准确率如图中数据点所示。
方法本身不复杂,但设计得非常精巧。它本质上是对YaRN的一种“面向泛化的训练增强”,没有引入额外的可学习参数——只需要在每次训练迭代时重新计算位置编码向量,计算开销基本可以忽略。

实验全胜:在两个基准上OOD泛化能力均大幅领先

对比基线设置非常全面:包括(1)零样本直接推理;(2)标准LoRA微调;(3)Trained YaRN(微调时使用YaRN编码但不随机采样);(4)RPE(用随机位置编码替代原生RoPE训练,推理时用YaRN)。对于Olmo3模型,由于预训练时内置了YaRN,Vanilla LoRA和RPE无法正确使用,排除在外。
数据量和训练配置合理:BABILong训练集4000条,MRCR仅60条。所有方法使用相同的LoRA配置(r=16, alpha=32, dropout=0.1),训练上下文长度不超过9,216(BABILong)或8,192(MRCR)。这确保了差异只来自位置编码的处理方式。
评估涵盖了多个OOD长度:BABILong从0K到128K共9个长度档位,MRCR从4-8K到64-128K共5个区间。Randomized YaRN在所有这些远距离长度上一致领先,证明了方法的鲁棒性。
论文还发现一个有趣的现象:零样本直接使用YaRN(不加训练)效果很有限。在BABILong上,不加YaRN的零样本OOD平均只有20.7%,加了YaRN也才21.2%。这表明单纯靠推理时修改编码不足以让模型掌握长上下文推理,必须经过训练才能“融会贯通”。

方法虽好,但仍有不足:局限性与未来方向

第一,适用范围有限。该方法主要适用于推理上下文长度远大于训练上下文长度的场景。如果训练时已经用了足够长的上下文,优势可能就不那么大了。
第二,模型规模和评估语言单一。所有实验只在70亿参数级别的模型上进行,没有验证更大或更小的模型。评估数据仅限英文,对于中文等多语言场景的泛化能力未知。
第三,没有与更多长上下文扩展方法对比。论文没有对比PoSE、LongRoPE等方法,如果能在同一个基准上公平对比,会更有说服力。
第四,课程设计依赖手工调整。目前的长度课程序列是手工设定的,不同任务可能需要不同的课程步长和终点。如果能发展为自适应方案,适用性会更广。
不过话说回来,这篇论文提出的思想——通过随机位置采样让模型“预先看到”长文本编码,配合课程学习逐步加码——非常简洁且有效。尤其适合预算有限、又想提升大模型长文本能力的团队。龙哥相信,这个方法很可能成为未来长上下文扩展的标配组件。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?大语言模型在短文本上训练后,难以泛化到更长的上下文进行复杂推理。论文提出Randomized YaRN训练方法,通过在短文本训练中模拟长文本的位置编码,让模型学会长度泛化,仅用<8K的数据就能在128K长上下文推理任务上取得领先效果。

文章中提到的YaRN、RoPE、RPE、LoRA分别是什么意思?RoPE(Rotary Position Embedding)是苏剑林等人提出的一种旋转位置编码,被大多数现代大模型使用。YaRN(Yet another RoPE extensioN)是2024年提出的一种基于RoPE的上下文扩展方法,通过NTK-by-parts插值和注意力温度缩放来延长有效上下文。RPE(Randomized Positional Encoding)是2023年提出的随机位置编码,在训练时为每个token分配一个从更大范围中随机抽取的位置编码。LoRA(Low-Rank Adaptation)是一种高效的微调方法,通过在模型权重矩阵旁添加低秩矩阵来进行参数高效微调。

Randomized YaRN在实际部署中需要注意什么?第一,训练时需要对每个batch重新随机采样位置编码,但计算量增加不大。第二,推理时不需要随机采样,只需使用标准YaRN并设置合适的缩放因子s'。第三,课程学习的最大长度L_t需要根据目标推理长度进行设计。第四,该方法只适用于训练长度远小于推理长度的场景。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

随机位置编码+长度课程学习用于改进YaRN,思路新颖且简洁。虽然RPE和YaRN都不是新东西,但将两者结合并系统评估课程学习的作用,是首个有效的配方。

实验合理度:★★★★☆

对比基线全面,消融实验充分。但缺少与PoSE、LongRoPE等其他主流上下文扩展方法的直接对比。

学术研究价值:★★★★☆

探索了长度泛化的新机制,对理解Transformer的位置编码泛化有重要理论启发。

稳定性:★★★★☆

在两个不同架构的模型上、两个有挑战性的任务上一致表现良好。但仅在7B模型上验证。

适应性以及泛化能力:★★★☆☆

在特定场景(训练短、推理长)下泛化能力强,但若训练长度已经较长则优势减弱。仅评估了英文推理任务。

硬件需求及成本:★★★★☆

训练时额外计算量极小,LoRA微调参数量少,7B模型单卡可跑。推理时无额外开销。

复现难度:★★★★★

方法实现简单,论文列出了超参数配置,复现难度极低。

产品化成熟度:★★★☆☆

可用于需要长上下文推理的产品,但还需在更大模型、更多任务上验证稳定性。课程长度需要针对具体产品调整。

可能的问题:论文未对比最先进的其他上下文扩展方法,且仅使用单一的LoRA微调方式,验证场景偏窄。随机位置编码是否会破坏注意力机制的某些先验结构?论文没有深入分析。


主要参考文献

[1] Peng, B., Quesnelle, J., Fan, H., & Shippole, E. (2024). YaRN: Efficient Context Window Extension of Large Language Models. ICLR 2024.
[2] Ruoss, A., Delétang, G., Genewein, T., et al. (2023). Randomized Positional Encodings Boost Length Generalization of Transformers. ACL 2023.
[3] Zhu, D., Yang, N., Wang, L., et al. (2024). PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise Training. ICLR 2024.
[4] Su, J., Lu, Y., Pan, S., et al. (2023). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
[5] Kuratov, Y., Bulatov, A., Anokhin, P., et al. (2024). BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack. arXiv:2406.10149.
[6] Vodrahalli, K., Ontanon, S., Tripuraneni, N., et al. (2024). Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries. arXiv:2409.12640.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想让你的大模型也学会“超长待机”? 这招“随机位置+课程学习”的套路,让你的小模型也能hold住长上下文推理,就像学会了降龙十八掌,一招鲜吃遍天~ 想跟龙哥一起练就更多大模型的神功吗?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大语言模型+上海+NYU+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。