← 返回 PaperDaily 大模型与智能体

北大阿里新方法:长上下文推理少复读,准确率最高提4.6分

长上下文推理最怕什么?不是算不出来,而是模型一边思考一边疯狂复读输入。北大和阿里这篇论文把“复读”拆成可优化的奖励信号,思路很朴素,效果却很能打。

北大阿里新方法:长上下文推理少复读,准确率最高提4.6分
原论文信息如下:
论文标题:
COPY LESS, GROUND MORE: OVERCOMING REPETITIVE COPYING IN LONG-CONTEXT REASONING VIA EVIDENCE-AWARE REINFORCEMENT LEARNING
发表日期:
2026年07月
发表单位:
Peking University; Alibaba Group
原文链接:
https://arxiv.org/pdf/2607.19345v1.pdf

大模型“照抄”输入?长上下文推理的致命缺陷

长上下文推理这件事,表面上看是“读得更长”,本质上却是“别把输入当草稿纸”。这篇论文抓到的毛病很直接:很多带思维链的大模型,在长文本里不是先找证据再推理,而是一边思考一边把输入大段抄进来,像极了考试时把题干复述了三遍,最后还没答对。
论文把这个现象叫作 repetitive copying,中文可以理解成“重复性照抄”或“复读式复制”。它不是偶尔抄一句,而是在长上下文里把输入中的大段内容直接搬进推理过程。更麻烦的是,输入越长,这种行为越严重;模型越爱“复读”,推理越长,准确率反而越容易掉。
封面:长上下文推理中的重复性照抄问题
封面图:长上下文推理中的重复性照抄问题。图里最扎眼的不是模型“会不会想”,而是它“会不会抄”。
这事之所以值得单独拎出来,是因为很多人默认“上下文更长=信息更多=模型更强”。现实却很不讲武德:上下文变长后,模型不一定更聪明,反而可能更啰嗦、更分心、更爱把无关内容当证据。长上下文推理的难点,已经不是“能不能看到”,而是“看到了能不能抓住重点”。

诊断:模型为何会复读?证据接地不足是关键

论文没有停留在“模型很烂”这种情绪化判断上,而是做了一个比较扎实的诊断:模型不是单纯爱抄,而是接地不足。所谓接地,简单说就是模型能不能把推理和真正有用的证据对上号,而不是把整段输入一锅端。
论文先把输入拆成两类:一类是任务相关的关键证据,另一类是干扰上下文。前者是真正该看的内容,后者就是长文本里常见的“陪跑信息”。如果模型只是不断复制输入,那它可能把证据和噪声一起抄进去;如果它真的会推理,就应该更偏向关键证据,少碰干扰内容。
这里有一个很关键的判断:复制本身不一定坏,乱复制才坏。如果模型能准确抓住关键证据,把它们和问题关联起来,复制甚至可能是有帮助的;但如果模型对整段上下文平均用力,什么都抄一点,那就会把有限的思考预算浪费在“搬运”上,而不是“求解”上。
图1:不同上下文长度下七个模型的 n-gram 重叠率变化
图1:不同上下文长度下七个模型的 n-gram 重叠率变化。可以看到,输入越长,模型越容易从原文里“顺手抄作业”,而且 10-gram 的高重叠说明抄的还是长段连续内容,不是零星词汇碰巧撞上。
论文在 GSM-Infinite 上观察到一个很一致的现象:七个前沿长上下文模型,随着上下文从 8k 拉到 64k,复制率都在上升。这个结果很扎心,因为它说明这不是某一个模型“手滑”,而是长上下文推理里普遍存在的系统性毛病。更重要的是,10-gram 这种更长的重叠也很高,意味着模型不是偶尔引用几个词,而是在连续搬运原文片段。
图2:重复性照抄如何同时伤害准确率和推理效率
图2:重复性照抄如何同时伤害准确率和推理效率。正确样本的重叠率明显更低;而当重叠率升高时,准确率下滑,思考长度却猛增,典型的“越想越长,越长越错”。
更有意思的是,论文还把“抄得多”和“答得对”放在一起看,结果非常清楚:正确样本的重叠率更低,错误样本更容易陷入高重叠。换句话说,复读不是一种高明策略,它更像是模型在长输入面前的应激反应。模型一旦开始把 token 预算花在复述上,推理长度就会飙高,最终把自己拖进一个“越啰嗦越没用”的循环。
图3:正确与错误样本的接地程度差异
图3:正确与错误样本的接地程度差异。正确样本的 grounding ratio 更高,说明它们更偏向关键证据;同时它们对干扰上下文的重叠更低,说明模型确实在“挑着看”,而不是“全都抄”。
这一步把根因说透了:问题不在于模型会不会复制,而在于它是否能把复制对象锁定在关键证据上。论文用 grounding ratio 来衡量这种选择性,结果显示,答对的样本通常有更高的接地比例。这个结论很朴素,但很值钱,因为它把“长上下文推理失败”从玄学拉回到了工程问题:模型需要学会筛证据,而不是海量复述。

对症下药:GEAR奖励塑形,精准区分证据与干扰

既然根因是接地不足,那药方就不能只盯着最终答案对不对,还要奖励模型“有没有盯住该盯的证据”。论文提出的 GEAR,全称是 Grounding Evidence-Aware Reward,中文可以叫“证据感知的接地奖励”。
GEAR 的核心很简单:在原本的准确率奖励之外,再加两个方向相反但彼此配合的信号。一个是grounding reward,鼓励模型多关注关键证据;另一个是distractor penalty,惩罚模型对干扰上下文的无差别复制。前者负责“拉着模型往正确证据上靠”,后者负责“别让模型把噪声也当宝贝抱走”。
图7:GSPO 与 GEAR 的推理行为对比
图7:GSPO 与 GEAR 的推理行为对比。GSPO 虽然少了输入照抄,但容易陷入重复循环;GEAR 则能先抽取策略,再围绕频率关系做推理,最后用更少的思考 token 得到正确答案。
这个设计最妙的地方,在于它没有把“少复制”当成唯一目标。只惩罚复制,模型可能直接什么都不抄,连关键证据也不碰;只奖励关键证据,模型又可能为了拿奖励,把整段输入都复制一遍。GEAR 把两种力同时放进去,逼着模型学会区分“该看什么”和“该躲什么”。这才像真正的训练,而不是单纯给模型装个“少说话”插件。
从优化角度看,GEAR 本质上是一个奖励塑形方法。原始的准确率信号太稀疏,尤其在长上下文里,模型很难知道自己到底是因为没找到证据,还是因为找到了但没处理好。GEAR 把“答对”拆成更细的过程目标:既要对,还要对得有依据;既要看上下文,还要会筛上下文。
表2:GEAR 对重复性照抄与思考长度的影响
表2:GEAR 对重复性照抄与思考长度的影响。可以看到,单加 grounding reward 反而会让模型更爱抄、更爱想;只有 grounding reward 和 distractor penalty 一起上,复制率和思考长度才会同时降下来。
这张表特别能说明问题。只加 grounding reward 时,模型会更用力地和输入发生“互动”,但互动对象不够干净,于是复制率不降反升,思考长度也被拉长。这个现象非常像“只许努力,不许偷懒”的训练口号,听起来很励志,实际很容易把模型带偏。GEAR 的价值就在于,它不是鼓励模型疯狂靠近输入,而是鼓励模型更聪明地靠近输入。

自动化数据构建:让GEAR跳出人造数据集

如果奖励设计只有理论,没有数据支撑,那训练照样落不了地。论文很清楚地意识到这一点,所以专门做了一套自动化数据构建流程,让 GEAR 不只会在合成题上发力,也能走进自然语言文档。
这套流程的思路有点反直觉:不是先出题再找证据,而是先选证据,再让问题围着证据长出来。这样一来,证据标注几乎是“顺手生成”的,不需要人工一条条标。论文把它分成三步:先分析文档适不适合问答,再从文档里抽出若干片段作为约束证据,最后只允许问题在这些证据范围内生成,并通过独立复答来验证答案是否唯一可解。
这里有一个很实用的工程味道:长上下文训练最大的成本之一,就是高质量标注太贵。论文没有幻想“人工精标百万条长文证据”,而是用程序化流程把证据和问题绑定起来,尽量降低数据准备门槛。对于真正要把这类方法做成训练管线的人来说,这一步比单纯的奖励函数更接近现实。
训练集构成也很有意思:一部分来自 GSM-Infinite 和 PhantomWiki 这类结构化合成任务,另一部分来自 RedPajama-v2 文档生成的自然语言问答。这样做的目的很明确,就是避免 GEAR 只会在“题目长得像训练集”的场景里有效,而是希望它学到一种更通用的证据接地能力。
表5:按推理步骤数分组的准确率与重叠率关系
表5:按推理步骤数分组的准确率与重叠率关系。它说明复制率升高并不是因为题目“本来就更难”这么简单,而是在相同复杂度下,过度照抄仍然会明显拉低表现。
这类分组分析很重要,因为它能排除一个常见借口:是不是模型只是碰到了更难的问题,所以才抄得多、答得差?论文给出的结果是否定的。即便把问题按推理步骤数分开看,复制率和准确率之间的负相关仍然存在,说明“复读”不是题目难度的副作用,而是模型行为本身出了问题。

效果验证:准确率暴涨,思考量锐减,推理更高效

方法好不好,最后还是得看实验说话。论文把 GEAR 放在多个长上下文基准上验证,包括 Ruler、LongBench-v2、BrowseComp-LC、GraphWalks 和 AA-LCR,并且分别考察了 32k 与 128k 两种上下文尺度。这个设置很合理,因为它既测了常规长上下文,也测了更接近真实应用的超长上下文。
表1:长上下文基准上的总体性能
表1:长上下文基准上的总体性能。GEAR 在三种模型规模、两种上下文长度下都拿到了最好的平均分,而且 128k 场景下的提升通常比 32k 更明显。
这张表最值得看的不是“某个单项涨了多少”,而是整体趋势:GEAR 在所有模型配置下都稳定优于仅用准确率奖励的 GSPO,平均提升最高能到 +4.6。更有意思的是,训练时只见过 16k–32k 的上下文,到了 128k 仍然能继续涨,这说明学到的不是某个固定长度的技巧,而是一种更泛化的证据接地能力。
不过,论文也很诚实地揭示了一个坑:只加 grounding reward 反而会翻车。这不是小瑕疵,而是方法设计里最关键的反例之一。它说明如果没有 distractor penalty,模型会被奖励驱动去“多碰输入”,但碰的方向不对,结果就是复制更多、思考更长、效果更差。也就是说,GEAR 真正起作用的不是“奖励证据”这一个动作,而是“奖励证据 + 压制干扰”这对组合拳。
图4:不同重叠率区间下的准确率与思考长度
图4:不同重叠率区间下的准确率与思考长度。蓝色柱子是准确率,红色折线是思考长度。可以直观看到,重叠率越高,模型越容易“想得又长又差”。
图5:正确与错误样本的 grounding ratio 分布
图5:正确与错误样本的 grounding ratio 分布。多模型下都能看到,答对的样本更偏向关键证据,答错的样本则更容易被干扰上下文带跑。
再看效率层面,GEAR 也挺实在。它不只是把准确率拉上去,还把思考长度压下来了。以 Ruler 和 LongBench-v2 为例,GEAR 相比 GSPO 都能进一步缩短输出 token 数,同时降低输入重叠率。这个结果很重要,因为很多长上下文方法只顾着提分,不管推理成本,最后落地时一算账,GPU 直接先皱眉。GEAR 至少在“更准”和“更省”这两个方向上没有打架。
图10:GSPO 在同一样本上的反复犹豫
图10:GSPO 在同一样本上的反复犹豫。它已经找到正确答案,却还在来回自我怀疑,最后产生了大量冗余思考 token。这个现象说明,长上下文推理的浪费不只来自照抄,也来自“想太多还想不明白”。
图9:基线模型在长文本中陷入反复自我怀疑
图9:基线模型在长文本中陷入反复自我怀疑。它明明早早接近答案,却在长文里不断重算、反悔、再重算,最后把自己拖进冗余推理泥潭。
如果把这些结果连起来看,论文其实讲清了一个很现实的道理:长上下文能力不是“能塞多少字”这么简单,而是“能不能在长输入里稳定地抓住证据、过滤噪声、控制推理长度”。GEAR 的贡献,就是把这个抽象能力拆成了可训练、可验证、可分析的奖励信号。

总结与启示:接地能力是长上下文推理的基石,龙迷三问,龙哥点评,参考文献

这篇论文最有价值的地方,不是又造了一个听起来很酷的缩写,而是把长上下文推理里一个常被忽略的问题讲明白了:模型在超长输入里失败,很多时候不是“看不见”,而是“看见了也没抓住重点”。GEAR 的思路很务实,既不神神叨叨,也不靠玄学调参,而是直接把“证据接地”写进奖励里。
对做大模型训练的人来说,这篇工作至少给了三个启发。第一,长上下文训练不能只看最终答案,过程里是否真正利用了关键证据同样重要。第二,奖励设计不能太单薄,尤其在复杂推理里,单一奖励很容易把模型带到歪路上。第三,数据构造本身就是方法的一部分,能不能自动生成“带证据”的训练样本,往往决定了方法能不能真正规模化。
当然,这篇论文也不是没有边界。它目前的奖励主要依赖可标注的证据范围,天然更适合那些证据边界清晰、答案可验证的任务;如果换成更开放、更主观的长文理解,证据划分和奖励计算都会更难。换句话说,GEAR 很像一把锋利的手术刀,适合切清楚的病灶,但还不是万能锤。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是长上下文推理里“模型爱复读输入”的问题。论文发现,模型在超长文本中会把大量输入直接复制进思维链,导致准确率下降、推理长度暴涨,所以提出用证据接地奖励来纠正这个行为。

GEAR 里的 grounding reward 和 distractor penalty 分别是什么意思?grounding reward 是奖励模型去覆盖关键证据,鼓励它真正参考任务相关内容;distractor penalty 是惩罚模型去复制无关干扰内容,防止它把噪声也一并抄走。两者一起用,模型才会学会“挑着看”。

为什么论文还要做自动化数据构建?因为只靠合成数据不够,方法很容易被质疑“只在玩具任务上有效”。自动化数据构建让 GEAR 能从任意长文里生成带证据标注的问答样本,把训练从人造题库扩展到自然语言文档,增强了方法的通用性。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆。创新点不在于发明了全新范式,而在于把“接地不足”这个长上下文痛点拆成可优化的奖励项,思路稳,够实用。

实验合理度:★★★★☆。诊断、消融、跨基准验证都比较完整,而且还专门验证了“只加 grounding reward 会翻车”,这类反例很加分。

学术研究价值:★★★★☆。它把长上下文推理里的“复制”和“接地”关系讲清楚了,对后续做奖励设计、证据选择和长文推理训练都有启发。

稳定性:★★★☆☆。在长上下文基准上表现稳定,但依赖证据标注与可验证答案,离更开放的真实业务还有一段距离。

适应性以及泛化能力:★★★★☆。从合成题到自然语言文档都做了验证,且 128k 上下文也能受益,说明不是只会背训练集套路。

硬件需求及成本:★★★☆☆。训练仍然是长上下文 RL,成本不会低,但方法本身没有额外引入复杂检索器,推理阶段相对干净。

复现难度:★★★☆☆。核心奖励思路并不复杂,但证据标注管线、长上下文训练和评估都不算轻松,工程门槛中等偏上。

产品化成熟度:★★★☆☆。适合证据边界清晰的长文问答、检索增强推理和企业文档场景,但对开放式生成和模糊任务还需要更多验证。

可能的问题:方法依赖可识别的关键证据与干扰划分,若任务证据边界模糊、答案不可严格验证,奖励设计就会明显变难,泛化到开放域还需补实验。


主要参考文献

Fang, L., Shen, W., Tang, T., & Wang, Y. Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning. arXiv:2607.19345v1, 2026.
Zheng et al. GSPO: Group Sequence Policy Optimization. 2025.
Guo et al. DeepSeek-R1. 2025.

长上下文不是比谁更能抄,关键是能不能盯住证据狠狠干活。想继续看这种“把模型毛病讲明白”的论文拆解,欢迎加入龙哥读论文粉丝群,和一群爱较真的同行一起聊推理、聊RL、聊落地。扫描下方二维码或加龙哥助手微信号 kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。