← 返回 PaperDaily
大模型与智能体
北大阿里新方法:长上下文推理少复读,准确率最高提4.6分
长上下文推理最怕什么?不是算不出来,而是模型一边思考一边疯狂复读输入。北大和阿里这篇论文把“复读”拆成可优化的奖励信号,思路很朴素,效果却很能打。
龙哥读论文
阅读 3
查看原文
原论文信息如下:
大模型“照抄”输入?长上下文推理的致命缺陷
长上下文推理这件事,表面上看是“读得更长”,本质上却是“别把输入当草稿纸”。这篇论文抓到的毛病很直接:很多带思维链的大模型,在长文本里不是先找证据再推理,而是一边思考一边把输入大段抄进来,像极了考试时把题干复述了三遍,最后还没答对。
论文把这个现象叫作 repetitive copying,中文可以理解成“重复性照抄”或“复读式复制”。它不是偶尔抄一句,而是在长上下文里把输入中的大段内容直接搬进推理过程。更麻烦的是,输入越长,这种行为越严重;模型越爱“复读”,推理越长,准确率反而越容易掉。
这事之所以值得单独拎出来,是因为很多人默认“上下文更长=信息更多=模型更强”。现实却很不讲武德:上下文变长后,模型不一定更聪明,反而可能更啰嗦、更分心、更爱把无关内容当证据。长上下文推理的难点,已经不是“能不能看到”,而是“看到了能不能抓住重点”。
诊断:模型为何会复读?证据接地不足是关键
论文没有停留在“模型很烂”这种情绪化判断上,而是做了一个比较扎实的诊断:模型不是单纯爱抄,而是接地不足。所谓接地,简单说就是模型能不能把推理和真正有用的证据对上号,而不是把整段输入一锅端。
论文先把输入拆成两类:一类是任务相关的关键证据,另一类是干扰上下文。前者是真正该看的内容,后者就是长文本里常见的“陪跑信息”。如果模型只是不断复制输入,那它可能把证据和噪声一起抄进去;如果它真的会推理,就应该更偏向关键证据,少碰干扰内容。
这里有一个很关键的判断:复制本身不一定坏,乱复制才坏。如果模型能准确抓住关键证据,把它们和问题关联起来,复制甚至可能是有帮助的;但如果模型对整段上下文平均用力,什么都抄一点,那就会把有限的思考预算浪费在“搬运”上,而不是“求解”上。
论文在 GSM-Infinite 上观察到一个很一致的现象:七个前沿长上下文模型,随着上下文从 8k 拉到 64k,复制率都在上升。这个结果很扎心,因为它说明这不是某一个模型“手滑”,而是长上下文推理里普遍存在的系统性毛病。更重要的是,10-gram 这种更长的重叠也很高,意味着模型不是偶尔引用几个词,而是在连续搬运原文片段。
更有意思的是,论文还把“抄得多”和“答得对”放在一起看,结果非常清楚:正确样本的重叠率更低,错误样本更容易陷入高重叠。换句话说,复读不是一种高明策略,它更像是模型在长输入面前的应激反应。模型一旦开始把 token 预算花在复述上,推理长度就会飙高,最终把自己拖进一个“越啰嗦越没用”的循环。
这一步把根因说透了:问题不在于模型会不会复制,而在于它是否能把复制对象锁定在关键证据上。论文用 grounding ratio 来衡量这种选择性,结果显示,答对的样本通常有更高的接地比例。这个结论很朴素,但很值钱,因为它把“长上下文推理失败”从玄学拉回到了工程问题:模型需要学会筛证据,而不是海量复述。
对症下药:GEAR奖励塑形,精准区分证据与干扰
既然根因是接地不足,那药方就不能只盯着最终答案对不对,还要奖励模型“有没有盯住该盯的证据”。论文提出的 GEAR,全称是 Grounding Evidence-Aware Reward,中文可以叫“证据感知的接地奖励”。
GEAR 的核心很简单:在原本的准确率奖励之外,再加两个方向相反但彼此配合的信号。一个是grounding reward,鼓励模型多关注关键证据;另一个是distractor penalty,惩罚模型对干扰上下文的无差别复制。前者负责“拉着模型往正确证据上靠”,后者负责“别让模型把噪声也当宝贝抱走”。
这个设计最妙的地方,在于它没有把“少复制”当成唯一目标。只惩罚复制,模型可能直接什么都不抄,连关键证据也不碰;只奖励关键证据,模型又可能为了拿奖励,把整段输入都复制一遍。GEAR 把两种力同时放进去,逼着模型学会区分“该看什么”和“该躲什么”。这才像真正的训练,而不是单纯给模型装个“少说话”插件。
从优化角度看,GEAR 本质上是一个奖励塑形方法。原始的准确率信号太稀疏,尤其在长上下文里,模型很难知道自己到底是因为没找到证据,还是因为找到了但没处理好。GEAR 把“答对”拆成更细的过程目标:既要对,还要对得有依据;既要看上下文,还要会筛上下文。
这张表特别能说明问题。只加 grounding reward 时,模型会更用力地和输入发生“互动”,但互动对象不够干净,于是复制率不降反升,思考长度也被拉长。这个现象非常像“只许努力,不许偷懒”的训练口号,听起来很励志,实际很容易把模型带偏。GEAR 的价值就在于,它不是鼓励模型疯狂靠近输入,而是鼓励模型更聪明地靠近输入。
自动化数据构建:让GEAR跳出人造数据集
如果奖励设计只有理论,没有数据支撑,那训练照样落不了地。论文很清楚地意识到这一点,所以专门做了一套自动化数据构建流程,让 GEAR 不只会在合成题上发力,也能走进自然语言文档。
这套流程的思路有点反直觉:不是先出题再找证据,而是先选证据,再让问题围着证据长出来。这样一来,证据标注几乎是“顺手生成”的,不需要人工一条条标。论文把它分成三步:先分析文档适不适合问答,再从文档里抽出若干片段作为约束证据,最后只允许问题在这些证据范围内生成,并通过独立复答来验证答案是否唯一可解。
这里有一个很实用的工程味道:长上下文训练最大的成本之一,就是高质量标注太贵。论文没有幻想“人工精标百万条长文证据”,而是用程序化流程把证据和问题绑定起来,尽量降低数据准备门槛。对于真正要把这类方法做成训练管线的人来说,这一步比单纯的奖励函数更接近现实。
训练集构成也很有意思:一部分来自 GSM-Infinite 和 PhantomWiki 这类结构化合成任务,另一部分来自 RedPajama-v2 文档生成的自然语言问答。这样做的目的很明确,就是避免 GEAR 只会在“题目长得像训练集”的场景里有效,而是希望它学到一种更通用的证据接地能力。
这类分组分析很重要,因为它能排除一个常见借口:是不是模型只是碰到了更难的问题,所以才抄得多、答得差?论文给出的结果是否定的。即便把问题按推理步骤数分开看,复制率和准确率之间的负相关仍然存在,说明“复读”不是题目难度的副作用,而是模型行为本身出了问题。
效果验证:准确率暴涨,思考量锐减,推理更高效
方法好不好,最后还是得看实验说话。论文把 GEAR 放在多个长上下文基准上验证,包括 Ruler、LongBench-v2、BrowseComp-LC、GraphWalks 和 AA-LCR,并且分别考察了 32k 与 128k 两种上下文尺度。这个设置很合理,因为它既测了常规长上下文,也测了更接近真实应用的超长上下文。
这张表最值得看的不是“某个单项涨了多少”,而是整体趋势:GEAR 在所有模型配置下都稳定优于仅用准确率奖励的 GSPO,平均提升最高能到 +4.6。更有意思的是,训练时只见过 16k–32k 的上下文,到了 128k 仍然能继续涨,这说明学到的不是某个固定长度的技巧,而是一种更泛化的证据接地能力。
不过,论文也很诚实地揭示了一个坑:只加 grounding reward 反而会翻车。这不是小瑕疵,而是方法设计里最关键的反例之一。它说明如果没有 distractor penalty,模型会被奖励驱动去“多碰输入”,但碰的方向不对,结果就是复制更多、思考更长、效果更差。也就是说,GEAR 真正起作用的不是“奖励证据”这一个动作,而是“奖励证据 + 压制干扰”这对组合拳。
再看效率层面,GEAR 也挺实在。它不只是把准确率拉上去,还把思考长度压下来了。以 Ruler 和 LongBench-v2 为例,GEAR 相比 GSPO 都能进一步缩短输出 token 数,同时降低输入重叠率。这个结果很重要,因为很多长上下文方法只顾着提分,不管推理成本,最后落地时一算账,GPU 直接先皱眉。GEAR 至少在“更准”和“更省”这两个方向上没有打架。
如果把这些结果连起来看,论文其实讲清了一个很现实的道理:长上下文能力不是“能塞多少字”这么简单,而是“能不能在长输入里稳定地抓住证据、过滤噪声、控制推理长度”。GEAR 的贡献,就是把这个抽象能力拆成了可训练、可验证、可分析的奖励信号。
总结与启示:接地能力是长上下文推理的基石,龙迷三问,龙哥点评,参考文献
这篇论文最有价值的地方,不是又造了一个听起来很酷的缩写,而是把长上下文推理里一个常被忽略的问题讲明白了:模型在超长输入里失败,很多时候不是“看不见”,而是“看见了也没抓住重点”。GEAR 的思路很务实,既不神神叨叨,也不靠玄学调参,而是直接把“证据接地”写进奖励里。
对做大模型训练的人来说,这篇工作至少给了三个启发。第一,长上下文训练不能只看最终答案,过程里是否真正利用了关键证据同样重要。第二,奖励设计不能太单薄,尤其在复杂推理里,单一奖励很容易把模型带到歪路上。第三,数据构造本身就是方法的一部分,能不能自动生成“带证据”的训练样本,往往决定了方法能不能真正规模化。
当然,这篇论文也不是没有边界。它目前的奖励主要依赖可标注的证据范围,天然更适合那些证据边界清晰、答案可验证的任务;如果换成更开放、更主观的长文理解,证据划分和奖励计算都会更难。换句话说,GEAR 很像一把锋利的手术刀,适合切清楚的病灶,但还不是万能锤。
龙迷三问
这篇论文到底解决了什么问题?它解决的是长上下文推理里“模型爱复读输入”的问题。论文发现,模型在超长文本中会把大量输入直接复制进思维链,导致准确率下降、推理长度暴涨,所以提出用证据接地奖励来纠正这个行为。
GEAR 里的 grounding reward 和 distractor penalty 分别是什么意思?grounding reward 是奖励模型去覆盖关键证据,鼓励它真正参考任务相关内容;distractor penalty 是惩罚模型去复制无关干扰内容,防止它把噪声也一并抄走。两者一起用,模型才会学会“挑着看”。
为什么论文还要做自动化数据构建?因为只靠合成数据不够,方法很容易被质疑“只在玩具任务上有效”。自动化数据构建让 GEAR 能从任意长文里生成带证据标注的问答样本,把训练从人造题库扩展到自然语言文档,增强了方法的通用性。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★☆☆。创新点不在于发明了全新范式,而在于把“接地不足”这个长上下文痛点拆成可优化的奖励项,思路稳,够实用。
实验合理度:★★★★☆。诊断、消融、跨基准验证都比较完整,而且还专门验证了“只加 grounding reward 会翻车”,这类反例很加分。
学术研究价值:★★★★☆。它把长上下文推理里的“复制”和“接地”关系讲清楚了,对后续做奖励设计、证据选择和长文推理训练都有启发。
稳定性:★★★☆☆。在长上下文基准上表现稳定,但依赖证据标注与可验证答案,离更开放的真实业务还有一段距离。
适应性以及泛化能力:★★★★☆。从合成题到自然语言文档都做了验证,且 128k 上下文也能受益,说明不是只会背训练集套路。
硬件需求及成本:★★★☆☆。训练仍然是长上下文 RL,成本不会低,但方法本身没有额外引入复杂检索器,推理阶段相对干净。
复现难度:★★★☆☆。核心奖励思路并不复杂,但证据标注管线、长上下文训练和评估都不算轻松,工程门槛中等偏上。
产品化成熟度:★★★☆☆。适合证据边界清晰的长文问答、检索增强推理和企业文档场景,但对开放式生成和模糊任务还需要更多验证。
可能的问题:方法依赖可识别的关键证据与干扰划分,若任务证据边界模糊、答案不可严格验证,奖励设计就会明显变难,泛化到开放域还需补实验。
主要参考文献
Fang, L., Shen, W., Tang, T., & Wang, Y. Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning. arXiv:2607.19345v1, 2026.
Zheng et al. GSPO: Group Sequence Policy Optimization. 2025.
Guo et al. DeepSeek-R1. 2025.
长上下文不是比谁更能抄,关键是能不能盯住证据狠狠干活。想继续看这种“把模型毛病讲明白”的论文拆解,欢迎加入龙哥读论文粉丝群,和一群爱较真的同行一起聊推理、聊RL、聊落地。扫描下方二维码或加龙哥助手微信号 kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称。

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

