← 返回 PaperDaily
大模型与智能体
多轮搜索Agent新范式:小模型蒸馏精炼上下文,性能逼近GPT-4
搜索智能体总是"检索到答案却答不出来"?问题很可能出在上下文干扰。港中大等机构这篇研究系统地定位了干扰源——最新检索回来的文档,并设计了蒸馏式上下文精炼器,让智能体在"生成"之前先"精炼",可靠性和效率双双提升。看完这篇,对多轮搜索智能体的调优思路会有新的启发。
龙哥读论文
发布于 2026-08-27 00:20:02
阅读 5
查看原文
原论文信息如下:
引言
先来设想一个场景。问搜索智能体"Hndrxx这张专辑中客串的加拿大歌手是谁",它搜了三轮,每轮都返回了三篇关于专辑的维基百科文档。文档里客串歌手的名字堆了一长串:Rihanna、The Weeknd、Chris Brown、Nicki Minaj……结果智能体最后自信地写下"Nicki Minaj"——一个正确答案都没有沾边的结论。而事实上,答案"加拿大歌手The Weeknd"早就躺在检索结果里了。
这种"检索到了却答不对"的现象,就是本论文要解决的核心问题——上下文干扰(Context Interference) 。所谓上下文干扰,指的是搜索引擎每轮都会返回一批文档以尽量覆盖查询需求,但其中混入的无关或冗余信息会干扰大语言模型的判断,让它把注意力放在错误的地方。尤其在多轮搜索智能体中,检索文档、历史查询、思考步骤全部堆叠在上下文中,干扰会在每一轮积累放大,最终拖累回答的质量和搜索的效率。
用论文里的数据说明这个问题有多严重:在检索到的文档确实包含正确答案的问题中(Recall Rate),搜索智能体真正能给出正确答案的比例(Recall Accuracy)存在巨大的落差。下面这张图直观地展示了上下文干扰的影响。
注意看,检索命中率并不低,但真正转化成正确答案的比例却低得惊人。也就是说,搜索智能体的瓶颈往往不在"搜不到",而在"看到了却看不准"——文档里的关键信息被淹没在大量无关描述中,模型被带偏了。
论文的贡献在于系统地回答了三个问题:第一,上下文干扰到底来自哪里?第二,怎样精炼上下文来消除干扰?第三,把上下文精炼融入搜索智能体的强化学习训练,能不能带来进一步提升?针对第一个问题,论文通过掩码实验发现,干扰主要来自最新一轮检索回来的文档 ,历史查询和旧文档也有一定影响但并非主因。针对第二个问题,论文提出了一个基于蒸馏的上下文精炼器(Context Refiner) ,用大模型老师蒸馏出精炼数据集,让小模型学会提取与查询最相关的关键信息,过滤噪声。针对第三个问题,论文进一步提出了CRRL(Context-Refined Reinforcement Learning)框架 ,把上下文精炼器引入GRPO强化学习的rollout过程中,在训练阶段动态精炼上下文,让模型在更干净的轨迹上学习。
下面这张图展示了一个真实的例子:同样的提问,左边是原始检索文档输入时的生成过程,模型被一堆歌手名字绕晕,最后答错;右边是经过上下文精炼后的生成过程,只保留了最关键的信息,模型一步到位给出正确答案。这种对比非常直观地体现了精炼的价值。
搜索智能体为何“答非所问”?——上下文干扰的发现
先把场景放大来看。所谓搜索智能体(Search Agent) ,就是让大语言模型(LLM)具备调用搜索引擎的能力,通过多轮“思考→检索→再思考”的过程来解决复杂问题。每一轮,模型先生成一个搜索查询,检索器从知识库中捞回Top-K篇文档,模型再基于这些文档决定下一步动作或直接给出答案。这个过程用马尔可夫决策过程(Markov Decision Process,MDP)来刻画非常自然:状态是当前拼接起来的历史上下文,动作是思考步骤和搜索查询,观察是检索到的文档列表,奖励来自最终答案与标准答案的比对。
问题就出在“观察”上。检索器为了提升召回率,每轮都返回一堆文档,其中真正与当前查询相关的可能只有一小段,其余都是干扰。论文将这种现象称为上下文干扰(Context Interference) :大量不相关信息挤在上下文里,把LLM的注意力带偏,导致它明明“看到”了答案却回答错误。更麻烦的是,多轮搜索智能体的上下文是不断累积的——前几轮的历史查询、历史文档、思考步骤也会堆在上下文窗口里,干扰还会随轮次叠加放大。
论文用一组直观的指标拆解了问题:召回率(Recall Rate)衡量“检索到的文档里含不含正确答案”,召回准确率(Recall Accuracy)衡量“在检索到正确答案的前提下,模型能不能答对”,最终准确率(Accuracy)衡量整体答题正确率。理想情况下这三个指标应该很接近,但数据显示出巨大的落差——检索没问题,答题掉链子。换句话说,搜索智能体的瓶颈不在于“搜不到”,而在于“看到了却看不准”。
这篇来自香港中文大学、伦敦大学学院、浙江大学、香港大学和爱丁堡大学合作的论文,就是要把这个“看不准”的根源挖出来,再对症下药。
三步定位干扰源:最新检索文档是“罪魁祸首”
要搞清楚干扰从哪来,论文设计了一个非常巧妙的掩码实验。基础方法采用IRCoT(Interleaved Retrieval and Chain-of-Thought,交错检索与思维链),即让模型在思考过程中边推理边检索。在此基础上,通过对历史上下文做“断舍离”,构造出三个变体:IRCoT-o丢掉之前所有轮的检索文档,只保留最新一轮观察;IRCoT-oq再进一步丢掉历史搜索查询;IRCoT-oqp只保留最近一轮的思考、查询和观察。通过对比这些变体的表现,就能逐个定位不同上下文成分的干扰程度。
表1:不同推理方法在问答测试集上的性能(EM/ART),其中EM指精确匹配(Exact Match)用于评估可靠性,ART指平均检索次数(Average Retrieval Times)用于评估效率。
表1里的数据透露了几个关键信息。第一,IRCoT-o在可靠性和效率上都优于IRCoT,说明去掉历史文档确实能减少干扰。第二,IRCoT-oq比IRCoT-o略好一点,表明历史搜索查询也带着轻微干扰,但影响不大。第三,IRCoT-oqp的可靠性反而小幅下降、检索次数明显变多,这说明历史思考步骤其实存着对后续推理有价值的线索,不能一刀切全丢掉。
但这里有个更深的发现。即便把历史文档和历史查询全部去掉,IRCoT-oqp的“召回率”和“召回准确率”之间依然存在很大的空隙——说明真正的干扰源还没被挖出来。
图3:四种IRCoT变体搜索智能体的上下文干扰效果演示,结果在所有问答测试集上取平均,指标定义与图1一致。
结合Figure 3来看:过去几轮的思考步骤通常会总结和推理前文信息,当模型生成当前轮次的动作时,它真正直接依赖的是最新检索回来的原始文档 。这些文档未经任何筛选,Top-K里混着大量与查询关系不大甚至完全无关的句子,模型在读上下文时被这些噪声分散了注意力,自然就容易“答非所问”。
找到了主要矛盾,下一步就是对症下药——把最新检索文档里真正关键的信息提取出来,丢掉噪声。这就是论文提出的上下文精炼器(Context Refiner) 要做的事情。
蒸馏精炼器:让弱模型也能精准提取关键信息
上下文精炼的目标很明确:每一轮检索之后,先对最新文档做一次“提纯”,只保留与当前搜索查询最相关的内容,再把精炼后的文本交给搜索智能体,而不是直接堆原始文档。这里的核心难题在于,用什么模型来做精炼?直接调用GPT-4级别的大模型当然效果最好,但推理成本高、延迟大,在实际产品里跑不起。让一个小模型来做精炼,它自己都未必看得懂复杂文档,提取出来的重点可能偏到姥姥家。论文的实验也证实了这一点:让小模型自己尝试精炼,效果几乎没有提升。
于是论文采用了知识蒸馏(Knowledge Distillation) 的思路:让强模型当老师,生成一批高质量的“原始文档→精炼文本”配对数据,然后让小模型跟着学。具体流程是:用IRCoT方式在问答数据集上跑教师的推理过程,每一轮检索到文档后,让老师模型专门针对搜索查询提取关键信息。这里特意强调是“提取”而不是“总结”——提取意味着所有输出内容必须原原本本来自原始文档,不能凭空发挥。
图4:基于蒸馏的上下文精炼器训练流程。教师模型在IRCoT推理过程中为每轮检索文档生成精炼后的关键信息,经过蕴含模型验证后构建蒸馏数据集,训练学生模型。
为了确保数据质量,论文还加了一道保险:用蕴含模型(Entailment Model) 自动验证精炼后的文本是否完全被原始文档蕴含,是否引入了原文之外的新信息。只有通过验证的数据才会进入蒸馏数据集。这样一来,最终的数据集里每一对“原始文档→精炼文本”都是可靠、可学习的。
拿到数据集后,用监督微调(Supervised Fine-Tuning,SFT)训练学生模型,目标函数如下:
π* = argmin_π L_SFT,即找到使精炼损失最小化的模型参数。
L_SFT = -(1/M)ΣE[L_i],对蒸馏数据集中的M个样本求期望损失。
L_i = log M_π(d̃_i | d_i, q_i),即给定原始文档d_i和搜索查询q_i,模型生成精炼文本d̃_i的交叉熵损失。
训练完成后,这个精炼器就可以作为一个即插即用的模块,部署在任意搜索智能体的检索和生成之间。
表2:上下文精炼方法在缓解干扰方面的性能(EM/ART),在多个问答测试集上与IRCoT基线及各对照方法对比。
论文还设置了三个对照方法:GPT-Compress用GPT-4直接压缩全部历史上下文,GPT-Refine用GPT-4按查询动态精炼最新文档,Self-Refine则让小模型自己精炼。表2和下面这张上下文长度对比图一起看,能得出几个重要结论。
图5:搜索智能体在所有问答测试集上的平均上下文长度对比,用于评估不同精炼方法的效率。
第一,GPT-Refine明显优于GPT-Compress,说明“按查询定向提取关键信息”比“无差别压缩全文”更有效。第二,Context Refiner用很小的模型就逼近了GPT-4级别的精炼效果,证明蒸馏路线的价值——不一定非要依赖昂贵的大模型API才能实现高质量上下文精炼。第三,Self-Refine几乎没什么用,小模型的“信息提取”能力确实需要靠蒸馏来补足。
CRRL框架:将上下文精炼融入强化学习训练
前面两步都是在推理阶段做文章。论文没有止步于此,还往前多想了一步:既然精炼后的上下文对搜索智能体帮助这么大,能不能直接把精炼器塞进强化学习(Reinforcement Learning,RL) 的训练流程里,让模型在训练阶段就习惯从干浄的上下文中提取信息?
这就引出了论文提出的CRRL(Context-Refined Reinforcement Learning,上下文精炼强化学习) 框架。CRRL选择了GRPO(Group Relative Policy Optimization,群体相对策略优化)作为底层强化学习算法。GRPO是近年来在LLM对齐中常用的一种策略优化方法,它的特点是:对同一个状态采样一组输出,用组内输出的奖励均值与标准差做归一化,得到每个输出的相对优势,再通过裁剪的PPO目标更新策略。相比传统PPO需要额外维护一个价值网络(critic model),GRPO更简洁、训练开销更低。
图6:论文提出的CRRL方法演示。在GRPO强化学习训练的rollout阶段,上下文精炼器对检索文档做动态精炼,搜索智能体在精炼后的干净上下文上进行多轮推理,再根据最终奖励进行策略更新。
CRRL的核心改动在于rollout阶段。传统GRPO训练搜索智能体时,模型直接基于原始检索文档做推理;而CRRL在检索和推理之间插入了一个固定的上下文精炼器(在训练期间冻结参数),每一轮检索得到的文档都先被精炼成关键时刻、无噪声的文本,再交给搜索智能体继续生成。这样做的好处是:模型在训练期间看到的都是“干净上下文”,策略梯度也能更集中地学习“如何利用关键信息做正确决策”,而不会被噪声带偏。
CRRL的优化目标表达式为 L_CRRL = -E[G_π - β·KL],其中G_π是组内归一化后的策略梯度优势项,β·KL是策略与参考策略的KL散度惩罚,防止模型跑偏。
其中G_π = (1/G)Σ_j (1/Σ_k|a_j|) · R_j,意思是组内所有生成动作序列的优势奖励按动作长度做归一化后取平均。
R_j内部采用与PPO一致的裁剪目标:Σ_k min(r_k·A_j, clip(r_k, 1-ε, 1+ε)·A_j),其中r_k是新旧策略的似然比,A_j是组内归一化优势。
整个CRRL流程概括起来就是:在GRPO训练中,每次检索后先用精炼器把上下文“洗干净”,再让搜索智能体做决策和回答。训练结束之后,这个智能体在推理阶段既可以直接搭配精炼器使用,也可以凭借已经学会的精炼习惯在更复杂的场景中保持较好的表现。
实验验证:可靠性与效率的双重提升
论文的实验横跨七个闭卷问答数据集,覆盖单跳和多跳场景。单跳数据集包括Natural Questions(自然问题)、TriviaQA(冷知识问答)、PopQA(流行文化问答);多跳数据集包括HotpotQA、2Wiki-MultiHopQA、MuSiQue、Bamboogle。模型方面采用Qwen2.5-7b-Instruct和Qwen2.5-3b-Instruct作为基础大模型,检索器使用E5,知识库使用2018年维基百科转储。
表3:CRRL方法与多个基线在问答测试集上的EM/ART性能。
表4:推理阶段各方法的效率对比,包括平均检索次数(ART)、平均上下文长度(Len.)、单题平均推理时间(AIT)。
从可靠性(EM)来看,CRRL在多个数据集上的表现超过了IRCoT基线,特别是在多跳问答数据集上,Qwen2.5-7b的提升幅度比单跳更明显。这说明在更复杂的推理链中,上下文干扰积累得更多,精炼上下文的收益也更大。对比同样搭配了精炼器但只在推理阶段使用的Context Refiner,CRRL依然占有优势——把精炼融入训练,让模型从根本上改变了“阅读”检索文档的方式,不再需要依赖大量原始文本来猜答案,而是能主动聚焦关键信息。
从效率(ART、Len.、AIT)来看,收益更加直观。原始IRCoT的ART通常在2.5次以上,而精炼后的方法大幅压缩到1.0到1.2次左右。上下文长度从数千token急剧下降到几百token,推理时间也相应缩短。这背后的逻辑不难理解:上下文干净了,模型不需要反复检索来排查噪声信息,检索次数自然就少了;输入长度变短,计算量也同步下降。
论文还分析了“召回率→召回准确率→准确率”的转化链路。通过精炼上下文,召回率与召回准确率之间的差距明显收窄,验证了精炼确实在帮助模型“把看到的答案说出口”,而不是靠记忆硬猜。
这项工作的核心价值在于提出并验证了一种新的Agent工作范式——“先精炼上下文,再生成回答 ”。它告诉我们,对于多轮搜索智能体,与其盲目堆砌检索结果来扩充上下文,不如先把上下文“瘦身”到真正有用的信息上。这既是对效率的优化,更是对可靠性的保障。
龙迷三问
这篇论文到底在解决什么问题? 多轮搜索智能体常因检索文档中的无关信息陷入"上下文干扰",检索到答案却答不对。本文系统定位干扰源——最新检索文档是主因,据此提出蒸馏式上下文精炼器,并在强化学习训练中动态精炼上下文,在7个问答数据集上同时提升可靠性与效率。
这篇工作最值得看的点是什么? CRRL方法在7个QA数据集上平均EM达到36.6(7b模型)和31.5(3b模型),均优于所有对比方法;ART分别降至1.7和1.3,显著低于IRCoT的2.6和1.4,在可靠性和效率上均取得最优表现。
这篇工作的边界或风险在哪里? 优点:1)系统性地研究了多轮搜索智能体中的上下文干扰问题,明确了干扰主要来源于最新检索文档;2)提出基于蒸馏的上下文精炼器,使弱模型也能获得精炼能力;3)将上下文精炼融入RL训练流程,同时提升可靠性和效率。缺点:1)上下文精炼器作为辅助模块,未与智能体训练完全集成;2)依赖教师模型(GPT-4)构建蒸馏数据,成本较高;3)在MuSiQue数据集上性能提升有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出基于蒸馏的上下文精炼器(Context Refiner),动态过滤多轮搜索智能体上下文中的最新检索文档,以缓解上下文干扰并提升可靠性与效率,并将其融入GRPO强化学习训练流程。
实验合理度: ★★★★☆
Exact Match (EM) 用于可靠性,Average Retrieval Times (ART)、平均上下文长度(Len.)、平均推理时间(AIT)用于效率。
学术研究价值: ★★★★☆
提出基于蒸馏的上下文精炼器(Context Refiner),动态过滤多轮搜索智能体上下文中的最新检索文档,以缓解上下文干扰并提升可靠性与效率,并将其融入GRPO强化学习训练流程;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
CRRL方法在Qwen2.5-7b上平均推理时间16.9秒/问题,在Qwen2.5-3b上为4.2秒/问题。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: ,明确了干扰主要来源于最新检索文档;2)提出基于蒸馏的上下文精炼器,使弱模型也能获得精炼能力;3)将上下文精炼融入RL训练流程,同时提升可靠性和效率。缺点:1)上下文精炼器作为辅助模块,未与智能体训练完全集成;2)依赖教师模型(GPT-4)构建蒸馏数据,成本较高;
[1] Xue B, Wu B, Qiao S, et al. Mitigating Context Interference for Reliable and Efficient Search Agents[J]. arXiv preprint arXiv:2608.10743, 2026.
[2] Trivedi H, Balasubramanian N, Khot T, et al. Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions[C]//ACL 2023.
[3] Qwen Team. Qwen2.5 technical report[J]. arXiv preprint arXiv:2412.15115, 2024.
[4] Wang L, Yang N, Huang X, et al. Text embeddings by weakly-supervised contrastive pre-training[J]. arXiv preprint arXiv:2212.03533, 2022.
[5] Shao Z, Wang P, Zhu Q, et al. DeepSeekMath: Pushing the limits of mathematical reasoning in open language models[J]. arXiv preprint arXiv:2402.03300, 2024.
[6] Jin B, Zeng A, et al. Trail: Learning to search with language models[J]. 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
搜索智能体还在"答非所问"?让上下文先精炼,再生成!想了解更多大模型与智能体前沿进展,欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+港中大+龙哥) ,根据格式备注,可更快被通过且邀请进群。群内已有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融五大方向,等你来!
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!