← 返回 PaperDaily 大模型与智能体

百度北大新作:ECHO把长程RL的记忆与信用打通

长程智能体最烦的不是“想不起来”,而是“想起来了却不知道该把功劳算给谁”。ECHO把记忆选择和信用分配绑在一起,思路很工程,也很实用,尤其适合做搜索、工具调用和深度研究的Agent训练。

百度北大新作:ECHO把长程RL的记忆与信用打通
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
长程智能体最烦的不是“想不起来”,而是“想起来了却不知道该把功劳算给谁”。ECHO把记忆选择和信用分配绑在一起,思路很工程,也很实用,尤其适合做搜索、工具调用和深度研究的Agent训练。


原论文信息如下:
论文标题:
ECHO: PRUNE TO ACT, TRACE TO LEARN WITH SELECTIVE TURN MEMORY IN AGENTIC RL
发表日期:
2026年06月
发表单位:
Peking University, Baidu Inc., University of Science and Technology of China
原文链接:
https://arxiv.org/pdf/2606.31650v1.pdf
开源代码链接:
https://github.com/xiezijun714-lang/Echo

基于来源索引的选择性记忆,打通长程Agent的行动与学习

长程智能体最容易翻车的地方,不是“不会搜”,而是“搜到了也记不住,记住了也说不清功劳算谁的”。ECHO正是冲着这个痛点来的:它不把历史一股脑压成一坨摘要,而是把每一轮完成的交互都做成带来源索引的记忆,再从这些记忆里挑出当前真正有用的证据,重新拼出下一步可用的上下文。这样一来,Agent在行动时能“轻装上阵”,在学习时又能“顺藤摸瓜”。
封面
图1:ECHO在BrowseComp-Plus训练中的表现。它一边提升准确率,一边没有像滚动摘要那样把轮次和轨迹体积越滚越大,属于“更会办事,也更不乱花钱”的那类方法。
论文标题里的两个动词很关键:prune to act,意思是先剪枝再行动;trace to learn,意思是学习时保留可追踪路径。这里的核心不是“记忆越多越好”,而是“记忆必须可定位、可重建、可回传信用”。这比单纯堆长上下文更像工程系统:不是把仓库门敞开,而是给每个箱子贴标签,后面才知道哪箱货真的救了场。

在32K上下文窗口下,策略如何筛选历史证据?

先把背景说人话。长程Agent做搜索、工具调用、深度研究时,历史轮次会越积越多,但模型能吃进去的上下文窗口有限。传统做法大致有几类:截断,只留最近几轮;摘要,把旧内容压成一段话;检索,从历史里挑相关片段;或者做记忆模块,把旧状态存起来。问题在于,摘要能省长度,却会丢掉原始证据的“出处”。证据被压扁后,模型虽然还能看见“结论”,却不一定知道结论来自哪一轮、哪次工具调用、哪条观察。
表1:在(M, Φ)接口下的上下文管理回合策略,比较不同方法是否保留可追踪性。
表1:在(M,Φ)接口下的上下文管理回合策略。这里的M表示“历史如何被管理”,Φ表示“如何把管理后的历史重新渲染成模型上下文”。表里最重要的一列是Traceability,也就是重建出来的上下文还能不能指回原始环境轮次。ECHO的答案是能,而且是源索引级别地能。
论文把长程回合过程抽象成一个统一接口:历史先被管理,再被重建成政策上下文。这个视角很实用,因为它把“能不能继续做事”和“能不能追责学习”拆开了。很多方法只解决前者,比如滑动窗口、摘要、压缩记忆;但后者没解决,训练时还是只能把最终奖励粗暴地摊给整条轨迹。结果就是,模型可能把“真正有用的证据轮次”和“只是瞎忙活的搜索轮次”混在一起奖励,越训越像在给乱翻网页发奖金。
ECHO的做法更像“分仓管理”。每完成一轮工具交互,系统会把这一轮压缩成一条source-indexed memory,也就是“带来源索引的记忆”。英文全称里没有额外花活,重点就在于 source-indexed:每条记忆都明确知道自己来自哪一轮。论文里还会为这一轮写一个简短的发现摘要,作为后续检索的线索。这样,旧历史不会被揉成一个不可拆分的大球,而是变成一个个带编号的小卡片。
当上下文窗口快满了,ECHO不会直接把最早的内容扔掉,而是让策略从这些记忆卡片里选择当前最有用的历史证据。这里的选择不是静态相似度检索,而是由策略自己根据当前搜索状态来决定。这个设计很像人类研究问题:不是看到“长得像”的资料就全塞进脑子,而是先想清楚现在卡住的是证据、反例还是下一步行动,再去翻对应的笔记。
论文还保留了一个很务实的细节:最近几轮会自动保留,远处记忆则由模型选取。换句话说,ECHO不是“全靠模型记忆”,也不是“全靠检索器拍脑袋”,而是把近期上下文和长期记忆做了分工。这个分工很工程,代价也很清楚:系统复杂度比纯摘要高一点,但换来的是更稳的证据保真度和更可控的学习路径。
图3:ECHO总体框架,先把完成的轮次存成带来源索引的记忆,再从记忆中选择有用证据重建上下文,并把同一条来源轨迹用于信用分配。
图3:ECHO整体框架。左边是“记忆怎么存”,中间是“上下文怎么拼”,右边是“奖励怎么回”。这张图把论文最关键的逻辑串起来了:同一条来源索引同时服务于行动和学习,不是一边存记忆、一边训练时又把记忆关系弄丢。

“源索引”如何为正向结果提供精确的信用路由?

这部分是ECHO最有意思的地方。很多Agent RL方法的问题不在于“没有奖励”,而在于“奖励太晚、太粗、太糊”。最终答案对了,不代表前面每一步都该加分;但如果不加,模型又不知道到底是哪一轮证据搜索、哪次记忆选择帮了忙。ECHO的思路是:既然上下文重建时已经记录了哪些历史轮次被选进来了,那学习时就顺着这条provenance trace,也就是“来源轨迹”,去做信用分配。
这里的credit assignment,可以直接理解成“功劳分账”。普通做法是把整条轨迹的优势值摊给很多token,像是老板月底发奖金时人人都有份,但没人知道谁真干活。ECHO不这么干。它只把正向结果的信用路由给几类token:最终答案段、被选入最终上下文的历史证据轮次、这些轮次生成的记忆摘要,以及记忆选择动作本身。也就是说,只有真正参与了“重建出正确决策上下文”的部分,才会被重点奖励。
论文还做了一个很谨慎的限制:只有当轨迹整体是正向优势时,才沿着来源索引做traceable credit。原因也很朴素——如果最终结果是错的,选中的历史轮次可能是有用但被误用,也可能本来就带偏了方向。此时强行往回分账,只会把噪声当监督,训练越久越像在给错误路径贴金。这个设计虽然保守,但很符合大模型训练里“宁可少奖,不要乱奖”的现实。
图2:长程搜索中的训练诊断。基于摘要的上下文管理能让回合变长,但也会带来轮次膨胀、响应更长、生成时间更高、轨迹体积更大。
图2把问题说得很直白:摘要式上下文管理确实能让回合继续往后跑,但副作用也很明显,轮次越来越多,回答越来越长,生成时间越来越高,轨迹体积越来越大。换句话说,模型不是更聪明了,而是更会绕路了。ECHO想解决的,就是这种“看起来能跑很久,实际上在疯狂加班”的局面。
如果把ECHO的训练逻辑压缩成一句话,大概就是:先用来源索引把历史证据选出来,再把奖励只发给真正参与了可追踪重建的部分。这让“记忆选择”和“信用分配”不再是两套互不相干的系统,而是同一条链上的两个环节。前者决定看什么,后者决定奖什么,逻辑非常统一。

从43.4%准确率看ECHO:行动更高效,学习更精准

主实验放在BrowseComp-Plus上,任务本质是长程工具使用和证据检索,比较适合检验这种“记忆+信用”联合设计到底有没有用。作者把Qwen3-32B-Instruct作为主干模型,并和GRPO、SUPO式滚动摘要做对比。结果很直接:ECHO的held-out accuracy达到43.4%,明显高于GRPO的28.9%和SUPO的36.1%。
图4:BrowseComp-Plus上的消融实验。(a)学习式源选择优于语义top-k检索;(b)去掉可追踪信用路由会降低准确率和稳定性。
图4的消融实验很关键,因为它不是只告诉读者“ECHO赢了”,而是告诉读者“到底是谁在干活”。图4(a)显示,学习式源选择比静态语义top-k检索更强,说明当前问题需要的不是“语义上像”,而是“当前状态下真正该看谁”。图4(b)则表明,一旦去掉traceable credit routing,准确率和稳定性都会掉下来,说明这不是一个可有可无的附加项,而是方法的主骨架之一。
从效率角度看,ECHO也没有“为了准确率把系统跑炸”。论文给出的训练动态里,SUPO虽然也能延长回合,但会出现轮次膨胀、轨迹体积变大、生成时间上升等现象;ECHO则在更少的轮次和更低的轨迹体积下拿到了更高准确率。这个结果很有现实意义,因为Agent系统真正落地时,成本和稳定性往往比论文里的小数点更值钱。一个方法如果只能在demo里跑得漂亮,到了线上就开始疯狂堆token,那基本等于把工程团队请去陪它熬夜。
图5:Qwen3-30B-A3B-Instruct MoE骨干上的训练动态。SUPO在50步附近进入塌缩状态,准确率明显恶化,平均轮次和轨迹体积却继续膨胀。
图5更像一次“压力测试”。在MoE骨干Qwen3-30B-A3B-Instruct上,SUPO在训练到一定步数后进入塌缩区,准确率掉得很难看,而轮次和轨迹体积还在涨。ECHO则保持了更稳的训练曲线。这说明选择性记忆和可追踪信用分配并不只是对某个密集模型有效,而是对MoE这类更复杂骨干也有迁移价值。
更值得一提的是零样本泛化。论文在多目标问答、代码生成、深度信息检索等多个基准上测试,没有额外微调,ECHO依然取得了更好的平均表现。这个结果说明,ECHO学到的不只是某个任务的“搜题技巧”,而是一种更通用的长程上下文管理方式:知道保留什么、丢掉什么、奖励什么。
表2:多个基准上的零样本泛化结果,ECHO在Qwen3-32B和Qwen3-30B-A3B两种骨干上都取得了更好的平均分。
表2展示了零样本泛化结果。可以看到,ECHO在Qwen3-32B-Instruct上平均分达到40.2%,在Qwen3-30B-A3B-Instruct上也有30.5%,都高于GRPO和SUPO。更重要的是,这种提升不是只在单一任务上冒头,而是在证据密集型任务里更明显。原因不难理解:当任务需要反复查证、对照、回溯时,能指回原始证据的记忆结构就比“压成一段摘要”更靠谱。

模拟实验验证:选择性记忆与可追溯信用分配缺一不可

如果只看一个点,容易误判这篇论文只是“又一个更聪明的记忆模块”。但消融实验告诉读者,ECHO真正的价值在于选择性记忆可追溯信用分配是绑在一起的:只做前者,学习信号还是会乱;只做后者,没有能指回原始证据的记忆结构,credit routing也会失去锚点。论文的结论并不玄学,反而很朴素——Agent想跑得远,先得知道自己每一步踩在了哪块石头上。
从方法论上看,ECHO有两个很现实的启发。第一,长程Agent不是单纯把上下文窗口做大就行,关键是把历史结构化成可管理、可追踪的状态。第二,RL里的信用分配不一定非得更“复杂”,有时只要把奖励和证据来源对齐,就能少走很多弯路。这个思路对搜索、代码、深度研究、工具调用类Agent都很有借鉴意义。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是长程Agent里最烦的两个问题:旧历史太长,模型装不下;而且历史被压缩后,RL又不知道该把奖励发给谁。ECHO用带来源索引的记忆把“行动时的上下文重建”和“学习时的信用回传”连成了一条线。

source-indexed memory和普通摘要有什么区别?普通摘要只保留“内容大意”,source-indexed memory除了内容,还保留“这条内容来自哪一轮”。前者像会议纪要,后者像会议纪要加页码,后面追证据时差别很大。

为什么ECHO只对正向结果做traceable credit?因为只有成功轨迹里的“被选中证据”更像是有效路径的近似代理;如果结果是错的,选中的历史可能本来就偏了,再沿着它回传奖励只会把噪声放大。这个保守策略虽然少发了一些“安慰奖”,但训练信号更干净。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把“记忆选择”和“信用分配”用同一条来源索引串起来,这个点很干净,也很工程化,不是那种只会在标题里发光的创新。

实验合理度:★★★★☆。主实验、消融、跨骨干、零样本泛化都做了,比较完整;如果能再补更多真实工具环境和更长训练曲线,会更扎实。

学术研究价值:★★★★☆。它不只是一个技巧,而是把长程Agent训练里“上下文管理”和“信用分配”这两个老问题接到了一起,后续很容易继续展开。

稳定性:★★★☆☆。从结果看比滚动摘要稳,但本质上还是依赖记忆选择和训练信号设计,落地时对任务类型和预算控制有要求。

适应性以及泛化能力:★★★★☆。在多目标问答、代码和深度信息检索上都能转移,说明不是只对BrowseComp-Plus有效。

硬件需求及成本:★★★☆☆。训练主干已经到32B和MoE级别,成本不低;但相对“无限堆长上下文”的粗暴路线,ECHO至少是在更有纪律地花算力。

复现难度:★★★☆☆。代码已开源是加分项,但这类Agent RL复现通常还受环境、验证器、数据筛选和训练细节影响,不算轻松。

产品化成熟度:★★★☆☆。适合搜索、研究助手、工具调用型Agent的训练框架参考,但要进产品,还得再验证多轮稳定性、记忆污染和长周期成本。

可能的问题:方法把“可追踪性”做得很漂亮,但也把系统链路拉长了;真实线上场景里,记忆选择错误、索引漂移和验证器偏差,都可能让收益打折。


主要参考文献

ECHO: Prune to Act, Trace to Learn with Selective Turn Memory in Agentic RL, arXiv 2026.
项目代码:https://github.com/xiezijun714-lang/Echo
原文链接:https://arxiv.org/pdf/2606.31650v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。