← 返回 PaperDaily
大模型与智能体
百度北大新作:ECHO把长程RL的记忆与信用打通
长程智能体最烦的不是“想不起来”,而是“想起来了却不知道该把功劳算给谁”。ECHO把记忆选择和信用分配绑在一起,思路很工程,也很实用,尤其适合做搜索、工具调用和深度研究的Agent训练。
龙哥读论文
发布于 2026-08-16 11:00:47
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 长程智能体最烦的不是“想不起来”,而是“想起来了却不知道该把功劳算给谁”。ECHO把记忆选择和信用分配绑在一起,思路很工程,也很实用,尤其适合做搜索、工具调用和深度研究的Agent训练。
原论文信息如下:
基于来源索引的选择性记忆,打通长程Agent的行动与学习
长程智能体最容易翻车的地方,不是“不会搜”,而是“搜到了也记不住,记住了也说不清功劳算谁的”。ECHO正是冲着这个痛点来的:它不把历史一股脑压成一坨摘要,而是把每一轮完成的交互都做成带来源索引的记忆 ,再从这些记忆里挑出当前真正有用的证据,重新拼出下一步可用的上下文。这样一来,Agent在行动时能“轻装上阵”,在学习时又能“顺藤摸瓜”。
论文标题里的两个动词很关键:prune to act ,意思是先剪枝再行动;trace to learn ,意思是学习时保留可追踪路径。这里的核心不是“记忆越多越好”,而是“记忆必须可定位、可重建、可回传信用”。这比单纯堆长上下文更像工程系统:不是把仓库门敞开,而是给每个箱子贴标签,后面才知道哪箱货真的救了场。
先把背景说人话。长程Agent做搜索、工具调用、深度研究时,历史轮次会越积越多,但模型能吃进去的上下文窗口有限。传统做法大致有几类:截断,只留最近几轮;摘要,把旧内容压成一段话;检索,从历史里挑相关片段;或者做记忆模块,把旧状态存起来。问题在于,摘要能省长度,却会丢掉原始证据的“出处” 。证据被压扁后,模型虽然还能看见“结论”,却不一定知道结论来自哪一轮、哪次工具调用、哪条观察。
论文把长程回合过程抽象成一个统一接口:历史先被管理,再被重建成政策上下文。这个视角很实用,因为它把“能不能继续做事”和“能不能追责学习”拆开了。很多方法只解决前者,比如滑动窗口、摘要、压缩记忆;但后者没解决,训练时还是只能把最终奖励粗暴地摊给整条轨迹。结果就是,模型可能把“真正有用的证据轮次”和“只是瞎忙活的搜索轮次”混在一起奖励,越训越像在给乱翻网页发奖金。
ECHO的做法更像“分仓管理”。每完成一轮工具交互,系统会把这一轮压缩成一条source-indexed memory ,也就是“带来源索引的记忆”。英文全称里没有额外花活,重点就在于 source-indexed:每条记忆都明确知道自己来自哪一轮。论文里还会为这一轮写一个简短的发现摘要,作为后续检索的线索。这样,旧历史不会被揉成一个不可拆分的大球,而是变成一个个带编号的小卡片。
当上下文窗口快满了,ECHO不会直接把最早的内容扔掉,而是让策略从这些记忆卡片里选择当前最有用的历史证据 。这里的选择不是静态相似度检索,而是由策略自己根据当前搜索状态来决定。这个设计很像人类研究问题:不是看到“长得像”的资料就全塞进脑子,而是先想清楚现在卡住的是证据、反例还是下一步行动,再去翻对应的笔记。
论文还保留了一个很务实的细节:最近几轮会自动保留,远处记忆则由模型选取。换句话说,ECHO不是“全靠模型记忆”,也不是“全靠检索器拍脑袋”,而是把近期上下文和长期记忆做了分工。这个分工很工程,代价也很清楚:系统复杂度比纯摘要高一点,但换来的是更稳的证据保真度和更可控的学习路径。
这部分是ECHO最有意思的地方。很多Agent RL方法的问题不在于“没有奖励”,而在于“奖励太晚、太粗、太糊”。最终答案对了,不代表前面每一步都该加分;但如果不加,模型又不知道到底是哪一轮证据搜索、哪次记忆选择帮了忙。ECHO的思路是:既然上下文重建时已经记录了哪些历史轮次被选进来了,那学习时就顺着这条provenance trace ,也就是“来源轨迹”,去做信用分配。
这里的credit assignment,可以直接理解成“功劳分账”。普通做法是把整条轨迹的优势值摊给很多token,像是老板月底发奖金时人人都有份,但没人知道谁真干活。ECHO不这么干。它只把正向结果的信用路由给几类token:最终答案段、被选入最终上下文的历史证据轮次、这些轮次生成的记忆摘要,以及记忆选择动作本身。也就是说,只有真正参与了“重建出正确决策上下文”的部分,才会被重点奖励。
论文还做了一个很谨慎的限制:只有当轨迹整体是正向优势时,才沿着来源索引做traceable credit。原因也很朴素——如果最终结果是错的,选中的历史轮次可能是有用但被误用,也可能本来就带偏了方向。此时强行往回分账,只会把噪声当监督,训练越久越像在给错误路径贴金。这个设计虽然保守,但很符合大模型训练里“宁可少奖,不要乱奖”的现实。
如果把ECHO的训练逻辑压缩成一句话,大概就是:先用来源索引把历史证据选出来,再把奖励只发给真正参与了可追踪重建的部分 。这让“记忆选择”和“信用分配”不再是两套互不相干的系统,而是同一条链上的两个环节。前者决定看什么,后者决定奖什么,逻辑非常统一。
从43.4%准确率看ECHO:行动更高效,学习更精准
主实验放在BrowseComp-Plus上,任务本质是长程工具使用和证据检索,比较适合检验这种“记忆+信用”联合设计到底有没有用。作者把Qwen3-32B-Instruct作为主干模型,并和GRPO、SUPO式滚动摘要做对比。结果很直接:ECHO的held-out accuracy达到43.4% ,明显高于GRPO的28.9%和SUPO的36.1%。
从效率角度看,ECHO也没有“为了准确率把系统跑炸”。论文给出的训练动态里,SUPO虽然也能延长回合,但会出现轮次膨胀、轨迹体积变大、生成时间上升等现象;ECHO则在更少的轮次和更低的轨迹体积下拿到了更高准确率。这个结果很有现实意义,因为Agent系统真正落地时,成本和稳定性往往比论文里的小数点更值钱 。一个方法如果只能在demo里跑得漂亮,到了线上就开始疯狂堆token,那基本等于把工程团队请去陪它熬夜。
更值得一提的是零样本泛化。论文在多目标问答、代码生成、深度信息检索等多个基准上测试,没有额外微调,ECHO依然取得了更好的平均表现。这个结果说明,ECHO学到的不只是某个任务的“搜题技巧”,而是一种更通用的长程上下文管理方式 :知道保留什么、丢掉什么、奖励什么。
如果只看一个点,容易误判这篇论文只是“又一个更聪明的记忆模块”。但消融实验告诉读者,ECHO真正的价值在于选择性记忆 和可追溯信用分配 是绑在一起的:只做前者,学习信号还是会乱;只做后者,没有能指回原始证据的记忆结构,credit routing也会失去锚点。论文的结论并不玄学,反而很朴素——Agent想跑得远,先得知道自己每一步踩在了哪块石头上。
从方法论上看,ECHO有两个很现实的启发。第一,长程Agent不是单纯把上下文窗口做大就行,关键是把历史结构化成可管理、可追踪的状态。第二,RL里的信用分配不一定非得更“复杂”,有时只要把奖励和证据来源对齐,就能少走很多弯路。这个思路对搜索、代码、深度研究、工具调用类Agent都很有借鉴意义。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是长程Agent里最烦的两个问题:旧历史太长,模型装不下;而且历史被压缩后,RL又不知道该把奖励发给谁。ECHO用带来源索引的记忆把“行动时的上下文重建”和“学习时的信用回传”连成了一条线。
source-indexed memory和普通摘要有什么区别? 普通摘要只保留“内容大意”,source-indexed memory除了内容,还保留“这条内容来自哪一轮”。前者像会议纪要,后者像会议纪要加页码,后面追证据时差别很大。
为什么ECHO只对正向结果做traceable credit? 因为只有成功轨迹里的“被选中证据”更像是有效路径的近似代理;如果结果是错的,选中的历史可能本来就偏了,再沿着它回传奖励只会把噪声放大。这个保守策略虽然少发了一些“安慰奖”,但训练信号更干净。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把“记忆选择”和“信用分配”用同一条来源索引串起来,这个点很干净,也很工程化,不是那种只会在标题里发光的创新。
实验合理度: ★★★★☆。主实验、消融、跨骨干、零样本泛化都做了,比较完整;如果能再补更多真实工具环境和更长训练曲线,会更扎实。
学术研究价值: ★★★★☆。它不只是一个技巧,而是把长程Agent训练里“上下文管理”和“信用分配”这两个老问题接到了一起,后续很容易继续展开。
稳定性: ★★★☆☆。从结果看比滚动摘要稳,但本质上还是依赖记忆选择和训练信号设计,落地时对任务类型和预算控制有要求。
适应性以及泛化能力: ★★★★☆。在多目标问答、代码和深度信息检索上都能转移,说明不是只对BrowseComp-Plus有效。
硬件需求及成本: ★★★☆☆。训练主干已经到32B和MoE级别,成本不低;但相对“无限堆长上下文”的粗暴路线,ECHO至少是在更有纪律地花算力。
复现难度: ★★★☆☆。代码已开源是加分项,但这类Agent RL复现通常还受环境、验证器、数据筛选和训练细节影响,不算轻松。
产品化成熟度: ★★★☆☆。适合搜索、研究助手、工具调用型Agent的训练框架参考,但要进产品,还得再验证多轮稳定性、记忆污染和长周期成本。
可能的问题: 方法把“可追踪性”做得很漂亮,但也把系统链路拉长了;真实线上场景里,记忆选择错误、索引漂移和验证器偏差,都可能让收益打折。
主要参考文献
ECHO: Prune to Act, Trace to Learn with Selective Turn Memory in Agentic RL, arXiv 2026.
项目代码:https://github.com/xiezijun714-lang/Echo
原文链接:https://arxiv.org/pdf/2606.31650v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群