← 返回 PaperDaily
大模型与智能体
微软TRACE新作:Qwen3-4B长程搜索飙到35.6
长程智能体最怕的不是不会搜,而是搜了半天,最后谁也没记功。TRACE把这件事掰开揉碎,逐轮算账,适合想搞懂长程RL怎么训得更稳、更快的人。
龙哥读论文
发布于 2026-08-16 11:00:46
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 长程智能体最怕的不是不会搜,而是搜了半天,最后谁也没记功。TRACE把这件事掰开揉碎,逐轮算账,适合想搞懂长程RL怎么训得更稳、更快的人。
原论文信息如下:
长程智能体训练的困境:奖励稀疏与信用迷雾
长程智能体最让人头疼的,不是“会不会用工具”,而是“用了十几次工具之后,最后到底该给谁记功”。搜索、打开网页、定位证据、再搜索、再确认,整条轨迹像一场马拉松,最后却只在终点发一张奖状——成功就全体加分,失败就全体背锅。问题是,这种分法对智能体训练并不友好。
这篇论文盯住的就是这个老大难:长程智能体的信用分配 。在数学题、代码题里,最后答案对不对很容易验;但在多轮搜索和工具调用里,某一步到底是“神来之笔”,还是“无效折腾”,终点奖励根本说不清。于是就出现了经典尴尬:有用的中间动作被低估,没用的动作被误奖,训练信号还特别抖,像拿着漏勺给智能体喂饭。
TRACE 的切入点很直接:既然终点奖励太粗,那就把轨迹切到工具调用边界 上,一轮一轮算账。这样做的好处很朴素:不是问“整条路成没成”,而是问“这一步有没有让答案更接近”。这比让模型在迷雾里猜功劳,靠谱得多。
TRACE来了:冻结参考模型,在工具调用之间“掐指一算”
TRACE 全称是 Turn-level Reward Assignment via Credit Estimation ,中文可以理解成“基于信用估计的逐轮奖励分配”。名字不花哨,思路却很实用:它不再额外训练一个 critic,也不依赖人工过程标注,而是把一个冻结的参考模型当成“进度探针”,看看当前轨迹前缀到底有多像“已经快能答对了”。
这里的关键不是“参考模型有多强”,而是“参考模型足够稳定”。它被冻结后,不跟着策略一起乱跑,所以不会像某些学出来的奖励模型那样,今天说好明天说坏。TRACE 让它只做一件事:判断当前前缀对正确答案的“可预测性”有没有提升。
更妙的是,TRACE 不是直接拿原始概率硬算,而是把答案概率变成一种对数比值状态值 。说人话就是:不是只看“现在有多像答案”,而是看“相对最开始,已经把差距缩小了多少”。这样一来,早期的小进步和后期的关键突破,都能用同一把尺子衡量。
论文里还提到一个很实在的点:Temporal-Difference,简称 TD,中文是时序差分 。它本来就是强化学习里拿相邻状态做差的经典思路。TRACE 的做法并不玄学,就是把“前一轮前缀值”和“下一轮前缀值”相减,得到这一步到底贡献了多少进展。工具调用如果让答案更容易被推出来,这一步就该得分;如果只是原地打转,信用就别硬蹭了。
如何不训练新网络,就能衡量每一步的价值?
TRACE 最值得夸的一点,是它的工程洁癖:不训练新 critic,不搞额外过程标签,不依赖强 judge 。这意味着它不是把问题再复制一遍,而是直接利用现成的参考模型和终局可验证奖励,把“终点监督”拆成“逐轮监督”。
它的流程可以概括成四步:先把一次长轨迹按工具调用切成多个前缀状态;再用冻结参考模型计算每个前缀下正确答案的条件概率;然后把这个概率变成一个“离答案还有多远”的状态值;最后用相邻状态值的差,给当前工具调用分配 turn-level reward。这个奖励再和原本的终局奖励一起进入策略优化。
TRACE 伪流程:
1. 将一条长轨迹拆成多个工具调用边界前缀
2. 冻结参考模型,计算每个前缀对 gold answer 的可预测性
3. 把可预测性转成状态值,衡量“答案差距被缩小了多少”
4. 用相邻状态值差分配每一轮工具调用的信用
5. 将 turn-level 信号与终局 outcome reward 一起做策略优化
这里有个很关键的直觉:如果某次搜索只是把网页翻了一遍,却没有带来新的证据,那么参考模型对正确答案的把握不会明显增强,TD 差分自然也就接近零。反过来,如果某次 open 操作真正翻出了关键文档,后续答案的可预测性会明显上升,这一轮就该拿到正反馈。TRACE 不是在奖励“忙”,而是在奖励“有用”。
论文还强调了一个漂亮的性质:这种一阶 TD 信用是可以“望远镜式”相消的。说白了,前后相邻差分加起来,最终只看起点和终点,不会因为中间插了很多无意义动作就把信用刷高。这个设计对长程智能体特别重要,因为它天然防止“灌水式搜索”混奖励。
三大任务、四个榜单:TRACE性能飙升至新高度
实验部分最有说服力的地方,不是某一个榜单上的小胜,而是它在闭源网页搜索 和开放网页检索 上都能站住脚。训练环境是离线语料构建的复杂多文档搜索任务,评测则覆盖 BrowseCompPlus、BrowseComp、GAIA 和 xbench-DeepSearch,已经不是“在自己家里练拳”,而是跨场景验货。
先看最核心的闭源任务。Qwen3-4B 从 7.2 被拉到 35.6,Qwen3-30B-A3B 从 8.4 被拉到 42.6,这不是“抠一点点分”,而是把原本几乎趴地上的长程搜索能力,硬生生拽到了能打的区间。更重要的是,这个结果不是靠冷启动监督微调、不是靠中间阶段过渡训练、也不是靠 live-web 数据堆出来的,而是纯 RL 配合 turn-level credit。
再看开放网页任务,TRACE 训练出来的策略并没有“只会闭门造车”。在 BrowseComp、GAIA 和 xbench-DeepSearch 上,它依然能把基础模型往上推,说明学到的不是某个固定语料的死记硬背,而是一种更通用的搜索—阅读—再搜索策略。对长程智能体来说,这一点很关键:真正值钱的不是某个题的答案,而是面对新信息时还能不能稳住节奏。
和 GRPO、GSPO、GiGRPO 这些只看轨迹级信号的方法相比,TRACE 的优势很直接:同样是终局正确性训练,TRACE 额外给了“哪一轮工具调用更有贡献”的信息。结果就是,模型不再只知道“整条轨迹成没成”,还知道“哪一步值得重复,哪一步该少做”。这对多轮搜索特别重要,因为很多失败并不是方向错了,而是中间有几步没有被及时强化,最后被整体奖励一锅端了。
不只是效果:TRACE如何让学习曲线“快人一步”?
这篇工作真正让人眼前一亮的,不只是最后分数高,而是它的收敛更早、上升更快 。在长程智能体里,训练早期往往最难熬:轨迹长、反馈稀、探索乱,模型很容易在一堆失败样本里转圈。TRACE 通过逐轮信用,把“哪一步有用”提前告诉了优化器,于是学习曲线就不那么拖泥带水。
这背后的逻辑其实挺朴素:如果只有终局奖励,那么一条失败轨迹里前面那些有价值的搜索动作,也会和最后那个错误动作一起被罚,模型学到的东西就混着杂质。TRACE 则把“前面有没有把答案变得更可预测”单独拿出来,让有用的中间动作先吃到正反馈,训练自然更顺。
消融结果也给了一个很现实的提醒:TRACE 不是魔法棒。turn-level 信号太弱,模型还是会被终局奖励牵着走;太强,又可能压过最终正确性;K 值太短,延迟证据传不过来;太长,又会把局部信用稀释掉。换句话说,这套方法的核心不是“有没有 turn-level reward”,而是“怎么把 turn-level reward 放到一个合适的位置”。
论文里还用了不同参考检查点来做回答可预测性打分,结果说明:只要参考模型足够稳定,前缀值就能较好反映终局质量。这一点很重要,因为它说明 TRACE 并不依赖某个“神奇奖励网络”,而是依赖一个更接近工程现实的事实:基础模型本身就能提供足够好的进度读数,关键是有没有把它用对地方。
抛开复杂与昂贵:为何TRACE是一种简便高效的收益分配方案
从工程角度看,TRACE 的吸引力非常明确:它没有引入额外可训练网络 ,也没有把系统复杂度再往上堆一层。对真实团队来说,这意味着少一套 critic 训练、少一套标签管线、少一批稳定性问题,部署门槛会低不少。
它的代价也不是没有。首先,参考模型必须足够靠谱,否则前缀打分就会偏;其次,长程任务里“答案可预测性”并不总能完美等价于“中间动作真的有帮助”,尤其在噪声很大的开放环境里,相关性会受检索质量影响。也就是说,TRACE 解决的是“信用怎么分”,不是“世界怎么变得更容易”。
不过,放在长程智能体训练这个场景里,它已经很有现实意义了。因为很多团队真正缺的不是一个更复杂的奖励网络,而是一个能稳定工作的、能解释的、能直接接到现有 RL 流水线里的信用分配方案。TRACE 的价值就在这里:它没有试图发明新宇宙,而是把老问题掰直了。
如果放到产品视角,这类方法最适合那些“工具调用多、终局可验证、但过程难标注”的场景,比如深度搜索、信息检索、企业知识库问答、代码辅助排查。它不一定是最炫的路线,但很可能是最接近落地的一类:少折腾、可复现、能解释,还能让训练曲线少一点人间疾苦。😊
龙迷三问
这篇论文到底解决了什么问题? 它解决的是长程智能体训练里的信用分配难题:工具调用很多、终局奖励很稀疏,TRACE 试图把“整条轨迹的成败”拆成“每一轮工具调用的贡献”。
文中的 reference model 和 TD credit 分别是什么意思? reference model 是冻结的参考模型,用来判断当前前缀对正确答案有多“可预测”;TD credit 是时序差分信用,也就是比较相邻前缀状态值的变化,看看这一轮工具调用到底让答案更接近了多少。
TRACE 为什么比只看终局奖励更有效? 因为终局奖励只能告诉模型“最后成没成”,却不知道中间哪一步有用。TRACE 把中间有帮助的搜索、打开、定位等动作单独记功,能更早给出正反馈,所以学习更快、曲线更稳,也更不容易把有用动作和无用动作混在一起惩罚。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。思路不是凭空造出新范式,而是把参考模型、对数比值状态值和 TD 信用组合成一个可落地的长程奖励方案,属于“聪明地解决老问题”。
实验合理度: ★★★★☆。训练、评测、对照都围绕同一 backbone 和同一工具环境展开,能较清楚地说明改进来自信用分配本身,而不是别的花活。
学术研究价值: ★★★★☆。对长程智能体、过程监督和强化学习的结合都有启发,尤其适合研究“如何把终局监督拆成中间监督”。
稳定性: ★★★☆☆。方法本身简洁,但对参考模型质量和任务可验证性有依赖,开放环境里仍会受检索噪声影响。
适应性以及泛化能力: ★★★★☆。从闭源搜索到开放网页检索都能迁移,说明学到的不是单一数据集技巧,而是更通用的交互策略。
硬件需求及成本: ★★★★☆。没有额外 critic,训练链路比很多 process reward 方案轻不少,成本主要还是在长轨迹 RL 本身。
复现难度: ★★★☆☆。算法不复杂,但要复现高质量长程搜索训练,数据构造、工具接口和评测环境都得搭得比较严。
产品化成熟度: ★★★☆☆。在“工具多、终局可验、过程难标注”的场景很有潜力,但要上生产,还得处理噪声、延迟和任务分布漂移。
可能的问题: 方法依赖参考模型对前缀可预测性的可靠刻画,开放场景里若证据检索不稳,turn-level credit 也会跟着发飘。
主要参考文献
Tao, L., Peng, B., Yao, W., Ge, T., Cheng, H., Wang, M. H., Gao, J., & Li, S. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents. arXiv:2607.13988v1, 2026.
Sutton, R. S. Learning to predict by the methods of temporal differences. Machine Learning, 1988.
Yao, S. et al. ReAct: Synergizing Reasoning and Acting in Language Models, 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!