← 返回 PaperDaily 大模型与智能体

微软TRACE新作:Qwen3-4B长程搜索飙到35.6

长程智能体最怕的不是不会搜,而是搜了半天,最后谁也没记功。TRACE把这件事掰开揉碎,逐轮算账,适合想搞懂长程RL怎么训得更稳、更快的人。

微软TRACE新作:Qwen3-4B长程搜索飙到35.6
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
长程智能体最怕的不是不会搜,而是搜了半天,最后谁也没记功。TRACE把这件事掰开揉碎,逐轮算账,适合想搞懂长程RL怎么训得更稳、更快的人。


原论文信息如下:
论文标题:
TRACE: TURN-LEVEL REWARD ASSIGNMENT VIA CREDIT ESTIMATION FOR LONG-HORIZON AGENTS
发表日期:
2026年07月
发表单位:
University of Wisconsin–Madison; Microsoft Research
原文链接:
https://arxiv.org/pdf/2607.13988v1.pdf

长程智能体训练的困境:奖励稀疏与信用迷雾

长程智能体最让人头疼的,不是“会不会用工具”,而是“用了十几次工具之后,最后到底该给谁记功”。搜索、打开网页、定位证据、再搜索、再确认,整条轨迹像一场马拉松,最后却只在终点发一张奖状——成功就全体加分,失败就全体背锅。问题是,这种分法对智能体训练并不友好。
这篇论文盯住的就是这个老大难:长程智能体的信用分配。在数学题、代码题里,最后答案对不对很容易验;但在多轮搜索和工具调用里,某一步到底是“神来之笔”,还是“无效折腾”,终点奖励根本说不清。于是就出现了经典尴尬:有用的中间动作被低估,没用的动作被误奖,训练信号还特别抖,像拿着漏勺给智能体喂饭。
Figure 1
图1:工具调用边界上的信用分配。长程搜索轨迹被拆成一轮轮工具调用后,可以清楚看到:前面的搜索和打开动作,可能已经为后续答案提供了关键证据;但如果只看最终成败,所有动作都会被同一张“总账单”处理。
TRACE 的切入点很直接:既然终点奖励太粗,那就把轨迹切到工具调用边界上,一轮一轮算账。这样做的好处很朴素:不是问“整条路成没成”,而是问“这一步有没有让答案更接近”。这比让模型在迷雾里猜功劳,靠谱得多。

TRACE来了:冻结参考模型,在工具调用之间“掐指一算”

TRACE 全称是 Turn-level Reward Assignment via Credit Estimation,中文可以理解成“基于信用估计的逐轮奖励分配”。名字不花哨,思路却很实用:它不再额外训练一个 critic,也不依赖人工过程标注,而是把一个冻结的参考模型当成“进度探针”,看看当前轨迹前缀到底有多像“已经快能答对了”。
Figure 2
图2:TRACE 在工具调用边界上的奖励构造。每个前缀状态先由冻结参考模型打分,再转换成一种“回答可预测性”的状态值,随后用相邻状态值的变化量给当前一轮工具调用分配信用。
这里的关键不是“参考模型有多强”,而是“参考模型足够稳定”。它被冻结后,不跟着策略一起乱跑,所以不会像某些学出来的奖励模型那样,今天说好明天说坏。TRACE 让它只做一件事:判断当前前缀对正确答案的“可预测性”有没有提升。
更妙的是,TRACE 不是直接拿原始概率硬算,而是把答案概率变成一种对数比值状态值。说人话就是:不是只看“现在有多像答案”,而是看“相对最开始,已经把差距缩小了多少”。这样一来,早期的小进步和后期的关键突破,都能用同一把尺子衡量。
论文里还提到一个很实在的点:Temporal-Difference,简称 TD,中文是时序差分。它本来就是强化学习里拿相邻状态做差的经典思路。TRACE 的做法并不玄学,就是把“前一轮前缀值”和“下一轮前缀值”相减,得到这一步到底贡献了多少进展。工具调用如果让答案更容易被推出来,这一步就该得分;如果只是原地打转,信用就别硬蹭了。

如何不训练新网络,就能衡量每一步的价值?

TRACE 最值得夸的一点,是它的工程洁癖:不训练新 critic,不搞额外过程标签,不依赖强 judge。这意味着它不是把问题再复制一遍,而是直接利用现成的参考模型和终局可验证奖励,把“终点监督”拆成“逐轮监督”。
它的流程可以概括成四步:先把一次长轨迹按工具调用切成多个前缀状态;再用冻结参考模型计算每个前缀下正确答案的条件概率;然后把这个概率变成一个“离答案还有多远”的状态值;最后用相邻状态值的差,给当前工具调用分配 turn-level reward。这个奖励再和原本的终局奖励一起进入策略优化。
    TRACE 伪流程:
    1. 将一条长轨迹拆成多个工具调用边界前缀
    2. 冻结参考模型,计算每个前缀对 gold answer 的可预测性
    3. 把可预测性转成状态值,衡量“答案差距被缩小了多少”
    4. 用相邻状态值差分配每一轮工具调用的信用
    5. 将 turn-level 信号与终局 outcome reward 一起做策略优化
    这里有个很关键的直觉:如果某次搜索只是把网页翻了一遍,却没有带来新的证据,那么参考模型对正确答案的把握不会明显增强,TD 差分自然也就接近零。反过来,如果某次 open 操作真正翻出了关键文档,后续答案的可预测性会明显上升,这一轮就该拿到正反馈。TRACE 不是在奖励“忙”,而是在奖励“有用”。
    论文还强调了一个漂亮的性质:这种一阶 TD 信用是可以“望远镜式”相消的。说白了,前后相邻差分加起来,最终只看起点和终点,不会因为中间插了很多无意义动作就把信用刷高。这个设计对长程智能体特别重要,因为它天然防止“灌水式搜索”混奖励。
    score has the strongest correlation with both endpoint quality and final correctness, while also giving the best pairwise ranking accuracy among rollouts with similar initial raw log-probabilities.
    图:对前缀状态值的相关性分析。论文展示了这种基于参考模型的前缀打分,不仅和最终终点质量、最终正确性都有较强相关性,而且在初始原始对数概率相近的轨迹之间,也能更好地区分谁更值得奖励。

    三大任务、四个榜单:TRACE性能飙升至新高度

    实验部分最有说服力的地方,不是某一个榜单上的小胜,而是它在闭源网页搜索开放网页检索上都能站住脚。训练环境是离线语料构建的复杂多文档搜索任务,评测则覆盖 BrowseCompPlus、BrowseComp、GAIA 和 xbench-DeepSearch,已经不是“在自己家里练拳”,而是跨场景验货。
    Table 1
    表1:长程深度研究基准上的性能对比。BrowseCompPlus 属于闭源网页环境,BrowseComp、GAIA 和 xbench-DeepSearch 则是开放网页检索。TRACE 在两种 Qwen3 backbone 上都明显抬升了结果,尤其是在 BrowseCompPlus 上提升非常显眼。
    先看最核心的闭源任务。Qwen3-4B 从 7.2 被拉到 35.6,Qwen3-30B-A3B 从 8.4 被拉到 42.6,这不是“抠一点点分”,而是把原本几乎趴地上的长程搜索能力,硬生生拽到了能打的区间。更重要的是,这个结果不是靠冷启动监督微调、不是靠中间阶段过渡训练、也不是靠 live-web 数据堆出来的,而是纯 RL 配合 turn-level credit。
    再看开放网页任务,TRACE 训练出来的策略并没有“只会闭门造车”。在 BrowseComp、GAIA 和 xbench-DeepSearch 上,它依然能把基础模型往上推,说明学到的不是某个固定语料的死记硬背,而是一种更通用的搜索—阅读—再搜索策略。对长程智能体来说,这一点很关键:真正值钱的不是某个题的答案,而是面对新信息时还能不能稳住节奏。
    Figure 3
    图3:BrowseComp-Plus 上的学习动态。无论是训练奖励还是评测准确率,TRACE 的上升都更早、更快,而且后期平台也更高,说明它不仅学得快,学得也更稳。
    和 GRPO、GSPO、GiGRPO 这些只看轨迹级信号的方法相比,TRACE 的优势很直接:同样是终局正确性训练,TRACE 额外给了“哪一轮工具调用更有贡献”的信息。结果就是,模型不再只知道“整条轨迹成没成”,还知道“哪一步值得重复,哪一步该少做”。这对多轮搜索特别重要,因为很多失败并不是方向错了,而是中间有几步没有被及时强化,最后被整体奖励一锅端了。
    Figure 4
    图4:轨迹尺度动态。TRACE 的曲线更早抬升,也更快增长,说明它在训练早期就更愿意展开有效交互,而不是等到最后才靠终局奖励“临门一脚”。

    不只是效果:TRACE如何让学习曲线“快人一步”?

    这篇工作真正让人眼前一亮的,不只是最后分数高,而是它的收敛更早、上升更快。在长程智能体里,训练早期往往最难熬:轨迹长、反馈稀、探索乱,模型很容易在一堆失败样本里转圈。TRACE 通过逐轮信用,把“哪一步有用”提前告诉了优化器,于是学习曲线就不那么拖泥带水。
    这背后的逻辑其实挺朴素:如果只有终局奖励,那么一条失败轨迹里前面那些有价值的搜索动作,也会和最后那个错误动作一起被罚,模型学到的东西就混着杂质。TRACE 则把“前面有没有把答案变得更可预测”单独拿出来,让有用的中间动作先吃到正反馈,训练自然更顺。
    Figure 5
    图5:消融实验。turn-level reward 系数、TD 望远镜窗口 K、以及参考模型的选择都会影响效果,说明 TRACE 不是“随便一减一加就行”,而是需要合理的信用强度和时间视野。
    消融结果也给了一个很现实的提醒:TRACE 不是魔法棒。turn-level 信号太弱,模型还是会被终局奖励牵着走;太强,又可能压过最终正确性;K 值太短,延迟证据传不过来;太长,又会把局部信用稀释掉。换句话说,这套方法的核心不是“有没有 turn-level reward”,而是“怎么把 turn-level reward 放到一个合适的位置”。
    论文里还用了不同参考检查点来做回答可预测性打分,结果说明:只要参考模型足够稳定,前缀值就能较好反映终局质量。这一点很重要,因为它说明 TRACE 并不依赖某个“神奇奖励网络”,而是依赖一个更接近工程现实的事实:基础模型本身就能提供足够好的进度读数,关键是有没有把它用对地方。

    抛开复杂与昂贵:为何TRACE是一种简便高效的收益分配方案

    从工程角度看,TRACE 的吸引力非常明确:它没有引入额外可训练网络,也没有把系统复杂度再往上堆一层。对真实团队来说,这意味着少一套 critic 训练、少一套标签管线、少一批稳定性问题,部署门槛会低不少。
    它的代价也不是没有。首先,参考模型必须足够靠谱,否则前缀打分就会偏;其次,长程任务里“答案可预测性”并不总能完美等价于“中间动作真的有帮助”,尤其在噪声很大的开放环境里,相关性会受检索质量影响。也就是说,TRACE 解决的是“信用怎么分”,不是“世界怎么变得更容易”。
    不过,放在长程智能体训练这个场景里,它已经很有现实意义了。因为很多团队真正缺的不是一个更复杂的奖励网络,而是一个能稳定工作的、能解释的、能直接接到现有 RL 流水线里的信用分配方案。TRACE 的价值就在这里:它没有试图发明新宇宙,而是把老问题掰直了。
    如果放到产品视角,这类方法最适合那些“工具调用多、终局可验证、但过程难标注”的场景,比如深度搜索、信息检索、企业知识库问答、代码辅助排查。它不一定是最炫的路线,但很可能是最接近落地的一类:少折腾、可复现、能解释,还能让训练曲线少一点人间疾苦。😊

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:

    这篇论文到底解决了什么问题?它解决的是长程智能体训练里的信用分配难题:工具调用很多、终局奖励很稀疏,TRACE 试图把“整条轨迹的成败”拆成“每一轮工具调用的贡献”。

    文中的 reference model 和 TD credit 分别是什么意思?reference model 是冻结的参考模型,用来判断当前前缀对正确答案有多“可预测”;TD credit 是时序差分信用,也就是比较相邻前缀状态值的变化,看看这一轮工具调用到底让答案更接近了多少。

    TRACE 为什么比只看终局奖励更有效?因为终局奖励只能告诉模型“最后成没成”,却不知道中间哪一步有用。TRACE 把中间有帮助的搜索、打开、定位等动作单独记功,能更早给出正反馈,所以学习更快、曲线更稳,也更不容易把有用动作和无用动作混在一起惩罚。

    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆。思路不是凭空造出新范式,而是把参考模型、对数比值状态值和 TD 信用组合成一个可落地的长程奖励方案,属于“聪明地解决老问题”。

    实验合理度:★★★★☆。训练、评测、对照都围绕同一 backbone 和同一工具环境展开,能较清楚地说明改进来自信用分配本身,而不是别的花活。

    学术研究价值:★★★★☆。对长程智能体、过程监督和强化学习的结合都有启发,尤其适合研究“如何把终局监督拆成中间监督”。

    稳定性:★★★☆☆。方法本身简洁,但对参考模型质量和任务可验证性有依赖,开放环境里仍会受检索噪声影响。

    适应性以及泛化能力:★★★★☆。从闭源搜索到开放网页检索都能迁移,说明学到的不是单一数据集技巧,而是更通用的交互策略。

    硬件需求及成本:★★★★☆。没有额外 critic,训练链路比很多 process reward 方案轻不少,成本主要还是在长轨迹 RL 本身。

    复现难度:★★★☆☆。算法不复杂,但要复现高质量长程搜索训练,数据构造、工具接口和评测环境都得搭得比较严。

    产品化成熟度:★★★☆☆。在“工具多、终局可验、过程难标注”的场景很有潜力,但要上生产,还得处理噪声、延迟和任务分布漂移。

    可能的问题:方法依赖参考模型对前缀可预测性的可靠刻画,开放场景里若证据检索不稳,turn-level credit 也会跟着发飘。


    主要参考文献

    Tao, L., Peng, B., Yao, W., Ge, T., Cheng, H., Wang, M. H., Gao, J., & Li, S. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents. arXiv:2607.13988v1, 2026.
    Sutton, R. S. Learning to predict by the methods of temporal differences. Machine Learning, 1988.
    Yao, S. et al. ReAct: Synergizing Reasoning and Acting in Language Models, 2023.

    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

    end
    欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
    『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
    长程智能体最怕的不是不会搜,而是搜了半天,最后谁也没记功。TRACE把这件事掰开揉碎,逐轮算账,适合想搞懂长程RL怎么训得更稳、更快的人。
    wechat_helperdianzan
    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。