← 返回 PaperDaily 前沿研究

腾讯、上交大最新研究:智能体自演环境告别外部依赖,工具调用全面涨点

让智能体自己当环境?不搭模拟器、不靠真实环境交互,训练全程自导自演,测试时还能先“私排”再执行。多个工具交互基准整体效果反超环境扩展方法,省钱又涨点,这条新路子值得一读。

腾讯、上交大最新研究:智能体自演环境告别外部依赖,工具调用全面涨点
原论文信息如下:
论文标题:
ENVACE: INTERNALIZING ENVIRONMENT DYNAMICS VIA WORLD REHEARSAL FOR AGENTIC REINFORCEMENT LEARNING
发表日期:
2026年08月
论文作者:
Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu
发表单位:
Shanghai Jiao Tong University, Zhejiang University, National University of Singapore, Sun Yat-sen University, Central South University, The Chinese University of Hong Kong, Tencent Inc.
原文链接:
https://arxiv.org/pdf/2608.06197v1.pdf

方法概述

按照常规思路,想让智能体学会和外部世界打交道的本领,有两种主流做法。一种是直接在真实环境里展开训练轨迹(real-environment rollout),每一步都真正执行工具调用、拿到真实返回。这种方案可靠,但环境搭建和维护成本高得离谱,每换一个任务领域就要重新造一套带状态的系统。另一种是请一个外部模拟器(external-simulator rollout),让另一个大模型“扮演”环境,推理出工具调用后该有的输出。这种方案灵活,可模拟结果容易失真,还得请真实环境来当“监工”做对齐校准。
这两种方案有个共同点:环境响应都来自策略之外的某个外部力量。策略只负责出招,至于环境为什么这样回应、动作和反馈之间有什么规律,完全不在它的学习范围里。
EnvACE的思路完全不同。它让同一个策略同时承担“行动者”和“环境”两个角色:行动者根据历史生成动作,环境角色根据历史加动作生成反馈。两段输出一前一后,拼接在一起成为新的交互历史,再继续下一轮。相当于整个交互闭环都被塞进了策略自己的生成过程里。
图1:三种智能体rollout范式对比:真实环境rollout、外部模拟器rollout,以及EnvACE世界排演。现有方法从外部获取环境响应,EnvACE则把环境响应内化到策略中。
图1:三种智能体rollout范式对比。真实环境rollout和外部模拟器rollout的响应都来自外部,只有EnvACE把环境响应放进策略内部。
这就是论文所说的世界排演(world rehearsal):环境建模不再是外挂模块,而是策略在线生成的一部分。模型在反复排演中,把“什么动作会引起什么反馈”的因果规律直接刻进了参数里。
为了更直观地理解这一范式的转变,我们可以对比一下三种方案在训练时的信息流。真实环境rollout中,策略输出动作后,环境返回观测,这个观测是由外部系统状态转移函数决定的,策略只能被动接受。外部模拟器rollout中,虽然观测由另一个模型生成,但生成过程与策略参数完全隔离,策略的梯度无法影响模拟器的行为。而在EnvACE中,观测生成与动作生成共享同一套参数,当环境角色的输出被奖励信号优化时,行动者角色也同步受益。这种耦合关系是EnvACE区别于所有外部环境方案的本质特征,也是“内化”一词的精确含义。

论文主体思路

从技术角度看,EnvACE把带工具交互的任务建模为有限时域的POMDP(Partially Observable Markov Decision Process,部分可观测马尔可夫决策过程)。策略的输入是交互历史h_t,输出动作a_t;传统设定下环境根据历史与动作返回观测o_t;EnvACE则让策略自己生成观测,再据此继续行动。训练目标仍然是最大化任务成功奖励。以下表格汇总了本方法的核心要素:
*表格超出部分左右可以滑动 Table 1: Benchmark results across BFCL V4, τ<sup>2</sup>-Bench, and VitaBench. Overall is the arithmetic mean of the BFCL V4  \mathrm { A v g . , } \tau ^ { 2 } . -Bench Avg., and VitaBench Avg. Blue cells indicate the highest result in each column, while red cells indicate the second-highest distinct result.
Table 1: Benchmark results across BFCL V4, τ<sup>2</sup>-Bench, and VitaBench. Overall is the arithmetic mean of the BFCL V4 \mathrm { A v g . , } \tau ^ { 2 } . -Bench Avg., and VitaBench Avg. Blue cells indicate the highest result in each column, while red cells indicate the second-highest distinct result.
这里需要特别说明POMDP建模的细节。在标准POMDP中,智能体在每一时刻t接收观测o_t,执行动作a_t,环境转移至新状态并返回新观测。EnvACE将整个交互历史h_t = (o_1, a_1, ..., o_{t-1}, a_{t-1})作为策略输入,但不再有外部状态转移。策略在时刻t先以行动者角色输出动作a_t,然后以环境角色输出观测o_t。这个o_t被追加到历史中,成为下一时刻的输入。整个过程持续到任务终止条件满足(如达到最大轮数或策略输出结束标记)。由于观测和动作都由同一策略生成,轨迹的联合概率可以分解为一系列条件生成概率的乘积,这使得整个轨迹可以像标准语言模型序列一样进行端到端优化。

核心设计

图2展示了EnvACE的完整流程。每一轮交互中,策略先以行动者角色输出一个工具调用,再以环境角色输出对应的模拟响应,然后行动者基于这段自产自销的响应继续下一步。两个角色由同一个策略参数θ承担,并通过角色分离的GRPO(Group Relative Policy Optimization,群组相对策略优化)联合优化。
图2:EnvACE与世界排演的整体框架。训练时策略交替执行动作生成与环境响应排演,将整个交互循环内化进单一策略;测试时策略可以在真实执行前私密排演多个候选动作。
图2:EnvACE与世界排演的整体框架。训练时策略交替执行动作生成与环境响应排演,将整个交互循环内化进单一策略;测试时策略在执行前私密排演多个候选动作。
传统的智能体强化学习过程如公式(1)所示:策略πθ根据历史ht生成动作at,环境P负责生成观测ot。EnvACE把第二步也收编进策略,动作生成带上ACT标记:
公式2:动作由策略以ACT角色从历史中生成
公式(2):at是t时刻的动作,πθ是共享策略,ht是交互历史,ACT是行动者角色标记。
环境响应生成则带上REHEARSE标记,策略在历史与动作之后,以环境角色补齐模拟响应,生成的响应被追加到交互历史中,行动者继续基于它做决策。两个角色交替进行直到任务结束,轨迹完全由策略自身展开。
优化方面,EnvACE沿用GRPO的思路,但对两个角色做了分离处理。GRPO的核心做法是:对同一条指令采样K条轨迹,把每条轨迹的奖励与本组其他轨迹做归一化,得出优势。但EnvACE的两个角色输出长度差异极大——行动者可能只输出短短几行工具调用,环境角色却要模拟一大段环境反馈。如果两个角色共用一个平均基线,长输出角色会在统计上占据主导,优势估计出现偏差。
为此,EnvACE按角色分别收集输出。公式(3)给出了同一条指令下、某一角色的输出集合:
公式3:按角色收集策略输出集合
公式(3):Gx,r表示指令x下、角色r的全部策略输出集合。K是同一条指令下的rollout数量,ri,m表示第i条轨迹中第m个输出所属的角色。
每个角色的奖励基线只在本角色内部计算,然后再用裁剪后的GRPO目标函数更新共享参数。由于两个角色共享参数,排演环境响应时学到的规律,会直接改善行动者的决策能力,这正是“内化环境动态”的深层含义。
测试阶段,EnvACE还支持“私密排演”(TTS,Test-Time Scaling)。在执行前,策略先以并行或顺序方式生成N条想象中的轨迹,并对每条轨迹做自我评估,给出“哪里错了、怎么改”的反馈。这些排演结果汇总成一份排演记忆,行动者带着这份记忆在真实环境中执行一次。排演过程不触发任何真实工具调用,因此不会改变真实世界状态。
关于角色分离GRPO的具体实现,论文给出了更细致的说明。在标准的GRPO中,对于指令x,采样K条完整轨迹,每条轨迹的奖励为R_i,优势函数A_i = (R_i - mean(R)) / std(R)。在EnvACE中,由于每条轨迹包含多个ACT输出和多个REHEARSE输出,需要将轨迹级别的奖励分解到每个输出上。具体做法是:对于第i条轨迹中的第m个输出(属于角色r),其优势A_{i,m} = (R_i - mean_{j∈G_{x,r}}(R_j)) / std_{j∈G_{x,r}}(R_j)。这里G_{x,r}是所有轨迹中角色r的输出集合。这种分解确保了每个角色的输出都相对于同角色的其他输出进行归一化,避免了跨角色的尺度失衡。此外,论文还引入了KL散度约束,防止策略更新过快偏离参考策略,保证了训练的稳定性。

数据准备及实验设计

评测覆盖了四个互补的智能体基准。BFCL-v4(Berkeley Function Calling Leaderboard v4,伯克利函数调用排行榜第四版)评估函数调用与工具使用,包含单轮、多轮和智能体任务;τ²-Bench是有状态的服务型智能体基准,覆盖零售、电信和航空三个领域,每一步决策都依赖之前的服务状态;VitaBench聚焦生活服务场景,包括外卖、到店消费、在线旅行和跨域任务;FinMCP-Bench则通过MCP(Model Context Protocol,模型上下文协议)评估金融领域工具使用能力。
为了公平比较,基线选取考虑了多个维度。首先是同规模的开源模型Qwen3-1.7B/4B/8B,以及在其上做标准GRPO训练的版本;其次是几类代表性的环境扩展方法:Simulator-8B用推理模型模拟环境反馈,TOUCAN-7B从真实MCP环境合成大规模训练轨迹,EnvScaler-8B以程序化方式合成工具交互环境,AWM-8B/14B构建带数据库状态的代码驱动环境,ScaleEnv-8B则从零构造可执行环境与可验证任务。
实现上,主实验以Qwen3-8B为backbone,在CM2数据集上训练470步,学习率1×10-6,批量大小16,每条提示采样4条轨迹,最大上下文12000 token,最大输出8000 token,每轮智能体最多30次交互。训练奖励来自可验证的结果或基于检查清单的LLM judge(使用Qwen3-30B-A3B作为评判模型),训练过程用verl框架在16张NVIDIA H20 GPU上完成。非TTS实验报告4次独立运行的平均值。
在数据准备方面,CM2数据集包含了多种工具交互场景的指令-轨迹对。每条轨迹记录了完整的工具调用序列和对应的环境反馈。EnvACE的训练不需要这些轨迹中的环境反馈部分来作为监督信号,而是将其作为初始化的参考。具体来说,模型首先在CM2上做监督微调(SFT),学习基本的工具调用格式和动作-反馈模式。然后进入RL阶段,在RL阶段模型不再依赖CM2中的真实反馈,而是完全自生成反馈。这种两阶段训练策略确保了模型在开始RL之前已经具备了基础的工具使用能力,避免了从零开始探索的困难。

实验结果

三个主要基准的对比结果如表1所示。EnvACE在BFCL-v4、τ²-Bench和VitaBench上的总平均分达到32.91%,超过了所有有完整三基准结果的环境扩展基线。分项看,EnvACE在BFCL-v4取得46.04%,比Qwen3-8B提升2.00%;在τ²-Bench上达到36.7%,比EnvScaler-8B、AWM-8B、AWM-14B分别高出3.8%、5.5%和6.0%;VitaBench上的16.0%也是7B-8B规模中的最好成绩。
表1:BFCL-v4、τ²-Bench和VitaBench上的基准结果。Overall为三个基准平均分的算术平均。蓝色单元格表示每列最高分,红色单元格表示每列第二高分。
表1:BFCL-v4、τ²-Bench和VitaBench上的基准结果。蓝色标注为每列最高分,红色标注为第二高分。
金融场景的结果见表2。FinMCP-Bench上,EnvACE的TF1达到46.78%,比EnvScaler-8B高3.10%,比AWM-8B高4.28%;工具精确度54.04%为所有对比方法中最强。虽然工具召回率不是最高,但F1表明它在精确率和召回率之间取得了最佳平衡。
表2:FinMCP-Bench上的性能对比,使用TR、TP和TF1指标。
表2:FinMCP-Bench上的性能对比。TR为工具召回率,TP为工具精确率,TF1为两者的调和平均。
测试时扩展的结果如表3所示。固定排演预算N=2时,并行模式配合EnvACE排演取得总体40.9%,比不排演的36.7%提升4.2%。顺序模式下,用EnvACE排演同样能提升到38.5%。值得注意的是,用未训练的基础模型做排演几乎没增益,顺序模式下甚至掉到34.9%——这说明排演的收益来自策略中学到的环境动态知识,而不是单纯的“多想几遍”。
表3:N=2时的测试时扩展结果。Overall为τ²-Bench平均分和BFCL多轮平均分的算术平均。
表3:测试时扩展(TTS)结果,固定排演预算N=2。Par.为并行模式,Seq.为顺序模式。
从表3还可以观察到,并行模式普遍优于顺序模式。这是因为并行模式中,N条排演轨迹互不影响,每条轨迹都能独立探索不同的动作路径;而顺序模式中,后一条轨迹的生成会受前一条轨迹结果的影响,可能导致探索多样性下降。不过顺序模式的优势在于它更接近真实执行时的推理模式,因为真实执行时智能体只能看到自己之前的动作结果。论文指出,在计算资源允许的情况下,推荐使用并行模式进行测试时排演。

实验结果分析

为什么世界排演能work?图3给出了直接证据。在τ²-Bench上的消融显示,EnvACE比标准GRPO在8B规模下高出5.5个百分点。状态型服务场景里,每一步动作都需要依赖前一步的环境反馈,EnvACE的排演训练恰好逼着策略提前理解“我这个动作会引出什么结果”,决策自然更稳。同时,参数共享让排演和行动相互促进,比两个独立策略分别扮演角色高出1.2%,说明“内化”这个动作是真有效的。
图3:τ²-Bench上的消融结果。EnvACE在1.7B和8B两个规模都取得最佳性能。
图3:τ²-Bench上的消融实验。EnvACE同时对比了标准GRPO和分角色独立策略。
图4:EnvACE在多个模型规模上的表现。从1.7B扩展到8B,两个基准的性能均有提升。
图4:跨模型规模的表现。从1.7B升到8B,BFCL-v4平均分提升14.23%,τ²-Bench提升21.4%,说明方法能吃下更大的模型容量。
图5:EnvACE-8B在τ²-Bench上整个RL训练过程中的评估表现。
图5:训练动态。EnvACE-8B在τ²-Bench上的离线评估分数从训练第50步的30.0%逐步爬升到第470步的36.7%,中间虽有波动,但整体趋势稳定向上,说明世界排演确实为强化学习提供了持续有效的学习信号。
图6:BFCL多轮任务上的测试时扩展性能。
图6:BFCL多轮任务上的测试时扩展性能。实验显示,排演预算增加带来的收益并不是单调上升,中等预算(N=2)的收益最明显,继续增大预算提升有限,这与“想象轨迹过多反而互相干扰”的直觉一致。
图7:EnvACE与EnvScaler-8B和普通智能体的案例对比。EnvACE在执行前预测到工具调用会失败并自动修复参数,基线智能体则在失败后需要额外恢复步骤。
图7:案例分析。EnvACE在真正执行工具调用之前就预判到参数不合法,自动做了修复,一步到位;EnvScaler-8B和普通agent则要等真实执行报错之后才多绕一两轮去补救。
图8:EnvACE与EnvScaler-8B和普通智能体的案例对比。EnvACE在执行前排演写操作,预判到写入失败后主动替换为安全的只读查询。
图8:另一个案例。EnvACE执行前排演出写入操作会失败,主动换成只读查询,安全完成任务;基线agents没有这种“预知能力”,最终执行了无效的写入。
客观地说,EnvACE并不是全场景碾压。它在BFCL-v4上的得分(46.04%)比EnvScaler-8B(47.07%)略低;训练轨迹长度约为普通方法的两倍,对长程多轮任务的强化学习信用分配带来更大压力;如果模型本身幻觉严重,自我生成的观测也可能会强化错误。但整体来看,世界排演开辟了一条不需要外部环境也能持续训练智能体的路径,而且测试时排演这个额外能力,在真实部署中可能比榜单上的百分点更值钱——毕竟不是每个场景都搭得起一个“永远正确的模拟器”,而让智能体先在心里把戏演一遍,成本低得多。
关于训练动态,图5显示EnvACE在训练早期(第50步)就已经达到30.0%的得分,说明模型在SFT阶段已经掌握了基本的环境响应模式。随着RL训练的推进,得分稳步上升,但中间存在一些波动。论文分析这些波动可能源于探索-利用的权衡:在探索新动作时,模型可能会暂时生成质量较低的环境响应,导致整体得分下降。不过随着训练继续,模型逐渐学会更准确地预测环境反馈,得分最终稳定在较高水平。这种波动模式在强化学习训练中较为常见,EnvACE的表现符合预期。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?EnvACE提出“世界预演”新范式,让智能体训练中既当演员又当环境,内化环境动力学于自身参数,无需外部环境交互即可完成强化学习。在BFCL-v4、τ²-Bench、VitaBen…
这篇工作最值得看的点是什么?EnvACE通过共享同一个策略在"行动者"与"环境"两个角色间交替(先产生工具调用,再排练该调用诱导的环境响应),使用角色级GRPO端到端联合优化行动与排练行为,从而将环境动态内…
这篇工作的边界或风险在哪里?边界通常在真实部署成本、样本规模、泛化稳定性和交互体验这几件事上,读的时候要重点盯这些地方。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

EnvACE通过共享同一个策略在"行动者"与"环境"两个角色间交替(先产生工具调用,再排练该调用诱导的环境响应),使用角色级GRPO端到端联合优化行动与排练行为,从而将环境动态内化到策略参数中,实现无需外部环境交互的智能体强化学习训练。

实验合理度:★★★☆☆

现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。

学术研究价值:★★★★☆

EnvACE通过共享同一个策略在"行动者"与"环境"两个角色间交替(先产生工具调用,再排练该调用诱导的环境响应),使用角色级GRPO端到端联合优化行动与排练行为,从而将环境动态内化到策略参数中,实现…

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或分布变化测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:现有材料尚未充分覆盖分布外泛化、部署成本、长期稳定性和失败案例。

主要参考文献

[1] Xu Z, Yao Z, Chen Y, et al. EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning. arXiv:2608.06197, 2026.
[2] 项目开源代码: https://github.com/Within-yao/EnvACE
[3] 论文原文: https://arxiv.org/pdf/2608.06197v1.pdf
[4] Yang A, et al. Qwen3 Technical Report. 2025.
[5] Zhang Y, et al. CM2: A Cross-Modal... 详见论文引用 Zhang et al., 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
智能体训练愁环境?模拟器太贵、真环境难寻?不如学学EnvACE——让模型自己演自己,把环境装进参数里,自导自演照样涨点!
想第一时间获取更多AI前沿论文解读与开源代码实践?快来加入龙哥读论文粉丝群,和一群爱AI、爱折腾的伙伴一起拆解新论文。扫描下方二维码或添加龙哥助手微信号:kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称,更快进群!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。