← 返回 PaperDaily
大模型与智能体
告别“绕路成功”!厦大&南洋理工PlanPO:多轮智能体强化学习效率暴涨27.2%
继8月推过单次采样SAPO之后,强化学习训练多轮智能体又有新活。这次厦大和南洋理工的合作工作,只靠“成功轨迹的长度”这一个几乎零成本的信号,就把GRPO平均拔高27.2%,还顺带解决了成功轨迹之间的“优势坍缩”难题,值得一读。
龙哥读论文
发布于 2026-08-25 00:20:13
阅读 1
查看原文
原论文信息如下:
之前龙哥聊过单次采样自回归策略优化(SAPO),那种一条rollout就能把PPO和GRPO都比下去的路子确实惊艳。不过今天这篇来自厦门大学和南洋理工大学等机构的新工作PlanPO,走的是另一个更“抠门”的路线——不增加任何模型、不看过程奖励、不用外部验证器,仅仅在成功轨迹里比一比“谁更短”,就在ALFWorld、WebShop、SciWorld三个多轮智能体基准上把GRPO平均提升了27.2%。是的,你没看错,就是这个看起来有点“简单粗暴”的直觉:同样是完成任务,绕了三圈才到终点的成功,和一步直达的成功,凭什么拿一模一样的奖励?
成功轨迹也有优劣之分?PlanPO如何破解多轮Agent强化学习的优势坍缩难题
大语言模型在信息检索、网页导航、代码生成、具身交互等复杂多轮任务上的进步有目共睹。而驱动这些智能体能力跃迁的关键技术之一,就是带可验证结果奖励的智能体强化学习(Agentic RL),尤其是DeepSeekMath提出的GRPO(Group Relative Policy Optimization)这类组相对策略优化方法,已经成为微调Qwen2.5等开源模型、提升多轮任务能力的主流范式。
但这里藏着一个被很多人忽视的 bug:组相对优化只按最终结果给奖励——成功了就一样,失败了就一样。可同样是成功,有的轨迹一步直达干净利落,有的却在环境里反复横跳、犹豫不决、甚至走进死胡同再退出来,最后才磨到终点;同样是成功的那一步动作,有的思维链逻辑清晰直奔主题,有的则绕来绕去、自相矛盾、甚至出现幻觉式的中间推理。按照GRPO的逻辑,这些质量天差地别的成功轨迹,最终拿到的奖励完全相同。
结果就是所谓的优势坍缩(Advantage Collapse) 。同一个任务组里,所有成功轨迹的优势被压成一团,模型分不清哪条路径更值得学,哪些冗余行为应该被抑制。更麻烦的是,这些绕路成功里夹带的噪声rollout还会反向污染训练信号。这个问题,正是PlanPO这篇论文要解决的核心痛点。
其实学术界不是没意识到这个问题。有人引入价值模型(critic)或者过程奖励模型(PRM)来逐跳给反馈,但这些额外模型本身会引入估计偏差,还占用大量显存。也有人走组优化的路子,比如HiPER通过子任务分解计算轨迹片段的多重回报,GiGPO通过识别重复的锚定状态在动作空间上构造逐步优势信号,R3L和GVPO则分别从失败反思和代码执行反馈里找回合级信用。但问题在于,这些方法多多少少都依赖人工设计的启发式规则,换个任务就得重新调,泛化性存疑。
那有没有一种简单、有效、又足够通用的信号,能把成功轨迹内部的差异重新拉开?PlanPO的作者把目光投向了一个天然存在却被长期忽略的指标——轨迹长度与响应长度 。多轮交互中的低效,往往表现为多余的交互轮次和冗长的生成文本。同样是成功,短而直接的路径显然比绕路成功的路径包含了更优的规划能力。
从“绕路成功”到“高效直达”:PlanPO的核心机制解析
PlanPO的整体思路可以用一句话概括:只在成功轨迹内部,用轨迹长度和响应长度做粗到细的组相对归一化,从而重构优势信号 。它不追求把每个动作都打上精确的分数,而是通过两个层级的长度信息,把成功轨迹之间的质量差异重新拉开。
先看轨迹级别的设计。给定一个任务实例x,旧策略会采样出N条完整轨迹,每条轨迹只在终止时拿到一个结果奖励R(τ)。在ALFWorld这类环境里,任务完成就给10分,否则给0分。PlanPO做的第一件事,是只对成功轨迹做长度归一化:把结果奖励除以这条轨迹的交互轮数T,得到轨迹级的长度归一化奖励。然后再在同一任务的成功轨迹组内做组相对归一化,得到轨迹级优势A^E。这样,同样是成功,用了5轮就完成任务的轨迹,就会比绕了20轮才完成的轨迹拿到明显更高的优势。
但轨迹级别的信号还是太粗了,它只能区分“整条路径”的优劣,没法告诉模型“这一步该怎么说”。于是PlanPO又叠加了一个回合级(turn-level)的设计:把同任务内所有成功轨迹中的每个响应动作,按响应token长度做归一化,再在成功响应组内做组相对归一化,得到回合级优势A^S。这样,同样是输出take potato 1 from countertop 1这个正确动作,想都不想直接给的响应,就比前面先写一堆自相矛盾思维链的响应拿到更高的优势。
最后,PlanPO把两个层级的优势加权组合成最终优势:A^PlanPO = A^E + α(k)·A^S。其中α(k)是随训练步数线性衰减的权重系数,初始值设为α_init,最终衰减到α_final,且0 ≤ α_final ≤ α(k) < α_init ≤ 1。为什么衰减?因为训练初期策略还比较弱,需要回合级的精细信号来纠正冗长和不一致的推理;到了训练后期策略已经比较强了,回合级约束用太猛反而会过度惩罚响应长度,伤害任务表现。这个设计在后面的消融实验里会看到明显效果。
这里需要特别强调的是,PlanPO没有落入“无脑压长度”的陷阱。它和Pardo等人提出的无条件长度奖励塑形有本质区别。无条件长度塑形不管任务完没完成,只要轨迹短就给奖励,这会把模型逼成“什么都不干直接放弃”的懒鬼。PlanPO的所有长度归一化操作都加了一个前提——成功条件化 。只有先成功完成任务,长度才参与比较;没完成任务,长度一分钱不值。这一步看似不起眼,却是PlanPO能学到规划能力而不是简单长度最小化的关键。
训练目标本身采用和GRPO一样的裁剪式组相对目标,加上KL正则防止策略偏离参考策略太远。整个方法只增加了几个归一化操作,不引入任何额外可学习参数,计算开销几乎可以忽略不计。用论文里的话说,就是negligible additional training cost 。
数据准备及实验设计
实验部分,PlanPO在三个公认有挑战性的多轮智能体基准上做了全面验证。ALFWorld是具身家居环境,考验长程文本推理和决策,包含3827个任务实例、覆盖六个类别;WebShop是交互式网购环境,包含近110万个商品和1.2万条用户指令;SciWorld则偏科学探索,智能体需要通过API操作科学仪器做实验。这三个环境各有侧重,合在一起能比较全面地检验方法在长程交互、信息检索和探索性任务上的表现。
训练基座选择是Qwen2.5-1.5B-Instruct和Qwen2.5-7B-Instruct。对比基线覆盖三条线:闭源模型(GPT-4o、Gemini-2.5-Pro)、免训练提示词智能体(ReAct、Reflexion),以及RL训练方法(PPO、RLOO、GRPO、EMPG、GiGPO)。为了让对比公平,PlanPO的超参完全沿用对应基准上已有RL框架的设置,比如组大小N=8、学习率1e-6、KL惩罚系数1e-3等。ALFWorld和WebShop训练150步,SciWorld训练200步。最大交互轮数分别设为50、15和20。所有实验跑在6块NVIDIA H200和8块NVIDIA A40上。
三大基准全面领先:PlanPO实验效果一览
先看ALFWorld和WebShop的整体结果。从表1可以清晰地看到,PlanPO在几乎所有指标上都把对比方法甩在了后面。在1.5B模型上,PlanPO在ALFWorld六个类别上的整体成功率达到91.3%,比GRPO的72.8%高出18.5个百分点;在WebShop上得分86.8,GRPO只有75.8,成功率更是从56.8飙到77.2。在7B模型上,PlanPO在ALFWorld整体成功率94.4%,WebShop得分88.5、成功率80.6,同样是全面领先。
SciWorld上PlanPO同样稳定领先。SciWorld是偏科学探索的环境,智能体需要通过API操作科学仪器做实验,探索空间大、奖励稀疏,比另外两个基准更考验方法的泛化能力。表2展示了三个随机种子下的结果。
PlanPO在导电性测试和化学混合两个任务上均超过AgentGym-RL、ScalingInter等强基线。考虑到SciWorld的探索性更强,PlanPO把α_init设置为0.05(其他两个环境为0.1),没有额外调参就拿到了最好成绩。
更关键的是泛化能力。表3是Qwen2.5-1.5B在ALFWorld上的分布内与分布外(Out-of-Distribution, OOD)评估结果。
PlanPO在分布外任务上比GRPO提升了24.3%。这一点非常关键:如果模型只是死记硬背了训练任务里的成功模式,OOD表现不可能有这种幅度的提升。这说明PlanPO学到的确实是可迁移的规划策略,而不是对特定成功轨迹的机械模仿。
不只是更短:PlanPO如何避免退化为简单长度最小化
看到这里,有人肯定会问:PlanPO不就是把“越短越好”塞进奖励里吗?这会不会把模型逼成“啥也不干直接结束”的懒鬼?这正是作者反复强调的一个核心区别——成功条件化 。
PlanPO所有长度归一化操作的前面,都挂着一个指示函数1[τ_i∈G_x^U]。这意味着,只有成功完成任务的轨迹,长度才参与比较;失败轨迹的长度归一化奖励直接置零。而无条件长度塑形(比如Pardo等人2018年提出的长度奖励塑形)不管任务完没完成,只要轨迹短就给奖励,模型很容易学会“提前终止任务”来刷奖励,最后变成什么都不做的懒鬼。
PlanPO里,失败就是失败,长度再短也拿不到正信号。“短”必须建立在“成”的前提之下。模型学到的是保证任务完成的前提下提升交互效率和生成质量,而不是偷工减料。图4展示了不同奖励塑形设置在ALFWorld上的长度归一化对比结果。
可以看到,PlanPO的成功条件化设计在保持高任务成功率的同时,显著降低了轨迹长度和响应长度;而其他无条件的长度惩罚设置则出现了明显的性能退化。这说明PlanPO确实在学“更高效的规划路径”,而不是“更短的无效输出”。
理论支撑与消融验证:PlanPO的可靠性分析
PlanPO不只是实验效果好,理论上也有支撑。论文给出了一个关于偏差-方差权衡的定理:PlanPO的优势估计器A_α = A^E + αA^S,相对于完整细化目标A^★ = A^E★ + A^S★,存在如下关系:
在消融实验层面,图3左侧两张图展示了不同α调度(衰减模式)的对比,第三张展示了组件消融结果:轨迹级优势A^E单独用、回合级优势A^S单独用、PlanPO默认衰减、以及PlanPO使用常数α=0.1。结果显示,只用轨迹级或只用回合级,都拿不到完整效果;常数α的效果也不如衰减调度。这说明“粗到细、前期细化后期稳定”的设计缺一不可。
图3最右侧的时间开销分解也很有说服力:PlanPO相比GRPO,在reward和advantage阶段增加的计算几乎可以忽略,反而因为成功轨迹更短,整体任务运行时间减少了12.5%。
图5进一步展示了ALFWorld任务上的平均长度对比。PlanPO在保持高成功率的同时,轨迹轮数和响应长度都明显低于GRPO和其他基线。这再次印证了一个判断:PlanPO学到的是“更短而成功的路径”,而不是“牺牲成功率换取短输出”。
总结与展望:Agent规划能力学习的下一步
PlanPO的贡献可以总结为三点:第一,识别出成功轨迹异质性是组相对优化中的一个关键瓶颈——成功轨迹内部冗余回合和冗余推理会掩盖轨迹质量,限制策略学习;第二,提出成功条件化的长度归一化优势,用轨迹级加回合级的粗到细方式重构训练信号,让智能体学到可泛化的规划能力;第三,在ALFWorld、WebShop、SciWorld三个具有挑战性的多轮基准上,PlanPO一致超越近期强基线,且训练成本几乎可以忽略。
局限方面,长度信号毕竟只是规划质量的代理指标。如果任务本身需要长链推理,或者“绕路”本身是任务要求的必要探索,简单的长度归一化可能会引入偏差。此外,目前的实验集中在具备可验证结果奖励的环境,对于更开放、奖励更模糊的通用Agent任务,PlanPO的效果还需要进一步验证。未来值得探索的方向包括:把长度信号与过程奖励模型、外部验证器结合,以及在更广泛的Agent框架(比如网页导航、代码生成、具身操作)中检验PlanPO的通用性。
龙迷三问
这篇论文到底在解决什么问题? 多轮智能体强化学习中,成功轨迹并非同等优秀。厦大与南洋理工提出PlanPO,通过成功条件化的粗到细长度归一化优势,区分高效成功与绕路成功,相比GRPO平均提升27.2%,训练成本几乎为零。
这篇工作最值得看的点是什么? PlanPO在ALFWorld、WebShop和SciWorld三个基准上均取得最优性能,相比GRPO平均提升27.2%,在ALFWorld分布外任务上提升24.3%
这篇工作的边界或风险在哪里? 优点:方法简单有效,无需额外模型或人工设计,计算开销可忽略;成功条件归一化避免了退化为简单长度最小化;在多个基准上取得显著提升。缺点:依赖成功轨迹的多样性,若成功轨迹较少则信号可能不足;α(k)衰减调度需要调参;在SciWorld的Chem-Mix任务上仍无法解决。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出PlanPO方法,在组相对策略优化框架下,对成功轨迹按轨迹长度和响应长度进行条件归一化,构建从粗到细的多尺度优势信号,以学习可泛化的规划能力。
实验合理度: ★★★★☆
ALFWorld各任务类别成功率、WebShop得分与成功率、SciWorld各任务得分与总体得分
学术研究价值: ★★★★☆
提出PlanPO方法,在组相对策略优化框架下,对成功轨迹按轨迹长度和响应长度进行条件归一化,构建从粗到细的多尺度优势信号,以学习可泛化的规划能力;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
训练开销与GRPO相比几乎可忽略,额外计算仅在于奖励和优势计算阶段;可减少12.5%的任务运行时间
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 依赖成功轨迹的多样性,若成功轨迹较少则信号可能不足;α(k)衰减调度需要调参;在SciWorld的Chem-Mix任务上仍无法解决。
主要参考文献
[1] Liang D, He L, Feng X, et al. PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs. arXiv:2608.17289, 2026.
[2] Shao Z, Wang P, Zhu Q, et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300, 2024.
[3] Yao S, Zhao J, Yu D, et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023.
[4] Shinn N, Cassano F, Gopinath A, et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023.
[5] Schulman J, Wolski F, Dhariwal P, et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017.
[6] Feng X, et al. GiGPO: Group-in-Group Policy Optimization for LLM Agents. 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
多轮智能体训练正火热,PlanPO教你分辨“高效成功”和“绕路成功”!想和更多小伙伴一起交流强化学习、智能体训练的最新进展?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 强化学习+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。😊