← 返回 PaperDaily
大模型与智能体
单次采样效果优于PPO/GRPO厦大&南洋理工新方法大涨15个点
智能体强化学习正处在大模型后训练的核心位置,但PPO太贵、GRPO又存在信用分配短板。本文提出SAPO,用一条自回归流同时搞定策略与价值估计,在ALFWorld和WebShop上比PPO/GRPO平均涨15.1/12.1个百分点,还省掉独立critic、提速33.2%。一句话:值估计的便宜和单采样的高效,这次全都要。
龙哥读论文
阅读 6
查看原文

原论文信息如下:
引言
大语言模型的强化学习后训练,正从单轮问答走向多轮交互的“实战模式”。智能体在网页购物、家务操作等长程任务中,需要在一连串观察、思考、行动间决策。当环境只在一整段轨迹结束时给出一次奖励,中间每一步的信用分配成为难题。
主流方案分两派。PPO等演员-评论家方法用独立critic网络学习状态价值,能精细分配信用,但额外模型带来显存和算力开销。GRPO等免评论家方法通过组内多轨迹奖励归一化估计优势,省掉critic,但面临优势坍缩、轨迹级优势无法区分中间步骤、采样成本高等问题。
厦门大学和南洋理工大学提出SAPO,核心思想巧妙:大语言模型本身是自回归生成器,演员-评论家所需信息流与语言生成的因果顺序天然吻合。SAPO让同一模型在一条自回归流中同时承担策略生成、状态价值估计和行为价值估计三个角色,既获得显式值函数泛化能力,又避免独立critic开销。
方法概述
SAPO的设计基于“状态价值只看行动前信息,行为价值可额外看到行动本身”的直觉。自回归解码中,这两个信息边界天然存在:生成响应第一个token前可读状态价值V,生成最后一个响应token后可读行为价值Q。SAPO利用这两个因果边界,从同一模型的logits中读出V和Q。

图1:SAPO整体框架图。模型在生成响应前读取状态价值,在生成响应后读取行为价值,一条自回归流同时承担三个角色。
实现上,SAPO在词表中保留两个特殊token作为“价值基座”,一个代表正向价值、一个代表负向价值。模型在边界位置对这两个token的logits做差,经裁剪和缩放得到归一化价值读数。这两个token不会被采样出来,策略softmax只作用于剔除它们后的词表子集,策略学习不干扰价值基座,价值目标独立优化其logits。
SAPO做策略评估时只需对采样轨迹做一次前向计算,同时拿到旧策略token对数概率、状态价值旧值和行为价值旧值。相比PPO的额外critic前向和反向传播,SAPO计算链路更短,这是节省33%以上迭代时间的结构根源。
问题背景及相关工作
当前智能体强化学习有两条技术路线。第一条以GRPO及其变体为代表,对同一提示词采样一组轨迹,用组内奖励均值与标准差归一化优势,避开critic网络。这在数学推理任务上表现惊人,但在长程交互任务中,奖励稀疏时组内轨迹奖励可能完全相同,归一化后优势全变零,梯度消失,即“优势坍缩”。
第二条路线重新引入显式价值模型,如Open-Reasoner-Zero、VC-PPO、VAPO。这些工作证明靠谱的critic能显著改善长程推理任务的信用分配,但代价是维护与策略规模相当的价值网络。Hydra-PPO通过共享冻结主干缓解,但仍需分别配置适配器与输出头。POISE用轻量探针读价值,却依赖跨轨迹估计。SAO实现异步单轨迹训练,但仍需单独预训练的critic。
SAPO的差异化定位在于:既不需要独立critic网络,也不需要组内多轨迹采样,而是把完整演员-评论家结构压缩进单一自回归语言模型。这不仅是参数共享,更建立起自回归建模与演员-评论家学习之间的结构性对应关系。
核心设计
SAPO的核心设计拆成三个关键模块:因果边界上的价值读取、单轨迹轨迹级优势估计、联合策略-价值优化目标。
在第t轮交互中,模型先看到状态上下文,再逐token生成响应,之后才能看到环境奖励和下一轮观察。SAPO在响应生成前读取状态价值V,在响应生成完毕后读取行为价值Q。这两个位置对应自回归解码的两个因果边界,因果掩码天然保证V不会看到未生成的行动、Q不会看到未到来的奖励。
价值读取方式:从词表中挑出两个特殊token,将其logits之差除以温度参数,再裁剪到负一到一之间,得到归一化价值读数。logits差值对公共偏移不敏感,具有稳健性;裁剪操作把读数限制在固定范围。两个特殊token在策略softmax中被显式排除,模型永远不会把它们当动作生成,保证价值基座与动作分布彻底隔离。
有了价值函数,SAPO用广义优势估计(GAE)递归计算每一轮优势值,配合λ参数调节偏差与方差权衡。与组相对方法将同一轨迹级优势广播给所有token不同,SAPO在把优势赋给响应token前,先在整个训练batch的合法轮次上做批量归一化。这防止长响应在优势统计中占据不成比例的分量,也让不同轨迹间的学习信号可比——只需一条轨迹,不需要同提示词的多个同步采样。
SAPO给状态价值V和行为价值Q设置不同学习目标。V被训练去拟合λ回报,让长期结果信息传播到行动之前的状态边界;Q被训练去拟合on-policy SARSA目标,即当前奖励加上下一轮Q的折扣值,把选中响应与其直接后果绑定。策略优势只用GAE而不用V和Q之差,避免早期行为价值估计不准确时直接扰动策略更新。
SAPO最终损失函数由四部分组成:token级别裁剪策略损失、V和Q两个价值的裁剪回归损失、参考策略KL正则、策略熵正则。策略损失保持PPO风格信任域约束,但每个轮次内所有合法token共享同一归一化优势值。价值损失在归一化概率空间做裁剪回归,只在合法轮次上平均,让每次环境决策获得相等权重。
整个训练过程只有一次联合前向和反向传播,策略、状态价值、行为价值更新同一个transformer和同一个语言模型头,只是使用不同掩码和监督信号。这种设计在算法结构上消除了独立critic的显存占用,也避免了组相对方法对多轨迹同步采样的强依赖。
核心原理推导
SAPO的价值读取公式简洁。给定因果上下文c,模型输出logits向量,两个特殊token对应的logits之差经温度缩放和裁剪得到归一化读数:
p(c) = clip(((z+(c) - z-(c)) / τ_v), -1, 1)
当任务折扣回报落在[-Rmax, Rmax]区间内时,状态价值V(s_t) = Rmax · p(c_t^s),行为价值Q(s_t, a_t) = Rmax · p(c_t^sa)。
单次采样也能做Actor-Critic?SAPO打破传统范式
智能体强化学习面临一个尴尬现实:训练AI执行“整理房间”这类多步任务,环境只在最后给出成功或失败反馈。PPO这类演员-评论家方法训练价值网络当“教练”,每一步告诉策略“这一步值不值”;GRPO这类免评论家方法不训练价值网络,而是对同一任务采样多条完整轨迹,用轨迹间奖励对比估计“哪个动作更好”。
问题在于:PPO的“教练”不便宜——价值网络参数量与策略网络相当,训练时额外占用显存,每一步都需额外前向和反向传播。GRPO靠“题海战术”弥补:同一道题需采样好多条轨迹才能算出靠谱基线,采得少基线噪声大,采得多计算成本成倍上涨。更致命的是,长程交互任务奖励稀疏,一组轨迹成功率全为0,奖励一样,归一化后优势变零,梯度消失——即“优势坍缩”。
厦门大学和南洋理工大学提出的SAPO,试图把两类方法优点结合:既有PPO精细到每一轮的信用分配能力,又不用单独养完整critic网络;既保留值函数泛化优势,又只需每个任务采样一条轨迹。SAPO把“请教练”和“题海战术”合二为一,用同一模型参数同时干策略生成和价值估计。关键在于找到巧妙的结构切入点:自回归语言模型的因果解码顺序,天然就是演员-评论家各自所需信息流的顺序。
因果边界上的价值读取:一个模型三种角色
一个自然的直觉是:智能体决定“下一步做什么”前,应对当前局面有整体判断——这个状态大概值多少分,即状态价值V(s_t);生成某个具体行动后,应对这个“状态-行动”组合有更精细判断——这个动作在当下好不好,即行为价值Q(s_t, a_t)。V的估计只能基于行动前信息,Q的估计可额外看到行动本身,但都不能看到环境后续奖励。
这种信息依赖关系,恰好与自回归解码的两个因果边界完美对应。第一个边界在生成响应第一个token前,此时模型已处理完对话历史但还没看到本次响应内容,适合读V;第二个边界在生成最后一个响应token后,此时模型已看到完整动作但还不知道环境反馈,适合读Q。SAPO在这两个边界上各读一次价值,中间生成的响应就是策略动作本身。因果掩码天然保证信息隔离。
价值读数怎么从语言模型里提取?SAPO从词表中选出两个已有token,一个作为“正向价值基座”,一个作为“负向价值基座”。在某个因果边界位置,模型对这两个token分别输出logits值,两者之差除以温度参数,再裁剪到[-1, 1]区间,得到归一化价值读数:
但有个必须处理好的隐患:这两个基座token如果出现在策略softmax里,就可能被模型当作普通动作生成出去,价值体系就崩了。SAPO的解决办法很干脆——把这两个token从动作词表里剔除,策略softmax只在剔除后的词表子集上做归一化:
这套“一鱼三吃”设计还有一个隐蔽的工程红利:SAPO在评估旧策略时,只需对采样轨迹做一次前向计算,就能同时拿到旧token对数概率、旧状态价值和旧行为价值。PPO需要为critic单独做一次前向,GRPO需要为同提示词的多个轨迹分别做前向。SAPO把这一步省掉了,为后面33%的提速埋下伏笔。
轨迹级GAE与批量归一化:解决稀疏奖励下的信用分配
有了价值函数,下一步就是把终局奖励“拆解”到每一轮决策上。SAPO采用广义优势估计(GAE),从最后一轮往前推进,先算出时序差分残差δ_t,再用λ参数控制多步回溯深度:
更讲究的是,SAPO给状态价值V和行为价值Q设置不同学习目标。V被训练去拟合λ回报,即旧价值加上GAE优势,让长期结果信息传播到行动前状态边界;Q被训练去拟合在线策略SARSA目标,即当前奖励加上下一轮Q的折扣值,把选中响应与其直接后果绑定:
有了每轮优势值后,还有一个关键细节:怎么把它分配给响应里的各个token?GRPO把整个轨迹级别优势广播给所有token,但SAPO选择更精细的路线——先把优势在batch内所有合法轮次上做批量归一化,再广播给对应轮次内的所有token:
最后,联合优化目标把策略损失、两个价值损失、KL正则和熵正则组合在一起:
实验验证:全面超越PPO和GRPO,速度还快33%
SAPO在两类长程智能体基准上验证:ALFWorld是家务操作任务,包含捡放物品、开灯检查、清洁、加热、冷却、捡两个物品等六个子类别;WebShop是网页购物任务,要求根据自然语言指令浏览商品页面、做出购买决策。两条基准都要求智能体与环境多轮交互,奖励只在任务结束时给出,正是长程稀疏奖励的典型场景。
到了7B规模,SAPO面对的竞争更激烈,PPO(带评论家)和GRPO都已调得较好,但SAPO依然保持优势。论文摘要给出的总括数字是:相比PPO平均提升15.1个百分点,相比GRPO平均提升12.1个百分点。考虑到这是在只采样一条轨迹、不训练独立critic的条件下实现的,这个成绩单相当能说明问题。
在训练效率上,SAPO的结构优势转化成了实打实的运行时间节省。下图展示Qwen2.5-1.5B在ALFWorld上PPO和SAPO单次迭代的耗时分解对比,纵轴采用对数坐标:
为什么SAPO能涨这么多?结合方法设计,关键原因有三点。第一,显式状态价值提供轨迹间泛化——同样一个状态在不同任务实例里出现时,价值函数能共享知识,这是组相对方法不具备的。第二,turn级GAE优势让每一轮交互都有独立学习信号,即使整条轨迹最终失败,中间那些“本可以做得更好”的轮次照样能获得梯度。第三,批量归一化保证不同长度响应的优势尺度一致,长轨迹训练时优势方差不被个别超长响应主导,优化更平稳。
局限与展望:SAPO的边界在哪里?
SAPO的巧妙之处在于用两个特殊token的logits之差编码连续价值。但这也带来潜在问题:价值读数的表达能力受限于单点logits差值,对于回报分布特别复杂或动态范围特别大的任务,这种标量读数容量可能不够。论文实验任务回报基本在[-1, 1]范围内,换到回报范围更大的场景,价值基座拟合压力会明显上升。
另一个有待观察的点是价值初始化。SAPO复用预训练语言模型的token logits作为价值读数起点,而预训练时这两个token并没有被赋予“价值”语义,初始价值读数很可能偏离真实回报范围。论文没有详细分析价值初始化对训练稳定性的影响,实际复现时可能需要额外调参。此外,大部分基线数据引自Feng等人的论文,虽然属于公开标准对比,但若能用自己的复现结果再补一组对照,说服力会更强。
展望未来,SAPO打开了一个值得深入探索的方向:自回归模型token级价值读数的设计空间还很大。比如,能否用一组token的输出分布编码更丰富的价值分布而不只是期望值?能否把这种因果边界价值读数扩展到多步规划或模型预测控制?能否在更大规模模型上验证这种共享参数actor-critic的稳定性边界?这些都是值得后续研究者接着往下挖的问题。
龙迷三问
这篇论文到底在解决什么问题?针对智能体强化学习中GRPO无值函数、信用分配弱和采样开销大的问题,厦门大学与南洋理工提出SAPO,在单条轨迹内用共享自回归网络同时输出策略与价值,ALFWorld和WebShop上平均超越PPO和GRPO达15.1和12.1个百
这篇工作最值得看的点是什么?SAPO在ALFWorld和WebShop上均优于PPO和GRPO,在Qwen2.5-1.5B上ALFWorld总体成功率90.1%(比PPO高35.7个百分点,比GRPO高17.3个百分点),在Qwen2.5-7B上达到94.0%的ALFWorld成功率和88.6的WebShop得分,同时减少33.2%运行时间。
这篇工作的边界或风险在哪里?优点:(1) 创新性地将actor-critic学习与自回归生成结构对齐,在单一模型中同时表示策略和价值函数;(2) 消除了独立critic模型的内存开销和组相对采样的计算成本;(3) 通过GAE和SARSA目标的结合实现了显式的时序信用分配;(4) 实验证明在多个基准上优于现有方法。缺点:(1) 保留两个词汇作为价值基底的策略可能影响模型原有词汇分布;(2) 价值函数范围受限于R_max的预设;(3) 在极端长轨迹任务上的表现尚未验证;(4) 与最新方法GiGPO相比优势不够显著。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
提出一种单次采样自回归策略优化框架,利用因果语言模型的自回归结构在单一backbone上同时表示策略、状态价值和动作价值,通过因果边界读取实现无需独立critic和组相对采样的显式时序信用分配。
实验合理度:★★★★☆
ALFWorld任务成功率(按6个类别分别统计及总体),WebShop得分和成功率
学术研究价值:★★★★☆
提出一种单次采样自回归策略优化框架,利用因果语言模型的自回归结构在单一backbone上同时表示策略、状态价值和动作价值,通过因果边界读取实现无需独立critic和组相对采样的显式时序信用分配;更关键的是问题定义是否可复用到同类任务。
稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本:★★★☆☆
相比PPO减少33.2%的每迭代运行时间(从451.2s降至301.4s),消除了独立critic模型的前向/反向传播及其训练状态的内存开销。
复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题:(1) 保留两个词汇作为价值基底的策略可能影响模型原有词汇分布;
主要参考文献
[1] Liang D, Feng L, An B, et al. SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning. arXiv preprint arXiv:2608.19842, 2026.
[2] Schulman J, Wolski F, Dhariwal P, et al. Proximal Policy Optimization Algorithms. arXiv preprint arXiv:1707.06347, 2017.
[3] Shao Z, Wang P, Zhu Q, et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv preprint arXiv:2402.03300, 2024.
[4] Yu F, et al. Feng et al. Agentic RL baseline evaluation results. (原文引用来源, 详细出处见论文参考文献[4])
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!