← 返回 PaperDaily 大模型与智能体

单次采样效果优于PPO/GRPO厦大&南洋理工新方法大涨15个点

智能体强化学习正处在大模型后训练的核心位置,但PPO太贵、GRPO又存在信用分配短板。本文提出SAPO,用一条自回归流同时搞定策略与价值估计,在ALFWorld和WebShop上比PPO/GRPO平均涨15.1/12.1个百分点,还省掉独立critic、提速33.2%。一句话:值估计的便宜和单采样的高效,这次全都要。

单次采样效果优于PPO/GRPO厦大&南洋理工新方法大涨15个点

paperdaily_reaction_gif


原论文信息如下:
论文标题:
SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
发表日期:
2026年08月
发表单位:
厦门大学(Xiamen University)与南洋理工大学(Nanyang Technological University)
原文链接:
https://arxiv.org/pdf/2608.19842v1.pdf

引言

大语言模型的强化学习后训练,正从单轮问答走向多轮交互的“实战模式”。智能体在网页购物、家务操作等长程任务中,需要在一连串观察、思考、行动间决策。当环境只在一整段轨迹结束时给出一次奖励,中间每一步的信用分配成为难题。

主流方案分两派。PPO等演员-评论家方法用独立critic网络学习状态价值,能精细分配信用,但额外模型带来显存和算力开销。GRPO等免评论家方法通过组内多轨迹奖励归一化估计优势,省掉critic,但面临优势坍缩、轨迹级优势无法区分中间步骤、采样成本高等问题。

厦门大学和南洋理工大学提出SAPO,核心思想巧妙:大语言模型本身是自回归生成器,演员-评论家所需信息流与语言生成的因果顺序天然吻合。SAPO让同一模型在一条自回归流中同时承担策略生成、状态价值估计和行为价值估计三个角色,既获得显式值函数泛化能力,又避免独立critic开销。

方法概述

SAPO的设计基于“状态价值只看行动前信息,行为价值可额外看到行动本身”的直觉。自回归解码中,这两个信息边界天然存在:生成响应第一个token前可读状态价值V,生成最后一个响应token后可读行为价值Q。SAPO利用这两个因果边界,从同一模型的logits中读出V和Q。

图1:SAPO整体框架图 图1:SAPO整体框架图。模型在生成响应前读取状态价值,在生成响应后读取行为价值,一条自回归流同时承担三个角色。

实现上,SAPO在词表中保留两个特殊token作为“价值基座”,一个代表正向价值、一个代表负向价值。模型在边界位置对这两个token的logits做差,经裁剪和缩放得到归一化价值读数。这两个token不会被采样出来,策略softmax只作用于剔除它们后的词表子集,策略学习不干扰价值基座,价值目标独立优化其logits。

SAPO做策略评估时只需对采样轨迹做一次前向计算,同时拿到旧策略token对数概率、状态价值旧值和行为价值旧值。相比PPO的额外critic前向和反向传播,SAPO计算链路更短,这是节省33%以上迭代时间的结构根源。

问题背景及相关工作

当前智能体强化学习有两条技术路线。第一条以GRPO及其变体为代表,对同一提示词采样一组轨迹,用组内奖励均值与标准差归一化优势,避开critic网络。这在数学推理任务上表现惊人,但在长程交互任务中,奖励稀疏时组内轨迹奖励可能完全相同,归一化后优势全变零,梯度消失,即“优势坍缩”。

第二条路线重新引入显式价值模型,如Open-Reasoner-Zero、VC-PPO、VAPO。这些工作证明靠谱的critic能显著改善长程推理任务的信用分配,但代价是维护与策略规模相当的价值网络。Hydra-PPO通过共享冻结主干缓解,但仍需分别配置适配器与输出头。POISE用轻量探针读价值,却依赖跨轨迹估计。SAO实现异步单轨迹训练,但仍需单独预训练的critic。

SAPO的差异化定位在于:既不需要独立critic网络,也不需要组内多轨迹采样,而是把完整演员-评论家结构压缩进单一自回归语言模型。这不仅是参数共享,更建立起自回归建模与演员-评论家学习之间的结构性对应关系。

核心设计

SAPO的核心设计拆成三个关键模块:因果边界上的价值读取、单轨迹轨迹级优势估计、联合策略-价值优化目标。


因果边界上的双token价值基座

在第t轮交互中,模型先看到状态上下文,再逐token生成响应,之后才能看到环境奖励和下一轮观察。SAPO在响应生成前读取状态价值V,在响应生成完毕后读取行为价值Q。这两个位置对应自回归解码的两个因果边界,因果掩码天然保证V不会看到未生成的行动、Q不会看到未到来的奖励。

价值读取方式:从词表中挑出两个特殊token,将其logits之差除以温度参数,再裁剪到负一到一之间,得到归一化价值读数。logits差值对公共偏移不敏感,具有稳健性;裁剪操作把读数限制在固定范围。两个特殊token在策略softmax中被显式排除,模型永远不会把它们当动作生成,保证价值基座与动作分布彻底隔离。


单轨迹轨迹级GAE与批量归一化

有了价值函数,SAPO用广义优势估计(GAE)递归计算每一轮优势值,配合λ参数调节偏差与方差权衡。与组相对方法将同一轨迹级优势广播给所有token不同,SAPO在把优势赋给响应token前,先在整个训练batch的合法轮次上做批量归一化。这防止长响应在优势统计中占据不成比例的分量,也让不同轨迹间的学习信号可比——只需一条轨迹,不需要同提示词的多个同步采样。

SAPO给状态价值V和行为价值Q设置不同学习目标。V被训练去拟合λ回报,让长期结果信息传播到行动之前的状态边界;Q被训练去拟合on-policy SARSA目标,即当前奖励加上下一轮Q的折扣值,把选中响应与其直接后果绑定。策略优势只用GAE而不用V和Q之差,避免早期行为价值估计不准确时直接扰动策略更新。


联合优化目标

SAPO最终损失函数由四部分组成:token级别裁剪策略损失、V和Q两个价值的裁剪回归损失、参考策略KL正则、策略熵正则。策略损失保持PPO风格信任域约束,但每个轮次内所有合法token共享同一归一化优势值。价值损失在归一化概率空间做裁剪回归,只在合法轮次上平均,让每次环境决策获得相等权重。

整个训练过程只有一次联合前向和反向传播,策略、状态价值、行为价值更新同一个transformer和同一个语言模型头,只是使用不同掩码和监督信号。这种设计在算法结构上消除了独立critic的显存占用,也避免了组相对方法对多轨迹同步采样的强依赖。

核心原理推导

SAPO的价值读取公式简洁。给定因果上下文c,模型输出logits向量,两个特殊token对应的logits之差经温度缩放和裁剪得到归一化读数:

p(c) = clip(((z+(c) - z-(c)) / τ_v), -1, 1)

当任务折扣回报落在[-Rmax, Rmax]区间内时,状态价值V(s_t) = Rmax · p(c_t^s),行为价值Q(s_t, a_t) = Rmax · p(c_t^sa)。

单次采样也能做Actor-Critic?SAPO打破传统范式

智能体强化学习面临一个尴尬现实:训练AI执行“整理房间”这类多步任务,环境只在最后给出成功或失败反馈。PPO这类演员-评论家方法训练价值网络当“教练”,每一步告诉策略“这一步值不值”;GRPO这类免评论家方法不训练价值网络,而是对同一任务采样多条完整轨迹,用轨迹间奖励对比估计“哪个动作更好”。
问题在于:PPO的“教练”不便宜——价值网络参数量与策略网络相当,训练时额外占用显存,每一步都需额外前向和反向传播。GRPO靠“题海战术”弥补:同一道题需采样好多条轨迹才能算出靠谱基线,采得少基线噪声大,采得多计算成本成倍上涨。更致命的是,长程交互任务奖励稀疏,一组轨迹成功率全为0,奖励一样,归一化后优势变零,梯度消失——即“优势坍缩”。
厦门大学和南洋理工大学提出的SAPO,试图把两类方法优点结合:既有PPO精细到每一轮的信用分配能力,又不用单独养完整critic网络;既保留值函数泛化优势,又只需每个任务采样一条轨迹。SAPO把“请教练”和“题海战术”合二为一,用同一模型参数同时干策略生成和价值估计。关键在于找到巧妙的结构切入点:自回归语言模型的因果解码顺序,天然就是演员-评论家各自所需信息流的顺序。

因果边界上的价值读取:一个模型三种角色

一个自然的直觉是:智能体决定“下一步做什么”前,应对当前局面有整体判断——这个状态大概值多少分,即状态价值V(s_t);生成某个具体行动后,应对这个“状态-行动”组合有更精细判断——这个动作在当下好不好,即行为价值Q(s_t, a_t)。V的估计只能基于行动前信息,Q的估计可额外看到行动本身,但都不能看到环境后续奖励。
这种信息依赖关系,恰好与自回归解码的两个因果边界完美对应。第一个边界在生成响应第一个token前,此时模型已处理完对话历史但还没看到本次响应内容,适合读V;第二个边界在生成最后一个响应token后,此时模型已看到完整动作但还不知道环境反馈,适合读Q。SAPO在这两个边界上各读一次价值,中间生成的响应就是策略动作本身。因果掩码天然保证信息隔离。
价值读数怎么从语言模型里提取?SAPO从词表中选出两个已有token,一个作为“正向价值基座”,一个作为“负向价值基座”。在某个因果边界位置,模型对这两个token分别输出logits值,两者之差除以温度参数,再裁剪到[-1, 1]区间,得到归一化价值读数:
公式1:价值读取公式 p(c) = clip(((z_w+ - z_w-) / τ_v), -1, 1)
其中z_w+和z_w-分别是两个基座token在当前位置的logits,τ_v是温度参数。用logits之差而非单个logits,对两个logits同时加常数偏移不影响结果,天然具有稳健性;裁剪操作把读数约束在固定范围。当任务折扣回报落在[-R_max, R_max]区间时,状态价值和行为价值分别参数化为:
公式2:状态价值与行为价值参数化公式
这里的R_max是回报最大绝对值,c_t^s是第t轮状态上下文,c_t^sa是状态和响应拼接后的完整上下文。这个设计很克制:状态价值只看行动前信息,行为价值多看一个行动本身,两者共享同一transformer主干和同一语言模型头,只是读取位置不同。
但有个必须处理好的隐患:这两个基座token如果出现在策略softmax里,就可能被模型当作普通动作生成出去,价值体系就崩了。SAPO的解决办法很干脆——把这两个token从动作词表里剔除,策略softmax只在剔除后的词表子集上做归一化:
公式3:受限策略分布公式
W_act表示剔除两个基座token后的动作词表。采样时、计算动作对数概率时、计算熵正则时,都使用这个受限分布。策略学习永远不会奖励或抑制价值基座token的生成,但它们的原始logits依然可被价值目标独立优化。一句话:策略和值函数共享参数,但各管各的监督信号。
这套“一鱼三吃”设计还有一个隐蔽的工程红利:SAPO在评估旧策略时,只需对采样轨迹做一次前向计算,就能同时拿到旧token对数概率、旧状态价值和旧行为价值。PPO需要为critic单独做一次前向,GRPO需要为同提示词的多个轨迹分别做前向。SAPO把这一步省掉了,为后面33%的提速埋下伏笔。

轨迹级GAE与批量归一化:解决稀疏奖励下的信用分配

有了价值函数,下一步就是把终局奖励“拆解”到每一轮决策上。SAPO采用广义优势估计(GAE),从最后一轮往前推进,先算出时序差分残差δ_t,再用λ参数控制多步回溯深度:
公式4:时序差分残差公式 公式5:GAE递归公式
其中γ是折扣因子,d_t表示第t轮之后轨迹是否终止。λ越大,优势估计越依赖长期累积回报,偏差小但方差大;λ越小,越依赖单步价值差值,方差小但偏差大。GAE的好处在于,即使环境只在最后给一个总奖励,通过价值引导,中间每一轮也能获得各不相同的学习信号——解决组相对方法“轨迹级平均优势”导致的信用分配粗糙问题。
更讲究的是,SAPO给状态价值V和行为价值Q设置不同学习目标。V被训练去拟合λ回报,即旧价值加上GAE优势,让长期结果信息传播到行动前状态边界;Q被训练去拟合在线策略SARSA目标,即当前奖励加上下一轮Q的折扣值,把选中响应与其直接后果绑定:
公式6:价值目标公式
为什么不让Q和V之差直接作为策略优势?论文作者很清醒:早期Q估计可能不准确,用V和Q的差直接驱动策略更新,会把行为价值误差直接传导到策略上,造成不稳定。所以策略优势只用GAE,Q目标单独训练“行动条件下的价值表示”,两个价值各司其职又不互相拖累。
有了每轮优势值后,还有一个关键细节:怎么把它分配给响应里的各个token?GRPO把整个轨迹级别优势广播给所有token,但SAPO选择更精细的路线——先把优势在batch内所有合法轮次上做批量归一化,再广播给对应轮次内的所有token:
公式7:批量归一化优势公式
这里的μ_B和σ_B是整个训练batch的均值与标准差。批量归一化有两个直接好处:一是防止长响应在优势统计里占据过大权重——如果某个动作生成500个token而另一个只生成5个,归一化前长响应的优势方差会被稀释;二是让不同轨迹、不同任务间的学习信号处于同一尺度,方便用统一学习率优化。和GRPO组归一化相比,SAPO的批量归一化不要求同提示词多轨迹同步出现,只需单条轨迹就能计算,从根本上解除“组内多采样”的负担。
最后,联合优化目标把策略损失、两个价值损失、KL正则和熵正则组合在一起:
公式8:SAPO总损失函数
其中L_pol是PPO风格裁剪策略损失,L_V和L_Q是两个价值的裁剪回归损失,L_KL是参考策略KL散度,H是策略熵。所有分量都作用在同一个transformer和同一个语言模型头上,只是用不同掩码区分优化位置。系数c_V和c_Q控制生成与价值学习间的干扰程度。

实验验证:全面超越PPO和GRPO,速度还快33%

SAPO在两类长程智能体基准上验证:ALFWorld是家务操作任务,包含捡放物品、开灯检查、清洁、加热、冷却、捡两个物品等六个子类别;WebShop是网页购物任务,要求根据自然语言指令浏览商品页面、做出购买决策。两条基准都要求智能体与环境多轮交互,奖励只在任务结束时给出,正是长程稀疏奖励的典型场景。
表1:ALFWorld和WebShop上的评估结果,每个RL训练方法报告三个随机种子的均值和标准差
表1展示Qwen2.5-1.5B和Qwen2.5-7B两种参数规模下的完整对比。在1.5B规模上,SAPO在ALFWorld综合成功率上达90.1%,对比PPO的54.4%和GRPO的72.8%,提升显著;在Clean和Heat两个子任务上甚至拿到100%成功率。在WebShop上,SAPO得分82.2也明显高于PPO的73.8和GRPO的75.8。大部分基线数据引自Feng等人的论文,属于标准化公开对比设置。
到了7B规模,SAPO面对的竞争更激烈,PPO(带评论家)和GRPO都已调得较好,但SAPO依然保持优势。论文摘要给出的总括数字是:相比PPO平均提升15.1个百分点,相比GRPO平均提升12.1个百分点。考虑到这是在只采样一条轨迹、不训练独立critic的条件下实现的,这个成绩单相当能说明问题。
在训练效率上,SAPO的结构优势转化成了实打实的运行时间节省。下图展示Qwen2.5-1.5B在ALFWorld上PPO和SAPO单次迭代的耗时分解对比,纵轴采用对数坐标:
图2:PPO和SAPO在ALFWorld上使用Qwen2.5-1.5B的每次迭代耗时分解,SAPO将每次迭代从451.2秒降至301.4秒,相比PPO减少33.2%
从图2可以看到,SAPO压根就没有value-model和critic-update这两个模块,核心里就是把critic的前向、反向和训练状态整个省掉了。每次迭代从451.2秒降到301.4秒,降幅33.2%。对于需要跑几万步迭代的大规模训练来说,这个时间节约非常可观。
为什么SAPO能涨这么多?结合方法设计,关键原因有三点。第一,显式状态价值提供轨迹间泛化——同样一个状态在不同任务实例里出现时,价值函数能共享知识,这是组相对方法不具备的。第二,turn级GAE优势让每一轮交互都有独立学习信号,即使整条轨迹最终失败,中间那些“本可以做得更好”的轮次照样能获得梯度。第三,批量归一化保证不同长度响应的优势尺度一致,长轨迹训练时优势方差不被个别超长响应主导,优化更平稳。

局限与展望:SAPO的边界在哪里?

SAPO的巧妙之处在于用两个特殊token的logits之差编码连续价值。但这也带来潜在问题:价值读数的表达能力受限于单点logits差值,对于回报分布特别复杂或动态范围特别大的任务,这种标量读数容量可能不够。论文实验任务回报基本在[-1, 1]范围内,换到回报范围更大的场景,价值基座拟合压力会明显上升。
另一个有待观察的点是价值初始化。SAPO复用预训练语言模型的token logits作为价值读数起点,而预训练时这两个token并没有被赋予“价值”语义,初始价值读数很可能偏离真实回报范围。论文没有详细分析价值初始化对训练稳定性的影响,实际复现时可能需要额外调参。此外,大部分基线数据引自Feng等人的论文,虽然属于公开标准对比,但若能用自己的复现结果再补一组对照,说服力会更强。
展望未来,SAPO打开了一个值得深入探索的方向:自回归模型token级价值读数的设计空间还很大。比如,能否用一组token的输出分布编码更丰富的价值分布而不只是期望值?能否把这种因果边界价值读数扩展到多步规划或模型预测控制?能否在更大规模模型上验证这种共享参数actor-critic的稳定性边界?这些都是值得后续研究者接着往下挖的问题。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对智能体强化学习中GRPO无值函数、信用分配弱和采样开销大的问题,厦门大学与南洋理工提出SAPO,在单条轨迹内用共享自回归网络同时输出策略与价值,ALFWorld和WebShop上平均超越PPO和GRPO达15.1和12.1个百
这篇工作最值得看的点是什么?SAPO在ALFWorld和WebShop上均优于PPO和GRPO,在Qwen2.5-1.5B上ALFWorld总体成功率90.1%(比PPO高35.7个百分点,比GRPO高17.3个百分点),在Qwen2.5-7B上达到94.0%的ALFWorld成功率和88.6的WebShop得分,同时减少33.2%运行时间。
这篇工作的边界或风险在哪里?优点:(1) 创新性地将actor-critic学习与自回归生成结构对齐,在单一模型中同时表示策略和价值函数;(2) 消除了独立critic模型的内存开销和组相对采样的计算成本;(3) 通过GAE和SARSA目标的结合实现了显式的时序信用分配;(4) 实验证明在多个基准上优于现有方法。缺点:(1) 保留两个词汇作为价值基底的策略可能影响模型原有词汇分布;(2) 价值函数范围受限于R_max的预设;(3) 在极端长轨迹任务上的表现尚未验证;(4) 与最新方法GiGPO相比优势不够显著。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种单次采样自回归策略优化框架,利用因果语言模型的自回归结构在单一backbone上同时表示策略、状态价值和动作价值,通过因果边界读取实现无需独立critic和组相对采样的显式时序信用分配。

实验合理度:★★★★☆

ALFWorld任务成功率(按6个类别分别统计及总体),WebShop得分和成功率

学术研究价值:★★★★☆

提出一种单次采样自回归策略优化框架,利用因果语言模型的自回归结构在单一backbone上同时表示策略、状态价值和动作价值,通过因果边界读取实现无需独立critic和组相对采样的显式时序信用分配;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

相比PPO减少33.2%的每迭代运行时间(从451.2s降至301.4s),消除了独立critic模型的前向/反向传播及其训练状态的内存开销。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 保留两个词汇作为价值基底的策略可能影响模型原有词汇分布;

主要参考文献

[1] Liang D, Feng L, An B, et al. SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning. arXiv preprint arXiv:2608.19842, 2026.
[2] Schulman J, Wolski F, Dhariwal P, et al. Proximal Policy Optimization Algorithms. arXiv preprint arXiv:1707.06347, 2017.
[3] Shao Z, Wang P, Zhu Q, et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv preprint arXiv:2402.03300, 2024.
[4] Yu F, et al. Feng et al. Agentic RL baseline evaluation results. (原文引用来源, 详细出处见论文参考文献[4])

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球