← 返回 PaperDaily
大模型与智能体
还在用GRPO?当90%动作都是“摸鱼”,信噪比还不如随机乱猜!
训练多轮智能体时,GRPO等无评判器方法常常在长序列任务中“失灵”,大家都以为是“长程信度分配”的锅。但龙哥今天带来的这篇工作却一针见血地指出:罪魁祸首是“例行公事”太多!论文首次定义了“决策密度”这个量化指标,并完美推导验证了其与训练信噪比之间的幂律关系。啃完这篇,你对强化学习训练效率的理解会上一个台阶。
龙哥读论文
发布于 2026-08-16 00:20:05
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 训练多轮智能体时,GRPO等无评判器方法常常在长序列任务中“失灵”,大家都以为是“长程信度分配”的锅。但龙哥今天带来的这篇工作却一针见血地指出:罪魁祸首是“例行公事”太多!论文首次定义了“决策密度”这个量化指标,并完美推导验证了其与训练信噪比之间的幂律关系。啃完这篇,你对强化学习训练效率的理解会上一个台阶。
原论文信息如下:
今天咱们聊一个特别接地气,但又极其重要的AI训练话题。相信很多搞强化学习、做大模型的朋友都有这种感觉:当你训练一个多轮对话的智能体(比如编程助手、客服机器人)时,明明总奖励(Return)还不错,但用GRPO 这类方法去训练,效果就是上不去,收敛得贼慢,甚至还不如随机乱选。
很多人第一反应肯定是:“这还用问?长序列任务(Long Horizon)嘛,信用分配(Credit Assignment)太难了!” 觉得是序列太长,导致反馈信号传不回来。
但今天这篇发表在2026年6月的论文,直接给这种“传统认知”来了一记响亮的耳光!它一针见血地指出:锅不在“长”,而在“水” !
什么意思?就是说,你的智能体在大部分时间里,都在干一些“例行公事”的活儿——比如编程助手去“运行测试用例”,比如机器人导航去“直走”几步。这些操作虽然必不可少,但它们对最终的成败往往没什么决定性的影响。正是这些“水货”操作,像往咖啡里掺水一样,把你珍贵的训练信号给“稀释”了!
常规操作如何“稀释”了你的智能体?——多轮训练中的“信号稀释”机理
要理解“信号稀释”,咱们得先搞清楚两个关键角色:关键动作 和例行公事 。
举个例子,你让一个AI编程助手去修一个Bug。整个过程可以分为几个步骤:
关键动作: 比如,它需要判断“Bug到底在解析器里,还是在优化器里?”,然后决定“好了,我要去修复解析器”。这一步一旦选错,后面再怎么努力都是白搭,所以对最终的结果有决定性影响,被称为“关键状态 ”。
例行公事: 在决定了修复解析器之后,它要做一系列操作:比如“打开项目文件”、“定位到解析器代码”、“修改一个变量名”、“运行测试用例”。这些操作虽然必要,但无论你选择“运行全部测试”还是“只运行关联测试”,对最终能否修好Bug这个结果的影响微乎其微。这些状态就是“例行状态 ”。
现在问题来了,当我们用GRPO (Group Relative Policy Optimization ,组相对策略优化,一种无值函数的策略梯度算法)这类轨迹级(Trajectory-level) 方法进行训练时,整个序列只会得到一个整体的奖励分数(比如修好Bug得1分,没修好得0分)。然后,这个单一的分数会被“平均”地分配给轨迹里的每一个步骤。
论文里把这种轨迹级梯度估计器的梯度,拆成了两部分:
其中,关键项 承载着真正的学习信号,而例行项 就是那个“水货”。论文的命题3.1 (例行信号消失命题),用数学证明了这点:
这个公式的意思是: 这个“例行项”在整个训练集上的期望(平均值) 确实是0,它不会给出错误的方向指导。但是!在每一次训练迭代 中,这个“例行项”却会带来巨大的方差(波动) 。这就好比一个射击教练,告诉你要往左边偏一点,但每次下达指令时,声音里都混杂着巨大的噪音,你根本听不清该往左还是往右。
这就是“信号稀释”的机理: 例行公事般的操作,在不贡献任何有效学习信号的同时,却注入了大量无用的噪声,导致低信噪比(SNR, Signal-to-Noise Ratio)。
那有没有更好的办法呢? 当然有!比如PPO (Proximal Policy Optimization ,近端策略优化)这类回合级(Turn-level) 方法。它需要一个额外的价值函数(Critic) 来为每一个步骤计算一个单独的优势值。
差异就在这!在一个“例行状态”下,价值函数能精准地识别出“无论选哪个动作,结果都差不多”,因此它会给出零优势值 。像下面这个完美估计器的公式所示,它在例行态上点对点地就把噪声给清除了:
什么是“决策密度”?——一个量化学习信号的关键变量
既然问题出在“例行公事”上,那我们就需要一个指标来衡量“例行公事”的比例有多高。论文作者很聪明地提出了一个非常优雅的量化指标,叫做决策密度(Decision Density, ρ) 。
决策密度 ρ = 关键状态的数量 / 整条轨迹的总长度(T)
ρ = 1 :意味着轨迹中的每一步都是关键决策,没有任何“水”动作。智能体在一直在做选择。比如一个猜数字游戏,每一步都在问“大了还是小了?”,每一步都影响结果。
ρ → 0 :意味着轨迹极其冗长,99%的动作都是例行公事。比如一个机器人从A点走到B点,中间有10000步“直走”,只有最后一步“打开门”是关键的。
有了这个ρ,作者就能精确地量化“信号稀释”问题的严重程度了。
证据说话:受控实验完美验证ρ^{-1/2}定律
光有理论哪行?为了验证这个猜想,作者设计了一个非常巧妙的实验环境——稀释之门(Diluted Doors) 。
这个环境就像一个有N层楼的游戏。每层楼你都得从几扇门中选择一扇正确的(这是关键决策)。但更关键的是,在每次选择门的动作之后,作者可以随意插入0到50个“例行步骤”,比如让你在走廊里漫无目的地走几步。这样,他们就能精确控制决策密度ρ!
在第一个实验中,他们测量并比较了两种梯度估计器(回合级 vs 轨迹级)的信噪比(SNR) 。
论文从数学上推导出,在完美Critic的设定下,回合级SNR对轨迹级SNR的比值,会随着决策密度ρ的减少而呈ρ^{-1/2} 的幂律增长:
看这图!(左图)数据点完美地落在理论预测的线上,拟合得到的指数α = -0.5084,与理论值-0.5相比,误差不到0.01!拟合优度R²达到了惊人的0.9994 !这意味着SNR比值每下降50倍(ρ从1/1变成1/51),回合级方法对轨迹级方法的信噪比优势就暴增17.41倍 !
在第二个实验中,他们直接比了“训练步数加速比”(即轨迹级方法需要多少步才能达到回合级方法的目标)。结果依然是ρ越小,加速效果越明显。当ρ=1/51时,轨迹级方法需要多花一倍 的训练步数才能追上回合级方法的效果!
这个实验结果直接证明了:导致多轮Agent训练变慢的元凶,不是“长”,而是“水” 。决策密度ρ,而非单纯的轨迹长度,才是那个决定性的变量。
当批评家不完美时:理论如何扩展?
看到这里,大家可能会想:“那PPO这类回合级方法就是无敌的了?直接无脑用PPO不就行了?”
现实是残酷的。理论上完美的价值函数(Critic) 几乎不可能训练出来。训练一个靠谱的Critic比训练策略本身还贵,它会让模型参数量翻倍,而且在复杂场景下很容易学偏。论文把这个现实情况称为“不完美Critic” 。
那在不完美Critic场景下,咱们的理论还成立吗?论文给出了一个更广义的标度定律。如果Critic的误差方差用σ²表示,那么信噪比的增长将受限于一个更复杂的公式:
这条公式太有洞察力了!它告诉我们一个关键的“权衡法则” :
当Critic误差很小(σ² ≪ ρ): 也就是说,你的Critic训练得足够好时,它就能精确地识别出例行步骤,剔除噪声,完美复现ρ^{-1/2}的优势。
当Critic误差很大(σ² ≫ ρ): 也就是说,你的Critic本身就是个“水货”,它在例行步骤上给出的评论也是充满噪声的。那么,回合级方法的优势就会大打折扣,信噪比优势会被一个与ρ无关的常数(1/σ)所限制。这时候,用CRPO反而可能更省事!
这条法则完美指导了实践:你Critic的能力,决定了你能否享受决策密度带来的红利 。
对实践者的启示:何时该用回合级?何时轨迹级就够了?
好了,理论讲完了,实验也看爽了。那这对咱们这些在AI领域搬砖的打工人,到底有啥用呢?龙哥给你总结成几条“黄金法则”:
法则一:先诊断,再治疗。 训练你的多轮Agent前,先花点时间去分析一下你的任务环境。估算一下决策密度ρ 。你可以随机采样一些轨迹,手动或者半自动地标注哪些是“关键动作”,哪些是“例行公事”。如果ρ > 0.5,恭喜你,用GRPO就能很快收敛;如果ρ < 0.1,那你得小心了,GRPO很可能让你原地打转。
法则二:给Critic算笔账。 当你发现ρ很低,决定上PPO等回合级方法时,你需要评估一下“训练一个靠谱Critic的成本” vs “多花几倍时间训练GRPO的成本”。如果Critic太难训练,或者你模型本来就小,那么它的误差σ²会很大。这时候,根据新定律,Critic带来的优势被其自身噪声抵消,用GRPO反而可能是更务实的选择。
法则三:考虑“降噪”或“提纯”。 论文给出了一个理论上限。在实际应用中,你可以尝试通过一些工程手段来提高有效信噪比。比如,在训练GRPO时,是否可以通过对奖励进行加权,来突出关键步骤的贡献?或者直接对轨迹进行裁剪,把明显的例行步骤直接去掉?这些方法虽然没有被论文验证,但理论给它们提供了很好的实验动机。
龙迷三问
什么是决策密度 ρ? 决策密度ρ是论文中提出的核心概念,用于量化一个多步任务中“真正重要的决策”的密度。它等于一条轨迹中关键状态的数量除以总步数。ρ越接近1,说明任务步步惊心,全是关键选择;ρ越接近0,说明任务中充斥着大量对结果没有影响的例行公事。
信号稀释机制具体是什么意思? 信号稀释指的是一种现象:当使用GRPO这类轨迹级方法训练多轮智能体时,那些“例行公事”的操作(例行状态)虽然期望上的梯度贡献为零,但在每次更新时会产生巨大的方差噪声。这些噪声“稀释”了来自关键决策的有效学习信号,导致信噪比下降,训练变慢。
多轮智能体训练中常用的算法有哪些? 常用的算法大致可分为两类:一类是无值函数(Critic-free)的轨迹级方法,以GRPO(Group Relative Policy Optimization)为代表,它通过比较同一个组内不同轨迹的优劣来计算优势,省去了训练价值函数的开销;另一类是有值函数的回合级方法,以PPO(Proximal Policy Optimization)为代表,它需要训练一个价值函数来为每一步计算精确的优势值,训练成本更高但理论上信用分配更精确。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
可能的问题: 论文的数学证明建立在部分理想假设上(如完美例行状态),其真实任务中的近似程度尚需验证。环境“稀释之门”牺牲了复杂任务的部分特性去验证理论,实验的精妙与结果的清晰让人佩服,也让人更期待在真实Agent任务上的表现。
主要参考文献
[1] Yann Pernot, Vi Retault. Drowning in Routine: Signal Dilution in Multi-Turn Agent Training. arXiv:2606.22164v1, 2026.
[2] Shao, Z., et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning with Open Language Models. arXiv:2402.03300, 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
训练智能体总感觉“雷声大雨点小”?问题可能出在那些看似无关紧要的“例行公事”上!想和龙哥一起深入探讨强化学习的信噪比玄机,掌握训练效率翻倍的关键吗?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 多轮agent+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:大模型及智能体、图像处理、自动驾驶及机器人、AI医疗及AI金融5个群