← 返回 PaperDaily 大模型与智能体

美团新框架SAF:1.7B到8B全系提升,几乎所有基准都在涨

图1:固定系数融合与SAF的对比。SAF分别针对OPD优势的幅度失配与时间失配设计独立控制机制,避免熵塌缩、保留探索能力,最终提升任务表现。

美团新框架SAF:1.7B到8B全系提升,几乎所有基准都在涨

美团SAF:GRPO与教师蒸馏简单相加为何翻车?四步融合全面涨点

图1:固定系数融合与SAF的对比
图1:固定系数融合与SAF的对比。SAF分别针对OPD优势的幅度失配与时间失配设计独立控制机制,避免熵塌缩、保留探索能力,最终提升任务表现。
龙哥导读:想象一下,一个教练只负责给你“整张试卷”打分,另一个教练则逐题甚至逐步骤给你抠细节。两个教练风格互补,合体教学总该带出高徒了吧?结果论文作者把俩信号直接相加,模型居然“心态崩了”——策略熵坍缩,成绩不升反降,简直像师兄师姐双管齐下训你,反而把你整不会了。这篇来自上海财经大学、美团LongCat团队、香港中文大学(深圳)和北京大学的工作,就是要解决这个“1+1反而小于2”的怪问题。

一个看似简单的“1+1”融合,为什么翻车了?

先弄清楚两个选手的名字。
第一个是可验证奖励强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)。这类方法用规则的、可验证的奖励(比如数学答案对不对、单元测试能不能过)来训练大模型。其中最典型的实现是组相对策略优化(Group Relative Policy Optimization,GRPO)。GRPO的玩法是:针对同一个问题,让模型采样一组回答,然后把这组回答的奖励做组内归一化,得到一个响应级的优势值。这个优势值是每个response只有一个标量,然后“广播”给该响应里每一个token——不管这个token是关键的解题步骤还是个“的”字,拿到的优势完全一样。
GRPO的优势在于信号可靠、自校准,因为奖励来自真实规则验证器;但缺点也很明显:太“粗颗粒度”——一条长推导里真正导致最终正确/错误的那一步,和其他所有token拿到同样的功劳,对难问题来说,这种粗粒度的反馈几乎给不出有效引导。
第二个选手是在线策略蒸馏(On-Policy Distillation,OPD)。OPD的思路是让一个更强的教师模型对每个token打分,计算教师与学生在该token上的对数概率差:
OPD优势公式
其中πT是教师策略,πθ是学生策略,si,t是第i条样本在第t个token之前的上下文。这个公式的含义很直白:教师给某个token的概率越高,而学生给的概率越低,这个token的优势就越大,学起来越“带劲”。因为它是逐token重新计算的,所以反馈非常稠密,能告诉模型到底是哪一步出了问题。
但OPD的软肋也很致命:它的优势纯粹是“跟老师对齐的程度”,并不关心老师自己是否真的做对了。如果老师本身菜,学生学得再像老师也只能考到老师的水平;而且由于没有可验证的奖励信号来引导探索,学生很容易被钉在教师分布上,失去自主探索追求更高分的能力。
看到这里大家自然会想:GRPO负责“外面”的终极目标,OPD负责“里面”的每一步路径,两者互补啊!加在一起不是完美吗?事实上,也确实有不少工作这么干:比如把两个优势都算出来,然后用一个固定的系数相加——GRPO的优势+OPD的优势,完事。
结果,论文作者把这个“固定系数相加”方案跑起来后发现问题大了:训练初期策略熵就迅速塌缩,并且保持低位。熵塌缩意味着模型很快就变成了“复读机”,只会模仿教师的高概率token,不再有探索新解法的欲望。最终准确率的天花板,比单独用GRPO或单独用OPD都要低。好好的“1+1>2”,变成了“1+1<1”,这谁能忍?
作者进一步诊断,发现翻车根源在于两个信号存在两重失配

幅度失配(Magnitude Mismatch)GRPO优势值经过组内归一化,是有界的、自校准的;而OPD优势值是逐token的无界对数概率差,重尾且波动极大。某些极端token的优势值可以比GRPO优势值大一个数量级,融合同一个梯度时,OPD直接把GRPO的信号彻底“淹没”了。

时间失配(Temporal Mismatch)OPD全强度注入的时间不对。训练早期一上来就全强度推着学生向教师靠拢,熵直接崩了,后续探索能力全无;训练后期学生已经把教师的“知识库”吸收得差不多了,依然全强度锚定教师,GRPO的探索奖励完全使不上劲,性能被教师这个“上限”死死压住。

这两重失配一个作用在token维度的“横向尺度”上,一个作用在训练进程的“纵向时间”上,完全不是靠调一个固定系数就能解决的。这就引出了SAF的出场。

SAF的“幅度控制”:把token级优势的野性关进笼子里

既然OPD优势无界且重尾,那就从两个环节来给它“上锁”:先稀疏化,再压缩。
Stage 1:Top-k%稀疏化。OPD优势的绝对值分布在0附近高度集中,只有极少数token拥有巨大的幅值。作者的做法是:对每一条序列i,先统计该序列所有token优势绝对值的(1-k%)分位数,记为τk(i),然后构造一个掩码,把优势绝对值低于该阈值的token直接归零,只保留前k%个“最有发言权”的token:
Top-k稀疏化掩码公式
这里的关键设计是阈值τk(i)按序列自适应地选取,而不是全局一刀切。每条序列有自己的优势分布,有的序列普遍低幅值、有的序列普遍高幅值,用全局阈值会导致长尾序列过曝、矮个子序列完全被滤掉。按序列分位数来,干净利落。
这一步就是把OPD信号从“全员参与”变成“关键token精英制”。那些幅值趋近于0的低显著性token本来对梯度也没什么贡献,滤掉它们能大幅减少噪声。当然,设置k=100时完全禁用过滤,保证一个可逆的开关。
Stage 2:有界tanh压缩。稀疏化只是去掉了“大多数小角色”,但幸存token里依然可能有巨幅异常值。作者用了一个很优雅的几何变换:
tanh压缩公式
c是一个可调系数。tanh把实数轴压到(-1,1),因此压缩后的信号被严格限定在(-c,c)范围内,无论压缩前的幅值有多夸张。更妙的是tanh在0附近近似线性,所以对于绝大多数中小幅值的token,它们的相对排序在压缩后几乎不变——小幅值之间还能保持有意义的区分度,只有那些冲击极限的异常值会被“削顶”。
两步叠加的效果就是:Stage 1决定“谁有资格发言”,Stage 2决定“每个幸存者能吼多大声”。从此,哪怕某个token的原始优势是GRPO优势的50倍,经过稀疏化压缩后,它对融合梯度的贡献也被控制在有限范围内。

SAF的“时间控制”:让教师信号该强则强,该退则退

幅度控制解决了“单个token不可一世”的问题,但还有另一个维度:训练早期和后期,教师信号的合理强度本来就该不一样。SAF为此设计了一个“预热-退火”机制。
Stage 3:KL触发的预热(KL-triggered Warm-up)。OPD信号不能一上来就满功率输出,需要一个从0开始线性爬坡的过程:
预热缩放公式
Swarmup是最大预热步数。但作者没有让它变成一个死板的定时器,而是监测一个在线估计的学生到教师的反向KL散度(KL散度可以粗略理解为两个概率分布之间的“距离”)。设预热开始时KL值为KL0,当前步的KL值为KLs,一旦满足:
KL触发早停公式
也就是说,学生的分布已经向教师的方向靠近了至少δ的比例,就提前结束预热,不必非要等到Swarmup步。这么做的好处是:不同模型和任务需要爬坡的时间差异很大,有的任务300步早就“毕业”了,有的任务100步还没缓过来。用KL下降这种观测指标来触发早停,比固定步数聪明得多。它也防止“过度模仿”:教师自己的能力不是无限的,一旦学生追平了教师能提供的有价值信息,继续全强度硬灌主要是在拟合教师的错误,有害无益。
Stage 4:剩余步数上的线性退火(Linear Annealing)。预热结束之后,OPD系数不能继续保持全强度,而应该随着训练进程逐步把控制权交还给GRPO。设总训练步数为S,预热结束步为sw,剩余步数R=S-sw,从sw开始记录局部步数ta,OPD系数按如下规则线性衰减:
当s < sw时,opd_coef = 1;当s ≥ sw时,opd_coef = cmin + (1 - cmin)·(1 - ta/R),其中cmin是一个较小的保底值(论文实验中直接设为0)。也就是说,退火结束时OPD贡献几乎归零,GRPO完整接管训练目标。如果KL触发了更早的预热结束,R会变大,衰减曲线变得更平缓。
这套“观测学生-教师距离来决定何时放手”的设计,本质上把教师从“永久型拐杖”变成了“阶段性脚手架”,需要时扶一把,能走路了就赶紧撤,让学生自己飞。

四阶段管道如何组装成一个可插拔的融合器?

四个阶段按顺序串联,得到最终的融合优势:
总体融合公式
GRPO优势原封不动,所有控制手段作用在OPD优势上。每个阶段都可以独立开关,禁用后等价于恒等变换;四个阶段全部禁用时,整个式子退化成原始的固定融合,所以SAF是严格意义上固定融合的泛化扩展。
图2:SAF整体架构
图2:SAF整体架构。SAF只修改OPD分支,经过四个阶段处理后再加到不变的GRPO优势上,用于策略梯度更新。
实践层面最吸引人的是它的“轻”:整个改动不引入任何新的模型、不新增辅助损失、不需要额外的前向传播。Stage 1只是每条序列算一个分位数;Stage 3只是存一个KL0标量;Stage 4只维护sw和ta两个计数器。可以说,SAF就是一个可以drop-in替换原GRPO+OPD融合逻辑的“四行代码级”组件,几乎零计算开销。

实验验证:从数学推理到代码生成,全面超越固定融合

SAF用GRPO作为RLVR实例,在Qwen3-1.7B/4B/8B三个规模的学生模型上(教师统一使用Qwen3-30B-A3B-Instruct-2507),覆盖数学推理(AIME24、AIME25、HMMT25二月/十一月)和代码生成(HumanEval+、MBPP+、LiveCodeBench)共七个基准。训练数据方面,数学用DeepMath中难度≥6的5.7万题,代码用25K题的Eurus-RL-Code数据集。
对比方法包括:未训练的Base、GRPO-only(去掉OPD)、OPD-only(去掉GRPO)、GRPO+OPD固定融合(作为基线)、以及SAF。主结果如下:
*表格超出部分左右可以滑动
方法 AIME-24 AIME-25 HMMT25-Feb HMMT25-Nov 数学平均 HumanEval+ MBPP+ LiveCodeBench 代码平均
教师:Qwen3-30B-A3B 73.65 61.98 43.85 57.81 59.32 82.93 78.31 45.00 68.75
学生:Qwen3-8B
Base 26.56 21.25 11.35 9.79 17.24 80.49 72.49 23.71 58.90
GRPO-only 61.15 49.06 28.65 37.50 44.09 81.10 72.22 28.85 60.72
OPD-only 59.58 50.52 27.60 40.73 44.61 84.15 71.96 33.29 63.13
GRPO+OPD (fixed) 60.83 51.25 28.44 43.33 45.96 78.66 71.69 34.86 61.74
SAF (ours) 64.79 51.25 30.00 41.67 46.93 81.10 71.69 37.43 63.41
学生:Qwen3-4B
Base 23.02 21.88 11.67 9.17 16.44 79.27 63.49 24.57 55.78
GRPO-only 58.96 50.62 30.10 37.60 44.32 80.49 68.78 32.14 60.47
OPD-only 57.81 51.56 29.38 37.71 44.12 78.66 69.31 30.71 59.56
GRPO+OPD (fixed) 57.19 51.98 29.90 38.44 44.38 79.88 66.14 33.86 59.96
SAF (ours) 60.21 53.96 31.15 38.23 45.89 82.93 70.63 34.43 62.66
学生:Qwen3-1.7B
Base 12.81 10.83 5.94 3.54 8.28 60.98 54.23 15.14 43.45
GRPO-only 36.25 31.35 17.19 16.88 25.42 65.24 53.70 17.57 45.50
OPD-only 35.10 28.54 15.83 16.35 23.96 70.73 58.73 25.86 51.77
GRPO+OPD (fixed) 34.79 29.69 17.50 16.56 24.64 70.12 56.08 26.43 50.88
SAF (ours) 36.67 31.98 18.02 19.27 26.49 70.73 57.14 26.29 51.39
表1:数学推理与代码生成主结果。所有指标为准确率(%)。每个模型规模内和每一列中,最好结果加粗,第二好结果加下划线。
结果非常清晰:SAF在六个模型-领域组合上全部超过固定融合,数学平均提升0.97%~1.85%,代码平均提升0.51%~2.70%。六个组合的平均分上,SAF达到49.46%,比固定融合(47.92%)高出1.54个百分点,比GRPO-only高2.71%、比OPD-only高1.60%。
提升是广泛的,但不是每个基准都碾压。比如Qwen3-8B的MBPP+上SAF落后GRPO-only约0.53%,1.7B的代码平均上OPD-only(51.77%)略高于SAF(51.39%)。这说明SAF的定位并非“全场景无敌”,而是“在聚合层面持续优于简单粗暴的固定融合”,且比任何一个单独信号都更能稳定地提高上限。不过龙哥注意到,1.7B代码基准上OPD-only表现非常亮眼,这提示在小模型上,纯蒸馏带来的即时收益可能比复杂融合更直接。但OPD-only的数学平均只有23.96%,远低于SAF的26.49%,说明OPD-only的收益偏科,稳定性不足。
消融实验同样耐人寻味。作者以Qwen3-4B数学推理、300步训练为基准,逐步加入SAF的各个阶段:
*表格超出部分左右可以滑动
配置 AIME-24 AIME-25 HMMT25-Feb HMMT25-Nov 平均
GRPO+OPD (fixed) 57.19 51.98 29.90 38.44 44.38
+ top-k and tanh (固定权重) 58.75 50.94 30.10 37.60 44.35
+ warm-up (无退火) 58.96 51.46 29.69 36.15 44.07
+ annealing 59.27 52.60 31.25 37.81 45.23
SAF (δ=0.2,选定) 60.21 53.96 31.15 38.23 45.89
SAF (δ=0.3) 58.75 52.81 29.38 37.08 44.51
表2:Qwen3-4B数学推理在300步训练下的代表性SAF消融。
最有意思的发现是:只加幅度控制(top-k + tanh)时,成绩几乎没有变化(44.35%对44.38%),只加warm-up甚至略微下降(44.07%)。龙哥觉得这个结果太典型了——你只把噪声调小了,但你还是从头到尾全强度逼学生模仿老师,不过是“冷静地翻车”。直到把退火(annealing)加上,成绩才显著跳到45.23%。说明幅度控制是“必要条件但非充分条件”,真正的疗效来自于教师信号在后期被合理地撤下。
另一个微妙之处是δ从0.2增大到0.3时,成绩反而从45.89%掉到44.51%。δ越大,要求KL下降越多才结束预热,也就是教师满功率的时间越长。这表明学生很早就追平了教师的“有效信息量”,继续模仿教师只会把教师的错误也学过来。这也是SAF选择δ=0.2而非更大值的直接依据。
训练动态分析还揭示了一个直观现象:OPD优势绝对值的分布极度集中在0附近,但尾部的异常值幅值远超GRPO优势一个量级;而当GRPO优势本身是负值(比如-2.47)时,OPD优势的巨幅正值会直接逆转整体梯度方向,把学生向教师的方向猛拽。稀疏化+压缩恰好切断了这条“巨幅绑架”路径。同时,相比固定融合的熵一路走低,SAF训练中的策略熵始终维持在较高水平,保留了探索能力,最终精度上限也跟着被拉高。

总结与思考:多信号融合的通用配方

SAF这篇论文最有价值的贡献,可能不只是给GRPO+OPD配了个四阶段融合器,而是提出了一个更通用的观察角度:任何两个强化学习信号做融合时,都要同时考虑“幅度分布”和“时间调度”两个维度。一个信号有界、粗粒度,另一个无界、细粒度,简单相加必然出问题。
这种“稀疏化+有界压缩”做幅度校准、“KL触发预热+线性退火”做时间校准的配方,完全不依赖具体的奖励函数或模型结构,可以迁移到其他场景:例如多模态RL中视觉奖励与文本奖励的融合、LLM智能体场景中过程奖励与结果奖励的融合。对后续研究者而言,这是一个非常值得参考的模板。
当然,SAF也有它的局限性。它目前在1.7B-8B的模型上验证,最大模型只有8B,在30B以上的大规模模型上效果是否依然稳定尚待检验。另外δ和top-k%这两个超参对最终结果有明显影响,虽然作者给出了合理取值,但如何自动确定最优值仍然依赖更多经验。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问题1:什么是GRPO?什么是OPD?为什么说它们互补?GRPO是组相对策略优化,属于RLVR(可验证奖励强化学习)的一种主流实现。它针对一个问题的多个采样回答,用规则验证器打分后做组内归一化,得到整个response共用的一个标量优势值。OPD是在线策略蒸馏,用更强的教师模型对学生自己生成的每个token打分,计算教师与学生的对数概率差,提供逐token的稠密优势。GRPO可靠但粗糙,OPD稠密但受限于教师水平且没有可验证奖励引导探索,一个管“最终目标”、一个管“中间路径”,因此天然互补。

问题2:“熵塌缩”到底是什么现象?为什么会导致性能天花板被压低?熵塌缩指的是策略分布过早地变得极度尖锐,几乎只会输出教师的高概率token序列,随机性大幅下降。这在强化学习里意味着模型失去了探索新解题路径的能力,遇到一点偏离教师分布的正确解法就“不敢选”。训练后期教师本身犯错的地方也全盘接受了,最终精度被教师上限压死。固定系数融合中,OPD信号从第一步就满功率拽着学生向教师靠拢,所以熵快速塌缩。

问题3:SAF只修改OPD优势曲线,会不会让学生模型最后完全丢失教师的知识?不会。SAF的退火过程是将OPD系数从1线性降到cmin(实验中为0),也就是说训练后期教师信号确实几乎消失,但学生已经在前中期把教师的知识“内化”到了自身参数中。如果学生的能力已经足够强、甚至超过教师,继续依赖教师信号反而有害。退火就是相信学生能独立行走,GRPO在这时负责利用可验证奖励继续引导学生探索超越教师。这就是“扶上马,送一程,然后放手”

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

将固定系数融合的失败归因为“幅度失配+时间失配”两个独立维度,并分别设计轻量机制,诊断角度新颖,四阶段管道设计巧妙但不炫技。

实验合理度:★★★★✰

覆盖3种模型规模、7个基准和2个领域,有消融、训练动力学分析和超参敏感性验证,整体扎实。个别基准上提升不明显甚至略有回落,但作者如实报告,没有挑选结果。

学术研究价值:★★★★☆

提出了一个可复用的“信号校准+时间调度”分析范式,对后续多信号RL融合、RLHF与蒸馏结合的研究有明确启发价值。

稳定性:★★★★☆

训练熵曲线更健康、聚合成绩提升稳定,但δ和top-k%等超参在不同场景下仍需要重新调整,并非完全免调参。

适应性以及泛化能力:★★★★☆

在数学推理和代码生成两个领域、三种规模模型上都稳定超过固定融合,方法本身没有对任务做特殊定制。但尚未在更大规模模型、多模态或通用对话场景上验证。

硬件需求及成本:★★★★★

只在优势融合阶段做逐token的稀疏化和压缩,无额外模型、无额外损失、无额外前向计算,几乎零开销。

复现难度:★★★★✰

代码基于verl框架实现,改动集中在advantage融合层,结构简单;但KL在线估计和退火触发条件等细节需要细致实现才能完全复现结果。

产品化成熟度:★★★☆☆

可以直接嵌入现有GRPO+OPD训练链路,训练成本不增加,作为训练增强手段有落地潜力。但更大规模模型的效果和更多任务上的稳定性仍需进一步验证,更适合作为方法储备而非开箱即用的产品方案。

可能的问题:实验最大只到8B,缺少更大规模模型及多模态场景验证;KL触发的早停阈值δ对结果影响显著,论文虽给出了经验值但缺乏自动确定该值的机制;另外SAF四个阶段的可解释性较好,但“先稀疏化再压缩”的幅度控制思路比较工程化,理论分析可以更深入。


主要参考文献

[1] Shao Z, et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models, 2024.
[2] Guo D, et al. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, 2025.
[3] Agarwal R, et al. On-policy distillation of language models, 2024.
[4] MiMo Core Team. MiMo-V2-Flash: A multimodal reasoning model with on-policy distillation, 2026.
[5] 原文链接:https://arxiv.org/pdf/2607.29209v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
被SAF这波“四步修正”秀到了?想让大模型后训练少踩坑,欢迎加入龙哥读论文粉丝群,跟各路同行一起聊RLVR、在线蒸馏和更多新出炉的前沿方法~扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,等你来撩~
wechat_helper
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。