← 返回 PaperDaily 前沿研究

腾讯混元与宾大推理模型训练新作:FlowBalance让自我指导听从验证器

论文基本信息 原文标题: FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience 首次公开: 2026 年 9 月 3 日 主要署名单位: 腾讯混元与宾夕法尼亚大学 具体领域: 推理模型训练 核心亮点: FlowBalance让自我指导听从验证器

腾讯混元与宾大推理模型训练新作:FlowBalance让自我指导听从验证器

论文基本信息

原文标题:FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
首次公开:2026 年 9 月 3 日
主要署名单位:腾讯混元与宾夕法尼亚大学
具体领域:推理模型训练
核心亮点:FlowBalance让自我指导听从验证器
许可:CC BY 4.0
原论文:https://arxiv.org/abs/2609.03241
代码:https://github.com/alexhuang13/FlowBalance
项目页:https://alexhuang13.github.io/FlowBalance-Blog/

龙哥导读

一个推理模型拿着参考解回看自己的答案,很容易变成“越复盘越觉得自己有道理”。FlowBalance最值得看的地方,是让这种密集自信先过验证器这一关:答对就顺着教,答错就反着教,没有组内胜负就干脆闭嘴。

先看进展。到第 180 步,FlowBalance在 Qwen3-4B 与 Qwen3-8B 上的五项数学基准平均分分别达到 64.26 与 67.61;同属轨迹平衡路线的 FlowRL 分别为 63.22 与 65.85。Qwen3-8B 达到 0.5 AIME24 验证准确率约需 100 步,而 GRPO 约需 143 步,相当于把抵达同一门槛的更新次数缩短到约七成。

数字背后的矛盾比数字本身更重要。最终答案验证器可靠,却只能在一条长推理结束时给出稀疏的对错;同一个模型若在训练时额外看到参考解或反馈,则可以对每个 token 给出密集判断,但它也可能非常自信地偏爱一条最终错误的轨迹。直接跟随这种自我指导,不是在学习错误那么简单,而是在把错误加工成更高置信度的下一轮监督。

FlowBalance主实验结果

图1|论文 Table 1 官方裁图。两种 Qwen3 骨干、五种训练方法在五项数学基准上的第 180 步结果;AIME24 使用 Pass@16,其余使用 Pass@1,数值为五个种子的均值与样本标准差。来源:FlowBalance 论文,CC BY 4.0。

01 问题不在“有没有自我指导”,而在谁掌方向盘

推理模型后训练常见两类信号。RLVR依赖可验证奖励:数学答案能否匹配、代码能否通过测试、约束是否满足,结果通常清楚,但数百乃至数千个 token 最后只换来一个终局分数。组相对策略优化可以比较同题多条回答,却仍然把一份轨迹级结果摊到整段决策上,途中哪一步真正有价值并不明确。

另一类信号来自 privileged hindsight,也就是“特权后见视角”。模型先在看不到参考信息的条件下独立作答,之后冻结的同策略副本拿到参考解或任务反馈,再给已经生成的每个 token 重新打分。它不需要更大的外部教师,也不额外生成替代答案,因此便宜、稠密,还与当前策略的分布贴得很近。

麻烦也恰恰来自“同一个模型”。参考上下文会让某些看似顺畅的局部表达概率上升,即便这条回答最后没通过验证;若把这些 token 分数直接当模仿目标,错误轨迹会借模型自己的口给自己背书。FlowBalance的核心判断是:密集信号适合补细节,但没有资格单独决定更新方向。

02 Figure 1 的五阶段闭环:先经历,再裁决,最后学分布

FlowBalance不是在原有强化学习损失旁边再挂一条蒸馏损失,而是把整组 on-policy 经验转换成一个“下一版策略应该拟合什么完整回答分布”的目标。Figure 1 把这个过程画成五阶段闭环,每一阶段都只处理一种职责,避免可靠但稀疏的结果信号与丰富但可能失真的局部信号互相抢方向盘。

FlowBalance五阶段方法流水线

图2|论文 Figure 1 官方裁图。流程依次为当前策略产生 on-policy 回答组、验证器给出结果反馈、冻结的同策略特权视角对已采样 token 评分、符号门控校准方向、profiled trajectory balance 拟合归一化完整回答分布。来源:FlowBalance 论文,CC BY 4.0。

阶段一:生成同题回答组。每轮训练开始时,把当前参数快照冻结为 rollout policy;对一个题目 x,从这个策略采样 N 条完整响应 y(1)…y(N)。它们都来自当前模型真实会走到的分布,而不是离线教师预先准备的标准轨迹,所以更新针对的是模型眼下正在犯的错、正在尝试的路。

阶段二:验证器给出二值结果,并计算组相对优势。数学任务里,规则验证器依据最终答案产生奖励 R;随后用组内均值 μ 和标准差 σ 标准化,得到 Ai=(Ri−μ)/(σ+ε)。A 不是“绝对有多好”,而是这条回答相对同题伙伴更好还是更差;奖励、统计量和优势都停止梯度。

阶段三:冻结的同策略用特权后见信息评分。同一个冻结快照此时额外看到训练专用上下文 c,例如参考解或任务反馈,只对第一阶段已经采样的 token 计算概率,不重采样、不改写答案,也不接收梯度。部署和评测时,正式策略既看不到 c,也不存在这条 hindsight 分支,因此它是训练脚手架,不是推理外挂。

阶段四:把 token 增益聚合成轨迹增益,再由优势符号门控。每个 token 在特权视角下相对固定参考策略的对数概率变化先被裁剪,再按整条响应取平均,得到 GH。若 A>0,保留 GH;若 A<0,反转 GH;若 A=0,密集指导归零。于是相同的“高自信”在成功轨迹上是加分,在失败轨迹上反而成为纠偏力量。

阶段五:构造能量与归一化目标,再用 profiled trajectory balance 拟合。验证器优势和门控后的自指导合成完整轨迹能量,指数重加权固定参考策略;每个 rollout group 估计一个配分函数,把未归一化偏好变成概率分布。训练只通过完整响应的轨迹平衡残差更新 πθ,没有另一项逐 token 模仿损失。

03 三组公式,把“自信”变成受约束的能量

第一组公式处理局部信息。对第 t 个已采样 token,论文定义 δtH=clip(log πH−log πref,−B,B):πH是看到训练专用上下文的冻结视角,πref是固定初始参考策略,B 防止少数极端概率比支配训练。随后 GH=(1/T)ΣδtH,用长度平均把整条轨迹压成一个可比较的密集特征。

这里的“平均”很关键。若直接求和,长响应天然积累更大绝对值,指导强弱就容易混入长度效应;平均后,GH更接近“这条轨迹里的 token 整体被特权视角提高或降低了多少”。但它仍然只是模型内部判断,不等于正确性,也不能替代外部验证器。

FlowBalance 的轨迹能量

E(y)=ηAA(y)+βGGH(y)·sgn(A(y))

第二组公式决定方向。ηA控制验证器优势的权重,βG控制自指导强度,sgn(A)则是整篇论文最醒目的开关:正优势乘 +1,负优势乘 −1,零优势乘 0。举个直觉例子,同样有 GH=0.4 的两条回答,一条验证通过、一条验证失败;不门控会给两条都加能量,门控后失败轨迹的这 0.4 变成减分。

论文进一步证明,在一条验证成功轨迹与一条被拒轨迹的概率比中,符号门控相对无门控会多出 exp(2βGGH(y−)/τ) 的修正因子。这意味着“错误答案上的正自信”不只是被忽略,而会被精确转换成偏向已验证成功轨迹的相对校正。不过这是目标分布层面的性质,不是对任意神经网络优化器全局收敛的保证。

参考策略支持下的归一化目标

p*(y) ∝ πref(y)·exp(E(y)/τ)

第三组公式回答“最终学什么”。πref限定支持并抑制策略漂移,能量 E 决定组内回答的相对偏好,温度 τ 决定重加权有多尖锐,配分函数 Z 则让所有完整回答概率重新归一。它不是看到某个 token 好就局部推高,而是要求整条回答在一个概率守恒的分布里重新排位。

轨迹平衡残差可写成 ΔTB=τlogZ+τlog(πθ(y)/πref(y))−E(y)。残差为零时,两条回答的概率比只由参考概率比与能量差决定;共同的 logZ 会在两两比较中抵消。因此 profiled Z 只吸收组内公共偏移,不会抹掉 N 条回答所携带的 N−1 个相对对比。

04 Profiled trajectory balance 到底“profile”了什么

FlowBalance不再训练额外网络预测配分函数,而是在每个 rollout group 内直接估计:每条响应由能量与当前策略相对参考策略的概率比反推出一个 logZ 候选,组内取平均并停止梯度。它相当于当场消掉组级公共截距,同时保留所有相对对比。

理论上,这一目标是在达到既定复合能量水平时,相对参考策略的最小 reverse-KL 位移。直觉上,它不是把最高奖励轨迹硬推成唯一答案,而是在参考分布上保守倾斜,继续回答“多个正确答案怎样分概率”。

05 一段伪代码,看清决定性分支

根据论文方法整理的伪代码

    输入:题目与训练专用上下文 (x, c),策略 πθ,固定参考 πref
    每轮训练:
        冻结当前策略为 πroll,并从 πroll 为 x 采样 N 条完整回答
        用二值验证器计算奖励 R,再得到组相对优势 A
        对每条已采样回答 y:
            用冻结的同策略特权视角 πH(·|x,c,y<t) 重评原 token
            δt = clip(log πH(yt) - log πref(yt), -B, B)
            GH = mean_t(δt)
            if A > 0: guided_gain = +GH
            if A < 0: guided_gain = -GH
            if A = 0: guided_gain = 0
            E = ηA·A + βG·guided_gain
        由组内回答估计一个停止梯度的 logZ
        最小化完整回答的 trajectory-balance 残差平方
    输出:更新后的策略 πθ

    伪代码真正决定方法身份的不是“多算一次 log probability”,而是三个约束同时出现:评分对象必须是当前策略已生成的轨迹,特权视角必须冻结且只在训练时存在,自指导必须经过优势符号门控后进入完整轨迹能量。少掉任何一个,方法都会滑向离线教师模仿、局部 token 蒸馏或无验证器的自我确认。

    恍然大悟

    06 Table 1:优势不是只押中一张卷子

    主表统一在第 180 步报告五个种子的均值与样本标准差。AIME24采用 Pass@16,强调多次采样中能否至少找到一条正确路径;HMMT25、Minerva、MATH500 与 OlympiadBench采用 Pass@1,更接近一次作答准确率。五项均值是不加权平均,因此不能把 AIME24 的多样采样收益偷换成所有任务都同样提升。

    Qwen3-4B 上,五种方法的平均分依次为 62.31、54.12、59.55、63.22、64.26。FlowBalance逐项为 80.00、32.00、50.51、93.28、65.49;它在四项上超过 GRPO,但 Minerva 低于 FlowRL 的 51.99,因此“所有项目都第一”只适用于 8B。

    Qwen3-8B 上,FlowBalance逐项达到 89.33、34.67、53.68、93.52、66.85,五项平均 67.61;对应 FlowRL 是 86.67、30.67、52.79、92.92、66.20,平均 65.85。它在这一骨干的五个列均取得最高均值,相对 GRPO、RLSD 与 FlowRL 的平均分分别高 2.12、3.49 与 1.76 个百分点。

    最有解释力的对照是 FlowRL:两者都学习完整轨迹分布,差别主要在 FlowBalance把经过验证器校准的密集自指导加入能量。因此 4B 的 1.04 分和 8B 的 1.76 分平均增益,比单独拿它和普通策略梯度比较,更能指向新增机制的价值。

    07 训练曲线的转折:更快到门槛,还要看之后会不会掉

    Qwen3-8B 的动态曲线给出了比终点表格更多的信息。FlowBalance约在第 100 步达到 0.5 AIME24 验证准确率,GRPO约在第 143 步达到;两者使用匹配的 rollout 与评测预算,所以这里比较的是达到门槛所需更新步数,而不是宣称墙钟时间也必然加速 1.43 倍。

    FlowBalance训练加速稳定性与响应长度曲线

    图3|论文 Figure 2 官方裁图。左图比较达到 AIME24 验证准确率门槛的更新速度,中图展示 400 步稳定性,右图比较 FlowBalance 与直接 OPSD 的响应长度;平滑曲线之外保留了逐步测量轨迹。来源:FlowBalance 论文,CC BY 4.0。

    第三条曲线是响应长度。直接 OPSD 很快坍缩成明显更短的回答,FlowBalance则维持较长推理轨迹;这与“特权教师可能压缩不确定性表达、过早结束推理”的解释一致。但长度在这里是故障诊断,不是因果证据:论文没有证明回答越长,准确率就一定越高。

    08 消融与多样性:自指导不是音量越大越好

    系数消融最直接地拆掉了“多加密集监督就能涨分”的简单故事。固定 ηA=15 时,βG从 1、2 增到 3,Qwen3-8B 五项平均从 67.61 降到 66.48,再降到 65.95;AIME24也从 89.33 降到 87.33 和 86.00,HMMT25从 34.67 降到 32.00 和 30.00。

    这说明符号门控解决的是方向错误,却没有让自指导变成无风险信号。β过大时,模型内部的局部偏好仍可能压过验证器所提供的稳健锚点,或者把目标分布推得过尖。反过来,固定 βG=1 时,ηA取 5、10、15 的平均分为 65.65、65.41、67.61,默认设置把更多权重留给验证器。

    多样性诊断则问了另一件事:涨分是否只是把一个成功模板磨得更尖?研究用 GPT-5.5 对 AIME24 完整轨迹做两阶段判断,先抽取数学表示与主要工具,再在匿名条件下聚类;正确轨迹的 Simpson 策略多样性为 FlowBalance 0.2194、RLSD 0.1456、GRPO 0.1017。这个指标可理解为随机抽两条正确轨迹时,它们采用不同语义策略的概率。

    案例里,不同不是换变量名或多写两行,而是 Cayley–Menger 行列式与隐藏 4×5×8 长方体嵌入这类数学对象层面的差异。结果支持“成功分布更宽”的判断,但范围必须说完整:只用了 seed 0、step 180 一个检查点,并由 GPT-5.5 单一 LLM judge 判定,不是多种子人工评审。

    09 放回技术谱系:FlowRL 管分布,Self-Distilled Reasoner 管密集指导

    FlowRL(https://arxiv.org/abs/2509.15207)的重要贡献,是把 LLM 推理训练从“只把概率推向最高奖励样本”转成奖励分布匹配:通过 trajectory balance 学习完整响应的归一化分布。它更关心终局奖励如何塑造多条轨迹的相对概率,因此天然适合保留不止一种高奖励解法,但能量仍主要来自 outcome-only 信号。

    FlowBalance继承分布式更新,却把能量从 outcome-only 推进到“验证器优势定方向、privileged hindsight补密集证据”。因此与 FlowRL 的对照,直接检验同一轨迹平衡家族里新增校准指导的价值。

    Self-Distilled Reasoner(https://arxiv.org/abs/2601.18734)代表另一条互补路线:利用模型自己的 on-policy 轨迹与更有信息的训练视角形成自蒸馏信号,让当前策略从自身经验里获得比终局奖励更密的指导。它抓住了长推理信用分配稀疏这一痛点,但密集教师判断可能错误、缩短推理或把策略收缩到局部模式。

    FlowBalance的桥接方式不是把两种损失简单相加,而是把自蒸馏信号降级为“定义轨迹能量的一个停止梯度特征”,再让验证器决定它的符号,最后统一交给归一化分布拟合。可以把它看成:拿 Self-Distilled Reasoner 类方法的密度,放进 FlowRL 类方法的分布容器,再加一道结果校准阀门。

    10 工程启示:适合什么任务,成本又藏在哪里

    最合适的落点,是同时具备三个条件的后训练任务:模型能产生多条 on-policy 候选;终局结果可以低歧义自动验证;训练阶段还能提供参考解、测试反馈或其他 privileged context。数学推理显然满足,带单元测试的代码生成、具有确定约束的规划、可模拟验收的结构化任务也具备方法上的相似性,但论文没有给出这些领域的实证数字。

    实现账本也不能只看样本效率。每轮既要生成回答组,又要让冻结快照在带上下文条件下重算已采样 token 的概率,还要计算参考策略概率与训练策略概率;相比只用验证器的 GRPO,前向评分和显存管理更复杂。论文报告的是达到准确率门槛的更新步数改善,并未给出覆盖所有硬件与实现的端到端训练成本结论。

    工程上最值得复用的是信号治理,而不是照抄超参数。内部模型评分可以便宜地提供密集线索,但必须记录其与可验证结果的冲突率;β与η应围绕验证可靠度、组内奖励方差和任务长度重新校准;当一组回答奖励完全相同、A=0 时,应允许密集分支不更新,而不是为了“充分利用算力”硬造偏好。

    11 四条边界:这还不是会自己找题的“自主进化”

    第一,大规模实验只覆盖数学推理。数学拥有清晰终局验证器、标准参考解和相对稳定的答案抽取,恰好是方法的舒适区。智能体、多模态交互、开放式写作或长程软件任务里的奖励噪声、状态变化与部分可观测性,可能让组相对优势和符号门控面对完全不同的误差结构。

    第二,响应长度只呈相关,不代表因果。直接 OPSD 的短回答坍缩与低准确率同时出现,FlowBalance保持较长轨迹并更稳定,但这不能推出“延长回答就能提升推理”。长度可能只是策略过早确定、探索减少或训练目标失衡的外在症状。

    第三,多样性证据是窄范围诊断。0.2194、0.1456、0.1017来自 AIME24 的一个种子、一个 step-180 检查点和 GPT-5.5 judge。虽然完整轨迹经过匿名两阶段聚类,且只在至少有两条正确回答的问题上统计,它仍不能替代多种子、人类专家或不同 judge 的稳定性验证。

    第四,它研究固定任务分布上的内循环,不会自主生成任务。题目来源与训练分布被固定,FlowBalance解决的是“已有题目和自生成经验怎样更新策略”,不是“下一轮该出什么题、如何筛题、如何形成课程”。把它接到任务生成或 Challenger–Solver 外循环是自然方向,但不属于当前已验证系统。

    12 龙哥点评:最值钱的不是新教师,而是给旧教师降权

    这篇工作最聪明的地方,是没有继续寻找一个更大、更贵、更像真理的外部教师。它承认当前模型在看到参考信息后确实能提供有用的局部判断,也承认这份判断会犯错;于是关键创新不是让“自我指导”说得更多,而是重新规定它在决策链里的职级。

    验证器像终审,密集指导像技术评议。技术评议可以说明某段推理为何顺、哪些 token 与参考证据更一致,但终审判错后,它不能继续替错误轨迹拉票。符号门控把这个组织原则写进能量函数,trajectory balance再把组织原则落实成完整回答之间的概率关系。

    真正的考验在数学之外。若验证器本身有系统性偏差,符号门控只会忠实执行错误裁决;若训练专用上下文质量不稳,密集分支可能持续制造噪声;若额外评分成本吃掉更新步数优势,平台侧收益也会缩水。FlowBalance给出的不是“模型可以放心自学”,而是更成熟的一句话:模型可以从自己身上学,但自信必须有外部结果约束。

    龙迷三问

    第一问:答错的轨迹为什么还值得评分,而不是直接丢掉?因为错误轨迹仍包含模型真实会走到的局部模式,完全丢弃会损失“哪些看似合理的步骤需要降权”的信息。FlowBalance通过负优势反转指导,把错误上的虚假自信转成相对纠偏,而不是把失败经验当空气。

    第二问:为什么不直接把验证器奖励与 token 蒸馏损失相加?两项局部损失相加不自动对应一个归一化完整回答分布,也可能让强密集梯度覆盖稀疏结果信号。FlowBalance先在轨迹级合成能量,再通过配分函数和 trajectory balance 统一拟合,让不同回答的相对概率有明确目标。

    第三问:β调大为什么反而降分?门控只能保证自指导服从结果方向,不能保证每个局部评分都精确。β从 1 增到 3 时,五项平均从 67.61 降至 65.95,说明模型内部证据适合当修饰项,不适合压过验证器成为主导项。

    总结

    FlowBalance把推理模型的自我改进拆成清楚的五步:当前策略生成回答组,验证器给二值结果与组相对优势,冻结的同策略特权视角为原 token 提供密集增益,优势符号决定保留、反转或关闭指导,最后用参考策略支持的能量目标与 profiled trajectory balance 学习完整回答分布。

    实验中,它把 Qwen3-4B 与 Qwen3-8B 的五基准平均推到 64.26 与 67.61,Qwen3-8B约 100 步达到 GRPO约 143 步才达到的 AIME24 验证门槛,并在受控诊断中显示更高正确策略多样性。这项工作的长期价值,可能不在某个数学榜单多出一两分,而在建立了一条通用训练纪律:密集自指导可以参与解释,但可验证结果必须掌握最终方向。

    本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。

    论文文字、方法图与实验裁图来源于 FlowBalance 官方论文,依 CC BY 4.0 许可使用并注明来源。本文为论文解读,不代表完成了本地代码执行或独立基准复现,技术结论与数值应以原论文为准。

    原论文:FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

    https://arxiv.org/abs/2609.03241

    https://github.com/alexhuang13/FlowBalance

    https://alexhuang13.github.io/FlowBalance-Blog/

    end
    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

    LONGGE AI COMMUNITY

    把每天读到的论文,变成长期积累

    加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

    加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

    龙哥读论文知识星球二维码 微信扫码加入知识星球