← 返回 PaperDaily 大模型与智能体

平均2.99轮省一半token 中山大学让大模型学会自判对错

大模型推理烧算力烧得肉疼,这篇中山大学的新工作偏要教模型“见好就收”。SVR让模型每轮输出答案时顺带自证对错+报置信度,自己决定要不要继续想下去,七大数学基准平均2.99轮就超过了固定10轮预算的效果,token直接省一半还多。

平均2.99轮省一半token 中山大学让大模型学会自判对错
原论文信息如下:
大模型做数学题,常常让人既爱又恨。爱的是它真能一步步推理,恨的是它不知道什么时候该停。明明第一轮就答对了,偏要硬着头皮再算九轮,不仅白白烧算力,还经常把正确答案改错。中山大学这项新研究,就是要教会大模型

“见好就收”,而且收手的时机还是模型自己定的。

测试时计算分配难题:多算无用、少算不够

随着大模型推理能力攀升,让模型在推理阶段多花点“思考”已经成为主流路线。测试时计算扩展(test-time compute scaling)的核心思路是:在推理时通过采样更多候选、做结构化搜索或者多轮迭代细化,换取更高的答题精度。一句话,算得越多,想得越深,答得越准。
但问题是,算力不应当平均分配。一道“1+1等于几”的送分题,犯不着让模型跑满十轮推理;而一道五步以上的竞赛题,只算一遍又大概率翻车。更闹心的是,多轮细化并不总是“多算多对”。已有研究发现,模型在后续轮次中完全可能把之前已经正确的答案覆盖掉——这种“有害修订”不仅白花时间,还直接拉低精度。
现有方法在这个问题上各自有短板。固定预算方法对每个输入分配相同的轮次,简单题浪费、难题不够用;自适应分配策略会在推理前给不同题目分配不同预算,但预判题目难度和实际上手做是两回事,随着解题过程推进,预算怎么调整就成了盲区;自校正方法主要研究怎么把错误的回答改对,但细化多少轮还是外部说了算;验证器引导的方法靠奖励模型、过程验证器或执行结果来指导修改,效果好是好,可真到部署时这些外部信号往往拿不到,或者贵得离谱。
这篇论文抛出的核心问题也很尖锐:模型能不能只靠自己的内部信号,既不依赖外部答案反馈,也不靠单独训练验证器,就学会什么时候保留当前答案、什么时候继续细化?SVR给出的答案是:能,信号就是模型自己生成的“判定+置信度”。

SVR核心机制:自验证信号如何当上“计算调度员”

SVR的全称是Self-Verifying Refinement,自验证细化。它把多轮细化重新建模成一个顺序的测试时计算分配问题。给定一个输入,策略πθ最多生成Tmax轮候选解答,每一轮都会产出一个结构化结果:ot = (rt, at, vt, ct)。其中rt是推理过程,at是任务答案,vt是判定(verdict),ct是置信度(confidence)。判定有三个取值:Correct(正确)、Incorrect(不正确)和Unsure(不确定)。置信度是一个0到1之间的实数,表示模型自认为当前答案正确的概率。
这两个信号合起来构成了推理时的停止规则。在没有达到最大预算Tmax之前,SVR严格控制停手条件:要求当前输出没有被截断、判定必须是Correct、置信度不低于部署阈值γ。哪怕有一条不满足,模型就得继续细化。停止时刻可以写成:
t̂γ = min({t ∈ {1, …, Tmax} : qt = 0, vt = C, ct ≥ γ} ∪ {Tmax})
式中的Tmax是最大预算,qt表示第t轮生成是否被截断(1为截断),vt=C表示判定为Correct,γ是部署时的置信度阈值,论文中取0.85。当且仅当输出完整、判定正确、置信度够高时,系统才返回当前答案;如果一直不满足,就跑到Tmax强制停。
这里有一个很关键的概念需要掰开揉碎讲清楚:论文里说的“oracle-free”(无预言机)。它不是指训练时完全不看正确答案——训练时当然要用真实正确性来构造奖励。它指的是推理时的信息边界:SVR在部署阶段不会访问任何外部正确性信号、参考答案、评估器得分或者执行结果。模型看到的提示只包含原始题目、当前答案草稿以及模型自己生成的自验证状态。这和常见的验证器引导方法有本质差异——那些方法在推理时还需要一个额外的奖励模型、执行环境或者专门的验证器,而SVR把“解题”和“自查”融进了同一个策略里。
另一个设计上的巧思在于提示的构建方式。SVR的每一轮提示只依赖原始问题、上一轮的答案草稿和最近一帧的自验证状态,不携带完整的交互历史。这相当于一个“一阶马尔可夫”上下文:既保证模型在长链条细化中不被无关历史干扰,又控制了token消耗的增长率。
图2:SVR固定视野训练与自适应推断概览
图2:SVR的训练与推断流程概览。(a)固定视野训练:每轮的求解、自验证和格式分数聚合成一条轨迹回报,策略梯度损失只作用在最终补全token上,真实正确性只用于构建奖励。(b)推断:当且仅当输出未截断、判定为Correct且置信度超过阈值时才停,否则继续细化直到预算耗尽。

联合判定−置信度强化学习:训练时如何把校准错误转化为分配错误

既然自验证信号要当“停止判官”,置信度与实际正确率是否对齐就成了生死线。语言模型本身存在明显的置信度校准问题——有的模型答错了还迷之自信,有的模型答对了却底气不足。而在SVR这套框架里,校准错误会直接演变成分配错误:过度自信会让模型在错题上提前交卷,自信不足则让模型反复折腾本来正确的答案,白白耗掉算力甚至把对的改错。
为此,论文提出了Joint Verdict–Confidence Reinforcement Learning,联合判定−置信度强化学习。训练时采用固定视野(fixed-horizon)的多轮轨迹τ=(o1,…,oTtr),无论中间判定如何,都必须完整跑完Ttr轮。整条轨迹的回报由三个互补的逐轮信号平均而成:
RSVR(τ) = (1/Ttr) · Σt=1Ttr [rsolve,t + rverify,t + λfmt·rfmt,t]
其中rsolve,t评估答案质量与跨轮改进,rverify,t训练自验证信号本身,rfmt,t约束输出格式,λfmt是格式项的权重系数。平均而非求和的设计,防止了回报值机械地随训练视野变长而膨胀。
先看答案质量项rsolve,t。它包含了绝对质量和跨轮进展两个子项。绝对质量奖励那些答对的轮次,但不奖励“把答案写短写错”的偷懒行为。跨轮进展项则比较相邻两轮的正确性变化:从错改对加分,保持正确也加分,正确变错误扣分,一错再错还是扣分。这个设计非常贴合实际推理过程——它让模型在“有用修正”和“破坏性改写”之间建立起清晰的偏好。
重头戏是自验证奖励项rverify,t,它可以拆成四项:
rverify,t = (1−qt)·[λcal·(1−(ct−yt)²) − λover·ct·I(vt=C ∧ yt=0) + λdetect·I(vt=I ∧ yt=0) + λready·ct·I(vt=C ∧ yt=1)]
第一项是Brier风格的校准分数,要求置信度ct贴近真实正确性yt,两者越接近得分越高。第二项专门惩罚“过度自信的错判”,当模型判定Correct但答案实际错误时,置信度越高惩罚越重——这正是要防止模型在错题上提前收工。第三项奖励“错误识别”,判定为Incorrect且确实答错时给正分,鼓励模型直面自己的错误。第四项是“停止就绪”奖励,答案正确时置信度越高越好,让正确解答有足够强的正面信号通过停止门。整个式子的开头的(1−qt)是一个屏蔽项:截断输出不可信,直接跳过自验证监督。
有意思的是,这四个项加起来,训练的并不是“如何准确描述不确定性”,而是“如何为停止决策提供可靠的控制信号”。模型光会报置信度数字不够,还必须在关键节点敢于说“我错了”,在正确的时候敢于说“我确定”。

固定视野训练+自适应推断:为什么这种分离是妙招

SVR在训练和推断时采用了刻意的不对称设计:训练阶段强制每条轨迹完整跑Ttr轮,禁止任何提前停止;部署阶段才启用判定−置信度门来做自适应终止。这个分离不是偷懒,而是整篇方法里最值得琢磨的一个设计决策。
想象一下,如果训练时就让模型按停止规则提前退出,会陷入一个恶性循环:刚开始策略的置信度完全不靠谱,第一轮就可能“自信满满”地停下来,于是模型根本没有机会经历后续细化中的状态——比如“发现自己错了并改正”“坚持己见结果发现原答案才是对的”。训练数据里缺少这些关键轨迹,自验证信号就永远学不准。强制固定视野等于逼着模型把细化路径完整走一遍,把各类中间状态都暴露在监督信号下,模型才能学会在不完美的中间节点上如何自评。
优化用的算法是GRPO(Group Relative Policy Optimization,组相对策略优化),由DeepSeekMath提出的一种强化学习算法。它不依赖额外训练一个价值网络来估计优势,而是对同一个输入采样的多条轨迹做组内归一化。具体地,每条轨迹计算上述回报后在组内标准化:
Ri = RSVR(τi),   Âi = (Ri − μR) / (σR + ε)
其中μR和σR是组内回报的均值与标准差,ε防止除零。策略梯度损失只应用到每条轨迹最终补全的生成token上。前两轮的输出不直接作为独立优化样本,而是通过决定后续提示和贡献轨迹回报来间接影响学习。这样每条轨迹对应一个组相对优化样本,多轮结构不会导致优化步骤数量爆炸。
训练与推断的分离还带来一个非常实用的效果:部署阈值γ完全不出现在训练目标中。这意味着一个训练好的模型,在服务端可以按需求平滑调节γ——想省算力就把γ调低,想求稳就把γ调高,不需要为每个γ重新训练。训练视野Ttr和推理预算Tmax也是两个完全独立的参数,论文中训练用3轮,推理给到最多10轮,互不绑死。更妙的是,训练和推理在信息边界上完全对齐:两者都不会把任何外部正确性信号塞进提示里,所见即所得。

实验结果:2.99轮超越10轮固定预算,token减半精度不减

实验设计用一句话概括:基座模型统一用Qwen3.5-2B,在Countdown、GSM8K和MATH三个训练集上分别训练领域专属策略。评估横跨七个基准:Countdown、GSM8K、MATH500、AIME26、AMC23、OlympiadBench和MinervaMath。其中MATH训练的模型直接在其他五个基准上做零样本泛化测试。ALL-7指七个基准的宏平均,Math-5指MATH训练模型所覆盖的五个基准的平均值。所有可训练方法统一跑一个epoch,采样数也做了对齐控制——单轮方法每组24个样本,多轮方法每组8条三轮轨迹,尽量保证“谁也没多吃多占”。
看结果表之前先交代一个重要细节:论文里专门加了一个“预言机引导参考”(oracle-guided reference)作为对比系统。它和SVR用相同的训练视野、上下文重置方式、草稿长度限制,唯一的区别是它在每轮后续提示中额外塞入了上一轮答案的评估分数——也就是推理时真的有“开卷”特权。但它固定的10轮预算没有自适应停止机制。这个对比测的是“完整系统”的优劣,而不是单纯比较反馈来源。
表1:七个推理基准上的最终答案精度对比
表1:七个推理基准上的最终答案精度。All-7是所有基准的宏平均,Math-5是MATH策略评估的五个基准的平均。加粗为最优,下划线为次优。
从表1可以看到,SVR在All-7上达到0.563,比原始backbone的0.420提升了14.3个百分点,比最强的无预言机多轮基线Murphy高出7.5个百分点,甚至比那个“开卷考试”的预言机引导参考还高出4.4个百分点。在Math-5上同样全面领先,达到0.458。七个基准中有六个SVR拿到了最优或次优,覆盖了算术搜索、小学应用题、竞赛数学和通用推理等多个赛道。
但精度领先只是故事的一半,真正的亮点是算力账。SVR在All-7上平均只需要2.99轮推理就能停手,在Math-5上是3.42轮,而所有固定预算多轮方法都是整整10轮。图1给出了更直观的对比:SVR每样例平均消耗8.56千token,不到GRPO-MT(20.85千)和Murphy(19.55千)的一半,甚至比号称精打细算的MLMT-RL(25.45千)少了一大截。那个预言机引导参考每样例也要消耗19.34千token。
图1:All-7上的精度和累计推理tokens对比
图1:All-7上代表性多轮细化方法的精度与累计推理token对比。固定预算方法执行十轮,预言机引导参考额外使用外部正确性反馈,SVR执行自适应停止。精度越高且token越少代表性能越好。
更有说服力的诊断实验来自“固定预算扫描”。论文在已经训练好的SVR策略上,强制所有样例都统一停在第1轮、第2轮或第3轮,结果没有任何单一固定轮次能匹配自适应停止的精度。这直接证明了SVR的性能优势来自按样例自适应决定何时停手,而不是单纯因为多跑了几轮。
另一个让人印象深刻的对比是跟多数投票的竞赛。GRPO策略采样10个独立解做多数投票,精度大约0.565;SVR的0.563已经基本打平,但token消耗只有一半左右。也就是说,用自验证停止来代替盲目采样聚合,可以用一半的推理预算换到同样的精度。这种效果放在线上推理服务里,省下来的就是真金白银的算力账单。
go I am not angry.jpg

局限性分析与未来方向:过早停止仍是最大短板

SVR最核心的风险,是它有可能“过于信任自己的判断”。虽然停止门已经相当保守——必须判定Correct并且置信度不低于0.85——但模型万一在错题上给出了高置信度的正面判定,就会提前交卷。论文用PSE(Premature Stop Error,过早停止误差)来度量这类错误,它仍然是整体精度损失的主要来源。从结果看,SVR在Countdown上拿了0.839,在AIME26这种高难竞赛题上只有0.200——竞赛题本来就容易引发过度自信,这条短板在难度曲线上会更加明显。
从任务覆盖来说,实验全部集中在数学推理领域。数学题有明确的正确答案和自动评估器,训练时能低成本地给每一轮的中间状态打标签。换到代码生成、工具调用、开放问答这类没有零成本自动判分器的任务,SVR的训练奖励构造会立刻变得棘手。这也是当前框架最大的适用性瓶颈。
展望未来,一个自然的方向是把全局阈值γ升级成可学习的动态策略,让模型根据题目难度和当前推理状态自适应调节停止线;另一个思路是把判定从“整题对错”细化到“哪个推理步骤可疑”,粒度更细的自验证信号,对精确控制计算分配会更有价值。

龙迷三问

下面是龙哥对大家可能问题的解答:

置信度和判定是怎么从模型输出里解析出来的?SVR要求模型在生成时按固定的结构化格式输出推理过程、答案、判定和置信度。比如自检查提示会要求模型显式地写“VERDICT: Correct/Incorrect/Unsure”和“CONFIDENCE: 0~100”之类的字段,再由程序化解析器提取。解析失败的判定统一归类为Unsure,解析失败的答案视为错误。由于有固定的fallback规则,模型的输出即使格式有瑕疵也不会让调度器直接崩溃。

训练时每轮都要给中间答案打分,这需要人工标注吗?不需要额外的人工过程式标注。SVR选的任务都是数学推理类,有标准答案或规则化检查器,每一轮生成的答案可以直接和参考答案对比自动判断对错。真正的限制在于,自动评估器的可得性决定了这个训练框架能不能迁移到其他任务上。

如果模型每轮都输出“Correct+置信度100%”,SVR是不是第一轮就该停了?训练奖励里专门设计了过度自信惩罚项:当模型在答案错误时给Correct判定且高置信度,会收到严厉的惩罚。而且固定视野训练强制模型即使第一轮“自信”了也必须继续走完后续轮次,让模型有机会看到“我第一轮其实错了但还很自信”的修正过程。最终结果显示平均停轮数是2.99轮而不是1轮,说明模型学会了在适当的谨慎和自我肯定之间找平衡。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

自验证信号从“质量描述”升级为“计算分配控制信号”,联合判定−置信度RL的奖励设计把校准误差和目标函数直接挂钩,思路新颖且自洽。

实验合理度:★★★★☆

基线覆盖全面,采样数做了严格对齐,还加了固定预算的预言机引导参考做系统级对比。唯一的小遗憾是主实验只报了一个全局阈值0.85,诊断性阈值扫描的结果没有充分展开。

学术研究价值:★★★★☆

把置信度校准和自适应推理这两个原本平行的方向连了起来,对后续研究“模型何时该相信自己”这一类问题有直接的启发意义。

稳定性:★★★☆☆

对阈值γ有一定敏感度,不同难度分布下最佳停止点会漂移;全局单一阈值在混合题集上能work,但还没达到“免调参”的稳健程度。

适应性以及泛化能力:★★★☆☆

七个数学基准上的泛化表现扎实,但训练依赖自动评估器给中间轮次打标签,限制了向代码、工具调用、开放生成等领域的直接迁移。

硬件需求及成本:★★★★☆

部署侧非常友好:2B模型加平均约3轮推理,单卡即可跑服务。训练侧需要4块A800做全参数RL,对一般研究组有一定门槛,但对工业界不算高。

复现难度:★★★★☆

方法描述细致,训练框架基于ms-swift和vLLM,奖励定义也清晰。GRPO的稳定复现仍有一些工程细节要处理,但整体不算难。

产品化成熟度:★★★☆☆

对数学推理类API服务而言,自适应的token节省是实打实的收益,可以直接降低推理成本。但在金融、医疗等高风险决策场景中,过早停止的风险还需要更充分的评测来兜底。

可能的问题:自验证信号在高难度、多步骤推理中的可靠性仍有天花板;全局阈值γ的敏感度讨论不多;训练依赖任务特定的自动评估器,限制了范式向通用任务推广。


主要参考文献

[1] Shao, Z., et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. 2024.
[2] DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 2025.
[3] Shinn, N., et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023.
[4] Kumar, A., et al. Training Language Models to Self-Correct via Reinforcement Learning. 2025.
[5] Wang, X., et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023.
[6] Wei, J., et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
[7] Snell, C., et al. Learning How Hard to Think: Directed Test-Time Scaling. 2024.
[8] Guo, C., et al. On Calibration of Modern Neural Networks. ICML 2017.
[9] Lightman, H., et al. Let's Verify Step by Step. ICLR 2024.
[10] 论文原文:https://arxiv.org/pdf/2607.28466v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
模型见好就收,科研要趁热打铁。SVR教会大模型自证对错,龙哥带你看懂其中门道。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。大模型群正在热议自适应测试时计算,快来一起聊!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。