← 返回 PaperDaily
大模型与智能体
告别离散判分:连续概率评分让LLM验证准确率提升至86.5%,零微调超越专用模型
验证是AI的隐藏瓶颈!斯坦福伯克利这篇最新论文,提出LLM-as-a-Verifier,用连续评分取代离散判分,并沿三个维度缩放验证能力。无需训练就在代码、机器人、医学四基准拿下SOTA,GitHub已获近600星。想了解如何让Agent更可靠?这篇值得细读。
龙哥读论文
阅读 3
查看原文
原论文信息如下:
验证也能缩放?LLM-as-a-Verifier给出新答案
当大语言模型(LLM,Large Language Model)在各种任务上取得了前所未有的生成能力时,一个关键问题浮出水面——如何判断模型输出的正确性?现有的方法主要分为两类:一是直接让LLM以离散分数(如1-5分)进行判分,即LLM-As-A-Judge范式;二是训练专门的奖励模型(Reward Model)。但前者存在严重的评分粗糙问题——面对复杂任务,两个截然不同的方案得分可能完全一样,导致大量平局;后者则受限于训练数据,泛化能力堪忧。斯坦福大学、加州大学伯克利分校和英伟达研究团队联合提出的LLM-as-a-Verifier框架,从根源上重新定义了验证:不直接取最高概率的离散token,而是将评分token的整个概率分布进行期望计算,从而得到连续、光滑的分数。这个看似简单的改变,竟然系统地打开了验证能力的缩放定律。
在实际应用中,一个Agent(智能体)反复采样往往能产生正确答案——论文在Terminal-Bench V2上的实验表明,如果有一个“神谕验证器”(Oracle Verifier)总能挑出最优轨迹,那么成功率达到惊人的98.9%。但现实是没有这样的神谕。LLM-as-a-Verifier的目标就是尽可能逼近这个天花板,它不需要任何训练,即插即用,就实现了四个领域的SOTA(最新最优性能)。
三大缩放维度:粒度、重复、准则
LLM-as-a-Verifier的核心创新在于揭示了验证任务同样存在“缩放定律”(Scaling Law)。它沿着三个正交维度进行缩放,每个维度都带来一致的精度提升。
第一个维度:评分粒度(Scoring Token Granularity)
传统Judge方法要求LLM从预设的离散值中选一个(例如1-5),然后取最高概率的token作为最终得分。这相当于把LLM内部丰富的评估信息压缩成了一个粗略的整数。LLM-as-a-Verifier改为提取评分token的整个logit分布,计算加权期望值。例如,在5分制下,如果模型对“3”和“4”的概率分别为0.4和0.3,Judge会输出“3”,而Verifier会输出3×0.4+4×0.3+...的连续值。这个微妙的转换消除了离散化带来的信息丢失。
更关键的是,评分粒度可以缩放。论文将评分范围从1-5扩展到1-20,实验发现随着粒度G增大,信噪比(SNR)从0.775(G=1)提升至0.799(G=20),相应的成对验证准确率从73.1%提升至77.5%。信噪比公式如下:SNR(G) = E(s_c - s_i) / sqrt(Var(s_c - s_i)),其中s_c为正确轨迹得分,s_i为错误轨迹得分。更大的粒度让Verifier能更精细地区分细微差异,而Judge限于离散输出,即使扩大粒度也无法利用概率信息。
论文用一个生动的案例展示了这一点:在Terminal-Bench V2的query-optimize任务中,两个候选轨迹都生成了优化的SQL查询,但一个正确验证了等价性,另一个没有。Judge在100次评估中有88次打出平局,而Verifier(连续G=5)正确选出了0次平局,正确排序69次;Verifier(G=20)则正确排序77次。
第二个维度:重复评估(Repeated Evaluation)
单次评估总会有噪声——可能因为提示的随机性、模型的采样波动等。LLM-as-a-Verifier通过对同一条轨迹进行K次独立评估并取平均,利用方差缩减原理(方差以O(1/K)衰减)来稳定分数。实验表明,从K=1到K=16,验证准确率从74.7%提升至77.5%。有趣的是,这种重复评估对Judge也有帮助——通过平均多个离散分数来打破平局,但效果远不如Verifier。图7显示了这一对比:Verifier即使K=1的准确率就超过了Judge K=16的水平,且Verifier在任何K下都保持零平局率。
第三个维度:准则分解(Criteria Decomposition)
单一评判标准往往过于笼统,比如“这个轨迹是否正确?”会混淆多个方面。LLM-as-a-Verifier将评估分解为多个子准则,对每个子准则独立评分后再综合。以代码代理(Coding Agent)的轨迹为例,分解为三个准则:规范满足度(Specification)、输出格式正确性(Output)、错误日志检查(Errors)。每个子准则更容易验证,且综合后的准确率(78.3%)显著高于任何单一准则(75.2%-76.4%)。这种分解独立于前两个维度,可以叠加使用。
无需训练,即插即用:四个Benchmark的SOTA
论文在四个难度极高的基准上验证了LLM-as-a-Verifier的效果,涵盖代码、机器人、医学领域。注意,Verifier本身不经过任何领域微调,完全零样本(Zero-shot)使用,只是输入评分提示和轨迹。
整体结果如表3所示。在Terminal-Bench V2上,使用Capy作为框架,从GPT-5.5采样5条轨迹,Verifier将其准确率从Pass@1的83.1%提升至86.5%,超越了此前所有单独模型的最佳成绩(84.7%)。在SWE-Bench Verified上,从三个不同模型(Claude Opus 4.5、Gemini 3 Flash、MiniMax M2.5)各采样1条轨迹构成混合池,Verifier的准确率达到78.2%,超过其中任何一个单独模型。在医疗基准MedAgentBench上,同样提升明显,达到73.3%。
机器人领域的RoboRewardBench尤其说明问题。这是一个视频输入的任务,要求从一对机器人操作视频中选出进展更大的那个。相比经过大量数据微调的专用奖励模型(如RoboReward-8B在约4.5万条数据上训练,Robometer-4B在约100万条比较上训练),零样本的LLM-as-a-Verifier达到了87.4%的偏好准确率,远超这些专用模型(81.4%和78.8%)。这充分展示了连续概率评分的泛化能力。
为了在高延迟预算下进行高效候选排序,论文提出了概率枢轴锦标赛(Probabilistic Pivot Tournament, PPT)算法。传统做法是两两比较所有N个候选,需要O(N²)次验证。PPT首先通过一个随机哈密顿环(Ring Pass)让每个候选恰好出现一次在A位置和一次在B位置,消除位置偏差;然后选择环中得分最高的k个候选作为枢轴(Pivot),后续只比较所有候选与枢轴之间以及枢轴内部的分数,将复杂度降至O(Nk)。实验表明,该方法在k较小时就能达到接近全比较的性能。
从轨迹选优到进度监控:信号的多用性
LLM-as-a-Verifier产生的连续分数不仅用于选择最佳轨迹,还发现了与任务进度的强相关性。论文在Terminal-Bench V2的代码生成任务中,记录每一步骤的Verifier得分,发现成功轨迹的分数随时间单调递增,而失败轨迹的分数徘徊不前或下降(见图8)。这种相关性使得连续分数可以作为任务进度代理(Progress Proxy),用来监控Agent的行为是否在正轨上。
为了量化这一能力,论文在RoboRewardBench上测量了Verifier分数与步骤序号之间的价值-顺序相关(Value-Order Correlation, VOC)系数。LLM-as-a-Verifier达到了0.966的平均VOC,超过了最好的专用奖励模型RoboReward 8B的0.943。这意味着即使没有明确的进度标注,Verifier也能判断机器人是否在向目标前进。
论文还展示了Verifier可以作为过程奖励模型(Process Reward Model, PRM)——在每一步对多个候选动作进行评分,并在步骤级别进行选优。表10显示,随着每步采样动作数k的增加,Pass@1单调递增。这表明Verifier可以取代传统的PRM,在搜索过程中提供分支级别的反馈。
更高效的强化学习:密集奖励的实践
强化学习(Reinforcement Learning, RL)通常面临稀疏奖励(Sparse Reward)的问题——只有最终成功时才能获得正反馈。LLM-as-a-Verifier的连续分数可以充当密集奖励信号(Dense Reward),指导Agent每一步的学习。
论文在两种RL场景中验证了这一想法:离线策略(Off-policy)的机器人操作任务和在线策略(On-policy)的数学推理任务。在机器人操作任务LIBERO上,使用DSRL-SAC算法微调π0策略,LLM-as-a-Verifier提供的进展奖励(Progress Reward)相比稀疏奖励基线,达到了约1.8倍的样本效率提升(即达到相同成功率所需的交互步数减少了近一半),并且最终成功率更高(0.76 vs 0.69)。在数学推理任务MATH上,结合GRPO算法微调Qwen3-8B,Verifier提供了推理奖励(Reasoning Reward),实现了约1.1倍的样本效率提升。图9直观展示了训练过程中的成功率曲线。
这一部分不仅展示了Verifier作为评估工具的价值,更展示了它作为学习信号的潜力。想象一下,在机器人训练中,Verifier可以告诉算法“你这次拿得比上次更稳了”,而不是只有“成功/失败”的结局信息,这让学习过程变得高效得多。
龙迷三问
LLM-as-a-Verifier与LLM-as-a-Judge的根本区别在哪里?Judge输出离散整数分数(如1-5),取最高概率token。Verifier则提取评分token整个概率分布的期望值,输出连续实数。这一区别使得Verifier能捕捉到模型内部更细腻的评估信息,消除平局,并且可以沿着粒度、重复、准则三个维度进行缩放,从而大幅提升验证精度。
概率枢轴锦标赛(PPT)具体如何降低计算成本?假设有N个候选,全对全比较需要O(N²)次验证。PPT先通过一个随机环(Ring Pass)进行N次比较,消除位置偏差;然后选出环中得分最高的k个作为枢轴(k远小于N)。接着,每个非枢轴候选只与这k个枢轴比较(共(N-k)*k次),枢轴之间再相互比较(k²次)。总次数为N + k(N-k) + k²,约N + kN,当k=O(√N)左右时成本最低。实验证明k取5-10即可达到接近全比较的性能。
Verifier需要访问模型内部的logits,如果使用只有API访问权限的闭源模型怎么办?论文在附录B.6提出了一个两阶段变通方案:首先用闭源模型生成详细的评估推理(Reasoning),然后将推理文本作为输入,喂给一个支持logits访问的开源或中等模型(如Gemini 2.5 Flash)来提取分数token的logits。实验显示,这种两阶段方法在Terminal-Bench V2上仍然取得了84.3%的准确率,优于纯离散Judge的72.6%,证明了框架在不能直接获取logits的情况下的实用性。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
该工作首次系统地将“验证”本身作为一个可缩放的轴,并提出了三个明确的缩放维度。利用评分token的整个分布来获得连续分数这一技术本身并非全新(类似思路在奖励建模中已有探索),但论文将其与缩放定律、高效排名算法和多种应用场景紧密结合,构成了一个完整的框架,创新性显著。
实验合理度:★★★★★
实验覆盖编码、机器人、医学三个领域共四个高难度基准,对比基线包括多个前沿模型和专用奖励模型。消融实验完整,对三个缩放维度分别进行了控制变量分析,还进行了预算-准确率权衡的详细分析。所有实验设置清晰、可复现,充分验证了方法的有效性和泛化性。
学术研究价值:★★★★★
揭示了验证范式本身存在缩放定律,为后续研究打开了一个新方向。包括如何自动选择最优的准则分解、如何动态调整重复评估次数、如何将Verifier分数用于更复杂的搜索算法等。此外,基于Verifier的进度监控和密集奖励信号还可能推动RL领域的样本效率提升研究。
稳定性:★★★★☆
Verifier得分在不同重复次数下表现稳定,尤其在K≥4后变化较小。在机器人领域,Verifier的分数与人工标注的MAE(平均绝对误差)从1.11降至0.72,说明预测与人类判断的一致性较高。但需要注意,Verifier依赖底层LLM的评估能力,当任务完全超出模型知识范围时,分数可能不可靠。
适应性以及泛化能力:★★★★★
无需任何领域微调,零样本在代码、机器人、医学三个完全不同模态的任务上均取得SOTA,尤其超越了大量机器人专用奖励模型,泛化能力极强。唯一限制是需要底层LLM具备一定的领域知识——但论文实验已经使用了不同尺寸的模型(Gemini 2.5 Flash、Qwen 3.6等)进行验证,显示了一定的模型无关性。
硬件需求及成本:★★★☆☆
推理成本与采样数N、重复次数K、准则分解数C线性相关。实际使用中,N×K×C次LLM调用可能成本较高。但是论文的PPT算法将比较复杂度从O(N²)降到O(Nk),显著降低了预算。对于大型生产系统,仍然需要权衡精度与成本。
复现难度:★★★★☆
论文方法不需要训练,核心代码主要是提示工程和logits提取逻辑,理论上易于复现。但依赖特定的LLM接口(支持top logprobs访问)以及评分token的解析。论文已开源项目代码(GitHub llm-as-a-verifier仓库),并提供了详细的提示模板,复现工作较为便捷。
产品化成熟度:★★★★☆
论文已经提供了Claude Code和Codex的扩展插件,可以直接用于监控和改进Agent系统。作为奖励信号用于RL训练也已得到验证。但要完全产品化,还需解决延迟、成本以及不同底层LLM的打分一致性等问题。整体而言,接近中等成熟度。
可能的问题:论文的关键方法依赖于能够访问LLM内部评分token的logits,这并非所有模型都直接提供(尤其是闭源API)。虽然附录给出了两阶段变通方案,但会增加延迟和成本。另外,准则分解部分目前是手工设计的,缺乏自动发现最优分解机制的方法。最后,Verifier在极端困难或模型完全无知的任务上的表现尚未充分验证。
主要参考文献
[1] Kwok, J., Li, S., Atreya, P., et al. LLM-as-a-Verifier: A General-Purpose Verification Framework. arXiv:2607.05391v2, 2026.
[2] Terminus-Bench V2. https://terminus-bench.github.io/
[3] SWE-Bench Verified. https://www.swebench.com/
[4] RoboRewardBench. https://robo-reward-bench.github.io/
[5] MedAgentBench. https://medagentbench.github.io/
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!