← 返回 PaperDaily 大模型与智能体

西北大学&亚马逊AGI最新研究:让大模型学好“纠错”,推理能力暴涨,4B模型打趴8B!

让大模型第一步就做对,这要求有点高。但如果允许它错几次,再一步步修正呢? 西北大学联手亚马逊AGI提出的REVES框架,精准点出了当前“测试时扩展”技术的核心瓶颈——训练与推理的“步数”不匹配。它巧妙地通过把“接近正确”的错解转化为修正样本,用单步强化学习高效地训练模型学会自我纠错,在代码、数学上全面领先,还用4B模型在圆球填充任务上追平了8B系统的SOTA

西北大学&亚马逊AGI最新研究:让大模型学好“纠错”,推理能力暴涨,4B模型打趴8B!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
让大模型第一步就做对,这要求有点高。但如果允许它错几次,再一步步修正呢?
西北大学联手亚马逊AGI提出的REVES框架,精准点出了当前“测试时扩展”技术的核心瓶颈——训练与推理的“步数”不匹配。它巧妙地通过把“接近正确”的错解转化为修正样本,用单步强化学习高效地训练模型学会自我纠错,在代码、数学上全面领先,还用4B模型在圆球填充任务上追平了8B系统的SOTA!


原论文信息如下:
论文标题:
REVES: REvision and VErification–Augmented Training for Test-Time Scaling
发表日期:
2026年06月

发表单位:
Northwestern University (西北大学), Amazon AGI (亚马逊AGI), Qualcomm AI Research, University of Minnesota (明尼苏达大学)

原文链接:
https://arxiv.org/pdf/2606.18910v1.pdf

开源代码链接:
https://github.com/yxliu02/REVES.git
先抛出一个问题:你辛辛苦苦训练了一个大模型,它第一次回答问题的正确率可能只有 20%,但如果你给它多几次“试错修正”的机会,它最终的正确率能飙升到 50% 以上——这算不算一个巨大的进步?
现有的测试时扩展(Test-Time Scaling,TTS)技术,比如 Sequential Revision(顺序修订,即让模型基于上一次的错误和反馈不断改写答案)、MCTS(蒙特卡洛树搜索)、Mind Evolution 等,正是利用这个“多步修正”的机制来大幅提升最终答案质量。但问题来了:我们训练大模型的时候,用的都是 “一锤子买卖”——给定问题,直接输出一个答案,然后根据这个答案给奖励。这种训练方式完全忽略了模型在推理时“边错边改”的多步动态。
今天龙哥要讲的这篇论文《REVES: REvision and VErification–Augmented Training for Test-Time Scaling》,来自西北大学、亚马逊 AGI、高通 AI 研究院和明尼苏达大学。它提出的 REVES 框架,巧妙地把模型在修正过程中犯的“错误”变成了训练燃料,让模型学会如何在测试时更好地自我修正。结果呢?在 LiveCodeBench 上比单步 RL 基线高出 +6.5 个点,用 Qwen3-4B 这样的小模型在圆球填充(circle packing)任务上 追平了之前用 Gemini 2.0 Pro/Flash 等大系统的最佳结果
图10:REVES训练的Qwen3-4B在n=26的圆球填充实例上找到的配置,达到了2.635983的半径和(最优值)。
图10:REVES训练的Qwen3-4B在n=26的圆球填充实例上找到的配置,达到了2.635983的半径和(最优值)。
这篇文章没有那些花里胡哨的复杂架构,核心思想简洁而有力——让训练目标跟测试时的推理步数对齐。听起来很直觉,但实现起来并不简单。下面龙哥就带大家一层层拆解。

为什么“一锤子买卖”不好使?从单次回答到“修正-验证”的范式转变

首先,我们得搞清楚一个核心概念:测试时扩展(Test-Time Scaling,TTS)。简单来说,就是在推理阶段不只用一次模型调用,而是通过多次调用(比如并行采样、顺序修正、树搜索等)来提升答案质量。其中,顺序修订(Sequential Revision,SR) 是一种特别简单又强大的方式:模型先给出初始答案,根据反馈(比如代码的编译错误或数学题的验证结果)不断修订,直到正确或耗尽预算。
现在,大多数训练方法(比如 RLHF、RLVR、GRPO)优化的是所谓的单步目标(One-Shot objective)
公式:J_OneShot(θ) = E_{x~X, y~πθ(·|x)} [r*(x,y)]
公式1:单步目标,J_OneShot(θ) = E_{x~X, y~πθ(·|x)} [r*(x,y)]
这就像训练一个学生只考“一次定终身”,但考试时却允许他反复订正。这两件事完全不匹配!
于是论文定义了 TTS 算法 φ 下的目标:
公式:J_φ(θ) = E_{x~X, (s1:τ,y1:τ)~(πθ, φ)} [r*(x,y_τ)]
公式2:TTS算法φ下的目标,J_φ(θ) = E_{x~X, (s1:τ,y1:τ)~(πθ, φ)} [r*(x,y_τ)],其中τ是停止时间(首次正确或耗尽预算)。
论文的 定理 3.2 指出:存在两个策略 π₁ 和 π₂,它们在单步目标 J_OneShot 上是完全一样的,但在顺序修订目标 J_φ_SR 上可以有显著差异。这彻底说明了:单步训练无法替代多步推理训练
图1:(a) 标准RL:策略πθ直接将问题x映射到答案y,获得奖励r*。(b) TTS算法φ调用同一策略πθ最多K步,每一步的提示st由之前的历史构建(虚线箭头),最终答案在停止时间τ≤K输出;策略πθ必须在φ诱导的整个上下文分布上表现良好。
图1:(a) 标准RL;(b) TTS算法φ诱导的多步上下文。灰色虚线箭头表示历史依赖。
那该怎么办?论文选择了一个聪明的训练目标:顺序修订目标 J_φ_SR。为什么选它?因为 SR 本身就是一个很强的 TTS 算法(在 TravelPlanner 任务上与 Mind Evolution、AB-MCTS 不相上下,见图2),而且论文的 定理 3.1 证明:只要你改善了 SR 上的一步修正能力,这种提升会自动迁移到所有使用修订的 TTS 算法(包括 MCTS、Mind Evolution 等)。
图2:DeepSeek-V3在TravelPlanner上的表现。左图:顺序修订 vs. Mind Evolution / MCTS / AB-MCTS;右图:成本-准确率曲线,修订上下文窗口覆盖最近k次回答(k=1,2,3)或全部历史。
图2:顺序修订是一个强基线,且简单高效。

如何从失败中学习?REVES将“错误”转化为“训练燃料”的两阶段框架

目标定了,怎么优化呢?直接做多步强化学习(Multi-turn RL)?缺点很明显:对于一条“错→错→对”的轨迹,多步 RL 会给三步都分配相同的正面奖励,包括那两个错误步骤。这好比老师因为你最终答对了,就表扬你之前的每一个错误——显然不合理。
REVES 的核心洞察是一个数学分解(Lemma 4.1):顺序修订目标 J_φ_SR 可以精确分解为沿轨迹访问的每个中间状态上的一步恢复概率的加权和。这意味着,我们可以把学到的一条成功轨迹(比如经过3次修正终于正确)拆解成3个独立的小问题:从第一次错误答案出发,模型需要学会如何修正成正确的;从第二次错误答案出发,同样需要学会修正。每个小问题都可以独立地用单步 RL 来训练,避免了多步信用分配带来的偏差。
公式:J_φ_SR(θ) = Σ_{t=1}^K E[1{τ≥t} V_π(z_t)] = E[Σ_{t=1}^τ V_π(z_t)] = Σ_z ρ_θ(z) E[r*(x,y')]
公式3:J_φ_SR 的分解。V_π(z) 是从状态z出发一步修正就成功的概率,ρ_θ(z) 是状态z的期望访问次数。
基于这个分解,REVES 提出了一个简洁的 两阶段迭代框架

Stage I:数据增强(Data Augmentation)

对每个训练问题,用当前策略 π_θ 执行一次顺序修订(最多 K 步)。只保留那些最终成功的轨迹(即在预算内修正出正确回答)。然后,从这些成功轨迹中提取出所有中间状态(即那些“接近正确”的错误答案),将每个中间状态转化为两类提示:
修订提示(Revision Prompt):请模型基于之前的错误和反馈进行修订;
验证提示(Verification Prompt):请模型判断该错误答案是否正确(用于训练模型自我停止)。

Stage II:单步强化学习(Single-turn RL)

将 Stage I 生成的修订提示和验证提示,与原始的 RL 训练提示合并,用标准的单步 RL 算法(如 RLVR)来更新策略。注意,这里每个样本都是单个(提示,回答)对,不需要多步展开。
两个阶段交替进行:每一轮迭代,先用当前策略执行 Stage I 生成新数据,再用这些数据执行 Stage II 更新策略,然后进入下一轮。
图4:REVES两阶段迭代框架概览。Stage I:当前策略进行顺序修订,仅保留最终成功的轨迹,将中间状态转化为修订和验证提示,合并到原始RL提示集中;Stage II:在增强提示集上用单步RL训练,更新后的策略在下一轮迭代重新生成数据。
图4:REVES两阶段迭代框架。
我有一个新思路
这个设计的精妙之处在于:它把“错误”从需要避免的东西,变成了训练素材。每个错误中间步在未来都可能成为新训练样本的起点。而且生成数据是离线的(off-policy),可以异步进行,训练阶段只需要单步 RL 计算,效率远高于在线多步 RL。论文附录 F.2 给出了实际的 wall-clock 对比,REVES 在 8×H200 GPU 上每个 epoch 只需约 2 小时就能完成。
图3 直观地展示了这个分解思想:水平链条是保留的成功轨迹,每个状态 z 处,从当前策略采样新的分支来估计一步恢复概率 V_π(z)。
图3:将公式(1)映射到图上。(a) 当前策略下的多步RL训练轨迹;(b) 水平虚线链是保留的顺序修订轨迹,确定每个中间状态z的访问计数权重ρ_θ(z);在每个被访问的z处的分支是来自π_θ(·|z)的新样本,它们的验证结果提供了V_π(z)的每个状态估计。
图3:REVES 的训练信号分解示意图。

实验结果全面开花:代码、数学、未知难题,甚至“圆球填充”都赢了

论文在多个基线和任务上进行了全面评估。训练集使用 Skywork-OR1-RL-Data(7298 数学 + 1015 代码 = 8313 条),测试了 Qwen2.5-7B、Qwen2.5-3B、Qwen3-4B 和 DeepSeek-R1-Distill-Qwen-7B。
代码任务:在 LiveCodeBench 和 CodeContest 上,REVES 在所有预算设置下都优于单步 RL、多步 RL 和 PAG(一种多步自验证方法)。以 Qwen2.5-7B 为例,在 LCB(Aug 24-Jan 25)上,单步 RL 的 OneShot 为 18.0,而 REVES 在 TC-32(预算32次修订)下达到 29.5,比多步 RL 的 25.5 高出 4.0 个点,比 PAG 的 25.7 高出 3.8 个点。
表1:代码基准上的顺序修订测试时扩展性能。TC-B 表示预算B的顺序修订,使用执行测试作为验证器。每列最好结果加粗,次好加下划线。
表1:代码任务上,REVES 在 LCB 和 CodeContest 上全面领先。
数学任务:在 AIME24/25 和 MATH500 上,使用 Oracle 停止(-O)和自置信度停止(-SC)的评估,REVES 都带来了显著提升。在 AIME24 上,Qwen3-4B 的 Oracle-32 从多步 RL 的 44.0% 提升到 51.1%,提升了 7.1 个点。
表3:数学基准上的顺序修订测试时扩展性能。1-shot 是一次回答;O-B 是Oracle停止(已知正确答案),SC-B 是自置信度停止。
表3:数学任务上,REVES 在 Oracle 和 SelfConf 停止下都优于基线。
圆球填充(Circle Packing):这原本是一个需要大量进化搜索和强大基础模型才能解决的优化问题。REVES 直接用 Qwen3-4B 训练,在 n=26 上达到了 2.635983 的半径和——与之前用 Gemini 2.0 Pro/Flash、R1-Qwen3-8B 等系统最好的结果完全一样,但模型小了数个量级,rollout 数量也少得多。
表2:圆球填充基准(n=26,半径和,越高越好)。REVES 用 Qwen3-4B 达到了最优值 2.635983,使用了最小的基础模型和更少的 rollout。
表2:4B 模型追平 8B+ 大系统的结果。厉害不?
未知分布外谜题:REVES 还用仅基于数学和代码训练出来的模型,去解决 N皇后和迷你数独这类完全不同的约束满足问题。结果也一致优于基线,说明它学到了通用的修正能力
图5:N皇后和迷你数独上的表现(基于验证器停止)。REVES 使用仅在数学和代码上训练的模型,也泛化到了这类分布外谜题。
图5:REVES 在分布外谜题上也保持了优势。

来看看REVES的功力:各种测试策略下,它都更胜一筹

除了 SR 本身,论文还测试了 REVES 训练后的模型在 其他使用修订的 TTS 算法上的表现,包括 AB-MCTS(A 和 M 变体)、Mind Evolution 等。结果如 表4 所示:REVES 训练后的模型在所有策略上都取得了最佳或次佳结果,验证了定理 3.1 的迁移性保证——在 SR 上训练,直接提升所有使用修订的算法
表4:在不同测试时策略上的模型性能对比。1-shot 是一次回答;MindEvo 是 Mind Evolution;ABM-A(β)、ABM-A(G)、ABM-M 是 AB-MCTS 的变体。每列最好加粗,次好加下划线。
表4:REVES 训练出的模型在各种 TTS 策略下都表现优异。

REVES为何成功?连续数据增强是关键

论文对关键设计进行了细致的消融实验(图6、图7)。
图6:数据增强的消融实验(AIME24)。左图:增强预算K的影响(最大轨迹长度);右图:连续增强 vs 一次性增强。
图6:左图显示,允许更大的修订预算 K(即允许更长的修正链)能带来更好的性能;右图表明,连续迭代增强(每轮生成新数据并训练)优于一次性增强(只在最初生成数据然后训练到底)。
图7:数据增强的消融实验(MATH500)。左图:增强频率(连续 vs 一次性);右图:允许的修订预算K。
图7:在 MATH500 上的消融结果与 AIME24 一致,连续增强和更大的 K 都更优。
另外,表5 分析了修订提示和验证提示各自的贡献:单独使用修订提示(Revision Only)在 Oracle 停止下效果不错,但自置信度停止(SelfConf-4)下效果不明显;而单独使用验证提示(Verification Only)能提升自置信度停止的准确率。两者结合(REVES)才实现了最好的整体性能。这个分析清晰地说明了为什么两阶段的提示设计都很重要。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

REVES 与多步 RL 的核心区别是什么?多步 RL 对整个轨迹(从初始问题到最终答案)做强化学习,信用分配会掩盖中间错误步骤的负面信号。REVES 则把成功轨迹拆解成独立的单步修正问题,每个中间状态单独学习修正,信号更纯净、训练更高效。

什么是“顺序修订”(Sequential Revision, SR)?SR 是一种测试时扩展策略:给定问题 x,模型先生成初始答案 y1,获取反馈 f1(如代码错误信息);然后根据 (x, y1, f1) 生成修订版 y2,如此重复直到预算用尽或答案正确。REVES 正是以 SR 作为训练目标,因为它的收益可以迁移到其他策略。

REVES 的“近错”(near-miss)答案是什么意思?“近错”答案就是在成功修正轨迹中出现的那些中间错误答案——它们离正确只差一步,因为下一步的修订就成功了。REVES 将这些“近错”状态提取出来,作为独立的修正训练样本,让模型学会从这些特定错误模式中恢复,从而强化了局部修正能力。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

REVES 将测试时扩展问题形式化为元强化学习问题,提出逐状态分解训练信号的新方法,整体思路自然且有效。概念上的转化(错误→训练燃料)有一定的新颖性,但本质上还是“数据增强+单步RL”的组合,基础元素不新,因此扣一星。

实验合理度:★★★★★

实验设计非常全面:涵盖了代码、数学、圆球填充、分布外谜题等多种任务;对比了单步RL、多步RL、PAG 等多个强基线;进行了充分的消融实验,分析了预算、增强次数、提示类型等因素的影响。所有结果清晰且支撑论点。满分。

学术研究价值:★★★★✰

该工作明确指出了训练目标与测试时部署之间的步数不匹配问题,并提供了一个简洁的解决方案。对于后续研究如何对齐训练和推理多步动态具有重要启发。但方法本身在理论深度上尚可,定理证明虽严谨但结论不算特别意外,因此四星。

稳定性:★★★★✰

REVES 在多种任务和模型上表现一致,消融实验也显示对不同超参数(如预算K、增强轮数)相对鲁棒。但需要注意,论文中所有实验均使用公开测试用例作为代码反馈,以及使用 TailConfidence 作为数学的自停止规则。如果切换到更嘈杂的反馈或更弱的自停止规则,稳定性可能会下降。因此四星。

适应性以及泛化能力:★★★★★

REVES 在多个不同任务(代码、数学、圆球填充、N皇后、数独)上都取得了提升,并且训练后的模型在多种 TTS 策略(SR、MCTS、Mind Evolution)上都有增益。泛化性很好。满分。

硬件需求及成本:★★★★✰

训练阶段:REVES 需要额外生成增强数据(Stage I),但可以异步并行,训练本身是单步RL,计算量小于多步RL。推理阶段:测试时扩展算法本身需要多次模型调用,但与普通SR相同。总体来看,训练成本可控,推理成本取决于预算。4B模型即可达到SOTA,硬件门槛低。四星。

复现难度:★★★★★

论文已开源代码仓库(https://github.com/yxliu02/REVES),提供了完整的数据生成和训练脚本,且依赖的主流框架(vLLM、Skywork-OR1)较为常见。复现难度较低。满分。

产品化成熟度:★★★★✰

REVES 提供了一个实用的训练范式,尤其适合那些在测试时可以利用反馈的场景(如代码生成、数学解题、约束优化)。但需要注意,对于无法获得外部验证信号的任务(如开放文本生成),REVES 的验证提示训练无法直接应用,需要调整。直接产品落地还需考虑任务特定反馈的构建成本。四星。

可能的问题:论文主要依赖公开测试用例或确定性验证器来获取反馈,在现实场景中,高质量的验证器可能并不总是可用。此外,REVES 在训练阶段需要生成成功轨迹,如果模型初始能力很弱,可能导致很少的成功轨迹,数据增强效果受限(但迭代可以缓解)。对于需要极长修正链的复杂推理,SR 本身的效率可能成为瓶颈。


主要参考文献

[1] Liu et al. REVES: REvision and VErification–Augmented Training for Test-Time Scaling. arXiv:2606.18910, 2026.
[2] Madaan et al. Self-Refine: Iterative Refinement with Self-Feedback. NeurIPS 2023.
[3] Shinn et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023.
[4] Inoue et al. AB-MCTS: Adaptively Behaved MCTS for LLM Reasoning. 2025.
[5] Lee et al. Mind Evolution: Evolutionary Search for LLM Reasoning. 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
大模型也会犯错,但学不会”纠错”才是真短板!REVES把错题变成宝藏,让AI迷上修正与验证。 欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大语言模型+上海+西北大学+小张),根据格式备注,可更快被通过且邀请进群。 『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。