← 返回 PaperDaily 大模型与智能体

俄亥俄州立&普林斯顿:把失败变成错题集,Qwen2.5-72B单次生成59.2%

测试时扩展很香,但反复采样是真烧钱。这篇论文给出一个反直觉的省钱思路:把小模型犯过的错变成提示词,让大模型一次解码就能绕开坑。单次生成、零额外推理开销,还在Qwen、Llama两大系列上全面超越多次采样基线,值得所有做LLM推理的读者花五分钟看看。

俄亥俄州立&普林斯顿:把失败变成错题集,Qwen2.5-72B单次生成59.2%

paperdaily_reaction_gif


原论文信息如下:
论文标题:
CritICL:推理时从大语言模型的失败模式中实现弱到强泛化
发表日期:
2026年08月
发表单位:
俄亥俄州立大学,普林斯顿大学
原文链接:
https://arxiv.org/pdf/2608.27455v1.pdf
开源代码链接:
https://github.com/umwyf/CRITICL

引言:小模型犯错,大模型受益?CritICL让失败成为推理指南

不知道大家有没有过这种体验:家里那位刚学做饭的室友,把糖当盐撒进了红烧肉里,你尝了一口之后,从此记住了这盘教训——噢,原来糖和盐的罐子不能放一起。这个看似平平无奇的日常瞬间,实际上揭示了一个深刻的道理:失败本身,也是可以传递的经验。
大语言模型的推理,也藏着同样的道理。过去一两年,推理时扩展(Inference-time Scaling)成了提升模型推理能力的香饽饽。思路很简单:让模型多采样几次,或者生成更多推理步骤,最后再投票选一个答案。效果确实有,但代价也肉眼可见——token烧得飞快,延迟蹭蹭上涨,每一次查询都要付出好几倍的推理成本。
俄亥俄州立大学和普林斯顿大学的研究者们最近抛出了一个反直觉的思路:与其让大模型自己反复试错,不如把同族小模型犯过的错误直接整理成一本“错题集”,在推理时作为提示词喂给大模型。这个框架就是本文的主角——CritICL。核心洞察说起来有点意思:同一个模型家族里,1.5B的小模型和72B的大模型,犯错的模式居然高度相似。也就是说,小模型踩过的坑,大模型大概率也会踩,只是踩的频率低一点而已。
既然坑是共通的,那解决思路就顺理成章了:把小模型的错误整理成带批评的示例,用检索的方式塞进大模型的上下文里,让大模型在动笔之前先看一眼“前人踩过的雷”。整个过程只做一次解码,不需要反复采样,不需要外部验证模型,更不需要微调。用最少的额外开销,拿到接近甚至超过多次采样的效果。
这个思路还有一层更深的含义:它把“失败”从一种需要被丢弃的负样本,变成了一种可复用的知识资产。一次离线构建,多次在线复用,每一条错误的标注成本都被摊薄到无数次推理中。这不只是省钱,更像是在重新思考——我们到底该如何对待模型犯过的错。

方法概述:失败模式跨尺度共享,弱模型的错误为何能指导强模型

CritICL的出发点是一个关于大模型失败模式的经验观察。研究者在论文里做了一个很有趣的分析:让同一家族里不同规模的模型去解同一批数学题,然后把它们答错的原因按照预定义的失败模式打上标签,比如“公式应用错误”“问题误解”“逻辑跳步”等等,最后统计每种失败模式出现的频率。
结果发现,Qwen家族从1.5B到72B,Llama家族从1B到70B,虽然模型大小差了上百倍,但失败模式的相对排序和出现频率惊人地一致。意味着小模型爱犯的错误,大模型也躲不掉,只是概率稍低一些。更妙的是,如果把多个弱模型的失败统计聚合起来,得到的分布比任何一个单独的弱模型都更接近大模型的实际表现。换句话说,小模型的失败样本聚在一起,反而构成了大模型错误行为的最优预测器。
图1:CritICL是一个两阶段推理时弱到强泛化方法。阶段1构建CritBank:使用小语言模型在数据集上生成响应和推理,再借助前沿大模型生成批评并标注失败模式。阶段2使用CritICL进行推理:对于给定查询,CritICL-static从CritBank构建模型特定的失败模式画像,CritICL-dynamic则会识别与查询相关的失败模式,随后基于失败模式进行上下文示例选择,为目标大模型提供示例。
图1:CritICL是一个两阶段推理时弱到强泛化方法。阶段1构建CritBank:使用小语言模型在数据集上生成响应和推理,再借助前沿大模型生成批评并标注失败模式。阶段2使用CritICL进行推理:对于给定查询,CritICL-static从CritBank构建模型特定的失败模式画像,CritICL-dynamic则会识别与查询相关的失败模式,随后基于失败模式进行上下文示例选择,为目标大模型提供示例。
基于这个观察,CritICL设计了一套两阶段的流程。整个框架的核心,是先把“失败”转化为可检索、可复用的知识,再在推理时把这份知识精准地投喂给大模型。这个思路的关键,就在于把原本需要重复试错的推理成本,转移为一次性的离线构建成本。

核心原理推导:CritBank——把失败变成一种可检索的知识

CritBank的构建可以拆成三个步骤。第一步是响应生成:对于训练集中的每一道题,让多个小模型分别用思维链提示生成五条响应。这些模型不需要很聪明,1.5B、3B、7B这种量级就够用了。生成完毕之后,把其中回答错误的响应筛选出来,这些就是后续要用的“失败样本”。
说起来,这个大模型推理优化的赛道上,大家已经习惯了堆算力的玩法——采样不够就多采样几次,投票不够就再多投几轮,好像推理能力的提升只能用钱和电来换。但CritICL这篇论文偏偏走了一条完全不同的路:不烧多余的token,不做重复采样,只靠一本离线构建的“错题集”,就让大模型记住了同类模型容易踩的坑。
先说结论:在Qwen2.5-72B模型上,CritICL-static用单次生成就拿到了59.2%的平均准确率,超过了Self-Consistency@5的59.0%;在32B模型上,CritICL-static的49.8%也压过了Consistency@7的49.5%。这不仅是不花钱还办事,简直是花小钱办大事了。
图1:CritICL是一个两阶段推理时弱到强泛化方法。阶段1构建CritBank:使用小语言模型在数据集上生成响应和推理,再借助前沿大模型生成批评并标注失败模式。阶段2使用CritICL进行推理:对于给定查询,CritICL-static从CritBank构建模型特定的失败模式画像,CritICL-dynamic则会识别与查询相关的失败模式,随后基于失败模式进行上下文示例选择,为目标大模型提供示例。

两大变体解析:动态预测与静态画像的协同

CritICL提供了两种推理时的使用方式,各有各的妙处。先把两种方式的核心机制讲清楚,大家就好理解后续的实验结果了。
CritICL-dynamic:输入相关的动态选取。这种方式的核心逻辑是“看菜下饭”——每来一道新题,先让目标大模型自己预测一下这道题最可能犯哪几类错误(最多五个失败模式标签),然后拿着这些预测结果去CritBank里检索对应的批评示例,把检索到的示例拼进提示词里。因为每个输入的预测各不相同,所以每次构造出来的提示词也是定制化的。
CritICL-static:全局画像的稳定输出。这种方式不针对单个输入做定制,而是先聚合同族多个弱模型的失败模式统计,算出一个覆盖全族的“失败模式画像”——也就是这个模型家族最常犯的Top-K类错误。推理时直接用这批固定的高发失败模式去检索批评示例,所有输入都共享同一套提示词模板。虽然看起来不如动态方式“个性化”,但它有一个隐藏优势:对输入不做额外的模型调用,只解码一次,推理成本最低。
两种方式的底层共享同一个Failure Mode-Based Sample Selection过程,也就是检索打分排序:对于一组给定的失败模式集合S,每个候选样例的得分等于其失败模式标签与S交集的大小(或者加权求和),最后取Top-K个样例作为上下文示例。整个流程不需要任何向量数据库,不需要embedding模型,甚至不需要任何额外的模型调用(静态版),纯粹基于预构建的失败模式索引做集合匹配,工程实现极其轻量。

论文主体思路:从CritBank构建到推理时提示

一句话概括CritICL的完整流程:先用弱模型产出大量错误答案,再用强模型给这些错误答案标注失败模式和批评,形成CritBank;推理时,针对查询检索最相关的失败批评示例拼进提示词,引导大模型避开常见的推理陷阱。
*表格超出部分左右可以滑动 (a) Target Model: Qwen2.5-32B-Instruct
(a) Target Model: Qwen2.5-32B-Instruct

核心原理推导:CritBank——把失败变成一种可检索的知识

CritBank的构建可以拆成几个关键环节。首先对于训练集中的每一道题,论文会让多个小模型(比如Qwen2.5-1.5B、3B、7B)分别用思维链提示生成五条响应。这五条响应里有对有错,错误的那部分就是后续要用的“失败样本”。形式化地说,对于一个输入问题q和模型m,生成五条响应组成一个集合,再根据一个正确性函数把正确和错误的响应区分开,只保留错误的响应。
每个问题和模型组合生成五条响应,包含推理步骤和最终答案
R(q,m)表示模型m针对问题q生成的全部响应集合,r带(i)上标表示其中第i条响应,每条响应既包含中间推理步骤也包含最终答案。收集了所有问题和模型组合的响应后,就得到了一个总响应池。
全部响应集合的并集形式化定义
接下来一步很关键:对于每条错误响应,论文用一个前沿大模型(默认是GPT-4o-mini)来生成最多五个候选失败模式标签,再通过聚类把语义相近的标签合并,得到一组代表性的失败模式。与此同时,对每对“问题-错误响应”生成一条自然语言批评,指出推理过程中到底哪里出了问题。最终CritBank里的每一条记录都包含四个要素:问题、错误响应、失败模式标签、自然语言批评。
CritBank数据集的形式化定义
CritBank(Q,M)表示由问题集Q和模型集M构建的完整数据集,每个条目包含四元组:问题q、错误响应r、失败模式标签l和批评C(q,r)。值得注意的是,标签是个集合值函数,同一个错误响应可能同时命中多个失败模式。
有了CritBank之后,推理时要做的事情就变成了:给定一个新问题,预测它可能命中哪些失败模式,然后从CritBank里把带有这些失败模式标签的“问题-错误响应-批评”三元组捞出来,作为上下文示例拼进提示词。这个检索过程的打分函数非常简单朴素——一个候选样例的得分,就是它的失败模式标签和当前关注集合的交集大小,或者按失败模式权重加权求和。取Top-K个样例进提示词即可。

实验结果:效率与精度兼得,单次生成超越多次采样

论文的实验设计相当完整。先看主实验:在Qwen家族上,CritBank由三个小模型(1.5B、3B、7B)构建,目标模型为32B和72B,评测覆盖了域内(GSM8K、MATH)和域外(AMC23、AIME24、AIME25)共五个基准。对比基线包括标准ICL和测试时扩展两大类。
表格1(a):Qwen2.5-32B-Instruct上的性能对比
表格1(a):Qwen2.5-32B-Instruct上的性能对比。CritICL-static在GSM8K上达到93.6%,MATH上59.2%,整体平均49.8%——这个数字超过了Consistency@7的49.5%,而Consistency@7需要7次采样。
表格1(b):Qwen2.5-72B-Instruct上的性能对比
表格1(b):Qwen2.5-72B-Instruct上的性能对比。72B模型上优势更明显:CritICL-static整体平均59.2%,超过Consistency@5的59.0%和LLM-as-Judge的58.5%。值得注意的细节是,在GSM8K上CritICL-static达到了95.4%,比任何基线都高。
更让人眼前一亮的其实是推理成本对比。表格2给出了MATH数据集上每种方法的平均token消耗。CritICL-static只需要一次生成,总计3768个token;CritICL-dynamic因为多了一步失败模式预测,需要两次生成,总计3897个token。而Consistency@7烧了5440个token,Self-Reflection更是烧了7533个token。这意味着一件事:CritICL用不到测试时扩展方法70%的token量,拿到了持平甚至更高的准确率。
表格2:各方法在MATH数据集上的推理成本对比
表格2:各方法在MATH数据集上的推理成本对比。CritICL略增输入token但大幅降低输出token,总token消耗显著低于所有测试时扩展方法。
论文还做了一个很有意思的消融实验。把CritICL的失败模式选择换成随机选择、固定选择或者语义相似度检索,效果都会大幅下降。在AMC23和AIME25这两个有挑战性的基准上,随机选择只有22.2%和13.2%的准确率,而CritICL-static能做到26.6%和17.9%,提升了4到6个点。这说明CritICL的成功不光是“加了批评示例”这个动作本身,更关键的是“基于失败模式来选择示例”这个设计。
表格3:不同上下文化示例选择策略的效果对比
表格3:不同上下文化示例选择策略的效果对比。基于失败模式的示例选择在所有数据集和指标上统一优于随机、固定和语义相似度检索。
为什么失败模式选择这么重要?因为普通的检索看的是“表面相似性”——两道题看起来像,但错误原因可能完全不同。失败模式检索看的是“内在错误共性”——直接命中模型容易犯的推理错误类型,对模型来说这才是真正有用的信号。换句话说,语义检索回答的是“哪些题跟这道题长得很像”,失败模式检索回答的是“这道题最容易在哪里翻车”,后者显然更贴近推理增强的目标。

实验结果分析:为什么CritICL能work

这里要深入一层:为什么小模型的失败模式能指导大模型?论文用了一张很直观的图来回答这个问题。研究者把Qwen家族和Llama家族各自不同规模模型的失败模式分布画在一起对比,观察到了两个关键现象。
图2:Qwen家族和Llama家族不同规模模型的失败模式分布高度一致
图2:Qwen家族(上)和Llama家族(下)的失败模式分布随模型规模增长保持高度一致。这也解释了为什么小模型踩过的坑,大模型大概率也躲不掉。
第一个现象是同一家族内失败模式分布高度一致。Qwen从1.5B到72B,Llama从1B到70B,高频失败模式的排序和相对频率几乎不变。这意味着模型家族的“犯错基因”是稳定遗传的,规模增大只是降低了犯错的绝对概率,但犯错的结构性偏好没有本质变化。第二个现象更有意思:把多个弱模型的失败统计聚合起来,得到的分布比任何一个单独的弱模型都更接近大模型的实际表现。这说明不同小模型各自捕捉到的是失败模式的互补子集,聚合之后更接近对完整错误地形的无偏估计。
这两个现象放在一起,就给CritICL的整个设计提供了坚实的经验基础。更妙的是,论文还验证了失败模式标签的标注可靠性——GPT-4o-mini自动标注的结果与独立LLM标注及人类标注的一致性都很高,说明用前沿小模型批量产标签这条路是走得通的。此外论文也做了跨家族迁移的探索,把Qwen的CritBank直接用到Llama上,虽然比同家族迁移稍弱,但依然能超过标准ICL不少,说明失败模式的共性可能超越了家族边界。

从数学到科学:CritICL的跨领域泛化能力

CritICL的优势能不能泛化到数学之外?论文在GPQA基准上做了跨领域验证,GPQA是一个涵盖化学、生物、物理和量子力学的高难度科学问答数据集。实验结果很清晰:CritICL在所有科学领域上都一致地超过了标准ICL基线。化学、生物、物理、量子力学四个子领域,CritICL的准确率全部高于随机选择和固定选择的上下文示例。
更值得注意的是跨域迁移实验:用数学的CritBank去指导GPQA的科学问答,竟然也能比标准ICL有提升;反过来用GPQA构建的CritBank指导数学推理,同样有效。虽然领域专属的CritBank效果最好,但混合域的CritBank也不会拖后腿。这个结果的意义在于,失败模式在某种程度上是跨任务通用的——不管是数学里的计算失误,还是化学里的概念混淆,本质上都是模型推理过程中的系统性偏差。
表格16:GPQA基准上各科学领域的性能对比
表格16:GPQA基准上各科学领域的性能对比。CritICL在化学、生物、物理和量子力学全部一致提升。
这里龙哥必须多说一句:CritICL的本质其实是对“失败”这种数据的重新定价。过去失败样本是负样本,是训练时要被压低的信号;现在失败模式变成了提示词里的路标,是推理时要主动参考的导航信息。这种视角反转,比单纯涨几个点的准确率更有启发意义。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?同族小模型的失败绝非废料。CritICL把小模型的错误整理成批评库,再以动态预测或静态画像的方式喂给大模型做上下文示例,一次解码就超越多次采样,Qwen2.5-72B平均准确率达59.2%,token成本直降三成。
这篇工作最值得看的点是什么?CritICL-static在Qwen2.5-72B上达到59.2%平均准确率,超过所有基线包括Consistency@5(59.0%);在Llama-3.1-70B上达到53.1%,显著超过最强基线Consistency@5(51.3%);同时token消耗仅为测试时扩展方法的50-70%
这篇工作的边界或风险在哪里?优点:(1)提出利用弱模型失败模式增强强模型推理的新范式,无需额外训练;(2)CritBank可离线构建并重复使用,推理时仅需单次生成,效率极高;(3)在数学推理和科学领域均验证有效性;(4)提供了丰富的消融实验和统计分析。缺点:(1)依赖同模型家族内失败模式分布的一致性假设,跨家族迁移效果显著下降;(2)CritBank构建需要前沿LLM标注,存在离线成本;(3)动态变体需要额外一次失败模式预测生成,增加推理开销;(4)在AIME等小规模基准上改进不显著。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出CritICL框架,通过离线构建包含失败模式标签和批评性反馈的CritBank,在推理时利用弱模型的结构化失败模式检索针对性示例,以单次生成实现高效的大模型推理增强。

实验合理度:★★★★☆

Pass@1准确率,平均token消耗,Spearman相关系数,Kendall's τ,Top-10重叠率,JS距离

学术研究价值:★★★★☆

提出CritICL框架,通过离线构建包含失败模式标签和批评性反馈的CritBank,在推理时利用弱模型的结构化失败模式检索针对性示例,以单次生成实现高效的大模型推理增强;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

CritICL-static仅需1次生成,CritICL-dynamic需2次生成(含失败模式预测步骤),总token消耗3768-3897,远低于测试时扩展方法的4192-7533

复现难度:★★★☆☆

https://github.com/umwyf/CRITICL

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:模式增强强模型推理的新范式,无需额外训练;(2)CritBank可离线构建并重复使用,推理时仅需单次生成,效率极高;(3)在数学推理和科学领域均验证有效性;(4)提供了丰富的消融实验和统计分析。缺点:(1)依赖同模型家族内失败模式分布的一致性假设,跨家族迁移效果显著下降;

主要参考文献

[1] Yufan Wu, Yinghui He, Zhengyi Hu, et al. CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes. arXiv preprint arXiv:2608.27455, 2026.
[2] Wang et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023.
[3] Madaan et al. Self-Refine: Iterative Refinement with Self-Feedback. NeurIPS 2023.
[4] Burns et al. Weak-to-Strong Generalization: Eliciting Strong Capabilities with Weak Supervision. ICML 2024.
[5] Didolkar et al. Metacognitive Capabilities of LLMs: An Exploration in Mathematical Problem Solving. NeurIPS 2024.
[6] Yang et al. Qwen2.5 Technical Report. arXiv preprint arXiv:2412.15115, 2024.
[7] Cobbe et al. Training Verifiers to Solve Math Word Problems. arXiv preprint arXiv:2110.14168, 2021.
[8] Hendrycks et al. Measuring Mathematical Problem Solving with the MATH Dataset. NeurIPS 2021.


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球