← 返回 PaperDaily 大模型与智能体

数学推理新方法:CANON在无标签场景涨分12点

无标签训练最怕什么?怕信号太稀,怕算力太贵。CANON偏偏把“多数投票”变成了每个token都能学的监督信号,结果是:更省算力,推理还更准。

数学推理新方法:CANON在无标签场景涨分12点
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
无标签训练最怕什么?怕信号太稀,怕算力太贵。CANON偏偏把“多数投票”变成了每个token都能学的监督信号,结果是:更省算力,推理还更准。


原论文信息如下:
论文标题:
CONSENSUS AS PRIVILEGED CONTEXT FOR LABEL-FREE SELF-DISTILLATION
发表日期:
2026年07月
发表单位:
ILLC, University of Amsterdam; ILCC, University of Edinburgh
原文链接:
https://arxiv.org/pdf/2607.13643v1.pdf

大模型无标签训练新范式:将共识变成“特权信息”

无标签训练最难的地方,不是“没有数据”,而是“没有够硬的监督信号”。这篇论文盯上的,正是大模型推理里最值钱、却常被浪费的一类信号:多数投票形成的共识。过去的方法通常只把共识当成一个筛选器、偏好对、或者一个标量奖励,等于把一整桶牛奶只喝了表面那一层。
CANON 的思路更狠一点:既然多数样本都指向同一个答案,那就别只拿这个答案做“标签”,而是把它当成一种特权上下文,让一个冻结的教师模型围绕这条共识推理线,给学生模型提供逐 token 的密集监督。说人话就是:把“大家都觉得对”这件事,变成“每个字都能学”的训练信号
这篇工作还有个很现实的优点:它不是在玩概念,而是在算账。论文的结论很直接——在数学和科学推理任务上,CANON 最高能把 pass@1 拉高 12 个点,算力只用无标签强化学习的大约七分之一,效果还逼近“拿金标准答案当教师”的上限。对做大模型落地的人来说,这种结果比“方法听起来很美”更有杀伤力。🤨
图1:CANON训练框架
图1:CANON 训练框架。给定一个无标签问题,模型先采样 N 个解,再从中抽取多数答案;随后冻结一个模型快照,并把某个到达该共识答案的解作为“锚点”,让教师模型沿着这条共识推理线给学生提供逐 token 监督。梯度不回传到教师,单次生成同时完成共识提取和蒸馏素材构造。

揭秘CANON:如何将多数投票转化为密集的token级监督?

先把名字拆开看。CANON 是 Consensus-ANchored self-distillatiON,中文可以理解成“以共识为锚点的自蒸馏”。这里的关键词不是“蒸馏”,而是“锚点”:它不是让模型学一个最终答案,而是让模型沿着一条已经被多数样本证明更靠谱的推理轨迹去对齐。
论文的方法流程其实很工整,核心就三步。第一步,对每个无标签问题采样 N 条解答,并从中找出多数答案。第二步,在所有命中这个多数答案的解答里,挑一个平均 token 置信度最高的解答,作为“共识解”。第三步,把这个共识解塞进冻结教师的上下文里,让教师在学生自己的 rollout 上逐 token 输出分布,学生则用 Jensen-Shannon 散度去贴近教师。
这里的 Jensen-Shannon 散度,英文全称是 Jensen-Shannon Divergence,中文一般叫“詹森-香农散度”。它和常见的 KL 散度相比更稳定、更对称,也不会像某些奖励式训练那样一脚踩空就炸。论文把它用在 token 分布层面,本质上是在说:别只告诉学生“这个答案对”,而是告诉它“每一步该往哪边走”。
公式1
公式1:多数答案的定义。对每个问题,先统计 N 个采样解答里哪个最终答案出现次数最多,得到共识答案 âax。这里的 ai 是第 i 个解答提取出的最终答案,𝒜 是候选答案集合。
公式2
公式2:从多数答案里挑出“共识解”。不是随便抓一条命中多数答案的轨迹就完事,而是要在这些轨迹里选平均 token 置信度最高的那条。这样做的直觉很简单:同样是到达正确答案,更稳、更顺、更像一条靠谱推理链的解答,更适合当教师锚点。
公式3
公式3:CANON 的训练目标。学生模型在自己的 rollout 上,逐 token 去贴近“带着共识上下文”的冻结教师分布。x 是问题,sx 是共识解,y(i) 是第 i 条采样轨迹。这个式子最关键的地方在于:监督不是压在最终答案上,而是铺满整条生成序列。
这个设计和以前方法的差别,说白了就是“稀疏奖励”对“密集蒸馏”。无标签强化学习通常只给一条轨迹一个分数,模型得自己猜哪里做对了、哪里做错了;CANON 则直接把共识轨迹的分布当老师,连中间每个 token 的倾向都告诉学生。训练信号密度高了,优化自然就没那么“瞎撞墙”。
更妙的是,这套流程只需要一次采样。N 条 rollout 既拿来投票,又拿来做蒸馏素材,单个问题不需要反复生成、反复更新、反复赌运气。对工程实现来说,这一点很值钱:少一轮生成,就少一轮算力和时间的燃烧

实验对比:CANON如何在精度和算力上双杀无标签强化学习?

论文的实验设置很有针对性:模型主力是 Qwen3-4B-Instruct-2507,任务覆盖 AMC、AIME 2024/2025、GPQA-Diamond 和 MATH500。这个组合有个好处——既能测数学推理,也能测科学问答,还能看出方法到底是在“刷熟题”,还是在真提能力。更关键的是,作者把所有方法都放在同一套冻结评测框架下,尽量避免“谁更会调参谁赢”的老毛病。
表1:方法与监督对比
表1:方法与监督对比。所有方法都在同样的 83 个无标签 AMC 问题上训练,再去看 AMC 的转导结果,以及没见过的 AIME 2024、AIME 2025、GPQA 上的表现。表里最扎眼的不是“谁用了标签”,而是CANON 在无标签方法里几乎一骑绝尘:AMC 上到 76.5,平均分到 49.4,算力只要 1.2 GPU 小时。
如果只看无标签强化学习那一堆方法,TTRL、EMPO、SCRL、TTRL-Guard 都在 70 分上下打转,彼此差距不大,但离 CANON 还有明显距离。更有意思的是,CANON 甚至逼近了“用金标准答案做教师”的 oracle distillation,说明共识并不是一个廉价替代品,而是一个相当接近金标信息的有效代理
图2:转导式AMC主对比
图2:转导式 AMC 主对比。左图把精度和墙钟时间放在一起看,CANON 在 1.2 GPU 小时内就接近金标教师的上限,而 gold-reward GRPO 想追上它要花大约 11 小时,冲到更高还得 19 小时。右图则展示了 CANON 和深度重采样的 oracle teacher 之间的差距,最大缺口出现在 GPQA,说明共识能拿到大部分“金标教师”的价值,但还不能把所有场景都抹平
这组结果最值得注意的,不是 CANON 单次分数有多高,而是它的精度-算力比。无标签 RL 往往要很多轮优化、很多次重新生成,才能把一点点共识信号“磨”出来;CANON 直接把那点信号变成密集监督,省去了大量空转。对实际训练来说,这意味着“涨分”不再一定要靠堆训练步数硬怼。
表2:跨模型、跨基准的转导结果
表2:跨模型、跨基准的转导结果。CANON 不只在 Qwen3-4B 上有效,换到 Qwen3.5-2B、Qwen3.5-9B、SmolLM3-3B、Gemma-4-E4B-it 甚至 MoE 模型上,整体也都能涨。更重要的是,提升不是只发生在某一个模型家族里,这比“只对某个底座灵”的方法更像能迁移的训练范式。
其中一个很现实的细节是,MATH500 上有些模型涨幅不大,甚至接近饱和。这反而说明 CANON 不是“见题就涨”的万能药,而是在模型还没把共识吃干榨净的时候最有效。换句话说,越是还有“多数票和单次答案之间的差距”,CANON 越有发挥空间。

深入分析:CANON的提升仅仅是分布锐化吗?它真的学会了新知识?

一个很常见的质疑是:这类方法是不是只是把输出分布“磨尖”了,原本会的题更自信,不会的题还是不会?论文专门拿这个问题做了分析,答案并不那么简单。CANON 的增益确实包含一部分分布重整,但不只是把概率质量往已有答案上挤。
图4:按难度分带的收益
图4:按难度分带的收益。收益主要集中在最难的题上,尤其是那些基座模型原本一次也没做对的问题,pass@32 还能提升 33.3 个点。这个现象挺说明问题:CANON 不是单纯给“本来就会的题”抹亮,而是把一部分原本没有被模型稳定抓住的解法,重新拉进了可学习区域
表4:共识与覆盖效应
表4:共识与覆盖效应。这里直接把一个事实摆在桌面上:如果多数票本身是错的,CANON 没法凭空把它变对;如果某题在基座模型里从来没有被任何采样命中过,CANON 也没法从空气里造出答案。这不是缺点装优点,而是无标签方法的边界条件。
但这也恰恰解释了它为什么有效:CANON 不是在创造知识,而是在把模型已经“隐约知道”的东西,稳定地写进参数里。所以它最适合的场景,是“模型有能力,但不够稳;有共识,但没被充分利用”的地方。
表6:条件梯度对比
表6:条件梯度对比。CANON 只比基线多了一种东西:共识解作为教师上下文。如果把这层内容拿掉,收益就会明显缩水;换成金标解决方案,性能还能再往上顶一点,但差距并没有大到“换了一个宇宙”。这说明共识确实承担了“特权信息”的角色,而不是摆设。
表7:设计与机制消融
表7:设计与机制消融。几个关键设计都不是随手加的装饰:冻结教师、一次生成、共识锚定、JSD 目标,缺了任何一个,结果都会掉。尤其是“活教师”版本很容易出现塌缩迹象,说明教师如果跟学生一起漂,最后容易变成互相带偏,而不是互相校正。
这里的结论很工程化:冻结快照比在线教师更稳,而且能防止训练过程中“老师跟着学生一起跑偏”。这也是 CANON 能在少量步数里稳定发挥的原因之一。很多论文喜欢说“简单有效”,但真正简单有效的前提,是把容易翻车的环节提前锁死。

何时使用CANON?一张图看懂共识监督的适用条件

CANON 不是“任何任务都能上”的万能键,它对任务有明显要求。最基本的一条是:问题必须能从模型采样里抽出可比较的最终答案,比如 boxed 数学答案、选择题选项等。第二条是:基座模型得有一定的自洽能力,不然连多数答案都凑不出来,共识锚点也就无从谈起。
表5:按票占比划分的收益
表5:按票占比划分的收益。收益集中在“多数票已经有点像对的,但还不够稳”的区间。也就是说,CANON 最擅长修补的是“半对半不对”的题,而不是把完全没戏的题硬拉起来。
论文还给出一个很实在的结论:当模型在某些题上已经高度饱和时,CANON 的空间会变小。反过来,越是“单次解答不稳、但投票后明显变强”的模型和任务,越适合用这种共识监督。这个规律对实际选型很有帮助,至少能避免把算力浪费在本来就没多少上升空间的地方。
如果把这篇论文压缩成一句话,那就是:当“多数投票”已经能给出靠谱方向时,最聪明的做法不是反复投票,而是把这条方向写进模型参数。这比单纯做测试时投票更像真正的训练,也比无标签 RL 更像“把信号吃干榨净”。

总结与展望:无标签自蒸馏的未来方向

这篇工作最有价值的地方,不只是拿到了不错的分数,而是把一个朴素但常被低估的事实说透了:模型自己的一致性,本身就是一种可训练资产。过去很多无标签方法把它压成一个分数,CANON 则把它展开成一整段监督信号,这个动作很像“把压缩包解开”,信息自然就多了。
不过它也有清晰边界:如果任务没有稳定的可抽取答案,或者模型本身连共识都凑不出来,那 CANON 的作用会明显受限。再往前一步看,这类方法未来真正值得探索的,可能不是“把共识用得更狠”,而是怎样在更弱监督、更复杂输出形式下构造类似的密集锚点。这才是下一阶段更难、也更有意思的题。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“无标签训练信号太稀”的问题。以前共识只被当成筛选、偏好或标量奖励,CANON 则把共识变成逐 token 的密集监督,让模型能从自己的多数解里学到更细的推理路径。

JSD 和“冻结教师”分别在干什么?JSD 用来让学生分布贴近教师分布,而且比单纯的硬标签更平滑;冻结教师则是防止老师和学生一起漂、一起塌。一个负责“怎么学”,一个负责“别学歪”。

CANON 是不是所有题都能用?不是。它更适合能抽取最终答案、且模型本身已经有一定共识基础的任务。对于完全没覆盖到、或者多数票本身就错得很稳的题,CANON 没法凭空造出正确知识。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把“多数投票”升级成“特权上下文”,思路很顺,且确实把共识信号用密了,不是换皮。

实验合理度:★★★★☆。对比了无标签 RL、金标训练和 oracle 教师,算力也一起报,比较像真正的工程评估。

学术研究价值:★★★★☆。它回答了一个很关键的问题:没有标签时,模型自己的共识能不能当监督。答案是能,而且还挺能。

稳定性:★★★☆☆。在有共识、可抽取答案的任务上稳定,但对完全无共识或高度饱和任务,收益有限。

适应性以及泛化能力:★★★★☆。跨模型、跨基准都能起作用,说明不是只对单一底座“专属适配”。

硬件需求及成本:★★★★☆。相较无标签 RL 省很多,单 epoch 成本低,工程上更友好。

复现难度:★★★☆☆。方法不算复杂,但仍依赖采样、答案抽取和稳定评测框架,细节要做扎实。

产品化成熟度:★★★☆☆。适合数学/选择题等可验证场景,离通用产品化还差一段路。

可能的问题:共识错了就会把错路锚得更牢;对共识稀薄或开放式任务,收益会明显下降。


主要参考文献

John Gkountouras, Josip Jukic, Ivan Titov. Consensus as Privileged Context for Label-Free Self-Distillation. arXiv:2607.13643v1, 2026.
Wang et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. 2022.
Zuo et al. Test-Time Reinforcement Learning with Majority-Vote Pseudo-Reward. 2025.

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。