← 返回 PaperDaily
大模型与智能体
数学推理新方法:CANON在无标签场景涨分12点
无标签训练最怕什么?怕信号太稀,怕算力太贵。CANON偏偏把“多数投票”变成了每个token都能学的监督信号,结果是:更省算力,推理还更准。
龙哥读论文
发布于 2026-08-19 00:20:04
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 无标签训练最怕什么?怕信号太稀,怕算力太贵。CANON偏偏把“多数投票”变成了每个token都能学的监督信号,结果是:更省算力,推理还更准。
原论文信息如下:
大模型无标签训练新范式:将共识变成“特权信息”
无标签训练最难的地方,不是“没有数据”,而是“没有够硬的监督信号”。这篇论文盯上的,正是大模型推理里最值钱、却常被浪费的一类信号:多数投票形成的共识 。过去的方法通常只把共识当成一个筛选器、偏好对、或者一个标量奖励,等于把一整桶牛奶只喝了表面那一层。
CANON 的思路更狠一点:既然多数样本都指向同一个答案,那就别只拿这个答案做“标签”,而是把它当成一种特权上下文 ,让一个冻结的教师模型围绕这条共识推理线,给学生模型提供逐 token 的密集监督。说人话就是:把“大家都觉得对”这件事,变成“每个字都能学”的训练信号 。
这篇工作还有个很现实的优点:它不是在玩概念,而是在算账。论文的结论很直接——在数学和科学推理任务上,CANON 最高能把 pass@1 拉高 12 个点,算力只用无标签强化学习的大约七分之一,效果还逼近“拿金标准答案当教师”的上限。对做大模型落地的人来说,这种结果比“方法听起来很美”更有杀伤力。🤨
揭秘CANON:如何将多数投票转化为密集的token级监督?
先把名字拆开看。CANON 是 Consensus-ANchored self-distillatiON ,中文可以理解成“以共识为锚点的自蒸馏 ”。这里的关键词不是“蒸馏”,而是“锚点”:它不是让模型学一个最终答案,而是让模型沿着一条已经被多数样本证明更靠谱的推理轨迹去对齐。
论文的方法流程其实很工整,核心就三步。第一步,对每个无标签问题采样 N 条解答,并从中找出多数答案。第二步,在所有命中这个多数答案的解答里,挑一个平均 token 置信度最高的解答,作为“共识解”。第三步,把这个共识解塞进冻结教师的上下文里,让教师在学生自己的 rollout 上逐 token 输出分布,学生则用 Jensen-Shannon 散度 去贴近教师。
这里的 Jensen-Shannon 散度,英文全称是 Jensen-Shannon Divergence ,中文一般叫“詹森-香农散度”。它和常见的 KL 散度相比更稳定、更对称,也不会像某些奖励式训练那样一脚踩空就炸。论文把它用在 token 分布层面,本质上是在说:别只告诉学生“这个答案对”,而是告诉它“每一步该往哪边走”。
这个设计和以前方法的差别,说白了就是“稀疏奖励 ”对“密集蒸馏 ”。无标签强化学习通常只给一条轨迹一个分数,模型得自己猜哪里做对了、哪里做错了;CANON 则直接把共识轨迹的分布当老师,连中间每个 token 的倾向都告诉学生。训练信号密度高了,优化自然就没那么“瞎撞墙”。
更妙的是,这套流程只需要一次采样。N 条 rollout 既拿来投票,又拿来做蒸馏素材,单个问题不需要反复生成、反复更新、反复赌运气。对工程实现来说,这一点很值钱:少一轮生成,就少一轮算力和时间的燃烧 。
实验对比:CANON如何在精度和算力上双杀无标签强化学习?
论文的实验设置很有针对性:模型主力是 Qwen3-4B-Instruct-2507,任务覆盖 AMC、AIME 2024/2025、GPQA-Diamond 和 MATH500。这个组合有个好处——既能测数学推理,也能测科学问答,还能看出方法到底是在“刷熟题”,还是在真提能力。更关键的是,作者把所有方法都放在同一套冻结评测框架下,尽量避免“谁更会调参谁赢”的老毛病。
如果只看无标签强化学习那一堆方法,TTRL、EMPO、SCRL、TTRL-Guard 都在 70 分上下打转,彼此差距不大,但离 CANON 还有明显距离。更有意思的是,CANON 甚至逼近了“用金标准答案做教师”的 oracle distillation,说明共识并不是一个廉价替代品,而是一个相当接近金标信息的有效代理 。
这组结果最值得注意的,不是 CANON 单次分数有多高,而是它的精度-算力比 。无标签 RL 往往要很多轮优化、很多次重新生成,才能把一点点共识信号“磨”出来;CANON 直接把那点信号变成密集监督,省去了大量空转。对实际训练来说,这意味着“涨分”不再一定要靠堆训练步数硬怼。
其中一个很现实的细节是,MATH500 上有些模型涨幅不大,甚至接近饱和。这反而说明 CANON 不是“见题就涨”的万能药,而是在模型还没把共识吃干榨净的时候最有效 。换句话说,越是还有“多数票和单次答案之间的差距”,CANON 越有发挥空间。
深入分析:CANON的提升仅仅是分布锐化吗?它真的学会了新知识?
一个很常见的质疑是:这类方法是不是只是把输出分布“磨尖”了,原本会的题更自信,不会的题还是不会?论文专门拿这个问题做了分析,答案并不那么简单。CANON 的增益确实包含一部分分布重整,但不只是把概率质量往已有答案上挤。
但这也恰恰解释了它为什么有效:CANON 不是在创造知识,而是在把模型已经“隐约知道”的东西,稳定地写进参数里 。所以它最适合的场景,是“模型有能力,但不够稳;有共识,但没被充分利用”的地方。
这里的结论很工程化:冻结快照比在线教师更稳 ,而且能防止训练过程中“老师跟着学生一起跑偏”。这也是 CANON 能在少量步数里稳定发挥的原因之一。很多论文喜欢说“简单有效”,但真正简单有效的前提,是把容易翻车的环节提前锁死。
何时使用CANON?一张图看懂共识监督的适用条件
CANON 不是“任何任务都能上”的万能键,它对任务有明显要求。最基本的一条是:问题必须能从模型采样里抽出可比较的最终答案,比如 boxed 数学答案、选择题选项等。第二条是:基座模型得有一定的自洽能力,不然连多数答案都凑不出来,共识锚点也就无从谈起。
论文还给出一个很实在的结论:当模型在某些题上已经高度饱和时,CANON 的空间会变小。反过来,越是“单次解答不稳、但投票后明显变强”的模型和任务,越适合用这种共识监督。这个规律对实际选型很有帮助,至少能避免把算力浪费在本来就没多少上升空间的地方。
如果把这篇论文压缩成一句话,那就是:当“多数投票”已经能给出靠谱方向时,最聪明的做法不是反复投票,而是把这条方向写进模型参数 。这比单纯做测试时投票更像真正的训练,也比无标签 RL 更像“把信号吃干榨净”。
总结与展望:无标签自蒸馏的未来方向
这篇工作最有价值的地方,不只是拿到了不错的分数,而是把一个朴素但常被低估的事实说透了:模型自己的一致性,本身就是一种可训练资产 。过去很多无标签方法把它压成一个分数,CANON 则把它展开成一整段监督信号,这个动作很像“把压缩包解开”,信息自然就多了。
不过它也有清晰边界:如果任务没有稳定的可抽取答案,或者模型本身连共识都凑不出来,那 CANON 的作用会明显受限。再往前一步看,这类方法未来真正值得探索的,可能不是“把共识用得更狠”,而是怎样在更弱监督、更复杂输出形式下构造类似的密集锚点 。这才是下一阶段更难、也更有意思的题。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“无标签训练信号太稀”的问题。以前共识只被当成筛选、偏好或标量奖励,CANON 则把共识变成逐 token 的密集监督,让模型能从自己的多数解里学到更细的推理路径。
JSD 和“冻结教师”分别在干什么? JSD 用来让学生分布贴近教师分布,而且比单纯的硬标签更平滑;冻结教师则是防止老师和学生一起漂、一起塌。一个负责“怎么学”,一个负责“别学歪”。
CANON 是不是所有题都能用? 不是。它更适合能抽取最终答案、且模型本身已经有一定共识基础的任务。对于完全没覆盖到、或者多数票本身就错得很稳的题,CANON 没法凭空造出正确知识。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把“多数投票”升级成“特权上下文”,思路很顺,且确实把共识信号用密了,不是换皮。
实验合理度: ★★★★☆。对比了无标签 RL、金标训练和 oracle 教师,算力也一起报,比较像真正的工程评估。
学术研究价值: ★★★★☆。它回答了一个很关键的问题:没有标签时,模型自己的共识能不能当监督。答案是能,而且还挺能。
稳定性: ★★★☆☆。在有共识、可抽取答案的任务上稳定,但对完全无共识或高度饱和任务,收益有限。
适应性以及泛化能力: ★★★★☆。跨模型、跨基准都能起作用,说明不是只对单一底座“专属适配”。
硬件需求及成本: ★★★★☆。相较无标签 RL 省很多,单 epoch 成本低,工程上更友好。
复现难度: ★★★☆☆。方法不算复杂,但仍依赖采样、答案抽取和稳定评测框架,细节要做扎实。
产品化成熟度: ★★★☆☆。适合数学/选择题等可验证场景,离通用产品化还差一段路。
可能的问题: 共识错了就会把错路锚得更牢;对共识稀薄或开放式任务,收益会明显下降。
主要参考文献
John Gkountouras, Josip Jukic, Ivan Titov. Consensus as Privileged Context for Label-Free Self-Distillation. arXiv:2607.13643v1, 2026.
Wang et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. 2022.
Zuo et al. Test-Time Reinforcement Learning with Majority-Vote Pseudo-Reward. 2025.
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群