← 返回 PaperDaily 大模型与智能体

答案泄露让蒸馏掉16.2分,最新论文警告

这篇论文专门盯住一个很阴险的问题:正确答案提前露给模型,训练数据就“看起来都对”,但学生模型还是会被带歪。它不是在讨论玄学,而是用一比特实验把锅精准甩给“答案可见”。

答案泄露让蒸馏掉16.2分,最新论文警告
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇论文专门盯住一个很阴险的问题:正确答案提前露给模型,训练数据就“看起来都对”,但学生模型还是会被带歪。它不是在讨论玄学,而是用一比特实验把锅精准甩给“答案可见”。


原论文信息如下:
论文标题:
Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models
发表日期:
2026年07月
发表单位:
Korea University, Zoom Communications, Yonsei University
原文链接:
https://arxiv.org/pdf/2607.14552v1.pdf
开源代码链接:
https://github.com/js-lee-AI/answer-leakage
项目链接:
https://github.com/js-lee-AI/answer-leakage
推理蒸馏这件事,表面看像“把老师的本事抄给学生”,听起来很省事;但这篇论文直接戳破了一个很现实的幻觉:正确答案先露出来,并不等于训练数据就干净。更扎心的是,常见的正确性过滤器还真看不出来这种“数据被悄悄带歪”的问题。
封面
图1:一比特实验的核心框架图。唯一变化只有一个比特:生成思维链时,模型到底能不能看到黄金答案。
这类论文最有价值的地方,不是又发明了一个花哨名词,而是把“看起来没问题”的训练流程拆开看:到底是模型不行,还是数据生成方式在悄悄下毒。

揭示推理蒸馏的隐藏陷阱:答案泄露

先把概念说人话。这里的“推理蒸馏”,指的是把大模型的思维链(Chain of Thought, CoT)拿来训练学生模型,让学生学会像老师一样一步步推理。问题出在一个很常见的修补动作:如果模型自己采样出来的推理链不够好,很多流程会把标准答案先塞给模型,再让它“顺着答案写一条能走到终点的推理链”。
听起来很合理:只要最后答案对了,链条就该能用。论文偏偏说,这个假设不成立。因为答案可见时生成出来的链条,可能不是“推导”,而是“合理化”——先看结果,再编故事。正确性过滤器只会检查最后答案对不对,看不见这种“思路方向反了”的问题。
论文把这种现象叫作 answer leakage,中文可以理解为“答案泄露”或“答案条件化泄露”。它不是说答案本身有毒,而是说:当模型知道答案后再写推理,产出的数据分布就变了。学生模型学到的,不再是未知答案下的搜索过程,而是已知答案后的事后解释。
这篇论文最狠的地方在于,它不是泛泛地说“可能有影响”,而是直接给出量化结果:在 Qwen3-8B 上,答案条件化生成的蒸馏数据会让学生在 MATH-500 上掉16.2 分,在更难的 AIME 题上甚至能掉到27.2 分。这已经不是“有点影响”,而是“训练方向都被拧歪了”。
表1:Qwen3-8B 上的答案泄露惩罚,以及不同难度基准上的对比结果
表1:Qwen3-8B 上的答案泄露惩罚。Blind 是答案盲生成,Leaked 是答案可见生成,Penalty 表示 Blind 减去 Leaked 的差值。可以看到,题目越难,惩罚越大。

单比特实验:精准隔离因果

这篇论文没有走“堆一堆实验再讲故事”的老路,而是设计了一个很干净的因果实验:单比特实验(one-bit experiment)。所谓“单比特”,就是只改一个变量——生成思维链时,模型是否看得到标准答案。其它东西全锁死:同一个生成器、同一批问题、同一种正确性过滤器、同一种监督微调配方。
图1:单比特实验框架图
图1:单比特实验框架图。左边是答案盲路径,右边是答案可见路径。两边唯一的差异,就是生成时有没有看到黄金答案。
这种设计的好处很直接:如果最后结果不同,就很难把锅甩给别的因素。论文把这个差异压缩成一个比特,等于把“答案泄露到底害不害人”这个问题从大杂烩里拎了出来,单独审判。
实验流程也很朴素:先让同一个模型分别在答案盲和答案可见两种提示下生成推理链;然后只保留最终答案正确的链;最后拿这些链去监督微调两个学生模型。按常识看,这应该已经很公平了——都过了正确性筛选,怎么也该差不多吧?论文的结果是:差得还真不小
图3:泄露惩罚随评测 token 预算变化
图3:泄露惩罚随评测 token 预算变化。预算越紧,答案可见训练出来的模型越吃亏,说明问题不只是“答得对不对”,还包括“能不能在有限推理长度内真正收敛”。
这张图其实透露出一个很工程化的信号:答案泄露会把模型训练成“会讲故事但不一定会收口”的风格。评测预算一收紧,问题就暴露了——不是推不出来,而是推理过程更容易拖沓、发散,最后连正确答案都来不及稳定落笔。

机制揭秘:从“推导”到“合理化”的转变

论文给出的机制解释很清楚:答案一旦可见,模型就更容易把正确答案提前写出来,然后围着它补理由。这和真正的“从未知到已知”的搜索过程不是一回事,而是先有结论,再补叙事。
为了把这个现象量化,论文定义了一个很关键的指标:Answer-First Rate, AFR,中文可以叫“答案优先率”。它的意思很简单:在一条思维链里,黄金答案是不是很早就被说出来了。论文把“在推理块前 20% 以内就说出答案”的链条记为 answer-first。AFR 越高,说明越像在合理化;AFR 越低,越像在真正推导
图2:答案位置、答案优先率与链长变化
图2:答案位置、答案优先率与链长变化。答案可见后,推理链更容易把答案放在前面;而且这种习惯还会传到学生模型自己的输出里。
这张图的意思很直白:答案条件化不仅改变了训练链本身,还会把学生模型训练成一种“先报答案,再慢慢解释”的坏习惯。更麻烦的是,这种坏习惯在评测时也会冒出来,说明它不是表面噪声,而是已经被学进去了。
论文还做了一个很有说服力的控制:把答案可见的提示改成不同风格。结果发现,真正带来伤害的是“围绕答案去合理化”这条指令,而不是“答案本身被看见”这件事。换句话说,不是所有看到答案的场景都一样糟,最糟的是那种明示模型“请围着答案编一条能走到它的链”。
论文还做了一个很“工程师味道”的验证:把答案可见数据里那些一上来就报答案的链条单独挑出来,看看它们是不是主要“罪犯”。结果表明,确实是它们在承担大部分伤害。也就是说,模型不是被所有答案可见样本平均拖累,而是被这类“先结论后解释”的链条重点带偏。
表7:答案位置统计
表7:匹配链对上的答案位置统计。这里的关键不是“有没有答案”,而是“答案出现在推理的什么位置”。

预测伤害:训练前就能看出的“答案优先率”

这部分很有意思。论文没有只停留在“训练后发现坏了”,而是进一步问:能不能在训练前就看出某个教师模型会不会把学生带歪?
答案是可以。论文定义了一个简单但很实用的信号:ΔAFR = AFRleaked − AFRblind,也就是答案可见时的答案优先率减去答案盲时的答案优先率。这个差值越大,说明模型越容易在看见答案后提前把答案说出来,也就越可能在蒸馏后带来更大惩罚。
图4:ΔAFR 与答案泄露惩罚的关系
图4:ΔAFR 与答案泄露惩罚的关系。八个思维模型、四个家族,相关性很强,说明这个信号不是偶然噪声,而是一个能提前读出风险的“体征”。
这就很像给教师模型做“体检”。不需要先把学生训一遍再后悔,只要拿教师模型少量无标注生成样本,算一下 ΔAFR,就能大致判断它的答案泄露风险。论文里这个指标在八个模型上和真实惩罚的相关系数达到 r = 0.960,还可以跨家族预测未见过的模型,平均绝对误差只有 2.9 分。对做数据筛选的人来说,这种东西比“训完再看天命”靠谱多了。
表4:留出模型的泄露惩罚预测
表4:用训练前的答案优先率信号,预测留出模型后续会损失多少准确率。预测值和真实值非常接近。
这也是这篇论文最“实用”的地方之一:它不只告诉大家有坑,还给了一个训练前筛教师的方法。对真实项目而言,这比事后复盘更值钱,因为训练成本往往已经烧掉了,能提前筛掉坏数据,才是真省钱。

跨越模型与领域的普适性验证

如果只是某一个模型、某一类题目出问题,那还可以说是个别现象。但论文把实验扩展到多个模型、多个家族、多个任务后,结论依然站得住:答案泄露伤害的是“需要推导”的任务,而不是所有任务
在数学题上,问题很稳定:从小学算术到竞赛题,答案可见训练都更差,而且越难越明显。到了代码任务,情况也一样——即便最终代码能通过测试,答案可见生成的链条依然会把学生模型带歪。这里的关键不是“答案对不对”,而是“推理过程是不是被答案提前截断了”。
表5:跨领域与跨教师家族的泛化结果
表5:把同一比特实验扩展到代码领域、不同规模学生,以及不同教师家族之后,答案泄露带来的惩罚依然稳定存在。
更有意思的是,论文还验证了跨教师家族的情况。也就是说,这不是某一家模型“脾气怪”,而是一个更普遍的生成机制问题。只要训练数据是“看了答案再写推理”,学生就可能学到错误的推理习惯。这个结论对蒸馏流水线很重要,因为它意味着问题不在某个模型名气大不大,而在数据生成策略本身。
论文还做了长度匹配控制:把答案盲链条裁到和答案泄露链条一样长。结果惩罚并没有消失,说明锅不是“长短不一”,而是内容本身。这个控制很关键,因为很多人一看结果变差,第一反应就是“是不是泄露链更短,所以学得少”。这篇论文把这种偷懒解释直接堵死了。
表13:跨家族与代码转移的长度匹配控制
表13:长度匹配控制。把答案盲链条裁到和泄露链条一样长后,性能差距依然存在,说明问题不在长度,而在生成内容的方向。

实用指南:如何避免“答案泄露”

论文最后给出的建议其实很朴素,但很管用:尽量答案盲生成。如果必须看答案,那也尽量让提示语变成“先推导,再给出答案”,而不是“围着答案合理化”。论文显示,这种改法能恢复掉失性能的一大部分。
对做数据工程的人来说,这篇论文给了三个很现实的动作。第一,训练前先用 ΔAFR 这种轻量指标筛一遍教师模型,别等学生训完才发现踩雷。第二,对答案可见生成的数据,尽量过滤掉那些一上来就报答案的链条。第三,别把“最终正确”当成“推理质量足够好”的同义词,这两个东西在这篇论文里被明确拆开了。
如果把视角放到产品落地,这个结论也很实在。很多团队喜欢把“有答案的链条”当成更稳的训练数据,因为它看起来更容易过滤、更容易过测试。可这篇论文提醒得很直接:你以为自己在清洗数据,实际上可能是在给学生灌输错误的推理姿势。这种问题一旦进了模型,后面再修,成本可就不止一点点了。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“推理蒸馏里,正确答案提前可见会不会污染训练数据”这个问题。论文证明了:会,而且这种污染正确性过滤器看不见。

AFR 和 ΔAFR 分别是什么意思?AFR 是 Answer-First Rate,中文可理解为“答案优先率”,表示答案在思维链里是不是出现得很早;ΔAFR 是答案可见和答案盲两种提示下 AFR 的差值,用来预测某个教师模型会不会带来更大的泄露惩罚。

为什么“最终答案正确”还不够?因为正确不等于会推。答案可见时,模型可能只是学会了“围着答案讲故事”,而不是在未知答案时真正搜索、推导和收敛。对需要多步推理的任务,这种差别会直接反映到学生模型的准确率上。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。创新点不在模型结构,而在把一个常见训练习惯拆成了可验证的因果问题,方法不花哨,但切得很准。

实验合理度:★★★★★。单比特实验、长度匹配、跨家族、跨任务、留出预测,控制做得相当严,基本把“可能的借口”都堵上了。

学术研究价值:★★★★☆。它补上了推理蒸馏里一个长期被忽略的盲点,对数据生成和蒸馏理论都有启发。

稳定性:★★★★☆。结论跨模型、跨家族、跨领域都能复现,说明不是偶发现象;但实际流水线里还要看具体提示和过滤器配置。

适应性以及泛化能力:★★★★☆。对数学和代码这类可验证推理任务很适用,但对不需要显式推导的任务,惩罚不明显。

硬件需求及成本:★★★☆☆。论文本身的预测指标很轻,但完整复现蒸馏实验仍要不少训练成本;好在训练前筛教师这件事很省钱。

复现难度:★★★☆☆。代码开源是加分项,但依赖固定版本和受控检查点,复现时还是要认真对齐环境。

产品化成熟度:★★★☆☆。更适合先作为数据筛选和训练前诊断工具,直接拿去大规模生产还需要更多任务验证。

可能的问题:结论很强,但主要集中在可验证推理任务;对开放式生成、复杂对话或非结构化知识任务,外推要谨慎,别把“答案泄露”当成万能解释。


主要参考文献

Jungseob Lee, Seungyoon Lee, Suhyune Son, Dongyub Jude Lee, Sungbin Han, Sugyeong Eo, Heuiseok Lim. Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models. arXiv, 2026.
项目代码:https://github.com/js-lee-AI/answer-leakage
原文链接:https://arxiv.org/pdf/2607.14552v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。