← 返回 PaperDaily 大模型与智能体

DeepSeek教Qwen7B做题:蒸馏后准确率涨4.76%

这篇论文不玩虚的,直接拿 DeepSeek-R1 教 Qwen2.5-7B 做数学题,结果不是“玄学提升”,而是能稳定涨分,还顺手把“推理长度一缩水,准确率就掉”这件事讲明白了。对想做小模型蒸馏、数学推理和本地部署的人,都挺有参考价值。

DeepSeek教Qwen7B做题:蒸馏后准确率涨4.76%
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文不玩虚的,直接拿 DeepSeek-R1 教 Qwen2.5-7B 做数学题,结果不是“玄学提升”,而是能稳定涨分,还顺手把“推理长度一缩水,准确率就掉”这件事讲明白了。对想做小模型蒸馏、数学推理和本地部署的人,都挺有参考价值。


原论文信息如下:
论文标题:
Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O’Bryan Mathematics Competition
发表日期:
2026年06月
发表单位:
Northern Kentucky University
原文链接:
https://arxiv.org/pdf/2606.31048v1.pdf
开源代码链接:
https://github.com/TempGaurab/Distillation.John-O-Bryan
项目链接:
https://github.com/TempGaurab/Distillation.John-O-Bryan

数学竞赛难题有救了!知识蒸馏让小模型也能“思考”

这篇论文最有意思的地方,不是“又做了一个蒸馏”,而是它把一个很现实的问题摆到了台面上:大模型会做题,小模型也想做题,但推理能力不能只靠嘴上说说。 真正落地时,很多团队既想要数学推理能力,又想要本地部署、低成本、低显存。结果往往是:大模型太贵,小模型太笨。于是,这篇工作就干了一件很务实的事——拿 DeepSeek-R1 当老师,把它的推理过程“教”给 Qwen2.5-7B 这个学生模型。
封面
封面:训练与验证损失曲线也把这篇论文的核心矛盾亮出来了——训练越久不一定越聪明,过拟合来得比答案还快。
项目的切入点也很接地气:不是拿一堆“网上通用题”糊弄,而是直接用 Northern Kentucky University 的 John O’Bryan Mathematics Competition 历年题目做实验。这个选择很聪明,因为它更像真实教学和竞赛场景里的题,而不是被预训练语料污染得七七八八的公开刷题集。说白了,这不是在比谁背题背得多,而是在看谁真会推理。

双智能体框架:如何用DeepSeek R1“教”会小模型?

先把概念讲人话。知识蒸馏,可以理解成“老师把解题思路教给学生”,而不是只告诉学生最终答案。对数学题来说,这一点尤其关键,因为很多题不是算不出,而是中间步骤一断,最后答案就跟着跑偏
这篇论文的老师不是普通老师,而是 DeepSeek-R1。论文把它拆成了两个角色:Solver 负责先写出逐步推理链,Verifier 负责拿标准答案做核验,判断这条推理到底对不对。也就是说,不是“老师说啥都算数”,而是老师先做题,再由另一个老师检查。这个双智能体流程,至少比单纯拿模型输出当训练集更稳一点。
表2
表2:DeepSeek-R1 在各分区上的教师准确率。整体达到 91.4%,说明它拿来做“推理示范”是站得住脚的,不是那种自己都做不对题还要当老师的离谱设定。
这里还要补一个缩写:CoTChain-of-Thought,中文常译为“思维链”或“逐步推理链”;LoRALow-Rank Adaptation,中文叫“低秩适配”。前者解决“怎么教”,后者解决“怎么低成本学”。这两个东西一搭,论文的方法就很清楚了:先用老师生成高质量推理样本,再用 LoRA 去微调学生模型。

LoRA+早期停止:在小数据上训练大模型的秘诀

论文的训练策略其实很像“别贪”。它没有上来就把模型往死里训,而是先做了一个 1000 次迭代的诊断实验,看看验证集什么时候开始崩。结果很典型:训练损失一路往下掉,验证损失却在 200 次迭代左右到达最低点,之后开始反弹。这个信号非常明确——继续训练只会把训练集背得更熟,不会让模型更会做题
图2
图2:1000 次迭代中的训练与验证损失变化。验证损失在第 200 次迭代达到最低点 0.374,之后持续上升,说明小语料上的 LoRA 微调很容易过拟合。
这一步的价值不只是“找到一个好 checkpoint”,而是给出了一个很实用的经验:小数据蒸馏里,早期停止不是保守,是救命。 论文最后选定 200 次迭代,并且不是只跑一次就拍脑袋,而是用 5 个随机种子独立训练,看看结果稳不稳。这个做法很加分,因为单次跑分好看不等于方法可靠,尤其在小数据上,运气经常比算法还会抢戏。
表3
表3:关键迭代点上的训练损失、验证损失和困惑度。200 次迭代后验证困惑度最低,之后明显变差,说明模型开始“记题库”而不是“学规律”。
再看 LoRA 本身。它的思路不是把整个 7B 模型全部重训,而是只给注意力层挂上少量可训练的低秩参数。原文里可训练参数只有 1153.4 万,占整个模型的 0.151%。这意味着什么?意味着训练成本和存储成本都压下来了,苹果芯片也能跑,至少在“本地蒸馏一个数学助手”这件事上,门槛没高到离谱。
公式1
公式1:蒸馏训练的标准目标函数。第一项是对真实答案的交叉熵,第二项是老师与学生输出分布之间的 KL 散度;但由于 DeepSeek-R1 通过接口调用,拿不到完整 logits,所以论文实际采用的是 基于思维链文本的监督微调,也就是把老师生成的推理过程直接当训练目标。

Token缩水,准确率暴跌:最小推理长度是多少?

这部分是整篇论文里最像“现实打脸”的地方。很多人以为大模型推理就是“多说两句”,但论文直接做了一个 token budget 实验:把输出长度从宽松状态一路压缩到 100 tokens,看看准确率会掉多少。结果很直白:推理不是废话,推理是空间。 空间一缩,步骤放不下,答案就开始乱。
表6
表6:不同推理长度等级 R1–R6 的响应长度与准确率。R1 平均约 220 词,准确率 69.43%;压到 R6 后平均只剩约 31 词,准确率跌到 41.9%。
这里最值得记住的不是某个单点数字,而是趋势:从 R1 到 R2,准确率就明显掉了一截;到 R4 以后,模型已经很难把完整的中间计算塞进有限篇幅,只能靠更粗糙的启发式猜答案。论文还发现,两人速答部分对长度压缩最敏感,因为那里本来就需要连续的数值推导,少一句都可能少一层逻辑。
表7
表7:不同题型在各推理等级下的准确率。两人速答题下降最猛,说明“短输出”对需要多步计算的任务伤害最大。
图3
图3:按年份和推理等级统计的准确率。不同年份的题目难度差异会放大 token 压缩带来的影响,难题在短推理下掉得更快。
还有一个很有意思的发现:不是所有年份都一样难。论文用 DeepSeek-R1 给每年的题目打了难度分,结果不同年份差异还挺明显。难度更高的年份,在 token 压缩后掉得更早、更快;难度相对低的年份,则能在较短推理下维持更稳的表现。这个现象说明,推理长度不是一个抽象超参数,而是和题目结构强相关的资源预算。
图1
图1:按年份统计的平均题目难度。深色柱表示高于平均难度 5.19 的年份,能看出题目并不是“平均难”,而是有明显波动。

实验揭秘:从64%到69%,这5%的提升如何确保?

这篇论文的实验设计,整体是比较讲究的。先看数据:一共 671 道题,按年份切分成训练、验证、测试集,避免了时间泄漏。训练集用 2011–2021 年,验证集用 2022–2023 年,测试集用 2024–2025 年。这个按年份划分的方式很重要,因为如果把同一年甚至相邻年份的题混在一起,模型可能只是“见过类似题型”,不是真的学会了推理。
表1
表1:John O’Bryan 数学竞赛数据集统计。包含 15 年题目、三大分区以及训练/验证/测试划分,数据组织比较完整。
实验的一个关键点是“正确样本筛选”。只有被 DeepSeek-R1 验证为正确的推理链才进入训练集。这个做法相当于先把杂音过滤掉,再让学生学习高质量样本。论文也提到,错误样本里有一大块其实不是数学错,而是格式错、抽取错、表达不规范。这说明在数学推理任务里,后处理和输出约束并不是边角料,而是能实打实捞回准确率的工程环节。
结果上,基座模型 Qwen2.5-7B 的准确率是 64.67%,经过 200 次迭代的 LoRA 蒸馏后,五次独立运行的平均准确率提升到 69.43% ± 0.17%。这不是那种“提升 0.3 个点也敢写突破”的水分结果,而是一个稳定、可复现、跨数据集还能转移的改进。更关键的是,MATH-500 上也从 70.1% 提升到 73.1% ± 0.18%,说明它不是只会背竞赛题,而是确实学到了一些可迁移的推理模式。
表4
表4:整体准确率比较、不同随机种子结果以及分区表现。五次 200 轮训练的标准差很小,说明提升并不是“撞大运”。
表5
表5:微调后模型在 MATH-500 各子领域上的表现。代数和数论提升更明显,几何、预备微积分和中级代数相对偏弱,说明训练语料的题型覆盖会直接影响泛化方向。
再看一个工程细节:作者还验证了 LoRA 适配器不能随便往别的骨干上硬塞。把 Qwen2.5-7B 的适配器直接套到 Qwen2.5-3B 上,会出现维度不匹配。这个结果很正常,但也提醒了一个经常被忽略的事实:蒸馏不是“有个 adapter 就能通吃”,结构兼容性是硬约束。
如果把整篇实验压缩成一句话,那就是:先用高质量思维链教,再用早停防过拟合,最后用多种子证明稳定性。 这三步缺一个,结果都很容易变成“看着挺美,实际上不稳”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“小模型如何低成本获得数学推理能力”的问题。核心不是让小模型变成大模型,而是让它在有限参数和有限算力下,尽量学到可迁移的思维链模式。

CoT、LoRA、双智能体分别是什么意思?CoT 是思维链,用来保存一步步推理过程;LoRA 是低秩适配,用少量参数微调大模型;双智能体就是一个负责解题、一个负责验题,尽量把错误样本挡在训练集外面。

为什么推理长度一缩,准确率就掉这么多?因为数学题不是只看最终答案,很多题必须保留中间变量、公式变换和局部结论。长度被压得太狠时,模型只能跳步甚至猜答案,尤其对多步骤题型,损失会非常明显。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆。思路不是全新,但把竞赛题、双智能体 CoT 蒸馏、早停、token 压缩这几件事串成完整闭环,做得比较扎实。

实验合理度:★★★★☆。按年份切分、五次独立训练、教师核验、再做跨基准测试,实验链条比较完整,可信度比“单次跑分论文”强不少。

学术研究价值:★★★★☆。它不只是涨了几个点,而是把“小模型推理能力如何获得、如何衰减、如何稳定”这三个问题都量化了,对后续研究有参考价值。

稳定性:★★★☆☆。五种子结果很稳,但方法仍依赖高质量老师和结构化数据;一旦题型变复杂或输出格式失控,稳定性就会打折。

适应性以及泛化能力:★★★☆☆。在竞赛数学和 MATH-500 上有效,但题库覆盖偏向代数、数论,几何和中级代数仍是短板,泛化不是全能型。

硬件需求及成本:★★★★☆。LoRA + 4bit + Apple Silicon 这套组合很友好,训练成本不高,适合资源有限的团队试水。

复现难度:★★★★☆。代码开源,流程清楚,复现门槛不算高;难点主要在数据清洗和教师验证环节。

产品化成熟度:★★★☆☆。适合做“辅助解题/草稿生成”工具,不适合直接当自动判题器或完全无人值守的数学助手。

可能的问题:数据集较小且题型集中,教师与验证器都来自同一大模型体系,可能带来风格偏置;另外,输出格式问题占比不低,工程上还得加解析与约束。

参考文献


主要参考文献

1. Apple Inc.: MLX: An array framework for Apple silicon. GitHub repository (2023). https://github.com/ml-explore/mlx
2. Gou, J., Yu, B., Maybank, S.J., Tao, D.: Knowledge distillation: A survey. International Journal of Computer Vision 129(6), 1789–1819 (2021).
3. Guo, D., Yang, D., Zhang, H., Song, J., Zhang, R., Xu, R., Zhu, Q., Ma, S., Wang, P., Bi, X., et al.: DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning. arXiv preprint arXiv:2501.12948 (2025).
4. Hinton, G., Vinyals, O., Dean, J.: Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531 (2015).
5. Hendrycks, D., Burns, C., Kadavath, S., Arora, A., Basart, S., Tang, E., Song, D., Steinhardt, J.: Measuring mathematical problem solving with the MATH dataset. NeurIPS 2021 Datasets and Benchmarks Track (2021).
6. Cobbe, K., Kosaraju, V., Bavarian, M., Chen, M., Jun, H., Kaiser, L., Plappert, M., Tworek, J., Hilton, J., Nakano, R., Hesse, C., Schulman, J.: Training verifiers to solve math word problems. arXiv preprint arXiv:2110.14168 (2021).
7. Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Chen, W.: LoRA: Low-rank adaptation of large language models. ICLR 2022.
8. 项目开源代码:https://github.com/TempGaurab/Distillation.John-O-Bryan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。