← 返回 PaperDaily
大模型与智能体
IFT后推理会丢?这篇论文用合并法救回来了
推理模型最怕的,不是不会做题,而是微调完把“会想”这件事顺手弄丢了。这篇论文给出一个很朴素但很能打的解法:先把任务学进去,再把推理习惯捞回来。
龙哥读论文
发布于 2026-08-18 00:20:03
阅读 3
查看原文
原论文信息如下:
推理模型遭遇“特洛伊木马”:指令微调带来的能力丧失
推理模型最尴尬的事,不是答错题,而是答对了题,却把“怎么想”这件事弄丢了 。这篇论文抓住的就是这个很现实的问题:当一个原本擅长推理的大模型,拿去做指令微调(Instruction Fine-Tuning,IFT)之后,任务分数可能涨了,推理习惯却被悄悄掏空,像是模型里被塞进了一枚“特洛伊木马”。
这事听起来有点反直觉,但非常真实。推理语言模型(Reasoning Language Model,RLM)通常依赖带验证器的强化学习训练,比如数学、代码这类能自动判对错的任务;可一旦任务变成文本摘要、没有可靠单测的编程题,验证器就没那么好用了。于是大量现成的高质量监督数据反而被闲置了:只有输入和标准答案,没有推理链。直接拿它们做 IFT,模型会学会“直接给答案”,却忘了先思考再回答的老本行。
论文的切入点很朴素:既然监督数据里没有推理链,那就先把任务学进去,再把推理习惯捞回来 。这个思路不花哨,但很工程。它不去硬造推理轨迹,也不依赖额外的奖励模型,更不要求一个“更强老师模型”来吐推理过程,成本一下就压下来了。
一个诀窍,两步走:轻量级IFT+合并法搞定模型适应
这篇论文的方法其实只有两步,但每一步都踩在痛点上。第一步是标准 IFT:把训练样本里的答案直接喂给模型,让它学任务本身。第二步是模型合并(model merging):把微调后的模型和原始推理模型按一定比例线性插值,找回被 IFT 冲掉的推理行为。
为了把这个现象说清楚,论文先解释了推理模型的输出结构。RLM 的答案可以拆成两段:前面是推理链,后面是最终答案。IFT 数据里没有推理链,于是训练时只能把推理部分记成空串。模型学久了,就会形成一种“别废话,直接答”的偏好。对普通任务来说这不一定坏,但对推理模型来说,这就是把核心能力往外扔。
论文没有把合并当玄学,而是给了一个很工程化的筛选准则:在小规模校准集上,只看模型有没有继续输出非空推理链。用一个最小可接受推理率作为门槛,挑出“尽可能靠近 IFT,但还没把推理彻底搞坏”的那个合并比例。说白了,就是让模型既学会新任务,又别把老本行忘光 。
为了省算力,论文还做了两个很实用的优化。第一,只看校准集上推理开始后的前几个 token,不必完整采样长答案;因为一旦模型被 IFT 训坏,通常会非常快地吐出结束推理的标记。第二,作者观察到合并比例和推理率大体单调,于是可以用二分搜索代替暴力扫网格。工程味很足,属于那种“不是最浪漫,但很省钱”的做法。🤨
论文的实验不是拿一个模型、一个数据集“碰巧赢一下”就收工,而是覆盖了四个开源推理模型:OpenThinker 7B、Apriel Nemotron 15B Thinker、Olmo3 7B Think、DeepSeek R1 Qwen 7B Distilled。任务也分成两类:Rust 代码生成和文本摘要。前者偏可验证,后者偏难验证,正好能看出方法到底是“只会刷单测”,还是能真适应推理模型。
先看 Rust。标准 IFT 往往能把代码题分数抬高一点,但也会把模型的推理行为冲掉,尤其在 OpenThinker 7B 上,MATH500 这类外部推理能力掉得很明显。论文的方法则更像“补课后把脑子找回来”:既保住了任务收益,又恢复了推理习惯。更有意思的是,Rust 上的最佳点往往出现在中间合并比例,而不是简单地越靠近 IFT 越好。这说明推理和任务记忆之间并不是非黑即白,而是存在一个可操作的平衡带。
再看文本摘要。这里没有可靠验证器,正是很多实际业务最头疼的场景。标准 IFT 能提升 SummEval,但代价是推理率和 MATH500 表现一起下滑。论文的方法则把这两件事尽量都捞了回来:摘要分数基本保住,推理率恢复得也很完整。更关键的是,这不是靠额外奖励模型堆出来的,而是靠“先微调、再合并”的轻量流程做出来的。
这里还有一个很值得注意的细节:有些基线方法也能恢复推理,但往往要付出更高的训练开销,或者在目标任务上掉一点分。论文的方法在多个模型上都能保持比较稳定的折中,说明它不是只对某一个模型“调出来的巧合”,而是对这类适应问题有一定普适性。
图5很有代表性:IFT 之后,模型虽然能把 Rust 类型转换写对,但它不再“解释自己为什么这么写”。这就是论文说的分布错位——训练时教它直接给答案,推理时它就真的不想再绕一圈了。对普通生成任务这可能只是风格变化,但对 RLM 来说,推理链本身就是能力的一部分,不能随便丢。
这篇论文最容易让工程同学点头的地方,不是“分数涨了”,而是它真的便宜 。作者统计下来,整个适应流程平均只要大约 52 分钟,按单张 H200 的租用价格算,成本不到 3 美元。这个数字不一定是所有实验室都能原样复现,但它至少说明:这不是那种“论文里很美,落地时钱包先死”的方案。
和对比方法相比,这套方案省钱的原因也很明确:它不需要额外做大量推理 rollout,不需要再找一个老师模型反复吐推理轨迹,也不需要复杂奖励设计。校准时只看少量样本的前几个 token,合并搜索又能用二分缩小开销。换句话说,论文把“恢复推理”这件事,从一场大规模训练工程,压缩成了一个小而准的校准流程。
摘要任务的评价也处理得比较严谨。论文没有偷懒只用一个“看起来像分数”的自动指标,而是把 Gemini 3 Pro 作为裁判,并用人工标注验证其与人类判断的相关性。这样做的意义很简单:如果连评测都不靠谱,后面所有“恢复了”“保住了”的结论都可能是空中楼阁。这里作者至少把地基先打稳了。
这篇工作的真正价值,不只是“又发明了一个省钱技巧”,而是它把一个长期被忽略的现象讲透了:推理模型在没有推理链监督时,确实会出现能力漂移 。IFT 带来的不是单纯的性能下降,而是行为分布变化。模型并非不会做了,而是“做题方式”被改写了。
消融实验进一步说明,这个方法不是靠某个特别脆弱的超参数“碰运气”。无论是训练轮数、学习率、批量大小,还是 LoRA 与全量微调、线性合并与其他合并方式,整体趋势都比较稳定。LoRA 的表现尤其值得注意:相比全量微调,它更省资源,也更不容易把原始推理能力打烂。对实际落地来说,这一点非常重要,因为很多团队根本没有条件做大规模全参训练。
当然,这个方法也不是万能钥匙。它依赖一个小校准集来判断推理率,依赖“推理链非空”作为代理指标,也默认合并路径比较平滑。若目标任务本身和原推理能力差异极大,或者模型在微调后出现更复杂的行为漂移,单靠线性合并未必总能救回来。换句话说,它适合“轻量适应”,不适合幻想把所有灾难都一键缝合。
不过,正因为它不贪,所以反而更有用。未来如果把这套思路推广到更多“没有可靠验证器”的领域,比如问答、长文改写、结构化信息抽取,甚至一些专业垂直场景,可能会很有价值。核心不是合并本身,而是这种先适应、再恢复行为 的训练哲学:别把模型的旧能力当成可以随便牺牲的边角料。
龙迷三问
这篇论文到底解决了什么问题? 解决的是“推理模型在没有推理链监督时怎么适应新任务”的问题。它用 IFT 把任务学进去,再用模型合并把推理行为拉回来,避免模型只会直接答题却不会思考。
文中的 Reasoning rate 是什么意思? 就是模型在评测集上输出非空推理链的比例。它不是在看推理链写得多漂亮,而是在看模型还愿不愿意先“想一想”。
为什么合并能把推理找回来? 因为合并相当于把“任务能力”和“原始推理习惯”放到同一条参数轨道上做折中。微调模型负责新任务,原模型负责保住推理风格,选对比例后,两边的优势可以同时保留一部分。
如果还有哪些想继续深挖的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
创新点不算“宇宙级新物种”,但把 IFT 和模型合并组合成一个可操作的适应流程,确实抓住了推理模型落地的真问题。
实验合理度: ★★★★☆
四个模型、两类任务、再加 MATH500 作为遗忘监测,实验设计比较完整。对比和消融也比较到位,结论可信度不错。
学术研究价值: ★★★★☆
它补的是一个很现实的空白:没有验证器、没有推理链时,RLM 怎么继续适应新任务。这个问题很实际,也很值得后续继续研究。
稳定性: ★★★★☆
消融结果显示整体趋势稳定,说明方法不是靠单点运气吃饭。但对校准集和推理率阈值仍有一定依赖。
适应性以及泛化能力: ★★★☆☆
对 Rust、摘要这类场景很合适,但是否能覆盖更复杂的长链推理或强分布漂移任务,还需要更多验证。
硬件需求及成本: ★★★★★
单卡 H200、不到 3 美元、一个小时内完成,这个成本控制非常漂亮,工程上很有吸引力。
复现难度: ★★★★☆
流程清晰,超参表和运行拆分都给了,复现门槛不高;但要完全对齐结果,仍需要校准集和模型细节一致。
产品化成熟度: ★★★☆☆
适合做低成本模型适应的中间层方案,但还不算“开箱即上生产”。对校准策略、任务类型和模型家族仍有依赖。
可能的问题: 把“非空推理链”当作推理能力代理,指标略粗;方法对校准集和合并假设敏感,遇到更复杂迁移场景未必同样稳。
主要参考文献
Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev. Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation. arXiv:2607.14895v1, 2026.
原文链接:https://arxiv.org/pdf/2607.14895v1.pdf
推理模型想“补课”,不一定非得烧大钱、找老师、上奖励模型。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称 ,一起聊推理、微调、合并这些真能落地的办法。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群