← 返回 PaperDaily 大模型与智能体

IFT后推理会丢?这篇论文用合并法救回来了

推理模型最怕的,不是不会做题,而是微调完把“会想”这件事顺手弄丢了。这篇论文给出一个很朴素但很能打的解法:先把任务学进去,再把推理习惯捞回来。

IFT后推理会丢?这篇论文用合并法救回来了
原论文信息如下:
论文标题:
Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation
发表日期:
2026年07月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2607.14895v1.pdf

推理模型遭遇“特洛伊木马”:指令微调带来的能力丧失

推理模型最尴尬的事,不是答错题,而是答对了题,却把“怎么想”这件事弄丢了。这篇论文抓住的就是这个很现实的问题:当一个原本擅长推理的大模型,拿去做指令微调(Instruction Fine-Tuning,IFT)之后,任务分数可能涨了,推理习惯却被悄悄掏空,像是模型里被塞进了一枚“特洛伊木马”。
这事听起来有点反直觉,但非常真实。推理语言模型(Reasoning Language Model,RLM)通常依赖带验证器的强化学习训练,比如数学、代码这类能自动判对错的任务;可一旦任务变成文本摘要、没有可靠单测的编程题,验证器就没那么好用了。于是大量现成的高质量监督数据反而被闲置了:只有输入和标准答案,没有推理链。直接拿它们做 IFT,模型会学会“直接给答案”,却忘了先思考再回答的老本行。
图1:论文提出的核心两步法:先做指令微调,再与原推理模型合并,恢复推理行为并保留任务收益。
图1:论文提出的核心两步法:先做指令微调,再与原推理模型合并,恢复推理行为并保留任务收益。
论文的切入点很朴素:既然监督数据里没有推理链,那就先把任务学进去,再把推理习惯捞回来。这个思路不花哨,但很工程。它不去硬造推理轨迹,也不依赖额外的奖励模型,更不要求一个“更强老师模型”来吐推理过程,成本一下就压下来了。

一个诀窍,两步走:轻量级IFT+合并法搞定模型适应

这篇论文的方法其实只有两步,但每一步都踩在痛点上。第一步是标准 IFT:把训练样本里的答案直接喂给模型,让它学任务本身。第二步是模型合并(model merging):把微调后的模型和原始推理模型按一定比例线性插值,找回被 IFT 冲掉的推理行为。
公式:指令微调的交叉熵目标函数。
公式:指令微调的交叉熵目标函数。这里的意思很直白——让模型在给定输入后,尽量生成训练答案序列;问题是,若训练答案里没有推理链,模型就会被训练成“直接报答案”的风格,推理痕迹自然越来越少。
为了把这个现象说清楚,论文先解释了推理模型的输出结构。RLM 的答案可以拆成两段:前面是推理链,后面是最终答案。IFT 数据里没有推理链,于是训练时只能把推理部分记成空串。模型学久了,就会形成一种“别废话,直接答”的偏好。对普通任务来说这不一定坏,但对推理模型来说,这就是把核心能力往外扔。
公式:模型合并的线性插值形式。
公式:模型合并的线性插值形式。θα = (1 - α)θ1 + αθ2,其中 α 控制“靠近原推理模型”还是“靠近微调模型”。这一步的精髓在于:不是简单二选一,而是在两种能力之间找一个平衡点。
论文没有把合并当玄学,而是给了一个很工程化的筛选准则:在小规模校准集上,只看模型有没有继续输出非空推理链。用一个最小可接受推理率作为门槛,挑出“尽可能靠近 IFT,但还没把推理彻底搞坏”的那个合并比例。说白了,就是让模型既学会新任务,又别把老本行忘光
公式:推理率的定义。
公式:推理率的定义。ρ(M′, D) 表示模型在数据集 D 上输出非空推理链的比例。这个指标看起来有点“粗”,但恰好适合这篇论文的目标:先判断模型还愿不愿意想,再看任务分数有没有保住。
为了省算力,论文还做了两个很实用的优化。第一,只看校准集上推理开始后的前几个 token,不必完整采样长答案;因为一旦模型被 IFT 训坏,通常会非常快地吐出结束推理的标记。第二,作者观察到合并比例和推理率大体单调,于是可以用二分搜索代替暴力扫网格。工程味很足,属于那种“不是最浪漫,但很省钱”的做法。🤨

实战检验:四大模型,两大任务,效果斐然

论文的实验不是拿一个模型、一个数据集“碰巧赢一下”就收工,而是覆盖了四个开源推理模型:OpenThinker 7B、Apriel Nemotron 15B Thinker、Olmo3 7B Think、DeepSeek R1 Qwen 7B Distilled。任务也分成两类:Rust 代码生成和文本摘要。前者偏可验证,后者偏难验证,正好能看出方法到底是“只会刷单测”,还是能真适应推理模型。
图2:不同合并比例下,推理率与任务表现的变化曲线。
图2:不同合并比例下,推理率与任务表现的变化曲线。
先看 Rust。标准 IFT 往往能把代码题分数抬高一点,但也会把模型的推理行为冲掉,尤其在 OpenThinker 7B 上,MATH500 这类外部推理能力掉得很明显。论文的方法则更像“补课后把脑子找回来”:既保住了任务收益,又恢复了推理习惯。更有意思的是,Rust 上的最佳点往往出现在中间合并比例,而不是简单地越靠近 IFT 越好。这说明推理和任务记忆之间并不是非黑即白,而是存在一个可操作的平衡带。
表1:四个模型在 Rust 与摘要任务上的效果、推理率与训练成本对比。
表1:四个模型在 Rust 与摘要任务上的效果、推理率与训练成本对比。
再看文本摘要。这里没有可靠验证器,正是很多实际业务最头疼的场景。标准 IFT 能提升 SummEval,但代价是推理率和 MATH500 表现一起下滑。论文的方法则把这两件事尽量都捞了回来:摘要分数基本保住,推理率恢复得也很完整。更关键的是,这不是靠额外奖励模型堆出来的,而是靠“先微调、再合并”的轻量流程做出来的。
这里还有一个很值得注意的细节:有些基线方法也能恢复推理,但往往要付出更高的训练开销,或者在目标任务上掉一点分。论文的方法在多个模型上都能保持比较稳定的折中,说明它不是只对某一个模型“调出来的巧合”,而是对这类适应问题有一定普适性。
图5:IFT 模型在 Rust 示例中直接输出答案,推理链被压成空串。
图5:IFT 模型在 Rust 示例中直接输出答案,推理链被压成空串。
图5很有代表性:IFT 之后,模型虽然能把 Rust 类型转换写对,但它不再“解释自己为什么这么写”。这就是论文说的分布错位——训练时教它直接给答案,推理时它就真的不想再绕一圈了。对普通生成任务这可能只是风格变化,但对 RLM 来说,推理链本身就是能力的一部分,不能随便丢。

低成本,高回报:优于其他方法的性价比分析

这篇论文最容易让工程同学点头的地方,不是“分数涨了”,而是它真的便宜。作者统计下来,整个适应流程平均只要大约 52 分钟,按单张 H200 的租用价格算,成本不到 3 美元。这个数字不一定是所有实验室都能原样复现,但它至少说明:这不是那种“论文里很美,落地时钱包先死”的方案。
表5:方法运行时间拆分,包括 IFT、合并和校准评估。
表5:方法运行时间拆分,包括 IFT、合并和校准评估。
和对比方法相比,这套方案省钱的原因也很明确:它不需要额外做大量推理 rollout,不需要再找一个老师模型反复吐推理轨迹,也不需要复杂奖励设计。校准时只看少量样本的前几个 token,合并搜索又能用二分缩小开销。换句话说,论文把“恢复推理”这件事,从一场大规模训练工程,压缩成了一个小而准的校准流程。
表2:Gemini 3 Pro 作为摘要评估器时的相关性验证结果。
表2:Gemini 3 Pro 作为摘要评估器时的相关性验证结果。
摘要任务的评价也处理得比较严谨。论文没有偷懒只用一个“看起来像分数”的自动指标,而是把 Gemini 3 Pro 作为裁判,并用人工标注验证其与人类判断的相关性。这样做的意义很简单:如果连评测都不靠谱,后面所有“恢复了”“保住了”的结论都可能是空中楼阁。这里作者至少把地基先打稳了。

不止于方法:对机理的深入探讨与未来展望

这篇工作的真正价值,不只是“又发明了一个省钱技巧”,而是它把一个长期被忽略的现象讲透了:推理模型在没有推理链监督时,确实会出现能力漂移。IFT 带来的不是单纯的性能下降,而是行为分布变化。模型并非不会做了,而是“做题方式”被改写了。
图2:合并比例跨过阈值后,推理率会快速下滑,而任务分数变化更平滑。
图2再次说明了一个很关键的现象:推理率和任务分数并不同步下降。也就是说,模型不是一边“慢慢变笨”,而是先丢掉推理习惯,再在某个区间里慢慢丢任务收益。这个结果也解释了为什么合并有效——它不是神奇修复,而是在两种参数状态之间找到一个能共存的区域。
图3:OpenThinker 7B 在训练轮数、学习率、批量大小、LoRA 与全量微调、合并方式上的消融结果。
图3:OpenThinker 7B 在训练轮数、学习率、批量大小、LoRA 与全量微调、合并方式上的消融结果。
消融实验进一步说明,这个方法不是靠某个特别脆弱的超参数“碰运气”。无论是训练轮数、学习率、批量大小,还是 LoRA 与全量微调、线性合并与其他合并方式,整体趋势都比较稳定。LoRA 的表现尤其值得注意:相比全量微调,它更省资源,也更不容易把原始推理能力打烂。对实际落地来说,这一点非常重要,因为很多团队根本没有条件做大规模全参训练。
当然,这个方法也不是万能钥匙。它依赖一个小校准集来判断推理率,依赖“推理链非空”作为代理指标,也默认合并路径比较平滑。若目标任务本身和原推理能力差异极大,或者模型在微调后出现更复杂的行为漂移,单靠线性合并未必总能救回来。换句话说,它适合“轻量适应”,不适合幻想把所有灾难都一键缝合。
不过,正因为它不贪,所以反而更有用。未来如果把这套思路推广到更多“没有可靠验证器”的领域,比如问答、长文改写、结构化信息抽取,甚至一些专业垂直场景,可能会很有价值。核心不是合并本身,而是这种先适应、再恢复行为的训练哲学:别把模型的旧能力当成可以随便牺牲的边角料。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?解决的是“推理模型在没有推理链监督时怎么适应新任务”的问题。它用 IFT 把任务学进去,再用模型合并把推理行为拉回来,避免模型只会直接答题却不会思考。

文中的 Reasoning rate 是什么意思?就是模型在评测集上输出非空推理链的比例。它不是在看推理链写得多漂亮,而是在看模型还愿不愿意先“想一想”。

为什么合并能把推理找回来?因为合并相当于把“任务能力”和“原始推理习惯”放到同一条参数轨道上做折中。微调模型负责新任务,原模型负责保住推理风格,选对比例后,两边的优势可以同时保留一部分。

如果还有哪些想继续深挖的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

创新点不算“宇宙级新物种”,但把 IFT 和模型合并组合成一个可操作的适应流程,确实抓住了推理模型落地的真问题。

实验合理度:★★★★☆

四个模型、两类任务、再加 MATH500 作为遗忘监测,实验设计比较完整。对比和消融也比较到位,结论可信度不错。

学术研究价值:★★★★☆

它补的是一个很现实的空白:没有验证器、没有推理链时,RLM 怎么继续适应新任务。这个问题很实际,也很值得后续继续研究。

稳定性:★★★★☆

消融结果显示整体趋势稳定,说明方法不是靠单点运气吃饭。但对校准集和推理率阈值仍有一定依赖。

适应性以及泛化能力:★★★☆☆

对 Rust、摘要这类场景很合适,但是否能覆盖更复杂的长链推理或强分布漂移任务,还需要更多验证。

硬件需求及成本:★★★★★

单卡 H200、不到 3 美元、一个小时内完成,这个成本控制非常漂亮,工程上很有吸引力。

复现难度:★★★★☆

流程清晰,超参表和运行拆分都给了,复现门槛不高;但要完全对齐结果,仍需要校准集和模型细节一致。

产品化成熟度:★★★☆☆

适合做低成本模型适应的中间层方案,但还不算“开箱即上生产”。对校准策略、任务类型和模型家族仍有依赖。

可能的问题:把“非空推理链”当作推理能力代理,指标略粗;方法对校准集和合并假设敏感,遇到更复杂迁移场景未必同样稳。


主要参考文献

Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev. Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation. arXiv:2607.14895v1, 2026.
原文链接:https://arxiv.org/pdf/2607.14895v1.pdf

推理模型想“补课”,不一定非得烧大钱、找老师、上奖励模型。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,一起聊推理、微调、合并这些真能落地的办法。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。