← 返回 PaperDaily 大模型与智能体

7B蒸馏干翻72B?这篇金融推理新方法有点狠

金融问答最怕什么?不是题难,是模型一本正经地把账算错。本文直接把“自然语言讲道理”换成“可执行程序讲道理”,再用执行验证筛掉假把式,7B学生竟然能把72B教师按在地上摩擦,思路很硬,结果也很硬。

7B蒸馏干翻72B?这篇金融推理新方法有点狠
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
金融问答最怕什么?不是题难,是模型一本正经地把账算错。本文直接把“自然语言讲道理”换成“可执行程序讲道理”,再用执行验证筛掉假把式,7B学生竟然能把72B教师按在地上摩擦,思路很硬,结果也很硬。


原论文信息如下:
论文标题:
Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text
发表日期:
2026年07月
发表单位:
Georgia Institute of Technology; Stanford University
原文链接:
https://arxiv.org/pdf/2607.14709v1.pdf

金融推理新范式:用代码替代自然语言进行蒸馏

金融问答里最烦人的,不是题目长,而是模型算错了还说得像真的。尤其是表格和文本混在一起时,模型一边看财报,一边做加减乘除,最后常常把“看起来很会”演成“其实不太会”。这篇论文的处理方式很直接:既然自然语言推理容易胡算,那就干脆让模型学可执行的 Python 程序,把计算交给解释器,别让大模型在脑子里硬掰数字。
图1:两阶段程序化蒸馏与迭代微调总体框架
图1:两阶段程序化蒸馏与迭代微调总体框架。先由教师模型生成可执行程序,再用执行验证筛选高质量监督信号,最后让学生模型在失败样本上继续“补课”。
这套思路和传统的“让大模型写一段推理文字,再拿去蒸馏”不一样。自然语言解释看着顺眼,但里面藏着大量算术坑;程序则不同,只要能执行、能输出正确答案,监督信号就相对可靠。论文把这个思路叫做 Gold-Guided Programmatic Distillation,中文可以理解为金标引导的程序化蒸馏:这里的 gold 指的是数据集里的标准答案和标准推导,guidance 的意思是用这些金标去约束教师模型生成程序,避免它自由发挥到离谱。
论文用的核心任务是 TAT-QA。TAT-QA 本身是一个金融问答基准,问题往往同时依赖表格和文本段落,既要找信息,又要做计算。它不是那种“在表里抄一个数”就完事的题,而是更像财务分析里的日常:先从报表里定位,再从正文里补上下文,最后做汇总、比较、比例换算。对这种任务来说,模型如果只会嘴上推理,往往一到计算就现原形。
图7:TAT-QA 数据集示例
图7:TAT-QA 数据集示例。可以看到问题并不是单纯抽取,而是要把表格和文本证据拼起来,再完成数值推理。

两阶段框架:从教师引导到学生自提升

整套方法分两步走,逻辑很像“先找老师抄对答案,再让学生自己做题补短板”。第一步是教师驱动蒸馏,第二步是迭代自我提升。别看名字学术,骨子里其实很朴素:先把监督信号做干净,再让模型在干净信号上反复练
第一阶段里,72B 教师模型先根据题目、表格、文本和金标推导,生成 Python 程序。这里不是让它随便写,而是要求程序格式严格、输出固定,甚至要打印一个 JSON 结果,里面包含答案和单位尺度。这样做的好处很现实:后面的自动筛选更容易,少一点“格式漂移”,少一点“模型文学创作”。
教师生成后,不是全收,而是执行验证:程序必须能跑通,而且结果必须和标准答案完全一致,连尺度都不能错。只有过了这道门,才算进入蒸馏数据集。这个过滤动作很关键,因为它相当于把“看起来会推理”的程序和“真的会推理”的程序分开了。前者很会演,后者才配当老师。
第二阶段更有意思。教师没答对的样本,不是直接扔掉,而是交给第一阶段训练出来的学生模型重新采样候选程序。学生在更高随机性下多试几次,只要某个程序能执行且答案正确,就收进恢复集合,继续训练。这个过程本质上是在做一种“学生反向补老师没覆盖到的题”,属于很务实的扩容思路。
图2:不同数据划分中的答案类型与答案来源分布热力图
图2:不同数据划分中的答案类型与答案来源分布热力图。训练、验证、测试三部分的分布基本一致,说明实验切分比较稳定,不是那种“训练集简单、测试集玄学”的套路。
这里还有一个很容易被忽略但其实很重要的点:模型不是直接学习“答案”,而是学习“如何写出能算出答案的程序”。这意味着学生学到的不只是结果,还包括中间的运算路径。对金融推理来说,这比背答案更有价值,因为真实业务里题目千变万化,能复用的方法比单次命中更重要。

核心揭秘:如何通过执行验证保障推理可靠性

这篇论文最硬的地方,不是“让模型写代码”这件事本身,而是只保留执行正确的代码。听起来像常识,但真能做到的人并不多。很多蒸馏工作会把模型生成的解释当监督,问题是解释文本本身不具备可验证性,错了也不容易发现;而程序一旦跑出来的数和标准答案不一致,立刻就能被抓现行。
这里的“执行验证”其实可以拆成三层。第一层是语法能不能过,程序至少得能被解释器读懂;第二层是运行后有没有产出有效答案,别跑半天吐个空;第三层是结果是否与 gold answer 完全一致,包括数值和尺度。三道关卡都过了,才算是高质量监督。这个筛选机制虽然残酷,但非常适合金融场景,因为金融任务对数字正确性几乎零容忍。
图3和图4:消融分析与不同阶段、不同答案类型的测试集表现
图3和图4:消融分析与不同阶段、不同答案类型的测试集表现。前者看核心组件有没有用,后者看模型在不同答案类型、不同证据来源上的提升情况。
论文还做了一个很实在的工程优化:教师提示词中加入金标推导,并通过 DSPy 做提示优化,让教师更稳定地产生结构化代码。这里的 DSPyDeclarative Self-improving Python 的缩写,中文一般可理解为“把语言模型调用编译成自我改进流水线”的工具框架。它在这里的作用不是发明新模型,而是把输出格式和提示流程调顺,减少教师乱写代码的概率。
另一处值得注意的是 LoRA。LoRA 全称是 Low-Rank Adaptation,中文是“低秩适配”。它的思路是冻结大模型主体参数,只训练少量低秩增量参数,省显存、省时间、也更适合大模型微调。论文比较了只调 attention 和同时调 attention+MLP 两种方式,后者更强,说明这类数值推理任务不只是“看哪里重要”,还得让中间特征变换也跟着学会做题。
从方法设计上看,这套框架的核心并不神秘:用程序替代口头推理,用执行结果替代主观判断,用迭代采样补齐覆盖面。它不是在追求“解释更漂亮”,而是在追求“监督更可靠”。这点特别适合金融场景,因为金融问答的价值不在于说得像,而在于算得准。
图5:错误类型分解
图5:错误类型分解。可以看到训练后,答案错、尺度错、两者都错这三类问题都明显减少,说明程序化蒸馏不仅提升了推理正确率,也改善了输出格式一致性。

实验碾压:7B模型如何超越72B教师与强基线

实验结果是这篇论文最有戏剧性的部分:7B 学生最终反超了 72B 教师。这类结果之所以吸引人,不是因为“参数小一定更强”,而是因为它说明蒸馏质量足够高时,小模型也能把复杂数值推理学得很扎实,甚至在特定任务上比大模型更稳定。
表1:TAT-QA 过滤子集上的主要结果
表1:TAT-QA 过滤子集上的主要结果。与任务专用基线、已有大模型方法以及教师/学生参考模型相比,本文方法取得了最强成绩。
先看主表。传统方法 TAGOP 的表现只有 47 左右,和后面的 LLM 路线差距很大,说明这类杂糅表格文本任务已经不是传统符号流水线能轻松吃下的领域。TAT-LLM 作为专门面向金融表格文本推理的大模型方法,已经把成绩提到了 82 左右,但本文的 7B 学生在第二轮训练后进一步到了 87.00 EM / 87.18 F1,把 72B 教师的 78.46 EM / 78.73 F1 也甩在后面。
这个反超并不奇怪,原因也很清楚。教师模型虽然大,但它输出的是“候选程序”;学生模型经过执行过滤和二轮恢复后,学到的是更干净、更一致、更接近正确解法分布的监督。换句话说,学生不是单纯模仿老师,而是在老师成功案例和自我恢复案例的双重加持下,学会了更可靠的数值推理套路。
再看训练过程。表2显示,第一轮学生已经很强,第二轮还能继续涨。注意力版和注意力+MLP版都在 dev 和 test 上稳步提升,说明迭代自提升不是“碰运气涨一点”,而是确实在补足教师没覆盖到的题型。第二轮里,attention+MLP 版本在测试集达到最优,说明更丰富的适配位置能更好承接程序化监督。
表2:不同训练轮次与适配设置下的开发集和测试集表现
表2:不同训练轮次与适配设置下的开发集和测试集表现。第二轮训练带来稳定收益,attention+MLP 方案整体优于仅调 attention 的方案。
如果把结果拆得更细,会发现提升最明显的地方是需要结构化数值推理的题目,尤其是 arithmetic 类问题,以及同时依赖表格和文本的混合证据题。这个现象和方法设计完全对得上:既然计算已经被外部解释器接管,那模型最容易丢分的算术环节就被大幅压制了。剩下的难点,更多变成“证据找对没”“尺度写对没”“程序格式稳不稳”。
论文还做了错误分解,结果也挺有说服力:训练后,答案错、尺度错、两者都错的情况都明显下降。这里最值得肯定的一点是,它没有把“正确率提升”包装成玄学,而是明确告诉读者提升来自哪里。对实际落地来说,这种可解释的收益路径比单纯报一个高分更重要,因为工程团队能据此判断问题到底是出在检索、算术、格式还是监督质量上。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“金融问答里模型会算错、而且错得不容易发现”的问题。做法不是让模型多说几句,而是把推理改成可执行程序,再用执行结果筛选监督信号,让学生模型学到更可靠的数值推理。

文中的 gold derivation 和 execution-verified 分别是什么意思?gold derivation 指数据集给出的标准推导或标准解题过程;execution-verified 指程序必须能在解释器里成功执行,并且输出和标准答案完全一致,才能被保留。前者用来引导教师生成程序,后者用来保证监督质量。

为什么 7B 学生能超过 72B 教师?因为学生学到的不是“老师随口说的答案”,而是“经过执行验证的正确程序”。教师虽然大,但它生成的候选里会混入错误或不稳定样本;学生经过过滤和二轮自我恢复后,训练信号更干净,反而更容易学到稳定的数值推理规律。

如果还有想继续追问的地方,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把程序化蒸馏、执行验证和迭代恢复拼成一套闭环,思路不花哨,但很扎实,尤其适合金融数值推理。

实验合理度:★★★★☆。有清晰的主结果、消融和分组分析,且对比基线覆盖了传统方法、强 LLM 方法和教师/学生参考模型,比较完整。

学术研究价值:★★★★☆。它不是只做一个任务分数,而是在回答“如何让小模型学会可靠数值推理”这个更通用的问题,研究味道是有的。

稳定性:★★★☆☆。执行验证让结果更稳,但依赖可执行程序和金标推导,离完全通用落地还有距离。

适应性以及泛化能力:★★★☆☆。方法对金融表格文本推理很合适,但是否能平滑迁移到其他需要复杂工具调用的任务,还需要更多验证。

硬件需求及成本:★★★☆☆。学生端是 7B,成本友好;但教师端 72B 生成和多轮采样仍然不便宜,训练管线也比普通微调更复杂。

复现难度:★★★☆☆。思路清楚,但涉及教师提示优化、程序执行过滤、二轮采样和数据筛选,工程细节不少,不是点一下就能复现的那种。

产品化成熟度:★★★☆☆。在“结构化金融推理”场景很有潜力,但要上生产还得补异常处理、覆盖率评估和更广泛的数据验证。

可能的问题:依赖金标推导和可执行程序,覆盖面受限;过滤后数据规模变小,泛化到更开放场景仍需验证。


主要参考文献

Fengbin Zhu, Wenqiang Lei, Youcheng Huang, Chao Wang, Shuo Zhang, Jiancheng Lv, Fuli Feng, and Tat-Seng Chua. TAT-QA: A question answering benchmark on a hybrid of tabular and textual content in finance. ACL 2021.
Wenhu Chen, Xueguang Ma, Xinyi Wang, and William W. Cohen. Program of Thoughts Prompting: Disentangling computation from reasoning for numerical reasoning tasks. 2022.
Xuekai Zhu, Biqing Qi, Kaiyan Zhang, Xinwei Long, Zhouhan Lin, and Bowen Zhou. PaD: Program-aided Distillation Can Teach Small Models Reasoning Better Than Chain-of-Thought Fine-Tuning. NAACL 2024.
Omar Khattab et al. DSPy: Compiling declarative language model calls into self-improving pipelines. 2023.
本论文原文链接:https://arxiv.org/pdf/2607.14709v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦! 

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。