← 返回 PaperDaily 大模型与智能体

数字比大小难倒一片大模型,NAACL基准揭示“数盲”真相

数学解题能力强,不代表真的“懂数字”。这篇NAACL论文把数值能力当成自然语言推理任务来测,一口气跑了49个模型,结果发现数学专用大模型只在算术上占优,数字比较和归一化反而拉胯,值得每一位关注LLM推理能力的读者看看。

数字比大小难倒一片大模型,NAACL基准揭示“数盲”真相

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Evaluating Numeracy of Language Models as a Natural Language Inference Task
发表日期:
未找到(NAACL 2025 Findings)
发表单位:
RMIT University 与 The University of Melbourne(澳大利亚)
原文链接:
https://aclanthology.org/2025.findings-naacl.467.pdf
开源代码链接:
https://github.com/rmahendra/numeracyNLI

引言:大模型会解题,但真的“懂数字”吗?

最近两年,大语言模型在数学推理上的进步可以用“肉眼可见”来形容。从解一元二次方程到处理多变量非线性方程组,动辄几十亿参数的模型在各类数学基准上刷新成绩,让人不禁感叹:AI这是要上天啊。
然而,现实世界中的数字使用,远不止“解出一道数学题”这么简单。当一份医疗报告写着“患者白细胞计数为12.5×10⁹/L”,或者一篇新闻说“某公司市值突破2000亿美元,较去年增长15%”时,模型需要做的不是计算,而是理解这些数字在具体语言环境中的含义——判断“12.5”是否高于正常范围、“2000亿”跟“15%”放在一起是否自洽。这种能力,学界称之为“numeracy(数值能力)”,它跟纯粹的数学解题能力是两码事。
来自澳大利亚RMIT大学和墨尔本大学的团队,把这个问题正式摆到了台面上。他们的一篇NAACL 2025 Findings论文,将数值能力重新定义为一项自然语言推理(NLI)任务,构建了一个超过2.8万对句子的基准,一口气评测了49个开源语言模型。结论相当扎心:数学专用大模型,可能只是“偏科”的优等生。
好的,龙哥来了。这篇NAACL的论文挺有意思,把“数感”这事儿掰开揉碎了看,结果发现不少大模型其实就是个“偏科”的算术学霸。咱们今天就用大白话,把这49个模型的“考试成绩单”拿出来盘一盘,看看它们到底是真的懂数字,还是只会套公式。 以下是本篇文章的正文部分,直接拼接在引言和基础信息之后即可。
先问大伙儿一个问题:你家楼下的便利店老板,和一个刚拿了奥数金牌的中学生,谁更会“算账”?
这问题搁以前,大家肯定说奥数天才啊,那脑子多好使。但在现实生活中,老板知道一瓶水进价一块卖两块,一天卖五十瓶能赚五十块,还知道月底要交房租、水电、人工,这些钱加一块儿得卖多少瓶水才能回本。这奥数天才可能连“利润率”和“折扣价”哪个划算都掰扯不清楚。
这其实就是“数学能力”“数值能力(Numeracy)”的区别。前者是解题,后者是理解数字在真实世界里怎么用。RMIT和墨尔本大学的这篇NAACL论文,干的就是这么一件事:那些在数学题上考高分的AI大模型,放到“现实生活”的数字场景里,是不是也一样好使?

数值推理的盲区:大模型会算题但不会“用”数字?

现在的大模型,你问它“鸡兔同笼”,它能给你列方程解出来;你问它“微积分”,它也能给你整两步。但你要是给它一句话:“约翰一共有16件衬衫”,然后问它“约翰一共有十六件衬衫”这句话对不对?有些模型可能就得懵圈一会儿。
这不是开玩笑。论文里专门设计了一个测试,把数字当成自然语言理解的一部分来考。就好比我们小时候学语文,不光是认字,还要理解词语在句子里的意思。现在的AI模型,很多是“算术巨人,语文矮子”——算数一流,但一涉及到用自然语言去理解数字的大小、单位、语境,立马露馅。
这里得先科普一个概念:自然语言推理(Natural Language Inference,简称NLI)。这个任务说白了就是给模型看两句话,一句叫“前提(Premise)”,一句叫“假设(Hypothesis)”,让模型判断这两句话的关系:是蕴含(Entailment)——假设能从前提推出来;是矛盾(Contradiction)——假设跟前提对着干;还是中性(Neutral)——没法确定,信息不足。
这篇论文的聪明之处,就是没直接考模型“1+1等于几”,而是把算术、比大小、单位换算这些事儿,全部包装成了NLI的句子对。比如前提说“山姆有9个一角硬币,他爸爸又给了他7个”,假设说“山姆现在有16个硬币”——这考的不光是加法,还有模型能不能把这个加法过程放到句子里理解。这种方式更贴近真实场景,毕竟没人会在聊天时突然说“请计算 9+7”。
为了让大家直观感受一下这种考法,咱们直接看论文里的例子,非常生动:
表1:数据集示例,涵盖三大基础数值任务(E:蕴含,C:矛盾,N:中性)
表1:数据集示例,涵盖三大基础数值任务(E:蕴含,C:矛盾,N:中性)。可以看到,同样的数字“20”和“80”,加上“不到”“不超过”这些词,整个句子的逻辑关系就变了。

三大基础数值任务:从算术到数值比较与归一化

论文把“数值能力”这个大概念,拆解成了三个最基本的组成技能,考试范围就这么划定了:

第一项:基础算术(Basic Arithmetic)这个大家最熟,就是加减乘除。但论文刻意把它限制在“单跳推理”,就是说题目里所有的数字都明明白白给你了,不需要你绕弯子去隐含条件里找。比如“商店里有13只暹罗猫和5只家猫,卖掉了10只,还剩几只?”这就是最朴素的加法减法,不搞什么二次函数。

第二项:数字比较(Number Comparison)这里考的不是简单问“5和3谁大”,而是把数字放进句子里。它又分了两个小类:一是带量词的比较,比如前提说“Rasik向北走了20米”,假设说“Rasik向北走了不到80米”——这里不光要比较20和80,还得理解“不到”这个词把范围扩大到了(0, 80)这个区间,所以20米确实“不到80米”,是蕴含关系。二是多数字的比较推理,比如“Willy有1400支蜡笔,Lucy有290支蜡笔”,假设说“Willy的蜡笔比Lucy多”,这考验的是从两个独立数字中提取关系的能力。

第三项:数字归一化(Number Normalization)这一项最容易被忽略,但生活里到处都是。它考的是模型能不能识别出“同一个数字的不同马甲”。比如前提写“John总共有16件衬衫(16)”,假设说“John总共有十六件衬衫(sixteen)”——这个“16”和“sixteen”说的是一个意思,就是蕴含。再比如前提说“这只海胆的壳直径可达40毫米”,假设说“可达4厘米”——这考的是单位换算,40毫米等于4厘米,也是蕴含。但如果前提说“这批货物的总重量是285千克”,假设说“285克”——单位不同,数字含义天差地别,这就是矛盾。

这三项技能,构成了这篇论文的“数值能力”测试框架。你会发现,它不考复杂的微积分,也不考多步推理,考的恰恰是我们在日常阅读和交流中最常用到的数字理解能力。这种“返璞归真”的考法,反而能更真实地反映模型对数字的底层理解。

28K数据对构建:如何系统评估模型的数值理解力?

光有考试大纲还不够,还得有实实在在的考卷。论文团队花了大功夫,构建了一个包含超过2.8万对句子的基准测试集,这个工作量有多大呢?光靠人工写肯定不现实,他们的数据来源主要有三个渠道:

渠道一:精挑细选现有NLI数据集。不是拿来就用,而是人工逐一审查,把有问题的、标注错误的全剔掉。比如他们原本想用EQUATE里的数值压测集,结果发现里面的“中性”标签有规律可循,模型不用理解数字,光靠猜标签都能蒙对不少,这种带“捷径”的题必须扔掉。

渠道二:把数学应用题改写成NLI形式。这里用了一个巧妙的办法:先把数学题里的“问题+答案”用ChatGPT转成一个陈述句,然后人工检查确保句子通顺。比如把“山姆有9个一角硬币,他爸爸给了他7个,现在有多少?”改写成“山姆现在有16个硬币”作为假设句。接下来再做“干扰项”,把正确数字换掉,就生成了矛盾样本。这种“改写”方法大大提升了数据构建效率。

渠道三:模板+公式自动生成。这也是论文最出彩的地方之一。他们发现,很多模型做题其实是在“背套路”,数字一换就懵。为了测试这种“泛化能力”,他们搞了个“模板-公式配对法”。具体的做法是:从已有的算术题里提取句子骨架(模板),比如“一家宠物店有__只暹罗猫和__只家猫。在促销期间,他们卖掉了__只猫。这家宠物店还剩__只猫。”,然后自动生成一系列数学公式(公式),比如“13+5-10=8”。把不同的模板和不同的公式随机配对,就能产生海量的新题。

图A1:模板-公式数据增强方法示意图
图A1:模板-公式数据增强方法示意图。通过将句子模板和数学公式自由组合,可以系统性地生成大量测试数据。
论文里展示了一个例子:I1和I2的句子结构完全不同,一个是猫一个是果子,但背后都是同一个公式。I3和I4的句子结构一样,但数字不同。这样一来,模型如果只记住了“宠物店卖猫”的套路,遇到“食堂订苹果”就傻眼了。这种设计非常考验模型的真实推理能力。
此外,论文还专门搞了“数字表示变化”的子集,比如把“16”换成“十六”,或者把“1400”和“两百九十”混着用,看模型还能不能正确比较大小。这一系列操作下来,最终形成了18243对句子组成的主数据集,加上额外的10000多对增强数据,总量超过2.8万对。
表2:基础数值数据统计
表2:基础数值数据统计。主数据集包含18243对句子,加上增强数据后总量超过2.8万对。

49个模型大比拼:数学专用大模型为何“偏科”?

考卷出好了,接下来就是拉出来遛遛。这次“应试”的阵容相当豪华:来自17个不同模型家族的49个开源语言模型,大致可以分为三组。

第一组:微调过的预训练语言模型(PLMs)。比如RoBERTa、ALBERT、ELECTRA、BART、XLNet、DeBERTa-v3这些经典模型。它们是“专才”,专门在NLI数据集(如SNLI、MNLI、ANLI)上微调过,属于“科班出身”的语文课代表。

第二组:通用大语言模型(LLMs)。包括Flan-T5、Mistral、Llama、Gemma、Qwen、InternLM、DeepSeek这些当红炸子鸡,参数量从1.5B到12B不等,既有基础版也有指令微调版。

第三组:数学专用大模型(Math LLMs)。这才是重头戏。Llemma、MetaMath、WizardMath、OpenMath、QwenMath、InternLM-Math、DeepSeekMath,这些可都是“奥数集训队”出来的,专门在数学数据上练过。

论文把49个模型按“每类任务F1分数”排了个座次,咱们捡重点的说:
表4:语言模型在基础算术、数字比较和数字归一化任务上的评估结果(Accuracy/macro F1)
表4:语言模型在基础算术、数字比较和数字归一化任务上的评估结果(Accuracy/macro F1)。加粗标出的是各任务上的最优成绩。
在这份成绩单里,有一个反常的现象特别扎眼:数学专用大模型在小规模预训练模型面前,并没有展现出全面的优势。
先看基础算术。这个项目上,大模型们确实找回了场子。Gemma-2-9B-it拿到了0.651的准确率,Llama-3.1-8B-instruct也有0.577,明显高于DeBERTa-v3的0.451。这说明参数量大、训练数据多,做起计算题来还是有底气的。
但是!一到数字比较(Number Comparison)和数字归一化(Number Normalization),画风突变。DeBERTa-v3+ NLI这个小个子选手,在Quantifier任务上F1达到0.654,Reasoning任务上更是高达0.798,把一堆几十亿参数的LLM按在地上摩擦。再看看那些数学专用模型:Llemma-7B在Reasoning任务上F1只有0.391,WizardMath-7B也只有0.472。这是什么概念?一个专门学数学的,竟然搞不定“1400比290大”这种问题?
更让人大跌眼镜的是数字归一化。这个任务考的是“16”和“sixteen”是不是一个意思,“40mm”和“4cm”是不是一个意思。结果,DeBERTa-v3在Numeration上F1高达0.978,ALBERT也达到了0.965。而Llemma只有0.443,WizardMath是0.700,InternLM2-Math-plus是0.386。给数学学霸一张“十六=16”的卷子,他能给你考不及格,这找谁说理去?
论文里有一句话总结得很到位:“数学推理能力不能泛化到其他数值技能上。”换句话说,你在奥数班学到的东西,到了菜市场砍价的时候,可能真用不上。
不过也别急着否定大模型,指令微调(Instruction Tuning)还是有效果的。论文数据显示,经过指令微调的模型比基础版本在数值任务上普遍高出10-20个百分点的F1分数,有的甚至提升了30多个点。比如Gemma-2-9B-it基础版本在算术任务上F1只有0.320,指令微调后直接飙升到0.634。这说明“听懂人话”和“会做数学题”确实是两种能力。

数字大小与语言语境:模型数值能力的隐藏短板

如果只是“偏科”还不算大问题,更麻烦的是,模型在理解数字的时候,经常被一些“障眼法”干扰。论文里专门做了几个深入分析,把模型的底裤扒了个干净。

第一个障眼法:数字的“大小”会干扰判断。论文用“数字量级效应”来研究这个问题,就看一个事儿:数字本身的大小,会不会影响模型的判断?

图2:数字量级对数值能力的影响
图2:数字量级对数值能力的影响。横轴表示数字的大小范围,纵轴表示模型的准确率。
结果发现,大多数模型在处理大数字(比如几千、几万)时的准确率,明显低于处理小数字(比如个位数、十位数)。这说明模型对“数字大小”这件事本身没有直观的感受,数字大了它就容易犯迷糊。这就好比一个人,你问他“1块钱和2块钱哪个多”,他秒答;你要问他“1万亿和2万亿哪个多”,他可能得先数数零有几个。

第二个障眼法:更致命的是“语境理解”的缺失。论文设计了一个“模板-公式”稳健性测试:同一道题,换个说法(比如把“猫”换成“苹果”),模型还会不会做?

图1:基于不同模板和公式的基础算术稳健性测试结果(DeBERTa-v3、LLama3.1-8B-instruct、Qwen2.5-Math-7B-instruct)
图1:基于不同模板和公式的基础算术稳健性测试结果。图中展示了DeBERTa-v3、LLama3.1-8B-instruct和Qwen2.5-Math-7B-instruct在不同模板与公式组合下的表现。
横轴是模型在不同任务上的得分,每个色块代表“模板A+公式B”这种组合的准确率。如果模型真的懂算术,那么不管套什么马甲,只要公式对了,结果就该是对的。但实验结果让人哭笑不得:模型的表现非常不稳定。同一个模型,在某些模板上能考90分,换个模板直接不及格。这说明它们很大程度上是在“背题”,而不是在“解题”。
论文还发现了一个有趣的“人类相似性”问题。人类学习者普遍觉得加减法比乘除法简单,多位运算比单步运算难。小的微调模型(如DeBERTa-v3)也表现出了类似的规律,这符合我们的直觉。但数学专用大模型(Math-LLMs)的行为模式就不那么“拟人”了,它们做复杂的乘除运算跟做加减法一样……一样地拉胯,完全没有体现出“题海战术”应有的效果。
更值得关注的是,几乎所有模型在处理NLI中的“中性(Neutral)”类别时都表现得非常挣扎。在“数字带量词”子任务中,大部分模型对于中性类别的召回率不到0.3(满分1.0),数学专用模型更是差到离谱。有个别模型(比如OpenMath-Mistral和InternLM2-Math-plus)甚至一个中性样本都预测不出来。这说明什么?说明模型根本分不清“我该不该知道这个答案”——要么就是傻傻地觉得都能推出来(错判为蕴含),要么就是觉得都不相关(错判为矛盾)。这种对“信息不确定性”的感知能力,恰恰是真实世界推理的基础,而这一步,它确实还没学会。
图A3:不同数字表示形式下,模型在基础算术和数字比较任务上的准确率。digit:数字表示,word:文字表示,mixed:混合表示
图A3:不同数字表示形式(阿拉伯数字 vs 英文文字 vs 混合)下,模型在基础算术和数字比较任务上的准确率表现。

基准开源与未来展望:数值推理评估的新起点

这篇论文最大的价值,或许不在于告诉了我们“哪个模型最强”,而在于提供了一个全新的、更贴近日常使用的评估视角。目前这个包含超过2.8万对句子的测试集,已经全部开源到了GitHub上(项目地址:https://github.com/rmahendra/numeracyNLI),任何研究者都可以拿来测一测自己手头的模型。
对于咱们普通读者来说,这研究的实际意义在于:当你下次看到某个大模型又在数学基准上刷新了SOTA时,不妨多问一句——“那它知道‘3000克’和‘3千克’是一回事儿吗?”
论文同时也是一项对现有认知的补充和挑战。它证明了数学能力和数值能力是两个不完全重叠的技能树。未来的方向应该是双管齐下:一边通过更好的数据和训练策略增强模型对数字语义的理解,另一边持续建设更全面的评估基准。一句话总结就是:模型不仅要会“算得对”,还得“说得清”和“看得懂”。这也正是自然语言处理走向真实应用所必须跨越的一大步。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文提出基于自然语言推理的数值能力基准,评估49个语言模型在算术、数字比较和归一化上的表现。结果显示,数学专用模型仅在算术上占优,数字理解与语言理解能力并未同步增强。
这篇工作最值得看的点是什么?大多数模型在基础算术和数值比较任务上F1分数低于0.75;数学专用LLM仅在算术任务上优于通用模型;小型微调模型在数值比较和归一化任务上可与LLM媲美
这篇工作的边界或风险在哪里?优点:构建了系统性的数值能力NLI基准,覆盖三种基础数值技能;大规模评估49个模型,结论具有广泛性;揭示了数学专用LLM的局限性。缺点:仅覆盖英语;未探索少样本学习和思维链提示;数值类型覆盖有限(缺少分数、小数、百分比)
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆把数值能力作为NLI任务来评估的视角很独特,模板+公式的自动化数据生成方式也为后续基准构建提供了新思路。

实验合理度:★★★★☆一口气跑了49个模型、覆盖17个家族,工作量相当扎实。零样本的设置一致且公平,对于“中性”类别的额外分析也做得比较到位,扣一星是因为测试集主要基于现有的AWP和WikiConvert改写,自建语境的多样性还可以更强。

学术研究价值:★★★★☆这篇论文最重要的贡献是给“数学强=数值能力强”这个普遍认知敲了一记警钟,为未来数值推理研究划清了边界、指明了方向,对事实核查、科学假设验证等下游任务都有参考意义。

稳定性:★★★☆☆测试集中各任务的表现方差比较大,模型在不同模板和公式组合下的结果波动明显。这反映了模型数值能力的不稳定性,也说明评估结果可能会因为数据集的具体构成而产生变化。

适应性以及泛化能力:★★★☆☆基准限定在英语、三个基础任务上,对多语言、多领域以及更复杂的数值推理场景的覆盖还不够。不过,其“模板-公式”自动增广机制本身就包含了对泛化能力的考量。

硬件需求及成本:★★★★★49个模型都能用开源权重跑推理,配合现成的推理框架,普通单卡或几卡就能跑完。数据生成虽然调用了ChatGPT做了辅助改写,但这是离线一次性成本,对复现者来说代价很低。

复现难度:★★★★☆数据集已开源在GitHub上,且论文对数据构建步骤的细节描述得很清楚。扣一星是因为附录中提到部分数据是通过ChatGPT辅助生成的,虽然经过人工检查,但这一步骤目前没有提供完整的原始交互记录,也算是个次要制约。

产品化成熟度:★★★☆☆本基准非常适合作为模型上线前的“体检项目”,尤其是在医疗、金融、科研等对数字敏感的垂直领域做质量门禁。但基准本身是评估工具,不直接解决业务问题,且当前仅覆盖英文,产品落地时还需要针对特定领域做适配和扩充。

可能的问题:论文主要以开源模型为主,缺少对闭源商业模型的评测;数据集中英文单一,未覆盖其他语言的数字表达习惯;“中性”类别的数据生成策略(如通过翻转得到)仍可能残留少量模式化痕迹,模型有取巧空间。


主要参考文献

Mahendra R, Spina D, Cavedon L, et al. Evaluating Numeracy of Language Models as a Natural Language Inference Task[C]//Findings of the Association for Computational Linguistics: NAACL 2025. 2025.
Ravichander A, Naik A, Rose C, et al. EQUATE: A Benchmark Evaluation Framework for Quantitative Reasoning in Natural Language Inference[C]//Proceedings of the 23rd Conference on Computational Natural Language Learning (CoNLL). 2019: 349-361.
Mishra S, Mitra A, Varshney N, et al. NumGLUE: A Suite of Fundamental yet Challenging Mathematical Reasoning Tasks[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2022: 3505-3523.
Sivakumar V, Moosavi N S. FERMAT: An Open-Source Framework and Dataset for Analyses of Mathematical Reasoning in Language Models[J]. arXiv preprint arXiv:2310.10531, 2023.
Bowman S R, Angeli G, Potts C, et al. A large annotated corpus for learning natural language inference[C]//Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing. 2015: 632-642.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球