现在的大模型,你问它“鸡兔同笼”,它能给你列方程解出来;你问它“微积分”,它也能给你整两步。但你要是给它一句话:“约翰一共有16件衬衫”,然后问它“约翰一共有十六件衬衫”这句话对不对?有些模型可能就得懵圈一会儿。这不是开玩笑。论文里专门设计了一个测试,把数字当成自然语言理解的一部分来考。就好比我们小时候学语文,不光是认字,还要理解词语在句子里的意思。现在的AI模型,很多是“算术巨人,语文矮子”——算数一流,但一涉及到用自然语言去理解数字的大小、单位、语境,立马露馅。这里得先科普一个概念:自然语言推理(Natural Language Inference,简称NLI)。这个任务说白了就是给模型看两句话,一句叫“前提(Premise)”,一句叫“假设(Hypothesis)”,让模型判断这两句话的关系:是蕴含(Entailment)——假设能从前提推出来;是矛盾(Contradiction)——假设跟前提对着干;还是中性(Neutral)——没法确定,信息不足。这篇论文的聪明之处,就是没直接考模型“1+1等于几”,而是把算术、比大小、单位换算这些事儿,全部包装成了NLI的句子对。比如前提说“山姆有9个一角硬币,他爸爸又给了他7个”,假设说“山姆现在有16个硬币”——这考的不光是加法,还有模型能不能把这个加法过程放到句子里理解。这种方式更贴近真实场景,毕竟没人会在聊天时突然说“请计算 9+7”。为了让大家直观感受一下这种考法,咱们直接看论文里的例子,非常生动:表1:数据集示例,涵盖三大基础数值任务(E:蕴含,C:矛盾,N:中性)。可以看到,同样的数字“20”和“80”,加上“不到”“不超过”这些词,整个句子的逻辑关系就变了。
图1:基于不同模板和公式的基础算术稳健性测试结果。图中展示了DeBERTa-v3、LLama3.1-8B-instruct和Qwen2.5-Math-7B-instruct在不同模板与公式组合下的表现。横轴是模型在不同任务上的得分,每个色块代表“模板A+公式B”这种组合的准确率。如果模型真的懂算术,那么不管套什么马甲,只要公式对了,结果就该是对的。但实验结果让人哭笑不得:模型的表现非常不稳定。同一个模型,在某些模板上能考90分,换个模板直接不及格。这说明它们很大程度上是在“背题”,而不是在“解题”。论文还发现了一个有趣的“人类相似性”问题。人类学习者普遍觉得加减法比乘除法简单,多位运算比单步运算难。小的微调模型(如DeBERTa-v3)也表现出了类似的规律,这符合我们的直觉。但数学专用大模型(Math-LLMs)的行为模式就不那么“拟人”了,它们做复杂的乘除运算跟做加减法一样……一样地拉胯,完全没有体现出“题海战术”应有的效果。更值得关注的是,几乎所有模型在处理NLI中的“中性(Neutral)”类别时都表现得非常挣扎。在“数字带量词”子任务中,大部分模型对于中性类别的召回率不到0.3(满分1.0),数学专用模型更是差到离谱。有个别模型(比如OpenMath-Mistral和InternLM2-Math-plus)甚至一个中性样本都预测不出来。这说明什么?说明模型根本分不清“我该不该知道这个答案”——要么就是傻傻地觉得都能推出来(错判为蕴含),要么就是觉得都不相关(错判为矛盾)。这种对“信息不确定性”的感知能力,恰恰是真实世界推理的基础,而这一步,它确实还没学会。图A3:不同数字表示形式(阿拉伯数字 vs 英文文字 vs 混合)下,模型在基础算术和数字比较任务上的准确率表现。
Mahendra R, Spina D, Cavedon L, et al. Evaluating Numeracy of Language Models as a Natural Language Inference Task[C]//Findings of the Association for Computational Linguistics: NAACL 2025. 2025.Ravichander A, Naik A, Rose C, et al. EQUATE: A Benchmark Evaluation Framework for Quantitative Reasoning in Natural Language Inference[C]//Proceedings of the 23rd Conference on Computational Natural Language Learning (CoNLL). 2019: 349-361.Mishra S, Mitra A, Varshney N, et al. NumGLUE: A Suite of Fundamental yet Challenging Mathematical Reasoning Tasks[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2022: 3505-3523.Sivakumar V, Moosavi N S. FERMAT: An Open-Source Framework and Dataset for Analyses of Mathematical Reasoning in Language Models[J]. arXiv preprint arXiv:2310.10531, 2023.Bowman S R, Angeli G, Potts C, et al. A large annotated corpus for learning natural language inference[C]//Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing. 2015: 632-642.