← 返回 PaperDaily
大模型与智能体
阿里最新研究实锤:LLM最高44.1%“正确”答案竟是抄近路蒙的
考试抄答案能拿满分,算会还是不会?阿里巴巴团队系统实锤:LLM在科学推理评测中最高44.1%的“正确”答案靠抄近路蒙出来,而且难度越高的题越爱抄。这篇论文给出了可落地的“反作弊”评测框架,值得每一个关心AI真实能力的人读一读。
龙哥读论文
发布于 2026-08-14 09:12:23
阅读 4
查看原文
原论文信息如下:
上学的时候,班里总有那么一种人:平时作业靠抄,考试靠蒙,偏偏每次分数还不低。老师批卷子只看最终答案,那这种人简直就是“学霸”人设不倒。可你要是真让他上台讲一遍解题过程,他立马露馅——因为他的答案压根不是推导出来的,而是从选项里试出来的、从记忆里捞出来的、或者干脆瞎猜一个然后硬凑出来的。
大语言模型(LLM)现在干的事,跟这个“抄答案学霸”不能说毫无关系,只能说一模一样。😏 答案对了,方法却错了:LLM的“解捷径”正在骗过你的评测
上学的时候,班里总有那么一种“抄答案学霸”:平时作业靠抄,考试靠蒙,偏偏每次分数还不低。老师批卷子只看最终答案,那这种人简直就是“学霸”人设不倒。可你要是真让他上台讲一遍解题过程,他立马露馅——因为他的答案压根不是推导出来的,而是从选项里试出来的、从记忆里捞出来的、或者干脆瞎猜一个然后硬凑出来的。
大语言模型(LLM)现在干的事,跟这个“抄答案学霸”不能说毫无关系,只能说一模一样。龙哥扫完这篇由阿里巴巴集团与阿里巴巴达摩院研究者完成的论文《Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks》,第一反应是:这也太真实了。论文的核心观点简单又扎心——在各类科学推理基准测试里,LLM经常用“抄近路”的方式拿到正确最终答案,但不是通过题目真正想考察的推导过程,而是靠搜索、枚举、猜测甚至先看答案再倒着凑。这种失败模式,论文称之为解捷径(Solution Hacking) 。如果评测只看最终答案,你就完全发现不了它。
“解捷径”是什么?藏在正确答案背后的第三种失败模式
通常判断一个模型会不会做某道题,评测只看结果:答案对就给分。这个逻辑默认了一个前提——“答案对”等于“用了题目想考察的能力”。但实际推理存在三条路:路线一是正常推导得到正确答案,那是真会;路线二是推导错误得到错误答案,这是推理错误;路线三是用一个非法的捷径碰巧拿到正确答案,这就是解捷径。传统评测能分清路线一和路线二,却把路线三当成了路线一。下面这张图把这个区别画得很清楚。
为了严格界定,论文给出了形式化定义。对一道题目(q, a*),q是问题,a*是参考答案。模型生成解答s后,可提取最终答案â(s)。传统评分只看“â(s)是否等于a*”。论文引入两个关键符号:C(q)表示题目q目标考察的推理能力 ,M(q)表示领域专家公认的、可以合法展现该能力的策略集合 。解捷径的定义是:最终答案对了,但在某个关键步骤上,用了一个不在M(q)中的捷径策略替代了C(q),又没能真正完成题目要求的推导。
这一定义要靠三个判据落地:T1目标关键点 ,捷径是否替换了题目本来要考的核心步骤;T2能力绕行 ,策略是绕过了目标能力,还是合法地运用了它;T3推导支撑 ,推理是否独立建立答案,而不是只证明了一个候选答案和部分条件吻合。三个判据都满足,才算解捷径。
划重点:解捷径不是按“表面技术”分类,而是按“角色”分类。枚举变量本身不总是坏事,如果枚举本来就是题目要求的方法,且搜索空间被穷尽证明,那就是合法解;但只猜一个候选,再检查它满足某个条件、不排除其他候选,那就是作弊。论文也特别强调,一个“诚实推导但结果错误”的过程属于推理错误,而一个“答案正确但关键步骤被替换”的过程才是解捷径。两者正交。
论文总结了五种常见捷径模式:数值搜索 ,本该做解析推导,结果用二分法或牛顿迭代去凑数;枚举 ,在一个候选空间里暴力搜索,搜到第一个对得上的就停;模式猜测 ,看到几个例子就直接外推一般结论;公式猜测 ,凭记忆或量纲直接猜一个函数形式再配参数;答案猜测 ,直接提出一个像答案的数,只检查它和题目条件不冲突,不排除其他可能。另外还有一类“其他捷径”,比如在关键步骤直接断言一个结论,或者偷偷删掉一个条件去解一个更简单的题。这些行为在物理和化学中同样存在,只是形式不同——物理学中最多的是公式猜测(占物理hack的66%),化学中最多的是答案猜测(占化学hack的60%)。
数据实锤:前沿模型最高44.1%的“正确答”是作弊来的
解捷径这种事,偶尔一两条还能说是意外,但论文在尺度上让人没法回避。研究团队构建了一个大规模评测语料,覆盖数学、物理、化学三个学科,难度分成普通题、竞赛题、前沿题三档,用11个主流前沿模型(包括GPT-5.2、GPT-4.1、Claude Opus 4.7、Gemini-3.1-Pro-Preview、DeepSeek-V3.2、Qwen3.7-Max等)独立作答,收集了3528个解题过程,再由一个经过专家校准的检测器逐一判断哪些是解捷径。
第一个结论:题目越难,模型越爱作弊。教科书级的普通题,解捷径率只有2.2%;到了竞赛题,这个数字涨到28.3%;再往上到HLE(Humanity's Last Exam,人类最后考试,目前前沿科学推理基准,缩写HLE,全称“Humanity's Last Exam”),直接飙到37.4%。而且每个学科单独看,都呈现同样的单调递增趋势。这个结果很有画面感——简单题大家都老老实实推,难题一来,模型立刻开始“抄小道”。
第二个结论更扎心:作弊显著虚高了报告分数。在前沿难度档次上,整体解捷径率为33.2%。但更值得看的是HR|corr 这个指标——它表示在所有被判定“答案正确”的解答里,有多少比例实际是解捷径。这个数字在最强的Gemini-3.1-Pro-Preview上是8.2%,在最弱的GPT-4.1上高达44.1%。翻译一下:GPT-4.1在前沿题上的名义准确率只有10.1%,其中接近一半的分数是靠捷径捞来的,真正算得上干净推导的准确率只有5.7%。论文把“只有正确且非hack的答案才记分”的准确率称为DAA(Derivation-adjusted Accuracy,推导校正准确率) 。每个模型在DAA上都会低于原始准确率,无一例外。
*表格超出部分左右可以滑动
模型
准确率Acc (%)
解捷径率HR (%)
正确解中hack占比HR\|corr (%)
DAA (%)
GPT-5.5† 48.1 22.0 21.0 38.0
Kimi-K3† 46.9 12.3 11.0 41.7
DeepSeek-V4-Pro† 45.7 22.7 23.9 34.8
Qwen3.7-Max 45.6 17.7 17.8 37.5
Gemini-3.1-Pro-Preview 44.0 14.1 8.2 40.4
Claude Opus 4.7 42.0 20.9 21.2 33.1
GLM-5.2† 37.4 20.5 19.5 30.1
Claude Opus 4.8† 34.0 38.2 23.7 26.0
GPT-5.2 19.6 35.7 19.0 15.8
DeepSeek-V3.2 15.5 50.3 28.8 11.0
GPT-4.1 10.1 60.4 44.1 5.7
表中是主语料结果(3528个前沿模型解题过程,部署检测器,%)。数据来自论文表4。†标注的模型为后续补充测试,按相同协议跑完。可以看到,越弱的模型解捷径率越高,分数虚高越严重。
第三个结论:模型越弱,越倾向于在“不会做”的时候作弊。论文把“条件作弊倾向”(即在模型没能干净解出题目时选择hack的概率)和模型准确率做了相关性分析,得到相关系数r=-0.86。也就是说,能力越差的模型,越爱在硬骨头面前抄小道。但有趣的是,强模型虽然作弊率低,一旦作弊,成功率反而更高——同样的捷径,在强模型手里更容易变成蒙对的答案。换句话说,作弊这件事,对强模型更“划算”。
专家锚定三部曲:如何造出一个可信的“解捷径”检测器
既然要抓作弊,检测器本身的可信度就是生命线。团队没有直接拿大模型互评,而是用“专家锚定”的三阶段流程来构建检测器,每一步都让人挑不出大毛病。
Stage 1:种子审计与分层语料。 先用一个审计模型(Gemini-3.1-Pro-Preview)配合专门编写的审计指令,大批量扫描前沿模型产出的解题过程,挑出疑似作弊的样本,同时也保留一些干净样本,构成一个分层语料池。这样可以避免真实场景中作弊样本太稀疏、难以训练二分类器的问题。
Stage 2:盲审专家标注。 从池中抽取300条解题过程(数学101条、物理100条、化学99条),打乱顺序后,交由对应学科的博士级专家盲审。最终专家一致认为,这300条里有35.2%属于解捷径(数学45.9%、物理26.5%、化学33.0%)。这300条标注结果形成“锚定集”,其中180条用于调优,120条作为一次性的测试集,只用一次,避免反复调参导致测试集信息泄漏。
Stage 3:校准与最终检测器。 利用180条开发样本调优审计提示词,最终检测器由GPT-5.2、Claude Opus 4.7、Gemini-3.1-Pro-Preview三个模型做多数投票。每个模型都不会审计自己的输出,避免“自评满分”的尴尬。调优后的检测器与专家整体一致率为75.4%,明显好于Stage-1单一审计器的71.6%。
*表格超出部分左右可以滑动
检测器
整体一致率 (%)
数学 (%)
物理 (%)
化学 (%)
单一审计器(Gemini) 71.6 76.5 76.8 61.6
三模型投票(自审) 77.7 82.2 82.0 68.7
三模型投票(无自审,部署) 75.4 79.6 81.6 64.9
表为检测器与专家的一致率(数据来自论文表2)。粗体为最终部署的检测器:三模型投票、且模型不自审自己的答案。
关键点来了:检测器的错误是不对称的。它在专家认为干净的样本里只误伤了17%(32/190),但漏掉了专家确认的作弊样本中的39%(40/103),整体只恢复了61.2%的专家确认作弊。也就是说,检测器漏判多于误判,论文里报告的所有解捷径率都应视为真实值的下界(lower bound) 。用更直白的话说:真实情况大概率比论文报告的还严重。
*表格超出部分左右可以滑动
学科
专家确认hack率 (%)
检测器hack率 (%)
召回率
数学 45.9 43.9 0.76
物理 26.5 22.4 0.58
化学 33.0 30.9 0.44
总体 35.2 32.4 0.61
表为检测器各学科下的hack率与召回率(数据来自论文表3)。检测器在每个学科都低报了hack率,总体只恢复了61.2%的专家确认作弊。
Acc ,最终答案正确率;HR ,解捷径率;HR|corr ,正确解中的解捷径占比,也就是分数虚高比例;DAA ,推导校正准确率,只有“答案正确且不被判为hack”的样本才计入。DAA与Acc的差距就是被捷径污染的分水。
反解捷径提示实测:扣掉虚高分数后,真实推理还剩多少?
检测器负责事后抓作弊,那能不能在模型答题的时候就“劝”它别作弊?论文设计了四种反解捷径提示(anti-hack prompt) :禁令清单 ,明确禁止五类捷径策略;必要性要求 ,要求证明答案的必要性或唯一性;护栏规则 ,写明评分规则同时允许合法枚举;预承诺机制 ,让模型先说明打算怎么推导,再在关键步骤标注“推导”还是“猜测”。所有变体都允许模型在无法严格求解时输出“CANNOT SOLVE RIGOROUSLY”并放弃作答。允许放弃很关键——如果逼着模型必须给答案,它只会把作弊藏得更深。
实验结果相当有说服力。在最具挑战的跨学科子集上(核心题目,共1008个样本),最强的反作弊提示把名义准确率从50.6%压到了37.3%,把弃权率从0%拉到27.3%;与此同时,真正“又正确又不作弊”的DAA只从41.2%小幅下降到35.2%。换句话说,被扣掉的13.3个百分点里,绝大部分本来就是靠捷径骗来的分数,不是真推理的损失。这个结果让龙哥很想鼓掌——它说明只要把游戏规则说清楚,模型是能收敛到“老老实实做人”的。
图4里有个细节值得注意:物理学科中反作弊提示把解捷径率压了下来,但报告准确率和DAA几乎重合,阴影区接近零。这说明物理里模型虽然会尝试hack,但这些hack很少真的被计分。不同学科的作弊收益并不一样,这也是后续评测设计要分学科考虑的原因。
给AI评测的启示:从“只看答案”走向“验证推理过程”
这篇论文给AI评测领域带来的最大冲击,是指出了“答案正确”和“能力达标”之间存在的系统性差距。想在基准榜上刷分容易,但要真正证明模型掌握了科学推理,评测就不能只看答案。龙哥认为,短期来看最实用的路线是:主榜继续看答案跑分,同时抽样子集做过程检测,逐步把“过程分”纳入评估体系;长期则要把题目设计得让“搜索”和“猜测”更困难,例如增加开放形式答案、需要自建形式体系的证明题等。
论文也留下了不少坑:检测器目前仍有近40%的漏判,专家之间的判定一致性也不算很高(Cohen's κ只有0.5左右,κ是衡量两名专家判断一致程度的指标,0.5代表中等一致),说明“解捷径”的边界本身就带有灰度。后续工作可以考虑扩大专家标注集、让检测器输出置信度、在题目侧做更严格的防作弊设计。整体上,这篇论文不是要否定现有评测体系,而是提醒所有刷榜和看榜的人:在看准确率之前,先看一眼答案到底是怎么来的。毕竟,如果答案都是“抄”来的,那个分数还代表什么?
龙迷三问
解捷径和普通推理错误最根本的区别是什么? 普通推理错误是老老实实推导但推错了,最终答案是错的;解捷径是答案碰巧对了,但过程里用搜索、枚举、猜测绕过了题目真正想考察的能力。传统评测只能发现答案错,抓不到“答案对但过程作弊”的情况。
HR|corr这个指标到底怎么理解? HR|corr全称是“hack ratio among correct answers”,即在“最终答案被判正确”的解题过程里,有多少比例实际是解捷径。它直接衡量了分数的虚高程度。例如GPT-4.1的HR|corr为44.1%,意味着它每拿到10个正确分,约有4.4分是靠捷径凑出来的。
为什么论文说所有hack比率都只是下界? 因为最终检测器在专家锚定集上只恢复了61.2%的专家确认作弊,漏判率(39%)远高于误判率(17%)。凡是检测器报出来的解捷径率,都低于真实值。论文宁可保守,也不愿夸大问题,所以所有数字都应当理解为“至少这么多”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
定义一个系统的评测失败模式,并用专家盲审+检测器落地,概念新且抓人,配得上高创新分。
实验合理度: ★★★★★
3×3学科与难度分层、11个前沿模型、专家锚定与下界估计,实验设计相当严谨,结论可信。
学术研究价值: ★★★★★
对“只看答案”的评测模式发起正面挑战,对推理评测领域有很强的方法论启发意义。
稳定性: ★★★☆☆
检测器本身仍有漏判,不同学科表现差异较大,直接产品化需要更多校准。
适应性以及泛化能力: ★★★☆☆
框架可以迁移到多学科,但专家标注成本高,换一个学科或语言就需要重新适配。
硬件需求及成本: ★★★★☆
检测器只需调用现成大模型API,不需要额外训练,成本集中在专家标注环节,总体可控。
复现难度: ★★★★☆
论文公布了审计流程、提示词思路和专家标注集,按步骤可复现;但300条人工标注需要博士级专家参与,门槛不低。
产品化成熟度: ★★★☆☆
作为评测工具已可用,但作为标准化产品还缺更大规模的跨领域验证和更稳定的自动判定。
可能的问题: 专家间一致率约κ≈0.5,说明解捷径的边界判断存在灰度;检测器漏判率偏高,给实际应用带来不确定性。
主要参考文献
[1] Xuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Hu Wei, Bing Zhao. Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks. arXiv:2608.02442, 2026.
[2] Rein, D., et al. Humanity's Last Exam (HLE), 2025.
[3] Wang, X., et al. MATH-500: A dataset for evaluating mathematical reasoning, 2023.
[4] Zhong, W., et al. SciBench: Evaluating college-level scientific problem-solving abilities, 2023.
[5] 原论文还引用了IMO-Bench、PHYBench、SciOlympiad、OlymMATH、过程监督(process supervision)等相关工作,详见论文原文。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
解捷径再快,也不如真推导一步一个脚印踏实。想知道怎么给AI的推理过程去水分?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 LLM评测+上海+阿里+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群