← 返回 PaperDaily 大模型与智能体

0.75还是0.50?越南高考凸性评分给大模型评测上了一课

大模型评测几乎都在用“对错”代替“官方评分”,越南2025年高考的凸性评分直接把这种替代打回原形。本文用632道真题和百万考生真实分布,把模型放进人类排名里比了一次,结果让人捏把汗。

0.75还是0.50?越南高考凸性评分给大模型评测上了一课
原论文信息如下:
论文标题:
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam’s 2025 Convex Marking Scheme

发表日期:2026年8月

发表单位:越南邮电技术学院(Posts and Telecommunications Institute of Technology, Hanoi, Vietnam)

原文链接:https://arxiv.org/pdf/2608.18336v1.pdf


每年六月,越南有超过一百万高中生走进考场,参加全国高中毕业考试(THPT)。这场考试决定了他们能否拿到高中文凭,也决定了大学录取的起跑线。2025年,越南教育部对考试进行了一次大改版,其中第二部分(Part II)的评分规则变成了一个“凸性阶梯函数”:每道题包含四个判断题,对几题给几分,但给的分数不是线性的——全对给1.00分,对三题只给0.50分,而不是0.75分。换句话说,国家明确在惩罚“半桶水”的知识。
问题来了:几乎所有大模型评测基准,都在用“逐题对错”代替官方评分规则。一个模型四题里答对三题,基准会按0.75分记,可越南教育部只给它0.50分。这对模型来说,相当于考试没按官方规则阅卷,而是找了个宽松的代课老师。听起来差距不大?但在Part II占整张试卷40%分值的背景下,这一点点差距足以让一个模型从百万考生中的前10%掉到前23%。
越南邮电技术学院(PTIT)的研究团队把这件事做成了一份严格的基准测试,名字叫THPT-Ladder。他们收集了2025和2026两年、11个科目、21场官方考试、共632道真题,用教育部官方公布的答案和评分规则给八个主流大模型打分,再把模型的分数直接放进同时期参加考试的百万人类考生排名里。本文就带大家看看,当模型真正坐上高考考位,按国家规则阅卷时,它们的真实水平到底如何。

越南高考改革:凸性评分如何暴露LLM评测的致命缺陷

先说说越南高考改了什么。2025年之前,越南高中毕业考试基本是传统四选一选择题,满分10分,逐题计分。2025年改革后,教育部发布了第764号决定(Decision 764/QĐ-BGDĐT),把考试题目分成三个部分:第一部分(Part I)是传统四选一,每题0.25分;第二部分(Part II)是四道判断题打包成一道大题,共享1分;第三部分(Part III)是填空题,没有选项,分值视科目而定。
Part II就是论文的主角。它的评分方式不是按比例给分,而是一个阶梯:四道判断题全错或全对,得分是0或1.00;对1题得0.10,对2题得0.25,对3题得0.50。如果你对3题,按传统准确率逻辑应该得0.75分,可官方只给你0.50分。这0.25分的差距,论文称之为“部分学分差距”(partial-credit gap)或“短付”(shortfall)。
图2:题库中的一道第二部分题目,左侧为越南语原题,右侧为英文翻译。四个陈述均为正确。该题展示了凸性评分阶梯:四个陈述中正确判断三个得0.50分,而非按比例给0.75分。右面板展示了该规则如何让全部八个模型在语料库的每道第二部分题上少得0.020至0.159分。
注意,这套规则不是某个老师的个人偏好,而是国家规定的阅卷标准。越南教育部每年会公布官方答案和评分规则,并且公开全部考生的分数分布。这就给了研究者一个极其罕见的条件:可以把大模型的得分直接放回人类考生群体里做百分位排名。你不是在跟某个虚构的“基线”比,而是在跟一百多万个真实高中生比。
论文指出,现有的大模型评测基准几乎都丢掉了一个关键信息——阅卷规则。VMLU、VNHSGE等越南语基准,收集了大量题目,但打分方式全是“逐题对错”。这种替代默认了一个假设:部分知识应该获得比例分数。可一旦考试的真实规则是凸性阶梯,这个假设就崩了。基准报告的是模型“应该得”的分,但国家“实际给”的是另一个分。换句话说,标准基准可能报告了一个国家机构根本不会认可的能力。

从0.75到0.50:部分学分差距的数学

从0.75到0.50:部分学分差距的数学本质

先把Part II的评分规则翻译成人话。每道Part II大题由四个判断题组成,正确答案由越南教育部统一公布。一个考生四个判断里答对a个,得到的分不是按比例算的,而是查一张官方阶梯表:答对0个得0分,1个得0.10分,2个得0.25分,3个得0.50分,4个得1.00分。这张表就是论文反复提到的ladder函数,也是整个研究最核心的坐标轴。
如果按传统基准的“比例学分”逻辑,答对a个陈述应该拿0.25×a分。于是矛盾出现了:答对3个,比例给分是0.75,官方只给0.50;答对2个,比例给分是0.50,官方只给0.25;答对1个也少了0.15分。只有全对或者全错时,两种算法才一致。论文把这个差值定义为“部分学分差距”(partial-credit gap),也简称短付(shortfall)。这个差距不是零碎的“少给几分”,而是国家阅卷规则里明明白白写着的惩罚项。
短付用公式(2)严格定义:
公式(2):短付计算公式。
公式(2)中,Q是模型作答的Part II题目数量,a_q是第q题中正确判断的陈述个数,ladder[a_q]是官方阶梯给出的分数。整个求和后再除以Q,得到的平均短付永远非负。只有当模型对每道题要么全对、要么全错时,短付才等于0。换句话说,短付不为零,意味着模型的知识是“散装”的——每道题都知道一点,但每道题都不完整。
图3:凸性阶梯评分规则与实际作答分布。
图3:凸性阶梯评分规则与实际作答分布。国家按阶梯函数给分,比例学分则对应直线对角线。两者差距在四个陈述答对三个时最宽:官方0.50分对比例0.75分。值得注意的是,在模型作答的Part II题目中,有17.6%恰好落在这个惩罚最重的档位上,所以短付是真实效应,不是理论上的边角情况。
再来看一个反直觉的数学事实:如果考生完全不读题,对每一句判断题都扔硬币决定“对”还是“错”,期望得分反而偏高。把四种正确数量按二项分布加权:
公式(1):随机猜测Part II一题的期望得分计算。
公式(1)中C(4,k)是从四个陈述里选中k个正确的组合数,2⁻⁴是每次独立二选一的概率,ladder[k]是官方阶梯值。计算结果为4.90/16=0.30625分,比传统四选一每题0.25的期望高出22.5%。凸性阶梯确实把“全蒙全对”的概率压到了1/16,但同时偷偷抬高了猜题者的平均收益。
把这个猜测期望代入各科目结构,整张试卷的随机基线也各不相同:数学因为有6道Part III填空题兜底,猜题一分拿不到,整卷随机基线只有19.75%;而另外五个没有Part III的科目(如经济法、历史等),随机基线高达27.25%。所以“超过随机”在越南高考里不是一个固定数值,单看一个平均分根本说不清模型到底强在哪。

THPT-Ladder基准:632道题、21场考试、22个变体

为了严格按国家规则打分,研究者做了一套新基准,取名THPT-Ladder。THPT是越南高中毕业考试trung học phổ thông的缩写,Ladder则直接指那道凸性评分阶梯。语料库覆盖2025和2026两年、11个科目、21场官方考试、632道题,以及22个官方变体(mã đề)。每道题的答案都直接来自教育部发布的官方答案键,不存在任何第三方标注的主观成分。
表1:第764号决定规定的各科结构及基准语料覆盖情况。
表1:第764号决定规定的各科结构及基准语料覆盖情况。其中I/II/III分别代表三个部分的题目数量,分值分别为0.25分、1.00分以及0.50或0.25分;rnd表示整卷随机基线;2025和2026两列是各年收录的题数,某个数字超过单场考试题数说明该年收录了两个变体;Fig.是随数据集提供的图片数量。
结构上的关键信息有两点。第一,Part II除了英语科目外,在其余十个科目里都会出现,而且一出现就是4道大题、每题1分,合计4.00分——整张10分试卷的40%。第二,Part II的题量非常集中:在某些科目里,整张试卷只有22到28道题,其中4道就决定了两成的分数分布。换句话说,模型在这些科目上的排名,很大程度上由它在这4道题上的犯错形状决定。
Informatics(信息学)是个特例:卷面印了6道Part II题,但考生只需作答其中4道——包含两道公共题和两组选修题各选一道。论文按“大题”计数,一道Part II计一个item而不是按4个判断题计4个,所以数学科目22题就对应官方总结里的34个统计单位。这种计数方式跟官方阶梯“按题给分”的规则保持一致。
除了题目本身,论文还收录了每场考试公布的全部考生分数分布。2025年越南高考有超过113万名考生参加,论文用官方分布的310次对比校验成功复现了教育部公布的统计结果(312次中成功310次),然后把模型的得分直接变成人类考生百分位。这不是制造一个虚拟对照组,而是把模型放进真实的一百多万人里重新排队。

八模型实测:准确率第一≠官方评分第一

论文测试了8个模型,包括3个开源权重模型(Qwen3.5-27B、Qwen3.5-9B、InternVL3.5-8B)和5个闭源模型(Claude Opus 5、GPT-5.5、Claude Sonnet 5、Claude Opus 4.8、Claude Haiku 4.5)。开源模型在本地服务器上用发布方推荐的采样参数运行;闭源模型通过API调用,其中大部分不接受修改采样参数,因此实验并没有刻意追求解码设置完全相同,而是尽量接近实际使用场景。所有题目以越南语逐题呈现,图片一并给出,不带任何解题过程提示。
表2:8个模型在632道题上的官方规则得分。
表2:8个模型在632道题上的官方规则得分。三行开源模型在前,五行闭源模型在后。% avail是模型挣到的分数占22个变体总价值220分的百分比;I和III分别是四选一与填空题的正确率;II stmt是判断题的逐句正确率;II pts/q是每道Part II题的平均得分;shf/q则是每道Part II题的平均短付。
看Qwen3.5-27B这一行:它拿到了93.8%的可用分数,Part II逐句正确率92.6%,听起来很强。但按官方阶梯算,它每道Part II题只拿到0.884分,平均每题短付0.042分。整体上,8个模型的短付从0.020到0.159分/题不等。别小看这零点零几分——在百万考生的排名里,它可以是一段不小的距离。
最反直觉的发现是:语句准确率不预测短付。把模型按语句准确率从高到低排,短付并不是跟着单调下降。GPT-5.5的语句正确率96.7%,低于Claude Opus 5的97.3%,但前者的短付0.020反而小于后者的0.024;Claude Sonnet 5的正确率93.5%,高于Qwen3.5-27B的92.6%,但Sonnet 5的短付0.054反而大于Qwen3.5-27B的0.042。换句话说,准确率更高的模型,可能在官方评分下输得更惨。
论文还做了一个思想实验:把Sonnet 5的总体准确率固定住,只调整它错误的分布方式,结果官方阶梯给出的分数在0.869到0.932分/题之间来回摆动。如果只看一个准确率数字,你根本猜不到模型实际能拿多少分。分数取决于正确陈述在题目之间怎么“扎堆”,跟总数量关系不大。
有个例子把这件事展示得淋漓尽致。在2026年生物学科目上,Qwen3.5-27B和上文的盲猜字符串都判断对了16个Part II陈述中的11个,但模型只拿到1.75分,盲猜字符串却拿到2.35分。原因在于分布形状:模型在四道题上的正确数分别是3、2、3、3,均匀但分散;盲猜字符串是2、4、1、4,有两道题全部命中。官方阶梯明确为第二种形状付更高的钱。
图5:三个开源模型在18场考试中的考生百分位排名。
图5:三个开源模型在18场考试中的考生百分位排名。纵轴从人类考生最难的科目(数学2025,人类均分4.78)排到最容易的科目,右列为人类均分。Qwen3.5-27B在数学2025超过99.95%的1,126,172名考生,在历史2025却只超过76.97%的481,293名考生;InternVL3.5-8B的百分位更是从17.8一路窜到97.9。一个平均分完全藏得住这种剧烈波动。
图6:18场考试中人类均分与三个开源模型得分的关系。
图6:同样的18场考试,人类均分与开源模型得分画在同一张0-10的图上。如果难度可以从人类迁移给模型,点阵会沿着对角线分布;但所有点阵基本平行于横轴,说明模型的分数跟人类付出的代价几乎无关。Qwen3.5-27B、Qwen3.5-9B、InternVL3.5-8B与人类难度排序的Spearman相关仅为0.04、0.02和0.35,都不显著;闭源模型全部落在-0.14到0.22之间。反过来,Qwen3.5-27B和GPT-5.5对18场考试难度排序高度一致(ρ=0.86,p<0.001),说明模型之间有共鸣,但模型和人类之间没有。

不读题也能拿24%分数?答案键的隐藏漏洞

这里有一个让人哭笑不得的发现。研究者把16种可能的固定四值字符串(比如DDSS表示第一句选“错”、第二句选“错”、第三句选“对”、第四句选“对”)逐一在其余19年数据上测试,挑出表现最好的DDSS,然后让它完全不去看题、对所有考试都提交同一个答案。
结果DDSS在全部20场考试中全都赢了独立随机猜测(在18场里获胜),能拿到一张10分试卷的11.07%到24.25%的分数。原因是官方答案键并不是均匀分布的。在四种陈述位置里,“对”的出现频率各不相同,DDSS恰好是16种模式里最常见的一种,出现概率14.5%,而完全平衡的答案键只会让它出现6.25%。图4展示了每个陈述位置的“真”的比例:
图4:20个科目年份中,Part II各陈述位置为真的频率。
图4:20个科目年份中,Part II各陈述位置为真的频率。以数学为例,(a)位置在所有96道题里都是“真”;而在2026年地理科目中,(a)位置只有29%为“真”,(d)位置只有14%。答案键的不平衡方向随科目不同而改变,这意味着不管模型还是人类,只要掌握了这个统计规律,不读题也能稳定拿分。
这个基线的意义在于它定义了一个“能力的下限”:如果模型在Part II上的得分连一个固定字符串都打不过,那它值得被怀疑为零基础。采购方和评测方应该把这个地板写进报告。顺带一提,在2026年经济与法律科目上,表现最好的固定字符串变成SDSS,不读题拿到1.75分——而图1中对应的考生分布有282,519人,模型和盲猜字符串都被放在同一把尺子上比较。
mmexport1760710364748

评测启示:标准基准正在报告机构不会认证的能力

这篇论文给出的不只是另一个分数,而是三个可以直接用的实践约束。第一,任何要在越南这套考试上做自动阅卷的系统,都必须实现Decision 764的阶梯函数,而不是比例给分。两种规则在每道Part II题上的分歧是0.020到0.159分;在2025年历史科目上,Qwen3.5-27B那0.042分的短付,直接把它的“名次”从第90百分位拉到第77百分位——中间隔着481,293名考生里的约6.2万人。
第二,准确率数字不能用于采购验收。因为在固定准确率下,官方阶梯付的分数可以落在0.869到0.932之间,准确率并不界定得分上界。正确的做法是直接按官方规则算分,再把分数对照盲猜地板和人类百分位。第三,模型分数不是难度数据。18场考试里,模型和人类对“哪科难”的判断没有一项达到显著相关。如果把模型当作题目的难度标定器,得到的题库不会继承学生真正体验到的难度排序。
研究者也提醒了两个重要的局限。第一,百分位排名有粒度限制:官方评分以0.25分为一档,两个相差不到0.25分的模型在这套体系下无法区分。第二,数据污染是一个绕不开的话题——2025年的所有考试在论文发布时已公开超过一年,模型很可能在训练阶段见过这些题。论文做的检验是看模型在“更干净”的2026年考试上是否突然掉分,结果截距为正但统计上与零无差异,只能算一个无效结果。为了保险,作者建议所有对比都只用2026年6月19日发布的考试题。
回到整篇论文的立论:最强大的两个模型(Claude Opus 5与GPT-5.5)在18场考试里各有8场拿下满分,总分已经无法区分它们了,真正能区分它们的只剩错误的位置。凸性部分学分本质上是国家在拒绝为不可靠的知识付费。当标准基准用逐题准确率代替这套规则时,它报告的是一个机构永远不会认证的能力等级。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?越南邮电技术学院提出THPT-Ladder基准,用632道真题和官方凸性评分规则给8个大模型打分。结果显示,模型准确率与官方得分严重脱节,部分模型因错题分布吃亏,排名暴跌13个百分点;不读题的固定答案串甚至能拿24%分数。
这篇工作最值得看的点是什么?论文在8个模型上进行了全面评估,结果显示所有模型在凸性阶梯评分下均遭受0.020至0.159分/问的扣分;Qwen3.5-27B在2025年历史考试中因0.042分扣分从90百分位降至77百分位;固定答案字符串DDSS可在不读题的情况下获得11.07%-24.25%的分数;模型难度排序与人类考生难度排序无显著相关性(ρ从-0.14到0.35)。
这篇工作的边界或风险在哪里?优点:(1)严格遵循官方评分规则,评测结果具有真实性和权威性;(2)引入人类百分位排名,使模型成绩可直接与人类考生比较;(3)形式化了部分学分差距(shortfall)概念,揭示了标准准确率指标的缺陷;(4)发现官方答案键存在陈述不平衡问题,可被固定字符串利用。缺点:(1)百分位排名受0.25分网格限制,无法区分相近模型;(2)2025年考试题可能已进入模型训练数据,存在数据污染风险;(3)仅覆盖越南单一国家考试体系,泛化性有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出THPT-Ladder基准,严格遵循越南教育部发布的凸性阶梯评分规则(0/0.10/0.25/0.50/1.00)对LLM进行评测,并用人分数分布将模型成绩转换为人类百分位排名,以量化标准准确率与官方评分之间的部分学分差距。

实验合理度:★★★★☆

部分学分差距(shortfall, SF)、官方评分下的每问得分、人类百分位排名、陈述准确率、随机基线

学术研究价值:★★★★☆

提出THPT-Ladder基准,严格遵循越南教育部发布的凸性阶梯评分规则(0/0.10/0.25/0.50/1.

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:,可被固定字符串利用。缺点:(1)百分位排名受0.25分网格限制,无法区分相近模型;

主要参考文献

[1] Nguyen Quoc Hung et al., "Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme," arXiv:2608.18336v1, 2026. https://arxiv.org/pdf/2608.18336v1.pdf
[2] Bui C. T. et al., "VMLU Benchmarks: A Comprehensive Benchmark Toolkit for Vietnamese LLMs," Proc. ACL 2025, pp. 11495–11515.
[3] Dao X.-Q. et al., "VNHSGE: VietNamese High School Graduation Examination Dataset for Large Language Models," arXiv:2305.12199, 2023.
[4] Quyết định 764/QĐ-BGDĐT, Bộ GD&ĐT, 8 Mar. 2024.
[5] Koto F. et al., "Large Language Models Only Pass Primary School Exams in Indonesia: A Comprehensive Test on IndoMMLU," Proc. EMNLP 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
评分规则都改了,评测方法还停在十年前?加入龙哥读论文粉丝群扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 LLM评测+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。来群里聊聊,你的模型在凸性评分下还能保住排名吗? wechat_helper dianzan


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。