← 返回 PaperDaily 视觉与图像

Meta AI新基准GAMUT:长文评估不只看对错

最扎心的不是模型答错,而是它把该说的全漏了。Meta AI 这篇 GAMUT 直接把“事实完整性”拆成可评估的结构问题:先写清答案该包含什么,再把它变成机器能稳稳打分的二进制清单。

Meta AI新基准GAMUT:长文评估不只看对错
原论文信息如下:
论文标题:
Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness
发表日期: 2026年07月
发表单位: Meta AI
原文链接: https://arxiv.org/pdf/2607.19322v1.pdf
开源代码链接: https://github.com/facebookresearch/GAMUT
项目链接: https://github.com/facebookresearch/GAMUT/raw/main/assets/figure1.png

引言

长篇生成评估最容易犯的错,就是只盯着“有没有胡说”,却忘了“该说的有没有说全”。这篇论文抓住了这个老大难:事实性不只是精度问题,还包含完整性问题。
GAMUT 的思路很直接:先用结构化元评估标准把答案应包含的内容组织起来,再机械编译成扁平的二进制检查项,让 LLM 评委在更稳定的格式里打分。真正厉害的地方在于,它没有把结构扔掉,而是把结构和可评分性分开了。
论文构建了 1,813 个基于真实可穿戴图像的日常深度研究问题,覆盖 10 个领域,还给每题配了证据支持的评估标准。结果也很直白:最强模型 Gemini 3.1 Pro 只拿到 58.7%,说明“长篇回答看起来很会说”和“把该说的都说到位”之间,差得还挺远。

方法概述

GAMUT 的核心不是“再造一个更会挑刺的评委”,而是把评估对象重新定义了。过去很多工作把长回答拆成一串独立事实再判断真假;这篇论文认为,这样做会把“顺序”“分组”“可选覆盖”“重要性层级”这些决定答案质量的东西全抹平。
图1:GAMUT 的两级元评估标准与二进制检查清单编译示意图
图1:GAMUT 的两级元评估标准与二进制检查清单编译示意图。核心意思就一句话:先把“答案该长什么样”说清楚,再把“怎么打分”变稳定
第一层叫元评估标准,允许几种贴近真实答案的结构:简单知识、严格列表、灵活列表、过程、关系。比如“列出所有必需食材”是严格列表,“说出至少几个合理例子”是灵活列表,“按步骤说明演化过程”是过程。这样做的好处很明显:答案不再被硬压成一张扁平清单。
但结构越丰富,LLM 评委越容易打分打飘。于是第二层登场——把这些结构机械编译成二进制检查项。简单知识变成一条检查;严格列表每项单独检查;灵活列表先设“至少覆盖 N 个”的阈值;过程则把每一步拆成存在性检查,再加顺序检查。这样,结构留在“设计答案”的阶段,评分则回到“是/否”这种更稳的形式。
这套编译机制的妙处在于,它没有偷懒地把复杂问题粗暴简化,而是把复杂性前移到元评估标准里,再把评分后移到二进制清单里。换句话说,复杂性负责表达,简单性负责打分。这才是它真正解决的矛盾。

数据准备及实验设计

数据不是从互联网随便扒一批问答,而是做了两件很费工的事:先造问题,再造标准。问题来自真实的可穿戴图像,覆盖 10 个日常领域;标准结合网页证据和专家人工核验逐题构建。这种“题目和答案标准都要人盯着”的工作量,才是它可信的根基。
图2:GAMUT 元评估标准与编译后检查项的结构统计
图2:GAMUT 元评估标准与编译后检查项的结构统计。最关键的结论是几乎每道题都不止是简单事实题,而是带着列表、过程、关系等结构一起出现,说明扁平清单确实会失真。
问题构建上,论文先从 CRAG-MM 选取 1,938 张图像和对应实体,再让前沿多模态模型生成候选问题,要求问题自然、开放、需要多步检索且依赖图像。随后人工多轮筛选、改写、淘汰,确保问题不是“看图猜谜”或脱离图像就能回答。最后加了一层自动过滤,专门检查“陌生人测试”:没看过图像的人能否自然地问出这个问题,不能则淘汰。
标准构建上,流程更像“研究员+审稿人”双人配合。模型先根据检索到的网页证据生成元评估标准并编译成二进制检查项;随后模型自己再做审计和重搜补齐遗漏,再由人工进一步修订。重点不是让模型充当真理,而是让模型当“提案机器”,把人类审核集中在最值得介入的地方。
实验设计也很朴素:给 14 个前沿和开源模型同样的图像和问题,让它们自由生成回答,再用统一的 LLM 评委按同一套二进制清单打分。为了验证结果不是某个评委的偏见,还额外换了两个不同评委重跑。这个设计很像在说:别争嘴,拿同一把尺子量。

实验结果

图3:GAMUT 主实验结果表
图3:GAMUT 主实验结果表。最显眼的不是谁第一,而是最强模型也没跨过 60 分线,说明事实完整性远没有被现有模型解决。
主结果里最扎眼的是 Gemini 3.1 Pro 只拿到 58.7%。这不是“差一点点”,而是说明在这种需要多步检索、覆盖多类事实、还要照顾结构关系的任务里,模型经常不是答错,而是答不全。缺失项占了大头,尤其在弱模型上更明显,说明当前模型的主要短板不是“胡说八道”,而是“漏说关键内容”。
更有意思的是,GAMUT 的排序和大家对模型能力的常识基本一致:新模型通常比旧模型强,大模型通常比小模型强,闭源模型通常比开源模型强。这说明它不是在“随便造一个难题”,而是在稳定地区分真实能力差异。评委切换后排名也基本稳定,说明这套二级标准确实降低了 LLM 评委的随机性。
图4:人工核验网页证据与元评估标准支撑示意
图4:人工核验网页证据与元评估标准支撑示意。这个图的意义在于提醒读者:GAMUT 不是“模型自己编个标准自己考自己”,而是每个标准都尽量落在可核验的网页证据上。
文本版结果也很值得看。把图像去掉后,所有模型分数都上升,但提升幅度大致是一个比较稳定的“常数税”。这说明视觉识别确实增加了难度,但并没有改变模型之间的根本排序;真正拉开差距的,还是知识覆盖和回答完整性。
这点对做评估的人很关键:如果一个基准只会测“有没有看懂图”,那它更像视觉识别题;而 GAMUT 想测的是“看懂之后能不能把完整答案组织出来”。这两个问题不是一回事。

实验结果分析

GAMUT 最有价值的地方,是它把“为什么难”讲清楚了。难点不在于单个事实真假,而在于开放集合、顺序、层级、关系这些结构信息本来就不是一张平面清单能装下的。很多传统评估方法并不是“算错了”,而是从一开始就把题目简化过头了
这也解释了为什么论文要坚持两级设计。元评估标准负责表达“完整答案应该包含什么”,二进制检查负责让 LLM 评委稳定打分。前者是语义层,后者是执行层。把这两层混在一起,评委就容易一边理解结构一边做主观判断,最后分数抖得像喝了三杯咖啡;分开之后,结构保留了,评分也稳了。
从结果看,弱模型的大量问题集中在“缺失”,而不是“矛盾”。这符合直觉:一个模型越弱,越难把多跳检索到的信息组织成完整答案,于是就会出现“说了不少,但关键点漏了”的情况。GAMUT 的评分方式把这种漏项明确惩罚出来,因此比只看事实准确率更敏感。
但它也不是没有边界。第一,GAMUT 依赖高质量网页证据和人工核验,构建成本不低,不适合随便复制到所有领域。第二,它主要测的是“知识完整性”和“结构化事实覆盖”,对风格、说服力、创造性这些维度没那么敏感。第三,虽然文本版证明框架本身可迁移,但真正落地时,图像依赖问题和纯文本问题的证据获取方式还是不同。
所以这篇论文真正的价值,不是“又多了一个榜单”,而是给评估领域补上了一个长期被忽略的维度:事实完整性。这件事一旦被认真对待,很多看起来“回答得挺像回事”的模型,都会在完整性这一关露出短板。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:GAMUT 和传统事实性评估最大的区别是什么?传统方法大多把答案拆成一串独立事实再看对错;GAMUT 认为这不够,因为完整性、顺序和覆盖范围同样重要。它不是只问“对不对”,而是先问“该不该出现、该怎么组织”。

Q2:这套方法最适合什么场景?最适合“答案本来就不是一句话”的任务,比如多步检索问答、日常深度研究、长篇说明、复杂图像相关问答。凡是需要把一堆事实按结构组织起来的地方,它都比单纯的真假判断更有用。

Q3:普通从业者最该注意什么?如果在做评估、标注或产品质检,别只盯着“有没有幻觉”,还要问“有没有漏掉关键内容”。很多真实业务里,漏答比错答更致命,因为用户要的不是“像答案”,而是“完整答案”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆真正新的不是“又一个评估指标”,而是把结构化答案和稳定评分之间的冲突拆成了两层,思路很干净。

实验合理度:★★★★☆数据、标注、评委复核、文本版对照都做得比较完整,能支撑“这不是偶然现象”这个结论。

学术研究价值:★★★★★它补的是长篇生成评估里很关键但常被忽略的一块:完整性,而不是只盯正确率。

稳定性:★★★★☆多评委下排名基本一致,说明分数不是某个 LLM 评委的情绪化输出。

适应性以及泛化能力:★★★★☆框架本身是模态无关的,文本版也能跑,泛化潜力不错。

硬件需求及成本:★★★☆☆训练/推理硬件不是重点,但数据构建和人工核验成本不低,基准不是便宜货。

复现难度:★★★☆☆代码开源是加分项,但重做整套数据和证据链,仍然是重体力活。

产品化成熟度:★★★☆☆更像评估基础设施,不是直接可上线的应用模块,但对质检和评测平台很有启发。

可能的问题:★★★☆☆它主要测“事实完整性”,对风格、创意和交互体验覆盖有限;另外,构建成本决定了它更适合高价值场景。


主要参考文献

Sewon Min, Kalpesh Krishna, Xinxi Lyu, Mike Lewis, Wen-tau Yih, Pang Wei Koh, Mohit Iyyer, Luke Zettlemoyer, and Hannaneh Hajishirzi. FActScore: Fine-grained atomic evaluation of factual precision in long form text generation. In Proceedings of EMNLP, 2023.
Yixiao Song, Yekyung Kim, and Mohit Iyyer. VeriScore: Evaluating the factuality of verifiable claims in long-form text generation. In Findings of the Association for Computational Linguistics: EMNLP 2024.
Jerry Wei, Chengrun Yang, Xinying Song, Yifeng Lu, Nathan Hu, Jie Huang, Dustin Tran, Daiyi Peng, Ruibo Liu, Da Huang, Cosmo Du, and Quoc V. Le. Long-form factuality in large language models. In Advances in Neural Information Processing Systems (NeurIPS), 2024.
Akari Asai, Jacqueline He, Rulin Shao, Weijia Shi, Amanpreet Singh, Joseph Chee Chang, Kyle Lo, Luca Soldaini, Sergey Feldman, Mike D’arcy, David Wadden, Matt Latzke, Minyang Tian, Pan Ji, Shengyan Liu, Hao Tong, Bohao Wu, Yanyu Xiong, Luke Zettlemoyer, Graham Neubig, Dan Weld, Doug Downey, Wen-tau Yih, Pang Wei Koh, and Hannaneh Hajishirzi. OpenScholar: Synthesizing scientific literature with retrieval-augmented LMs. arXiv preprint arXiv:2411.14199, 2024.
Seonghyeon Ye, Doyoung Kim, Sungdong Kim, Hyeonbin Hwang, Seungone Kim, Yongrae Jo, James Thorne, Juho Kim, and Minjoon Seo. FLASK: Fine-grained language model evaluation based on alignment skill sets. In International Conference on Learning Representations (ICLR), 2024.
Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, and Ion Stoica. Judging LLM-as-a-judge with MT-bench and chatbot arena. In Advances in Neural Information Processing Systems (NeurIPS) Datasets and Benchmarks Track, 2023.

事实完备性:LLM评估中被忽视的“另一半”

长篇回答评估里最常见的误区,就是只盯着“有没有说错”,却忘了“该说的有没有说全”。这篇论文抓的正是这个漏洞:事实性不是只有精度,还有完整性。前者看模型有没有胡说,后者看模型有没有漏说,二者缺一半,评估就像只拿体温计测心脏病。
传统长文事实评估多走“拆解—检索—核验”路线,把回答拆成若干原子事实再逐条判断真假。这套方法对“精度”很有效,但对“完整性”力不从心。现实里的好答案往往不是一串独立勾选框,而是带着层级、顺序、可选项、覆盖范围的结构。比如列菜谱、讲演化过程、比较方案,都不是“事实列表”能完全装下的。
GAMUT 的出发点很直接:既然完整答案本来就有结构,那评估标准也别装作“平铺直叙”。它提出的不是一个更会挑刺的评委,而是一种更像人类审稿逻辑的表示方式——先把答案应该包含什么组织清楚,再把它编译成机器能稳定打分的清单。说白了,就是先把题目变聪明,再把评分变老实。
图1:GAMUT 的两级元评估标准与二进制检查清单编译示意图
图1:GAMUT 的两级元评估标准与二进制检查清单编译示意图。核心意思很朴素:先描述答案应该长什么样,再把打分变成稳定的对错判断
这件事之所以重要,是因为很多开放式生成任务的质量,不是由某一个“关键事实”决定的,而是由一整组事实的覆盖方式决定的。少一个步骤,答案就不完整;顺序错了,答案就不严谨。GAMUT 试图把这类“结构性缺失”从评估里显式抓出来。

GAMUT:用1813个“日常深度研究”问题拷问模型

GAMUT 全称是 Grounded Assessment of Multimodal Factuality,中文可理解为“基于证据的多模态事实性评估”。它不是做学术报告式的深题,而是瞄准一种更接地气的场景:用户看着眼前的东西,顺手问一句“这是什么、为什么这样、该怎么做”。这种问题看似日常,实际上往往要跨多个网页、多轮检索才能拼出完整答案。
论文把这种任务叫作 everyday deep research,翻译成人话就是“日常版深度研究”。不是论文写作那种深度,而是现实中真的会问的复杂问题:看见一块点心想知道它为什么会分层,看到一种植物想知道它的用途和风险。问题不高冷,但一点也不简单。
图2:GAMUT 框架的整体效果展示图
图2:GAMUT 框架的整体效果展示图。这个例子最能说明它的风格:不是把答案简单列成清单,而是先分清哪些内容必须有、哪些内容加分、哪些只是背景
数据构建也不是随便凑题。GAMUT 先从 CRAG-MM 里选取真实可穿戴图像,再让前沿多模态模型基于图像生成候选问题,之后由人工标注者反复筛选、改写、淘汰,确保问题既依赖图像,又不是“带答案的诱导题”。如果一个人没看图,只凭常识都能自然问出来,这题才算合格;如果问题一开口就把实体身份暗示得太明显,直接出局。
最终,GAMUT 收集了 1,813 个问题,覆盖 10 个日常领域。这个规模谈不上“海量”,但对高质量、逐题核验的基准来说已经不轻了。更关键的是,每道题都配了一套证据支持的评估标准,经过编译和人工修订,保证题目和标准都站得住脚。
图3:GAMUT 问题在 10 个领域中的主题构成分布
图3:GAMUT 问题在 10 个领域中的主题构成分布。不同领域的主题画像差异很明显,说明题目不是从少数模板里拼出来的,而是围绕具体对象定制的。

双层评分标准:既懂结构,又保可靠

GAMUT 最核心的设计,是把“评估标准”分成两层。第一层叫元评估标准(meta-rubric),负责表达完整答案的组织方式;第二层是编译后的二进制检查清单,负责让 LLM 评委稳定打分。这个分工很像写作和批改分开:先由懂内容的人把标准写清楚,再让只负责判分的人按规则执行。
元评估标准里,论文定义了几种常见结构:简单知识严格列表灵活列表过程关系。这些名字对应现实答案里最常见的几种组织方式。
简单知识就是单个离散事实;严格列表要求每一项都得出现;灵活列表允许从一组候选里覆盖足够多的项;过程强调顺序;关系强调实体之间的连接或对比。论文还允许给列表或过程附上一个“元洞察”,即对整组事实的总结性判断。
图4:GAMUT 元评估标准与编译后检查项的结构统计
图4:GAMUT 元评估标准与编译后检查项的结构统计。这里最值得注意的不是“题目很多”,而是几乎每道题都不止是纯事实题,说明开放式回答的完整性确实离不开结构化表达。
但结构一旦丰富,自动评分就容易飘。于是第二层登场:把元评估标准机械编译成二进制检查项。这里的关键不是“变简单”,而是“变可判”。比如简单知识就是一条检查;严格列表是每项单独检查;灵活列表先设最低覆盖阈值;过程则拆成步骤存在性检查和顺序检查。LLM 评委不需要自己理解整套结构,只要按一个个明确的检查项判断即可。
论文还把评分做成了分层加权:Answer-Critical(答案关键)、Valuable(有价值)、Context(背景信息)三档分别计分,再按全局权重合并。关键内容必须优先保住,背景信息只能锦上添花。
图5:GAMUT 完整示例:jollof rice 问题的元评估标准、二进制检查清单与证据链
图5:GAMUT 完整示例:jollof rice 问题的元评估标准、二进制检查清单与证据链。这个例子把整套逻辑摊开了看,最直观的感受就是:完整答案不是“列几个点”这么简单,而是要按重要性、结构和证据一起组织
这套设计最聪明的地方,是它没有把“结构表达”和“稳定评分”混成一锅粥。结构表达适合人类和标注者,稳定评分适合机器和评委。很多评估工作之所以不稳,就是因为把这两件事强行揉在一起。GAMUT 把它们拆开,等于是给评估系统做了分工。

评估结果:最强模型仅58.7%,事实召回远未解决

主结果非常直接:在 1,813 道多模态问题上,最强模型 Gemini 3.1 Pro 的 Gamut 分数只有 58.7%。这不是“差一点到满分”,而是说明在需要多步研究、覆盖多个事实、还要兼顾结构关系的任务里,模型离“完整回答”还差得远。更扎心的是,模型最常见的失败不是胡说,而是漏说。
表1:GAMUT 主实验结果
表1:GAMUT 主实验结果。这里最重要的不是某个模型排第几,而是最强模型也没把事实完整性这门课及格得特别漂亮。一旦把“该说的有没有说全”纳进来,差距立刻露馅。
从分项看,Answer-Critical、Valuable、Context 三档都没有出现“全面碾压”的情况,说明完整性这件事本身就难。缺失项占了大头,尤其在弱模型上更明显。这意味着模型当前的主要短板不是“瞎编太多”,而是“知道一点,但没讲全”。对真实业务来说,这种漏答往往比错答更麻烦。
论文还展示了一个很重要的现象:GAMUT 的模型排序和大家对模型能力的常识基本一致。新模型通常比旧模型强,大模型通常比小模型强,闭源模型通常比开源模型更稳。这说明基准不是在“制造奇怪排名”,而是在比较稳定地反映真实能力差异。
表2:不同评委对 14 个模型的评分一致性
表2:不同评委对 14 个模型的评分一致性。Gemini 3.1 Pro 和 Claude Opus 4.8 给出的排序几乎一致,说明这套二级评分标准确实降低了评委偏差;更弱的 Qwen3-VL 235B 评委虽然更宽松,但大体排序仍然保持。
从实验设计上看,这组结果是可信的:同一套题、同一套 rubric、换不同评委重跑,排序基本不乱。这种一致性对一个用 LLM 当裁判的基准来说非常重要。

纯文本对比:视觉识别是“常数税”,核心差距仍在知识

因为 GAMUT 的元评估框架本身不依赖图像,所以论文还做了一个纯文本版本:把题目改写成文本可自洽的形式,其他 rubric、评委和评分流程都不变。这个设计能把“看图带来的难度”单独拎出来,看看模型到底是卡在识别,还是卡在知识覆盖。
表3:多模态与纯文本版本的 Gamut 分数对比
表3:多模态与纯文本版本的 Gamut 分数对比。所有模型在去掉图像后分数都上升,但提升幅度大致像一笔稳定的“视觉识别税”。这说明图像确实增加了难度,不过它更像统一增加了一层感知成本,而不是改写了模型之间的根本差距。
这个结果很值得琢磨。很多人会下意识以为,多模态题难是因为“看不清图”;但 GAMUT 的对照说明,视觉识别固然重要,却不是决定性变量。真正拉开分数的,还是模型能不能把知识找全、组织全、讲完整。图像只是把门槛抬高了一点,真正决定上限的还是知识与结构能力。
对产品侧来说,这意味着一个很现实的问题:如果系统只会“看懂一点点”,那长答案就很容易变成“看起来有内容,实际上缺很多”。而 GAMUT 这类基准的价值,就是把这种漏项从模糊体验变成可量化指标。
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球