← 返回 PaperDaily
大模型与智能体
Apple Research最新论文!9位AI法官投票,有效票数竟然只有2张?
“三个臭皮匠,顶个诸葛亮”在AI评审领域失灵了。Apple Research这篇论文泼了盆冷水:你花重金请来9个顶级大模型打分,以为获得群体智慧,实际上它们只用同一种声音对你说话。这是直面当前AI测评滥用的“清醒剂”。
龙哥读论文
发布于 2026-08-19 00:20:07
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更新AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: “三个臭皮匠,顶个诸葛亮”在AI评审领域失灵了。Apple Research这篇论文泼了盆冷水:你花重金请来9个顶级大模型打分,以为获得群体智慧,实际上它们只用同一种声音对你说话。这是直面当前AI测评滥用的“清醒剂”。
原论文信息如下:
9位专家评审,为何相当于只有2票有效?
想象一下,你为了绝对公正的评测,请来9位顶尖专家独立打分,满心以为“群体智慧”会远超个人。但Apple Research最新论文《Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels》无情拆穿了这场“皇帝的新衣”。研究团队组建了包含GPT-4o、Claude Sonnet 4.5、Gemini 2.5 Pro、DeepSeek-V3等7个模型家族的9个顶级大模型评审团,让它们完成自然语言推理(NLI)任务。结果:你花的9份钱,买到的“独立见解”,实际上只相当于2个独立评审的意见。
这些模型来自不同公司、不同数据、不同训练方式,按理说犯错模式应完全不同。但论文揭示的核心问题正是:高度相关的错误。
在1000个样本的测试中,51个题目9个模型集体“翻车”。若意见独立,这种“全军覆没”概率极低。这强烈暗示模型在面对某些“坑”时,不仅一起掉进去,连摔下去的姿势都一样——这是结构性的“群体错觉”。
论文进一步揭示,集体误判的头号原因是:过度预测“矛盾”类。 全部答错的51个题目中,超过一半是因为模型倾向于将“蕴涵”或“中立”错误归类为“矛盾”。这打开了理解模型“共享偏见”的大门。
定量工具:Kish有效样本量(neff)和Condorcet差距
光说“不独立”不够,需要量化尺子。论文用到两个核心工具。
第一个是 Kish 有效样本量(neff) 。它来自统计调查学:9个评委意见高度相关时,他们的打分不能算9个独立证据。Neff告诉你这9人的“群体智慧”相当于多少个真正独立的评委。论文测算,这个豪华9人评审团的neff只有2.18——你请了9位“专家”,只获得2.18位“独立”专家的信息量。
第二个工具是 Condorcet 差距(Condorcet gap) 。Condorcet陪审团定理说,只要每个评委比随机乱猜强且彼此独立,评委数量增加时,多数投票得出正确结论的概率会趋近100%。Condorcet差距就是衡量“理想与现实”的差值:论文模拟9个独立评委的理论准确率,对比9个“不独立”评委的真实准确率,差距越大,说明意见相关性破坏力越强。
评审团表现不仅没超越“最强大脑”,反而被最牛的单挑选手比下去。MNLI上评审团准确率72.0%,最佳单模型Qwen3-32B为71.8%,几乎持平。SNLI上评审团(77.7%)被Claude Sonnet 4.5(84.2%)远远甩开。
“留一法”分析发现:移除6个评委竟能提升准确率,只有移除3个最强模型(如Qwen3-32B)才会让结果变差。能力稍弱的评委不仅帮不上忙,反而把最强选手的正确判断“带跑偏”。这颠覆了“多即是好”的认知。
实验剖析:在NLI与偏好任务上重现独立性问题
论文实验设计扎实,从多个维度进行验证。使用三个NLI数据集:ChaosNLI-MNLI、ChaosNLI-SNLI和ChaosNLI-AlphaNLI(2分类反事实推理),每个题目附带100个人类标注作为“金标准”。三个任务上neff值几乎一致(2.18、2.35、2.48)。
消融实验中,改变提问方式、答案选项顺序、使用Chain-of-Thought思维链,neff值都稳定在2.0-2.5,Condorcet差距同样稳定。就像全面体检,无论用什么仪器,结果都指向同一诊断:独立性严重缺失。
论文还将实验迁移到RewardBench的“偏好评分”任务——让模型判断A输出比B好还是不好。结果neff仍只有1.99。这说明问题不是NLI独有,而是主流大模型的普遍顽疾。
有人可能想:独立投票不行,换更高级的聚合算法(如给准确率高的评委更大权重)呢?论文“残酷”地告诉你:别白费力气。研究团队尝试了Dawid-Skene EM、基于准确率的加权投票等多种方法,即便给算法提供“参考答案”(Oracle访问权限),最多只能缩小Condorcet差距的11%,绝大多数情况下杯水车薪。
下面这张核心图表展示了增加评审人数的边际效益递减。
成对相关性分析显示,同属一个家族的模型(如GPT-4o与GPT-4o-mini)相关性较高,但最令人震惊的是,相关性最高的几对评委竟是跨家族的:Claude × Gemini(0.603)、GPT-4o × Claude(0.588)。不同公司的大模型,底层的“思考逻辑”和“容易犯的错误”已惊人一致。
论文附录对51个“全军覆没”的题目进行了深入剖析。
例如,原文本和假设存在微妙逻辑关系,人类判断为“中立”,但9个模型异口同声说“矛盾”。它们共享了一个具体、非理性的“偏见”,这是整个大模型生态体系中结构性的“认知偏差”,比想象的更深,仅靠加人、改算法根本解决不了。
结论启示:依赖群体智慧,但群体可能并不“智慧”
这项研究生动展示了,当我们以为借助“群体智慧”时,可能只是在倾听“趋同思维”小圈子的喃喃自语。Apple Research的成果敲响了警钟,也指明了方向。
论文提出,未来方向不在于寻找更多“同款”评审,而在于创造在推理层面上真正差异化的模型。量化“修复指南”显示:只需将评委间平均相关性系数Φ从0.39降到0.20,neff就能从2.2提升至3.5,关闭一半Condorcet差距。这需要设计更多样化的模型架构、探索专门化微调策略,甚至构建“人机混合”新型评审团。
从此以后,当你再看到“GPT-4、Claude、Gemini、DeepSeek等9大模型达成一致”的测评报告时,要记住:那可能只是一个由2.18票组成的小型“人云亦云”俱乐部。这并不意味着LLM-as-a-judge这条路走到死胡同,但至少不能再带着“三个臭皮匠”的想当然了。
龙迷三问
Kish有效样本量(neff)怎么计算? Kish有效样本量公式:neff = k / (1 + (k - 1) * Φ),其中k是评委数,Φ是两两之间的平均相关性系数。若完全独立,Φ=0,neff=9;若Φ=0.5,neff=9/(1+8*0.5)=1.8。论文中9个评委的Φ约为0.39,neff≈2.18。
Condorcet陪审团定理为何失灵? 该定理说,若每个决策者正确概率略超50%且彼此独立,群体多数投票的正确概率会趋近100%。前提是“独立”。Apple论文证明LLM评委团中“独立”前提荡然无存,评委集体犯同样的错,定理自然失效。
未来方向是什么? 论文指出,不是找更多更强的同类型评审,而是创造“推理方式根本不同”的评审模型,如不同算法架构、不同领域微调的模型,或引入人类专家。量化目标:将平均相关性从0.39降到0.20,有效样本量就能翻倍。
龙哥点评
这篇论文像一把手术刀,精准剖开大模型评测领域被忽视却致命的“病灶”。诊断方法(neff和Condorcet差距)和稳健实验设计很有价值。龙哥客观评价如下:
论文创新性分数: ★★★★✰
将Kish有效样本量引入LLM评审团评估,系统量化普遍现象。
实验合理度: ★★★★✰
跨数据集、任务、提示变体、算法全面验证稳健性,排除位置偏差等解释。
学术研究价值: ★★★★★
为批判性看待大模型评测方法奠定基础,提出测量“同质化”的量化工具。
稳定性: ★★★★✰
Neff值在不同场景下稳定在2.0-2.5,表明是系统性问题。
适应性及泛化能力: ★★★★✰
从NLI扩展到偏好判断任务,泛化能力强,但对更复杂生成式任务的适用性待验证。
硬件需求及成本: ★★★★★
论文不涉及训练,但调用9个大型模型1万次推理成本高,这本身正是被批判的对象。
复现难度: ★★★★★
实验细节、数据集和统计方法描述清晰,按图索骥即可复现。
产品化成熟度: ★★★★✰
“有效性计算框架”可直接产品化,未来AI评测工具应集成“同质化检测器”。
可能的问题: 论文未给出具体、低成本、可立即落地的解决方案。此外,“金标准”基于100个众包标注者,本身并非绝对真理,未来可探索模型与人类评审的交互影响。
主要参考文献
[1] Kohli, G. Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels. arXiv preprint arXiv:2605.29800, 2026.
[2] Kish, L. Survey Sampling. 1965.
[3] de Condorcet, M. Essai sur l'application de l'analyse à la probabilité des décisions rendues à la pluralité des voix. 1785.
[4] Dawid, A.P., and Skene, A.M. Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society, 1979.
[5] Verga, P., et al. Panel of LLM Evaluators: A Scalable Approach to Evaluation. 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或项目落地推荐意见。欢迎交流探讨。想了解更多原文细节,可点击 "阅读原文" 。
花9份钱雇9个评审,有效票只有2张。想不被论文忽悠?加入龙哥读论文粉丝群,
扫描下方二维码或添加龙哥助手微信号加群 :kangjinlonghelper。
备注:研究方向+地点+学校/公司+昵称 ,可更快被通过。