← 返回 PaperDaily
大模型与智能体
LLM一致就一定对吗?265000次审计打脸
这篇论文最狠的地方,是把“模型自己都这么说了,应该八九不离十吧”这套直觉狠狠干翻了。265000次采样审计显示,自洽性确实有用,但远没有想象中可靠,尤其在最会“装稳”的前沿模型上。
龙哥读论文
发布于 2026-08-14 09:11:08
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: 这篇论文最狠的地方,是把“模型自己都这么说了,应该八九不离十吧”这套直觉狠狠干翻了。265000次采样审计显示,自洽性确实有用,但远没有想象中可靠,尤其在最会“装稳”的前沿模型上。
原论文信息如下:
当LLM一致同意时,它们是对的吗?
这篇论文最扎心的地方在于:模型自己都很一致 ,并不等于它真的答对了。很多系统一看到“多数票”“高一致性”,就像看见一群人同时点头,默认这事八九不离十。但这项审计直接把这套直觉拎出来晒太阳:一致性确实有用,但它只是一个条件成立时才勉强能用的代理信号 ,不是那种拿来就能当置信度分数的万能钥匙。
论文研究的对象也很现实:现在很多企业评测流程里,LLM-as-judge 已经默认上岗,甚至还会搞成多模型评审团。问题是,这些流程都隐含一个朴素假设——“大家都同意,那大概率就是对的” 。作者偏偏就盯着这件事开刀:如果模型之间、或者模型自己的多次采样之间高度一致,到底是在“接近真相”,还是只是在“共享偏见”呢?
大规模审计揭示:自我一致性并非正确的可靠代理
先把术语说人话。这里的自洽性 (self-consistency)指的是:同一个模型在多次随机采样后,给出同一个答案的程度。论文里用 C = nmaj/K 表示,其中 K 是采样次数,nmaj 是出现次数最多的那个答案被选中的次数。直白点说,C 越高,模型越“嘴硬”,越坚定自己那套答案。
作者没有只做几组小实验糊弄过去,而是做了一个很重的跨运行审计:53 位运行者、394 个独立题目、总计 265000 次采样,覆盖 GPQA Diamond 和 AIME 两个困难推理基准。这里还有一个很重要的设计点:他们不是只看单次结果,而是把“多数答案是否正确”记为主要标签 M ,再看自洽性 C 能不能预测 M。这个选择很关键,因为真正部署时,系统返回的就是多数票答案,而不是某个采样的平均分。
实验结果先给结论:自洽性和正确性确实正相关,但相关性并不强,而且非常依赖场景 。在表1里,十二个分组的 Spearman 相关系数都为正,说明“更一致通常更可能对”这件事不是假的;但这些相关系数大多不高,没有一个冲到 0.6 以上。换句话说,高一致性能提供一点帮助,但远远不够支撑“高 C 直接放行”这种粗暴策略。
更有意思的是,作者还做了一个统计上很讲究的处理:不是只看一组相关系数,而是用分层 bootstrap 去估计置信区间,并且还做了按题目聚类的稳健性检查。这个动作很像在说:别拿“某次跑出来挺好看”来糊弄,得先看看是不是换个抽样方式就塌了。结果挺扎实——即便换成按题目聚类重采样,十二个分组的相关性依然都为正,说明这个结论不是统计手法“刷”出来的。
前沿模型过度自信:高一致性却伴随高错误率
论文里最“反直觉”的点,出现在前沿模型上。按常识,模型越强,应该越懂得什么时候该更一致、什么时候该更谨慎;但这里恰好相反:最一致的模型,反而是这项审计里最不适合拿来当置信度分数的那个 。在 gpt-4.1 这一组里,平均一致性最高,GPQA 上甚至有 77% 的题目达到 C≥0.8,可它的多数票正确率并没有更高,相关性反而更低。
这就很像一个人说话特别稳,语气特别笃定,结果经常一本正经地胡说八道。论文把这种现象称为过度自信 :不是概率意义上的“校准偏差”那么抽象,而是部署层面的危险信号——当系统看到高 C 就直接信任时,错误率会被直接带进线上决策。作者给出的数字很直接:在 GPQA 上,高一致性回答里,gpt-4.1 的多数票仍然有接近一半是错的。
作者还专门看了校准指标,比如 ECE(Expected Calibration Error,期望校准误差)和 Brier score(布里尔分数)。这两个指标的意思不复杂:前者看“说自己多有把握”和“实际对不对”是否对得上,后者看这种概率式判断整体偏差大不大。结果很不客气:gpt-4.1 在这些指标上都很差,说明它不是“稳”,而是“稳得离谱”。这类模型如果拿去做路由器,后果就是:把本该谨慎处理的题目,交给一个自信满满但并不更准的回答。
这里顺手补一个关键词:论文里的“frontier model ”可以理解为当前最前沿、最强的一档模型。按直觉,越前沿越应该更会“分寸感”,但这篇论文偏偏说明:在某些困难推理任务上,前沿模型的高一致性可能只是“更会重复自己”,不等于“更接近真相”。
链式思维:提升准确率,但信号改善有限
链式思维,也就是 CoT(Chain-of-Thought,思维链)并不是什么玄学,它本质上是让模型把中间推理步骤“说出来”,给自己多一点思考空间。论文里比较了 gpt-4.1-mini 的零样本和 CoT 两种提示方式,结果很清楚:CoT 确实能提升准确率 ,在 GPQA 和 AIME 上都能带来稳定增益。
但问题也跟着来了:准确率涨了,不代表“自洽性作为信号”的质量就同步暴涨。论文的结论比较克制,甚至有点冷静得过头:CoT 对 C 和 M 的相关性改善是有的,但很有限 。在 GPQA 上,CoT 对多数票正确性的相关性提升更明显一些,但放到 AIME 上就没那么漂亮了。也就是说,CoT 更像是一个“把答案做对”的工具,而不是一个“把置信度校准好”的工具。
这部分最有价值的不是“CoT 又赢了”,而是它把一个常见误区打穿了:提高推理能力,不等于提高信号质量 。很多系统设计默认“模型更强,置信度就更可信”,但论文显示这两者并不同步。换句话说,CoT 可以让模型更会做题,却不一定更会告诉别人“我到底有多靠谱”。
自信错误共享:模型间存在偏差而非独立验证
这篇论文还有一个很“工程味”的发现:不同模型之间的错误,并不总是独立的 。作者做了跨模型检查,发现某些题目上,不同模型会一起选错同一个答案,而且这些错答往往还都很自信。这个现象很关键,因为很多人以为“多模型投票”天然能抵消错误,但如果大家共享的是同一套偏见、同一个题目歧义,或者同样的选项位置偏好,那投票只是在集体重复错误。
为了验证这点,作者还做了一个很有意思的控制实验:把 GPQA 的选项顺序随机打乱,再看模型是否还会稳定偏向某个字母。结果发现,模型对某些选项位置有明显偏好,尤其是不太爱选 D。这个细节看起来很小,但意义很大:它说明所谓“自洽”,有一部分可能只是位置先验 在作怪,而不是模型真的在认真比较内容。
这也解释了为什么“跨模型一致”并不自动代表“更可信”。如果不同模型共享训练数据、共享题型分布,甚至共享某些常见错误模式,那么它们一致时,可能只是一起掉进了同一个坑。论文的跨家族检查也支持这一点:在 Claude 的探索性实验里,前沿档同样更自洽、更过度自信,但并没有更准确。也就是说,这不是某一家模型的偶发现象,而是一个更广泛的系统性风险。
实务启示:不要将自我一致性作为独立置信度分数
如果把这篇论文压缩成一句工程建议,那就是:不要把自洽性当成独立的置信度分数 。它可以辅助分流、辅助节省计算、辅助做粗筛,但不能单独拿来做“自动通过”或“自动拒绝”的硬阈值。尤其是在前沿模型上,高自洽性更像“话说得很满”,不是“答案真的很稳”。
论文还顺手证明了一件很实用的事:自洽性虽然不够当“真值探测器”,但拿来做算力分配 还是有价值的。比如在自适应采样场景里,可以提前在高一致性的题目上停止继续采样,从而节省大量调用成本。作者模拟后发现,这样能平均少用约 60% 的采样,精度损失不大。这个结论很务实:一致性不一定能帮你更聪明,但可能帮你更省钱。
这其实很符合工程现实:很多系统不是要追求“每题都最强”,而是要在成本、速度、准确率 之间找平衡。论文告诉业界一个挺冷静的事实:如果把“高一致性”误当成“高可信”,那路由系统很容易把难题送进自信陷阱;但如果把它当成“何时该停、何时该加算力”的辅助特征,它仍然能发挥作用。
龙迷三问
这篇论文到底解决了什么问题? 它研究的是“模型反复说同一个答案”这件事,能不能当成正确性的可靠信号。结论是:能用,但只能在特定场景下当辅助信号,不能直接当置信度分数。
C、M、A 这些符号分别是什么意思? C 是自洽性,表示多数答案出现的比例;M 是多数票是否正确,也就是最终部署时最关心的“这个答案对不对”;A 是样本准确率,表示所有采样里有多少比例采对了。论文重点看 C 能不能预测 M。
为什么高一致性还会错得很离谱? 因为一致性可能来自共享偏见、选项位置偏好、记忆化启发式,或者模型在同一个坑里反复打转,而不是真正理解了题目。模型越“坚定”,不代表越“正确”,有时只是越会重复自己的错误。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
把“自洽性能不能当置信度”这个看似老生常谈的问题,做成了大规模、跨运行、带聚类稳健性的审计,思路扎实,但不是全新范式。
实验合理度: ★★★★☆
样本量大、对照清楚、稳健性检查做得比较完整;不足是部分跨家族实验带有探索性,严格因果结论不能说太满。
学术研究价值: ★★★★☆
对 LLM 置信度估计、路由、弃权和评测体系都有直接启发,尤其提醒研究者别把“多数一致”误当“真实可靠”。
稳定性: ★★★☆☆
作为分析和审计工具很稳,但作为产品侧独立置信度信号不稳,尤其在前沿模型上容易误导路由决策。
适应性以及泛化能力: ★★★☆☆
在困难推理、多项选择和整数题上有说服力,但是否适用于开放问答、长文本生成,还需要更多验证。
硬件需求及成本: ★★☆☆☆
审计本身采样量很大,研究成本不低;但方法用于线上时可作为低成本辅助信号,前提是别单独依赖它。
复现难度: ★★★☆☆
数据与分析框架已释放,但完整复现需要较多采样、相同题目集和比较严格的统计处理,不算轻松。
产品化成熟度: ★★★☆☆
适合做辅助路由、节省算力、触发人工复核;不适合直接作为独立置信度分数上线。
可能的问题: 结论主要来自困难推理与多选场景,外推到开放生成任务仍需验证;另外部分跨家族实验是探索性的,不能过度解读。
主要参考文献
Kaihua Ding. When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals. arXiv:2607.08065v1, 2026.
项目代码:https://github.com/dingkaihua/self_consistency_as_predictor_of_accuracy
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
本期聊的是大模型“自信”这件事,群里也欢迎继续拆解:到底是更会答,还是更会装镇定🤨