苹果最近又在搞事情了。这次不是发新手机,而是发了一篇关于大语言模型的论文,标题相当直白:《LLMs are not (consistently) Bayesian: Quantifying internal (in)consistencies of LLMs' probabilistic beliefs》。翻译过来就是:大模型并不是(始终)贝叶斯式的。贝叶斯,概率论里那个如雷贯耳的名字。在医疗诊断、法律论证、科学推理这些高风险场景里,一个AI系统面对新证据时,应该理性地更新自己对某个结论的相信程度——这正是贝叶斯定理干的事。所以一个自然而然的问题就来了:LLM真的是这么做的吗? 这篇来自Apple Research的论文,用一套漂亮的信息论框架,把这个问题的答案量化地摆在了桌面上。 LLM是贝叶斯推理器吗?一个信息论视角的量化研究
先给不太熟悉背景的读者补个课。贝叶斯定理描述的是:当我们获得新证据时,应该怎样从先前的信念(先验概率)出发,结合证据的似然,计算出更新后的信念(后验概率)。长期以来,贝叶斯更新被认为是基于证据更新信念的决策理论最优方式。 之前学术界已经在追问LLM"是不是贝叶斯"了,也有人在尝试用各种提示词技巧"教"模型变得更贝叶斯。但市面上大多数工作都有一个隐含前提:得先给定一个明确描述的统计模型,才能在模型框架内讨论贝叶斯更新。 但真实场景哪有这么舒服?一个大模型面对一堆症状描述做诊断时,它脑子里并没有一个显式写好的统计模型。它就是在"凭直觉"做推断。那么问题来了:在没有显式模型的情况下,LLM到底是如何把证据变成信念的? 这篇论文的切入点非常巧妙:把LLM当作一个信息处理规则——输入是先验信念和似然,输出是更新后的信念——然后用信息论去度量这个处理过程的效率。论文提出了一个核心指标:信息处理间隙(information processing gap),记作Δ(q)。这个指标的能量在于:它不需要依赖某个"贝叶斯oracle"来当参照物,也不依赖训练数据,就能告诉你模型的信念更新离贝叶斯最优有多远。 信息处理间隙:衡量LLM信念更新与贝叶斯最优的偏差
先定义几个关键概念,理解这些是读懂整篇论文的地基。 假设存在一个假设空间Θ,θ表示其中某个具体假设——比如"患者得的是肺炎"。X表示可观察的证据,比如"患者发烧了"。论文考虑一个证据序列X1:n,也就是说证据是一个一个到来的。 论文区分了几个层次分明的量:π(θ|X1:n)是看到已有证据后的先验分布;ℓ(Xn+1|θ,X1:n)是似然函数,刻画在某个假设下出现新证据的可能性;q(θ|X1:n+1)是LLM实际输出的后验数据分布——注意论文故意用"post-data"而不是"posterior",就是为了强调q并不假定由贝叶斯定理产生;而p(θ|X1:n+1)才是用π和ℓ显式套贝叶斯公式算出来的贝叶斯后验。 核心创新在于,论文不假定π、ℓ、q来自某个隐藏的联合分布,而是把它们当成三个相互独立的"自由变量"。这样一来,就可以单独考察LLM输出的q和它自己声称的π、ℓ是否自洽。 接下来就是全文最核心的公式了。定义输入信息I_in、输出信息I_out,然后信息处理间隙Δ(q)就是两者之差: ![]()
这里Zπ,ℓ是边际似然,P是通过贝叶斯定理由π和ℓ算出的后验。这个等式的最后一步揭示了一个重要性质:Δ(q)等于q到贝叶斯后验p的KL散度,永远大于等于零。当且仅当q就是贝叶斯后验时,Δ(q) = 0,信息处理达到最优。 光给一个总差距还不够,论文还进一步做了拆解,把Δ(q)分解成两个具有明确含义的部分: ![]()
其中D_KL(q||π)衡量的是信念更新的总幅度——从先验到后验数据分布移动了多少;而I_LER(expected log likelihood-evidence ratio,期望对数似然-证据比)衡量的是这次更新中有多少是被证据合理支撑的。两者的差就是"没被证据支撑的那部分变化",也就是信息处理间隙。 I_LER本身的定义也很直观: ![]()
从LLM后验数据分布q的视角看,新证据如果能撑起信念的变化,ILER就大;如果模型更新方向跟证据"拧着来",ILER就可能为负。 基于这个分解,论文把偏离贝叶斯的行为划分为三类: 错误方向更新(wrong-direction):新证据在q下的期望对数似然反而比在先验π下更低,也就是说概率质量往证据不支持的方向跑了,这是最离谱的一种偏差。
欠更新(under-updating):方向对了,但步子迈得不够大,q离先验比离贝叶斯后验更近。
过更新(over-updating):方向对了,但步子迈过头了,q离先验比离贝叶斯后验更远,甚至可能冲到贝叶斯后验的另一侧。
有了这套度量工具,下一步就是设计实验来看LLM到底属于哪种选手。 BP模式vs batch模式:LLM如何整合证据的两种路径
论文设计了两套证据整合方式,对应实际应用中的两种典型场景。 第一种叫信念传播模式(belief propagation mode,简称BP模式):模型一步一步地看证据。每看到一条新证据,它先被要求显式给出这条证据的似然,然后基于先前信念做一次显式的信念更新,并输出更新后的分布。更新完一轮之后,下一条证据再来,如此逐步推进。这模拟的是对话式交互场景——AI每听到一句新信息就实时调整判断。 第二种叫批处理模式(batch模式):把所有证据一次性全塞给LLM,让它直接给出最终的信念分布。不要求它输出中间步骤,也不强制它显式考虑似然。这模拟的是"信息一次性给全,直接给结论"的场景。 实验数据用了四个任务,覆盖了不同类型和难度的推理场景: ![]()
Animals任务根据动物的属性猜动物,属于常识推理;Political Ideology则根据问卷回答推断政治立场,涉及社会常识;MediQ是医疗诊断,证据是临床检查结果;Eleusis则是根据出牌序列推断一个隐藏的卡牌游戏规则,这需要纯逻辑推理而不是依赖训练语料中的领域知识。 评估的模型覆盖面也相当广:开源的有Qwen3-8B/14B、Ministral系列、DeepSeek-R1蒸馏版,闭源的有GPT-4o mini、GPT-5.1(含中等推理和无推理两个版本)。所有模型的信念、似然都是通过让模型在token空间中直接"说出"概率值来获取的,这种方法是Tian等人2023年提出的。 第一个核心发现就来了:任务性能上,batch模式普遍胜出。下图比较了两种模式下各模型的AUROC(Area Under the Receiver Operating Characteristic curve,受试者工作特征曲线下面积,衡量模型区分正负类的能力,越接近1越好): ![]()
在Animals、Political Ideology和MediQ上,较弱模型的batch模式明显优于BP模式;强模型两种模式表现接近。唯一例外是Eleusis——这个不需要领域知识、纯靠推理的任务上,两种模式没什么差距。 校准性方面也是同样规律:batch模式的ECE(Expected Calibration Error,期望校准误差,衡量预测置信度与真实准确率之间的匹配程度,越低越好)通常低于BP模式。也就是说,一次性给全证据不仅让模型判断更准,而且让它"知道自己知道多少"的能力也更强了。 ![]()
但接下来的发现就有点"反直觉"了:用信息处理间隙来衡量,结果正好反过来。在BP模式下,LLM居然相当接近贝叶斯最优。 ![]()
上图中每个点代表一个样本,横轴是KL散度,纵轴是ILER,虚线是两者相等的最优线。可以清楚看到,GPT-5.1和Qwen3-14B的样本点大量落在虚线上或附近。GPT-5.1的表现几乎完美贴合贝叶斯更新;DeepSeek-R1-0528-Qwen3-8B也类似。弱一些的模型开始偏离,往往表现为欠更新或过更新;而最弱的非推理模型,比如Ministral的非推理版本,则出现大量红色点——错误方向更新。 注意,模型在BP模式下的prompt里只提供了先验和似然的文本,论文并没有在提示词里要求它"用贝叶斯定理计算"。模型是自发地接近了贝叶斯更新行为。这说明:只要把似然显式地给给模型,并让它一步一步来,强LLM是能从"直觉"上做出接近最优信息处理的。 而batch模式完全是另一番景象: ![]()
即使强如GPT-5.1,在batch模式下也频繁偏离最优信息处理线,出现大量错误方向更新和大幅度过更新。信息间隙的中位数对比一目了然: ![]()
大多数模型在BP模式下Δ(q)更低,也就是更接近贝叶斯。只有Ministral两个非推理模型是例外——它们的数学能力太弱,即使BP模式的脚手架结构也没法稳定执行贝叶斯更新。 于是论文捕获了一个看似矛盾的现象:batch模式任务性能更好,但HLM在batch模式下的行为离贝叶斯更远;BP模式强迫模型逐步处理证据,模型行为离贝叶斯更近,性能反而更差。这暗示着一个更深层的结论:batch模式下的LLM并没有在用"先验×似然"的路子做推断,而是直接学了一个从证据到信念的隐式映射。 贝叶斯更新并不总是最优:任务性能与信息处理效率的复杂关系
既然batch模式用得是隐式映射,那一个自然的追问是:如果把LLM在batch模式下"硬掰"回贝叶斯,任务表现会不会更好?论文做了一个非常聪明的反事实分析。 因为论文已经获取了模型自己声明的先验π和似然ℓ,所以可以离线用贝叶斯定理,把q替换成p,算出p的AUROC,再和q的AUROC做对比。如果强行贝叶斯化能提升性能,那AUC_Bayes - AUC_LLM应该为正。 ![]()
先看下图5的上半部分:AUROC和Δ(q)大致是负相关的,看起来好像模型越贝叶斯就越准。但这可能是混杂因素导致的——GPT-5.1又强又贝叶斯,可不代表"贝叶斯导致强"。图5下半部分给出了反事实的结果:强制Δ(q) = 0并不会稳定提升任务性能。在MediQ上,所有模型的贝叶斯化后验都更差;在Eleusis上,多数推理模型也宁愿保留自己的隐式映射。 论文给出的解释也很合理:LLM的训练语料里,更多见的是"一堆证据直接得出结论"的样例子,而不是"先明确写出先验和似然再做贝叶斯计算"的样例。因此LLM更容易学到的是从证据到结论的隐式映射,而不是显式的统计模型。 以MediQ为例,要描述"什么病导致什么症状"的显式概率模型极其困难,但LLM在训练中肯定见过海量的"症状集合→疾病"的对话样例,所以它的隐式逆向映射非常强。反过来,Eleusis这个冷门卡牌游戏几乎不存在于训练语料中,LLM没有隐式映射可用,只能靠上下文给的信息搭一个似然模型——这种情况下,显式贝叶斯计算当然就更有优势了。 顺带提一个有意思的细节:在Eleusis上,三个强推理模型(GPT-5.1、DeepSeek-R1、Ministral 14B-R)能用隐式映射打赢自己的显式贝叶斯更新。这几个模型在batch模式下不仅用了证据,还额外做了推理——比如推测"为什么对手会打出这张牌"。这种"超出统计模型本身的推理能力",恰恰是纯贝叶斯更新做不到的。 ![]()
上图的附录数据也印证了总体趋势:随着证据增多,模型性能整体向上——但batch模式和BP模式的增速并不相同。 隐式映射与oracle似然:LLM信念更新中的非显然一致性
接下来论文处理了一个非常微妙的问题:当模型的更新方向和它自己显式给出的似然"打架"时,到底是模型傻了,还是模型的似然本身就有问题? 论文的做法很巧妙:用GPT-5.1的似然来充当"oracle似然"——即对真实数据生成过程更好的近似,用ℓ^or表示。然后分析那些"错误方向更新"的点:如果LLM的q虽然和它自己的似然矛盾,却和oracle似然一致,那就说明模型的显式似然是错的,而它的隐式更新反而更接近真相。 ![]()
结果非常有意思:在除Eleusis外的所有数据集上,batch模式中约一半的"错误方向更新",实际是在朝oracle似然暗示的方向移动;还有约15%虽然跟两个似然都不一致,但最终的后验分布q距离oracle后验p^or比距离贝叶斯后验p更近。也就是说,这些看起来"非贝叶斯"的更新,反而可能是在纠偏一个有缺陷的似然模型。 这给LLM的信念更新行为一个更丰富的画像:模型内部可能存在两套系统——一套是可以用语言显式表达的似然估计,另一套是从海量训练数据中学到的隐式证据到信念的映射。当两者不一致时,隐式映射常常更接近"真相"。这对理解LLM的推理机制很有启发。 论文最后还给出了一个实用诊断工具:batch模式的信息处理间隙Δ(q)可以预测BP模式的任务表现。如下图7所示,两者呈明显的负相关——batch模式Δ(q)小的模型,在BP模式下AUROC往往更高。 ![]()
这背后的逻辑是:如果模型的似然模型本身质量高、隐式映射也靠谱,那两种模式下的信念估计应该一致,batch模式的Δ(q)自然就小。反之,如果batch模式的Δ(q)大,说明模型的似然和自我推断之间存在裂缝,此时BP模式的判断也不值得太信任。 当然,这个相关性仍可能受到"更强模型什么都好"的混杂因素影响,但作为诊断参考,它已经足够有用了。 对LLM推理系统设计与审计的启示
这篇论文的价值不只是学术上的,它对真正在搭LLM推理系统的人有非常实际的指导意义。 首先,如果你的系统是对话式的、证据会逐步到达,那么BP模式是更自然的选择。论文表明,强模型在BP模式下确实能做出接近贝叶斯的行为——但前提是你得在每一步引导它显式给出似然估计。不然的话,随着证据累积,模型的信念更新可能会逐渐跑偏。 其次,如果你的应用是一次性给全证据、直接出结论,那batch模式的表现通常更好,尤其在医疗诊断这类模型有充分先验知识的领域。此时别纠结于"模型够不够贝叶斯",因为强制它用显式的先验和似然去更新,反而可能拖累效果。 第三,对于那些需要审计和可信赖的AI系统,信息处理间隙Δ(q)是一个值得纳入监控面板的指标。它不需要额外的标注数据,只需要让LLM口头给出先验、似然和后验分布,就能计算。如果连续多个样本的Δ(q)偏大,就说明模型在这个领域的信念更新可能不可靠,需要人工介入检查。 最后,论文的研究方法也暗示了一条评测新思路:与其只看模型的回答对不对,不如去检查"模型的内部状态是否自洽"。这种面向内部一致性的评测,可能会成为LLM评估的一个新方向。 ![]()
上图的附录数据也支持了这一点:当模型自己的似然与oracle似然偏离较大时,误用这个似然构造贝叶斯后验的性能损失会很明显。 龙迷三问
下面是龙哥对于大家可能的一些问题的解答: 这篇论文到底在解决什么问题?苹果联合斯坦福、普林斯顿新研究揭示:LLM更新信念并不始终遵循贝叶斯规则,强行套用贝叶斯反而可能拖累任务表现。批量模式下隐式启发式比显式贝叶斯更新更准,GPT-5.1等强模型仅在逐步更新时接近最优。论文提出信息处理差距作为诊断指标 这篇工作最值得看的点是什么?论文发现:(1) batch模式通常比BP模式获得更好的任务性能;(2) BP模式下LLM更接近贝叶斯更新;(3) 强制贝叶斯更新并不总是提高任务性能;(4) batch模式的Δ(q)与BP模式任务性能存在强相关性 这篇工作的边界或风险在哪里?优点:(1) 提出新颖的信息论框架量化LLM信念更新行为;(2) 实验设计全面,覆盖多种模型和数据集;(3) 发现多个反直觉但重要的现象。缺点:(1) Δ(q)在不同证据步长和数据集间不可直接比较;(2) 结果可能对提示格式敏感;(3) 使用GPT-5.1作为oracle存在循环论证风险 如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~ 龙哥点评
论文创新性分数:★★★★☆
通过信息论框架将LLM视为信息处理规则,定义信息处理间隙Δ(q)量化LLM信念更新与贝叶斯最优更新的偏差,并在多种证据整合模式下进行实证分析。实验合理度:★★★★☆
AUROC, ECE, 信息处理间隙Δ(q), KL散度, 期望似然证据比ILER学术研究价值:★★★★☆
通过信息论框架将LLM视为信息处理规则,定义信息处理间隙Δ(q)量化LLM信念更新与贝叶斯最优更新的偏差,并在多种证据整合模式下进行实证分析;更关键的是问题定义是否可复用到同类任务。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
不适用(本文为实证分析,不涉及新方法的计算复杂度)复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:(1) Δ(q)在不同证据步长和数据集间不可直接比较;(2) 结果可能对提示格式敏感;(3) 使用GPT-5.1作为oracle存在循环论证风险
主要参考文献
Chen C, Jörke M, Goliński A, et al. LLMs are not (consistently) Bayesian: Quantifying internal (in)consistencies of LLMs' probabilistic beliefs. Apple, 2026. arXiv:2605.06915. Zellner A. Optimal information processing and Bayes's theorem. The American Statistician, 1988. Tian K, Mitchell E, Zhou A, et al. Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models. ICML 2023. Blei D M, Kucukelbir A, McAuliffe J D. Variational inference: A review for statisticians. Journal of the American Statistical Association, 2017. Robert C P. The Bayesian Choice. Springer, 1994.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
![]()
概率推理不头秃,贝叶斯也没那么玄~ 想跟上龙哥一起读懂LLM的“小心思”?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。
![]()
![]()
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!