← 返回 PaperDaily 大模型与智能体

黑盒LLM听不懂“我没把握”?分层监督让不确定性估计AUROC从0.57飙到0.80

黑盒大模型在物种分类这类层级推理任务中,经常“嘴硬”但心里没底。这篇来自Vector Institute与Guelph大学的工作,用开源工具LLM提取代理特征,训练轻量监督估计器,把全局阈值下AUROC从0.57拉到0.80,为“该信谁、该拒谁”提供了可落地的判断框架。

黑盒LLM听不懂“我没把握”?分层监督让不确定性估计AUROC从0.57飙到0.80

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Hierarchy-Aware Supervised Uncertainty Estimation for Black-Box LLM Taxonomic Reasoning
发表日期:
2026年8月

发表单位:
Vector Institute for AI, University of Guelph(第39届加拿大人工智能会议)

原文链接:
https://arxiv.org/pdf/2608.22839v1.pdf

开源代码链接:
https://github.com/uoguelph-mlrg/hierarchy-aware-llm-uq

引言:大模型很能说,但它知道自己“没把握”吗?

想象一个场景:生态学家在雨林拍到一只罕见节肢动物,交给AI系统识别。系统经过图像描述、检索增强生成,最后用大语言模型输出一个“纲-目-科-属-种”的完整分类路径。看起来一切都挺好——模型给出了自己的判断。
但真正的问题在下一秒出现:这个判断到底可不可信?模型自己知道它可能错在哪个等级吗?是“目”这个级别就开始不确定了,还是到“属”才没把握?如果系统能在输出答案的同时,诚实地告诉你“我对纲和目很有信心,但属和种不敢保证”,那就完美了。
这就是今天这篇论文要解决的问题:黑盒大语言模型在层级分类推理中的不确定性估计。所谓黑盒,就是只能通过API调用,拿不到模型的logits和隐藏层状态;所谓层级分类,就是输出不是单一的扁平标签,而是像“动物界-节肢动物门-昆虫纲-鳞翅目-尺蛾科-灰尺蛾属-某某种”这样跨多个语义级别的树状路径。
这个场景比普通的图像分类或者单标签文本分类麻烦得多。一来,层级分类天然是长尾分布——常见物种样本多、稀有物种样本少,而稀有物种恰恰最需要被准确监测;二来,模型在层级推理时可能“中途放弃”——在某个等级上主动表示不确定并停止输出,导致不同样本的分类路径深度不一致;三来,一旦模型在粗粒度等级(比如“目”)上就已经出错,那么后续所有的细粒度等级(“科”“属”“种”)也会跟着错,误差会在层级间传播。
本论文的应对思路很有工程感:不用花哨的多采样方法,也不尝试去获取内部状态,而是用另一个开源大模型(工具LLM)从提示-响应对中提取“代理特征”,然后训练一个轻量级的监督估计器来预测每个分类等级上的正确性。整体流程如图1所示。
图1:LLM不确定性估计的端到端流程。目标LLM根据VLM图像描述和RAG检索上下文生成分类学预测。工具LLM从每个提示-响应对中提取代理特征,轻量级不确定性估计器将这些特征映射为置信度分数。蓝色框表示输入和中间输出,红色框表示预测目标。
(图1:LLM不确定性估计的端到端流程示意图)

黑盒LLM的不确定性困境:分类学推理中的挑战

大语言模型正在进入越来越多的决策支持场景——医疗问诊、金融分析、生态保护。在这些领域,模型给出一个答案只是起点,更关键的问题是:这个答案有多可信?如果模型自己都拿不准,系统应该把案例转交给人类专家复核,而不是让一个错误结论直接进入决策流程。
对于白盒模型,我们可以直接读logits、看隐藏层。可现实是,很多最强模型都是黑盒API——你只能向它发请求、收回复,最多拿到每个token的概率。这就让不确定性估计变得棘手:你不能观察模型的内部“心理活动”,只能从外部行为去推断。
现有黑盒不确定性方法主要有两条路线。一条是“让模型自己说”——例如直接问模型“你对这个答案有多大把握”。听起来简单直接,但研究表明模型自我报告的置信度常常不能忠实反映其真实的不确定性,模型可能过度自信。另一条是“多次采样看一致性”——让模型生成多个回答,然后用语义聚类等方法判断它们是否一致。这个方法更可靠,但代价高昂:每次都要调用API多次,在长流程的RAG管道里成本会快速累积。
本文采用的是第三条路:监督式不确定性估计。用另一个开源工具LLM从提示-响应对中提取特征,再训练一个小型分类器预测目标模型输出的正确性。这样做的好处很明显:特征提取一次搞定,推理开销极低,而且不需要反复调用昂贵的API。
但层级分类给这个框架增加了额外的复杂度。我们需要的不是“这个回答整体上对不对”的单个置信度,而是“纲、目、科、属、种每个等级分别有多可信”。而且分类路径还有深度变化——模型可能只输出到“目”就停住了,这时候“科”及以下的等级没有预测结果,不确定性也就无从谈起。
这引出了本文的核心问题设定:在部分路径弃权(partial-path abstention)的条件下,如何做秩级(rank-level)的选择性预测?也就是说,系统要决定在哪个等级上继续输出、在哪个等级上停下来转交人工,而这个决策需要一个统一可比的置信度阈值。

层次感知监督:从代理特征到秩级置信度


数据来源:长尾物种监测管道

本文的实验数据来自Rare Species数据集,经过筛选后共829张节肢动物图像。这个数据集有一个显著特点:所有物种都属于世界自然保护联盟(IUCN)红色名录中从近危到野外灭绝的类别——也就是说,样本本身是极度长尾的,稀有物种占据了主体。
上游推理系统采用simple-RAG架构,以GPT-4o作为目标LLM。系统从VLM生成的图像描述和RAG检索到的上下文出发,按“从粗到细”的方式逐级预测分类学等级,并在第一个不确定的等级上主动弃权。这种设计在实际部署中很有意义——它把人类的注意力引导到最需要的地方。
但弃权机制也带来了数据覆盖不均匀的问题。来看附录表2:模型在“纲”这个等级上几乎100%覆盖,准确率高达96.6%;但在“属”这一级覆盖率骤降到23%,准确率也只有45.3%;到了“种”,覆盖率只剩下6%,准确率约45.5%。这意味着越细的等级,训练信号越稀疏,不确定性估计的难度也越大。
图3:工具LLM提取的特征类型树状结构图。
(图3:工具LLM提取的特征类型示意图)

双重监督信号:二元正确性与层次化F1

每个秩级样本都有两个监督信号。第一个是二元正确性标签 y∈{0,1},表示该等级上的预测分类与实际标注是否一致。这个标签直接支撑AUROC评估和风险-覆盖率评估。
第二个是层次化准确率 h∈[0,1],它不要求预测节点与真实节点完全一致,而是根据分类学分支的重叠程度给予部分分数。具体地,论文采用层次化精确率(hP)、层次化召回率(hR)和层次化F1(hF)这三个指标。令anc(v)表示节点v的祖先集合(包含自身),则hP是预测节点的祖先与真实节点祖先的交集大小除以预测节点祖先大小,hR是交集大小除以真实节点祖先大小。hF是两者的调和平均。本文将h设为hF,并只用它作为辅助训练目标,不参与主评估。这个设计很巧妙:它让估计器在训练时能感知“部分正确”的概念,而不是非对即错。

工具LLM特征提取:外部代理信号

特征从哪里来?论文采用了一个巧妙的方法:用另一个开源LLM作为工具,从目标LLM的提示-响应对中提取代理特征。本文测试了三个工具LLM:Gemma 7B、GPT-OSS 20B和Qwen3 30B A3B Instruct,具体配置见附录表3。
提取的特征分为两个家族。一是表示特征:取工具LLM中间层的平均隐藏状态和最后token的隐藏状态;二是分布特征:包括熵、负对数概率和原始token概率的统计量。这些特征组合在一起,构成了对目标LLM输出置信度的一个“外部镜像”。
这里有个细节值得注意:论文强调这些代理特征是对目标不确定性的实用近似,而不是忠实重建。也就是说,工具LLM提取到的信号可能和GPT-4o真实的内部不确定性并不是一回事,但只要它们有足够的预测相关性,就能支撑下游的分类器训练。

三种估计器设计:H1、H2、H3

为了缓解细粒度等级监督稀疏时的过拟合问题,论文使用了一个紧凑的MLP,包含共享的两层主干(隐藏维度16、ReLU激活、dropout为0.3)和任务专属头。主头是一个sigmoid分类器,用于预测秩级正确性的概率,直接支持AUROC和风险-覆盖率评估。部分变体还增加了一个回归头,用于预测层次化F1分数,从而提供层级感知的辅助监督。
总损失函数是主损失与辅助损失的组合:前者是二元交叉熵(BCE),作用于主分类头的预测概率和二元正确性标签;后者是均方误差(MSE),作用于层次化F1的预测值和真实值之间,λ设为0.1。
基于这个框架,论文设计了三种变体。H1使用共享主干加单一二元分类头,只用BCE损失训练。H2在H1基础上增加一个辅助回归头,用公式(2)的联合损失训练。H3则更进一步:使用共享主干加五个秩级专属二元分类头,外加一个辅助回归头——BCE损失只应用在与样本等级匹配的那个头上,而辅助回归损失全局应用。推理时,H3只需要一次前向传播就能同时输出所有五个等级的正确性概率。

三种设计对比:H1、H2与H3的优劣

从消融设计的角度看,这三个变体清晰地分离了两种设计决策的影响:是否使用层级感知的辅助监督(H1对比H2),以及是否使用秩级专属的输出头(H2对比H3)。这种逐步叠加的设计让读者可以清楚地看到每个组件对最终效果的边际贡献。
表1展示了所有秩级
先把问题掰开揉碎:在一个物种分类管道里,目标LLM输出的不是一个孤立的标签,而是一条从纲到种的层级路径。路径越深,覆盖越少、准确率越低,不确定性越高。下表给出了这个上游系统在过滤前的分布情况。
表2:过滤前上游系统的秩覆盖率和预测准确率
表2:过滤前上游系统的秩覆盖率和预测准确率(Rank coverage and prediction accuracy in the upstream system before filtering)
可以看到,模型在纲(Class)这一级覆盖率100%、准确率96.6%,但到了属(Genus)覆盖率只剩23%,种(Species)只覆盖6%,准确率也掉到45%左右。这种数据形态给不确定性估计带来的麻烦是双重的:一方面,越细的等级样本越少,能用来训练置信度模型的监督信号也越来越稀疏;另一方面,细等级一旦出错,往往是前面粗等级错误传导下来的,单看一个token的“自信程度”根本发现不了这种结构性错误。
再看黑盒设定下最容易拿到的基线信号——负对数似然(NLL)。目标LLM在生成答案时,每个token会返回一个概率,取所有token概率对数的负均值,就能得到一条逐token的置信度曲线。这个基线唯一的优势是便宜,一次API调用就能算出来。但问题也很明显:它打分的是“话”而不是“事”,是生成文本的流畅程度,而不是分类路径在生物学意义上的可靠程度。一个说得很流利的错误答案,NLL照样会给高分。
公式:负对数似然基线置信度定义
(公式:NLL基线置信度定义,取输出序列token对数概率的负均值,其中T为输出token数,pθ为目标LLM在上下文c下对token yt的条件概率)

层次感知监督:从代理特征到秩级置信度

既然不能直接读取目标LLM的内部状态,那就找“外援”来替它把脉。本论文的做法是:拿另一个开源大模型当工具,让它读完目标LLM的提示和输出,提取出一组能反映输出置信度的代理特征,再用这些特征训练一个极轻量的多层感知机(MLP)来预测每个等级上的对错概率。
工具LLM的选择不是随便指定的。本论文实验了三个模型:Gemma 7B、GPT-OSS 20B和Qwen3 30B A3B Instruct。它们的层数、中间层位置和隐藏维度都不一样,特征空间也因此有差异,正好可以检验方法对工具模型选择的稳健性。下表给出了三个工具LLM的具体配置。
表3:工具LLM配置详情
表3:工具LLM配置详情(Details of tool LLMs),第一列为模型名及对应的Hugging Face检查点标识,第二列为提取表示特征所用的中间层,第三列为总层数,第四列为隐藏维度。特征则分为两大类:一类是表示特征,包括中间层平均隐藏状态和最后token隐藏状态;另一类是分布特征,包括熵、负对数概率和原始token概率的统计量。
特征拿到手之后,还有一个容易被忽略但极其重要的细节:特征选择。本论文只对高维的隐藏状态特征做筛选,把Lasso回归、互信息、Pearson相关系数三种方法各自选出的top-100特征合并起来,送到下游分类器。这样既控制输入维度、减少过拟合,又保留了多视角的信息。为了避免同一样本的多个等级记录被同时分进训练集和测试集造成“数据泄漏”,本论文使用5折交叉验证,并保证同一个标本的所有记录进同一个折。
监督信号的设计也体现了“层级感知”四个字。每个等级样本除了一个非对即错的二元标签y之外,还有一个连续的层次化F1分数h作为辅助监督。层次化F1的计算不要求预测节点与真实节点完全重合,而是看两个节点在分类树上的祖先集合重叠了多少——重叠越多,即使不完全对,这个样本对训练的贡献也越平滑、越有信息量。公式理解起来也不难:让anc(v)表示节点v的祖先集合(含自身),hP是预测节点祖先集合与真实节点祖先集合的交集占预测节点祖先的比例,hR是交集占真实节点祖先的比例,hF则是两者的调和平均。
公式:层次化精确率、召回率与F1的计算方式
(公式:层次化精确率hP、层次化召回率hR与层次化F1 hF的计算方式。当预测节点为真实节点或真实节点的祖先时,hF取较大值;只有当预测节点落在完全无关的分支上时,hF才为0。本论文将h=hF作为辅助回归目标)
这里特别值得肯定的一点是:论文把“部分正确”纳入了训练目标。在传统的不确定性估计器里,要么对要么错,没有中间态。但分类学预测里,预测成同纲不同目和预测成完全无关的物种,错误的严重程度完全不同。用hF做辅助监督,让模型学会“这个预测虽然不完全对,但大方向没跑偏”的细微差别,这是一个很务实的设计。

三种设计对比:H1、H2与H3的优劣

网络结构上,本论文所有估计器共享一个两层的紧凑MLP主干:隐藏维度16、ReLU激活、dropout 0.3。区别主要在输出头的设计上。H1是共享主干加一个二元分类头,只用二元交叉熵(BCE)训练;H2在H1基础上增加了一个回归头去拟合层次化F1,用BCE加MSE的联合损失训练;H3则更激进,在共享主干之上挂五个秩级专属的二元分类头,再加一个回归头。BCE只作用在样本对应等级的那个头上,回归损失仍然全局生效。
在三个工具LLM上跑完,结果非常直观:所有监督估计器都大幅跑赢NLL基线。以micro AUROC(所有等级样本合并计算的AUC)为核心指标,NLL基线在0.573左右,而三种监督方法普遍达到0.69到0.80之间。其中H3的表现最稳定也最好,在Gemma 7B上达到0.796±0.023,在GPT-OSS 20B上达到0.790±0.028,在Qwen3 30B上达到0.749±0.017。
表1:所有秩级micro AUROC对比(5个随机种子的均值±标准差)
表1:所有秩级micro AUROC对比(All-rank micro AUROC,5个随机种子上的均值±标准差,加粗为最高均值)。横向看三个工具LLM的结果,可以得出两个结论:第一,监督式估计器的优势在三个工具模型上高度复现,说明方法不依赖某个特定工具LLM的特征;第二,H2对标H1的增益并不稳定——在Gemma 7B上反而略低,但H3相比H1和H2的提升在多数设置下都更明显。
这个消融设计的意义在于:它把“辅助监督目标”和“输出参数化方式”两个因素拆开了。H1对比H2,检验的是“加一个层次化F1回归头”有没有用;H2对比H3,检验的是“把单一二元头换成五个秩级专属头”有没有用。论文的结论很明确:秩级专属的输出头,比辅助回归目标本身更能提升统一阈值下的决策效果。这在直觉上也讲得通——不同等级的正确率差异巨大,一个全局共享的置信度头很难同时适配纲级的高置信度和种级的低置信度,分头预测才能让每个等级有自己的置信度刻度。

全局阈值下的选择性预测:风险-覆盖率实证

AUROC只能衡量置信度分数的排序质量,真正部署时还要回答另一个问题:阈值设在哪里?现实场景往往要求系统用一个统一的拒收阈值——比如“置信度低于0.6的预测全部转交人工”——而不是为每个分类等级分别设置阈值。为此,本论文在验证集上按置信度的分位数确定阈值,然后在测试集上计算接受样本中的错误率,也就是选择性风险R(τ)。
公式:选择性风险定义
(公式:选择性风险R(τ)的定义。其中yrcorr(x)表示样本x在等级r上的正确性标签,conf(x,r)为置信度分数,τ为全局阈值。含义是:在置信度大于等于τ的接受集合内,预测错误的期望占比)
图2展示了三条曲线随覆盖率变化的走势。纵轴是选择性风险,越低越好。可以看到,在覆盖率30%到90%的整个区间内,三条监督曲线都稳稳地压在NLL基线下方,尤其在40%到70%这个中等覆盖率区间,风险差距最明显。这意味着,如果系统愿意放弃25%的预测,把低置信度的案例交给人类专家,监督式估计器能让剩余样本的错误率比用NLL直接决策低一大截。
图2(a):Gemma 7B工具LLM下的全局阈值风险-覆盖率曲线
图2(a):Gemma 7B工具LLM下的全局阈值风险-覆盖率曲线
图2(b)和(c):Qwen3 30B A3B Instruct与GPT-OSS 20B下的全局阈值风险-覆盖率曲线
图2(b)(c):Qwen3 30B A3B Instruct与GPT-OSS 20B工具LLM下的全局阈值风险-覆盖率曲线。曲线为5个随机种子上的均值,阴影区间为±1倍标准差。Lower is better。
再看一个容易被忽略的辅助指标——校准。论文报告了温度缩放前后的负对数似然、期望校准误差(ECE)和Brier分数。三个工具LLM下,监督估计器的校准指标普遍好于NLL基线,其中H2和H3的温度缩放后NLL最低。校准不代表判别力,但对于“输出的置信度分数能不能直接当概率用”这件事,它给出了一个不错的答复。
表5:温度缩放前后的全秩校准指标对比
表5:全秩校准指标(温度缩放前后对比)。NLL、ECE、Brier均为数值越低越好,↓表示缩放后改善,↑表示退化。可以看到监视器估计器的NLL和Brier比基线低一个量级,说明预测概率与真实频率的匹配程度是明显更优的。
不过,事情并不全是好消息。换到rank-balanced的macro AUROC(每个等级权重相等的AUC)时,情况反转:三种监督估计器在多数设置下都低于NLL基线。这看起来跟micro AUROC上的大幅领先形成了矛盾。论文的解释是秩级样本极端不平衡:micro AUROC被样本量大的粗等级主导,而macro AUROC把每个等级一视同仁,于是深层等级样本少、训练不稳定、估计器方差大的问题就暴露出来了。下图进一步展示了每个等级单独的AUROC表现。
表4:全秩聚合macro AUROC对比
表4:全秩聚合macro AUROC对比。加粗为全部方法中最高,下划线为三种估计器中最高。可以看到基线在macro口径下反而领先,说明层级不平衡是监督式UQ在细粒度等级上的最大短板。
图4(a):Gemma 7B下的逐等级AUROC
图4(a):Gemma 7B工具LLM下逐等级AUROC(温度缩放前)
图4(b):Qwen3 30B A3B Instruct下的逐等级AUROC
图4(b):Qwen3 30B A3B Instruct工具LLM下逐等级AUROC
图4(c):GPT-OSS 20B下的逐等级AUROC
图4(c):GPT-OSS 20B工具LLM下逐等级AUROC。点表示5个随机种子的均值,横线为±1倍标准差。可以看到,越深的等级AUROC越低、方差越大,属和种两个等级的监督信号已经非常稀薄。

局限与展望:稀疏监督与泛化挑战

看完结果回到现实层面,这个方法的短板也很清晰。最核心的瓶颈是深层级监督稀疏:829张图像里,能走到属和种的样本分别只有223例和55例,在这类样本上训练分类头,效果天然受限。论文也明确承认,细粒度的AUROC表现和方差都说明监督信号不足。
第二个局限是泛化问题的验证还比较薄。目前的实验只基于simple-RAG这一条上游管道,目标LLM也固定为GPT-4o,工具LLM虽然换了三个,但下游任务、图像域、提示模板都没有变化。论文自己也指出,结论能否推广到更丰富的数据分布、其他分类任务甚至医学诊断,还是开放问题。
第三个值得注意的问题是评估口径的选择。micro AUROC和macro AUROC给出了相反结论,这说明“用什么指标考核”直接决定了你会得出什么结论。对部署方来说,如果目标是节省人工审核成本,全局阈值下的风险-覆盖率曲线是最贴近实际的指标;但如果希望每个等级都有均衡的把握,当前方法在深等级上还远远不够。
未来值得探索的方向也藏在结果里:一是给深层级设计专门的采样策略或者迁移学习机制,把粗等级学到的表示迁移到细等级;二是在RAG管道中,把不确定性估计的结果反馈给检索模块,形成“检索-推理-拒收-再检索”的主动学习闭环;三是把秩级阈值的全局统一放宽为多级自适应阈值,让不同等级用不同尺度做决策——不过这会引入更多需要考虑的工程约束。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?哪些分类等级靠谱、哪些需要人类复核?本文提出层级感知监督的不确定性估计框架,用工具LLM代理特征训练轻量估计器,在长尾物种分类任务上把全局阈值下的AUROC从0.57提升至0.75–0.80。
这篇工作最值得看的点是什么?监督不确定性估计器在micro AUROC上显著优于NLL基线(从0.57提升至0.75-0.80),H3设计在全局阈值选择性预测中表现最佳,风险-覆盖率曲线在广泛覆盖率范围内显著优于基线。
这篇工作的边界或风险在哪里?优点:方法轻量高效,无需访问黑盒LLM内部状态;层次感知监督和秩特定多头设计有效提升不确定性估计性能;在真实长尾生物多样性监测场景中验证。缺点:细粒度秩监督稀疏导致深层秩性能不稳定;仅验证单一分类学推理管线;macro AUROC上监督方法未一致优于基线。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

利用开源工具LLM提取代理特征,训练轻量级监督不确定性估计器,结合层次感知监督信号和秩特定多头输出结构,预测黑盒LLM在分类学推理中各秩的正确性。

实验合理度:★★★★☆

micro AUROC、macro AUROC、风险-覆盖率曲线、NLL、ECE、Brier分数。

学术研究价值:★★★★☆

利用开源工具LLM提取代理特征,训练轻量级监督不确定性估计器,结合层次感知监督信号和秩特定多头输出结构,预测黑盒LLM在分类学推理中各秩的正确性;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

轻量级MLP,计算开销极小;主要计算成本在工具LLM特征提取阶段。

复现难度:★★★☆☆

https://github.com/uoguelph-mlrg/hierarchy-aware-llm-uq

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:细粒度秩监督稀疏导致深层秩性能不稳定;仅验证单一分类学推理管线;macro AUROC上监督方法未一致优于基线。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球