← 返回 PaperDaily 视觉与图像

弗吉尼亚理工提出IntroConformal:让大模型自查"看图说话",弃权率狂降57%→25%

大模型"看图说话"时编造细节,一直缺乏严格的统计约束。弗吉尼亚理工这篇工作用模型自己的"内心独白"替换外部验证器,照样把错误率控制在数学保证范围内,还顺手把弃权率打了下去。值得所有关注多模态可靠部署的读者一读。

弗吉尼亚理工提出IntroConformal:让大模型自查"看图说话",弃权率狂降57%→25%

paperdaily_reaction_gif


原论文信息如下:
论文标题:
IntroConformal: 基于内省信号的大视觉语言模型共形事实性保证
发表日期:
2026年09月
发表单位:
弗吉尼亚理工大学
原文链接:
https://arxiv.org/pdf/2609.01375v1.pdf

先描述一个让所有AI工程师都心头一紧的场景:你部署了一个多模态大模型,让它读一张发票图片并输出关键字段,模型斩钉截铁地告诉你金额是" ∥1∥,∥2∥0∥0∥.∥0∥0∥"∥,∥还∥附∥带∥一∥串∥看∥似∥合∥理∥的∥明∥细∥解∥释∥。∥可∥实∥际∥上∥图∥片∥里∥清∥清∥楚∥楚∥写∥着∥"∥ 1,200.00"旁边还有一行小字"已付款",模型却根本没看见。更要命的是,它说这话时自信满满,token概率高得惊人,完全没有"心虚"的迹象。这种眼睛不眨一下的胡说八道,正是大视觉语言模型落地医疗报告、自动驾驶、财务单据等高危场景时最让人头疼的问题。
过去应对幻觉的主流思路大致分两类:一类是事后拿个外部验证器(比如CLIP)去核对模型生成的内容与图片是否一致;另一类是看模型生成时的token置信度。可这两条路都有硬伤。外部验证器一方面引入额外的部署依赖,算力紧张的环境根本跑不动;另一方面,CLIP这种通用图文匹配模型对细粒度事实的判别力其实相当有限。至于生成置信度,学术界早就发现,模型对幻觉内容往往同样自信——概率高不代表说得对。
弗吉尼亚理工大学的研究团队最近在arXiv上发布了一项名为IntroConformal的工作,思路很直接:既然外部验证不可靠、生成置信度更不可靠,那不如让模型自己当自己的"事实裁判"。他们在不引入任何外部模型、不做任何微调的前提下,仅靠模型内部隐藏状态和自身对事实的二分类判断,就构造出了符合严格数学保证的事实性筛选器。在多个主流视觉语言模型上,这套方法不仅把错误率牢牢压在预设的风险水位之下,还把系统的弃权率从57%直接降到25%。换句话说,原本每100次回答里有57次因为拿不准而拒绝回答,现在只有25次需要弃权,同时错误率依然可控。这相当于在安全性和可用性之间,找到了一把更精巧的平衡尺。

大模型也会“睁眼说瞎话”?——LVLM事实性控制的困境

先别急着笑“睁眼说瞎话”这个形容夸张。在医疗影像报告里,模型把肺部小结节说成“无异常”;在自动驾驶场景中,模型把路牌上的“禁止左转”读成“允许左转”;在发票识别里,金额、税号、收款方任何一个字段看错,都可能直接造成真金白银的损失。这里的核心麻烦不是模型偶尔犯错,而是它犯错时往往自信得毫无破绽:输出token概率很高,句子通顺流畅,甚至还会补上几句看似严谨的解释,用户根本没有办法从回答本身判断哪句话可信、哪句话是编的。
这类模型通常被称作大视觉语言模型(Large Vision-Language Model,LVLM),也就是既能看图像、又能用自然语言回答问题的多模态大模型。随着LVLM在高风险场景的渗透,学术界对幻觉问题的讨论已经从“如何让模型少骗人”升级为“能不能给出一个数学上可验证的承诺”:不管模型内部多复杂,最终保留给用户的每一条断言,都应当以不低于某个概率满足风险约束。换句话说,业界需要的不是碰运气的“尽量准”,而是一个有统计保证的事实性护栏
现在主流的防御思路有两条。一条是引入外部验证器,比如用CLIP这样的图文匹配模型来核对模型生成内容和图像的一致性;另一条是看模型生成阶段的token置信度,认为概率低的输出更值得怀疑。可惜这两条路的可靠性都打了折扣:外部验证器一方面增加了部署负担,在算力和内存受限的环境中很难跑起来,另一方面对“金额差一位”“物体颜色说错”这类细粒度事实其实很不敏感;而生成置信度与事实性的关联更是脆弱,模型完全可能对幻觉内容给出非常高的概率。学术界给这种现象起了个名字——自信幻觉(confident hallucination),越是看似靠谱的回答,越需要警惕。
弗吉尼亚理工大学团队提出的IntroConformal,恰好选择了第三条路:不依赖外部验证器,也不相信生成时的表面置信度,而是把目光转向模型自己。它假设模型在说出不实内容时,内部并非毫无痕迹;这些“痕迹”藏在隐藏状态的逐层演化里,也藏在模型对自己断言的二次判断里。把这套内省信号接入共形风险控制框架后,系统可以对“保留下来哪些断言”进行数学上可控的筛选。实验结果也非常直观:在常用基准上,弃权率从57%降到25%,而事实性风险依然被牢牢压在预设目标之下。听起来像个魔术,实际上是一套严谨的概率论与统计学习工具的优雅组合。

内省信号:让模型自己当自己的“事实裁判”

IntroConformal的第一步,是把模型一段完整的回答拆成原子声明(atomic claims)。一段描述可能有五六条独立信息,有的与图片吻合,有的完全是编造。逐条声明做筛选,比整段回答做“通过/不通过”更容易保证用户体验,也更能精准拦截错误信息。筛选时用到的打分函数被称为“一致性分数(conformity score)”,分数越高,代表该声明与图像证据越吻合,越应该保留给用户。
论文提出的第一种内省信号叫做逐层语义稳定性(S_sem)。这个思路来源于一个有趣的机制发现:当模型生成不实内容时,它的内部表示在靠近输出层的阶段会发生“语义漂移”,也就是说中间层还在处理图像信息,到了最后几层,表示却逐渐偏离了与图像证据一致的方向。为了捕捉这种漂移,论文在模型最后一个Transformer块之前选出一组中间层M,再取最后四层作为末端层集合T,分别对声明中每个token的隐藏状态求平均,然后计算两个平均表示之间的余弦相似度,最终汇总成一条声明级分数。
中间层与末端层平均隐藏状态公式
其中h_t^(ℓ)表示第ℓ层中token t的隐藏状态;M和T是两个互不相交的层集合。整体计算相当于把中层“大脑活动”与末层“即将说出口的表述”做一次相似度检查。
逐层语义稳定性S_sem公式
S_sem的数值越高,说明中层与末端层的语义方向越一致,该声明“在模型内部没有发生剧烈摇摆”;数值越低,则暗示末端表示偏离了中间层形成的语义锚点,这类声明往往更可能缺乏图像证据支撑。
不过,初步实验显示S_sem虽然能在多数架构上区分事实与非事实声明,判别力仍然不够强,甚至在个别模型上出现轻微反向。为了让信号更强,论文进一步提出第二种分数——验证概率(S_prob)。具体操作很朴素:把一条声明连同原图喂回同一个LVLM,向模型提出问题“基于这张图片,以下陈述是否成立?请回答Yes或No”,然后不采样离散答案,而是直接读取第一个回答位置中Yes token和No token的概率,并将二者归一化,得到最终分数。
验证概率S_prob公式
P(Yes|I,c_i)和P(No|I,c_i)分别表示模型在给定图像I与声明c_i时,对Yes和No两个答案位置的归一化概率。S_prob越高,说明模型自己“复核”后越倾向于认为这条声明有图像证据支持。
这套思路很容易让人联想到CoVe(Chain-of-Verification,验证链方法)。区别在于,CoVe通常需要额外采样离散答案,甚至让模型基于验证结果继续生成;而IntroConformal的S_prob只读取一次前向中的logits,不做任何额外解码,因此整体开销更低,属于严格意义上的单次前向内省。更重要的是,它没有借助任何外部模型,也没有改变原有LVLM的参数,是真正的训练免费(training-free)方案。
图1:IntroConformal总体流程
图1:IntroConformal总体流程。框架先把LVLM回答拆成原子声明(不实声明c₂标红),再计算两种一致性分数:来自隐藏状态的逐层语义稳定性S_sem,以及来自模型自身Yes/No事实判定的验证概率S_prob;用户选择其中一种分数用于校准与过滤。共形风险控制在校准集上标定阈值λ̂∈{λ̂_sem, λ̂_prob},只保留S(c)≥λ̂的声明,为事实性提供有限样本、分布无关的统计保证。
在正式介绍共形风险控制之前,先看一组信号质量对比。论文用AUROC(ROC曲线下面积,衡量二分类区分能力)和事实/非事实声明平均分差来评价四种信号:CONFLVLM采用的外部CLIP验证器、生成token平均概率T_prob、S_sem以及S_prob。结果很清晰:S_prob在所有任务与所有被测LVLM架构上都取得了最强区分力,事实与非事实声明的分数差在MSCOCO上从CLIP的+0.0196大幅拉升到+0.2014,AUROC也冲到0.819。
表1:三个任务与多种LVLM架构上的内省信号质量对比
表1:三个任务与多种LVLM架构上的一致性信号质量对比(校准集)。表中对每种信号报告事实声明(F)与非事实声明(NF)的平均分数、差值、AUROC与Welch t检验p值。S_sem与S_prob论为论文提出;可以看到S_prob在所有任务与架构中都显著拉开事实与非事实声明,而外部CLIP验证器与token置信度信号T_prob的区分力相当有限。
更有意思的是,某些传统信号甚至会出现“反向区分”:在文档理解任务上,token概率T_prob对事实声明的平均分反而更低;在Llama-3.2-Vision上,S_sem也出现轻微反转。这说明在复杂真实任务里,模型的表面置信度与隐藏层稳定性都不一定可靠,而直接询问模型“这条断言图像支持吗”这种显式自省,反而能获得更稳定的判别能力。

共形风险控制:给事实性保证加上“数学保险”

有了内省信号还不够。信号再强也只是“打分”,真正让打分转化为硬承诺的,是共形风险控制(Conformal Risk Control,CRC)这套统计框架。先解释一下背景:传统共形预测给的是“覆盖率”保证,而CRC把目标从覆盖率推广到更一般的风险函数。IntroConformal想控制的风险非常具体——保留下来给用户的声明中,不实声明的比例
形式化地说,论文希望选出的声明集合Ĉ满足下面的不等式:
非事实风险约束表达式
其中L(c,I)∈{0,1}表示声明c是否不被图像I支持;|Ĉ|表示最终保留的声明总数。等式的意思是:在保留的声明中,非事实声明的期望占比不超过用户预设的α;如果一条声明都没保留,则风险记为零。
数学实现上,IntroConformal基于Learn-Then-Test(先学后测)范式的CRC。校准过程中,系统会遍历很多候选阈值λ,按“分数≥λ则保留声明”的规则筛选:
阈值筛选算子公式
阈值λ取得越高,筛选越激进,保留下来的声明数量越少。问题在于,怎么知道哪个λ能真正保证风险上界?如果只看校准集上的经验风险,很容易出现过拟合。论文采用Hoeffding不等式构造每个λ的上置信界(UCB),再对全体候选阈值做Bonferroni校正,最终确保“所有阈值同时有效”这件事以不低于1−δ的概率成立。论文实验中取n=400个校准提示、α=δ=0.1,经过多重校正后得到并发保证水平α′≤0.170。
响应级非事实率公式
每个响应k的经验风险r_k(λ)定义为:保留的声明中非事实声明数目除以保留声明总数;如果没有保留任何声明,则损失直接记0,对应“弃权不扣分”的选择性预测约定。
Hoeffding上置信界公式
UCB_δ(λ)由经验风险加上一个随校准样本量n增大的项构成:样本量越大,置信区间越窄,所需预留的“不确定性余量”越小。最后论文选择满足风险约束的最小可行阈值,也就是对用户最友好、能保留最多声明的那个临界点。
这套机制的精妙之处在于把“信号设计”和“风险控制”解耦。信号可以弱一点,但只要有哪怕一点点真实区分能力,CRC都能通过校准自动找到合适的阈值;而真正决定“弃权率有多低”的,是信号本身把事实与非事实声明分得有多开。S_prob恰好补上了这一块短板,于是就有了前面看到的既满足保证、又大幅降低弃权率的结果。

实验结果:更低弃权率,更强判别力

实验设计横跨三个对事实性要求很高的视觉语言任务:通用场景理解(基于MSCOCO的500张图像,含人工验证的声明级标注)、细粒度描述(CUB鸟类、斯坦福汽车与斯坦福犬类,共516张图像)、文档理解(SROIE发票图像,随机选500张)。被测模型覆盖五个主流架构:LLaVA-1.5-7B、Phi-3.5-Vision-Instruct、Llama-3.2-11B-Vision、Qwen2.5-VL-7B-Instruct以及Qwen3-VL-8B-Instruct。校准集与测试集按照400/100切分,保证与测试数据来自同一分布。
在事实性标注环节,论文做了一项额外可信度验证:细粒度描述与文档理解任务使用GPT-4o-mini拆分声明、GPT-5.4标注是否与图像一致,随后由一名人类标注者独立复查372条声明,与GPT标签的一致性达到86.0%,Cohen's κ为0.71,说明自动标注结果并非模型自说自话,而是与人类判断相当吻合。
主要结果以“响应级风险”和“弃权率”为核心看点。弃权率指系统因为不满足保证而拒绝回答(或过滤全部声明)的比例;F1则综合了声明级查准率与召回率。这里直接看论文的核心对比表:
表2:IntroConformal与基线在通用场景理解上的响应级风险、弃权率与声明级指标对比
表2:通用场景理解(MSCOCO)上,IntroConformal与基线方法的响应级风险、弃权率与声明级指标对比(使用原论文表2截图)。可以看到,所有方法都把风险控制在预设水位以下,但采用S_prob后弃权率显著低于基于外部CLIP验证器的CONFLVLM:以LLaVA-1.5为例,弃权率从57%降至25%,F1从0.504提升到0.581;Phi-3.5-Vision上弃权率从65%降到23%;Llama-3.2-Vision上更是从51%降到13%。
再结合上面表1的信号质量,内部逻辑完全自洽:S_prob把事实与非事实声明分开的能力最强,所以在相同风险目标下,校准出的阈值不需要过滤掉那么多真实声明,弃权率自然会下降。这也说明“弃权率降了”不是靠偷偷放大风险换来的,而是信号判别力提升带来的真实收益。
细粒度与文档任务上同样复现了这一规律。图2以MSCOCO为代表展示了共形保证的有效性:无论用户把目标风险α设在0.05还是0.40,经验风险都稳定压在目标线以下,校准集规模从50逐步增加到400的过程中风险也保持一致,说明这套机制不是碰巧在某个参数点成立。
图2:MSCOCO评估:共形有效性与弃权率随目标风险和校准集规模的变化
图2:MSCOCO上三种LVLM架构的评估。(a) 随着用户目标风险α从0.05变化到0.40,经验风险始终低于目标,验证了共形风险保证;(b) 弃权率随期望覆盖率1−α的变化,可看出更严格的风险控制需要付出更高的弃权代价;(c)(d) 在校准集规模变化时的测试风险与弃权率,使用的运行点与全文一致。
只看弃权率还不够,论文还比较了声明过滤效率与回答准确性。所谓过滤效率,是指单位数量的风险控制下能保留多少有用内容;回答准确性则是过滤后输出内容的整体质量。这里与解码式方法以及验证式方法对比,S_prob版本在不需要任何外部模型、不做解码扰动的条件下依然全面占优。也就是说,相比那些需要额外推理、多轮采样或调用外部判别器的方法,IntroConformal用更轻的部署换来了更好的可用性。
表3:与解码式及验证式方法在声明过滤效率与回答准确性上的对比
表3:与解码式、验证式方法在声明过滤效率和回答准确性上的对比(原论文表3截图)。IntroConformal(S_prob)超过包括CONFLVLM在内的所有基线,且不需要外部模型或解码时扰动。
还有一个实际部署中非常关键的维度:校准标签噪声鲁棒性。真实业务里人工标注不可能完全没有错误,如果校准集里混入噪声,会不会导致风险失控?论文专门在LLaVA-1.5的MSCOCO校准标签中注入了从10%到50%的对称噪声,结果如下:
表4:校准标签噪声鲁棒性实验
表4:LLaVA-1.5在MSCOCO上的校准标签噪声鲁棒性(原论文表4截图)。在校准标签中注入对称噪声后,测试时的真实风险在不同噪声水平下都保持在目标以下,显示方法对校准集标签噪声并不敏感。
图3:IntroConformal定性示例
图3:IntroConformal在运行点上的定性示例。一个通用场景理解图像的回答被拆成6条原子声明,方法正确过滤了红色标出的两条非事实声明,同时保留了绿色标出的两条事实声明;另外两条事实声明被保守过滤(黑色),反映了严格风险水平下的风险—可用性权衡,对应阈值为λ̂_prob=0.940。
同样地,细粒度描述任务与文档理解任务上也观察到了稳定规律:CRC保证始终成立,S_prob的弃权率显著低于外部验证器基线。细粒度任务因为类别相近、视觉差异细微,整体F1绝对值不算高,但S_prob仍然把CLIP基线的F1从0.274附近拉开近10个点;文档理解任务中,不同模型对发票版式的敏感度差异较大,判别难度更高,S_prob依旧是表现最稳定的分数。
图4:细粒度描述任务评估结果
图4:细粒度描述任务上两种LVLM架构的评估。(a) 不同用户目标α下经验风险都低于目标;(b) 弃权率随覆盖率要求改变;(c)(d) 校准集规模从50到400变化时的测试风险与弃权率。
图5与表5:文档理解任务评估及层选择敏感性分析
图5与表5(合并截图):文档理解任务上两种LVLM架构的共形有效性、弃权率与校准集规模分析,以及S_sem中间层/末端层选择方式对信号质量的影响。论文将中间层集合M的选取从“网络前四分之一到中点”调整为“紧邻末端块之前的8层”,末端集合T固定为最后4层,这一调整借鉴了此前关于内部表示漂移的研究,能够有效提升S_sem在部分模型上的稳定性。
看到57%到25%这个数字的时候,龙哥确实不自觉地嘴巴微张。不是因为它把不可控变可控——共形方法要做到这点并不算稀奇——而是因为它没有引入任何外部模型,只靠模型自己的“二次确认”,就能在同样风险目标下把可用性拉到这么高。这相当于让一个经常口误的发言人,自己在出口前默念一遍“这句话真的看了图吗”,然后大部分不该说的话就真的被咽回去了。这种“向内要信号”的姿势,比单纯堆外部校准器优雅得多。
v2-74ba8bc1c6c52a48ea1c3c5c67685ca3_hd.jpg

局限与展望:从实验室到真实部署的距离

再漂亮的结果也有边界,这篇论文最需要被强调的边界是:共形风险控制的保证基于校准集与测试集同分布的假设。如果模型上线后面对的图像分布发生明显漂移——比如训练时主要是自然照片,部署遇到大量票据扫描件;或者图像里出现了从未见过的目标类别——那么这套数学保证在统计学上就不再自动成立。真实业务中需要持续采样、定期重新校准,才能让风险承诺继续有效。
另一个现实问题是校准成本。虽然IntroConformal本身不需要训练,但它需要一份高质量的声明级事实标注集合,标注过程还要兼顾不同错误类型,这部分人工与自动标注的清洗成本并不低。论文用GPT-4o-mini拆分声明、GPT-5.4标注并与人类标注交叉验证,说明自动标注已达到较高可用度;可一旦企业切换到细分垂直领域,原有标注提示词是否需要重写、新领域标注规范是否要人工重做,都是必须挤出的预算。
论文自己也坦承了S_sem信号的局限:它虽然在部分模型上有效,但并非在所有架构上都能稳定提供正判别力,因此在实际使用时主要推荐S_prob。展望后续,如果把多轮校验、跨模型一致性以及图像局部区域级别的细粒度验证组合进来,内省信号的判别天花板还能继续抬高。站在工程视角,这套方案的最大价值是提供了一种“以无训练代价换取可用性上限”的参考路径,特别适合算力受限的边缘场景与实时性敏感的交互产品。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?在无需外部验证器或额外监督的前提下,弗吉尼亚理工团队提出训练免费的IntroConformal框架,利用模型自身的"层间语义稳定性"与"验证概率"两个内省信号,结合共形风险控制,为多模态大模型的事实性输出提供了具有有限样本、分布无
这篇工作最值得看的点是什么?S_prob在所有任务和架构上均满足共形风险保证,同时显著降低弃权率(如MSCOCO上LLaVA-1.5从57%降至25%),F1从0.504提升至0.581,优于外部验证器基线和解码方法
这篇工作的边界或风险在哪里?优点:无需外部验证器或辅助监督,提供严格的统计保证,S_prob信号判别力强且跨架构一致;缺点:S_sem判别力有限,S_prob需要logits访问权限,额外前向传播增加推理成本,保证依赖于校准标签质量
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出IntroConformal框架,利用模型自身的层间语义稳定性和验证概率作为共形分数,通过共形风险控制提供无需训练的有限样本事实性保证。

实验合理度:★★★★☆

响应级经验风险、弃权率、TPR、精确率、F1、AUROC

学术研究价值:★★★★☆

提出IntroConformal框架,利用模型自身的层间语义稳定性和验证概率作为共形分数,通过共形风险控制提供无需训练的有限样本事实性保证;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

无需训练,仅需每个声明额外一次前向传播,与CLIP评分成本相当

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:S_sem判别力有限,S_prob需要logits访问权限,额外前向传播增加推理成本,保证依赖于校准标签质量

主要参考文献

[1] Md. Atabuzzaman, Christian Alexander, Chris Thomas. IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals. arXiv:2609.01375, 2026. https://arxiv.org/pdf/2609.01375v1.pdf
[2] Vovk V., Gammerman A., Shafer G. Algorithmic Learning in a Random World. Springer, 2005.(共形预测理论基础)
[3] Hoeffding W. Probability Inequalities for Sums of Bounded Random Variables. Journal of the American Statistical Association, 1963.(Hoeffding不等式来源)
[4] Dhuliawala S., et al. Chain-of-Verification Reduces Hallucination in Large Language Models.(CoVe方法基础,文中对比对象)
[5] Li et al. CONFLVLM: Contrastive Conformal Factuality Control for LVLMs.(外部验证器基线与标注基准来源)

融会贯通


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球