← 返回 PaperDaily
视觉与图像
弗吉尼亚理工提出IntroConformal:让大模型自查"看图说话",弃权率狂降57%→25%
大模型"看图说话"时编造细节,一直缺乏严格的统计约束。弗吉尼亚理工这篇工作用模型自己的"内心独白"替换外部验证器,照样把错误率控制在数学保证范围内,还顺手把弃权率打了下去。值得所有关注多模态可靠部署的读者一读。
龙哥读论文
发布于 2026-09-05 00:31:07
阅读 2
查看原文
原论文信息如下:
先描述一个让所有AI工程师都心头一紧的场景:你部署了一个多模态大模型,让它读一张发票图片并输出关键字段,模型斩钉截铁地告诉你金额是" ∥1∥,∥2∥0∥0∥.∥0∥0∥"∥,∥还∥附∥带∥一∥串∥看∥似∥合∥理∥的∥明∥细∥解∥释∥。∥可∥实∥际∥上∥图∥片∥里∥清∥清∥楚∥楚∥写∥着∥"∥ 1,200.00"旁边还有一行小字"已付款",模型却根本没看见。更要命的是,它说这话时自信满满,token概率高得惊人,完全没有"心虚"的迹象。这种眼睛不眨一下的胡说八道,正是大视觉语言模型落地医疗报告、自动驾驶、财务单据等高危场景时最让人头疼的问题。
过去应对幻觉的主流思路大致分两类:一类是事后拿个外部验证器(比如CLIP)去核对模型生成的内容与图片是否一致;另一类是看模型生成时的token置信度。可这两条路都有硬伤。外部验证器一方面引入额外的部署依赖,算力紧张的环境根本跑不动;另一方面,CLIP这种通用图文匹配模型对细粒度事实的判别力其实相当有限。至于生成置信度,学术界早就发现,模型对幻觉内容往往同样自信——概率高不代表说得对。
弗吉尼亚理工大学的研究团队最近在arXiv上发布了一项名为IntroConformal的工作,思路很直接:既然外部验证不可靠、生成置信度更不可靠,那不如让模型自己当自己的"事实裁判"。他们在不引入任何外部模型、不做任何微调的前提下,仅靠模型内部隐藏状态和自身对事实的二分类判断,就构造出了符合严格数学保证的事实性筛选器。在多个主流视觉语言模型上,这套方法不仅把错误率牢牢压在预设的风险水位之下,还把系统的弃权率从57%直接降到25%。换句话说,原本每100次回答里有57次因为拿不准而拒绝回答,现在只有25次需要弃权,同时错误率依然可控。这相当于在安全性和可用性之间,找到了一把更精巧的平衡尺。 大模型也会“睁眼说瞎话”?——LVLM事实性控制的困境
先别急着笑“睁眼说瞎话”这个形容夸张。在医疗影像报告里,模型把肺部小结节说成“无异常”;在自动驾驶场景中,模型把路牌上的“禁止左转”读成“允许左转”;在发票识别里,金额、税号、收款方任何一个字段看错,都可能直接造成真金白银的损失。这里的核心麻烦不是模型偶尔犯错,而是它犯错时往往自信得毫无破绽 :输出token概率很高,句子通顺流畅,甚至还会补上几句看似严谨的解释,用户根本没有办法从回答本身判断哪句话可信、哪句话是编的。
这类模型通常被称作大视觉语言模型(Large Vision-Language Model,LVLM) ,也就是既能看图像、又能用自然语言回答问题的多模态大模型。随着LVLM在高风险场景的渗透,学术界对幻觉问题的讨论已经从“如何让模型少骗人”升级为“能不能给出一个数学上可验证的承诺”:不管模型内部多复杂,最终保留给用户的每一条断言,都应当以不低于某个概率满足风险约束。换句话说,业界需要的不是碰运气的“尽量准”,而是一个有统计保证的事实性护栏 。
现在主流的防御思路有两条。一条是引入外部验证器,比如用CLIP这样的图文匹配模型来核对模型生成内容和图像的一致性;另一条是看模型生成阶段的token置信度,认为概率低的输出更值得怀疑。可惜这两条路的可靠性都打了折扣:外部验证器一方面增加了部署负担,在算力和内存受限的环境中很难跑起来,另一方面对“金额差一位”“物体颜色说错”这类细粒度事实其实很不敏感;而生成置信度与事实性的关联更是脆弱,模型完全可能对幻觉内容给出非常高的概率。学术界给这种现象起了个名字——自信幻觉(confident hallucination) ,越是看似靠谱的回答,越需要警惕。
弗吉尼亚理工大学团队提出的IntroConformal,恰好选择了第三条路:不依赖外部验证器,也不相信生成时的表面置信度,而是把目光转向模型自己。它假设模型在说出不实内容时,内部并非毫无痕迹;这些“痕迹”藏在隐藏状态的逐层演化里,也藏在模型对自己断言的二次判断里。把这套内省信号接入共形风险控制框架后,系统可以对“保留下来哪些断言”进行数学上可控的筛选。实验结果也非常直观:在常用基准上,弃权率从57%降到25%,而事实性风险依然被牢牢压在预设目标之下。听起来像个魔术,实际上是一套严谨的概率论与统计学习工具的优雅组合。
内省信号:让模型自己当自己的“事实裁判”
IntroConformal的第一步,是把模型一段完整的回答拆成原子声明(atomic claims) 。一段描述可能有五六条独立信息,有的与图片吻合,有的完全是编造。逐条声明做筛选,比整段回答做“通过/不通过”更容易保证用户体验,也更能精准拦截错误信息。筛选时用到的打分函数被称为“一致性分数(conformity score)”,分数越高,代表该声明与图像证据越吻合,越应该保留给用户。
论文提出的第一种内省信号叫做逐层语义稳定性(S_sem) 。这个思路来源于一个有趣的机制发现:当模型生成不实内容时,它的内部表示在靠近输出层的阶段会发生“语义漂移”,也就是说中间层还在处理图像信息,到了最后几层,表示却逐渐偏离了与图像证据一致的方向。为了捕捉这种漂移,论文在模型最后一个Transformer块之前选出一组中间层M,再取最后四层作为末端层集合T,分别对声明中每个token的隐藏状态求平均,然后计算两个平均表示之间的余弦相似度,最终汇总成一条声明级分数。
不过,初步实验显示S_sem虽然能在多数架构上区分事实与非事实声明,判别力仍然不够强,甚至在个别模型上出现轻微反向。为了让信号更强,论文进一步提出第二种分数——验证概率(S_prob) 。具体操作很朴素:把一条声明连同原图喂回同一个LVLM,向模型提出问题“基于这张图片,以下陈述是否成立?请回答Yes或No”,然后不采样离散答案,而是直接读取第一个回答位置中Yes token和No token的概率,并将二者归一化,得到最终分数。
这套思路很容易让人联想到CoVe(Chain-of-Verification,验证链方法)。区别在于,CoVe通常需要额外采样离散答案,甚至让模型基于验证结果继续生成;而IntroConformal的S_prob只读取一次前向中的logits,不做任何额外解码,因此整体开销更低,属于严格意义上的单次前向内省。更重要的是,它没有借助任何外部模型,也没有改变原有LVLM的参数,是真正的训练免费(training-free)方案。
在正式介绍共形风险控制之前,先看一组信号质量对比。论文用AUROC(ROC曲线下面积,衡量二分类区分能力)和事实/非事实声明平均分差来评价四种信号:CONFLVLM采用的外部CLIP验证器、生成token平均概率T_prob、S_sem以及S_prob。结果很清晰:S_prob在所有任务与所有被测LVLM架构上都取得了最强区分力,事实与非事实声明的分数差在MSCOCO上从CLIP的+0.0196大幅拉升到+0.2014,AUROC也冲到0.819。
更有意思的是,某些传统信号甚至会出现“反向区分”:在文档理解任务上,token概率T_prob对事实声明的平均分反而更低;在Llama-3.2-Vision上,S_sem也出现轻微反转。这说明在复杂真实任务里,模型的表面置信度与隐藏层稳定性都不一定可靠,而直接询问模型“这条断言图像支持吗”这种显式自省,反而能获得更稳定的判别能力。
共形风险控制:给事实性保证加上“数学保险”
有了内省信号还不够。信号再强也只是“打分”,真正让打分转化为硬承诺的,是共形风险控制(Conformal Risk Control,CRC)这套统计框架。先解释一下背景:传统共形预测给的是“覆盖率”保证,而CRC把目标从覆盖率推广到更一般的风险函数。IntroConformal想控制的风险非常具体——保留下来给用户的声明中,不实声明的比例 。
形式化地说,论文希望选出的声明集合Ĉ满足下面的不等式:
数学实现上,IntroConformal基于Learn-Then-Test(先学后测)范式的CRC。校准过程中,系统会遍历很多候选阈值λ,按“分数≥λ则保留声明”的规则筛选:
这套机制的精妙之处在于把“信号设计”和“风险控制”解耦。信号可以弱一点,但只要有哪怕一点点真实区分能力,CRC都能通过校准自动找到合适的阈值;而真正决定“弃权率有多低”的,是信号本身把事实与非事实声明分得有多开。S_prob恰好补上了这一块短板,于是就有了前面看到的既满足保证、又大幅降低弃权率的结果。
实验结果:更低弃权率,更强判别力
实验设计横跨三个对事实性要求很高的视觉语言任务:通用场景理解(基于MSCOCO的500张图像,含人工验证的声明级标注)、细粒度描述(CUB鸟类、斯坦福汽车与斯坦福犬类,共516张图像)、文档理解(SROIE发票图像,随机选500张)。被测模型覆盖五个主流架构:LLaVA-1.5-7B、Phi-3.5-Vision-Instruct、Llama-3.2-11B-Vision、Qwen2.5-VL-7B-Instruct以及Qwen3-VL-8B-Instruct。校准集与测试集按照400/100切分,保证与测试数据来自同一分布。
在事实性标注环节,论文做了一项额外可信度验证:细粒度描述与文档理解任务使用GPT-4o-mini拆分声明、GPT-5.4标注是否与图像一致,随后由一名人类标注者独立复查372条声明,与GPT标签的一致性达到86.0%,Cohen's κ为0.71,说明自动标注结果并非模型自说自话,而是与人类判断相当吻合。
主要结果以“响应级风险”和“弃权率”为核心看点。弃权率指系统因为不满足保证而拒绝回答(或过滤全部声明)的比例;F1则综合了声明级查准率与召回率。这里直接看论文的核心对比表:
再结合上面表1的信号质量,内部逻辑完全自洽:S_prob把事实与非事实声明分开的能力最强,所以在相同风险目标下,校准出的阈值不需要过滤掉那么多真实声明,弃权率自然会下降。这也说明“弃权率降了”不是靠偷偷放大风险换来的,而是信号判别力提升带来的真实收益。
细粒度与文档任务上同样复现了这一规律。图2以MSCOCO为代表展示了共形保证的有效性:无论用户把目标风险α设在0.05还是0.40,经验风险都稳定压在目标线以下,校准集规模从50逐步增加到400的过程中风险也保持一致,说明这套机制不是碰巧在某个参数点成立。
只看弃权率还不够,论文还比较了声明过滤效率与回答准确性。所谓过滤效率,是指单位数量的风险控制下能保留多少有用内容;回答准确性则是过滤后输出内容的整体质量。这里与解码式方法以及验证式方法对比,S_prob版本在不需要任何外部模型、不做解码扰动的条件下依然全面占优。也就是说,相比那些需要额外推理、多轮采样或调用外部判别器的方法,IntroConformal用更轻的部署换来了更好的可用性。
还有一个实际部署中非常关键的维度:校准标签噪声鲁棒性。真实业务里人工标注不可能完全没有错误,如果校准集里混入噪声,会不会导致风险失控?论文专门在LLaVA-1.5的MSCOCO校准标签中注入了从10%到50%的对称噪声,结果如下:
同样地,细粒度描述任务与文档理解任务上也观察到了稳定规律:CRC保证始终成立,S_prob的弃权率显著低于外部验证器基线。细粒度任务因为类别相近、视觉差异细微,整体F1绝对值不算高,但S_prob仍然把CLIP基线的F1从0.274附近拉开近10个点;文档理解任务中,不同模型对发票版式的敏感度差异较大,判别难度更高,S_prob依旧是表现最稳定的分数。
看到57%到25%这个数字的时候,龙哥确实不自觉地嘴巴微张。不是因为它把不可控变可控——共形方法要做到这点并不算稀奇——而是因为它没有引入任何外部模型,只靠模型自己的“二次确认”,就能在同样风险目标下把可用性拉到这么高。这相当于让一个经常口误的发言人,自己在出口前默念一遍“这句话真的看了图吗”,然后大部分不该说的话就真的被咽回去了。这种“向内要信号”的姿势,比单纯堆外部校准器优雅得多。
局限与展望:从实验室到真实部署的距离
再漂亮的结果也有边界,这篇论文最需要被强调的边界是:共形风险控制的保证基于校准集与测试集同分布的假设。如果模型上线后面对的图像分布发生明显漂移——比如训练时主要是自然照片,部署遇到大量票据扫描件;或者图像里出现了从未见过的目标类别——那么这套数学保证在统计学上就不再自动成立。真实业务中需要持续采样、定期重新校准,才能让风险承诺继续有效。
另一个现实问题是校准成本。虽然IntroConformal本身不需要训练,但它需要一份高质量的声明级事实标注集合,标注过程还要兼顾不同错误类型,这部分人工与自动标注的清洗成本并不低。论文用GPT-4o-mini拆分声明、GPT-5.4标注并与人类标注交叉验证,说明自动标注已达到较高可用度;可一旦企业切换到细分垂直领域,原有标注提示词是否需要重写、新领域标注规范是否要人工重做,都是必须挤出的预算。
论文自己也坦承了S_sem信号的局限:它虽然在部分模型上有效,但并非在所有架构上都能稳定提供正判别力,因此在实际使用时主要推荐S_prob。展望后续,如果把多轮校验、跨模型一致性以及图像局部区域级别的细粒度验证组合进来,内省信号的判别天花板还能继续抬高。站在工程视角,这套方案的最大价值是提供了一种“以无训练代价换取可用性上限”的参考路径,特别适合算力受限的边缘场景与实时性敏感的交互产品。
龙迷三问
这篇论文到底在解决什么问题? 在无需外部验证器或额外监督的前提下,弗吉尼亚理工团队提出训练免费的IntroConformal框架,利用模型自身的"层间语义稳定性"与"验证概率"两个内省信号,结合共形风险控制,为多模态大模型的事实性输出提供了具有有限样本、分布无
这篇工作最值得看的点是什么? S_prob在所有任务和架构上均满足共形风险保证,同时显著降低弃权率(如MSCOCO上LLaVA-1.5从57%降至25%),F1从0.504提升至0.581,优于外部验证器基线和解码方法
这篇工作的边界或风险在哪里? 优点:无需外部验证器或辅助监督,提供严格的统计保证,S_prob信号判别力强且跨架构一致;缺点:S_sem判别力有限,S_prob需要logits访问权限,额外前向传播增加推理成本,保证依赖于校准标签质量
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出IntroConformal框架,利用模型自身的层间语义稳定性和验证概率作为共形分数,通过共形风险控制提供无需训练的有限样本事实性保证。
实验合理度: ★★★★☆
响应级经验风险、弃权率、TPR、精确率、F1、AUROC
学术研究价值: ★★★★☆
提出IntroConformal框架,利用模型自身的层间语义稳定性和验证概率作为共形分数,通过共形风险控制提供无需训练的有限样本事实性保证;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
无需训练,仅需每个声明额外一次前向传播,与CLIP评分成本相当
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: S_sem判别力有限,S_prob需要logits访问权限,额外前向传播增加推理成本,保证依赖于校准标签质量
主要参考文献
[1] Md. Atabuzzaman, Christian Alexander, Chris Thomas. IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals. arXiv:2609.01375, 2026. https://arxiv.org/pdf/2609.01375v1.pdf
[2] Vovk V., Gammerman A., Shafer G. Algorithmic Learning in a Random World. Springer, 2005.(共形预测理论基础)
[3] Hoeffding W. Probability Inequalities for Sums of Bounded Random Variables. Journal of the American Statistical Association, 1963.(Hoeffding不等式来源)
[4] Dhuliawala S., et al. Chain-of-Verification Reduces Hallucination in Large Language Models.(CoVe方法基础,文中对比对象)
[5] Li et al. CONFLVLM: Contrastive Conformal Factuality Control for LVLMs.(外部验证器基线与标注基准来源)
融会贯通
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!