← 返回 PaperDaily 视觉与图像

Qwen2-VL & SmolVLM告诉你:内部Token概率才是真王者

你是否遇到过AI模型胸脯拍得震天响却答不对题?这篇论文发现,小VLM嘴上说着“我超自信”,但内部的token概率早就泄了底。想知道如何让模型在自己犯错时闭嘴?看这篇就够了!

Qwen2-VL & SmolVLM告诉你:内部Token概率才是真王者
原论文信息如下:
论文标题:
Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation
发表日期:
2026年7月

发表单位:
Independent Researcher

原文链接:
https://arxiv.org/pdf/2607.22034v1.pdf

开源代码链接:
https://github.com/Asif-Ferdous/vlm-reliability

小VLM的“嘴硬”真相:言语化置信度形同虚设

你有没有遇到过这种情况?你问一个AI模型“这张图里是什么?”,它信心满满地告诉你“这是披萨,我100%确定!”结果呢?那其实是一张烤焦的馕饼。模型嘴上说着“我最自信”,实际上却是“我根本不知道自己错哪了”。
这篇由独立研究者 M M Asif Ferdous完成的工作,就专门研究了这个问题:当输入图片不那么完美(被压缩、模糊、过暗、过亮)时,那些在消费级硬件上跑的小型视觉语言模型(VLM),到底有多“自知之明”?他们能不能清楚地告诉你“我大概有几分把握”?
为了搞清楚这个问题,作者选择了两个非常有代表性的小模型:Qwen2-VL-2B-Instruct(阿里通义千问系列的开源视觉语言模型)和SmolVLM-Instruct(Hugging Face团队的小型视觉语言模型)。它们都只有约20亿参数,非常适合在单个免费级NVIDIA T4 (16 GB) GPU上运行,也是目前边缘设备部署的热门选择。
论文的设计逻辑非常清晰。他们从Food101数据集中选取了100张食物图片,设计成一个四选一的视觉问答任务。然后,他们对每张图片施加了6种真实的、模拟手机拍照时可能发生的退化场景,每种场景还有3个严重等级:
表1:退化种类及严重程度参数
表1:退化种类及严重程度参数。可以看到,涵盖了压缩(JPEG)、运动模糊(Motion blur)、低光照(Low light)、眩光(Glare)、旋转(Rotation)和重采样(Resample)这六种非常常见的情况。
接下来是重头戏:他们比较了两种模型判断“自己有多自信”的信号。
第一种是言语化置信度(Verbalized Confidence)。简单说,就是直接问模型:“你有多确定你的答案?请给我一个0到100之间的数字。”模型会输出一个整数,比如“90”。这个方法非常直观,就像我们去问一个人“你确定吗?”一样。
第二种是内部置信度(Internal Confidence)。这是一种“窃听”模型内部想法的手段。研究人员不去问模型,而是去测量模型在生成答案时,每一步产生每个词(token)的平均概率。如果模型生成对应答案的每一个词都高概率,说明它内部“很笃定”;如果生成时概率忽高忽低,那它内部就在“犹豫”。
用公式表示就是:
内部置信度公式
公式1:内部置信度公式。简单来说,c_int 就是模型在生成答案(长度为T)时,对每一个生成出来的词y_t的平均概率。p_θ(y_t | ...) 是模型在给定输入x和已生成的词y_
那么,结果如何呢?结果可以说非常“讽刺”。
对于Qwen2-VL,这个模型在干净图片上的准确率高达0.99。但无论图片多么惨不忍睹,它口头表达的置信度几乎保持不变,始终在0.87到0.90之间徘徊。哪怕在严重低光条件下,准确率暴跌至0.22(接近随机乱猜的0.25),它仍然自信地告诉你“我87%确定”。这就像是一个永远考不及格的学生,每次考完试都跟你说“我这次考得好极了,95分稳了”一样。
SmolVLM的表现更是直接“摆烂”。研究人员试了三种不同的提示词模板,在5个测试样本上,只有一次成功让模型输出了一个可以被解析为置信度的数字。大部分时候,模型就只给你一个光秃秃的答案,完全无视“请告诉我你的确定程度”这个指令,仿佛根本没听到你在问什么。
图3:Qwen2-VL-2B在低光条件下的表现
图3:Qwen2-VL-2B在低光条件下的表现。黑色线(Accuracy)准确率从0.99暴跌至0.22,而红色线(Verbalized confidence)言语化置信度几乎纹丝不动,蓝色线(Internal confidence)内部置信度虽然下降了,但降幅远不及准确率的暴跌。这个巨大的“信任鸿沟”就是本文警告的核心问题。

内部信号才是真相:平均Token概率如何精准检测错误?

既然模型嘴上说的不靠谱,那我们来看看它“心里”想的怎么样。论文中的第二个关键发现,就是内部置信度(平均Token概率)的表现与言语化置信度形成了天壤之别。
研究人员使用了一个非常关键的评价指标:错误检测AUROC(Area Under the Receiver Operating Characteristic Curve)。这个指标衡量的是一个置信度信号能否有效区分正确的回答和错误的回答。AUROC值为0.5表示该信号完全随机,没有任何预测能力,就跟抛硬币一样。AUROC值越接近1.0,表示这个信号越强,几乎能做到“一抓一个准”。对于需要做出“是否退避”决策的系统来说,这是比单纯的校准误差更直观、更重要的指标。
结果令人震惊:
对于Qwen2-VL,言语化置信度的错误检测AUROC在很多条件下都在0.50左右徘徊,甚至在低光条件下掉到了0.39(比随机猜还差)。换言之,用它来判断模型是否答对,还不如直接投硬币的结果来得可靠。
然而,内部置信度(平均Token概率)的表现却几乎达到了天花板水平。在大多数情况下,它的AUROC值高达0.92到0.99。这意味着,通过观察模型生成答案时内部Token的平均概率,我们几乎可以肯定地判断出模型这次有没有犯错。
图2:Qwen2-VL-2B中的言语化置信度与内部置信度的错误检测AUROC对比
图2:Qwen2-VL-2B中两个置信度信号的错误检测AUROC对比。红色点是言语化置信度,蓝色点是内部置信度。红色点几乎贴着0.5的随机线(灰色虚线)浮动,而蓝色点则在0.82到0.99的高位运行。一张图就能看明白,哪个信号是“嘴炮王者”,哪个是“实力担当”。
为什么会出现这种情况?论文作者给出了一个非常精辟的解释。言语化置信度是一个需要模型进行“内省”并“序列化”输出的过程,这是一个学来的表面行为。在小型指令微调模型上,这种行为很容易退化为一个“标准答案式”的回复,比如Qwen2-VL就学会了在任何时候都回答“90”。而内部Token概率则不同,它不需要模型进行任何形式的内省,它是对模型自身概率分布的一个“直接读数”。模型在生成正确和错误答案时,其内部的“犹豫”和“坚定”程度是真实存在的、且无法通过简单的模仿学习来伪造的。模型“肚子里”知道正确答案,比“嘴上”知道的要靠谱得多。
图4:Qwen2-VL在干净图片上的可靠性图
图4:Qwen2-VL在干净图片上的可靠性图。左图是言语化置信度,右图是内部置信度。可以看到,在干净图片上,两者的表现看起来一样好,都紧贴对角线。然而,它们的错误检测AUROC却相差0.4还多(0.49对0.92)。这张图有力地证明了,依赖校准误差(ECE)来评价置信度信号可能产生误导,一个近乎不变的信号也能表现得“看起来很准”,但实际毫无信息量。

弱光下双双失效:两种置信度信号的共同盲区

看到这里,你可能会想:“太好了,那我们以后就用内部置信度来闭着眼睛做决策就行了!”先别急,路还长着呢。这篇论文之所以让人印象深刻,不仅仅是因为它找到了一个更好的信号,更是因为它诚实地指出了“所有信号”的致命弱点:极度弱光。
当图片被施加了第三等级(最严重)的低光退化后,两个模型的表现都暴跌:
表3:严重低光下两个模型双双失效
表3:严重低光下,两个模型双双失效。Qwen2-VL的准确率从0.99跌到0.22(接近随机),内部置信度的AUROC也跌到了0.62。SmolVLM准确率从0.97跌到0.42,内之置信度的AUROC跌到了0.54(基本等于随机猜)。
这是整篇论文里最让人心凉的一个发现。在模型最需要“知难而退”的时候,在准确率一落千丈、几乎全靠蒙的情况下,无论是它嘴上说的(言语化置信度),还是它心里想的(内部置信度),竟然都还保持着“一切正常”的假象。准确率降了77个百分点,言语化置信度只降了不到3个百分点,内部置信度也只降了不到6个百分点。
这意味着什么?这意味着,任何只依赖模型自身置信度信号做“退避”决策的系统,在面对极度黑暗的图片时,都会陷入一种“无知又自信”的危险状态。它不是不知道,而是它“自以为知道”并且“知道错了”这件事,它自己根本不知道。

给从业者的建议:用内部概率做退避,别信口头自信

龙哥觉得,这篇论文最实在的地方,就是给出了非常具体、可操作的建议。它不是一篇高高在上的理论文章,而是一份务实的“小型VLM部署避坑指南”。
1. 不要相信模型说的话:在小模型上,言语化置信度基本就是废的。它要么是一个恒定值(如Qwen2-VL),要么根本问不出来(如SmolVLM)。千万不要傻乎乎地去问“你确定吗?”,然后基于它的回答来决定是否应用结果。
2. 使用内部置信度(平均Token概率)作为退避信号:对于大多数常见的图像退化(压缩、模糊、旋转、眩光等),内部置信度是一个几乎免费的、高性价比的误差检测器。它不需要额外的模型、不需要重新训练,只需在你用贪心解码(Greedy Decoding)生成答案的同时,顺便记录一下每一步的概率并求个均值就行了。在自己的系统中,计算这个信号的成本几乎为零,但能带来可靠得多的判断。
3. 在极端低光下,不要相信任何模型内部的信号:论文明确警告,在严重弱光条件下,无论是言语化置信度还是内部置信度都会失效。如果你的应用场景可能遇到极度黑暗的图片,那么就不要在模型下游设置任何基于置信度的安全阈值,而是应该在模型上游做好图像质量检查。先判断图片是否太暗,如果太暗,就直接拒绝处理,或者给出“图片质量过低,无法识别”的提示,而不是让模型去猜。
论文还尝试了一个补救措施:用温度缩放(Temperature Scaling)来校准置信度。结果如何呢?在大部分轻度退化下,温度缩放确实能让校准误差(ECE)好看很多。但在严重弱光下,温度缩放是“帮倒忙”的。因为它只是在重新分配一个已经近乎恒定的信号,完全无法“无中生有”地恢复那些丢失的判别信息。论文的结果表6也证实了这一点,严重低光下的校准误差从0.650恶化到了0.756。
表6:对Qwen2-VL的言语化置信度进行温度缩放的结果
表6:对Qwen2-VL的言语化置信度进行温度缩放的结果。注意严重低光(low_light s3)那一行,缩放后的校准误差(ECE after)从0.650暴跌到0.756,反而更糟了。这就是“在垃圾数据上做再多的数学变换也得不出金子”的最好例证。

实验限制总结:小样本、单任务,通用性待检验

这篇论文的实验设计非常工整,结论也很有启发性。但龙哥也必须带大家冷静地看看它的限制,不然直接拿去指导工业生产,可能会翻车。
首先,样本量太小了。每个条件下只有大约100个样本。这导致很多结果的置信区间非常宽,特别是SmolVLM模型的AUROC,很多区间跨度达到了0.3到0.4,使得这些结果“统计上不显著”。如果有更大的样本量,结论会更牢靠。
其次,任务太单一了。所有的测试都基于Food101数据集的四选一视觉问答。这个任务很简单,模型的表现波动也比较小。结论是否适用于更复杂的开放式视觉问答(Open-ended VQA)、图像描述生成或者其他领域,还是大大的问号。
第三,模型的规模太小了。测试的两个模型都是大约20亿参数的小模型。我们不知道随着模型参数规模的扩大(比如70亿、130亿甚至更大的模型),这个“言语化置信度”和“内部置信度”之间的鸿沟是否还会存在,或者会不会有所缩小。
第四,退化是合成的。虽然研究人员努力模拟真实的手机拍照效果,但毕竟不是真实场景中拍的照片。模型在真实低光照片上的表现可能和合成退化的表现有所不同。
最后,也是龙哥觉得最可惜的一点,论文没有研究拒绝回答行为。因为是多选题任务,模型必须给出一个答案。但在开放式场景下,模型可以说“我不知道”或者“我拒绝回答”。之前的研究发现,这种拒绝行为本身就是一种非常好的置信度校准机制。如果模型在不确定时能主动“拒绝”,那系统就多了一个安全阀。这篇论文的设计没法探索这一点,算是小小的遗憾。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问题1:什么是AUROC(Area Under the Receiver Operating Characteristic Curve,受试者工作特征曲线下面积)?为什么它是评估置信度信号最重要的指标?AUROC是衡量一个二分类器(比如“正确”vs “错误”)区分能力的综合指标,值越接近1越好。在本文中,它直接回答了一个关键问题:给定一个置信度分数,你有多大概率能正确地区分模型答对的样本和答错的样本?一个AUROC为0.5的置信度信号,意味着它判断正确还是错误的概率就跟抛硬币猜正反面一样。而AUROC为0.99的信号,则意味着几乎总能做出正确判断。对于需要决定“要不要相信模型”的退避系统来说,这个指标比校准误差(ECE)更直观、更实用。

问题2:论文说的“内部置信度(Internal Confidence)”具体怎么计算?需要额外的模型或推理吗?不需要。它的计算成本几乎为零。在每一次生成token的时候,模型内部已经计算好了所有候选token的概率分布。论文的方法只需要记录下实际被选中的那个token的概率,然后在生成完整个答案后,对这些概率求一个平均值即可。一般用贪心解码(Greedy Decoding)生成答案时,这个信息是现成的,不需要任何额外的模型或推理过程。

问题3:这篇论文的发现有多大实际意义?我能不能直接用在我们的产品里?龙哥觉得,这篇论文的发现非常有实际指导意义,但“直接套用”时要谨慎。在大多数常见的图像退化场景下,用内部置信度做退避信号确实比用言语化置信度靠谱一万倍。但论文的结论有其局限性(小样本、单任务、小模型)。如果你要把它用在自家产品里,建议:1. 在自己的数据集上做类似的验证,看看结论是否重现。2. 在系统入口处,增加一个独立的图像质量检测模块(如检测图像亮度、模糊度等),来主动捕获那些“太黑”的图片,而不是等模型去判断。因为论文已经证明,在极度黑暗的图片面前,所有模型内部的信号都不可靠。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

该工作的创新在于补全了一个“缺失的对比”:之前的研究因为使用闭源模型,无法获得内部概率,只能研究言语化置信度。这篇工作通过在开源模型上做实验,首次在同一预测上比较了言语化置信度和内部置信度,发现了它们之间的巨大鸿沟。这是一个“挖坑填坑”式的创新。

实验合理度:★★★★☆

实验设计非常工整。选择模型(小型开源)、数据集(Food101)、退化方法(常见的6种)、评价指标(AUROC优于ECE)都很有说服力。但样本量偏小(n≈100),导致部分结论的置信区间较宽,统计功效不足,略有遗憾。

学术研究价值:★★★★☆

论文提出了一个极具价值但之前被忽略的重要问题:模型能否在“自知犯错”时表达出来?这个问题对于模型安全(尤其是边缘计算场景)至关重要。它打开了一个新的研究方向:如何更好地从VLM中提取其内化的自我知识。

稳定性:★★★☆☆

结论在Qwen2-VL上非常稳定,但在SmolVLM上则显得很弱。言语化置信度的不可获取性以及内部置信度的较弱表现,说明了结果的模型依赖性很强。目前稳定性还不足以成为一个通用法则。

适应性以及泛化能力:★★★☆☆

仅在Food101数据集上的四选一问答任务上测试,未验证在开放式VQA、图像描述生成或其他领域的普适性。此外,退化是合成而非真实的,模型在真实世界环境中的泛化能力依然存疑。

硬件需求及成本:★★★★☆

实验所用的都是20亿参数级别的小模型,可以在免费T4 GPU上运行。内部置信度的计算几乎不需要额外的推理成本,因为它是从生成过程中直接提取的。对于资源受限的边缘设备来说,这是一个巨大的优势。

复现难度:★★★★★

论文提供了完整的代码、每个预测的CSV日志和所有图表,并且明确表示在一个免费的NVIDIA T4上就能在大约90分钟内复现整个实验。可复现性堪称典范,这一点必须给作者点赞。

产品化成熟度:★★★☆☆

该工作的结论可以直接指导实践,比如建议用内部置信度代替言语化置信度做退避决策。但其局限性导致它不能直接作为产品化的通用解决方案。它更是一个“诊断工具”或“设计指南”,而非一个可以直接嵌入产品的“模块”。特别是对于“极度黑暗”的边界情况,它给出了明确的负面结论,这本身就是非常有价值的安全设计指导。

可能的问题:论文的实验样本量和任务类型都过于有限,导致结论的泛化能力存疑。未能探索模型的拒绝回答行为,错失了一个很重要的安全机制。口语化置信度的提示模板敏感性可能需要更全面的消融研究。


主要参考文献

[1] Borszukovszki, M., de Jong, I.P., & Valdenegro-Toro, M. (2025). Know what you do not know: Verbalized uncertainty estimation robustness on corrupted images in vision-language models. arXiv:2504.03440.
[2] Xiong, M., et al. (2024). Can LLMs express their uncertainty? An empirical evaluation of confidence elicitation in LLMs. In ICLR.
[3] Tian, K., et al. (2023). Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback. arXiv:2305.14975.
[4] Ovadia, Y., et al. (2019). Can you trust your model’s uncertainty? Evaluating predictive uncertainty under dataset shift. In NeurIPS.
[5] Wang, P., et al. (2024). Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution. arXiv:2409.12191.
[6] Hugging Face TB. (2024). SmolVLM. https://huggingface.co/HuggingFaceTB/SmolVLM-Instruct
[7] Guo, C., et al. (2017). On calibration of modern neural networks. In ICML.
图1:两个模型在退化严重程度下的准确率变化
图1:两个模型在不同退化严重程度下的准确率变化。五类退化(压缩、模糊、眩光、旋转、重采样)对模型准确率影响不大,但低光(绿色线)让两个模型都逼近了随机猜测线(红色虚线)。
表4:Qwen2-VL-2B-Instruct在所有19个条件下的完整实验结果
表4:Qwen2-VL-2B-Instruct在所有19个条件下的完整实验结果。展示了每个条件下的准确率、言语化置信度和内部置信度的AUROC值及其自助法置信区间。
表5:SmolVLM-Instruct在所有19个条件下的完整实验结果
表5:SmolVLM-Instruct在所有19个条件下的完整实验结果。由于言语化置信度无法可靠获取(第5.3节),故只报告了内部置信度的相关结果。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想让你的小模型不再“嘴硬”?加入龙哥读论文粉丝群,一起探讨模型可靠性方法!扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。