← 返回 PaperDaily 视觉与图像

幻觉检测最新方案!Pearson 0.413+干净IoU 91.3%,速度还快120倍

多模态大模型天天一本正经地胡说八道,怎么精准揪出幻觉片段还给出靠谱置信度?这篇论文把判别式标注器和生成式VLM拧成一股绳,Pearson 0.413、干净响应IoU超91%,推理还快120倍,值得一读。

幻觉检测最新方案!Pearson 0.413+干净IoU 91.3%,速度还快120倍
原论文信息如下:
论文标题:
SpanCalib-VLM:视觉语言模型中经过校准的幻觉跨度检测
发表日期:
2026年08月
发表单位:
Shaggar Institute of Technology, Trinity College Dublin
原文链接:
https://arxiv.org/pdf/2608.29974v1.pdf
## 幻觉检测的困境:快而准还是慢而稳? 多模态大模型(LVLM)是近年最火的方向之一,GPT-4V、Qwen-VL、MiniCPM-V这类模型在视觉问答、图像理解等任务上确实很强。但有一个老毛病始终没根治——视觉幻觉:明明图中没有的人,模型能一本正经地描述他的表情;明明是红色的消防车,模型非说成绿色的。更麻烦的是,这些幻觉往往出现在看起来非常流畅自然的句子里,普通用户很难察觉。 为了系统性地解决这个问题,学界举办了一个叫SHROOM-Visions的共享任务,要求参与者做两件事:第一,找出LVLM响应中所有幻觉片段的字符级边界;第二,对每个片段给出一个概率分数,这个分数必须和人类标注者的共识程度吻合。第一个任务考察定位精度(用IoU交并比衡量),第二个任务考察校准质量(用皮尔逊相关系数衡量)。 要想同时做好这两件事,并不容易。现有方法大体分两个流派: 第一个流派是生成式VLM微调。思路很简单:拿一个Qwen这样的多模态大模型,在带标注的幻觉数据上做监督微调,让模型输出结构化的跨度标注。优点是能用大模型的推理能力精确定位跨度,召回率相对高;缺点是生成式模型天生过度自信,给出的概率分数不可靠,而且推理极慢——开了思维链的Qwen处理一个样本要23秒。 第二个流派是判别式序列标注。用一个类似XLM-R的编码器做token级分类,单次前向传播就能给出所有token的幻觉概率。优点是非常快,而且分数天然比生成式模型的概率校准得好;缺点是边界判定保守,容易漏掉那些隐晦的幻觉。 一个快而糙,一个慢而精。能不能两个都要?这篇论文提出的SpanCalib-VLM,正是冲着这个目标去的。 ## SpanCalib-VLM:双系统协同的混合架构 SpanCalib-VLM的设计灵感来自认知科学中的双过程理论:系统1负责快速、直觉、自动化的判断,系统2负责慢速、深思、逻辑化的推理。在幻觉检测场景中,判别式标注器扮演系统1,快速给出每个token的校准概率;生成式VLM扮演系统2,深思熟虑地提出候选跨度。最后通过一个叫Union-Calibrated Fusion的融合算法,把两个系统的优势拼在一起。 图1给出了整体架构:
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
这篇工作的边界或风险在哪里?优点:(1) 混合双系统设计巧妙结合了判别式模型的校准优势和生成式模型的跨度召回优势;(2) Union-Calibrated Fusion策略有效提升整体性能;(3) 推理速度快,适合实际应用。缺点:(1) 幻觉样本IoU仍较低(0.196),字符级边界定位精度不足;(2) 512 token输入限制导致长响应中的幻觉无法检测;(3) 超参数主要基于英语验证集优化,跨语言泛化可能受限;(4) 无法检测两个子系统都遗漏的幻觉。
这篇工作最值得看的点是什么?SpanCalib-VLM在英语验证集上取得最高Pearson相关系数(0.413)和总体IoU(0.391),干净响应IoU达0.913,检测准确率70.7%。在中文上表现最佳(IoU 0.437),在法语和意大利语上幻觉IoU提升显著(+0.182和+0.180)。
这篇论文到底在解决什么问题?SpanCalib-VLM提出混合双系统架构,结合判别式序列标注器与生成式VLM,通过Union-Calibrated Fusion策略在SHROOM-Visions任务上实现Pearson相关性0.413、整体IoU 0.391
下面是龙哥对于大家可能的一些问题的解答:

龙迷三问


可能的问题:(1) 幻觉样本IoU仍较低(0.196),字符级边界定位精度不足;(2) 512 token输入限制导致长响应中的幻觉无法检测;

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

复现难度:★★★☆☆

https://github.com/amanuelgizachew/SpanCalib-VLM

硬件需求及成本:★★★☆☆

System 1推理速度5.25样本/秒(0.19秒/样本),比标准Qwen推理快4.5倍,比链式思维模式快120倍。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

学术研究价值:★★★★☆

提出SpanCalib-VLM混合双系统框架,将多模态序列标注器(XLM-RoBERTa-Large + SigLIP-2交叉注意力)与微调生成式VLM(Qwen3;更关键的是问题定义是否可复用到同类任务。

实验合理度:★★★★☆

Pearson校准相关系数、总体IoU、幻觉样本IoU、干净响应IoU、检测准确率。

论文创新性分数:★★★★☆

提出SpanCalib-VLM混合双系统框架,将多模态序列标注器(XLM-RoBERTa-Large + SigLIP-2交叉注意力)与微调生成式VLM(Qwen3.

龙哥点评


主要参考文献

图1 SpanCalib-VLM整体架构
SpanCalib-VLM整体架构。系统1(判别式标注器)产生校准的token概率;系统2(生成式VLM)提出候选跨度;Union-Calibrated Fusion将两者融合为最终预测。
先看系统1。文本侧使用了XLM-RoBERTa-Large,这是一个24层的多语言Transformer编码器,隐向量维度为1024。输入采用"Question: T_p \nResponse: T_r"的模板拼接,T_p是引导LVLM生成答案的提示词,T_r是待检测的模型响应,最大序列长度设为512个token。 视觉侧使用了SigLIP-2视觉编码器,将图像切分为196个patch,每个patch输出768维的特征,再经过一个线性投影层映射到1024维的文本隐空间。这里有一点值得注意:视觉特征并不是直接拼接到文本序列中,而是通过交叉注意力机制融合。融合的公式如下: 公式1 交叉注意力融合
公式1:H_fused = LayerNorm(H_text + Softmax(QK^T/√d_h) U)。Q和K是文本表示经线性变换得到的查询与键,U是视觉特征的投影,d_h是隐向量维度。每个文本token去"看"图像中最相关的patch区域,再把视觉信息加权融合回文本特征。
融合后的特征会送入三个并行任务头:

跨度分类头:一个两层MLP加sigmoid激活,输出该token属于幻觉跨度的概率,负责定位。

概率校准头:一个两层MLP加sigmoid激活,输出一个0到1的校准分数,这个分数的学习目标是人类标注者判断该token为幻觉的共识比例,负责校准。

类别分类头:一个两层MLP加softmax,把幻觉分成五个错误类型,作为一个辅助任务帮助编码器学到更丰富的语义边界。

三个任务头联合训练,总损失函数如下: 公式2 多任务损失
公式2:L = L_BCE(ŷ, y) + λ₁·L_MSE(p̂, p) + λ₂·L_CE(ĉ, c)。其中L_BCE是二分类交叉熵损失,监督跨度定位;L_MSE是均方误差损失,直接监督校准分数;L_CE是交叉熵损失,用于错误类型分类。权重λ₁=1.0,λ₂=0.5。
MSE校准loss是这套设计中比较关键的一环。传统校准方法是温度缩放、Platt缩放这类后处理技术,只是全局调整logit的置信度,难以捕捉token级的不确定性差异。而这里用MSE回归头,让模型直接学习输出与人类标注者共识对齐的token级分数,从训练源头解决校准问题。这个方法概念简单,但非常有效,消融实验显示去掉它Pearson下降0.095。 再来看系统2。系统2是生成式VLM,具体选了Qwen3.5-4B作为基座,用SHROOM-Visions的训练数据做了监督微调(SFT),让它学会输出结构化的JSON格式跨度标注。微调采用LoRA(秩为16,α为16),学习率2e-4,训练3个epoch,最大序列长度2048。系统2的优点是定位召回高,缺点是概率输出未校准,而且慢。 训练数据是SHROOM-Visions数据集,共2万个样本,覆盖英语、法语、意大利语和中文四种语言,每语言5000条。数据划分如下: 表8 数据集划分
SHROOM-Visions数据集各语言样本数,包含90%训练集、10%验证集和未标注测试集,总计20000条。
最后用一张信息总结表来概括整个方法的核心要素:
*表格超出部分左右可以滑动 Table 1: Performance on the SHROOM-Visions English validation split. Our full hybrid system (SpanCalib-VLM) achieves the highest Pearson calibration correlation and overall IoU, outperforming standalone baselines and individual subsystems across all metrics at optimal decision thresholds.
Table 1: Performance on the SHROOM-Visions English validation split. Our full hybrid system (SpanCalib-VLM) achieves the highest Pearson calibration correlation and overall IoU, outperforming standalone baselines and individual subsystems across all metrics at optimal decision thresholds.
## Union-Calibrated Fusion:校准与召回的完美平衡 两个系统单打独斗都有局限:系统1校准好但边界保守,系统2召回高但分数不可靠。Union-Calibrated Fusion算法解决问题的办法是"取长补短"。算法的名字里有两个关键词:Union(并集)和Calibrated(校准)。意思是,把系统2提议的候选跨度当作一个空间提案,再用系统1的校准概率为提案打分。 具体分三步: 第一步,从系统2的JSON输出中提取候选跨度,转成字符级的二值掩码。掩码在每个位置上取值0或1,1表示系统2认为这里可能是幻觉。 第二步,将系统1在token级别的概率,通过subtoken偏移对齐映射到字符级数组。 第三步,按公式3计算融合分数: 公式3 融合分数
公式3:P_ens(k) = w₁·P_SC(k) + w₂·M_VLM(k)。P_SC(k)是系统1在字符位置k的校准概率,M_VLM(k)是系统2在位置k的二值掩码,权重w₁=0.55,w₂=0.45,由验证集网格搜索确定。
为什么系统1的权重更高?因为系统1的校准基线更好(Pearson 0.369 vs 0.285),把它的概率作为分数主体,能保证最终分数仍然校准良好;系统2的掩码只负责把候选跨度内的分数拉高,相当于一个"空间先验",不引入数值噪声。这个设计还有一个巧妙之处:用二值掩码而不是系统2的原始概率,避免了生成式模型未校准分数对融合结果的污染。 效果如何?英文验证集的表现如下: 表1 英文验证集性能
SHROOM-Visions英文验证集性能。完整混合系统SpanCalib-VLM在皮尔逊校准相关性和总体IoU上取得最高分,在最优决策阈值下全面优于独立基线和各子系统。
数据已经说明问题:完整融合系统的Pearson达到0.413,总体IoU 0.391,干净响应IoU 0.913,检测准确率70.7%;单独系统1的Pearson是0.369、IoU 0.326;单独系统2的Pearson只有0.285、IoU 0.375;BLIP基线Pearson只有0.124。 干净响应IoU达到0.913,说明对于完全没有任何幻觉的响应,系统有91.3%的概率不产生误报。这对实际应用极为重要,因为内容审核场景中误报会造成大量人力和时间浪费。 消融实验也验证了融合策略的合理性。如果把Union替换为加权平均,Pearson从0.413掉到0.381;如果用交集(只保留两个系统都标记为幻觉的部分),Pearson只剩0.352。并集提案加校准打分这种"取并再校准"的思路,确实比简单平均或取交集都更有效。 ## 跨语言表现:中文为何最优? SHROOM-Visions是典型的多语言任务,除了英语还有法语、意大利语和中文。在官方盲测测试集上: 表2 官方测试集结果
官方共享任务测试集盲测结果:SpanCalib-VLM(SIT)与任务官方基线在四种语言上的对比。
可以看到SpanCalib-VLM在所有语言、所有指标上都大幅超过任务基线。英语的IoU从基线0.1549提升到0.2549,中文的IoU从0.2554提升到0.3425,意大利语的Cor相关从0.1635提升到0.3832。 细看验证集上的详细对比: 表7 跨语言详细性能对比
跨语言详细性能对比,比较基础零样本Qwen模型与SpanCalib-VLM在英语、法语、意大利语和中文评估集上的表现。
一个很亮眼的现象是中文的表现。系统1单独在中文验证集上取得了0.437的总体IoU和0.958的干净IoU,比基础Qwen模型(总体IoU 0.268)高了约0.17个点。为什么在中文上优势这么大? 论文给出的解释是分词粒度的差异。中文是表意文字,一个汉字就是一个语义单元,token与字符边界的对齐天然紧密,subtoken偏移映射的误差很小,所以跨度定位特别干净。而在英语、法语、意大利语这类以空格分隔的拼音文字中,一个token可能对应多个字符,对齐过程中容易产生边界偏移。 meng表情包 法语和意大利语的表现同样值得注意。基础Qwen模型在这两种语言上对幻觉跨度的IoU几乎失效(法语0.020,意大利语0.027),而SpanCalib-VLM的系统1直接拉到0.202和0.207。这说明判别式标注器在多语言上的迁移能力比预训练生成模型更稳定,即使训练数据占比不大,它也能学到较鲁棒的跨语言幻觉模式。 ## 速度与精度兼得:推理效率分析 幻觉检测要落地,推理速度是关键。论文在NVIDIA A40(48GB)上做了实测: 表4 推理延迟对比
NVIDIA A40(48GB)上的推理延迟(秒/样本)和吞吐量(样本/秒)。
系统1每条样本只花0.19秒,每秒处理5.25条;标准Qwen推理需要0.85秒,每秒1.18条;而开了思维链的Qwen直接爬行——23.10秒一条,每秒0.04条。系统1的速度是标准Qwen的4.5倍,是链式思维Qwen的120倍。 这个速度优势意味着,在生产环境中可以只部署系统1作为实时检测器;如果对召回率有更高要求,再叠加系统2的候选跨度,整体耗时也远小于纯生成式方案。 另一个工程友好特性是阈值稳定性: 表3 阈值网格搜索
集成系统的阈值网格搜索。在τ=0.25到0.45的范围内,IoU稳定保持0.391,检测准确率70.7%。
在τ=0.25到0.45的范围内,IoU稳定保持0.391,检测准确率保持70.7%。论文揭示了原因:融合分数分布是双峰的,在系统2提议跨度内的字符分数整体很高,跨度外的字符分数整体很低,决策边界附近的样本很少。这意味着部署时不需要费力精调阈值,随便选中间值就能有稳定表现。 训练动态方面,验证集Pearson在第2个epoch达到峰值0.369,后续epoch训练损失继续下降但验证损失开始抬头: 表9 训练历史
SpanCalib-VLM(多模态系统1)的训练历史。验证集Pearson在第2个epoch最高,之后出现轻微过拟合。
这说明5个epoch对于这种规模的数据是合适的,也提醒我们在训练时要用验证集指标选checkpoint而不是盲目训练更久。 消融实验进一步明确了每个组件的贡献: 表10 消融实验
消融实验结果。
关键结论有三条:MSE校准损失是最关键的组件,移除后Pearson从0.413降到0.318;视觉塔SigLIP-2带来的增益较小(IoU仅+0.003),说明文本信息已经提供了大部分幻觉线索;Union-Calibrated Fusion的并集机制比加权平均和交集都好。 ## 局限与展望:幻觉检测的下一步 论文没有回避问题,列出了几个比较实在的限制: 第一,误报复杂正确语言。对于措辞复杂、含有习语或冷门但正确的视觉细节描述,系统1容易产生误报。这暴露了判别式模型依赖表层分布模式而非深度视觉理解的弱点。 第二,512 token的输入上限。对于长响应,超过截断位置的幻觉完全检测不到。多模态对话场景中响应动辄上千token,这个限制是落地的一个硬伤。 第三,幻觉跨度IoU只有0.196。定位任务的大头——具体到字符级边界的精确判定,准确率还远不够理想,是后续改进空间最大的方向。 第四,超参优化偏向英文。模型的融合权重、阈值等关键超参主要在英文验证集上调优,其他语言性能还有提升空间。 第五,系统天花板受限于两个子系统的并集。如果系统1和系统2都漏了某个幻觉,融合无法"凭空发明"被遗漏的检测。 展望未来,以下几个方向比较值得关注:把输入长度扩展到2048配合滑动窗口;引入条件随机场等边界优化手段提升字符级定位能力;探索更轻量的视觉融合方式,毕竟视觉塔增益有限;在实际部署中考虑"系统1-only"模式处理高吞吐场景,混合模式处理高精度场景。 ## 龙迷三问
下面是龙哥对于大家可能的一些问题的解答:

SHROOM-Visions任务到底要解决什么问题?它要求系统输入一张图片、一个提示词和一个LVLM响应,输出响应中所有幻觉片段的字符级边界,以及每个片段被判定为幻觉的概率分数。评价时既看边界定位准不准(IoU),又看概率分数与人类标注者共识的吻合程度(Pearson相关性)。

什么是模型校准?为什么校准很重要?校准是指模型给出的概率分数与真实频率的一致性。比如模型说某个跨度有80%概率是幻觉,那么在所有类似的判断中,实际约有80%确实应该是幻觉。如果模型对非幻觉内容也给出99%的分数,那这个模型就是过度自信,不可信任。在幻觉检测这种高风险场景里,校准质量直接决定了系统的可用性。

Union-Calibrated Fusion中的权重w₁和w₂怎么定的?论文在验证集上做了网格搜索,最终选定w₁=0.55,w₂=0.45。系统1权重略高是因为它的校准基线更好,以它为主能保证融合后的分数仍然校准良好;系统2的二值掩码只提供空间位置信息,不参与分数数值的制定,因此不会把未校准的噪声引入融合分数。

## 龙哥点评

论文创新性:★★★★☆

双过程认知理论在幻觉检测中的落地,判别式校准加生成式提案的混合架构设计巧妙,有较强的范式启发意义。

实验合理度:★★★★☆

基线和消融对比全面,阈值扫描、跨语言分析、训练历史、推理延时都有覆盖,实验严谨;超参偏英文是主要扣分项。

学术研究价值:★★★★☆

MSE回归头直接监督token级校准的做法简洁有效,对后续多模态幻觉检测工作有较高参考价值。

稳定性:★★★☆☆

融合分数双峰分布带来宽阈值安全区,系统稳定;但512 token截断和幻觉跨度IoU较低限制了实际稳定性。

适应性以及泛化能力:★★★★☆

四个语言均有验证,中文表现突出,跨语言迁移能力优于纯生成式方案;不过复杂正确文本误报问题仍需解决。

硬件需求及成本:★★★☆☆

训练需要A40级别GPU,Qwen3.5-4B规模不小;推理端系统1单条0.19秒尚可接受,但模型总资源占用偏高。

复现难度:★★★★★

模型权重、代码和评估数据全部开源,训练配置详尽,这点做得非常厚道。

产品化成熟度:★★★☆☆

用于内容审核、辅助标注、幻觉监控等场景有较好的基础,系统1单独部署够快;但字符级边界精度和长文本支持仍需加强。

可能的问题:幻觉跨度IoU仅0.196,字符级边界定位是明显短板;视觉塔增益仅+0.003 IoU,需要进一步验证视觉融合模块是否被充分利用。

[1] Mickus, T., et al. SemEval-2024 Task 6: SHROOM, a shared-task on hallucinations and related observable overgeneration mistakes. In Proceedings of SemEval-2024.
[2] Vazquez, R., et al. SemEval-2025 Task 3: Mu-SHROOM, the multilingual shared-task on hallucinations. In Proceedings of SemEval-2025.
[3] Conneau, A., et al. Unsupervised cross-lingual representation learning at scale. In ACL 2020.
[4] Zhai, X., et al. Sigmoid loss for language image pre-training. In ICCV 2023.
[5] Yang, A., et al. Qwen3 technical report. Preprint, arXiv:2505.09388.
## 融会贯通 结合PaperDaily已收录论文可观察到,在幻觉检测这一任务上,生成式方案的校准难是普遍痛点。本文给出的"判别式校准加生成式提案"融合思路,在SHROOM-Visions这一特定评测上取得了显著的组合增益,为后续研究提供了值得借鉴的范式。 一个值得关注的趋势是,幻觉检测正在从"找出错误"升级为"衡量不确定性"。本文的MSE校准头实际上是在做细粒度不确定性建模,这与先前一些多模态幻觉研究的方向形成了呼应。把置信度校准和跨度定位联合起来训练,可能是幻觉检测走向实际应用的关键一步。 论文在中文验证集上的优势表现(总体IoU 0.437,干净IoU 0.958)提示跨语言分词粒度对跨度检测影响显著,这对面向多语言场景的幻觉检测系统有直接参考价值。 需要注意的是,以上观察仅基于PaperDaily已收录论文的范围,并非SHROOM-Visions官方榜单的完整排名。不同团队在测试集划分、后处理策略、评价细节上可能存在差异,具体结果应以官方发布为准。
end
AI幻觉无处藏,双系统融合来帮忙!想和龙哥一起追踪多模态大模型最新进展?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 多模态+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,快来找到你的组织~
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。