← 返回 PaperDaily
视觉与图像
Kimi-VL等三大模型实测:给注意力头"调薪"后,推理更靠谱了
多模态大模型“一本正经地胡说八道”是落地最大痛点之一。这篇CVPR 2026论文把幻觉拆成“感知偏差”和“推理漂移”两类,用不到1%的额外计算找到该加强的注意力头,平均提分4.2%且完全无需训练,插拔即用,值得所有做多模态推理的团队收藏。
龙哥读论文
发布于 2026-08-23 00:20:08
阅读 4
查看原文
原论文信息如下:
多模态模型为何总在"睁眼说瞎话"?
先看一个让人哭笑不得的场景:你拿一张得克萨斯州选举地图问多模态大模型,它先一本正经地说"得克萨斯是红色的",然后基于这个错误前提推出"共和党赢得了得克萨斯"。问题是,图上明明得克萨斯是蓝色(民主党赢了)。这不是偶发事故,而是多模态大模型(MLRM,Multimodal Large Reasoning Model)的日常翻车。
更让人头疼的是,这种幻觉还挺难治。大多数现有方案都在"视觉侧"下功夫,比如加强视觉编码、加外部视觉先验、做更精细的对齐,但这些方法有一个共同的隐含假设——幻觉的根源主要是视觉信息没用够。
但北邮、南洋理工等团队发表在CVPR 2026的这篇论文,直接把这个假设给拆了。他们发现,幻觉的根源不只在"看不看得清",更在于模型内部注意力分配的结构性失衡——浅层太关注图像,深层太偏重文本推理,两者之间没有形成良性的接力。于是他们提出了一个极轻量的插件:功能头识别与条件缩放(Functional Head Identification and Class-Conditioned Rescaling),不训练、不改架构,平均提升4.2个百分点,额外计算不到1%。
简单说,这篇论文做的事情就是:给模型内部的"注意力头"做了一次体检,找出哪些头负责"看"、哪些头负责"想",然后把不称职的头稍微加一下权重。是不是听着有点像给团队调绩效?对,本质上就是这个逻辑。
有意思的是,这家伙从头到尾没有动过任何训练参数。模型还是那个模型,权重还是那些权重,只是推理时做了一点"实时调音",让该看图的头多看会儿图、该推理的头多使点劲。结果,幻觉就明显减少了。这背后的原理值得好好拆一拆。
注意力头的"分工"秘密:感知与推理的分层机制
要说清楚这个方法,得先从Transformer的注意力机制聊起。目前主流的多模态大模型,比如Kimi-VL、Ocean-R1这些,结构上基本是"视觉编码器+大语言模型"的组合。视觉编码器把图片压缩成视觉token,语言模型再把视觉token和文本token一起处理,最后生成答案。
但注意力层的内部,实际上是一群"注意力头"(attention head)在各自干活。每个头都维护着一张注意力权重矩阵,决定当前token要多少信息给图像、多少信息给文本。这一堆头分布在几十层深度上,各司其职。
近年的可解释性研究揭示了一个规律:Transformer内部存在一种分层的分工模式。浅层(靠近输入一侧)的注意力头更倾向于把注意力分配给视觉token,属于"感知型";深层(靠近输出一侧)的头则逐渐把注意力转移到文本token上,偏向符号化的推理,属于"推理型"。
为了量化这种分工,论文引入了一个层级抽象:定义两个边界ℓ_perc和ℓ_reas。ℓ_perc表示感知主导的最后一层,ℓ_reas表示推理主导的第一层。在感知层区间内,注意力偏向视觉token;在推理层区间内,注意力偏向文本token。
为了度量每个头对图像和文本的关注程度,论文计算每个头的"模态注意力比率"——也就是该头在全部查询位置上,分配给视觉token的注意力权重之和。这个比率越高,说明这个头越爱"看"图;越低,说明越爱"想"文本。
基于这个度量,就可以对每个头做"角色定位"了。论文设定两个阈值:τ_perc和τ_reas(τ_reas < τ_perc)。如果某个头位于浅层且视觉注意力比率高于τ_perc,就标记为"感知头";如果位于深层且视觉注意力比率低于τ_reas,就标记为"推理头"。两头不靠的,不标记,维持原样。
这个分层的直觉其实和人处理复杂任务的方式很像。先看清楚眼前有什么,再想清楚怎么推理。如果中间的"交接棒"出了问题,前面看错了,后面全盘皆输。
两大幻觉根源:感知偏差与推理漂移
基于感知-推理的分层结构,论文把幻觉的成因拆成了两类。第一类是感知偏差(Perceptual Bias)。当浅层感知头没有从图像中提取到足够的视觉证据时,模型对场景的"内部印象"就会偏离真实情况。简单说就是:看走眼了。
用户如果用公式来理解的话,感知偏差可以定义为感知层学到的表示与真实视觉特征之间的差距。论文的写法是:
第二类是推理漂移(Reasoning Drift)。深层推理头没能保持与前文证据的一致性,导致结论逐渐偏离已有的推理链条。翻译成人话就是:想到后面,把前面的前提给忘了,或者基于错误前提做了错误推导。
论文还做了一个很细致的统计:人工检查200个幻觉案例,发现感知偏差占约16%,推理漂移占约20%,两者同时出现约占10%。这三类加起来接近一半的幻觉都与阶段性的"分工失衡"有关,而不是单纯的视觉信息不足。
更关键的是,这两类问题会相互放大。感知偏差给推理链条塞了一个错误前提,推理漂移又让这个错误在后续的推导中被不断放大。最终,模型给出的答案不仅和图像对不上,甚至跟自己的推理过程都对不上。
用户看到这里可能会问:既然模型本身的注意力头已经有分工了,为什么还会错得这么离谱?论文给了一个很关键的观察:模型内部其实存在一些有能力承担感知或推理角色的注意力头,但它们当前不够"强势"。也就是说,这些头有能力,但话语权太低,被其他头的噪声盖过了。
看到没,这是真正的"怀才不遇"。而这篇论文要做的事情,就是把有能力的头给扶上位。
无需训练的"轻量手术":功能头识别与条件缩放
整个方法分两步走。第一步叫功能头识别(Functional Head Identification),就是给每个注意力头做"岗位评估"。具体来说,先计算每个头的视觉注意力比率S_v(h),即该头对视觉token的注意力权重平均值。这个值高,说明头偏"看";低,说明偏"想"。
然后结合层深度做"交叉筛选":浅层 + 高视觉注意力比率的,认定为感知头;深层 + 低视觉注意力比率的,认定为推理头。这个"深度感知边界"的设计非常关键——它避免了把深层高视觉注意率的头错判成感知头,也避免了把浅层低视觉注意力的头错判成推理头。
第二步叫条件缩放(Class-Conditioned Rescaling)。对识别出来的感知头和推理头,分别施加一个大于1的乘法增益g_perc和g_reas。感知头乘上g_perc(比如1.16),推理头乘上g_reas(比如1.30),其他头保持原样(增益为1)。就这么简单。
这个"在输出投影前乘增益"的操作,本质上是在残差网络中注入一个受控的"方向性扰动"。它改的不是注意力的权重,而是每个头对最终输出的"话语权"。感知头的话语权变大,浅层就会更扎实地提取视觉证据,缓解感知偏差;推理头的话语权变大,深层就能更稳定地保持推理链条,抑制推理漂移。
为什么这个"只调增益"的策略有效?论文在补充材料里给了理论分析。注意力头之间存在一种"话语权竞争",只有少数头会最终成为主导头(dominating heads),决定模型的推理走向。很多时候,真正对结果有决定性影响的头没有进入主导集合,反而是一些"噪声头"抢了话语权。通过给功能头乘上一个略大于1的增益,相当于给这些"潜力股"加了杠杆,让它们更容易在竞争中被选中。
这个思路其实有点像"选秀节目里的导师加分卡"——你没办法改变选手的实力,但你可以让有实力的选手多一次展示的机会。
还有一个细节值得注意:论文在超参数选择上做了大量扫描实验。他们评估了超过150种边界配置和24种缩放策略。结论很有意思:最优的边界配置和缩放因子的影响在很宽的范围内是稳定的,模型性能对超参数不是特别敏感。这是一个很好的信号,说明方法不需要针对每个模型精调,具备较强的实用价值。
实验结果:4.2%的全面提升与近乎零开销
论文的实验做得很扎实。他们选取了三个代表性的多模态推理模型:Kimi-VL、Ocean-R1和R1-Onevision,在五个基准测试上进行评估,涵盖数学推理、视觉推理和多模态整合三大类任务。基线方法包括VCD(对比解码)、CGD(CLIP引导解码)、AGLA(全局-局部融合)这三个知名的推理时幻觉缓解方案。
从表1可以看到一些非常明确的信息。以Kimi-VL为例,论文的方法在MathVista-mini上达到69.78%,比基线模型AGLA的67.32%高出2.46个百分点;在MathVision-mini上达到60.54%,比AGLA的58.88%高出1.66个百分点;在HallusionBench上达到68.19%的准确率和68.32%的F1,全面超越所有基线。
在Ocean-R1上的提升更加显著,在MathVision-mini上从vanilla的20.05%直接拉到26.01%,涨了近6个百分点。R1-Onevision上,MMStar上的F1从39.11%提升到40.94%。总体来看,论文的方法在约95%的评估指标上取得了最佳或第二好的表现,平均提升4.2个百分点。这已经算是相当能打的成绩了。
跟基线方法对比更有说服力。VCD、CGD、AGLA这些方法,有的需要采样多份对比答案、有的需要引入CLIP模型做外部引导,推理开销显著增加。论文的表4里给出了具体的推理时间数据:在HallusionBench的200个样本上,vanilla模型平均推理时间约101秒,论文的方法只增加了约2秒,而VCD等基线方法的总推理时间是原来的1.2到6.6倍。
注意看图3的效率对比——横轴是(Acc/AvgBatchTime)^2,同时考虑精度和速度。论文的方法在右上角区域,意味着在更高精度的同时保持更高的速度。这是一个"又快又准"的组合,非常难得。
消融实验也很有意思。论文对比了只放大感知头、只放大推理头、两者同时放大三种变体。结果显示,感知和推理的增益是互补的:单独放大感知头对视觉相关任务提升明显;单独放大推理头对需要复杂推理的任务帮助更大;两者同时放大则在所有任务上都表现最佳。这验证了感知偏差和推理漂移确实是两个独立且叠加的问题。
论文还做了边界扫描实验,看ℓ_perc和ℓ_reas这两个层边界对精度的影响。
图4展示了边界扫描的结果:最佳和最差边界设置之间性能差距达27.4%,但最优设置附近有一个相当宽的"平坦区",说明方法对边界的选择有一定的容忍度。缩放因子和阈值扫描(图5)也显示出类似的性质——最优值附近有一片稳定的高精度区域,模型的性能不会因为超参数的微小扰动而剧烈波动。这大大降低了实际部署时调参的成本。
此外,论文还提供了可解释性案例(贡献图对比),直观地展示了Vanilla模型和论文方法在注意力分布上的差异。以得克萨斯州选举地图的案例为例,Vanilla模型的注意力在第二个推理段落中变得分散,且错误地将得克萨斯感知为红色;论文的方法通过强化浅层感知头和深层推理头,注意力更加集中,最终正确感知得克萨斯为蓝色,并推断出民主党获胜。这种"感知—推理"的良性协作,正是论文方法的核心价值。
坦白说,这个效果已经超出了很多人的预期。一个不需要训练、不需要改架构、只需要在推理时多算一步注意力比率的小插件,能在三个模型、五个基准上全面超过那些需要多次采样或外部模型辅助的SOTA基线,性价比确实高。
可解释性干预的未来:从"黑盒"到"可控"
这篇论文最值得玩味的地方,不在于"提了4.2分"这个数字,而在于它揭示了多模态大模型内部一种可以被理解和干预的规律性结构。
长期以来,大模型被当作一个"黑盒":输入进去,输出出来,中间发生了什么没人说得清。但这篇论文和类似的可解释性研究正在改变这种认知。通过观察注意力头的模态偏好,我们可以知道每一层在做什么、哪些头在"看"、哪些头在"想"、哪一步出现了偏差。更重要的是,这种认知可以转化为实际行动——直接用增益调整去修正偏差。这已经远远超出了"事后解释"的范畴,进入了"主动干预"的层面。
论文提出的方法本质上是一种"推理时干预"。如果把模型比作一个乐团,训练阶段是给每个乐手发乐谱,推理时干预就是指挥家在演奏过程中给某个声部一个"再响一点"的手势。不需要重新排练,只需要一个信号,就能让整个乐团的演奏更协调。
这种"理解和干预"的路径,对比"更大的模型"或"更多的训练数据",提供了一条完全不同的改进思路。当模型规模达到一定程度后,继续堆算力的边际收益在递减。但如果我们能更精细地理解模型内部的工作方式,就有机会用极小的成本撬动明显的性能提升。这篇论文用4.2个百分点证明了这条路是通的。
当然,这篇论文的方法也还有值得继续探索的空间。比如,目前的功能头识别依赖于任务无关的模态注意力比率,如果遇到更复杂的跨模态场景,是否需要更精细的角色划分?又比如,增益是在所有层上统一施加的,是否可以根据不同层的特点做更细粒度的调节?这些都是可以继续深挖的方向。
但不管怎么说,一篇顶会论文能用这么简单的思路换来这么实在的效果,还是值得说一句:有点东西。
龙迷三问
这篇论文到底在解决什么问题? 针对多模态大推理模型的幻觉难题,本文提出免训练插件“功能头识别与类别条件缩放”:识别注意力头中负责感知与推理的两类功能头并放大其贡献,在三个主流模型、五个基准上平均提升4.2%,额外计算不足1%,无需重训与改架构。
这篇工作最值得看的点是什么? 在5个基准测试上平均提升4.2个百分点,在最具挑战性任务上提升达7%,在95%的任务上取得最佳性能
这篇工作的边界或风险在哪里? 优点:无需训练、即插即用、计算开销极小、可解释性强、在多个模型和基准上一致提升。缺点:需要手动选择超参数(层边界、阈值、增益),不同模型和任务需要调整;增益因子和阈值的选择对性能有一定敏感性;方法基于注意力模式分析,对注意力分布不清晰的模型可能效果有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
将幻觉分解为感知偏差和推理漂移两个互补的失败模式,并针对性地进行功能头识别与条件缩放,这是对推理时干预方法的一次有意义的重构。虽然不是完全从零到一的开创性工作,但在问题分析、方法设计和理论解释上形成了很好的闭环。
实验合理度: ★★★★☆
三个模型、五个基准、四个基线的配置相当扎实。表1的结果统计完整,还提供了标准差。消融实验做得也很细致,感知和推理增益的独立贡献都验证了。缺点是基线数量略少,如果能再对比一两个更新的推理时幻觉缓解方法就更完整了。
学术研究价值: ★★★★☆
这篇论文为"推理时干预"提供了一个清晰而有效的范式:先理解,再干预。它将注意力头的模态偏好与幻觉成因建立起因果联系,这种思路对其他类型的模型偏差(比如知识冲突、上下文遗忘)也有借鉴意义。理论分析部分虽然做了简化近似,但逻辑链条完整。
稳定性: ★★★★☆
方法在3个不同架构、不同规模的模型上表现出一致的改善,且超参数扫描实验显示性能对超参数不敏感,在最优值附近有一片宽泛的稳定区域。这说明方法的稳定性是比较好的。唯一需要注意的是,目前实验的推理长度和任务类型还有限,更复杂的长推理链场景下的行为有待进一步验证。
适应性以及泛化能力: ★★★★☆
方法不针对特定模型或任务,只需要能获得每层的注意力权重就行,适用于几乎所有基于Transformer的多模态大模型。实验覆盖了数学推理、视觉推理和多模态整合三大类任务,表现均衡。但要注意,这里评估的模型都是视觉语言模型,对纯文本模型或其他模态的适用性尚未验证。
硬件需求及成本: ★★★★★
训练阶段零成本,推理阶段只增加不到1%的计算量。论文给出的数据是:vanilla模型处理100个样本用时约101秒,本方法约103秒,只多了约2秒。对比VCD等方法1.2到6.6倍的推理时间开销,本方法的成本优势非常明显,普通GPU即可运行,甚至可以考虑在CPU上做实时干预。
复现难度: ★★★★☆
方法本身非常轻量,核心代码量估计几百行就能搞定。注意力权重的获取在HuggingFace框架下是现成的,增益的施加也只需要改一行代码。论文给出了完整的超参数配置(表5),照着设置就能复现。唯一的小障碍是论文没有提供官方代码仓库,需要自己实现。
产品化成熟度: ★★★★☆
推理时干预的设计非常适合产品化。可以封装成一个轻量插件,部署在模型服务层,按需启用。对于需要高可靠性的场景(比如医疗影像问答、法律文档审阅),这个插件可以作为一个"安全阀门",在不影响常规推理性能的前提下,显著降低幻觉率。如果能在更多业务场景中验证其泛化性,产品化前景非常好。
可能的问题: 论文的幻觉成因统计(感知偏差16%、推理漂移20%)基于200个案例的人工标注,样本量偏小,统计置信度有限。此外,方法中的超参数虽然观察到了"平坦区",但四个超参数的最佳组合仍需要先验实验来确定,在全新模型上应用时,这部分"探索成本"并没有被计入总开销。
主要参考文献
[1] Lu H, Chu B, Fu W, et al. Reallocating Attention Across Layers to Reduce Multimodal Hallucination[C]//CVPR 2026. arXiv:2510.10285.
[2] Leng S, Zhang H, Chen G, et al. Mitigating Object Hallucinations in Large Vision-Language Models via Visual Contrastive Decoding[J]. arXiv:2311.16922, 2023. (VCD)
[3] Li Y, Du Y, Zhou K, et al. Evaluating Object Hallucination in Large Vision-Language Models[C]//EMNLP 2023. (POPE)
[4] Guan T, Liu F, Wu X, et al. HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models[C]//CVPR 2024.
[5] Chen Z, Zhang J, et al. AGLA: Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention[J]. arXiv:2411.10940, 2024. (AGLA)
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
多模态幻觉怎么破?与其瞎猜,不如来龙哥读论文一起拆解顶会最新思路!🤘
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群