← 返回 PaperDaily 视觉与图像

CVPR 2026新作CIGMA:剪掉“坏头”,ViT背景依赖直降88%

这篇论文最有意思的地方,不是“又做了一个剪枝”,而是把ViT到底在看什么这件事,往因果层面往前拽了一步。它不靠重训,直接定位并切掉那些专门走背景捷径的注意力头,思路很狠,实验也够硬。

CVPR 2026新作CIGMA:剪掉“坏头”,ViT背景依赖直降88%
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是“又做了一个剪枝”,而是把ViT到底在看什么这件事,往因果层面往前拽了一步。它不靠重训,直接定位并切掉那些专门走背景捷径的注意力头,思路很狠,实验也够硬。


原论文信息如下:
论文标题:
CIGMA: Causal Information-Gain Mechanistic Attribution of Attention Heads in Vision Transformers
发表日期:
未找到日期
发表单位:
University of Oklahoma
原文链接:
https://openaccess.thecvf.com/content/CVPR2026/papers/Maliha_CIGMA_Causal_Information-Gain_Mechanistic_Attribution_of_Attention_Heads_in_Vision_CVPR_2026_paper.pdf
开源代码链接:
原文提到“our code is available here”,但当前材料未给出具体链接

引言

这篇论文盯上的不是“模型准不准”,而是一个更扎心的问题——模型到底是不是在看该看的东西。很多ViT和大视觉语言模型在分类时,表面上答对了,实际却可能偷偷靠背景“抄答案”。比如把一只鸟认成某类,不一定是因为鸟本身,而是因为树枝、天空、草地这些背景太像“标准答案”了。
一旦场景换了,背景没了,模型就容易当场“翻车”。很多剪枝方法只关心算力和准确率,像是把一个学生的错题本撕了几页,成绩可能没掉太多,但到底错在哪儿还是不知道。CIGMA 就是来补这个洞的:它不只问“能不能剪”,还问“该剪哪几个头,才能把背景捷径连根拔起”。
封面
图1:背景影响比例对比。CIGMA 的 BIR 最低,说明它最少依赖背景线索;别的方法虽然也在做剪枝,但很多时候只是“少算一点”,并没有真正把背景捷径处理掉。
这篇工作最有意思的地方在于,它把“解释模型”这件事从看热力图,往前推到因果层面。不是只看某个注意力头“好像在看背景”,而是直接把它切掉,再看模型行为到底变没变。要是变了,而且背景依赖明显下降,那这个头大概率就是“坏头”;要是没啥变化,那它可能没那么重要。

方法概述

CIGMA 的全称是 Causal Information-Gain Mechanistic Attribution,中文可以理解成“基于因果信息增益的机制归因”。名字听着有点学术,但拆开看其实很朴素:先找出模型真正依赖的前景区域,再比较“去掉前景”和“去掉背景”后预测变化有多大,最后把这些变化追到每一个注意力头上。
图2:CIGMA整体流程图
图2:CIGMA 的整体流程。先自动找前景掩码,再算前景/背景的信息增益,最后对每个注意力头做因果干预,找出最“爱走背景捷径”的那一批头。
第一步是自监督找前景掩码。这里没有用人工标注分割框,而是让模型自己去“猜”哪些像素最关键。做法也不复杂:在低分辨率掩码上优化,让保留下来的区域尽量维持原始预测,同时尽量让掩码面积小、形状连续。这样得到的掩码,实际上就是模型自己认定的“证据区域”。
公式:保留前景的构造方式
公式1:保留前景的图像构造方式。掩码为1的地方保留原图,掩码为0的地方用一个“中性背景”替换。这样模型看到的就不是完整图片,而是“只留证据、其余打码”的版本。
第二步是信息增益度量。论文这里用了 Jensen-Shannon divergence,简称 JS 散度。它的好处是对称、稳定。直白点说,就是拿原始预测分布和编辑后的预测分布做比较,看模型到底被哪部分信息“拽着走”。
公式:JS散度
公式2:JS 散度。它衡量两个预测分布之间的差异,数值越大,说明去掉某部分信息后,模型“想法变了很多”。
公式:前景与背景信息增益
公式3:前景信息增益 FIG 和背景信息增益 BIG。FIG 看去掉前景后预测变多少,BIG 看去掉背景后预测变多少。前者大,说明模型确实需要前景;后者大,说明模型对背景也很上头。
第三步才是重头戏:头级别因果扫描。ViT 不是只有一个大脑,而是一堆多头注意力机制在分工协作。CIGMA 的思路很狠:把某个注意力头单独关掉,观察背景信息增益 BIG 会不会明显下降。下降越多,说明这个头越可能在给背景捷径“搬砖”。
公式:CIGMA评分
公式4:CIGMA 评分。它统计“删掉某个头以后,背景依赖平均少了多少”。分数越高,这个头越像背景通道里的“主犯”。
公式:spurious heads集合
公式5:最终得到的 spurious heads,也就是“坏头集合”。论文做的不是把全模型粗暴砍掉,而是只切掉这一小撮最会传背景信号的头。
这套流程的妙处在于,它不是“看起来像解释”,而是真的做了干预。很多可视化方法只能说“这里亮了”,但亮不亮不等于重要不重要。CIGMA 直接改模型结构,测行为变化,这就比单纯热力图更接近因果。

核心原理推导

核心原理已在上文方法概述中结合公式推导说明,此处不再赘述。简言之,CIGMA通过自监督掩码、JS散度信息增益和头级别因果干预三步,实现了对背景依赖头的精准定位与剔除。

实验结果

实验部分核心问题就三个:准确率有没有涨背景依赖有没有降模型是不是更稳。论文在 CIFAR-10、CIFAR-100 和 Tiny-ImageNet 上做了对比,模型覆盖 InternVL2-26B、LLaVA-1.6 和 LLaVA-1.5-13B,把不同规模、不同训练配方都试了一遍。
表1:零样本/训练免费结果
表1:零样本、无需重训的结果对比。CIGMA 在多个数据集和骨干上都同时把准确率拉高、把 NLL/ECE 压低、把 BIR 明显打下来。
零样本结果里,CIGMA 的表现有点“离谱但合理”。它不是把模型剪瘦以后换来一点点效率,而是直接把原模型里那些误导性的背景通道砍掉,结果准确率反而上去了。论文报告的提升幅度在不同设置下能达到 7.6 到 24.8 个百分点,背景依赖则下降了约 79.5% 到 88.1%。这说明它不是“少看了所以少错”,而是“少看了垃圾线索,所以更会答题”。
图3:剪掉坏头前后预测与热力图对比
图3:剪掉 CIGMA 识别出的坏头前后,模型关注区域从背景转向前景,预测也更可靠。注意力真的从草地、墙面、树枝这些地方挪回到了目标本体。
更值得注意的是,很多对照方法并没有把问题解决,甚至有些方法会让 BIR 更高,等于“为了省算力,顺手把模型带沟里去了”。这篇论文比较硬气的地方在于,它没有只报一个漂亮的准确率,而是把 NLL、ECE、BIR 一起拿出来,逼着大家看完整结果。
表2:训练后结果对比
表2:在允许微调的情况下,CIGMA 依然保持优势。说明它不是只能在“冻结权重的理想环境”里工作,而是可以和已有训练流程叠加使用。
训练后结果更说明问题。很多学习式去偏方法在这组实验里并没有压过原始微调模型,甚至有些还不如原模型本身;CIGMA 却能在微调后继续把准确率往上推,同时把背景依赖压下去。换句话说,它不是和训练抢饭吃,而是给训练补了一刀“纠偏手术”。
图1:背景影响比例对比
图1再次强调一个关键事实:CIGMA 的 BIR 远低于其他方法,说明它不是“剪得更狠”,而是“剪得更准”。
从实验设计上看,这篇工作也比较讲究。它先用真阳性样本做分析,避免把“本来就错了”的样本混进来扰乱判断;再用三套骨干、三套数据集、两种实验范式交叉验证,最后还报告三次独立运行的平均值。这样的设置,至少说明作者不是拿一组 demo 图来讲故事,而是在尽量证明规律是稳定存在的。

实验结果分析

虽然主实验是在通用分类数据集上做的,但论文还给了一个很有说服力的可视化案例:脑部 MRI 肿瘤检测。这类任务最怕模型盯着边缘、噪声、扫描伪影看半天,最后把真正病灶晾在一边。医学场景里,这可不是“答错一道题”那么简单,而是可能直接影响诊断可靠性。
图4:医学图像与消融实验
图4(a):脑部 MRI 案例中,基线模型有时会把注意力放到背景上,CIGMA 之后热力图会明显收回到病灶区域。图4(b):在 Tiny-ImageNet 上,剪掉的坏头数量不是越多越好,K=16 附近效果最好,说明“精准切除”比“暴力大砍”更重要。
这个案例特别能说明 CIGMA 的现实意义。它不是只在自然图像上“看起来不错”,而是能把模型的关注点往真正有意义的区域拉回去。对医学影像、自动驾驶、工业质检这类场景来说,这种“看对地方”往往比单纯多涨 0.5 个点更值钱,因为它关系到系统能不能被信任。

总结与未来展望

这篇论文最值得肯定的地方,是它把“剪枝”从一个纯效率问题,提升成了一个可验证的因果解释问题。传统方法常常是在“少算一点”和“尽量不掉点”之间打转,而 CIGMA 直接回答:哪些头在帮模型走背景捷径,删掉它们以后,模型会不会更像在认真看图。
它的优点也很明确:不需要重训能定位到头级别能同时改善准确率与校准,而且实验跨度还不小。对资源有限、又不想大动模型参数的场景,这种方法很有吸引力。
但局限也不能回避。首先,它依赖先找到一批“真阳性”样本来做分析,样本选择会影响坏头排序;其次,掩码是通过优化得到的,虽然不需要人工标注,但仍然带有方法假设;再者,当前结果主要集中在分类和部分 VLM 场景,遇到更复杂的开放式推理、多目标任务时,坏头是否还能稳定定义,还需要更多验证。说白了,这方法已经很能打,但还没到“所有场景通吃”的程度。
如果把这篇工作的意义放到更大的图景里看,它其实在提醒一个很朴素的道理:模型不是越会“猜”越好,而是越能基于正确证据做决定越好。这也是为什么因果解释会越来越重要——因为未来真正能落地的系统,不只是分数高,还得知道自己为什么这么答。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?它解决的是“模型为什么会靠背景做决定”这个问题。CIGMA 不是只让模型更小,而是先找出最依赖背景的注意力头,再把它们剪掉,从而降低背景捷径带来的误判。

FIG、BIG 和 BIR 分别是什么意思?FIG 是 Foreground Information Gain,前景信息增益;BIG 是 Background Information Gain,背景信息增益;BIR 是 Background Influence Ratio,背景影响比例。简单理解,前两个看删掉某部分后预测变化有多大,最后一个看模型到底有多爱背景。

为什么它说自己是“因果”方法,而不是普通可视化?因为它不是只画热力图看相关性,而是实际去掉某个注意力头,观察背景依赖是否变化。也就是说,它测的是“删掉之后行为变没变”,这比“看起来像在关注哪里”更接近因果判断。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是凭空造一个新模块,而是把“背景依赖”这件事做成了可因果验证的头级别归因,思路挺硬。

实验合理度:★★★★☆ 数据集、骨干、零样本与微调两种范式都覆盖了,还同时看准确率、校准和背景影响比例,比较完整。

学术研究价值:★★★★☆ 价值不只在剪枝本身,而在于把“解释”从热图升级到因果干预,对后续研究很有启发。

稳定性:★★★☆☆ 零样本和微调后都能用,但依赖掩码优化和真阳性样本筛选,离“随便扔进任何任务都稳”还有距离。

适应性以及泛化能力:★★★☆☆ 在分类和部分 VLM 场景有效,跨到更复杂开放任务时,还需要更多证据。

硬件需求及成本:★★★★☆ 不需要重训是大优点,主要成本在掩码优化和头级别扫描,比全量训练友好得多。

复现难度:★★★☆☆ 方法逻辑清楚,但涉及多阶段优化、干预和评估,细节参数如果没开源全,还是得花点功夫。

产品化成熟度:★★★☆☆ 适合做模型诊断、离线纠偏和安全审查,不太像即插即用的线上通用组件。

可能的问题:方法很强,但对样本筛选和掩码质量有依赖,且对开放式复杂任务的泛化还需更多验证。


主要参考文献

Alexander A Alemi, Ian Fischer, Joshua V Dillon, and Kevin Murphy. Deep variational information bottleneck. arXiv preprint arXiv:1612.00410, 2016.
Ruth C Fong and Andrea Vedaldi. Interpretable explanations of black boxes by meaningful perturbation. In Proceedings of the IEEE International Conference on Computer Vision, pages 3429–3437, 2017.
Ruth Fong, Mandela Patrick, and Andrea Vedaldi. Understanding deep networks via extremal perturbations and smooth masks. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2019.
Elena Voita, David Talbot, Fedor Moiseev, Rico Sennrich, and Ivan Titov. Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned. In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pages 5797–5808, Florence, Italy, 2019.
Yongming Rao, Wenliang Zhao, Benlin Liu, Jiwen Lu, Jie Zhou, and Cho-Jui Hsieh. DynamicViT: Efficient vision transformers with dynamic token sparsification. Advances in Neural Information Processing Systems, 34:13937–13949, 2021.
Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, et al. InternVL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 24185–24198, 2024.
Haotian Liu, Chunyuan Li, Yuheng Li, and Yong Jae Lee. Improved baselines with visual instruction tuning. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 26296–26306, 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
这篇CIGMA很适合图像与多模态方向同学来聊:怎么把“背景捷径”从模型脑子里揪出来,再一刀切掉。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。