← 返回 PaperDaily 视觉与图像

仅1500张图让ViT学会看“鸟喙”,CVPR 2026新方法鲁棒性大涨

本论文针对视觉Transformer在分布偏移下依赖背景等虚假相关性的顽疾,提出概念引导微调(CFT)。仅用1500张图、无需人工标注,让模型注意力从背景转向鸟喙、鱼鳍这类判别性语义概念,五个OOD基准一致提升。CVPR 2026 Highlight,代码已开源,可复现性强,值得细读。

仅1500张图让ViT学会看“鸟喙”,CVPR 2026新方法鲁棒性大涨
原论文信息如下:
论文标题:
Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness

发表日期: 2026年03月

发表单位: 特拉维夫大学、开放大学

原文链接: https://arxiv.org/pdf/2603.08309.pdf

开源代码链接: https://github.com/yonisGit/cft

ViT为何在分布外数据上失效?

视觉Transformer(Vision Transformer,ViT)在标准数据集上的表现,确实让人挑不出毛病。以ImageNet为例,无论是DINOv2还是DeiT-III,Top-1准确率都能轻松突破80%。但问题在于,一旦换了个环境——比如把物体换个角度、换个背景、变成素描或者艺术画——模型的性能就会瞬间崩塌。这种现象,在学术界被称为分布外数据(Out-of-Distribution,OOD)下的性能下降。
为什么会这样?最核心的原因在于,ViT在做判断时,往往不是因为“看见了物体”,而是因为“看见了背景”。举个例子:如果训练集里大多数“牛”的照片都出现在草地上,模型可能根本没有认真学“牛”这种动物的形态,而是把“草地”当成了判断依据。这种训练数据里存在的虚假关联,在学术上称为虚假相关性(spurious correlations)。在分布内数据上,这类捷径往往十分有效;但一旦遇到背景改变、视角改变或者风格改变的OOD数据,模型就会瞬间翻车。
图1:CFT的动机:ViT产生的相关性图经常集中在虚假背景线索上,而非语义概念。
CFT的动机——ViT产生的相关性图经常集中在虚假背景线索上,而非语义上有意义的概念。上方两行是ImageNet-A和ImageNet-R上的ViT-B结果。
过去几年,研究者们也试图纠正这个问题,最常见的手段是“用前景掩码去约束模型”——也就是告诉模型:你这张图片里,物体所在的区域应该被关注,背景区域不要看。听上去很有道理,但这类方法有一个致命缺陷:前景-背景二元分割太粗糙了。一个物体内部,不同部位的重要性是完全不同的。识别一只鸟,真正起关键作用的是“喙”和“翅膀”,而不是整个鸟的外轮廓;识别一条鱼,关键在“鳍”和“嘴”,而不是一团模糊的鱼形。传统的掩码把整个前景一视同仁,完全没有这种细粒度语义的区分能力。此外,还有一些情况是:相关特征可能延伸到物体之外——比如“树枝”可以作为“鹦鹉”的辅助证据,“水面”可以为“鸭子”的识别提供支持。这些合理的上下文线索,传统二值掩码也给不出答案。

概念引导微调:从“看背景”到“看本质”

针对上述痛点,特拉维夫大学和开放大学的研究者们提出了一种全新的微调框架——概念引导微调(Concept-Guided Fine-Tuning,CFT)。核心思想用一句话来概括就是:别再盯着背景和轮廓了,让模型真正去理解“鸟有喙”“鱼有鳍”这种概念级的语义吧。
CFT的妙处在于,它不需要人工标注的分割掩码,也不需要重新训练整个大模型。整个流程通过LLM(Large Language Model,大型语言模型)和VLM(Vision-Language Model,视觉语言模型)自动完成:先用LLM从类别名中生成一组判别性的语义概念,再用GroundedSAM在图像中把每个概念的像素位置找出来,最后引导模型的注意力去关注这些概念区域、忽略背景干扰。
更难得的是,CFT是一个极其省数据的方案:只需要从ImageNet-1K中随机挑一半类别、每类只用3张图片,总共1500张图,就能把模型的鲁棒性显著提上去。换句话说,整个微调数据量还不够人类看一天的,但对于教会模型“看本质”来说,已经足够了。

三步走:LLM生成概念、VLM定位概念、相关性对齐优化

CFT的整体流程,可以拆解成三个清晰的阶段。第一阶段,用LLM自动提出“每类物体应该看什么”;第二阶段,用VLM把“该看的地方”在图像里圈出来;第三阶段,在微调过程中强制模型的注意力对齐这些区域。下面把三步逐一拆开来讲。

第一步:LLM生成概念集

对于每一个目标类别c,算法使用一种免标签方法(引用自Oikarinen等人的工作)生成一组文本描述的概念集合ξ_c。本文在实现时选用了GPT-4o-mini模型,让它扮演一个“细粒度视觉专家”,描述“这种类别通常由哪些局部部件构成、通常出现在什么环境中”。例如,对于“虎皮鹦鹉”,生成的概念可能包括“蓝色头部”“弯钩状的喙”“带条纹的翅膀”“爪子”等。这一步骤完全不需要人工参与。最终在500个类别上,共生成了1852个经过验证的概念。

第二步:VLM验证与概念掩码生成

概念不能光停留在文字层面,必须落实到像素。论文使用GroundedSAM来完成这项工作。GroundedSAM是GroundingDINO与SAM(Segment Anything Model)的组合工具:GroundingDINO负责把文本概念在图像中定位出来,SAM则负责输出精细的分割掩码。对于每个概念k,如果它在某张图中被检测到,就返回对应的二值分割掩码M_k(I);如果没有检测到,该概念的掩码就置零。
不过,直接使用原始概念集会引入大量噪音——比如“长喙”这个概念可能只在部分图像中出现,或者某些概念与目标类别的重合度过低。为此,论文额外加入了一个自动化概念验证步骤,设置两个筛选指标:一是出现率(Occurrence Rate),即概念在同类图像中的检测成功率,阈值设为15%;二是空间覆盖率(Spatial Coverage),即概念掩码合并后与真实物体掩码的IoU,阈值设为20%。只有通过这两道筛选的概念才会被保留。论文在附录中证明,有验证步骤的效果明显优于无验证版本,但即使不做验证,CFT仍然管用。最终,每个图像上的语义引导掩码S(I)通过对该图像所有概念掩码取最大化操作得到。

第三步:相关性对齐优化

有了目标掩码S(I),下一个问题是:如何把模型的注意力“掰”过来?这里,论文使用了基于Transformer的可解释性工具——AttnLRP(Attention-aware Layer-wise Relevance Propagation,注意力感知的分层相关性传播)。AttnLRP是LRP(Layer-wise Relevance Propagation,分层相关性传播)针对Transformer的适配版本,它把分类得分从输出层逐层反向传播到输入层,从而得到每个图像patch对预测结果的贡献值,也就是相关性图Φ(I)。相比纯梯度方法,AttnLRP满足守恒性:所有patch的相关性之和恒等于模型的输出得分,这使得相关性图成为可信赖的优化目标。
公式2:AttnLRP相关性传播规则
公式2:AttnLRP的核心传播规则。其中Aij(ℓ)表示第ℓ层中从token i到token j的注意力权重,Φj(ℓ)为下一层的相关性值,ε是数值稳定项。
接下来,CFT定义了三个关键损失项,共同构成整个微调优化目标。整体优化目标可以写成:
公式1:整体优化目标
公式1:整体优化目标。其中θ为模型参数,L为总损失,D为微调数据集,(I, y)为图像与标签对。
第一个损失项是概念区域正对齐损失,它鼓励模型在概念掩码S(I)覆盖的像素上输出尽可能高的相关性值:
公式3:概念区域对齐损失
公式3:概念区域对齐损失。其中|S|为概念区域内像素总数,Φp(I)表示像素p上的相关性值。该损失通过最大化概念区域内相关性的对数值,迫使模型将注意力集中在这些语义关键区域上。
第二个损失项是背景区域负对齐损失,用来压制非概念区域(背景)上的相关性响应:
公式4:非概念区域抑制损失
公式4:非概念区域抑制损失。其中S̄为概念掩码之外的像素集合。该损失以(1−Φ_p)为目标,将非概念区域的响应向零压缩。
这两个损失项经过加权合并,得到总的对齐损失:
公式5:总对齐损失
公式5:总对齐损失。论文中固定取λ_non-concept=1.2,λ_concept=0.5。
但仅仅最小化对齐损失还不够。论文通过实验发现,如果只做对齐约束,模型的相关性图确实会贴近真实分割,但分类准确率会暴跌。原因很简单:模型为了迎合对齐损失,可能会放弃有价值的类别特征,甚至把输出分布变得极端化。为了解决这一问题,论文引入了第三个损失项——分类一致性损失
公式6:分类一致性损失
公式6:分类一致性损失。其中argmax f_θ(I)为模型当前对图像I的预测类别。该损失通过交叉熵将模型的输出分布向自己的预测类别拉近,保持模型在微调前后的预测行为一致。
最终,CFT的完整损失函数为总对齐损失与分类一致性损失的加权和:
公式7:总损失函数
公式7:总损失函数。论文中取λ_align=0.8,λ_cls=0.2。需要强调的是,这套损失函数在所有模型和所有数据集上共用同一组超参数,不需要针对每个任务做精细调参。

实验验证:五个基准上的鲁棒性提升

为了检验CFT的效果,论文设计了四组实验,覆盖了五类OOD基准、四种主流架构和三个基线方法。模型方面,实验选用了DINOv2、ViT-B、DeiT-III(简称DeiT)和ConvNeXt-V2(简称CNv2),全部使用timm库中的预训练权重。基线对比方法则选择了三类已有的显著性正则化策略:GradMask(基于梯度的掩码正则化)、RRR(Right for the Right Reasons,输入梯度正则化)和RRDA(基于解释的数据增强)。为了保证对比公平,所有基线方法都被适配到与CFT完全相同的微调设置中——用同样的1500张图片、相同的训练轮数和优化器。
表1:分布外鲁棒性与分布内准确率
表1:OOD鲁棒性与分布内准确率对比。指标为Top-1和Top-5准确率(%)。加粗为最优,下划线为次优。
从表1可以看到几个清晰的规律。首先,在IN-A(ImageNet-A,自然对抗样本)上,CFT对ViT-B的Top-1准确率从13.26%提升到27.76%,直接翻了一倍还多;在ObjectNet(物体旋转、背景和视角都发生改变)上,同样从33.26%提升到了54.28%,涨幅超过20个百分点。相比之下,GradMask和RRR的提升幅度要小得多,说明“硬怼前景分区”的方式并没有真正让模型学会泛化。其次,在IN-R(ImageNet-R,艺术渲染图)和IN-Sketch(素描图)上,CFT的提升幅度相对温和,基本在1到2个点之间。论文对此的解释是:艺术图和素描图本身的背景信息就很少,模型的背景捷径在这些数据上天然失灵,因此可提升的空间有限。
表2:SI-Score几何变换鲁棒性
表2:SI-Score几何变换鲁棒性对比。SI-Score是一个合成基准,系统性地改变目标的位置、尺度和旋转角度。
表2展示了SI-Score上的结果。更惊喜的现象出现在这里:CFT在所有四种模型上都带来了显著的提升,尤其是在SI-location上,ViT-B的Top-5从50.54%涨到了62.48%。这其实很好理解——当模型学会了关注物体自身的结构特征(如鸟喙、鱼鳍)时,它对物体在图像中的位置、大小和角度就不那么敏感了,几何不变性自然增强。
图2:CFT修正OOD数据集上的预测错误
图2:CFT修正OOD数据集上预测错误的定性示例。上方(ImageNet-A)中,基线模型将“普通蝾螈”误判为“蝎子”,相关性图散落在纹路复杂的背景上;经过CFT微调后,模型不仅纠正了预测,还将相关性集中在物体躯干上。
除了精度指标,论文还进一步验证了一个关键问题:CFT是否真的让模型“看对了地方”?为了回答这个问题,实验在ImageNet-Segmentation数据集上,把模型的相关性图与真实物体掩码进行像素级对比,结果如表3所示。
表3:相关性图与真实物体掩码的对齐
表3:相关性图与ground truth对象掩码的像素级对齐度。
在所有模型上,CFT都显著提高了相关性图与真实对象掩码的mIoU,这意味着模型的注意力确实从背景移向了物体本身。更难得的是,论文还做了一个“未见过类”的泛化测试:微调时只用了ImageNet-1K一半的类别,那么CFT的收益是否只对这些见过的类别有效?表4给出了答案。
表4:未见过类别的泛化能力
表4:未见过类别的泛化能力。分别评估微调集内类别与训练集外类别上的鲁棒性表现,最后一行给出两类结果的平均变化。
结果显示,对于微调时完全没有见过的类别,CFT同样能带来鲁棒性提升。这直接印证了CFT的本质不是“记住某些类的概念”,而是“学会了一种理解物体的方式”——把模型从背景依赖的惯性思维中解放出来。

消融研究:概念级引导为何优于前景-背景掩码

如果说主实验解决了“有没有用”的问题,那么消融研究解决的就是“为什么有用”的问题。论文的核心假设是:概念级引导比传统的前景-背景掩码更适合作为模型鲁棒性的监督信号。表5直接检验了这一假设。
表5:概念级引导与对象级引导的消融对比
表5:消融实验——概念级引导 vs 对象级引导。将CFT中的概念掩码替换成对象级分割掩码后,在ViT-B上重新评测。
对比结果非常直观:使用对象级掩码(把整个前景物体作为对齐目标)时,模型的鲁棒性提升十分有限;而使用概念级掩码(只关注喙、翅膀、鱼鳍这类判别性部件)时,提升幅度大幅增加。原因在于,对象级掩码把所有前景像素同等对待,模型依然分不清哪些部位才是真正区别于其他类别的关键;而概念级掩码直接告诉模型:“喙”是区分鸟类的重要证据,“树枝”可以作为辅助线索但“蓝天”不行。这种细粒度的语义指令,为模型提供了更加精确的特征选择依据。
表6:损失组件消融
表6:损失组件消融。使用ViT-B模型逐一移除三个主要损失项,观察对性能的影响。
表6展示了移除不同损失项后的表现差异。缺少概念区域对齐损失时,模型在IN-A上的性能明显回落,说明“让模型知道该关注什么”是鲁棒性提升的主要来源。缺少背景抑制损失时,性能同样下滑,可见“让模型知道不该关注什么”也不可或缺。而分类一致性损失的主要作用在于维持分布内准确率,去掉它之后,模型虽然对齐度提升,但分类能力受损,IN-V和IN-V2上的成绩会出现明显下跌。
表7:不同相关性方法的对比
表7:相关性方法消融。比较AttnLRP与替代相关性方法在Top-1准确率上的差异。
最后,相关性提取方法的选择也同样关键。表7对比了AttnLRP与其他可解释方法:当使用GradCAM或普通注意力加权作为相关性来源时,由于这些方法自身的解释不够精确,微调效果也大打折扣。这验证了AttnLRP的守恒性对于优化稳定性至关重要。

局限与展望:概念引导的边界与未来方向

任何方法都不可能完美,CFT同样有明确的边界。从实验数据来看,CFT在IN-R和IN-Sketch上的提升幅度明显小于IN-A和ObjectNet。论文的解释是:艺术图和素描图的背景干扰本就有限,模型没有太多“背景捷径”可走,因此改善空间自然被压缩。这也反向说明了一个问题——CFT解决的是“如何让模型不要依赖背景”的问题,而不是“如何让模型在所有分布偏移下都保持性能“的问题。对于纹理变化或风格变化主导的偏移(比如从照片变成素描、变成雕塑),CFT能提供帮助,但效果不是万能的。
另一个不可忽视的潜在瓶颈是:概念生成的质量高度依赖LLM和VLM的先验知识。GPT-4o-mini给出的概念,本质上来源于语言统计规律,而并非视觉观察;GroundingSAM的零样本分割能力也会在罕见概念或抽象概念上出现失效。虽然论文通过出现率和空间覆盖率做了筛选,但误差传播的链路依然存在。如果LLM生成的概念集本身就存在遗漏或者偏差,后续优化步骤也很难把它修正回来。未来的工作可以考虑将概念生成从离线静态改为在线动态——让模型在微调过程中根据自身的学习状态不断提出新的概念,甚至引入类间对比概念(例如“哪些特征不是这类物体该有的”),让引导信号更丰富。
不过,回到当下,CFT已经为“提升视觉模型鲁棒性”提供了一条非常独特且务实的路径:不需要人工标注、不需要大规模重训、不受限于前景-背景二分。它在可解释性、高效微调和分布外泛化之间找到了一个很好的平衡点。对于那些在真实场景中部署视觉模型的团队来说,这套框架的参考价值不言而喻。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本论文提出概念引导微调(CFT),利用大模型自动生成类相关概念、视觉语言模型完成空间定位,引导ViT内部相关性图聚焦鸟喙、鱼鳍等判别性语义而非背景。仅用1500张图、无需人工标注,在五个分布外基准上显著提升鲁棒性,且收益可泛化至未
这篇工作最值得看的点是什么?CFT在五个分布外基准上一致提升鲁棒性,在ImageNet-A和ObjectNet上提升显著(如ViT-B在IN-A上从15.37%提升至27.76%),在相关性图对齐指标上全面优于基线方法,且鲁棒性提升可泛化到未见类别。
这篇工作的边界或风险在哪里?优点:全自动无需人工标注,数据高效(仅需1500张图像),概念级语义引导优于传统前景-背景二值掩码,鲁棒性提升可泛化到未见类别。缺点:依赖VLM(GroundedSAM)的定位能力,对抽象或非视觉概念可能失效;概念生成依赖LLM,存在幻觉风险;初始概念创建和验证阶段计算开销较大。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

概念级语义引导+LLM/VLM自动生成掩码的思路,是对传统前景-背景二分法的有力升级。虽说每个组件都不是全新发明,但将它们组合成一个无需人工标注、数据高效的微调框架,本身就是一种很聪明的创新。

实验合理度:★★★★★

五类OOD基准、四个模型架构、三个基线,加上概念级vs对象级、损失组件、相关性方法、种子稳定性等六组消融,实验设计全面且对照公平。唯一的小遗憾是部分附录结果略显挤占篇幅,但主实验足以支撑结论。

学术研究价值:★★★★☆

本文为可解释性与鲁棒性的结合提供了一个可扩展的新范式。后续工作可以沿着更动态的概念生成、概念关系建模(如类间对比概念)、与其他训练策略组合等方向继续深挖。

稳定性:★★★☆☆

对LLM概念生成和VLM分割质量有一定依赖。论文通过概念验证筛选减轻了这一问题,并在5种种子下验证了稳定性,但极端情况下概念缺失或误导仍可能影响效果。

适应性以及泛化能力:★★★★☆

在五个OOD基准上均有提升,且对未见类有效,说明泛化能力不错。但在艺术图、素描等风格主导的分布偏移上提升幅度有限,这是方法本身的适用边界。

硬件需求及成本:★★★★☆

训练成本很友好:1500张图、50轮微调、A100即可完成。推理阶段则完全没有任何额外开销,因为概念掩码只在训练时使用。

复现难度:★★★★☆

代码已开源,依赖项明确(PyTorch、timm、GroundedSAM等),整体复现门槛不高。唯一稍显麻烦的是需要调用LLM API生成概念,会引入一点外部依赖。

产品化成熟度:★★★☆☆

对于有OOD鲁棒性要求的图像分类场景(如自动驾驶感知、安防、内容审核),CFT提供了一套低成本的模型加固方案。但因为需要依赖外部LLM和分割模型的推理服务,大规模工业化部署还需要额外的工程集成。

可能的问题:

概念生成依赖LLM先验,对长尾/细粒度类可能有遗漏或噪音;对风格/纹理主导的偏移(IN-R、IN-Sketch)提升有限,未充分展示该方法的边界条件;未探索更大规模数据集或开放词汇场景下的表现。

主要参考文献

[1] Oikarinen T., et al. Label-free Concept Bottleneck Models. ICLR 2023.
[2] Achtibat R., et al. Attention-aware Layer-wise Relevance Propagation for Transformers. ICML 2024.
[3] Liu S., et al. Grounding DINO: Marrying DINO with Grounded Pre-Training. ECCV 2024.
[4] Kirillov A., et al. Segment Anything. ICCV 2023.
[5] Hendrycks D., et al. Natural Adversarial Examples. CVPR 2021.
[6] Dosovitskiy A., et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ICLR 2021.
[7] Oquab M., et al. DINOv2: Learning Robust Visual Features without Supervision. TMLR 2024.
[8] Ross A.S., et al. Right for the Right Reasons: Training Differentiable Models by Constraining their Explanations. ICLR 2017.
[9] Touvron H., et al. DeiT III: Revenge of the ViT. ECCV 2022.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想让你的ViT也"擦亮眼睛"、不看背景看本质?更多鲁棒性调优与可解释性实战心得,尽在龙哥读论文粉丝群!扫描下方二维码或添加龙哥助手微信号kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称,即可进群和AI玩家们一起聊技术!🎉
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。