← 返回 PaperDaily 视觉与图像

CVPR 2026夺冠!SynCLIP一招让AI读懂“同义词”,密集感知鲁棒性飙升

说“飞机”和“飞行器”时,CLIP模型的“眼睛”居然会看错地方?那自动驾驶可不敢用!CVPR 2026的这篇SynCLIP,狠狠揪出这个同义词“注意力分裂”的bug,用语义连贯预训练一招治愈,密集感知鲁棒性直接拉满!

CVPR 2026夺冠!SynCLIP一招让AI读懂“同义词”,密集感知鲁棒性飙升
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
说“飞机”和“飞行器”时,CLIP模型的“眼睛”居然会看错地方?那自动驾驶可不敢用!CVPR 2026的这篇SynCLIP,狠狠揪出这个同义词“注意力分裂”的bug,用语义连贯预训练一招治愈,密集感知鲁棒性直接拉满!


原论文信息如下:
论文标题:
SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception
发表单位:
Beihang University, State Key Laboratory of Space Information System and Integrated Application, Nanjing University, Harbin Engineering University, Beijing Zhongguancun Academy
原文链接:
https://openaccess.thecvf.com/content/CVPR2026/papers/Xie_SynCLIP_Synonym-Coherent_Language-Image_Pretraining_for_Robust_Open-Vocabulary_Dense_Perception_CVPR_2026_paper.pdf
开源代码链接:
https://github.com/Justlovesmile/SynCLIP
发表日期:
CVPR 2026

问题诊断:同义词“惹的祸”——接地不一致现象

想象一下:当你指着天上的东西说“飞机”,然后又换了个说法叫“飞行器”,AI应该明白你说的是同一个玩意儿,对吧?但在当前最火的开放词汇密集感知(OVDP)领域,事情可没那么简单。
目前,OVDP方法主要依赖CLIP这类视觉语言模型。它们确实很强大,但龙哥今天要聊的这篇CVPR 2026论文,发现了一个隐藏极深的“大坑”:
图1:同义词引发接地不一致的示意图。(a)展示了多种同义表达在密集感知中的不一致性。(b)展示了由同义词接地不一致导致的性能下降。
图1:同义词引发接地不一致的示意图。(a)展示了多种同义表达在密集感知中的不一致性。(b)展示了由同义词接地不一致导致的性能下降。
如上图所示,当你对同样的图片,用“斑马”、“条纹马”、“hippotigris”这些同义词来描述时,CLIP模型的注意力图会“乱跑”,导致目标检测的平均精度(AP)断崖式下跌。这种 同义词引发的接地不一致 问题,在部署到自动驾驶、机器人等现实场景中会非常危险——同一物体因为换了个说法而识别失败,这谁受得了?

解决方案:三大法宝——SSA、SAR和SEViC

针对这个问题,北京航空航天大学等机构提出了 SynCLIP,一个同义词连贯的语言-图像预训练框架。这个框架的核心武器有三件:
图3:SynCLIP框架图,包含SSA(语义一致空间注意力对齐)模块和SAR(空间注意力精炼)模块。SSA通过对齐原始标签与语义增强表达之间的空间注意力来强制一致的接地。SAR通过选择最相关的语义token并聚合视觉基础模型导出的上下文感知空间相关性来精炼注意力精度。
图3:SynCLIP框架图,包含SSA模块和SAR模块。

法宝一:SEViC——同义词增强视觉语料库

数据是模型学习的“粮食”。为了让模型见识到语言的多样性,作者们首先构建了一个 同义词增强视觉语料库,即SEViC。它以COCO2017的训练集为基础,融合了LVIS的细粒度类别,形成了1232个独特类别的词汇表。对于每个类别,不仅保留已有的同义词和定义,还利用大语言模型(如DeepSeek)自动生成更多的同义表达,并由LLM进行一致性校验。最终,SEViC包含了118,287张图像、1234个类别以及11558条语义丰富的表达。
表格1:SEViC中的同义词增强文本表达示例。
表格1:SEViC中的同义词增强文本表达示例。

法宝二:SSA——语义一致空间注意力对齐

有了多样化的文本之后,如何让模型“听”得懂呢?SSA模块采用漂亮的 教师-学生双视觉编码器架构。给定一张图片,学生模型和其冻结的教师模型分别提取密集特征。然后,将原始的标签(如“狗”)和对应的语义增强表达(如“狗,小狗,犬科,一种常见的家养食肉哺乳动物……”)分别编码,并生成两者的空间注意力图。核心思想是,语义增强的表达包含更丰富的上下文,其注意力图通常更准确。因此,SSA通过一个 语义对齐损失,强制学生模型将原始标签的注意力图,向更精准的语义增强表达注意力图靠拢,从而消除同义词带来的注意力偏移。

法宝三:SAR——空间注意力精炼

SSA让注意力更一致了,但还不够精准。SAR模块负责对注意力图进行“精修”。它分为两步:
语义Token选择:从语义增强表达的注意力图中,挑选出注意力得分最高的top-k个图像块(tokens),这些块是信息最丰富的“种子”。
上下文感知注意力聚合:然后,借助一个强大的视觉基础模型(如DINOv2)提取的密集特征,计算这些“种子”与全图所有位置的空间相关性矩阵。最后,将这些相关性矩阵聚合起来,生成一个新的、更精准的空间注意力图。
这个过程可以理解为:先用粗的语义线索找到关键点,再用视觉基础模型提供的上下文“放大镜”去看清细节,从而得到更精细的图像区域。
图4:SAR过程示例(k=3)。从左至右分别是语义注意力Asem、空间相关注意力Aspa和聚合注意力Aagg。聚合后的注意力保留了语义相关性,并具备文本引导的空间定位能力。
图4:SAR过程示例(k=3)。聚合后的注意力既保留了语义相关性,又有精确的空间定位。

SSA与SAR的协同效应

作者通过消融实验证明了这两个模块的互补性。单独使用SSA,提升微乎其微,因为语义增强表达引入的信息虽多但也有冗余;单独使用SAR,提升明显,因为它能精炼注意力;而两者结合,效果发生“质变”,因为SSA提供了更一致的对齐基础,SAR则在此基础上进行精炼,实现了1+1>2的效果。

性能验证:基准测试与鲁棒性评估双丰收


基准测试:全面超越,登顶SOTA

SynCLIP在OV-COCO和OV-LVIS这两个主流基准上进行了测试。在以F-ViT为基线的框架下,SynCLIP的表现令人印象深刻。
图2:不同模型对同义表达(如同义词、定义)生成的空间注意力分布对比。SynCLIP的方法产生了更一致且语义对齐的注意力,表现出对同义词鲁棒的接地能力。
图2:在OV-COCO(表2a)上,使用ViT-B/16和ViT-L/14骨干网络时,F-ViT+SynCLIP的APnovel分别达到了43.6和49.8,大幅领先于CLIPSelf和DeCLIP等强基线。在更具挑战性的OV-LVIS(表2b)上,SynCLIP同样表现出色,尤其在ViT-B/16骨干上,以27.8的mAPmask超越了所有对比方法,证明了其强大的泛化能力。
表2:(a) OV-COCO基准上结果对比,(b) OV-LVIS基准上结果对比。最佳结果用粗体标出。
表2:(a) OV-COCO基准上结果对比,(b) OV-LVIS基准上结果对比。

鲁棒性评估:同义词替换下的“定海神针”

这是SynCLIP最核心的亮点。在OV-COCO基准上,当用同义表达替换原有类别名后,各方法的性能表现如下:
表3:OV-COCO基准上同义词替换下的鲁棒性评估。APnovel和APbase分别衡量新、基类上的接地性能。
表3:OV-COCO基准上同义词替换下的鲁棒性评估。
可以清晰地看到,CLIPSelf和DeCLIP的APnovel分别下降了8.8和9.5,简直是“雪崩”。而F-ViT+SynCLIP仅下降了4.4,而且基类性能几乎不变。这说明 SynCLIP的同义词连贯预训练,极大地降低了模型对语言变化的敏感性,使其成为同义词攻击下的“定海神针”。图5的注意力可视化结果也印证了这一点,SynCLIP在面对同义表达时,始终能稳定地将注意力聚焦在正确的物体上。
图5:同义表达下注意力图的可视化对比。(a)横幅 vs. 广告横幅,(b)碗 vs. 深盘。SynCLIP在不同但语义等价的表达中能保持更稳定和连贯的定位。图6:语义token数量k的影响。(a)OV-COCO上性能趋势;(b)不同k下的空间相关注意力图可视化。
图5:同义表达下注意力图的可视化对比。图6:语义token数量k对性能的影响。

同义词也能“指哪打哪”?SynCLIP让CLIP模型更鲁棒

好,前戏做足,下面龙哥就来带大家看看,SynCLIP到底是怎么把同义词这个“心头大患”给治得服服帖帖的。

问题诊断:同义词“惹的祸”——接地不一致现象

在深入解决方案之前,咱们得先把这个“病根”给彻底搞清楚。为什么说同义词是CLIP模型在开放词汇密集感知(OVDP)任务上的一个“软肋”呢?
开放词汇密集感知,或者简称OVDP,顾名思义,就是让模型不仅能识别训练时见过的物体,还要能理解并定位那些从未见过的、用文字描述的物体。这有点像给AI配了个“万能雷达”,你说个词,它就能在图片里找到对应的东西。这个能力对于自动驾驶、机器人等场景至关重要,因为现实世界里永远有你没见过的新玩意儿。
目前的OVDP方法大多依赖于像CLIP这样的视觉语言模型(VLM)。CLIP通过在海量的(图片、文本)对上进行对比学习,学会了把图片整体和文本描述对应起来。这个能力非常强大,但它有个“近视”的问题——它擅长全局匹配,却不擅长精细的区域定位。因此,很多后续工作,比如F-ViT、CLIPSelf、DeCLIP等,都在想办法把CLIP的能力从“图片级”下沉到“区域级”,让模型能更好地理解图片中每一个局部区域和文本描述的关系。
然而,一个被忽视的“大坑”出现了:同义词引发的接地不一致(Synonym-Induced Grounding Inconsistency)。啥意思呢?就是当你用不同的语言表达方式(比如“飞机”、“飞行器”、“Aircraft”)去描述同一个物体时,模型产生的空间注意力分布(即“看哪里”)居然截然不同!这就像一个脸盲症患者,你说“小明”他看左边,你说“那孩子”他看右边,明明说的是同一个人。
图1:同义词引发接地不一致的示意图。(a)展示了多种同义表达在密集感知中的不一致性。(b)展示了由同义词接地不一致导致的性能下降。
图1非常直白地展示了这个问题。当把“zebra”(斑马)这个标签换成它的同义词“striped horse”(条纹马)或者“hippotigris”时,最先进的F-ViT模型在OV-COCO基准上的平均精度(AP)直接来了个“断崖式下跌”。这说明现有模型在面对语言的细微变化时,表现极其不稳定,这对于要求高可靠性的AI应用来说,是致命的。
图2则从注意力的可视化角度,揭露了问题的本质。对于同一张图片,当输入“plane”(飞机)、“airplane”(飞机)、“aircraft”(飞行器)甚至是一段描述“a powered flying vehicle with fixed wings...”时,不同CLIP变体的“目光”(注意力热力图)完全不一样。CLIP像个粗心的家伙,目光散漫;DeCLIP虽然好点,但换了个词还是会看偏。只有SynCLIP的方法,不管你怎么说,它的目光都牢牢锁定在天空中的那个物体上,实现了真正的“指哪打哪”。
图2:不同模型对同义表达(如同义词、定义)生成的空间注意力分布对比。SynCLIP的方法产生了更一致且语义对齐的注意力,表现出对同义词鲁棒的接地能力。
图2:不同模型对同义表达生成的注意力分布对比。SynCLIP的注意力更一致且语义对齐。

解决方案:三大法宝——SSA、SAR和SEViC

找到病根之后,北航等机构的研究人员开出了一剂“对症良方”——SynCLIP。这个框架的名字起得很好:合成(Syn)了同义词连贯(CLIP)。它核心由三部分组成,环环相扣。
图3:SynCLIP框架图,包含SSA(语义一致空间注意力对齐)模块和SAR(空间注意力精炼)模块。SSA通过对齐原始标签与语义增强表达之间的空间注意力来强制一致的接地。SAR通过选择最相关的语义token并聚合视觉基础模型导出的上下文感知空间相关性来精炼注意力精度。
图3:SynCLIP框架图,展示了SSA和SAR两大核心模块如何协同工作。
我们直接来看图3,这是SynCLIP的完整框架,一切都从这个图开始。左边的部分是数据准备,右边是模型的核心。

法宝一:SEViC——同义词增强视觉语料库

“巧妇难为无米之炊”,要想让模型理解同义词,首先得有同义词的数据。作者们构建了同义词增强视觉语料库(SEViC),其全称是Synonym-Enriched Visual Corpus。这个语料库是SynCLIP赖以生存的“土壤”。
SEViC怎么构建的呢?它基于最常用的COCO2017数据集。但COCO的类别只有80个,不够丰富,所以作者们又引入了同样基于COCO图像的LVIS数据集,后者有1232个更细粒度的类别,覆盖了常见和长尾概念。最终,形成了一个包含118287张图片、1234个类别的庞大词汇库。
光有类别名还不够,对于每个类别,他们还利用大语言模型(LLM),比如DeepSeek,来生成多个同义词和一段简洁的定义。最后经过LLM的一致性检查,确保这些表达确实语义相同。比如,“boat”(船)这个类,就有了“vessel”、“watercraft”等同义词和“a small vessel for traveling on water...”这样的文本定义。
这个语料库就像是给模型准备了一本“同义词词典+百科全书”,让它在学习阶段就能见识到语言的多样性。

法宝二:SSA——语义一致空间注意力对齐

有了数据,接下来就是怎么用这些数据来训练模型。这就是语义一致空间注意力对齐(SSA)模块的拿手好戏,全称是Semantic-consistent Spatial Attention Alignment。
SSA的核心思想很朴素:既然你用“狗”这个标签时注意力不够准,那我就用“狗,小狗,犬科,一种常见的家养食肉哺乳动物……”这个更丰富的表达作为老师的教导,来“教”学生模型把“狗”的注意力图校准到和老师一样的水平。
具体如何实现呢?SSA采用了一个经典的教师-学生双视觉编码器架构。对于一张输入图片I,学生模型Fv和它的“老师”(一个冻结了参数的模型副本Fv*)分别提取出密集的视觉特征。
然后,SSA会构建两组文本:一组是原始标签文本Tlabel(比如“dog”),另一组是语义增强表达文本Tsem(来自SEViC,比如“dog, puppy, canine, ...”)。这两组文本都被送到文本编码器里编码成文本嵌入。
接下来,关键的来了。SSA计算视觉特征与两组文本嵌入之间的空间注意力图,得到Alabel和Asem。由于语义增强表达包含了更丰富的上下文,它的注意力图(Asem)通常更精准。所以,SSA的核心就是一个语义对齐损失函数:Lsem = mean(监督更新 {Alabel, Asem}),其目的就是让Alabel向Asem对齐。通过不断最小化这个损失,模型就能学会,无论你用什么同义词,都应该产生相似的、正确的注意力。

法宝三:SAR——空间注意力精炼

SSA虽然让注意力在语义上变得一致了,但光有“一致”还不够,我们还需要“精确”。比如,你可能知道“飞机”应该在天上,但具体是哪个像素点?这就要靠空间注意力精炼(SAR)模块了,全称是Spatial Attention Refinement。
SAR就像一个“细节放大镜”,它分为两步走:

第一步:语义Token选择。它从语义增强表达产生的注意力图Asem中,找出注意力得分最高的top-k个图像块(tokens)。这些“种子”token代表了与物体描述最相关的区域。

第二步:上下文感知注意力聚合。光有种子还不够,还得看它们周围是什么。SAR引入了一个预训练好的视觉基础模型(VFM),比如DINOv2。这个VFM能提取极其丰富的空间上下文特征。SAR会计算选出的种子token与图片中所有其他token的空间相关性。最后,把这些相关性矩阵聚合起来,形成一个全新的、上下文感知的注意力图Aspa。

最终,SAR将原始的语义注意力Asem和精炼后的空间注意力Aspa进行融合,得到最终的聚合注意力Aagg,并用它来监督模型的训练。这个过程可以形象地理解为:先靠文本线索(SSA)大概框出范围,再用视觉大模型(SAR)提供的高清“地图”进行精确定位。
图4:SAR过程示例(k=3)。从左至右分别是语义注意力Asem、空间相关注意力Aspa和聚合注意力Aagg。聚合后的注意力保留了语义相关性,并具备文本引导的空间定位能力。
图4:SAR过程示例。可以看到,聚合后的Aagg比单纯的语义注意力Asem更加聚焦,范围更精准。

SSA与SAR的完美协同

看到这里,你可能会问,这三个法宝单独拎出来效果如何?作者通过消融实验(表4)展示了它们神奇的协同效应。
实验结果表明:单独使用SSA,提升非常有限,因为语义增强的表达虽然全面,但也带来了冗余信息,对局部定位帮助不大。单独使用SAR,效果不错,因为它能精准提炼。但强强联合时,效果发生了质的飞跃!因为SSA为模型提供了更一致的语义基线,而SAR则在此基础上做精修,二者完美互补,实现了1+1>2的效果。
表4:SynCLIP在OV-COCO基准上的消融实验分析。SSA和SAR都贡献了性能提升,且两者结合取得了最佳的新类别结果,证明了它们的互补性。
表4:SynCLIP在OV-COCO上的消融实验。组合拳的效果远胜于单一招式。

性能验证:基准测试与鲁棒性评估双丰收

理论吹得再好,不如实验结果有说服力。SynCLIP在标准的OVDP基准上表现如何?面对同义词攻击时,又能否独善其身?

标准基准测试:全面超越,登顶SOTA

首先,看看SynCLIP在“常规考试”中的表现。它在OV-COCO和OV-LVIS这两个最权威的基准上进行了测试,并与多种最先进方法(如F-ViT、CLIPSelf、DeCLIP等)做了对比。为了确保公平,SynCLIP采用的是和F-ViT相同的骨干网络。
表2:与最先进方法的对比结果。'RN50'代表ResNet50,'B'和'L'代表ViT的Base和Large模型尺寸。同一骨干下的最佳结果用粗体标出。
表2:与最先进方法的对比结果。同一骨干下的最佳结果用粗体标出。
结果非常震撼。在OV-COCO上(表2a),F-ViT+SynCLIP使用ViT-B/16骨干时,新类别的AP50(APn5o0vel)达到了43.6,使用ViT-L/14骨干时更是飙到了49.8,大幅超越了所有基于相同骨干的方法。
在更具挑战性的OV-LVIS上(表2b),结果同样出色。使用ViT-B/16骨干时,F-ViT+SynCLIP以27.8的mAPmask超越了所有对比方法(包括DeCLIP的26.8)。使用大模型时,也达到了和最强基线持平的水平。考虑到LVIS数据集有337个稀有类别(即未见类别),且同义词和细粒度概念极多,这个成绩含金量十足。这说明,SynCLIP的同义词连贯预训练,确实让模型学到了更本质的类别语义。

鲁棒性测试:同义词攻击下的“定海神针”

标准测试证明了SynCLIP很“强”,但鲁棒性测试才能证明它很“稳”。这才是本文最大的亮点。作者们设计了一个特别的实验:用同义表达替代原始类别名,然后观察模型性能的下降情况。结果如表3所示。
表3:在OV-COCO基准上同义词替换下的鲁棒性评估。'syn.'表示使用同义表达进行评估。可以看到SynCLIP的AP下降幅度最小。
表3:同义词替换下的鲁棒性评估。下降幅度越小,说明鲁棒性越好。
数据是最有力的证明。当同义词攻击来袭时,CLIPSelf的APn5o0vel从37.6跌到了28.8,暴跌了8.8;DeCLIP从41.0跌到了31.5,狂跌了9.5。而F-ViT+SynCLIP呢?从43.6跌到了39.2,仅下降4.4!而且基类性能几乎纹丝不动。
这个结果清楚地表明,SynCLIP的同义词连贯预训练,极大地降低了模型对语言变化的敏感性。它就像一根“定海神针”,任凭你“飞机”、“飞行器”、“Aircraft”怎么换,我自岿然不动,始终能稳定地把注意力聚焦在目标上。图5从可视化的角度直观地展现了这一点,让我们看看SynCLIP那“稳稳的幸福”。
图5:同义表达下注意力图的可视化对比。SynCLIP在不同但语义等价的表达(如banner vs. advertising banner)中能保持更稳定和连贯的定位。图6:语义token数量k对性能的影响。
图5:注意力可视化对比。CLIPSelf和DeCLIP的目光在不同同义词下明显漂移,而SynCLIP始终锁定正确目标。

未来展望:迈向更可靠的开放词汇感知

SynCLIP的工作无疑为OVDP领域打开了一扇新的大门。它首次系统性地揭示了同义词引发的接地不一致问题,并给出了一个非常实用的解决方案。不过,龙哥觉得,虽然论文里说SynCLIP在OV-LVIS的稀有类上成绩不错,但相较于OV-COCO的提升,幅度显得小一些。这可能是因为LVIS的稀有类本身标注就少,同义表达在长尾分布下难以完全覆盖,这应该是未来一个可以继续优化的方向。
总的来说,这种“问题发现-数据构建-方法设计”的完整闭环研究思路,非常值得借鉴。未来的工作可以往更广泛的语言变体(比如成语、俚语)上扩展,或者探索如何更轻量地融入视觉基础模型的知识,让模型在资源和性能之间取得更好的平衡。当我们的AI不再因为人们说话方式的差异而“看错”世界时,离真正的通用智能就更近一步了。

龙迷三问

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。