← 返回 PaperDaily
视觉与图像
ACM MM 2026:让AI“看清”每一个目标!中科院提出SSDE,十个基准全面SOTA
当一句"穿红衣服的人"出现在一群长相相似的人堆里,AI如何精准锁定目标?中科院自动化所最新研究给出了答案:从语义和空间两个维度同时增强判别力,让AI在多目标、无目标等复杂场景下也能看得清、找得准。这项发表于ACM MM 2026的工作在十个基准上全面刷新SOTA,值得每一位关注多模态理解的研究者细读。
龙哥读论文
发布于 2026-09-12 16:53:31
阅读 1
查看原文
原论文信息如下:
想象一下这个场景:你指着一张满是人的照片说"那个穿红衣服、戴帽子、正在喝咖啡的人",AI需要在一群外形相似的人里准确找出你说的那一个。这听起来像是人类与生俱来的能力,但对AI来说,这是一道相当有挑战性的考题。
更复杂的是,如果这句话变成"所有人"或者"左边的两个人",AI不仅要理解语义,还要处理数量不确定、目标可能重叠、甚至有些目标根本不存在的情况。这就是广义视觉定位(Generalized Visual Grounding, GVG)任务要解决的问题。
视觉定位的判别性困境:从语义到空间的双重挑战
视觉定位(Visual Grounding, VG)是计算机视觉与自然语言处理交叉领域的一个重要任务,目标是让模型根据一句自然语言描述,在图像中定位出对应的目标。经典视觉定位(Classic Visual Grounding, CVG)中,一句描述通常只对应一个目标,包括两个子任务:指代表达理解(Referring Expression Comprehension, REC)和指代表达分割(Referring Expression Segmentation, RES)。
然而,现实世界远比这种"一对一"的设定复杂得多。一句"所有人都穿着红色衣服"可能对应图像中的五个人;一句"图片中不存在穿蓝色衣服的人"则很可能是在描述一个不存在的目标。为了更贴近真实应用场景,研究者们提出了广义视觉定位(GVG)任务,将问题扩展到多目标和无目标场景,包括广义指代表达分割(GRES)和广义指代表达理解(GREC)。
GVG任务的核心难点在于:在一个开放且不确定的搜索空间中,模型需要为"潜在目标"和"指代表达"之间建立稳定的决策边界。这要求模型具备强大的判别能力——既要在语义层面区分相似目标,又要在空间层面准确定位每个实例。然而,现有方法在这两个方面都存在明显不足。
从语义角度看,指代表达通常很简洁,类似标签。比如集合性指代(如"everyone")要求识别共享同一类别的多个目标;修饰性表达(如"man on motorcycle")则要求在视觉相似的目标中精确区分。现有方法往往依赖句子级别的语义,通过与区域提议对齐或与视觉嵌入交互来建模复杂的图文对应关系。但现实场景中通常存在大量干扰区域,仅依赖粗粒度的文本语义,很难区分"最佳匹配目标"和"部分相关候选",容易导致定位错误或过度响应。
从空间角度看,灵活多样的表达可能指向任意数量的目标(如"all people"或"the whole group"),模型不仅需要判断目标是否存在,还要识别每个目标的个体空间位置。值得注意的是,目标数量是空间结构的一个隐含属性,其不确定性直接影响定位效果。先前方法通常预测一个全局掩码,这在本质上将多个离散目标投影到一个统一区域中。在多目标场景中,实例之间存在大量竞争和重叠,全局掩码难以提供稳定的实例级决策边界。尽管一些工作尝试通过计数头来显式预测目标数量,但目标数量的细微差异很少能有效传播回空间定位过程。
图1生动地展示了这两个问题。如图1(c)所示,当存在相似候选目标时,描述"man on motorcycle"容易错误地高亮显著性实例,而加入属性词"sitting"后就能准确定位。类似地,描述"every person"会产生冗余预测,而加入"tattoo"、"plaid shorts"或"red"等属性描述符后,定位变得正确且完整。这些观察表明,视觉属性在细粒度关系约束下,能有效缓解语义歧义,促进多目标场景中目标集合的一致且完整识别。
如图1(d)所示,仅靠实例级监督时,定位"left reaching and man in white facing backwards"会出现冗余预测,且难以在严重实例粘连下定义准确的实例边界。而通过显式建模实例中心,即使在模糊边界或部分遮挡下,也能保持实例级结构可分离性和准确定位。
基于以上分析,中科院自动化所的研究团队提出了一种新颖的语义-空间判别性增强(Semantic-Spatial Discriminability Enhancement, SSDE)框架,旨在同时提升语义和空间判别力,从而推进跨模态理解和实例级定位。
方法概述:SSDE整体架构
SSDE框架基于实例分割框架构建,整体流程如下:首先采用多模态编码器BEiT-3联合处理输入图像和指代表达,生成对齐的视觉和文本特征。随后,语义判别性增强模块(SeDE)生成带有细粒度视觉属性表示的查询,增强语义判别能力;空间判别性增强模块(SpDE)预测实例中心密度图,与实例级监督联合优化作为辅助损失,强制施加结构约束。
具体来说,编码器分为三个阶段,生成层级视觉特征。所有视觉和文本特征通过线性层投影到d维空间。研究人员进一步利用特征金字塔网络(FPN)构建多尺度视觉特征,通过转置卷积上采样和最大池化下采样,形成包含四个尺度特征的多尺度特征集。最后,一个由卷积层组成的轻量级语义解码器聚合多尺度特征为全局语义特征,进而转换为全局分割图。
实例分割图通过将全局语义特征与掩码头特征相乘,再与全局分割图合并得到最终分割预测。检测方面,框和类别头产生最终边界框预测,而存在头(Exist Head)在全局语义特征上进行二值分类,判断目标是否存在。解码器采用可变形解码器实现。
在这个整体架构中,各个模块的衔接逻辑清晰:多模态编码器负责初步的跨模态对齐,SeDE在编码器输出的基础上增强查询的语义判别力,SpDE则在空间维度提供结构约束。这两个增强模块的输出共同输入到解码器中,实现更精准的定位和分割。可以说,SeDE解决"找到谁"的问题,SpDE解决"在哪找"的问题,两者相辅相成,共同提升最终性能。
语义判别性增强:让模型学会"看细节"
文本表达通常只提供粗粒度的主体信息。为了在密集分布的相似候选场景中获得精确的判别线索,SeDE模块通过空间引导的注意力机制提取细粒度视觉属性,并将其与主体级语义表示融合,生成更具判别力的查询表示。
SeDE的工作流程分为三个步骤:文本主体语义提取、视觉属性提取和查询生成。
在文本主体语义提取阶段,研究人员引入N个可学习查询嵌入,这些嵌入通过交叉注意力机制与文本特征交互,聚合词元级语义信息,生成文本驱动的查询。同时,对文本特征进行最大池化以突出显著语义成分,产生全局上下文信息。最终的文本主体语义表示由局部词元级语义和全局上下文信息共同构成。
在视觉属性提取阶段,研究人员利用图文相似度图作为空间先验,采用空间引导的注意力机制聚焦潜在目标区域,进一步提取细粒度视觉属性。具体来说,给定视觉特征和文本特征后,首先计算跨模态相似度,然后沿文本维度进行平均池化,并通过1x1卷积获得空间相似度图。这个相似度图在训练期间由真实掩码监督,确保能准确指示目标区域。
为了将这个空间先验融入注意力机制,研究人员构建了一个偏置项,将相似度图转换为空间注意力分布。这一操作显式引导注意力聚焦于语义相关区域。基于此,研究人员引入了空间引导交叉注意力(SGCA),通过将空间偏置注入注意力对数中,增强对目标相关区域的聚合能力。最后,N个可学习的属性词元通过SGCA与视觉特征交互,从目标相关区域提取颜色、纹理、姿态等细粒度属性。
在查询生成阶段,属性特征首先通过MLP增强表达能力,然后与文本主体语义表示拼接,再通过MLP融合,生成最终的属性增强查询。这样的设计使得主体语义决定类别,而属性细节使实例级区分成为可能。
此外,研究人员还引入了一组可学习的位置嵌入,通过线性变换和sigmoid函数投影到二维空间,生成可学习的参考点。这些参考点作为可变形注意力的初始采样位置,引导对多尺度特征的稀疏且有效的特征聚合。在解码过程中,参考点、位置编码和查询特征共同输入到可变形解码器中。
空间判别性增强:实例中心密度图的妙用
为了在密集场景中增强空间判别力并缓解空间歧义,SpDE模块显式建模实例中心响应,准确表示实例级空间结构,并通过轻量级特征投影模块预测实例中心。这一过程作为辅助损失,施加实例级结构约束,确保实例间的空间可分离性,提升实例级空间判别能力。
语义问题解决了,空间问题同样棘手。想象一下,一张照片里有五个人紧紧挨在一起,甚至互相遮挡。传统方法预测一个全局掩码,这就像把五个人用一个大麻袋罩住——"是,这里有人",但到底几个人、每个人在哪,完全说不清。
SpDE模块的核心思想是:显式建模实例中心的响应,用"中心密度图"来表示每个目标的个体空间位置。目标数量是空间结构的一个隐含属性,通过建模实例中心,数量信息就自然而然地编码进了空间结构中,无需额外的计数头。
这个密度图怎么构建呢?对于每个实例掩码,先进行连通组件分析,选择最大的连通组件,计算其质心作为实例中心。然后用二维高斯核将每个离散中心扩展为连续的空间密度信号。对于多个实例,采用逐点最大操作聚合高斯响应——这保证了即使两个中心靠得很近,两个峰值也不会被"抹平",保持了实例间的可分离性。
构造密度图的具体流程如下面的算法1所示。这里选择最大连通组件作为中心依据是经过深思熟虑的——最大组件通常保留了实例最完整、最显著的结构,能提供更清晰稳定的监督信号。
算法1:实例中心密度图构建
输入:实例掩码 M = {M₁, M₂, ..., M_K},图像尺寸 (H,W),高斯参数 σ
输出:密度图 D
1: 初始化密度图:D ← 0_{H×W}
2: for 每个实例掩码 M_k ∈ M do
3: 进行连通组件分析,得到 {C_{k,1}, C_{k,2}, ..., C_{k,n_k}}
4: if n_k = 0 then continue
5: end if
6: 计算每个组件的面积 A_{k,i}
7: 选择最大组件 i* = argmax A_{k,i}
8: 提取组件像素 C_k* = C_{k,i*}
9: 计算 C_k* 的中心坐标 c_k = (c_x^k, c_y^k)
10: 生成高斯分布 G(x,y) = exp(-((x-c_x^k)² + (y-c_y^k)²) / 2σ²)
11: 更新密度图:D = max(D, G)
12: end for
13: return D
有了密度图的监督信号,接下来还需要一个轻量级的预测模块。这个模块将相似度图 S_m 通过仿射变换转换为中心导向图,再与视觉特征拼接,经过一系列逐点卷积层,最后生成实例中心预测图。整个过程不改变特征图的空间分辨率,保持了空间信息的完整性。
整个SpDE模块的设计有一个关键的洞察:它不仅有"中心预测"这个可监督的显式任务,还通过与主任务的联合训练,让"中心感知"成为特征学习的一个隐式先验——模型在提取特征时就知道"这里是目标中心"和"这里是目标边缘"是不同语义的位置,这种感知能力间接提升了定位和分割的精度。
最终的总损失函数由五部分组成:检测损失、分割损失、存在性损失、相似度图损失和实例中心密度图损失。其中相似度图损失监督S_m的准确性,实例中心密度图损失(ICDM Loss)则施加实例级结构约束。通过α和β两个超参数平衡各部分贡献。
可以这样理解:SeDE提升了"语义分辨率",让模型能区分相似的目标;SpDE提升了"空间分辨率",让模型能分清粘连的目标。两者组合,相当于给模型装上了"显微镜和量角器"。
全面超越:十个基准上的SOTA表现
方法讲得再好,最终还是要用实验结果说话。研究团队在十个广泛使用的基准数据集上进行了全面评测,覆盖了经典视觉定位(CVG)和广义视觉定位(GVG)两大类任务,包括图像级定位(REC)和像素级分割(RES)两大子任务。
首先看在RefCOCO、RefCOCO+、RefCOCOg三个数据集上的指代表达分割(RES)任务表现。SSDE在所有八个评测子集上均取得了最佳结果,相较于强基线InstanceVG(同样是基于BEiT-3的多任务方法),在RefCOCO val上从81.36提升到81.82,testA从83.05提升到83.34,testB从79.28提升到79.83。值得注意的是,在更具挑战性的RefCOCO+上,SSDE的提升更为明显——val达到77.44,testB达到74.00,相比此前的最佳方法分别提升了0.52和1.05个百分点。
为什么RefCOCO+上的提升更大?因为RefCOCO+的表达中禁止使用位置词,只允许外观属性描述。这恰恰是SeDE发挥作用的主场——通过提取颜色、纹理、姿态等细粒度视觉属性,模型即使面对"没有位置提示、只有外观描述"的困难场景,也能准确定位目标。
在指代表达理解(REC)任务上,SSDE同样表现抢眼。在RefCOCO、RefCOCO+、RefCOCOg三个数据集上,以Precision@0.5为评估指标,SSDE在多个子集上取得了最佳或第二佳的成绩。特别是在RefCOCOg的test(u)子集上,达到了78.49的精度,显著超过此前的最佳方法。
广义指代表达分割(GRES)是GVG任务的核心子任务,gRefCOCO数据集专门用于评测多目标定位能力。SSDE在此数据集上取得了显著领先:cIoU达到64.68,hIoU达到63.12,相比此前的SOTA方法InstanceVG分别提升了2.29和1.47个百分点。这个提升幅度在多目标场景中相当可观,证明了SpDE模块在实例级空间结构化方面的有效性。
在广义指代表达理解(GREC)任务上,SSDE在gRefCOCO数据集上的cIoU达到56.17,相比此前最佳方法有一定提升。这个结果表明,SSDE不仅在分割这种"精细活"上表现出色,在框级定位这种"粗活"上同样可靠。
R-RefCOCO系列数据集引入了"表达描述的目标不存在"的场景,考验模型的"拒识"能力。SSDE在此类数据上同样取得了最佳表现。Ref-ZOM数据集则更极端——所有表达都指向"零个或多个目标",完全不提供单目标标注,SSDE在此数据集上的优异表现证明了其应对开放数量场景的能力。
直观感受一下实际效果。下面的可视化展示了SSDE在多个数据集上的预测结果、相似度图和实例中心预测。
消融实验揭示的关键设计选择
SSDE能取得如此全面的提升,到底是哪个模块的功劳?消融实验给出了清晰答案。
首先看模块级消融(表4)。完整模型在gRefCOCO上(GRES任务)取得最优结果。移除SeDE模块后,cIoU明显下降——这表明语义判别性增强对多目标定位至关重要。移除SpDE模块后性能同样下降,说明空间结构约束不可或缺。两个模块同时移除后性能大幅退化,验证了"语义+空间"双通道增强的设计合理性。
表5对SeDE内部的各组件进行了更细粒度的消融。逐一移除视觉属性提取、空间引导注意力、属性融合等组件,性能均有不同程度的下降。这说明SeDE的每一个设计环节都在发挥实际作用,而非简单的堆砌。
表6展示了SpDE内部的消融结果,关键发现是实例中心密度图的质量直接影响性能。表10则进一步探讨了实例中心的确定方式:选择最大连通组件的质心作为中心,优于使用完整掩码的质心或最小外接矩形的中心。原因在于最大连通组件排除了碎片化噪声的影响,提供了更稳定、更清晰的结构信号。
表11对损失函数中的权重系数α和β进行了敏感性分析,结果表明这两个超参数在较宽范围内都表现稳定,说明方法对超参数不敏感,易于复现和调优。表12验证了各损失项的必要性,移除任一损失项都会导致性能下降。表13则探讨了查询数量对性能的影响,发现过多的查询反而会引入冗余信息,适中的查询数量效果最佳。
总结与展望:迈向更精细的视觉定位
SSDE框架的贡献可以概括为一句话:通过"语义判别性增强"和"空间判别性增强"的双通道设计,同时解决了广义视觉定位中"相似目标难区分"和"多目标空间结构难刻画"两大核心挑战。
龙迷三问
这篇论文到底在解决什么问题? 中科院自动化所提出SSDE框架,通过语义判别性增强和空间判别性增强两大模块,分别解决广义视觉定位中相似目标易混淆和空间结构不清晰的问题,在十个经典与广义视觉定位基准上刷新SOTA。
这篇工作最值得看的点是什么? 在十个数据集上均取得最优性能,在经典和广义视觉定位任务上全面超越现有方法,包括基于大语言模型的方法和专用方法。
这篇工作的边界或风险在哪里? 优点:1) 从语义和空间两个维度系统性地提升判别性,思路清晰;2) SeDE模块通过空间引导的交叉注意力有效提取细粒度视觉属性;3) SpDE模块通过实例中心密度图提供实例级结构约束;4) 在多个基准上取得显著提升。缺点:1) 依赖实例分割标注构建密度图,限制了在无实例标注场景的应用;2) 方法复杂度较高,需要多任务联合训练;3) 对超参数(如损失权重)较为敏感。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~ 龙哥点评
论文创新性分数: ★★★★☆
提出语义-空间判别性增强(SSDE)框架,通过语义判别性增强模块(SeDE)利用空间引导的交叉注意力提取细粒度视觉属性,以及空间判别性增强模块(SpDE)建模实例中心密度图作为辅助监督,联合提升广义视觉定位中的跨模态理解和实例级定位能力。
实验合理度: ★★★★☆
REC任务使用Precision@0.5,RES任务使用mIoU,GREC任务使用F1score和N-acc.,GRES任务使用gIoU、cIoU、oIoU、mIoU、mRR、rIoU等
学术研究价值: ★★★★☆
提出语义-空间判别性增强(SSDE)框架,通过语义判别性增强模块(SeDE)利用空间引导的交叉注意力提取细粒度视觉属性,以及空间判别性增强模块(SpDE)建模实例中心密度图作为辅助监督,联合提升广义视。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
183.85M参数,119.34 GFlops
复现难度: ★★★☆☆
https://github.com/Letitialky/GVG-SSDE
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1) 依赖实例分割标注构建密度图,限制了在无实例标注场景的应用;2) 方法复杂度较高,需要多任务联合训练;
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!