← 返回 PaperDaily 视觉与图像

最新SOTA攻击:SAM3概念分割被一招打崩,Mask AP暴跌40.7

SAM3把分割从“几何抠图”进化成了“概念理解”,可越聪明的东西往往越怕被人抓住命门。这篇来自中科大、江南大学等团队的工作,首次为SAM3量身定制了跨概念通用对抗攻击UCD,一张扰动让五个数据集平均Mask AP从59.43直接被干到18.73,还顺手迁移到了SAM3.1和视频推理。AI安全方向的硬核活,值得好好拆解。

最新SOTA攻击:SAM3概念分割被一招打崩,Mask AP暴跌40.7
原论文信息如下:
论文标题:
Universal Concept Disruption for SAM3 Image Segmentation(SAM3图像分割的通用概念破坏)
发表日期:
2026年08月
发表单位:
中国科学技术大学、江南大学
原文链接:
https://arxiv.org/pdf/2608.05983v1.pdf
龙哥导读:SAM3刚把“分割”从几何抠图升级成概念理解,就被人抓住命门一顿暴揍。一张肉眼几乎看不出差别的扰动,能让最先进的分割大模型把眼前的物体当作不存在,五大数据集评分全线崩溃。AI安全这场攻防战,永远比你想象的更精彩。
图1:通用概念破坏方法概述图
图1:通用概念破坏(UCD)在输入、特征和输出三个层面攻击SAM3,同时优化一个跨提示共享的图像空间扰动。

SAM3概念分割的脆弱性:首个通用概念破坏攻击

先聊点背景。SAM(Segment Anything Model)系列在视觉大模型中的地位,基本相当于GPT在语言模型中的地位。最初的SAM在2023年发布,靠点、框、涂鸦等提示就能分割图像中的任意物体;SAM2在2025年进一步引入时间感知,支持视频分割;而这篇论文的主角SAM3(Carion et al. 2025),则把范式彻底换了一套——从“几何驱动的掩码预测”转向了开放词汇概念分割
所谓概念分割,简单说就是:你给模型一句“餐桌上的红酒杯”,它不仅要在图像里找到红酒杯,还得把所有匹配这一概念的实例都分割出来。这背后的关键在于,SAM3不再依赖外部CLIP检测器来提供空间提示,而是将类似感知编码器(Perception Encoder,PE)的视觉-语言表征集成到一个统一的文本条件接地架构中,并在SA-Co数据集上端到端训练。更关键的是,SAM3在输出侧引入了一个presence token(存在性标记)——模型先判断“这个概念在不在图里”,如果判断为不在,则全局压制所有候选掩码的分数。这个设计让SAM3在开放词汇分割上显著提升了概念级预测的鲁棒性,但也暴露了一个此前从未被研究的攻击面。
为什么说这是个全新的攻击面?以往针对SAM的攻击,比如DarkSAM和AttackSAM,都是让模型“分割不出东西”或“分割错地方”;针对SAM2的UAP-SAM2进一步考虑了视频记忆和跨帧提示复用。但SAM3的失败模式多了一种:即使几何分割基本正确,只要模型认为“概念不存在”,所有候选都会被一票否决。换句话说,攻击者不一定要破坏掩码的质量,只要破坏概念存在性判断,就能让整个分割任务失效。而现有的SAM、SAM2攻击方法完全没考虑这一层。
正是基于这一观察,来自中国科学技术大学和江南大学的研究团队提出了UCD(Universal Concept Disruption,通用概念破坏)——这是首个专门针对SAM3图像分割设计的跨概念通用对抗攻击。UCD的核心思路是:别再拿旧的几何攻击套路硬套了,直接把SAM3当作一个“概念接地系统”来打。它学习一个单一的、有界扰动(perturbation),这个扰动在训练和数据上都具备通用性——训练时在少量图像-名词短语对上优化,测试时可以直接应用到任意图像和任意文本提示上。
先梳理一下SAM3的推理路径。本文用公式表示如下:图像经过骨干网络编码得到视觉特征F,文本经过文本编码器得到查询向量q,然后接地头(grounding head)同时输出候选集和presence logit。这里O包含了每个候选的原始query logit、边界框和掩码logit图。对于每个候选,最终的概念分数就是query概率与presence概率的乘积:
公式1:SAM3简化图像推理路径
公式1:SAM3简化图像推理路径。F为图像骨干网络输出的视觉特征,q为文本编码器输出的查询向量,(O, p)为接地头输出的候选集与存在性logit。
公式2:概念分数计算
公式2:最终概念分数等于查询概率与存在性概率的乘积。这意味着只要presence概率趋近于0,即使某个候选的查询置信度很高,也会被整体压制。

三级联合攻击机制:从输入到特征再到输出

搞清楚SAM3的机制后,UCD的设计就顺理成章了。正如前面所说,一个概念查询在SAM3中要经过层层决策:图像要产生匹配名词短语的特征、接地头要在全局存在性开关下给出高候选分数、保留下来的候选还要有可用的掩码几何。任何一个环节被破坏,最终的概念分割都可能失败。但单点攻击效果有限——扰动可能改变了低层图像特征却不改变最终概念决策;或者压低了分数但仍有掩码幸存且空间上还说得过去。因此UCD选择在三个层面同时发力。

输入级:激活真实文本条件路径

先看输入级。以往针对SAM的攻击要么用点网格、要么用框作为训练提示,但SAM3的推理主路径是文本条件接地。UCD直接使用真实的(图像,名词短语)配对来训练扰动,而不是几何提示网格。这样优化过程中激活的正是SAM3推理时使用的文本条件概念路径,而不是把任务退化成与提示无关的掩码破坏。

特征级:扰动共享视觉表征,提升跨概念迁移

特征级攻击解决的是“泛化”问题。概念分割基准中的文本提示千变万化,如果扰动只对训练时见过的几个名词短语有效,那这个攻击就没啥实际威胁。但SAM3的图像骨干网络是跨所有文本提示共享的。UCD通过最大化干净图像与对抗图像在骨干网络特征金字塔网络(FPN)最后一层特征图上的归一化差异,让扰动作用于提示无关的共享视觉表征。这样即使遇到训练时没见过的概念,扰动也能造成特征层面的错乱。
公式11:特征分歧最大化
公式11:特征分歧损失,最大化对抗图像与干净图像在骨干网络特征图上的归一化L2距离。

输出级:三重损失压制概念决策、坍塌掩码几何

输出级攻击是UCD最核心的贡献。它包含三个协同的损失项,分别针对SAM3概念决策的不同层面。
第一项是分数压制损失(score loss)。UCD直接攻击后处理阶段的最终概念分数阈值:对对抗样本中分数最高的k个候选,惩罚它们超过预设边界的部分。这项设计同时考虑到了query置信度和presence置信度,攻击的是“概念存在性判断”这个整体。
公式6:分数压制损失
公式6:分数压制损失,对TopK候选的最终概念分数进行阈值惩罚。
但光压低分数还不够——万一某个候选还是顽强地超过了阈值呢?于是有了第二项掩码区域坍塌损失(mask area loss)。这项损失直接惩罚对抗样本中高分候选的掩码总面积,鼓励它们缩小到几乎不覆盖目标概念的程度。
公式7:掩码区域坍塌损失
公式7:掩码区域坍塌损失,使高置信候选的掩码面积尽可能小。
第三项Dice破坏损失(Dice disruption loss)则更进一步:即使掩码没有完全消失,也要让它与干净图像中所有高分实例的空间分布不再重叠。具体做法是计算对抗样本中每个TopK掩码与干净样本中所有TopK掩码的最大Dice相似度,然后最小化这个最大相似度。如果当前对抗掩码跑到目标物体旁边去了,这项损失就会把它推开。
公式8:干净高分掩码集合
公式8:存储干净图像中高分掩码集合,供后续Dice破坏损失使用。
公式9:Dice相似度定义
公式9:Dice相似度定义,η为平滑项。
公式10:Dice破坏损失
公式10:Dice破坏损失,最小化对抗掩码与干净高分掩码之间的最大Dice相似度。
整体优化目标将输出级三个损失加权求和,再减去特征分歧项,共同约束一个在L∞范数边界内的通用扰动。优化采用Adam优化器,每一步更新后把扰动裁剪回允许范围内。
公式5:UCD整体优化目标
公式5:UCD整体优化目标,包含输出级三项损失与特征分歧项。
值得一提的是,UCD的训练目标聚焦于正向提示(概念存在于图像中)的场景,目标是让“存在”变成“不存在”或“不可用”。对于负向提示(概念本就不存在于图像中),沿用正向提示的损失函数是不合理的——因为攻击者并不追求把不存在的东西激活成存在(那是另一类false-positive威胁模型)。这种明确的定位让UCD的攻击目标更聚焦。

跨数据集与跨模型验证:攻击效力的全面展示

实验部分,团队在五个数据集上对UCD进行了全面评估:SACo-Gold(SAM3官方发布的提示概念分割基准,同时包含正负名词短语)、LVIS(开放词汇类别分割)、RefCOCO(指代表达分割)、PhraseCut(短语接地分割)和OpenImages(开放词汇分割)。评估指标包含COCO风格的掩码AP(Mask AP)、边界框AP(Box AP),以及SAM3官方的概念接地F1分数(concept grounding F1,简称cgF1)。
为了确保对比公平,所有的基线攻击——包括DarkSAM、S-RA、UAPGD、UAP-SAM2、CPA、GRAT——都被统一调整为相同的通用扰动设置:相同的训练集划分、相同的随机种子、相同的优化预算(训练数据为50张LVIS训练图+50张SACo-Silver图像)、相同的评估流程。UCD只在这100张图像上训练扰动,然后在完全不同的测试样本上评估。
表1:与SAM3适配基线攻击在统一通用扰动训练预算下的对比
表1:与SAM3适配基线攻击在统一通用扰动训练预算下的对比。报告COCO风格Mask AP(%)、五个数据集平均边界框AP(%)以及有负提示数据集上的概念接地F1(cgF1,%)。Clean为未受攻击的SAM3性能,攻击效果越强数值越低,最优攻击加粗显示。
结果非常直观。UCD在五个数据集上全面碾压所有基线:平均Mask AP从干净的59.43降至18.73,而最强基线GRAT只能降到21.76,CPA只降到47.54。同样的趋势在Box AP上也成立——UCD将平均Box AP从60.35降到17.77,GRAT只有21.83。在概念感知识别方面,UCD将平均cgF1从50.32压到20.49,在SACo-Gold和LVIS上都取得了最低的对抗cgF1。
值得注意的细节是:SAM/SAM2风格和通用扰动基线(DarkSAM、S-RA、UAPGD、UAP-SAM2)对SAM3几乎没有效果,有些甚至让AP略微回升。这说明过去对付SAM系列的老办法在SAM3面前确实行不通了,针对概念评分机制的定向攻击才是正解。
消融实验方面,团队分别验证了各损失组件的贡献、概念决策目标的选择、训练提示形式的影响、图像-文本配对数量的影响以及扰动预算的影响。
表2:UCD损失组件消融;表3:概念决策目标消融
表2:UCD损失组件消融;表3:概念决策目标消融。数值均为对抗后的百分比。
有意思的是,去除特征分歧项后攻击强度大幅下降,说明特征扰动是跨概念迁移的关键驱动力;而单独攻击query置信度或presence概率都不如攻击两者结合(即最终概念分数)有效。
表4:训练提示形式消融
表4:训练提示形式消融。评估时统一使用文本提示,稀疏点网格为4×4,密集点网格为8×8。
表5:图像-文本配对数量消融
表5:图像-文本配对数量消融。4 prompts (shuffled)表示全局打乱图像与提示的对应关系。
表6:扰动预算消融;表7:从SAM3到SAM3.1的黑盒迁移
表6:扰动预算消融;表7:从SAM3到SAM3.1的黑盒迁移,扰动在SAM3上训练后直接评估SAM3.1,不重新优化。
跨模型迁移的结果尤其值得关注。SAM3训练的扰动直接迁移到SAM3.1,平均Mask AP从45.75降至13.66,完全不需要重新优化——这验证了prompt-shared图像特征、presence-gated分数和掩码几何确实是SAM3家族共享的稳定攻击面。更惊人的是图像到视频的迁移能力:只攻击视频第一帧,就能让后续干净帧的尾部性能下降4.00 Mask AP;攻击前14帧,尾部(最后一帧)的TETA评估指标下降13.46个点。这说明视频记忆机制会把前缀帧的扰动“传导”到后续帧。
图2:SACo-VEval上的图像到视频迁移
图2:SACo-VEval上的图像到视频迁移。仅用图像目标训练的通用扰动被施加到15帧视频片段的前k帧,代表性视频指标只在剩余的干净尾部帧上计算。更大的下降表示更强的时序迁移能力。

防御措施评估:现有防御为何难以奏效

既然是安全攻防研究,论文也认真评估了三种具有代表性的防御策略:提示集成、对抗头微调和时间一致性过滤。这三种策略分别对应推理期、训练期和视频后处理三个阶段。
提示集成的思路很直接:既然UCD是在文本条件路径上做的攻击,那就多换几种方式描述同一个概念(比如“一张照片里的猫”、“所有的猫”、“可见的猫”),然后把多种表述的预测结果融合投票。这个策略一定程度上能缓解UCD对单一词汇形态的过拟合,但恢复能力有限——因为UCD的核心破坏点其实是对共享视觉特征和presence gate的攻击,换措辞并不能从根本上修复被扰乱的视觉表征。
对抗头微调则是冻结图像骨干和文本编码器,只微调接地头和presence分数层,让模型在干净和UCD扰动样本上重新学习正确的概念分数和掩码分配。这个防御确实恢复了一些性能,但论文还做了自适应攻击评估——攻击者重新在微调后的模型上训练新的UCD扰动,结果显示恢复的鲁棒性在自适应攻击下不能完全保持。
时间一致性过滤针对的是视频场景,通过滑动窗口的中位分数和掩码空间一致性来拒绝时间上不稳定的概念轨迹。但UCD的幂在于前缀攻击可以污染视频记忆,让干净的后续帧也产生不稳定的轨迹。过滤机制虽然能去掉部分抖动的掩码,但也会误伤正常轨迹。
表8:防御导向的图像评估;表9:图像到视频迁移的时间一致性过滤
表8:防御导向的图像评估(固定UCD为表1训练好的扰动;自适应UCD针对微调后的头重新训练);表9:时间一致性过滤用于图像到视频迁移的尾部帧Mask AP结果。
总体来看,这三种防御能带来一定程度的缓解,但没有一种能真正防住UCD。这从侧面说明,对抗鲁棒性是一个系统性的问题——只修补某一个组件而不改变整体架构的脆弱性,很难从根本上解决问题。

研究启示与未来方向

这项研究最直接的启示是:AI模型越“智能”、越依赖高层语义判断,其攻击面就越隐蔽也越致命。SAM3的presence token设计在生产环境里提升了概念分割的可靠性,但也恰恰成为最脆弱的攻击点——攻击者甚至不需要让掩码完全失效,只要干扰这个“存在性开关”,整个系统就会崩溃。
从更深远的角度看,UCD也为大模型安全研究提供了几个值得探索的方向。一是false-positive攻击(激活不存在的概念)与false-negative攻击的对称性——本文聚焦后者,但前者的威胁模型在深度伪造检测等场景中可能更危险;二是跨模态攻击的迁移性——既然图像扰动能跨模型、跨任务迁移,那么文本侧的对抗提示是否也能对SAM3产生类似效果?三是防御设计的重新思考——拒绝服务式的输入过滤可能比事后恢复更有效。
当然,本研究也存在局限性。UCD目前主要针对正向概念提示的消失和破坏,对“从无到有”的false-positive攻击未作深入探索;在视频场景中,虽然验证了前缀攻击的记忆传导效应,但尚未系统研究针对整段视频的逐帧自适应攻击。扰动预算8/255在物理世界攻击中也可能受到数字-物理域差距的影响。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文介绍一项针对SAM3图像分割模型的通用跨概念对抗攻击UCD。该攻击学习单一有界扰动,三级联合破坏概念判定,使五数据集平均Mask AP从59.43暴跌至18.73,且黑盒迁移…
这篇工作最值得看的点是什么?UCD在所有五个数据集上均优于所有基线,平均Mask AP从59.43降至18.73(最强基线GRAT为21.76),平均cgF1从50.32降至20.49,平均Box AP从60.35降至17.77
这篇工作的边界或风险在哪里?优点:首次针对SAM3概念分割提出专门攻击,三级联合攻击机制设计合理,跨数据集、跨模型(SAM3.1)、跨任务(图像到视频)迁移性强,消融实验全面。缺点:仅针对正向提示(概念存在)场景,未覆盖负向提示的假阳性攻击;防御评估显示轻量级头部微…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出首个针对SAM3开放词汇概念分割的跨概念通用对抗攻击UCD,通过联合扰动文本条件输入路径、最大化提示共享视觉特征发散、抑制存在门控概念分数并破坏保留掩码的空间有效性,实现概念级攻击。

实验合理度:★★★★☆

COCO风格Mask AP、Box AP、概念感知F1(cgF1)、TETA(视频)

学术研究价值:★★★★☆

提出首个针对SAM3开放词汇概念分割的跨概念通用对抗攻击UCD,通过联合扰动文本条件输入路径、最大化提示共享视觉特征发散、抑制存在门控概念分数并破坏保留掩码的空间有效性,实现概念级攻击。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练在单张NVIDIA RTX A6000 GPU上进行,训练集为50张LVIS-train图像和50张SACo-Silver图像,每张图像最多4个正向名词短语,训练1个epoch

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:仅针对正向提示(概念存在)场景,未覆盖负向提示的假阳性攻击;防御评估显示轻量级头部微调可部分恢复性能,说明攻击对模型微调敏感;训练数据量较小(100张图像),可能影响泛化性。

主要参考文献

[1] Carion, N. et al. SAM3: Segment Anything in 3D Concept Spaces. 2025.
[2] Kirillov, A. et al. Segment Anything. ICCV 2023.
[3] Ravi, N. et al. SAM 2: Segment Anything in Images and Videos. ICLR 2025.
[4] Moosavi-Dezfooli, S.-M. et al. Universal Adversarial Perturbations. CVPR 2017.
[5] Radford, A. et al. Learning Transferable Visual Models From Natural Language Supervision. ICML 2021.
[6] Zhou, Z. et al. Dark-SAM: Towards Segment Anything Model Dark Image Segmentation. 2024.
[7] Long, C. et al. CPA: Concept Perturbation Attack. 2025.
[8] Gupta, A., Dollar, P., Girshick, R. LVIS: A Dataset for Large Vocabulary Instance Segmentation. CVPR 2019.
[9] Kazemzadeh, S. et al. ReferItGame: Referring to Objects in Photographs of Natural Scenes. EMNLP 2014.
[10] Kuznetsova, A. et al. The Open Images Dataset V4. IJCV 2020.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
一张扰动图,五大数据集集体“失忆”,SAM3的“存在性开关”就这么被拿捏了!😏 研究AI安全、图像分割、对抗攻击的朋友,快进群一起唠唠!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像分割+上海+中科大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。