← 返回 PaperDaily 视觉与图像

厦门大学新方法:跨图像提示让SAM3更懂伪装目标

伪装目标分割最烦人的地方,不是模型不够大,而是提示一旦打偏,结果就直接跑偏。GFR-SAM干脆把“点提示”换成“跨图像示例”,再用过滤和细化兜底,思路很顺,工程味也很足。

厦门大学新方法:跨图像提示让SAM3更懂伪装目标
原论文信息如下:
论文标题:
GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting
发表日期:
2026年07月
发表单位:
厦门大学,厦门理工学院
原文链接:
https://arxiv.org/pdf/2607.11732v1.pdf

目标检测新范式:不训练也能精准分割伪装目标

伪装目标分割最难的地方,不是“看见”目标,而是看见了也不敢认。目标和背景长得太像,传统模型一旦提示点稍微偏一点,结果就可能直接翻车。更麻烦的是,很多方法还得重新训练,数据标注一堆,工程成本也不低。GFR-SAM的思路很直接:既然点提示这么脆,就别把命门交给点了,干脆改成跨图像示例驱动,先生成,再过滤,最后细化。
封面
图1:GFR-SAM的整体思路。它不是靠一个脆弱的点去赌运气,而是把参考图像当“上下文示例”,先找候选,再做语义筛选,最后用几何和文本共同修边。
这篇工作最有意思的地方,在于它没有继续卷“再加一个更聪明的点提示器”,而是直接换了一种范式。这里的 SAM3 指的是 Segment Anything Model 3,中文可理解为“通用分割基础模型3”DINOv3 则是 一种自监督视觉表征骨干网络,用来提取更稳的图像特征。论文把这两个基础模型拼起来,但没有做额外训练,主打一个“拿来就用”。
更直白一点说,过去很多训练免费方法像是在黑夜里拿手电筒找目标,光点照到哪儿就分哪儿;GFR-SAM则更像拿着一张参考照片,先让模型“知道自己在找什么”,再去目标图里全局搜。这个差别看着不大,实际效果往往是两回事。
要理解这种范式转换的价值,需要先回顾一下传统训练免费方法的工作方式。以PerSAM为代表的一类方法,通常先利用参考图像和目标图像之间的特征相似度,在目标图像上生成一组“提示点”,然后将这些点输入给SAM,由SAM完成最终的分割。这个流程看似简单,但有一个致命弱点:相似度热图的质量直接决定了提示点的位置,而在伪装场景中,由于前景与背景的纹理、颜色高度接近,相似度热图往往非常模糊,峰值位置不稳定。这就导致生成的提示点可能落在目标边缘甚至背景上,SAM再强大,面对错误的提示也无能为力。GFR-SAM的贡献在于,它从根本上绕开了这个“点生成”的脆弱环节,不再试图用稀疏的点来概括目标的全部信息,而是用一整张参考图像及其掩码来构建一个更丰富的“视觉原型”,然后让模型在目标图像中寻找与这个原型最匹配的区域。

告别“点”的脆弱:用上下文示例实现鲁棒跨图像推理

先说清楚一个基础概念:所谓“referring camouflaged object segmentation”,就是“参考式伪装目标分割”。不是把图里所有伪装物都找出来,而是根据参考图、文本或者其他提示,去分割用户真正关心的那一个目标。这个任务比普通伪装检测更难,因为它既要识别“像背景的对象”,又要分清“到底是哪一个对象”。
论文先把问题拆开:传统训练免费方法依赖少量点提示,先根据参考图和目标图之间的相似度生成点,再把点喂给 SAM。这条路的最大问题是,伪装场景里前景和背景边界本来就糊,点只要偏个几像素,模型就可能把背景当成目标,或者只分出一小块残片。说白了,点提示太娇气,在这种任务里经常不够用。
图2:生成-过滤-细化框架总流程
图2:GFR-SAM的三阶段总流程。左边是参考图像,中间是候选生成,右边是过滤和细化。橙色箭头表示参考信息流,绿色箭头表示目标图像信息流。
GFR-SAM的第一步叫 Ice-Seg,全称是 In-Context Exemplar-guided Segmentation,中文可理解为“上下文示例引导分割”。这里的“in-context”不是玄学词,意思是把参考图像当作上下文示例,让模型从参考图中提炼出目标的视觉原型,再拿这个原型去目标图里做跨图像推理。它的关键不是“点在哪里”,而是“这个东西长什么样”。
Ice-Seg的具体实现并不复杂,但其设计思路非常巧妙。它首先利用一个预训练的视觉编码器(论文中使用了DINOv2或类似模型)分别提取参考图像和目标图像的特征。对于参考图像,由于我们已知其对应的掩码(即目标在参考图中的精确位置),Ice-Seg会利用这个掩码,对参考图像的特征图进行“掩码平均池化”,得到一个代表目标视觉特征的“参考原型”。这个原型是一个高维向量,它编码了目标的颜色、纹理、形状等关键视觉信息。随后,Ice-Seg将这个参考原型与目标图像的每一个空间位置的特征进行余弦相似度计算,得到一张“相似度热图”。热图中响应值高的区域,就是与参考目标视觉上最相似的区域。最后,Ice-Seg对这张热图进行阈值化处理,得到一组候选掩码。这些候选掩码就是目标图像中所有可能与参考目标相似的区域。
这一步里最关键的小改动叫 MSG,全称是 Mask-guided Spatial Gating,中文是“掩码引导的空间门控”。它的作用很朴素:先用参考图的掩码把背景特征挡掉,再去做特征池化。因为参考框里往往不只有目标,还会混进一部分背景,如果直接做区域池化,最后得到的“参考原型”就会脏。MSG相当于先给参考图做一次“去背景洗脸”,让原型更干净。
MSG的实现细节值得展开。在标准的掩码平均池化中,我们会对掩码区域内的所有特征向量取平均。但问题在于,参考图像的掩码往往不是完美的,尤其是在边界区域,掩码可能包含少量背景像素。这些背景像素的特征会污染最终的参考原型,导致后续的相似度计算出现偏差。MSG的解决方案是:在池化之前,先对参考图像的特征图进行一次“空间门控”。具体来说,它利用参考掩码生成一个权重图,掩码内部的像素权重为1,掩码外部的像素权重为0。然后,将这个权重图与参考图像的特征图逐元素相乘,从而将背景区域的特征“归零”。最后,再对经过门控后的特征图进行全局平均池化。这个简单的操作,能够显著提升参考原型的纯净度,从而让后续的跨图像匹配更加精准。
图5:有无MSG的相似度热图对比
图5:有无MSG时,参考原型与目标图特征的相似度热图对比。没有MSG时,响应会散到背景里;加上MSG后,热区明显更集中,说明参考表示更纯。
这里还有一个很重要的细节:跨图像任务里,参考图上的位置坐标其实没什么意义。目标在参考图左上角,不代表在待分割图里也在左上角。所以论文直接丢掉了位置相关的几何编码,只保留视觉原型,让模型专注于“像不像”,而不是“在哪儿”。这一步看似简单,实际上是从“局部点匹配”转向“全局视觉对齐”的关键转折。
第二步是 RGCF,全称是 Region-Global Contrastive Filtering,中文是“区域-全局对比过滤”。这一步做的事情也很好懂:Ice-Seg 会先吐出一堆候选掩码,但伪装场景里候选多半不干净,里面可能混着背景块、相似纹理或者别的干扰物。RGCF不急着拍板,而是给每个候选打分,看看它和参考原型到底有多像,同时又是否真的比全局背景更“突出”。
这里用到的视觉骨干是 DINOv3。论文先从参考图里做掩码平均池化,提取出一个参考原型,再和目标图的每个位置做余弦相似度,得到一张相似度热图。随后,对每个候选掩码计算区域内的平均响应,并再除以全局平均响应,形成一个“区域相对全局”的对比分数。这个分数的直觉很简单:真正的目标,不只是在局部像,还应该在全局背景里更显眼
RGCF的对比分数设计是该方法的一个亮点。它不仅仅看候选区域与参考原型的绝对相似度,还引入了“全局背景”作为对比项。具体来说,对于每一个候选掩码,RGCF会计算两个值:一是该掩码区域内所有像素在相似度热图上的平均响应值,记为S_region;二是整张相似度热图的全局平均响应值,记为S_global。最终的对比分数定义为 S_region / S_global。这个比值越大,说明该候选区域不仅与参考原型高度相似,而且这种相似性在整张图中是“鹤立鸡群”的,因此它更有可能是真正的目标。反之,如果一个候选区域的S_region很高,但S_global也很高,说明整张图到处都有与参考原型相似的区域,那么这个候选区域很可能只是背景纹理的误检。通过这种对比机制,RGCF能够有效抑制那些虽然局部相似但全局不突出的干扰项。
图3:中间结果与最终结果可视化
图3:中间候选、RGCF选出的Top-1掩码,以及最终细化结果的可视化。红框标出了被选中的候选,它会作为后续细化的几何提示。
第三步是 GSR,全称是 Geometric-Semantic Refinement,中文是“几何-语义细化”。这一步的逻辑很像“最后再补一刀”:先把RGCF选出的Top-1掩码转成边界框,再结合类别文本提示,让SAM3利用几何位置和语义身份去补全边界、找回被漏掉的同类实例。伪装场景里常见的问题不是“一个都找不到”,而是“找到了但不完整”或者“只找到了其中一部分”。GSR就是专门来修这种毛边和漏检的。
GSR的设计体现了对SAM3模型能力的深刻理解。SAM3本身是一个强大的分割模型,但它需要明确的提示。在GFR-SAM的前两步中,我们已经获得了“目标在哪里”的粗略信息(边界框)和“目标是什么”的语义信息(类别文本)。GSR的作用就是将这两个信息整合成SAM3能够理解的提示。具体来说,它将RGCF选出的Top-1掩码的最小外接矩形作为“边界框提示”,同时将用户提供的类别名称(例如“鱼”、“石头”)作为“文本提示”,一并输入给SAM3。SAM3利用其强大的上下文理解能力,在边界框限定的区域内,结合文本语义,生成一个更加精细、完整的分割掩码。这个过程能够有效修复Ice-Seg和RGCF阶段可能产生的边缘锯齿、内部空洞以及漏检的细小部分。
如果把整个流程翻译成人话,就是:先用参考图告诉模型“找谁”,再用全局对比告诉模型“哪个候选最靠谱”,最后再用边界框和文本告诉模型“把它抠完整”。这三步彼此独立又互相补位,前面负责召回,后面负责精修,思路很像一个靠谱的工程系统,而不是单点赌命。

“生成-过滤-细化”三阶段流水线:如何一步步锁定目标

这篇论文的核心,不是某个单独模块多花哨,而是把三个模块串成了一条很顺的流水线。第一阶段负责“广撒网”,第二阶段负责“去噪音”,第三阶段负责“补细节”。这种设计的妙处在于:每一步都只做自己最擅长的事,不让一个模块又找目标、又判真假、又修边界,最后把自己搞成四不像。
流程上,Ice-Seg先产生多个候选掩码,这一步强调的是召回,因为伪装目标很容易漏。RGCF再对候选做排序,强调的是可信度,避免把背景误选成目标。最后GSR借助边界框和文本做细化,强调的是完整性,尽量把同类实例都找出来,同时把边缘修干净。
这种拆分还有一个工程上的好处:每一步都可以单独分析、单独调参、单独替换。例如RGCF里Top-1和Top-K的选择,就直接影响“宁可漏一点,还是宁可多一点”的偏好;GSR里的阈值τ,则决定了最后是更保守还是更激进。论文并没有把所有东西塞进一个大黑盒,而是把决策点摊开了,便于理解,也便于后续迁移到别的任务。
从模块间的信息流来看,Ice-Seg的输出(候选掩码集合)是RGCF的输入;RGCF的输出(Top-1掩码及其边界框)是GSR的输入。这种串行结构保证了信息的有序传递,避免了不同模块之间的信息冲突。同时,每个模块的输入输出都是明确的、可解释的中间结果,这使得整个系统的调试和优化变得相对容易。例如,如果发现最终分割结果中存在大量漏检,可以回溯到Ice-Seg阶段,检查其阈值设置是否过于严格;如果发现分割结果中存在大量误检,则可以检查RGCF的对比分数阈值是否合理。
图6:不同K值下RGCF的消融结果
图6:RGCF在不同候选数量K下的消融结果。保留全部候选会引入噪声,而只保留Top-1又会让多目标召回受限。
论文还专门分析了阈值和shot数量的影响。这里的 shot 可以理解为参考示例的数量。理论上,参考越多,信息越全;但在伪装任务里,参考太多不一定更好,因为不同参考之间可能引入风格差异,甚至把模型带偏。实验里也确实能看到,数量不是越大越香,关键还是看参考是否足够干净、是否与目标语义对齐。
关于shot数量的实验非常有趣。论文测试了使用1-shot、2-shot和3-shot(即1张、2张和3张参考图像)的情况。直觉上,更多的参考图像应该提供更丰富的目标信息,从而提升分割性能。但实验结果表明,2-shot的性能通常优于1-shot,但3-shot的性能反而可能下降。论文分析认为,这是因为当参考图像数量增多时,不同参考图像之间可能存在较大的视觉差异(例如,同一只鸟在不同角度、不同光照下的外观差异),这些差异会使得提取出的“平均原型”变得模糊,反而降低了与目标图像中特定实例的匹配度。这个发现提醒我们,在跨图像提示中,“质”比“量”更重要,选择一张高质量、与目标高度相似的参考图像,可能比使用多张质量参差不齐的参考图像效果更好。
表1:与最新方法的比较
表1:与近期全监督方法和训练免费方法的对比。可以看到,GFR-SAM在训练免费路线里把成绩拉到了很高的位置,甚至已经逼近甚至超过部分全监督方法。

性能炸裂:免训练方法性能超越部分全监督模型

先看结果,再谈原因。论文在 R2C7K 基准上做了比较,训练免费方法里,GFR-SAM拿到了非常靠前的成绩:结构指标、加权F值都冲到了第一梯队,而且在若干指标上已经压过了不少全监督方法。这里最值得注意的不是“比某个方法高了零点几”,而是它在完全不训练的前提下,居然能把伪装场景做得这么稳,这就很难再用“只是demo好看”来敷衍了。
图4:与多种方法的定性对比
图4:GFR-SAM与T-REX2+SAM3、IPSeg、Matcher、PerSAM、PPO等方法的定性对比。可以看到,在低对比度、遮挡、多目标等场景下,GFR-SAM的轮廓更完整,漏检和溢出也更少。
为什么它能赢?原因其实和设计一一对应。Ice-Seg解决的是“从哪儿开始找”的问题,避免了点提示对局部位置的过度依赖;RGCF解决的是“别把背景当目标”的问题,避免候选太多时误判;GSR解决的是“别只找到半截”的问题,补上多实例和边界细节。换句话说,它不是靠某个单点魔法,而是靠三个环节把训练免费方法最容易翻车的地方逐个堵上。
消融实验也挺有说服力。去掉MSG后,性能会大幅掉队,说明参考原型里混入背景噪声后,后面的跨图像匹配很难救回来。只做Top-K筛选而不做细化时,K取大了会带来噪声,K取小了又会丢召回,说明“先粗筛再精修”不是装饰,而是必要条件。再看不同视觉编码器的结果,DINOv3在RGCF里表现更稳,说明这个阶段确实更依赖高质量的全局表征,而不是单纯更大的模型。
在R2C7K数据集上的详细结果值得深入解读。该数据集包含了多种复杂场景,如低对比度、严重遮挡、多目标重叠等。GFR-SAM在多个关键指标上取得了领先,例如在mean IoU(平均交并比)上,它比第二名的训练免费方法高出近3个百分点,甚至超过了部分需要大量标注数据训练的全监督方法。在F-measure(加权F值)上,它的优势同样明显,这表明其分割结果在精确率和召回率之间取得了更好的平衡。定性结果(图4)进一步展示了其优势:在面对与背景纹理高度融合的“石头鱼”时,其他方法要么只分割出部分身体,要么将背景误判为目标,而GFR-SAM能够完整、准确地勾勒出鱼的轮廓;在面对被水草部分遮挡的“比目鱼”时,它也能通过GSR阶段的语义理解,将被遮挡的部分“脑补”出来。
表2:MSG消融实验
表2:MSG的消融实验。关闭RGCF和GSR后,仅比较是否使用Mask-guided Spatial Gating,结果显示MSG对参考表示质量的提升非常明显。
表3:RGCF中不同视觉编码器的比较
表3:RGCF模块中不同视觉编码器的比较。整体上,DINOv3系列在区域-全局对比打分里表现更稳,说明该模块对表征质量比较敏感。
表4:不同提示策略比较
表4:不同提示策略的比较。对比说明,跨图像示例提示比单纯的点提示更适合伪装目标这种“边界不清、位置难猜”的任务。

挑战与展望:面对强干扰和低对比度,我们还能做什么

这篇方法虽然强,但边界也很清楚。第一,它仍然依赖参考图质量,如果参考图本身不干净,MSG也只能尽量止损,不可能凭空造出正确原型。第二,它对多实例场景的处理虽然比点提示稳,但本质上还是靠候选、排序、再细化,遇到极端拥挤或目标间高度相似的场景,仍可能出现混淆。第三,整个流程串了SAM3和DINOv3,推理链路并不算轻,训练免费不等于计算免费,工程部署时还是要算账。
不过,这类工作真正有价值的地方,恰恰在于它把一个老问题重新讲透了:通用基础模型不是不能做专门任务,而是提示方式要对路。训练免费方法过去总想着“少训练一点也许能凑合”,这篇论文的态度更像“别凑合,先把输入方式改对”。从这个角度看,它不只是一个伪装分割方法,更像是在给“如何调用基础模型”这件事提供一个更靠谱的模板。
具体来说,未来的改进方向可能包括以下几个方面。首先,可以探索更鲁棒的参考原型提取方法,例如利用注意力机制自动聚焦于目标区域,减少对精确掩码的依赖。其次,可以引入更复杂的候选筛选策略,例如利用图神经网络对候选区域之间的关系进行建模,从而更好地处理多实例和遮挡场景。最后,可以尝试对推理流程进行加速和压缩,例如通过知识蒸馏将SAM3和DINOv3的能力融合到一个更轻量的模型中,降低部署成本。尽管存在这些挑战,GFR-SAM无疑为训练免费的伪装目标分割任务树立了一个新的标杆,其“生成-过滤-细化”的范式也为其他视觉任务提供了有益的借鉴。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“参考式伪装目标分割”里的提示脆弱问题:不再依赖容易打偏的点提示,而是用参考图像生成跨图像视觉原型,再经过过滤和细化,把目标更稳地分出来。

MSG、RGCF、GSR分别在干什么?MSG负责把参考图里的背景特征先挡掉,RGCF负责从一堆候选里挑出最像目标、最不像背景的那个,GSR则用边界框和文本把结果修得更完整、更干净。

为什么不直接继续用点提示?因为伪装场景里前景和背景边界太模糊,点提示对位置极其敏感,稍微偏一点就可能把模型带沟里。相比之下,参考示例提供的是“目标长什么样”,比“点在哪儿”更稳。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是单纯把SAM套到新任务上,而是把“点提示”改成“跨图像示例提示”,再用生成-过滤-细化串起来,范式切换算是这篇工作的亮点。

实验合理度:★★★★☆ 对比了全监督、训练免费和不同提示策略,消融也围绕MSG、K值、编码器选择展开,实验链条比较完整。

学术研究价值:★★★★☆ 这篇工作对“基础模型怎么服务专门任务”有启发,尤其适合后续研究训练免费分割、跨图像提示和伪装场景鲁棒性。

稳定性:★★★☆☆ 思路比点提示稳,但仍依赖参考图质量和基础模型能力,极端复杂场景下还不能说绝对稳。

适应性以及泛化能力:★★★☆☆ 对伪装目标分割和参考式分割很有帮助,但是否能平移到其他细粒度任务,还要看提示设计是否同样成立。

硬件需求及成本:★★★☆☆ 不训练省了标注和训练成本,但推理链路串了多个大模型,算力开销并不轻,不能把“训练免费”误读成“部署免费”。

复现难度:★★★☆☆ 论文给出了模块思路和关键设置,但要把SAM3、DINOv3以及整条流程稳定拼起来,还是有一定工程门槛。

产品化成熟度:★★★☆☆ 在参考检索、伪装目标定位、辅助标注等场景有潜力,但要上产品还需要进一步优化速度、失败案例和输入鲁棒性。

可能的问题:方法依赖高质量参考图和基础模型,推理链路偏重;在极端遮挡、多相似目标场景下,候选筛选与细化仍可能失手。


主要参考文献

Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao. GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting. arXiv 2026.
论文原文:https://arxiv.org/pdf/2607.11732v1.pdf
项目与演示:暂无公开链接

伪装目标太会“躲猫猫”?GFR-SAM给了一个很硬气的答案:不训练,也能靠跨图像示例把目标揪出来。想继续围观这类又新又能落地的论文,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。记得备注:研究方向+地点+学校/公司+昵称,方便快速通过~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。伪装目标、图像分割、SAM、自动驾驶、医疗、机器人相关方向的小伙伴尤其适合来群里一起聊。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。