← 返回 PaperDaily
视觉与图像
告别手动标注!CVPR 2026论文提出PPD,让SAM提示词越战越准
为什么值得读?CVPR 2026最佳论文荣誉提名作品,把“攻击-防御”对抗博弈引入SAM提示词优化——用攻击者主动制造干扰,逼出能抗干扰的提示词优化器,全程无需下游任务标注,即插即用,医学图像上最多涨超15个百分点。思路清奇,值得一看。
龙哥读论文
发布于 2026-08-14 21:47:22
阅读 6
查看原文
原论文信息如下:
SAM的提示词困境:从手动到自动的进化之路
最近AI圈里有个趋势:比起让模型在"温室"里修炼,不如直接丢进"竞技场"里挨打。今天要聊的这篇CVPR 2026最佳论文荣誉提名,是真的把"以攻代守"玩出了新高度——它不直接教SAM如何分割,而是专门训练一个"捣蛋鬼"去破坏提示词,再顺手练出一个"清道夫"来收拾残局。这操作,龙哥看了也得说一声:妙啊。
在展开技术细节前,有必要交代一下这项工作的定位。SAM(Segment Anything Model)自2023年发布以来,凭借强大的零样本分割能力和灵活的提示机制,成为视觉基础模型标杆。然而,提示词的质量直接决定SAM输出的上限。一个点落在目标中心附近,分割结果往往干净利落;一个点落在背景纹理上,SAM就可能把整片区域都"吞"进去。这种敏感性在自然图像上尚可人工微调,但在医学影像等专业领域,标注成本极高,人工微调几乎不可行。因此,自动化的提示词优化方法,就成了释放SAM潜力的关键。
本文提出的PPD(Point Prompt Defender,点提示词防御器)框架,正是针对这一痛点设计。核心思想可以概括为一句话:与其费尽心思去定义"什么是好的提示词",不如让一个攻击者去主动制造"坏的提示词",再让防御者在对抗中学会识别并消除这些坏提示词。这种"以攻代守"的思路,在提示词优化领域尚属首次。
先来聊聊主角——SAM(Segment Anything Model,分割一切模型) 。它是Meta发布的超级分割基础模型,只要用户给出点、框、mask等提示词,它就能返回对应的分割结果。听起来很强大对吧?但问题就出在这些提示词上:提示词给得好,SAM就是分割神器;提示词给得差,SAM就变成"乱切一切"模型 。这就好比你把菜谱拿反了,再好的厨师也得把糖当盐放。
然而在实际应用中,手动标注提示词的成本高到离谱。以医学图像分割为例,一位经验丰富的放射科医生标注一张CT影像中的病灶区域,平均需要花费数分钟到十几分钟。如果要将这种标注扩展到整个数据集,人力成本和时间成本都是天文数字。因此,研究者们开始探索自动化生成提示词的方法。
目前主要有几条技术路线:一是微调prompt encoder,比如VRP-SAM等,但需要下游任务的标注数据,跨域很容易拉胯。这类方法本质上是在为特定任务"定制"提示编码器,一旦遇到新的数据分布,就需要重新收集标注数据并进行微调,泛化能力受限。二是基于启发式的几何提示词生成,代表方法有Matcher、GBMSeg,这类方法虽然不用训练,但是把提示词当成了静态输入,无法根据分割结果动态调整。它们通常依赖于手工设计的规则或特征匹配策略,生成的提示词质量不稳定,且缺乏对SAM反馈的利用。三是以PPO为代表的Point Prompt Optimizer(点提示词优化器) ,它把强化学习引入提示词优化,能够对提示词的位置进行迭代优化。
但PPO有个明显的毛病:它只盯着提示词之间的关系来调整位置,完全没有借助SAM的分割反馈来修正自己的行为。换句话说,PPO是"闭着眼"调提示词,调得好不好全靠蒙 ,而且训练环境比较单一,一旦碰上风格差异大的新场景,策略立马失灵。PPO的训练过程通常是在一个固定的数据集上进行的,它学到的策略高度依赖于训练数据的分布。当测试数据与训练数据存在较大分布偏移时,PPO的优化效果就会大打折扣。正因为这些痛点,本文提出了PPD——一个全新的对抗强化学习框架。
攻防博弈:PPD如何用对抗思想优化提示词
PPD的核心思路非常直白:与其费尽心思琢磨"什么样的提示词是好的",不如直接训练一个攻击者去捣乱,再让防御者在"挨打"中学会见招拆招。整个训练过程就像一场攻防演练——攻击者专门去激活那些让SAM输出变差的点提示,防御者则负责把这些"坏点"关掉,恢复SAM的分割精度。
为什么要用这种"自虐"的方式?因为攻击者可以源源不断地制造各种刁钻的"坏提示词",模拟真实场景中五花八门的噪声和干扰。在真实应用中,用户提供的初始提示词往往是不完美的:可能包含了误点击的背景点、可能遗漏了目标的关键区域、可能点的位置偏离了目标中心。这些"坏提示词"的形式千变万化,如果只靠人工设计规则来模拟,很难覆盖所有情况。而攻击者通过强化学习,能够主动搜索那些对SAM分割性能影响最大的提示词组合,从而为防御者提供最"刁钻"的训练样本。防御者在跟攻击者过招的过程中,必须学会判断哪些点值得保留、哪些点得果断干掉。这样训练出来的防御者,天然就具备很强的抗干扰能力,推理的时候直接部署防御者,就能对任意的粗提示词集合进行精细化处理,而不需要任何重训练。
具体来说,整个训练过程是这样的:每个训练回合开始时,环境用"理想提示词"初始化——先用Ground Truth生成一组最佳提示点(在目标区域内部和外部均匀采样)。这里的目标区域是指Ground Truth分割mask所覆盖的区域,内部采样的点作为正提示词,外部采样的点作为负提示词。这种初始化方式保证了训练开始时,SAM的分割性能处于一个较高的水平,为后续的攻防博弈提供了一个清晰的基准。接着攻击者上场,从不活跃的提示池里挑一些点激活,SAM拿到新的提示配置后输出分割mask,攻击者的奖励就是分割质量下降的幅度。然后轮到防御者,它从活跃的提示里挑出"坏点"关掉,SAM再次输出分割mask,防御者的奖励是分割质量恢复的程度。
奖励里反复提到的DICE系数,是分割任务中最常用的评估指标之一,衡量预测分割图和真实标注之间的重叠程度,数值越高代表分割越准。DICE系数的计算公式为2×|A∩B|/(|A|+|B|),其中A和B分别表示预测分割图和真实标注的像素集合。两个智能体都采用DQN(Deep Q-Network,深度Q网络) 来学习策略,每个智能体各自维护一个Q网络,通过不断试错来学习"什么状态该做什么动作"。DQN用一个经典的时序差分损失来更新网络:
整个对抗训练的流程可以概括为:攻击者先搞破坏 → 防御者来收拾残局 → 交替迭代,直到双方都"卷"到极致。这种交替训练的方式,类似于生成对抗网络(GAN)中的博弈过程,但这里的博弈对象是提示词的配置,而非图像本身。当训练结束时,攻击者退场,防御者被部署到推理阶段,专门用来优化任意输入的粗提示词集合。这种"攻击训练、防御部署"的设计,就是本文提出的attack-for-defense(以攻代守) 范式。
双空间图环境:让智能体理解提示词的空间与语义关系
要让两个智能体像下棋一样"思考"提示词之间的关系,光把提示词当成一堆孤立的点可不行。本文的解决方案是:把所有图像块看成图上的节点,边则同时编码"特征距离"和"物理距离",构成一个双空间异质图 。这样一来,智能体不仅能知道哪些提示词在语义上相似,还能知道它们在几何位置上是否靠近,决策依据就丰富多了。
构建过程是这样的。首先,把输入图像划分成若干个不重叠的图像块(patches),每个图像块用DINOv2视觉特征提取器编码成特征向量。DINOv2是Meta提出的自监督视觉基础模型 ,能提取出语义丰富的通用视觉特征,所以用它来构建的图环境对任意下游任务都适用,这也是PPD能做到任务无关的基础。DINOv2在训练过程中使用了大量的无标注图像,学习到的特征具有很好的通用性和鲁棒性,能够捕捉图像中的语义信息。接下来,用这些特征向量两两计算欧氏距离,得到特征距离矩阵;同时用图像块的几何中心坐标计算欧氏距离,得到物理距离矩阵:
这两个矩阵就构成了图上两种不同类型的边:特征边和物理边。为什么需要双空间?举个简单的例子:一只猫的耳朵和尾巴在物理上距离很远,但在语义上高度相似;而一个贴在物体边缘的噪声点,虽然在物理上跟物体挨得很近,在语义上却与物体完全不搭。只有同时利用两种距离,智能体才能做出更聪明的判断。如果只使用物理距离,智能体可能会将物理上相近但语义不同的提示词视为同类,导致错误的决策;如果只使用特征距离,智能体可能会忽略提示词之间的空间位置关系,同样影响决策的准确性。双空间图的引入,使得智能体能够综合考虑提示词的语义和空间属性,从而做出更合理的判断。
环境初始化时,本文使用Ground Truth分割mask生成理想提示词:在目标区域内均匀采样一些点作为正提示词,在区域外采样一些点作为负提示词。训练时,攻击者和防御者就基于这组高质量初始配置展开博弈;推理时,环境的提示词初始化换成用户提供的任意粗提示词集合,然后由防御者直接进行筛选和优化。这种训练与推理的差异,正是PPD能够实现"即插即用"的关键所在——训练时使用理想提示词是为了让防御者学会在"好"的基础上应对"坏"的干扰,而推理时面对的是真实的粗提示词,防御者需要将其"修正"到接近理想状态。
实验验证:从自然图像到医学图像的跨域泛化
实验设计得比较有意思。训练阶段只用了FSS-1000数据集中随机采样的1000张图像,涵盖了丰富的物体类别。FSS-1000是一个用于少样本分割的数据集,包含1000个物体类别,每个类别有10张图像。本文从中随机选取1000张图像作为训练数据,保证了训练数据的多样性。训练完成后,PPD不经过任何微调,直接拿到PASCAL VOC(自然场景)、ISIC和Kvasir(医学场景)三个数据集上进行跨域测试,检验的就是模型的泛化能力。PASCAL VOC是计算机视觉领域最经典的目标分割数据集之一,包含20个物体类别;ISIC是皮肤镜图像分割数据集,用于皮肤病变的自动分割;Kvasir是胃肠道内窥镜图像分割数据集,用于消化道疾病的辅助诊断。这三个数据集在图像风格、目标形态、背景复杂度等方面都有显著差异,能够很好地检验PPD的跨域泛化能力。
先看消融实验。第一组验证防御者能不能防住攻击:用攻击者去破坏理想提示词,可以看到SAM的分割性能出现断崖式暴跌——PASCAL VOC上mDSC从78.5%掉到34.2%,直接腰斩。这个结果说明攻击者确实找到了"最伤SAM"的提示词组合,能够显著降低SAM的分割性能。而当防御者介入后,性能恢复到了73.5%。这说明攻击者真的找到了"最伤SAM"的提示词,而防御者也确实学会了"排雷"。值得注意的是,防御后的性能虽然有所恢复,但并未完全达到初始水平(78.5%),这说明防御者虽然能够识别并移除大部分有害提示词,但可能无法完全恢复所有被破坏的提示词信息。图3展示了这一过程的可视化效果。
第二组实验更贴近实际使用场景:初始提示词来自一个无需训练的Feature Matching(特征匹配)策略,通过参考图像与目标图像之间的特征匹配自动生成初始提示点。这种免训练方案生成的提示词往往包含大量冗余和错误的点,所以SAM的分割效果初始只有41.3%的mDSC。但经过PPD优化后,性能大幅提升到69.1%(+27.8%),ISIC上也涨了9.9%,Kvasir上更是暴涨23.4%。图4的定性结果显示,PPD删掉了一大批噪声点,把分割边界打磨得清晰多了。这个实验充分说明了PPD在真实应用场景中的价值——即使初始提示词质量不高,PPD也能通过筛选和优化,显著提升SAM的分割性能。
最后是与已有SOTA方法的对比,统一采用one-shot(单样本)设定。从表格II可以看到,FM-PPD在PASCAL VOC、ISIC、Kvasir三个数据集上的mDSC和mIoU指标全部排名第一。尤其是在Kvasir上,FM-PPD的mDSC达到了54.8%,比Matcher的35.0%高出近20个百分点,比FM-PPO的38.9%高出近16个百分点。医学图像的跨域优势非常明显。再看看VRP-SAM的表现——它在PASCAL VOC上还行,但一到医学图像就彻底崩盘,ISIC上只有4.6%,Kvasir上直接归零,这反差确实让人有点绷不住。VRP-SAM的失败说明,依赖下游任务标注进行微调的方法,在跨域场景下泛化能力极差,而PPD这种无需微调的即插即用方法,则展现出了强大的鲁棒性。
为什么PPD的跨域泛化能做得这么好?核心原因在于"攻击者"带来的训练多样性。攻击者不断制造各种意想不到的破坏性提示词组合,逼着防御者学会在各种极端条件下做判断,而不是像PPO那样只会处理训练时见过的那些套路。攻击者的探索过程,实际上是在模拟真实世界中可能出现的各种"坏提示词"分布,这使得防御者学到的策略具有更强的鲁棒性。再加上DINOv2特征构建的双空间图,天然提供了与任务无关的通用语义与空间信息,所以即使面对医学图像这种完全陌生的域,防御者也能凭借学到的"排雷"技能稳住阵脚。DINOv2特征是在大规模无标注图像上预训练得到的,其语义表征能力具有很好的通用性,能够适应不同领域的图像。
局限与展望:PPD的未来发展方向
虽然PPD在自然图像和医学图像上都表现出了不错的跨域能力,但作者也坦承了它的局限:PPD仍然需要输入一个"还说得过去"的初始提示词集合 。如果初始提示词实在太离谱,比如点的位置跟目标物体完全没有空间或语义上的关联,防御者就算再努力,也很难凭空变出好的分割结果。换句话说,PPD是个"优化器",而不是"无中生有器"。它的作用是在已有提示词的基础上进行筛选和调整,而不是从零开始生成提示词。因此,PPD的性能上限,在一定程度上受限于初始提示词的质量。
针对这一点,作者提出了未来的改进方向:把PPD与更先进的提示词生成策略结合,比如文本引导的提示词、多模态参考等。如果能先从文本语义层面锁定目标区域,再让PPD在这个区域内精细调整提示点,冷启动的难题就能得到极大缓解。例如,可以先用CLIP等视觉-语言模型对图像进行文本描述,然后根据文本描述生成一个粗略的目标区域,再在该区域内使用PPD进行精细的提示词优化。这种"文本粗定位+PPD精优化"的组合,有望进一步提升PPD的适用性和鲁棒性。
龙迷三问
这篇论文到底在解决什么问题? 本文提出Point Prompt Defender(PPD),首个将对抗攻防博弈引入SAM点提示词优化的强化学习框架。
这篇工作最值得看的点是什么? 在PASCAL VOC、ISIC和Kvasir三个数据集上均取得最优性能,mDSC分别达到69.1%、76.3%和54.8%,显著优于现有方法
这篇工作的边界或风险在哪里? 优点:1) 提出新颖的对抗式攻击-防御框架优化提示词,思路独特;2) 任务无关设计,推理时无需重训练;3) 在自然图像和医学图像上均表现优异。缺点:1) 依赖初始提示词质量,极端差初始化下效果受限;2) 训练需要大量计算资源;3) 双智能体训练复杂度较高
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出对抗强化学习框架Point Prompt Defender (PPD),通过攻击者-防御者双智能体博弈,在双空间图环境中自动优化SAM的点提示词,推理时仅部署防御者即可实现任务无关的提示词精炼。
实验合理度: ★★★★☆
mDSC(平均Dice相似系数), mIoU(平均交并比)
学术研究价值: ★★★★☆
提出对抗强化学习框架Point Prompt Defender (PPD),通过攻击者-防御者双智能体博弈,在双空间图环境中自动优化SAM的点提示词,推理时仅部署防御者即可实现任务无关的提示词精炼;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
未明确给出具体FLOPs,训练使用10块NVIDIA Tesla V100 GPU,1000个episodes
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1) 依赖初始提示词质量,极端差初始化下效果受限;2) 训练需要大量计算资源;3) 双智能体训练复杂度较高
主要参考文献
[1] Kirillov A, Mintun E, Ravi N, et al. Segment anything[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. 2023: 4015-4026.
[2] Oquab M, Darcet T, Moutakanni T, et al. Dinov2: Learning robust visual features without supervision[J]. arXiv preprint arXiv:2304.07193, 2023.
[3] Mnih V, Kavukcuoglu K, Silver D, et al. Human-level control through deep reinforcement learning[J]. Nature, 2015, 518(7540): 529-533.
[4] Yang L, et al. Point Prompt Optimizer: A reinforcement learning approach to prompt optimization for segment anything model[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. 2024.
[5] Liu X, Zhang X, Shi G, et al. Attack for Defense: Adversarial Agents for Point Prompt Optimization Empowering Segment Anything Model[J]. arXiv preprint arXiv:2509.18891, 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想和龙哥一起追踪更多像PPD这样“攻防博弈”式的奇思妙想吗?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群