← 返回 PaperDaily 视觉与图像

SAM2Matting零样本SOTA:视频抠图不用再靠昂贵标注

SAM2Matting把“跟踪”和“抠图”这对老搭档拆开干活,思路很干净。更离谱的是,它只用图像训练,却能在视频抠图上打出零样本SOTA,属于那种看完会想拍桌子的设计。

SAM2Matting零样本SOTA:视频抠图不用再靠昂贵标注
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
SAM2Matting把“跟踪”和“抠图”这对老搭档拆开干活,思路很干净。更离谱的是,它只用图像训练,却能在视频抠图上打出零样本SOTA,属于那种看完会想拍桌子的设计。


原论文信息如下:
论文标题:
SAM2Matting: Generalized Image and Video Matting
发表日期:
2026年06月
发表单位:
Fudan University; Shanghai University of Finance and Economics
原文链接:
https://arxiv.org/pdf/2606.27339v1.pdf
开源代码链接:
https://github.com/FudanCVL/SAM2Matting
项目链接:
https://henghuiding.com/SAM2Matting

视频抠图新范式:无需昂贵标注,解耦跟踪与抠图实现零样本SOTA

封面
图2:SAM2Matting总体框架。它把视频目标分割跟踪器和专用抠图模块拆开,各干各的活,最后再把结果合起来。
视频抠图这件事,表面看是“把前景从背景里抠出来”,本质却是个很别扭的双人舞:一边要像视频目标分割那样稳稳跟住目标,另一边又要像图像抠图那样抠到每一根头发丝、每一块半透明边缘。很多方法想两手抓,结果常常两手都不太硬,尤其一旦换个场景、换个运动速度、换个目标类别,模型就开始“我是谁、我在哪、我在抠什么”。
这篇SAM2Matting的思路很干脆:既然视频抠图天然包含两个子任务,那就别让一个模块硬扛全部责任,直接把高层跟踪低层抠图解耦。前者交给大规模训练过的VOS tracker,后者交给专门学细节的抠图头。这样一来,跟踪保持稳,抠图负责细,谁也不用逼谁去兼职。
图1 SAM2Matting在人物与非人物、室内与户外场景中都能进行细粒度图像和视频抠图
图1:SAM2Matting在人物和非人物、熟悉场景和野外场景里都能做细粒度抠图,说明它不是只会在“标准答案题”上表演。
更关键的是,它并没有把自己绑死在昂贵的视频抠图标注上。传统视频抠图数据集要逐帧标alpha,成本高得像给每一帧都请一位手工绣花师傅,数据规模也因此受限,场景还常常偏人像。SAM2Matting反过来利用图像抠图数据训练低层抠图能力,再借助强大的跟踪器提供时序一致性,于是实现了一个很有反差感的结果:只用图像训练,却能在视频抠图上做到零样本SOTA。这就像没参加过游泳集训,却靠着扎实的陆上训练直接下水拿了好成绩,多少有点离谱,但论文把它做成了事实。
项目还支持多种提示方式,包括初始掩码、点、框,SAM3版本甚至支持文本提示。也就是说,用户不必总拿最“正统”的输入方式去喂它,交互门槛被进一步压低了。对实际应用来说,这点挺重要:很多场景里,用户能给的就是一个粗框、一个点,甚至一句话,模型要是还得“请先准备精确trimap”,那就有点像点外卖却被要求先种菜。

从高维跟踪到精细抠图:SAM2Matting如何解耦两大子任务?

先把概念捋顺。视频目标分割(VOS, Video Object Segmentation,视频目标分割)解决的是“这个目标在哪儿、下一帧还在哪儿”;视频抠图解决的是“这个目标边缘到底怎么过渡、头发丝和透明玻璃怎么保留”。前者偏语义和时序,后者偏像素和边界。把这俩硬塞进一个统一头里,模型往往会在“稳”和“细”之间反复横跳。
SAM2Matting的解法是:先让VOS tracker负责输出每一帧的目标掩码,这部分尽量冻结,不去破坏它原本的跟踪能力;然后在这个稳定掩码的基础上,再加专门的抠图组件做细节恢复。这样设计的好处很直接:跟踪器不必为了抠图去“学会”所有细节,抠图头也不用重新发明时序一致性。一个管大局,一个管刀工,分工明确,效率也更高。
图2 SAM2Matting总体框架
图2:整体流程里,跟踪器先给出每帧目标掩码,ROI检测器再找出真正需要精修的区域,渐进式Alpha预测器最后逐级补细节。
这里还有一个很聪明的点:抠图并不是对整张图平均发力,而是先找出“最值得抠”的区域。因为真正难的是边界附近那些半透明、细碎、容易混淆的地方,大片纯前景和纯背景其实没那么费脑子。于是论文引入ROI Detector,也就是区域提议检测器,先把“抠图关键区域”圈出来,再让后面的alpha预测器重点处理。
图3 传统形态学方法与真实trimap的差异
图3:传统的形态学膨胀和腐蚀会生成很粗糙、很均匀的边界,但真实trimap里的难点往往藏在头发、水杯、缝隙这些复杂结构里。

抠图关键区域精准定位:ROI检测器如何超越传统形态学方法?

很多旧方法喜欢拿目标掩码直接做膨胀、腐蚀,像是给边界套个“统一尺码”的外套。问题是,抠图真正麻烦的地方并不均匀:有的地方是清晰轮廓,有的地方是毛发飞丝,有的是半透明玻璃,有的是前景和背景缠在一起的“死结”。统一扩一圈、缩一圈,既浪费算力,又容易漏掉真正该处理的细节。
SAM2Matting的ROI检测器把这个问题改写成像素级二分类:哪些像素属于“抠图关键区域”,哪些不属于。它不是只看掩码本身,而是把视频跟踪掩码、当前帧图像以及多尺度图像特征一起拿来判断。这样做的意义在于,掩码提供“目标大概在哪”,图像特征提供“哪里细节复杂”,多尺度结构提供“哪里既有语义又有边缘问题”。三路信息一合,ROI就不再是粗糙的边缘环,而更像“真正值得修图的区域清单”。
论文里还特别强调,ROI不是单尺度拍脑袋决定的,而是每个尺度都预测一个logit map,再通过层级卷积网络融合。这里的logit可以理解为“这个像素属于ROI的把握程度”,最后再经sigmoid和阈值化得到二值ROI。说白了,就是先让模型在不同分辨率下各自发表意见,再把这些意见汇总成最终结论,避免只看一张低清图就下判决。
图7 ROI检测器识别出形态学或原始掩码遗漏的关键区域
图7:ROI检测器能找出飞散头发、细叶片、肢体缝隙等传统方法容易漏掉的区域,说明它不是在“描边”,而是在“找难点”。
有了ROI之后,论文还构造了一个pseudo-trimap,也就是“伪trimap”。这里的trimap是抠图里一个经典概念:把像素分成确定前景、确定背景和未知区域三类。原始trimap通常来自人工标注,而这里则由VOS掩码和ROI共同生成。VOS掩码负责给出确定前景和背景,ROI负责标出未知区。这样既保留了抠图所需的空间先验,又不需要昂贵的逐帧人工trimap。

从粗到细的级联优化:渐进式Alpha预测器如何捕获毛发与透明细节?

ROI只负责告诉模型“哪里值得认真抠”,真正把alpha值算出来的,是后面的Progressive Alpha Predictor,也就是渐进式Alpha预测器。它的核心想法很朴素:别指望一步到位把所有细节都抠干净,先粗后细,像修图一样一层层打磨。
具体来说,模型在每个尺度上都会把图像特征、当前帧、伪trimap,以及上一层已经预测出来的alpha结果拼起来,再继续预测更细一级的alpha。前一层的输出不是终点,而是下一层的“草稿”。这就像画画时先铺大色块,再补轮廓,再修高光,最后连头发丝都要挑出来。论文把这种多尺度串联叫做级联细化,实际效果就是让粗略边界逐渐变得稳定而干净。
图8 中间alpha在各尺度间逐步细化
图8:从A1到A3,alpha在每一层都更细一点,说明这个模块不是“猜一次完事”,而是在持续修正。
为了让这个过程别变成“越修越糊”,论文还加了两类关键约束。一个是matte-mask consistency loss,中文可以理解为“抠图-掩码一致性损失”,它防止前景内部出现空洞,避免抠出来的人像像被啃了一口。另一个是smoothness loss,即平滑损失,用来减少边缘锯齿,让轮廓更干净。
图9 一致性损失与平滑损失的作用
图9:一致性损失负责补洞,平滑损失负责修边。一个管完整性,一个管观感,分工非常明确。
训练时还有一个很重要的选择:冻结跟踪器,只训练抠图组件。这点看起来保守,实际上非常关键。因为一旦把跟踪器也一起端到端训练,模型很容易为了适应抠图数据而丢掉原本在大规模视频分割上学到的稳健跟踪能力。论文后面的实验也证明了这一点:视频抠图数据上的微调,虽然能让某些域内指标更好,但会明显伤害泛化和跟踪鲁棒性。

零样本超越视频监督:SAM2Matting在多种场景下的定量与定性表现

先看图像抠图结果。论文在多个数据集上做了对比,SAM2Matting的三个版本都稳定优于已有方法。这里的重点不是“某一个表格里赢了几个小数点”,而是它在不同数据集上都能保持一致优势,说明解耦设计并不是只在某个特定数据分布上碰巧有效。
表1 图像抠图基准上的定量结果
表1:图像抠图基准上的定量结果。可以看到,SAM2Matting在多个指标上都保持领先,说明它的低层抠图头确实学到了通用的细节恢复能力。
再看视频抠图。这里更有意思,因为SAM2Matting是零样本评测,也就是没有用视频抠图标注去专门训练,却拿去和一堆视频监督方法正面比拼。结果它在V-HIM60和VideoMatte上都能压过近期SOTA,而且dtSSD更低,说明时序稳定性也很在线。换句话说,它不仅“抠得细”,还“抠得稳”,不是那种每一帧都像换了个模型的闪烁型选手。
表2 视频抠图基准上的定量结果
表2:视频抠图基准上的定量结果。这里最亮眼的不是“有监督方法都打不过”,而是它在零样本条件下依旧保持了很强的竞争力。
图4 与人像视频抠图方法的定性对比
图4:在人像抠图中,SAM2Matting对头发丝、半透明区域和遮挡物的处理更稳,边缘也更干净。
图5 野外复杂场景中的定性对比
图5:在野外复杂场景里,基线方法对非人目标和快速运动常常吃力,SAM2Matting则能更稳地保住目标轮廓和细节。
图6 目标附着物与背景干扰处理
图6:对于骑车、滑雪杖这类附着物,或者桌面这种背景干扰,SAM2Matting也能比较稳地分开,说明它不是只会抠“孤零零的主体”。
更值得注意的是对比实验。论文把训练数据和tracker都对齐后,SAM2Matting依然能压过MAM和Matte Anything,说明优势不只是“用了更多数据”或者“换了更大骨干”,而是真正来自结构设计和监督方式。这个结论很重要,因为它把“谁更会堆料”与“谁更会设计”区分开了。
表3 与基线方法的受控对比
表3:受控对比实验。左边对齐数据,右边对齐tracker,SAM2Matting都更强,说明提升主要来自方法本身。
表4与表5 ROI策略和结构监督消融
表4与表5:ROI策略和结构/监督设计的消融结果。传统形态学和mask-only都不如ROI检测器,而级联细化、一致性损失和平滑损失也都在各自环节发挥作用。
论文还专门讨论了一个很现实的问题:如果把这个模型再拿去做视频抠图微调,会不会更好?答案是“有点好,但代价不小”。在V-HIM2K5上微调后,域内指标会变好一些,但跨域泛化变差,甚至原本的跟踪鲁棒性也被拖累。这个结果非常诚实,也很有价值,因为它说明视频抠图数据虽然能补一些局部性能,但规模和多样性还不够,强行端到端微调容易把原来辛苦学来的稳健性磨没了。
图10 视频微调会削弱原始跟踪鲁棒性
图10:视频微调会让原始跟踪能力变弱,这也从侧面证明了“解耦”不是形式主义,而是有实际收益的。

灵活高效:支持多种提示类型,实时运行40FPS,视频抠图走向实用

除了精度,SAM2Matting还有一个很实用的卖点:轻量和高效。论文给出的结果显示,SAM2.1-Tiny版本在1080p、200帧视频上能跑到40 FPS,显存占用也控制得比较克制。对于视频抠图来说,这已经不是“论文里能跑”,而是离真实应用很近了。毕竟用户最怕的不是模型不准,而是模型一开就像在拿GPU炖汤。
表7 速度与显存效率结果
表7:速度和显存占用结果。轻量版本已经能接近实时,这让它在交互式视频编辑、直播抠像、内容创作里更有落地可能。
灵活提示也很加分。很多抠图方法只认一种输入,用户得按它的脾气来;SAM2Matting继承了tracker的提示能力,点、框、掩码都能用,SAM3版本还支持文本提示。配合交互式演示,用户在不同场景下几乎可以用最顺手的方式把目标“指给模型看”,这才是真正接近产品的体验。
图13 不同提示类型下的交互式抠图
图13:不同提示方式都能工作,说明这个框架不是“只会一种姿势”的模型。
图14 长视频中的稳定抠图表现
图14:在长视频、频繁遮挡和重现的场景里,模型仍能保持稳定输出,时序一致性这块没有掉链子。
插图

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是视频抠图里“既要跟得稳,又要抠得细”的矛盾。方法把跟踪和抠图拆开,让强跟踪器负责时序一致性,让专用抠图模块负责边界细节,最后在零样本条件下做到很强的效果。

ROI Detector 和 pseudo-trimap 分别是什么意思?ROI Detector是“区域提议检测器”,用来找出真正需要精修的区域;pseudo-trimap是“伪trimap”,把确定前景、确定背景和未知区域组织起来,为后续alpha预测提供更明确的空间先验。

为什么只用图像训练,也能做好视频抠图?因为视频抠图被拆成了两个部分:跟踪能力由大规模视频分割模型提供,细节抠图能力由丰富的图像抠图数据学习。再加上冻结跟踪器、只训练抠图头,模型就能把“稳”和“细”分别学好。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把视频抠图拆成“跟踪+抠图”两段式,并用ROI桥接两者,思路清晰且实用,不是那种只会换皮的改改模块。

实验合理度:★★★★☆。有受控对比、消融、零样本视频评测和效率测试,证据链比较完整;如果再补更多跨域视频场景,会更扎实。

学术研究价值:★★★★☆。它对“视频抠图一定要靠视频标注”的默认范式提出了挑战,研究意义明确,也给后续方法提供了可复用框架。

稳定性:★★★★☆。冻结tracker、专门做ROI和alpha细化,整体稳定性不错;不过在极端遮挡、极复杂透明结构上,仍然会受tracker上限影响。

适应性以及泛化能力:★★★★★。人像、非人、野外、长视频都能覆盖,零样本还能打,泛化这块确实很能打。

硬件需求及成本:★★★★☆。轻量版已经能接近实时,成本控制得不错;但高分辨率长视频场景下,显存和算力仍然不是“随便一台笔记本就行”。

复现难度:★★★★☆。代码已开源,整体路径清楚;难点主要在训练数据组织、tracker适配和多尺度细化细节。

产品化成熟度:★★★★☆。交互提示丰富、速度也不错,已经很接近可用产品;但要进工业级流水线,还需要更强的极端场景验证。

可能的问题:方法依赖tracker质量,若跟踪器在极端场景失手,后续抠图仍会被连带影响;此外,零样本虽强,面对特别偏门的数据分布仍需谨慎。


主要参考文献

Shen, R., Jie, G., Liu, C., Ding, H. SAM2Matting: Generalized Image and Video Matting. arXiv, 2026.
项目主页:https://henghuiding.com/SAM2Matting
开源代码:https://github.com/FudanCVL/SAM2Matting

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
抠图、视频分割、图像增强、Agent、大模型,想找同好一起拆论文的,直接来群里开聊🤘
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。