← 返回 PaperDaily
视觉与图像
SAM2Matting零样本SOTA:视频抠图不用再靠昂贵标注
SAM2Matting把“跟踪”和“抠图”这对老搭档拆开干活,思路很干净。更离谱的是,它只用图像训练,却能在视频抠图上打出零样本SOTA,属于那种看完会想拍桌子的设计。
龙哥读论文
发布于 2026-08-14 21:47:10
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: SAM2Matting把“跟踪”和“抠图”这对老搭档拆开干活,思路很干净。更离谱的是,它只用图像训练,却能在视频抠图上打出零样本SOTA,属于那种看完会想拍桌子的设计。
原论文信息如下:
视频抠图新范式:无需昂贵标注,解耦跟踪与抠图实现零样本SOTA
视频抠图这件事,表面看是“把前景从背景里抠出来”,本质却是个很别扭的双人舞:一边要像视频目标分割那样稳稳跟住目标,另一边又要像图像抠图那样抠到每一根头发丝、每一块半透明边缘。很多方法想两手抓,结果常常两手都不太硬,尤其一旦换个场景、换个运动速度、换个目标类别,模型就开始“我是谁、我在哪、我在抠什么”。
这篇SAM2Matting的思路很干脆:既然视频抠图天然包含两个子任务,那就别让一个模块硬扛全部责任,直接把高层跟踪 和低层抠图 解耦。前者交给大规模训练过的VOS tracker,后者交给专门学细节的抠图头。这样一来,跟踪保持稳,抠图负责细,谁也不用逼谁去兼职。
更关键的是,它并没有把自己绑死在昂贵的视频抠图标注上。传统视频抠图数据集要逐帧标alpha,成本高得像给每一帧都请一位手工绣花师傅,数据规模也因此受限,场景还常常偏人像。SAM2Matting反过来利用图像抠图数据 训练低层抠图能力,再借助强大的跟踪器提供时序一致性,于是实现了一个很有反差感的结果:只用图像训练,却能在视频抠图上做到零样本SOTA 。这就像没参加过游泳集训,却靠着扎实的陆上训练直接下水拿了好成绩,多少有点离谱,但论文把它做成了事实。
项目还支持多种提示方式,包括初始掩码、点、框,SAM3版本甚至支持文本提示。也就是说,用户不必总拿最“正统”的输入方式去喂它,交互门槛被进一步压低了。对实际应用来说,这点挺重要:很多场景里,用户能给的就是一个粗框、一个点,甚至一句话,模型要是还得“请先准备精确trimap”,那就有点像点外卖却被要求先种菜。
从高维跟踪到精细抠图:SAM2Matting如何解耦两大子任务?
先把概念捋顺。视频目标分割(VOS, Video Object Segmentation ,视频目标分割)解决的是“这个目标在哪儿、下一帧还在哪儿”;视频抠图解决的是“这个目标边缘到底怎么过渡、头发丝和透明玻璃怎么保留”。前者偏语义和时序,后者偏像素和边界。把这俩硬塞进一个统一头里,模型往往会在“稳”和“细”之间反复横跳。
SAM2Matting的解法是:先让VOS tracker负责输出每一帧的目标掩码,这部分尽量冻结,不去破坏它原本的跟踪能力;然后在这个稳定掩码的基础上,再加专门的抠图组件做细节恢复。这样设计的好处很直接:跟踪器不必为了抠图去“学会”所有细节,抠图头也不用重新发明时序一致性。一个管大局,一个管刀工,分工明确,效率也更高。
这里还有一个很聪明的点:抠图并不是对整张图平均发力,而是先找出“最值得抠”的区域。因为真正难的是边界附近那些半透明、细碎、容易混淆的地方,大片纯前景和纯背景其实没那么费脑子。于是论文引入ROI Detector ,也就是区域提议检测器,先把“抠图关键区域”圈出来,再让后面的alpha预测器重点处理。
抠图关键区域精准定位:ROI检测器如何超越传统形态学方法?
很多旧方法喜欢拿目标掩码直接做膨胀、腐蚀,像是给边界套个“统一尺码”的外套。问题是,抠图真正麻烦的地方并不均匀:有的地方是清晰轮廓,有的地方是毛发飞丝,有的是半透明玻璃,有的是前景和背景缠在一起的“死结”。统一扩一圈、缩一圈,既浪费算力,又容易漏掉真正该处理的细节。
SAM2Matting的ROI检测器把这个问题改写成像素级二分类:哪些像素属于“抠图关键区域”,哪些不属于。它不是只看掩码本身,而是把视频跟踪掩码 、当前帧图像以及多尺度图像特征一起拿来判断。这样做的意义在于,掩码提供“目标大概在哪”,图像特征提供“哪里细节复杂”,多尺度结构提供“哪里既有语义又有边缘问题”。三路信息一合,ROI就不再是粗糙的边缘环,而更像“真正值得修图的区域清单”。
论文里还特别强调,ROI不是单尺度拍脑袋决定的,而是每个尺度都预测一个logit map,再通过层级卷积网络融合。这里的logit可以理解为“这个像素属于ROI的把握程度”,最后再经sigmoid和阈值化得到二值ROI。说白了,就是先让模型在不同分辨率下各自发表意见,再把这些意见汇总成最终结论,避免只看一张低清图就下判决。
有了ROI之后,论文还构造了一个pseudo-trimap ,也就是“伪trimap”。这里的trimap是抠图里一个经典概念:把像素分成确定前景、确定背景和未知区域三类。原始trimap通常来自人工标注,而这里则由VOS掩码和ROI共同生成。VOS掩码负责给出确定前景和背景,ROI负责标出未知区。这样既保留了抠图所需的空间先验,又不需要昂贵的逐帧人工trimap。
从粗到细的级联优化:渐进式Alpha预测器如何捕获毛发与透明细节?
ROI只负责告诉模型“哪里值得认真抠”,真正把alpha值算出来的,是后面的Progressive Alpha Predictor ,也就是渐进式Alpha预测器。它的核心想法很朴素:别指望一步到位把所有细节都抠干净,先粗后细,像修图一样一层层打磨。
具体来说,模型在每个尺度上都会把图像特征、当前帧、伪trimap,以及上一层已经预测出来的alpha结果拼起来,再继续预测更细一级的alpha。前一层的输出不是终点,而是下一层的“草稿”。这就像画画时先铺大色块,再补轮廓,再修高光,最后连头发丝都要挑出来。论文把这种多尺度串联叫做级联细化,实际效果就是让粗略边界逐渐变得稳定而干净。
为了让这个过程别变成“越修越糊”,论文还加了两类关键约束。一个是matte-mask consistency loss ,中文可以理解为“抠图-掩码一致性损失”,它防止前景内部出现空洞,避免抠出来的人像像被啃了一口。另一个是smoothness loss ,即平滑损失,用来减少边缘锯齿,让轮廓更干净。
训练时还有一个很重要的选择:冻结跟踪器,只训练抠图组件 。这点看起来保守,实际上非常关键。因为一旦把跟踪器也一起端到端训练,模型很容易为了适应抠图数据而丢掉原本在大规模视频分割上学到的稳健跟踪能力。论文后面的实验也证明了这一点:视频抠图数据上的微调,虽然能让某些域内指标更好,但会明显伤害泛化和跟踪鲁棒性。
零样本超越视频监督:SAM2Matting在多种场景下的定量与定性表现
先看图像抠图结果。论文在多个数据集上做了对比,SAM2Matting的三个版本都稳定优于已有方法。这里的重点不是“某一个表格里赢了几个小数点”,而是它在不同数据集上都能保持一致优势,说明解耦设计并不是只在某个特定数据分布上碰巧有效。
再看视频抠图。这里更有意思,因为SAM2Matting是零样本 评测,也就是没有用视频抠图标注去专门训练,却拿去和一堆视频监督方法正面比拼。结果它在V-HIM60和VideoMatte上都能压过近期SOTA,而且dtSSD更低,说明时序稳定性也很在线。换句话说,它不仅“抠得细”,还“抠得稳”,不是那种每一帧都像换了个模型的闪烁型选手。
更值得注意的是对比实验。论文把训练数据和tracker都对齐后,SAM2Matting依然能压过MAM和Matte Anything,说明优势不只是“用了更多数据”或者“换了更大骨干”,而是真正来自结构设计和监督方式。这个结论很重要,因为它把“谁更会堆料”与“谁更会设计”区分开了。
论文还专门讨论了一个很现实的问题:如果把这个模型再拿去做视频抠图微调,会不会更好?答案是“有点好,但代价不小”。在V-HIM2K5上微调后,域内指标会变好一些,但跨域泛化变差,甚至原本的跟踪鲁棒性也被拖累。这个结果非常诚实,也很有价值,因为它说明视频抠图数据虽然能补一些局部性能,但规模和多样性还不够,强行端到端微调容易把原来辛苦学来的稳健性磨没了。
灵活高效:支持多种提示类型,实时运行40FPS,视频抠图走向实用
除了精度,SAM2Matting还有一个很实用的卖点:轻量和高效 。论文给出的结果显示,SAM2.1-Tiny版本在1080p、200帧视频上能跑到40 FPS,显存占用也控制得比较克制。对于视频抠图来说,这已经不是“论文里能跑”,而是离真实应用很近了。毕竟用户最怕的不是模型不准,而是模型一开就像在拿GPU炖汤。
灵活提示也很加分。很多抠图方法只认一种输入,用户得按它的脾气来;SAM2Matting继承了tracker的提示能力,点、框、掩码都能用,SAM3版本还支持文本提示。配合交互式演示,用户在不同场景下几乎可以用最顺手的方式把目标“指给模型看”,这才是真正接近产品的体验。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是视频抠图里“既要跟得稳,又要抠得细”的矛盾。方法把跟踪和抠图拆开,让强跟踪器负责时序一致性,让专用抠图模块负责边界细节,最后在零样本条件下做到很强的效果。
ROI Detector 和 pseudo-trimap 分别是什么意思? ROI Detector是“区域提议检测器”,用来找出真正需要精修的区域;pseudo-trimap是“伪trimap”,把确定前景、确定背景和未知区域组织起来,为后续alpha预测提供更明确的空间先验。
为什么只用图像训练,也能做好视频抠图? 因为视频抠图被拆成了两个部分:跟踪能力由大规模视频分割模型提供,细节抠图能力由丰富的图像抠图数据学习。再加上冻结跟踪器、只训练抠图头,模型就能把“稳”和“细”分别学好。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把视频抠图拆成“跟踪+抠图”两段式,并用ROI桥接两者,思路清晰且实用,不是那种只会换皮的改改模块。
实验合理度: ★★★★☆。有受控对比、消融、零样本视频评测和效率测试,证据链比较完整;如果再补更多跨域视频场景,会更扎实。
学术研究价值: ★★★★☆。它对“视频抠图一定要靠视频标注”的默认范式提出了挑战,研究意义明确,也给后续方法提供了可复用框架。
稳定性: ★★★★☆。冻结tracker、专门做ROI和alpha细化,整体稳定性不错;不过在极端遮挡、极复杂透明结构上,仍然会受tracker上限影响。
适应性以及泛化能力: ★★★★★。人像、非人、野外、长视频都能覆盖,零样本还能打,泛化这块确实很能打。
硬件需求及成本: ★★★★☆。轻量版已经能接近实时,成本控制得不错;但高分辨率长视频场景下,显存和算力仍然不是“随便一台笔记本就行”。
复现难度: ★★★★☆。代码已开源,整体路径清楚;难点主要在训练数据组织、tracker适配和多尺度细化细节。
产品化成熟度: ★★★★☆。交互提示丰富、速度也不错,已经很接近可用产品;但要进工业级流水线,还需要更强的极端场景验证。
可能的问题: 方法依赖tracker质量,若跟踪器在极端场景失手,后续抠图仍会被连带影响;此外,零样本虽强,面对特别偏门的数据分布仍需谨慎。
主要参考文献
Shen, R., Jie, G., Liu, C., Ding, H. SAM2Matting: Generalized Image and Video Matting. arXiv, 2026.
项目主页:https://henghuiding.com/SAM2Matting
开源代码:https://github.com/FudanCVL/SAM2Matting
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
抠图、视频分割、图像增强、Agent、大模型,想找同好一起拆论文的,直接来群里开聊🤘