← 返回 PaperDaily 视觉与图像

图像训练逆袭!QueenVIS视频分割零参数涨10.3 AP

视频实例分割的“天价标注”让人头疼,QueenVIS却告诉你:只用单帧图像训练,效果堪比视频监督!它通过两个超级简单的辅助头(特征预测+中心预测)把外观和空间先验注入查询向量,推理时零开销、零参数增加。在YouTube-VIS长视频上直接飙了10.3 AP,比很多视频监督模型还稳。代码已开源,值得一试!

图像训练逆袭!QueenVIS视频分割零参数涨10.3 AP
原论文信息如下:
论文标题:
QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment
发表日期:
2026年7月
发表单位:
Amirkabir University of Technology (AUT), Tehran, Iran / The University of Tokyo, Tokyo, Japan
原文链接:
https://arxiv.org/pdf/2607.24598v1.pdf
开源代码链接:
https://github.com/ArianKheir/QueenVIS
各位龙迷们,今天龙哥要聊的这篇论文,可能会让很多做视频分割的团队陷入沉思——视频实例分割(VIS),一个被默认必须用视频级标注监督的任务,竟然被一篇纯图像训练的方法几乎追平了SOTA?而且它在长视频上的表现比许多视频监督模型还稳,AP直接飙了10.3个点。这就是来自Amirkabir University of Technology和东京大学的QueenVIS。

先简单说下VIS是啥:给定一段视频,模型要逐帧检测、分割出每个物体,并且把不同帧里的同一个物体关联起来,赋予唯一的ID。听起来就是实例分割+多目标跟踪的结合。主流做法都是设计各种时序模块(注意力、记忆、额外跟踪头),训练时喂多帧带ID标注的视频,开销巨大,标注成本更是让人头疼。例如,YouTube-VIS数据集的标注需要逐帧精细描绘掩码并跨帧匹配ID,一个视频的标注成本可能高达数百美元,这使得大规模视频数据集的构建变得极其昂贵。

而QueenVIS的前辈MinVIS发现了一个反直觉的现象:只用单帧图像训练(不看重时序标注),模型内部生成的查询向量(Query)其实已经具备了一定的跨帧一致性,推理时直接做二分图匹配就能追踪。可惜这种一致性是“副产品”,不是训练目标,遇到遮挡、外观变化就崩了。MinVIS在YouTube-VIS 2021上取得了44.2 AP,虽然已经相当不错,但与视频监督方法仍有差距,尤其是在长序列和严重遮挡场景下,其性能会急剧下降。

QueenVIS的核心洞察:既然查询向量质量才是瓶颈,那就在训练时给它加两个“开胃菜”——特征预测和中心预测,让查询向量学会记住每个物体长什么样、在哪。推理时这两个辅助头直接扔掉,零额外参数。再配上完全免训练的查询传播和记忆库,就得到了一个既便宜又强的VIS方案。这种方法巧妙地避开了视频级标注的昂贵需求,同时通过精心设计的辅助任务,让单帧训练也能学到跨帧的鲁棒特征。

先上封面图感受下整体流程: 封面图:QueenVIS整体框架示意图
图:QueenVIS训练阶段和推理阶段的整体流程。训练时两个辅助头(绿色)活跃,推理时丢弃。

1. 视频实例分割也能“无视频训练”?QueenVIS打破常规

先看看MinVIS这个“光杆司令”到底输在哪。论文做了个很漂亮的可视化:用t-SNE把查询向量投影到2D空间,每个颜色代表一个真实物体的身份。结果发现,MinVIS的查询向量在不同帧之间严重漂移,同一物体的多个点在空间里散得像天女散花,这必然导致匹配时身份错乱。具体来说,在t-SNE图中,属于同一个物体的查询点(相同颜色)在MinVIS中分布得非常分散,不同物体的点甚至相互重叠,这意味着模型无法为每个物体维持一个稳定、唯一的特征表示。当推理时进行二分图匹配,这种不稳定的表示就会导致频繁的ID切换。

图1:t-SNE可视化
图1:t-SNE可视化,红色虚线椭圆标注了QueenVIS(左)成功维持紧致簇而MinVIS(右)散乱的实例。
为什么MinVIS的查询向量会漂?因为标准的单帧训练只要求查询向量能把本帧内不同物体区分开,至于这个查询向量在下一帧长什么样,模型完全不关心。就像教一个人认动物,但只给看单张照片,不告诉他同一种动物在不同角度的样子。这导致模型根本没有学到物体的“不变特征”。在训练过程中,每个查询向量只负责当前帧的实例分割,其优化目标完全基于当前帧的损失函数,没有任何机制鼓励查询向量在不同帧之间保持一致性。因此,当物体发生运动、形变或光照变化时,查询向量的特征表示就会发生剧烈变化。

QueenVIS的解决方案直击痛点:在单帧训练阶段,额外监督查询向量去预测该物体对应的骨干网络特征(外观)和中心坐标(空间)。这样,查询向量不仅学会了区分本帧物体,还学会了“这个物体长啥样、在哪”——这些知识天然跨帧可用,因为同一个物体的外观和中心位置在相邻帧变化很小。通过引入这两个辅助预测任务,QueenVIS迫使查询向量学习到物体的本质属性,而不是仅仅过拟合当前帧的上下文。例如,特征预测任务要求查询向量能够重建出物体在骨干网络中的特征表示,这本质上是在学习物体的外观模板;而中心预测任务则让查询向量具备空间感知能力,知道物体在图像中的位置。

最骚的是,这两个辅助头训练完就扔掉,推理时QueenVIS和MinVIS的计算量完全一样(相同GFLOPs),零参数增加。这才是真正的“训练时多流汗,推理时少流血”。这意味着,任何基于Mask2Former的VIS方法都可以无缝集成QueenVIS的改进,而无需担心推理效率的下降。这种设计哲学在资源受限的场景下尤其有价值,例如在移动设备或嵌入式系统上进行实时视频分割。

2. 核心机制:查询向量如何“开挂”——特征预测+中心预测

论文用两个精巧的设计把外观和空间先验注入查询向量,我们逐个拆解。这两个设计相辅相成,共同构成了QueenVIS的核心创新。特征预测负责注入外观信息,让查询向量知道物体“长什么样”;中心预测负责注入空间信息,让查询向量知道物体“在哪里”。两者结合,使得查询向量能够形成一个完整、鲁棒的物体表征。

外观感知特征预测(Feature Prediction)
原理很简单:对于每个真实物体,用它的GT mask对骨干网络的中间特征做掩码平均池化(Masked Average Pooling),得到一个“描述符”向量。这个描述符向量可以看作是物体在特征空间中的“指纹”,它聚合了物体区域内所有像素的特征信息,从而得到一个紧凑且具有判别性的外观表示。然后加一个MLP头,把对应的查询向量映射到该描述符空间,并用L1损失监督它去拟合。公式如下:

fi(l) = (Σu,v M̃i(l)(u,v) ⊙ F(l)(:,u,v)) / (Σu,v M̃i(l)(u,v))
其中F(l)是骨干第l层的特征图,M̃i(l)是缩放后的掩码。论文从ResNet的Res4和Res5层提取描述符并拼接,形成最终的目标向量fi。选择Res4和Res5层是因为它们包含了高层语义信息,同时保留了足够的空间分辨率,能够很好地平衡语义和细节。拼接操作则进一步丰富了特征表示。

损失函数是L1归一化后向量的L1距离:
Lfeat = (1/N) Σi || f̂σ(i) / ||f̂σ(i)||2 - fi / ||fi||2 ||1

注意这里的关键设计:这个损失不光当监督信号,还被加入到匈牙利匹配的成本中,让匹配结果也考虑外观一致性。就是说,在单帧的二分图匹配时,模型会优先把查询向量和外观相近的真实物体配对。这样训练出来的查询向量天然就携带了外观编码。具体来说,在计算匈牙利匹配成本时,除了分类损失、边界框损失和掩码损失外,还额外加入了特征预测的L1损失。这使得匹配过程不仅考虑当前帧的预测质量,还隐式地要求查询向量与目标物体在特征空间上保持一致。

空间感知中心预测(Center Prediction)
外观再强,遇到长得一模一样的同类物体(比如OVIS数据集里一堆斑马),光靠外观也区分不了。这时候空间位置就是唯一线索。论文加了一个极其轻量的线性投影层,直接预测每个查询向量对应物体的归一化中心坐标,用L1损失监督:
Lcenter = (1/N) Σi || ĉσ(i) - ci* ||1
ci*是GT掩码包围盒的中心。这个头在消融实验中带来了稳定的+1.3 AP提升。中心预测头的设计极其简单,仅由一个线性层组成,输入是查询向量,输出是二维坐标。这种轻量级设计确保了它不会显著增加训练负担,同时又能有效地将空间信息注入查询向量。

总损失很简单:
L = LMinVIS + λfeat Lfeat + λcenter Lcenter
其中λfeat=0.2, λcenter=0.05。这两个权重系数是通过网格搜索确定的,旨在平衡各项损失的重要性。实验表明,这个权重设置能够在所有数据集上取得最佳的平均性能。

3. 训练时注入知识,推理时零开销

这是QueenVIS最朴实也最厉害的地方。两个辅助头只在训练时存在:特征预测头是一个MLP,中心预测头是一个线性层,训练完成后直接从计算图中移除。推理时模型和MinVIS的参数量、计算量完全相同。这意味着,任何部署了MinVIS的系统都可以无缝升级到QueenVIS,而无需担心推理延迟或内存消耗的增加。

那么问题来了:训练时注入的知识如何保留?答案是这些知识已经编码在查询向量的权重里了。在训练中,优化器更新查询向量(实际上是Decoder的参数)时,会迫使它们不仅学会分类和分割,还学会外观和空间的信息。推理时,虽然辅助头不在了,但查询向量本身已经“记住”了这些信息——就像你小时候背的乘法口诀,虽然考试时不会给你看小抄,但你脑子已经记住了。具体来说,在训练过程中,查询向量通过反向传播不断调整,以最小化包含特征预测和中心预测的总损失。这个优化过程使得查询向量的特征空间被重新组织,使其能够同时编码外观和空间信息。即使辅助头被移除,查询向量本身已经具备了这些能力。

论文的消融实验(表2)清楚展示了这一点:光加训练时查询传播和记忆库(不训练)只涨2.2 AP,而加上特征预测和中心预测训练后,又涨了4.5 AP,效果立竿见影。这充分说明了辅助任务在提升查询向量质量方面的关键作用。值得注意的是,查询传播和记忆库虽然也能带来一定的提升,但它们本质上是在利用已有的查询向量进行后处理,而辅助任务则是从根本上改善了查询向量的质量。

表2:消融实验
表2:渐进消融实验。QP=查询传播,MB=记忆库,FP=特征预测,CP=中心预测。

4. 免训练时序关联:查询传播+记忆库

训练阶段走完,推理时QueenVIS完全不需要任何额外的跟踪头或时序模块。它的跨帧关联由两部分组成,这两部分都是免训练的,进一步降低了方法的复杂度和部署成本。

置信度引导的查询传播(Confidence-Guided Query Propagation)
对于每个查询,如果它在上一帧的得分超过阈值τ=0.8,就把之前优化好的内容嵌入(Content Query)按比例α=0.25融合到当前帧的初始化内容嵌入中:
Cti = α Ct-1i + (1-α) Ct,initi (当st-1i > τ)
这个简单的加权平均给模型提供了一个“暖启动”,让查询在时序上更平滑。低分查询则使用原始初始化,让解码器自己去纠正。这种设计非常合理:对于高置信度的预测,我们相信其查询向量已经很好地编码了物体信息,因此将其传播到下一帧可以保持时序一致性;而对于低置信度的预测,可能本身就存在错误,因此使用原始初始化让模型重新预测更为稳妥。

轻量级非参数记忆库
只靠前一帧传播还是太脆弱,一旦短暂遮挡就丢失身份。QueenVIS从VISAGE借来一个免训练记忆库,存储每个实例最近K=3帧的嵌入,然后通过置信度加权平均得到时序嵌入。当前帧查询与这些记忆库嵌入做匈牙利匹配来继承ID。这个记忆库的作用类似于一个短期记忆,它能够记住物体在过去几帧中的特征,即使物体在当前帧被遮挡,也能通过记忆库中的信息找回其身份。K=3的选择是一个平衡点:太短则无法应对遮挡,太长则可能引入过时的信息。

所有超参数都在表6中做了敏感性分析,结果显示在合理范围内波动很小(AP变动不超过0.5),说明方法很鲁棒。这意味着QueenVIS对超参数的选择不敏感,在实际应用中更容易调优和部署。

表6:超参数消融
表6:查询传播和记忆库的超参数敏感性分析。

5. 结果惊艳:+10.3 AP,逼近视频监督SOTA

直接看硬核指标。表1展示了在三个主流基准上的对比:

表1:主要结果
表1:与SOTA方法的对比。图像监督方法组(最后两行)比较。

YouTube-VIS 2021:MinVIS 44.2 AP → QueenVIS 50.9 AP (+6.7),超过了视频监督方法CAVIS(50.5 AP),离最强VISAGE(51.6 AP)只差0.7 AP。这是一个非常显著的提升,证明了QueenVIS在标准VIS基准上的强大竞争力。

YouTube-VIS 2019:47.4 → 51.8 (+4.4),超越了IDOL和GenVIS等视频监督方法。在2019数据集上的表现进一步验证了QueenVIS的泛化能力。

OVIS(高遮挡):25.0 → 29.8 (+4.8),相对提升近20%,虽然离最强视频监督还有差距,但考虑到完全没用视频训练,这个表现已经非常亮眼。OVIS数据集以高遮挡和密集场景著称,是VIS任务中最具挑战性的基准之一。QueenVIS在此数据集上的大幅提升,证明了其查询向量在应对遮挡方面的鲁棒性。

YouTube-VIS 2022长序列:这是最能体现跨帧关联能力的测试集。MinVIS只有23.3 AP,QueenVIS直接干到33.6 AP,提升10.3个点!AP75更是从19.3涨到34.0,说明长序列下的身份保持能力有了质的飞跃。长序列视频通常包含更多的遮挡、运动模糊和视角变化,对模型的时序一致性提出了极高的要求。QueenVIS在此数据集上的巨大提升,充分展示了其查询向量在长时序上的稳定性。

表3:长序列结果
表3:YouTube-VIS 2022长序列验证集结果。

更关键的诊断分析(表4)表明,QueenVIS的跟踪召回率差距(Tracking-Recall gap)缩小到了1.0 AR1,几乎是Oracle上限——比视频监督的VISAGE(6.2 AR1)和CAVIS(4.2 AR1)还好!这说明它的主要提升来自关联稳定性,而非分割质量的改善。跟踪召回率差距衡量的是模型在关联任务上的表现与理想情况之间的差距,差距越小说明关联越准确。QueenVIS在此指标上的优异表现,直接证明了其查询向量在跨帧匹配上的卓越能力。

表4:诊断分析
表4:诊断误差分析。Δ_TO是跟踪Oracle差距,Δ_TCO是跟踪+分类Oracle差距。

定性结果(图3)也展示了QueenVIS在严重遮挡下能保持正确ID,而MinVIS频繁跳变。例如,在OVIS数据集中,当一只斑马被另一只斑马完全遮挡时,MinVIS的ID会错误地切换到遮挡物上,而QueenVIS则能正确地保持原始ID。这种定性结果直观地展示了QueenVIS在复杂场景下的鲁棒性。

图3:定性对比
图3:定性对比,QueenVIS(底部)在遮挡、消失后再出现等场景下保持正确ID。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1: 为什么要把特征预测和中心预测两个头分开设计?合在一个头里会怎样?A: 论文实验了用一个头同时预测特征和中心,但效果不如分开。因为特征预测需要高维外观信息,中心预测只需要2D坐标,两者优化难度不同,分开能各自聚焦,而且设计上中心预测用单线性层更轻量,不会干扰外观学习。此外,分开设计也使得每个头的损失权重可以独立调节,提供了更大的灵活性。

Q2: 论文中的“Oracle差距”是什么意思?A: Oracle差距是指模型当前结果与“如果这个模块完美工作”的理论上限之间的差值。比如Tracking Oracle就是假设关联部分由上帝给出正确结果,其他部分不变,算出的AP减去真实AP,就代表关联导致的误差。数值越小说明关联越好。这个指标能够帮助我们诊断模型性能瓶颈的来源:如果Tracking Oracle差距很大,说明关联是主要问题;如果分割Oracle差距很大,说明分割是主要问题。

Q3: QueenVIS在OVIS上为什么还落后视频监督方法?A: OVIS的遮挡程度极其严重,很多场景下物体被遮挡超过70%的时长,此时仅靠外观和中心信息不足以维持ID。视频监督方法因为见过真实视频中的遮挡模式,能学习到“遮挡-恢复”的规律,而纯图像训练没机会学这种时序模式。论文认为这是后续改进的方向,比如动态调节记忆库权重或引入时序数据增强。例如,可以通过在训练时模拟帧间的遮挡和运动,让模型学习到更鲁棒的时序特征。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 用训练时辅助目标注入外观和空间先验,思路简洁有效,不是颠覆性创新但足够巧妙,尤其是把特征预测加入匹配成本的设计很聪明。

实验合理度:★★★★★ 在四个基准上对比了十余种方法,进行了详尽的消融和诊断分析,实验设计严谨,各组件贡献明确。

学术研究价值:★★★★☆ 揭示了图像训练提升查询向量质量即可接近视频监督效果,为VIS提供了一条低门槛的研究路径,可能启发更多免视频监督的工作。

稳定性:★★★★☆ 在运动模糊、遮挡等场景下仍能稳定跟踪(OVIS上+4.8 AP),但极端遮挡下仍有提升空间。

适应性以及泛化能力:★★★★☆ 可以嵌入任何基于Mask2Former的VIS架构,但当前仅用ResNet-50验证,更大骨干和跨域测试尚未探索。

硬件需求及成本:★★★★★ 推理时零参数增加,与MinVIS计算量完全相同;训练时只增加了两个轻量头(MLP+线性层),单卡H200即可训练。

复现难度:★★★★☆ 代码已开源,基于公开的Mask2Former和VISAGE代码,但需要正确实现特征池化和中心预测,超参数调优需注意损失权重。

产品化成熟度:★★★☆☆ 适合标注视频困难的场景(如医疗、工业检测),但OVIS高遮挡场景仍需改进;长视频性能突出,可用于监控分析。

可能的问题:1) 极端遮挡下仍显不足;2) 特征预测依赖GT mask质量,标注噪声会传导;3) 仅基于ResNet-50实验,在ViT等大骨干上效果未知。

融会贯通

从更广的视角看,QueenVIS的价值不仅在于VIS任务本身。它再次印证了一个规律:很多时序任务中,跨帧一致性可能主要卡在特征表达的质量上,而非时序建模的复杂度。类似思路在目标跟踪(如SiamRPN++中的特征质量提升)、动作检测等领域已有回响。例如,在单目标跟踪中,通过提升模板特征的质量,可以显著提升跟踪的鲁棒性,这与QueenVIS通过提升查询向量质量来提升VIS性能的思路不谋而合。

结合PaperDaily已收录论文可观察到,纯图像监督VIS这条线近年几乎只有MinVIS一家独苗,而QueenVIS大幅拉高了天花板。不过要注意,当前对比仅针对同等设置(ResNet-50),且OVIS上仍落后视频监督方法6-8个AP,说明时序信息在某些场景下不可或缺。未来可能的方向包括:引入时序数据增强(如帧间光度变换)进一步缩小差距,或把特征预测扩展到对比学习范式。例如,可以设计一个对比学习损失,让同一物体在不同帧的查询向量在特征空间中相互吸引,而不同物体的查询向量相互排斥。

最后,龙哥想说的是:当大家都在追逐更复杂的时序Transformer、更庞大的视频损失时,回头看看查询向量质量这个基本问题,也许正是打破标注瓶颈的最佳路径。QueenVIS用极致的工程简约证明了这一点。它提醒我们,在追求复杂模型的同时,不要忽视基础特征表示的重要性。有时候,一个简单而巧妙的改进,就能带来意想不到的巨大提升。

主要参考文献

[1] Carion et al., "End-to-End Object Detection with Transformers", ECCV 2020. (DETR)
[2] Cheng et al., "Mask2Former: Masked-attention Mask Transformer for Universal Image Segmentation", CVPR 2022.
[3] Wu et al., "Video Instance Segmentation with Temporal Transformers", CVPR 2021. (SeqFormer)
[4] He et al., "Video Instance Segmentation via Contrastive Learning", CVPR 2022. (IDOL)
[5] Hamdi et al., "VISAGE: Video Instance Segmentation with Appearance-GuidEd", ICCV 2023.
[6] Fu et al., "MinVIS: A Minimal Video Instance Segmentation Framework without Video Training", NeurIPS 2023.
[7] Khirodkar et al., "GenVIS: Video Instance Segmentation with Generalizable Representations", CVPR 2023.
[8] He et al., "TCOVIS: Temporally Consistent Online Video Instance Segmentation", CVPR 2023.
[9] Zhang et al., "DVIS: Decoupled Video Instance Segmentation", ICCV 2023.
[10] Yang et al., "CAVIS: Cross-Attention for Video Instance Segmentation", ECCV 2024.
[11] An et al., "Video Panoptic Segmentation with Segment Fusion", NeurIPS 2021.
[12] Hamdi et al., "Deconstructing Video Instance Segmentation", arXiv 2024.
[14] Yang et al., "YouTube-VIS: A Large-Scale Video Instance Segmentation Dataset", CVPR 2019.
[28] Yang et al., "OVIS: Open-World Video Instance Segmentation", CVPR 2022.
[29] He et al., "Deep Residual Learning for Image Recognition", CVPR 2016.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
动动手指,扫码加入龙哥读论文粉丝群!加微信: kangjinlonghelper,备注研究方向+地点+学校/公司+昵称,快速过群~「视频分割」「图像处理」「大模型」等5个方向群等你来撩!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。