← 返回 PaperDaily 视觉与图像

东南大学ScanFocus:视频时空定位边界提升5.4%

这篇论文最有意思的地方,不是又堆了多少模块,而是很直接地指出:视频时空定位真正卡脖子的,往往不是“看不见”,而是“边界看不准”。ScanFocus把任务拆成粗扫和细抠两步,思路朴素,但对长视频定位很对症。

东南大学ScanFocus:视频时空定位边界提升5.4%
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是又堆了多少模块,而是很直接地指出:视频时空定位真正卡脖子的,往往不是“看不见”,而是“边界看不准”。ScanFocus把任务拆成粗扫和细抠两步,思路朴素,但对长视频定位很对症。


原论文信息如下:
论文标题:
ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding
发表日期:
2026年07月
发表单位:
Southeast University
原文链接:
https://arxiv.org/pdf/2607.12466v1.pdf
开源代码链接:
https://github.com/TenMinutes209/ScanFocu

引言:高清边界去哪了?视频定位的时序模糊困境

视频时空定位(Spatio-Temporal Video Grounding,STVG)听起来很学术,翻成大白话其实就是:给一段长视频和一句文字描述,模型要把“这个目标物体在什么时候、在哪里出现”找出来。难点不在“找”,而在“找得准”。因为一旦时间边界差几帧,空间框再稳也白搭,最后就是看着差不多,分数却很难看。
这篇论文一针见血地指出了一个很现实的问题:现有方法为了处理长视频,通常会做低频采样,也就是“隔几帧看一眼”。这样做省算力,但代价也很直接——边界附近那些最关键、最细碎的时序变化,常常被采样采没了。模型看到的不是“边界”,而是“边界的马赛克版”。
图1:时序边界定位范式对比
图1:时序边界定位范式对比。传统 Transformer 类方法往往因为全局下采样压掉了高频时序线索,导致边界发虚;ScanFocus 则先粗扫全局,再对边界附近做密集采样,把“看不清”的细节重新捞回来。
论文里还做了一个很有说服力的 Oracle 分析:如果把时间戳直接换成真实标注,性能会大幅跳升。这个结果说明,很多方法并不是“不会找这个物体”,而是“知道是谁,却卡在什么时候出现”。说白了,空间定位已经不算太差,真正拖后腿的是时间边界这根细针。
这就引出了 ScanFocus 的核心思路:别再让一个模型同时背着“全局理解”和“精细边界”两座大山跑马拉松了,干脆拆成两步。先用低成本做全局扫描,再围着粗边界做局部精修。这个思路不花哨,但很像真正干活的人:先把大方向看对,再把细节抠准。

方法:模仿人眼,两步走——先扫全局,再盯局部

ScanFocus 的结构很像人看东西的方式:先扫一眼场景,知道目标大概在哪;再把视线拉近,抠边界、看动作、盯变化。论文把 STVG 拆成两个阶段,名字也很直白:全局扫描局部聚焦
图3:ScanFocus整体架构图
图3:ScanFocus 整体架构图。第一阶段先用统一的视觉-语言融合编码器和轻量的语义-运动融合模块做粗粒度对齐,输出粗空间轨迹和粗时间区间;第二阶段再围绕粗边界做密集采样,并通过 SGTA 进一步精修开始和结束时间。
图4:多模态融合机制对比
图4:多模态融合机制对比。很多旧方法把视觉、语言、运动三种信息一股脑塞进一个大 Transformer 里,结果就是“什么都想学,什么都学得不够精”。ScanFocus 换成了更省事也更稳的做法:先用大规模预训练的统一视觉-语言编码器把视觉和文本对齐,再用轻量的语义-运动融合模块补上运动信息。
这里有两个关键词值得先解释一下。BEiT-3 是论文里用于视觉-语言建模的预训练编码器,作用是把图像和文本放到同一个语义空间里;VideoMAE 则负责提取视频运动特征,补足“静态图像看不到动作变化”的短板。前者像“识人识物的老江湖”,后者像“专门盯动作的观察员”。
全局阶段先做稀疏采样,只看少量帧,目的是把长视频压缩成可计算的粗线索。随后,论文用一个轻量的 Deformable Semantic-Motion Fusion 模块把语义和运动信息融合起来。这里的“Deformable”可以理解成“别死盯固定位置,而是让注意力去少数最关键的点上找信息”,这样比全连接式的大撒网更省算力,也更适合长视频。
接着是两个 DETR 风格的解码器,一个负责空间轨迹,一个负责时间区间。DETR 的中文可以理解为“直接预测目标位置的检测框架”,本质上是用可学习查询去回归结果,而不是靠一堆手工候选框慢慢筛。这里的关键不是“又用了 DETR”,而是它只负责粗定位,不再硬扛精细边界,这就把任务拆轻了。
第二阶段才是这篇论文真正的脾气:围绕粗时间边界,重新密集采样局部窗口。注意,这里不是把整段视频都加密采样,那样计算量会爆炸;而是只盯着“可能出错的边界附近”。这种做法很聪明,属于把钱花在刀刃上。
为了让精修阶段不至于“看见了局部,却忘了全局”,论文选择复用粗阶段的特征提取和融合模块。这样一来,局部窗口既保留语义一致性,又不会额外堆出一套独立大模型。工程上看,这种共享设计很实在:参数更省,训练也更稳。

亮点:SGTA模块——语义引导,精准抓取边界动态

如果说前面的粗扫是在“找大概”,那 SGTA 就是在“抠细节”。SGTA 的全称是 Semantic-Guided Temporal Aggregator,中文可以叫“语义引导时序聚合器”。它的任务很明确:在边界附近,把那些容易被粗采样漏掉的高频时序变化重新抓回来。
图5:SGTA模块细节结构
图5:SGTA 模块细节结构。它先根据粗时间边界构造局部窗口,再把粗阶段得到的空间轨迹插值成密集空间先验,随后用语义信息去筛掉背景干扰,最后通过时序自注意力捕捉边界附近的短时变化。
SGTA 的第一步是密集边界采样。它不是凭空重新看一整段视频,而是围着粗预测的起止时间各开一个局部窗口,在窗口里用更高的采样率取帧。这样做的逻辑很朴素:边界附近最容易出错,那就把算力集中到这里。
第二步是构造空间先验。论文会把粗阶段输出的空间框序列插值到局部窗口长度,再用 RoI Pooling 在目标区域上提取外观特征。RoI Pooling 可以简单理解成“只看框里面的内容,不让背景来捣乱”。这一步很关键,因为边界定位不是纯时间问题,目标物体本身也会在边界附近发生位移、遮挡、转身等变化。
第三步是语义引导。SGTA 并不是把运动特征单独丢进时序模块,而是先让外观特征、运动特征和文本特征互相“对齐口径”。这样做的好处是,模型不会把背景里的无关运动当成目标动作。比如文本说的是“戴帽子的人转身走向门口”,那模型就得盯住“戴帽子的人”和“走向门口”这两个语义线索,而不是把旁边路过的路人当主角。
最后,SGTA 把局部窗口里的特征拉平成一个长序列,送进时序自注意力层做交互。这里的核心不是“注意力又来了”,而是它在一个很小的局部窗口里显式建模帧与帧之间的依赖关系。以前很多方法只做帧级融合,像是每帧单独看病;SGTA 则是在边界附近做“连续病历复盘”,所以更容易抓住动作变化发生的那一瞬间。

实验:全面碾压,三个Benchmark上刷新SOTA

论文的实验设置比较标准,主要放在三个常用基准上:HC-STVGv1、HC-STVGv2 和 VidSTG。评价指标包括 m_tIoU(平均时间交并比)、m_vIoU(时空管道交并比)以及 vIoU@R。简单说,前者看时间边界准不准,中间那个看时空整体对不对,后者看达到某个严格阈值的样本占比。
从结果看,ScanFocus 不是只在某一个指标上“蹭到提升”,而是多个指标一起往上走,说明它的改进确实对准了任务痛点,而不是靠某个偶然设置刷出来的分数。
表1:HC-STVGv1对比结果
表1:HC-STVGv1 对比结果。ScanFocus 在所有指标上都超过了之前方法,尤其是更严格的 vIoU@0.3 和 vIoU@0.5,说明它对边界的把控更稳,不只是“看起来差不多”。
在 HC-STVGv1 上,ScanFocus 的 vIoU@0.3 和 vIoU@0.5 分别达到 67.5% 和 42.2%,相较此前较强的方法 TA-STVG 提升了 4.4 和 5.4 个百分点。对这种任务来说,严格阈值下还能涨得这么明显,通常意味着边界精修确实起作用了,而不是“换个名字继续做同一件事”。
表2:HC-STVGv2对比结果
表2:HC-STVGv2 对比结果。这个数据集规模更大,ScanFocus 依旧保持领先,说明方法不是只在小规模数据上会“过拟合式表演”,而是有一定泛化能力。
在 HC-STVGv2 上,ScanFocus 的 tIoU 提升 2.0 个百分点,vIoU@0.5 提升 2.6 个百分点。虽然绝对增幅没有 HC-STVGv1 那么夸张,但在更难、更大的数据集上还能稳步领先,反而更说明方法不是靠运气。
表3:VidSTG对比结果
表3:VidSTG 对比结果。这个数据集的语言表达更复杂,既有陈述句,也有疑问句。ScanFocus 在两类句子上都保持领先,说明它对文本表达方式并不挑食,泛化性还算靠谱。
这部分最值得注意的,不是“赢了多少”,而是“为什么能赢”。从方法设计看,ScanFocus 的优势来自两个地方:一是粗阶段用低成本拿到大致语义和空间轨迹,避免全局建模过重;二是细阶段只围绕边界做高密度局部推理,把被压掉的高频信息重新找回来。它不是把模型做大,而是把计算放对地方。
图6:ScanFocus定性结果
图6:ScanFocus 定性结果。可以看到,粗阶段的边界经常偏松或偏早/偏晚,而精修阶段能够把时间区间拉回到更接近真实标注的位置,视觉上就像“先画草稿,再描边”。
表4:组件消融实验
表4:组件消融实验。只加密采样会有提升,但真正把 SGTA 加进去后,性能才更完整地涨起来,说明“看得更密”还不够,还得“想得更细”。
消融实验里一个很典型的现象是:单纯加 DS(密集采样)能提升时间定位,但空间质量未必同步变强,甚至会有轻微波动。这个结果很正常,因为原始密集帧只是“信息更多”,并不自动等于“信息更有效”。SGTA 的价值就在于,它把这些密集帧重新组织成有语义约束的时序表示,避免局部窗口变成一锅粥。
表5:窗口大小影响
表5:窗口大小影响。局部窗口太小,边界上下文不够;太大,又会把无关信息拉进来。实验显示 8 帧左右比较合适,说明这个方法确实在“上下文”和“噪声”之间找到了平衡。
表6:SGTA设计消融
表6:SGTA 设计消融。语义引导和时序注意力缺一不可,单独拿掉任意一块,效果都会打折。这个结果也印证了一个常识:边界定位不是纯时间建模,语义对齐同样重要。
表7:融合机制消融
表7:融合机制消融。轻量的 Deformable Semantic-Motion Fusion 在效果和复杂度之间找到了更好的平衡,说明这篇论文不是单纯追求“更大更重”,而是在算力和精度之间做了更聪明的取舍。

结语:粗到细框架,为视频理解开辟新范式

ScanFocus 这篇工作最有价值的地方,不是又堆出一个复杂大模型,而是把 STVG 里最难的那根刺挑了出来:边界模糊。它没有和全局建模硬刚,而是承认长视频里“先看大概、再看细节”才更符合真实需求,于是用粗到细的两阶段框架把问题拆开解决。
从工程角度看,这种设计也比较讨喜。粗阶段控制了计算量,细阶段只在局部窗口上发力,避免了整段视频都做高分辨率建模的成本爆炸。再加上共享编码器和轻量融合模块,整体更接近可落地的路线,而不是实验室里“性能很强、显存也很强”的那类方案。
当然,它也不是没有边界。首先,精修阶段依赖粗阶段的时间预测质量,如果第一步偏得太离谱,后面局部窗口开错地方,修得再认真也难救。其次,这套方法虽然比全局密集建模省,但仍然是两阶段流水线,训练和调参复杂度比单阶段模型更高。最后,文中主要验证的是常见基准,面对更长、更嘈杂、目标更频繁遮挡的真实视频流,稳定性还需要更多检验。
如果把这篇论文放到更大的视频理解脉络里看,它其实传递了一个挺实用的信号:很多“难题”不一定要靠更大的模型硬解,也可以靠更合理的任务拆分去解。这对做视频定位、视频问答、时序检测的研究都很有启发。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决的到底是什么问题?它解决的是视频时空定位里“边界不准”的老大难。不是目标找不到,而是目标在视频里出现的起止时间容易被低频采样和全局建模压糊,所以 ScanFocus 才要先粗扫、再精修。

SGTA 到底在干什么?SGTA 是语义引导时序聚合器,先围绕粗边界取局部高密度帧,再用文本语义和空间先验过滤背景干扰,最后通过时序自注意力捕捉边界附近的细微动作变化。

为什么它比以前的方法更准?因为它没有把所有帧一锅端地平均处理,而是把计算资源集中在最容易出错的边界附近;同时又保留全局阶段的语义理解,所以既不丢大方向,也不丢细节。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 亮点不在“发明了一个前所未有的大模块”,而在于把 STVG 的痛点拆得很准:全局扫描 + 局部聚焦,这个粗到细的框架对症下药。

实验合理度:★★★★☆ 三个基准、多个严格指标、消融也比较完整,能说明问题。唯一要留意的是两阶段设计带来的复杂度,不能只看分数不看代价。

学术研究价值:★★★★☆ 对长视频时序边界建模有明确启发,尤其适合后续继续研究“如何在不爆算力的前提下补回高频细节”。

稳定性:★★★☆☆ 思路合理,但依赖粗阶段预测质量,前一步偏差过大时,后一步的局部精修会受影响。

适应性以及泛化能力:★★★★☆ 在 HC-STVGv1/v2 和 VidSTG 上都能保持领先,说明不是只在单一数据集上好看。

硬件需求及成本:★★★☆☆ 比全局高密建模省,但两阶段和局部高密采样仍然不算轻。更像“聪明省”,不是“无脑省”。

复现难度:★★★☆☆ 方法模块不少,训练还分粗细两阶段;好在代码计划开源,整体可复现性中等偏上。

产品化成熟度:★★★☆☆ 适合做研究型原型或离线分析,若要上实时系统,还得继续压缩时延和简化流水线。

可能的问题:边界窗口选错会影响精修;两阶段训练和推理链路较长,真实长视频场景里还要继续验证鲁棒性。


主要参考文献

[1] Kai Chen, Ming Dai, Wenxuan Cheng, Wankou Yang. ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding. arXiv:2607.12466v1, 2026.
[2] ScanFocus 官方代码:https://github.com/TenMinutes209/ScanFocu

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
📌 这篇讲“先扫再抠边界”的视频定位论文,适合进群一起拆细节、聊落地。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。