← 返回 PaperDaily
视觉与图像
CVPR 2026新作:广西师大砍掉60%模板Token,跟踪精度只掉0.4%
多帧视觉跟踪里模板帧越堆越多,效果却可能越堆越差?ETCTrack用一个可学习的ATC模块把历史模板Token动态压缩60%,MACs直降21.4%,精度只掉0.4%,还在七个基准上拿下SOTA。代码已开源,看完这篇也许能重新理解“给Transformer减负”这件事。
龙哥读论文
发布于 2026-08-27 00:20:02
阅读 6
查看原文
原论文信息如下:
开篇先问一个问题:当你往Transformer里塞越来越多的历史帧信息时,跟踪器真的会越来越准吗?ETCTrack这篇CVPR 2026论文给出的回答是:未必,堆得越多,反而可能被「冗余」拖垮。本文就用最通俗的方式,拆解这个「先压缩、再交互」的新框架到底做了什么。
多帧跟踪的「信息过载」困境:为什么更多模板帧反而更差?
视觉目标跟踪(Visual Object Tracking)这个任务,说白了就是:给定视频第一帧里的目标框,让算法在后续每一帧里都找到目标在哪。作为智能监控、自动驾驶、无人机视觉导航等场景的底层支撑,跟踪技术的每一次升级都备受关注。
Transformer架构凭借全局自注意力机制迅速统治了跟踪领域,而从单帧模板到多帧历史模板的演进,更是把跟踪的鲁棒性推向了新高度。道理很简单:只看第一帧,目标一旦发生剧烈形变、遮挡或光照变化,特征就失真了;把前几帧的信息一起拿来做模板,理论上能获得更全面的「目标画像」。
然而事情没那么简单。历史模板帧越加越多,输入Transformer的视觉Token数量也跟着暴涨。自注意力的计算复杂度是Token数量的平方,计算开销直线上升。更要命的是,多出来的Token并非都是「优质信息」,大量背景、重复纹理、目标遮挡部分的Token反而成了干扰项——它们稀释了注意力权重,让跟踪器更难聚焦于目标本身。
本文作者用一个先导实验把这个问题摆到了台面上:以OSTrack为代表的一流跟踪器为基线,不断增加历史模板帧数,结果性能在第5帧之后不升反降(图1b蓝色线)。这直接验证了「多帧跟踪的瓶颈不是信息不足,而是视觉冗余」。多模态大语言模型(MLLMs)领域早就发现,削减视觉Token的冗余是平衡模型能力与算力开销的关键,而ETCTrack把这个思路系统地搬到了视觉跟踪里。
ATC模块:可学习的Token压缩器如何精准去冗余
既然冗余Token有害,那直接暴力裁剪行不行?显然不行。手工设计的规则(按注意力分数、按固定空间位置)往往和最终的跟踪目标脱节,很容易误删关键特征。ETCTrack给出的方案是ATC(Adaptive Token Compressor,自适应Token压缩器):一个完全可学习的模块,由最终跟踪目标直接监督,动态评估每个Token的上下文重要性。
ATC的输入是历史模板帧的特征F_z∈R^(T·L)×C,其中T是模板帧数,L是每帧的Token数,C是特征维度。它首先把特征重塑成显式的时空结构Z_p∈R^(T×L)×C,再叠加一组可学习的时间位置编码E_temp∈R^(T×1)×C,让模型知道每个Token来自哪一帧。这些带时间位置信息的Token随后被送入TCM(Token Correlation Module,Token关联模块)——由若干层自注意力堆叠而成,通过全局自注意力在所有模板Token之间建立完整的时空关联。TCM输出的Z_context就是「见过全场面」的上下文感知Token。
下一步是真正的「压缩」环节——Mask-Guided Token Pruning and Merging(掩码引导的Token裁剪与合并,见图3)。先通过一个固定的随机投影生成每个Token的重要性分数S,按分数降序排列,所有Token被分成两组:高分的保留目标集A(数量由保留率r控制)和低分的冗余来源集B。
直接丢弃B集合的Token会造成语义信息损失,因此作者设计了Guided Similarity Merging(引导式相似性合并)策略:对B中的每个源Token b_i,通过贪心余弦相似度匹配,找到A中最相似的保留Token a_j,然后把b_i直接加到a_j上。这样一来,冗余Token的信息没有被浪费,而是被「吸收」进了语义最接近的保留Token里。
整个过程可以这样理解:先让所有Token「开个会」互相认识一下(TCM),然后分个高低(重要性打分),最后把能力弱的「意见」合并到能力强的人身上(引导式合并),而不是直接把人赶走。这种设计既保持了信息完整性,又让后续交互的计算量大幅下降。实验表明,配合0.9的保留率,ETCTrack-B224的模板Token数量削减60%,MACs直接降低21.4%,精度只掉了0.4%。
HIBlock:层次化交互如何让模板与搜索特征深度协同
压缩完模板Token,另一个关键问题来了:压缩后的模板如何与搜索区域特征高效交互?早期一步式跟踪器(如OSTrack)的做法是直接把模板和搜索Token拼接起来,送进Transformer做联合编码。这种隐式交互虽然简单有效,但模板对搜索过程的「引导」作用始终不够显式和充分。
HIBlock(Hierarchical Interaction Block,层次化交互模块)把模板与搜索的交互拆成了三个阶段,每个阶段各司其职。整个ETCTrack框架的结构如图2(a)所示:历史模板帧和搜索区域先分别经过Patch Embedding得到Token序列,模板Token先进入ATC模块压缩,压缩后的模板Token与搜索Token一起送入堆叠的HIBlock,最后搜索特征经预测头输出目标框。
每个HIBlock的核心流程如图4和公式3所示。第一阶段是上下文感知增强:压缩后的模板Token作为Q,搜索Token作为K和V,做一次交叉注意力。这一步让模板感知当前搜索帧的目标状态,动态调整自身表示。第二阶段是统一特征建模:增强后的模板Token与搜索Token拼接,送入M个Fast-iTPN骨干块做深度联合建模,让两者在深层语义空间充分融合。第三阶段是模板引导精修:搜索Token作为Q,查询深编码后的模板Token,显式地从模板中抽取与目标最相关的特征,最后再过一个ConvFFN(卷积前馈网络)完成非线性精修。
在Backbone选择上,作者没有用主流的plain ViT,而是选择了Fast-iTPN。原因是视觉跟踪这种细粒度定位任务需要多尺度层次化特征,而标准ViT只生成单尺度特征图。Fast-iTPN作为分层ViT预训练模型,对跟踪任务更友好。训练损失则结合了分类的加权focal loss与回归的L1+GIoU损失。
七大基准全面领先:精度与效率兼得的实验验证
ETCTrack的训练数据包括LaSOT、GOT-10k、TrackingNet、COCO和VastTrack五个数据集,训练配置为300轮、16批大小、5个模板帧,在4张A800 GPU上完成。评测覆盖GOT-10k、LaSOT、LaSOT_ext、TrackingNet、NfS、TNL2K、OTB100七大主流基准。
从主表格可以看到,ETCTrack-B384在GOT-10k上AO达到80.1%,比CVPR 2025的DreamTrack-B384高出1.8个百分点;在LaSOT上AUC 75.9%、TrackingNet上AUC 87.3%、NfS上AUC 71.3%、OTB100上AUC 73.6%,全面领先。而ETCTrack-B224在分辨率减半的情况下,AUC依然保持在73%以上——用大幅降低的计算开销换接近顶级的精度,这个取舍相当划算。更夸张的是,B224版本压缩模板Token达60%,MACs降低21.4%,精度只损失0.4%,几乎可以说是「免费」的效率提升。
图7的可视化结果进一步展示了ATC模块的实际效果:压缩后的模板Token主要保留了目标前景和关键判别区域,大量背景和冗余部分的Token被滤除,注意力分布更加集中。
消融实验深度解析:每个设计选择背后的依据
为了验证每个组件的必要性,作者进行了一系列消融实验。表3展示了ATC模块与HIBlock的独立贡献:单独加ATC,LaSOT AUC从73.7提升到74.4,FLOPs还降低了1G;单独加HIBlock,AUC同样到74.4,但FLOPs增加了3G。两者一起用,AUC到了74.9,FLOPs只比基线多1G——说明「压缩」和「高效交互」是天然搭档,压缩省下来的算力正好补贴给更深度的交互。
表4研究了保留率r的选择。r=0.9时性能最高(LaSOT AUC 74.9),不仅高于不压缩的r=1.0(74.4),还高了0.5个点——这说明压缩掉10%的Token不仅省算力,还能顺带滤除噪声、提升精度。r降到0.7和0.5时精度有所回落但仍与基线持平,而MACs持续下降。保留率的选择本质上是找「去噪」和「信息保留」的最优平衡点。
表5验证了TCM内部结构的设计选择,表6研究了模板帧数的影响,表7则对比了不同Backbone的效果。这些实验共同支撑了论文的几个关键设计决策:TCM层数不宜过深、5帧模板是当前最优配置、Fast-iTPN作为Backbone对分层特征提取有明显增益。
局限与展望:动态Token压缩的未来方向
虽然ETCTrack在精度和效率上都给出了亮眼的答卷,但一些局限同样值得关注。首先是保留率r的取值是固定的(0.9),而真实场景中目标运动的复杂度、遮挡程度各不相同,理想的压缩率理应动态调整——静态超参恐怕不是最优解。其次,当前只在模板侧做了压缩,搜索区域本身的Token量同样可观,如果对搜索侧也做协同压缩,推理速度还有进一步提升的空间。
另外,训练和推理都固定使用5帧模板,对于目标长时间消失又重现的场景,5帧的上下文窗口可能不够充裕。未来如果能结合更长的视频记忆机制,或者让模板帧的选择也变成可学习的,ETCTrack的框架完全可以进一步演化。还有一个值得思考的方向:ETCTrack从多模态大语言模型(MLLMs)中借鉴了Token压缩的思想,那跟踪任务中积累的时空感知经验,能否反向输出给MLLMs的视频理解模块?这个双向流动的想象空间很大。
龙迷三问
这篇论文到底在解决什么问题? 视觉跟踪里的历史模板帧常带大量冗余Token,堆得越多反而越“钝”。
这篇工作最值得看的点是什么? 在七个基准上均取得最优或次优性能。ETCTrack-B224在GOT-10k上AO达79.2%,超越所有更高分辨率跟踪器;ETCTrack-B384在LaSOT上AUC达75.9%,超越DreamTrack-B384达0.9%;在NfS和OTB100上均取得最高AUC分数。
这篇工作的边界或风险在哪里? 优点:(1)提出可学习的ATC模块,超越手工规则,能自适应压缩冗余token;(2)HIBlock设计实现深度层次化交互;(3)在多个基准上取得SOTA性能且计算开销低;(4)消融实验较全面。缺点:(1)token压缩率固定(keep ratio r),缺乏完全动态的自适应压缩机制;(2)ATC模块引入额外计算开销;(3)对模板帧数的选择(5帧)可能不是最优;(4)与更高分辨率跟踪器比较时,部分对比方法未在相同条件下训练。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一种"先压缩后交互"的跟踪框架ETCTrack,通过自适应Token压缩器(ATC)消除历史模板帧中的视觉冗余,再通过层次化交互编码器实现模板与搜索特征的深度交互。
实验合理度: ★★★★☆
AUC, P_norm, P, AO, SR_0.5, SR_0.75
学术研究价值: ★★★★☆
提出一种"先压缩后交互"的跟踪框架ETCTrack,通过自适应Token压缩器(ATC)消除历史模板帧中的视觉冗余,再通过层次化交互编码器实现模板与搜索特征的深度交互;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
ETCTrack-B224将模板token数量减少60%,MACs降低21.4%,仅精度下降0.4%;B224版本MACs约34G
复现难度: ★★★☆☆
https://github.com/PJD-WJ/ETCTrack
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1)token压缩率固定(keep ratio r),缺乏完全动态的自适应压缩机制;(2)ATC模块引入额外计算开销;
主要参考文献
[1] Ye B, Chang H, Ma B, et al. Joint feature learning and relation modeling for tracking: Exploring the interaction between template and search regions[J]. ECCV 2022. (OSTrack)
[2] Wu J, Liu J, et al. ODTrack: One-stream tracking with historical frames[J]. AAAI 2024.
[3] Xie F, et al. Fast-iTPN: Hierarchical vision transformer for visual tracking[J]. 2024.
[4] Chen X, et al. VideoTrack: Learning to track objects via video transformer[J]. CVPR 2023.
[5] Yuan S, et al. ARTrackV2: Autoregressive visual tracking revisited[J]. CVPR 2024.
[6] Cui Y, et al. DreamTrack: Towards multi-object visual tracking with diffusion transformers[J]. CVPR 2025.
[7] Wu W, Liang Q, Zhong B, et al. An efficient token compression framework for visual object tracking[J]. CVPR 2026.
结合PaperDaily已收录的论文来看,多帧视觉跟踪正在从「堆帧数」的蛮力模式走向「精压缩」的效率模式。从ODTrack、ARATrackV2到ETCTrack,进化路线非常清晰:都是先尝试引入更多历史信息,然后发现冗余问题,最后用更精细的机制去解决。ETCTrack的贡献在于把「压缩」从手工规则升级为可学习的端到端模块,让模板Token的选取直接服务于跟踪目标。
不过要提醒的是,不同论文之间的数字对比存在训练集组合、模板帧数、分辨率等设置差异。比如本文的B224与B384就是两套评测尺度,和同分辨率的基线比才公平。读者在横向参考PaperDaily收录的同类结果时,建议先确认设置是否一致,避免被单一数字误导。目前同基准的横向对比数据还不够完整,后续可以持续关注。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
看完ETCTrack,是不是也想给自家跟踪模型“减减负”?欢迎加入龙哥读论文粉丝群,和龙哥、龙迷们一起聊聊Token压缩、多帧跟踪和视觉Transformer的新玩法。
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 视觉跟踪+上海+广西师大+小龙) ,根据格式备注,可更快被通过且邀请进群~