← 返回 PaperDaily 视觉与图像

CVPR 2026新作:广西师大砍掉60%模板Token,跟踪精度只掉0.4%

多帧视觉跟踪里模板帧越堆越多,效果却可能越堆越差?ETCTrack用一个可学习的ATC模块把历史模板Token动态压缩60%,MACs直降21.4%,精度只掉0.4%,还在七个基准上拿下SOTA。代码已开源,看完这篇也许能重新理解“给Transformer减负”这件事。

CVPR 2026新作:广西师大砍掉60%模板Token,跟踪精度只掉0.4%
原论文信息如下:
论文标题:
An Efficient Token Compression Framework for Visual Object Tracking

发表日期:
2026年5月

发表单位:
广西师范大学、梧州学院

原文链接:
https://arxiv.org/pdf/2605.08329.pdf

开源代码链接:
https://github.com/PJD-WJ/ETCTrack

开篇先问一个问题:当你往Transformer里塞越来越多的历史帧信息时,跟踪器真的会越来越准吗?ETCTrack这篇CVPR 2026论文给出的回答是:未必,堆得越多,反而可能被「冗余」拖垮。本文就用最通俗的方式,拆解这个「先压缩、再交互」的新框架到底做了什么。

多帧跟踪的「信息过载」困境:为什么更多模板帧反而更差?

视觉目标跟踪(Visual Object Tracking)这个任务,说白了就是:给定视频第一帧里的目标框,让算法在后续每一帧里都找到目标在哪。作为智能监控、自动驾驶、无人机视觉导航等场景的底层支撑,跟踪技术的每一次升级都备受关注。
Transformer架构凭借全局自注意力机制迅速统治了跟踪领域,而从单帧模板到多帧历史模板的演进,更是把跟踪的鲁棒性推向了新高度。道理很简单:只看第一帧,目标一旦发生剧烈形变、遮挡或光照变化,特征就失真了;把前几帧的信息一起拿来做模板,理论上能获得更全面的「目标画像」。
然而事情没那么简单。历史模板帧越加越多,输入Transformer的视觉Token数量也跟着暴涨。自注意力的计算复杂度是Token数量的平方,计算开销直线上升。更要命的是,多出来的Token并非都是「优质信息」,大量背景、重复纹理、目标遮挡部分的Token反而成了干扰项——它们稀释了注意力权重,让跟踪器更难聚焦于目标本身。
图1 性能与计算量对比及视觉冗余影响
图1:(a) 近期SOTA跟踪器的AUC与MACs对比;(b) 在LaSOT上,基线模型在第5帧后因视觉冗余性能下降,而加入ATC模块后性能随帧数持续提升;(c) ATC模块与模板Token数量对LaSOT AUC的影响;(d) ATC模块带来的效率提升。
本文作者用一个先导实验把这个问题摆到了台面上:以OSTrack为代表的一流跟踪器为基线,不断增加历史模板帧数,结果性能在第5帧之后不升反降(图1b蓝色线)。这直接验证了「多帧跟踪的瓶颈不是信息不足,而是视觉冗余」。多模态大语言模型(MLLMs)领域早就发现,削减视觉Token的冗余是平衡模型能力与算力开销的关键,而ETCTrack把这个思路系统地搬到了视觉跟踪里。

ATC模块:可学习的Token压缩器如何精准去冗余

既然冗余Token有害,那直接暴力裁剪行不行?显然不行。手工设计的规则(按注意力分数、按固定空间位置)往往和最终的跟踪目标脱节,很容易误删关键特征。ETCTrack给出的方案是ATC(Adaptive Token Compressor,自适应Token压缩器):一个完全可学习的模块,由最终跟踪目标直接监督,动态评估每个Token的上下文重要性。
ATC的输入是历史模板帧的特征F_z∈R^(T·L)×C,其中T是模板帧数,L是每帧的Token数,C是特征维度。它首先把特征重塑成显式的时空结构Z_p∈R^(T×L)×C,再叠加一组可学习的时间位置编码E_temp∈R^(T×1)×C,让模型知道每个Token来自哪一帧。这些带时间位置信息的Token随后被送入TCM(Token Correlation Module,Token关联模块)——由若干层自注意力堆叠而成,通过全局自注意力在所有模板Token之间建立完整的时空关联。TCM输出的Z_context就是「见过全场面」的上下文感知Token。
公式1 上下文特征计算
公式1:TCM输出的上下文特征Z_context的维度与输入保持一致,其中T·L是所有历史模板帧的Token总数,C是特征通道数。
下一步是真正的「压缩」环节——Mask-Guided Token Pruning and Merging(掩码引导的Token裁剪与合并,见图3)。先通过一个固定的随机投影生成每个Token的重要性分数S,按分数降序排列,所有Token被分成两组:高分的保留目标集A(数量由保留率r控制)和低分的冗余来源集B。
图3 掩码引导的Token裁剪与合并模块
图3:Mask-Guided Token Pruning and Merging(掩码引导的Token裁剪与合并模块)。先是对Token做重要性排序,再通过引导相似性合并将冗余Token的信息融入保留Token,而不是直接丢弃。
直接丢弃B集合的Token会造成语义信息损失,因此作者设计了Guided Similarity Merging(引导式相似性合并)策略:对B中的每个源Token b_i,通过贪心余弦相似度匹配,找到A中最相似的保留Token a_j,然后把b_i直接加到a_j上。这样一来,冗余Token的信息没有被浪费,而是被「吸收」进了语义最接近的保留Token里。
公式2 引导式相似性合并
公式2:a_j′是合并后的保留Token,Ω_j表示被分配给a_j的源Token索引集合。合并后的特征集F_comp在消除冗余的同时,保留了原Token集合的主要语义信息。
整个过程可以这样理解:先让所有Token「开个会」互相认识一下(TCM),然后分个高低(重要性打分),最后把能力弱的「意见」合并到能力强的人身上(引导式合并),而不是直接把人赶走。这种设计既保持了信息完整性,又让后续交互的计算量大幅下降。实验表明,配合0.9的保留率,ETCTrack-B224的模板Token数量削减60%,MACs直接降低21.4%,精度只掉了0.4%。

HIBlock:层次化交互如何让模板与搜索特征深度协同

压缩完模板Token,另一个关键问题来了:压缩后的模板如何与搜索区域特征高效交互?早期一步式跟踪器(如OSTrack)的做法是直接把模板和搜索Token拼接起来,送进Transformer做联合编码。这种隐式交互虽然简单有效,但模板对搜索过程的「引导」作用始终不够显式和充分。
HIBlock(Hierarchical Interaction Block,层次化交互模块)把模板与搜索的交互拆成了三个阶段,每个阶段各司其职。整个ETCTrack框架的结构如图2(a)所示:历史模板帧和搜索区域先分别经过Patch Embedding得到Token序列,模板Token先进入ATC模块压缩,压缩后的模板Token与搜索Token一起送入堆叠的HIBlock,最后搜索特征经预测头输出目标框。
图2 ETCTrack整体框架与ATC模块结构
图2:(a) ETCTrack框架总览。历史模板Token先经ATC压缩,再与搜索Token共同送入层次化交互编码器,最终由预测头输出目标框;(b) ATC模块的详细结构。
每个HIBlock的核心流程如图4和公式3所示。第一阶段是上下文感知增强:压缩后的模板Token作为Q,搜索Token作为K和V,做一次交叉注意力。这一步让模板感知当前搜索帧的目标状态,动态调整自身表示。第二阶段是统一特征建模:增强后的模板Token与搜索Token拼接,送入M个Fast-iTPN骨干块做深度联合建模,让两者在深层语义空间充分融合。第三阶段是模板引导精修:搜索Token作为Q,查询深编码后的模板Token,显式地从模板中抽取与目标最相关的特征,最后再过一个ConvFFN(卷积前馈网络)完成非线性精修。
图4 HIBlock的结构
图4:Hierarchical Interaction Block(层次化交互模块)的结构。先让模板查询搜索特征完成上下文感知,再拼接联合建模,最后让搜索特征模板引导精修,形成完整的不对称交互闭环。
公式3 HIBlock流程
公式3:HIBlock的四步流程。F_comp是压缩后的模板Token,F_x是搜索Token,经过上下文感知增强、拼接联合建模、模板引导精修和ConvFFN最后精修,输出F_out作为预测头的输入。
在Backbone选择上,作者没有用主流的plain ViT,而是选择了Fast-iTPN。原因是视觉跟踪这种细粒度定位任务需要多尺度层次化特征,而标准ViT只生成单尺度特征图。Fast-iTPN作为分层ViT预训练模型,对跟踪任务更友好。训练损失则结合了分类的加权focal loss与回归的L1+GIoU损失。
公式4 总体损失函数
公式4:总损失函数由分类损失L_cls、边界框回归的IoU损失L_iou和L1损失组成,权重λ_iou与λ_L1分别设为2和5。

七大基准全面领先:精度与效率兼得的实验验证

ETCTrack的训练数据包括LaSOT、GOT-10k、TrackingNet、COCO和VastTrack五个数据集,训练配置为300轮、16批大小、5个模板帧,在4张A800 GPU上完成。评测覆盖GOT-10k、LaSOT、LaSOT_ext、TrackingNet、NfS、TNL2K、OTB100七大主流基准。
表1和表2 主实验结果
表1&表2:与SOTA跟踪器在GOT-10k、LaSOT、LaSOT_ext、TrackingNet、TNL2K、NfS和OTB100上的性能对比。前两名分别用粗体和下划线标出。
从主表格可以看到,ETCTrack-B384在GOT-10k上AO达到80.1%,比CVPR 2025的DreamTrack-B384高出1.8个百分点;在LaSOT上AUC 75.9%、TrackingNet上AUC 87.3%、NfS上AUC 71.3%、OTB100上AUC 73.6%,全面领先。而ETCTrack-B224在分辨率减半的情况下,AUC依然保持在73%以上——用大幅降低的计算开销换接近顶级的精度,这个取舍相当划算。更夸张的是,B224版本压缩模板Token达60%,MACs降低21.4%,精度只损失0.4%,几乎可以说是「免费」的效率提升。
图5 LaSOT不同属性AUC
图5:在LaSOT上不同挑战属性下的AUC对比。在形变、遮挡、运动模糊等困难属性上,ETCTrack的优势尤为明显。
图6 LaSOT AUC与模板帧数关系
图6:在LaSOT上不同模板帧数对AUC的影响。随着模板帧数增加,本文方法的性能持续提升,证明了ATC模块有效克服了多帧跟踪的冗余瓶颈。
图7的可视化结果进一步展示了ATC模块的实际效果:压缩后的模板Token主要保留了目标前景和关键判别区域,大量背景和冗余部分的Token被滤除,注意力分布更加集中。
图7 冗余消除可视化
图7:视觉冗余消除的可视化对比。ATC模块有效滤除了模板中的背景和冗余Token,将注意力集中在目标的判别性区域。

消融实验深度解析:每个设计选择背后的依据

为了验证每个组件的必要性,作者进行了一系列消融实验。表3展示了ATC模块与HIBlock的独立贡献:单独加ATC,LaSOT AUC从73.7提升到74.4,FLOPs还降低了1G;单独加HIBlock,AUC同样到74.4,但FLOPs增加了3G。两者一起用,AUC到了74.9,FLOPs只比基线多1G——说明「压缩」和「高效交互」是天然搭档,压缩省下来的算力正好补贴给更深度的交互。
表3 ATC与HIBlock消融
表3:在LaSOT和TNL2K上对ATC模块和HIBlock的消融研究。两者都能单独提升性能,组合后效果最佳。
表4研究了保留率r的选择。r=0.9时性能最高(LaSOT AUC 74.9),不仅高于不压缩的r=1.0(74.4),还高了0.5个点——这说明压缩掉10%的Token不仅省算力,还能顺带滤除噪声、提升精度。r降到0.7和0.5时精度有所回落但仍与基线持平,而MACs持续下降。保留率的选择本质上是找「去噪」和「信息保留」的最优平衡点。
表4 保留率对比
表4:不同保留率r下的性能与计算量对比。r=0.9是精度与效率的最佳平衡点。
表5验证了TCM内部结构的设计选择,表6研究了模板帧数的影响,表7则对比了不同Backbone的效果。这些实验共同支撑了论文的几个关键设计决策:TCM层数不宜过深、5帧模板是当前最优配置、Fast-iTPN作为Backbone对分层特征提取有明显增益。
表5 TCM架构消融
表5:在LaSOT上对不同TCM架构的消融对比。
表6 模板数量消融
表6:在LaSOT上对模板帧数量的消融研究,5帧模板取得最优性能。
表7 Backbone影响
表7:不同Backbone对LaSOT和TNL2K性能的影响。

局限与展望:动态Token压缩的未来方向

虽然ETCTrack在精度和效率上都给出了亮眼的答卷,但一些局限同样值得关注。首先是保留率r的取值是固定的(0.9),而真实场景中目标运动的复杂度、遮挡程度各不相同,理想的压缩率理应动态调整——静态超参恐怕不是最优解。其次,当前只在模板侧做了压缩,搜索区域本身的Token量同样可观,如果对搜索侧也做协同压缩,推理速度还有进一步提升的空间。
另外,训练和推理都固定使用5帧模板,对于目标长时间消失又重现的场景,5帧的上下文窗口可能不够充裕。未来如果能结合更长的视频记忆机制,或者让模板帧的选择也变成可学习的,ETCTrack的框架完全可以进一步演化。还有一个值得思考的方向:ETCTrack从多模态大语言模型(MLLMs)中借鉴了Token压缩的思想,那跟踪任务中积累的时空感知经验,能否反向输出给MLLMs的视频理解模块?这个双向流动的想象空间很大。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?视觉跟踪里的历史模板帧常带大量冗余Token,堆得越多反而越“钝”。
这篇工作最值得看的点是什么?在七个基准上均取得最优或次优性能。ETCTrack-B224在GOT-10k上AO达79.2%,超越所有更高分辨率跟踪器;ETCTrack-B384在LaSOT上AUC达75.9%,超越DreamTrack-B384达0.9%;在NfS和OTB100上均取得最高AUC分数。
这篇工作的边界或风险在哪里?优点:(1)提出可学习的ATC模块,超越手工规则,能自适应压缩冗余token;(2)HIBlock设计实现深度层次化交互;(3)在多个基准上取得SOTA性能且计算开销低;(4)消融实验较全面。缺点:(1)token压缩率固定(keep ratio r),缺乏完全动态的自适应压缩机制;(2)ATC模块引入额外计算开销;(3)对模板帧数的选择(5帧)可能不是最优;(4)与更高分辨率跟踪器比较时,部分对比方法未在相同条件下训练。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种"先压缩后交互"的跟踪框架ETCTrack,通过自适应Token压缩器(ATC)消除历史模板帧中的视觉冗余,再通过层次化交互编码器实现模板与搜索特征的深度交互。

实验合理度:★★★★☆

AUC, P_norm, P, AO, SR_0.5, SR_0.75

学术研究价值:★★★★☆

提出一种"先压缩后交互"的跟踪框架ETCTrack,通过自适应Token压缩器(ATC)消除历史模板帧中的视觉冗余,再通过层次化交互编码器实现模板与搜索特征的深度交互;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

ETCTrack-B224将模板token数量减少60%,MACs降低21.4%,仅精度下降0.4%;B224版本MACs约34G

复现难度:★★★☆☆

https://github.com/PJD-WJ/ETCTrack

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)token压缩率固定(keep ratio r),缺乏完全动态的自适应压缩机制;(2)ATC模块引入额外计算开销;

主要参考文献

[1] Ye B, Chang H, Ma B, et al. Joint feature learning and relation modeling for tracking: Exploring the interaction between template and search regions[J]. ECCV 2022. (OSTrack)
[2] Wu J, Liu J, et al. ODTrack: One-stream tracking with historical frames[J]. AAAI 2024.
[3] Xie F, et al. Fast-iTPN: Hierarchical vision transformer for visual tracking[J]. 2024.
[4] Chen X, et al. VideoTrack: Learning to track objects via video transformer[J]. CVPR 2023.
[5] Yuan S, et al. ARTrackV2: Autoregressive visual tracking revisited[J]. CVPR 2024.
[6] Cui Y, et al. DreamTrack: Towards multi-object visual tracking with diffusion transformers[J]. CVPR 2025.
[7] Wu W, Liang Q, Zhong B, et al. An efficient token compression framework for visual object tracking[J]. CVPR 2026.

融会贯通

结合PaperDaily已收录的论文来看,多帧视觉跟踪正在从「堆帧数」的蛮力模式走向「精压缩」的效率模式。从ODTrack、ARATrackV2到ETCTrack,进化路线非常清晰:都是先尝试引入更多历史信息,然后发现冗余问题,最后用更精细的机制去解决。ETCTrack的贡献在于把「压缩」从手工规则升级为可学习的端到端模块,让模板Token的选取直接服务于跟踪目标。
不过要提醒的是,不同论文之间的数字对比存在训练集组合、模板帧数、分辨率等设置差异。比如本文的B224与B384就是两套评测尺度,和同分辨率的基线比才公平。读者在横向参考PaperDaily收录的同类结果时,建议先确认设置是否一致,避免被单一数字误导。目前同基准的横向对比数据还不够完整,后续可以持续关注。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看完ETCTrack,是不是也想给自家跟踪模型“减减负”?欢迎加入龙哥读论文粉丝群,和龙哥、龙迷们一起聊聊Token压缩、多帧跟踪和视觉Transformer的新玩法。扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 视觉跟踪+上海+广西师大+小龙),根据格式备注,可更快被通过且邀请进群~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。