← 返回 PaperDaily 视觉与图像

扔掉源数据!TADD用CLIP作锚点,视频域漂移性能提升9.6%

视频测试时适应(TTA)一直是块硬骨头,尤其当遇到真实场景的严重分布漂移(比如白天到黑夜、体育到日常),现有方法要么忘得快,要么扛不住。圣保罗大学这篇ACM MM 2026论文提出TADD,巧妙地在冻结CLIP上只加个轻量适配器,靠「零样本蒸馏+目标蒸馏」双重约束,既守住CLIP的通用语义,又保留源域判别知识。效果实在:三个标准benchmark上全面超越之

原论文信息如下:
论文标题:
Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts
发表日期:
2026年7月(ACM MM 2026)
发表单位:
圣保罗大学 (University of São Paulo) 合作 联邦圣卡洛斯大学 (Federal University of São Carlos)
原文链接:
https://arxiv.org/pdf/2607.24611v1.pdf

引言

深度学习模型在封闭世界表现惊艳,一旦部署到真实场景,光照变化、天气干扰、传感器退化、压缩伪影……各种意想不到的分布漂移立马把准确率打回原形。尤其视频流,连续帧之间的强相关性让传统自适应策略雪上加霜——熵最小化方法在这种场景下几乎失效,模型要么退化,要么灾难性遗忘。这就是视频测试时适应(Video TTA)的终极难题。
虽然图像TTA已经有很多工作,但视频TTA目前还处于非常早期的阶段。现有方法要么只能应对合成噪声(加个高斯模糊就完事),要么在大幅度自然域漂移下直接崩掉。更棘手的是,源域数据由于隐私或存储限制往往无法回传,模型必须在推理时在线、逐批地适应,且不能看到大量目标样本。这种情况下,如何既保留源域学到的判别边界,又不被新域的剧烈变化带偏?
圣保罗大学的这篇工作给出了一个非常优雅的答案:Test-time Adaptation via Dual Distillation (TADD)。他们巧妙地将基础模型CLIP当作稳定的知识锚点,只更新一个极轻量的投影适配器,用两个互补的蒸馏损失来平衡「通用语义保持」和「源域知识传承」。结果让人眼前一亮:不仅在标准闭集TTA上全面超越现有方法(最高提升+3.81%),甚至在更苛刻的部分集和连续多目标场景下也表现出色,性能直追需要离线全量数据进行优化的SFDA方法。
这篇论文来自ACM MM 2026,作者是André Sacilotti、Samuel Felipe dos Santos和Jurandy Almeida。第一作者是圣保罗大学的博士生,研究方向为视频理解与领域适应。整体实验设计严谨,从标准闭集到部分集/多目标,再到数据顺序鲁棒性和迭代次数敏感性,非常全面。

方法概述

整个TADD框架非常清爽,核心只有三点:冻结CLIP主干、只更新一个轻量适配器、用双重蒸馏损失进行在线优化。
先看整体流程:
图1展示了TADD的两阶段架构。
(图1:TADD整体框架图。左:源域预训练阶段,在标注视频上训练源适配器Gs,冻结CLIP视觉编码器。右:在线测试时适应阶段,用双蒸馏损失更新目标适配器Gt,推理时使用Gt和冻结的文本嵌入。)
左边是离线源域预训练:利用标注的视频数据,训练一个源适配器Gs(两层MLP+ReLU),放在冻结的CLIP视觉编码器之后。这个Gs学会将CLIP的视觉特征映射到动作类别的判别空间中。训练完成后Gs被冻结。
右边是在线TTA阶段:Gt初始化为Gs的副本,然后在推理过程中只更新Gt。每个到达的未标注目标批次,先通过冻结的CLIP视觉编码器提取帧特征并做时序平均池化得到视频级表征z,然后分别通过三个通路得到logits:
1)零样本通路(恒等映射h):直接用z与文本嵌入计算相似度,得到CLIP零样本预测;
2)源适配器通路:通过冻结的Gs,得到源域判别预测;
3)目标适配器通路:通过可更新的Gt,得到当前适配器的预测。
然后,Gt的更新由两个KL散度损失驱动:
零样本蒸馏损失Lzs:让Gt的预测分布逼近冻结CLIP的零样本预测分布。这样做的好处是,即使目标域与源域差异巨大,CLIP的通用视觉-语言对齐仍然能提供稳定的语义锚点,防止适配器漂移到无意义的方向。
目标蒸馏损失Lpl:让Gt的预测分布逼近冻结源适配器Gs的预测分布。这确保了源域上学到的类别判别结构和任务边界不会被完全抹去,起到「保真」作用。
总损失为 L = Lzs + λLpl,其中λ设为0.1平衡两者。优化采用SGD,学习率固定1e-4,每个批次执行t次梯度更新(默认20次)。注意,推理时用更新后的Gt预测当前批次,且Gt在整个流中持续积累,不重置。
最巧妙之处在于这两个损失刚柔并济:Lzs提供「立足点」——无论域怎么变,CLIP的零样本知识永远是可靠的底线;Lpl提供「定向力」——让适配过程沿着源域学到的判别边界前进。两者缺一不可。消融实验(表6)清楚表明,单独使用Lzs反而会降低性能(比如H→A方向从30.2%掉到25.4%),说明没有源域判别知识,只靠零样本锚点是不够的。
图1:TADD整体框架图。左:源域预训练阶段;右:在线测试时适应阶段

视频TTA的挑战:严重分布漂移 vs 无源数据

先聊个直观的场景。你训练了一个动作识别模型,能精准识别UCF101数据集里的“跑步”“跳跃”“投篮”。一切都很美好。然后把它部署到安防摄像头上,好家伙,光照不对、画质压缩、视角完全不同,准确率直接腰斩。更棘手的是,训练数据因为隐私原因根本没法回传,模型必须“摸着石头过河”——在推理的同时,在线学习适应新环境。
这就是视频测试时适应(Video TTA, 即Video Test-Time Adaptation)面对的核心难题。与图像TTA不同,视频流中的帧具有高度时间相关性,且分布漂移通常是连续的、非平稳的。更可怕的是真实场景下的“严重分布漂移”——比如从白天到黑夜(光照剧变),或者从运动场到室内(环境剧变)。这种漂移远不是加个高斯噪声能模拟的。
传统TTA方法有两大致命伤:一是严重依赖源域数据或合成噪声模拟;二是在连续域漂移下极易发生灾难性遗忘。现有的视频TTA工作寥寥无几,且大多只处理温和的合成扰动。一旦遇到像“HMDB51→UCF101”这种真实跨域场景,最基础的熵最小化方法TENT,准确率甚至比不做任何适应的Lower Bound还低(表1中的数据请大家自行对比)。
这就引出了一个核心矛盾:模型既要对目标域的新分布足够敏感,又不能忘了从源域学到的判别边界。现有的方法要么过于保守(死守源域知识),要么过于激进(快速适应但忘掉了类别结构)。TADD这篇论文,就是奔着解决这个矛盾来的。

核心机制:双重蒸馏锚定语义与判别知识

TADD的架构非常优雅,可以用“以静制动”四个字概括。它构建在冻结的CLIP ViT-B/32骨干之上,核心是一个可学习的轻量投影适配器(Adapter)。这个适配器只有两层MLP加上ReLU激活函数,参数量约131K,非常轻量。
系统有两个适配器实例:源适配器(Gs,在标注的源域视频上预训练,之后冻结)和目标适配器(Gt,初始化为Gs的副本,在TTA阶段唯一可更新)。
来看具体流程。对于一段输入视频V,首先均匀采样16帧,用冻结的CLIP视觉编码器逐帧提取特征,然后对这些帧特征做平均池化,得到一个视频级表征z。这个表征z会同时通过三条通路(图1):

零样本通路直接使用恒等映射h,将z与冻结的文本嵌入进行相似度计算,得到CLIP原始的零样本预测。这是最稳定的语义锚点。

源适配器通路通过冻结的Gs,得到保留了源域判别知识(比如动作类别的视觉边际)的logits。

目标适配器通路通过可更新的Gt,产生用于实际推理的分类logits。

那么,Gt如何更新呢?核心是双重蒸馏损失
第一个是零样本蒸馏损失(Lzs)。Gt的预测分布要尽量逼近冻结CLIP的零样本预测分布。用公式说就是:

Lzs = DKL(Gt(z) · W^⊤ ∥ z · W^⊤)

其中DKL表示KL散度,W是拼接了类别名称和多模板提示的文本嵌入矩阵。这个损失的作用是什么?让Gt不要跑偏,始终与CLIP的通用语义对齐。无论目标域怎么变,“跑步”这个类别在CLIP的语义空间中总归有一个固定的区域,零样本蒸馏就是拉着Gt指向这个区域。
第二个是目标蒸馏损失(Lpl)。Gt的预测分布要同时逼近冻结的源适配器Gs的预测分布:

Lpl = DKL(Gt(z) · W^⊤ ∥ Gs(z) · W^⊤)

这个损失的作用是保留源域学到的细粒度判别知识。直接说人话:Gs知道“投篮”和“跳跃”在手势上的细微差别,Gt不能因为适应新环境就把这些知识忘掉。
总损失为L = Lzs + λLpl,其中λ是平衡系数,实验中设置为0.1。优化器使用SGD,学习率固定为1e-4,每个批次执行t步梯度更新(默认20步)。
这两个损失就像一刚一柔两根缰绳:Lzs拉住模型不脱离语义常识,Lpl拉住模型不丢失判别边界。二者缺一不可。消融实验(表6)就是铁证——单独用Lzs在某些方向上(比如H→A)反而会让性能暴跌,因为CLIP的零样本预测虽然有语义但缺乏视觉判别性,模型会被带到一个“似而非”的语义空间。
另一个设计巧妙之处是:Gt在整个目标域数据流上持续更新,不重置。这意味着它能累积多批次的域信号,逐步逼近目标域的真实分布。而每次更新后就用更新后的Gt对当前批次做推理,实现了严格意义上的在线适应性。

实验全景:三个基准、四种设置全面超越

实验部分非常扎实,覆盖了三个标准基准、四种测试设置。简单来说,就是在闭集TTA、部分集TTA、多目标TTA这三种越来越复杂的情况下,TADD都交出了远超现有方法的答卷。
先看闭集场景。表1是HMDB51↔UCF101的结果。TADD以平均87.4%的准确率大幅领先所有TTA方法。最夸张的是H→U方向:TADD达到91.6%,比次好的BATCLIP高出9.6%,比零样本CLIP也高出4.1%。这充分说明了双重蒸馏在严酷域漂移下的威力。
表1:闭集HMDB51↔UCF101的域适应结果。
再看Daily-DA(表2)。这是最难的基准,因为包含了ARID(A)这个极度黑暗的域。TADD以平均46.3%夺冠,超越BATCLIP 2.6个百分点,超越ST2ST 7.5个百分点。值得注意的是,在8个方向上TADD都是第一。
表2:闭集Daily-DA的域适应结果。
Sports-DA的结果(表3)更加凸显TADD的优势。由于Sports-DA的类别大多在CLIP的预训练数据中,零样本效果已经非常高(87.1%)。传统的TTA方法(TENT, ST2ST, ViTTA)不仅没提升,反而大幅下降。但TADD凭借零样本蒸馏的锚定作用,依然实现了88.4%的均值,超越了所有方法。
表3:闭集Sports-DA的域适应结果。
除了闭集,TADD在部分集(表4)和多目标(表5)设置下的表现同样出色。部分集中,源域有14类,目标域只有7类。TADD以93.7%的平均准确率远超所有方法,甚至碾压了零样本CLIP。这说明双重蒸馏机制能在类别数不对等的情况下,精准地利用CLIP的零样本信号对目标域类别进行“纯净”的分类,同时保留源域信息的判别力。
表4:部分集UCF↔HMDBpartial的域适应结果。
表5:Daily-DA多目标适应结果。
多目标适应(表5)更是对TTA方法的终极压力测试。模型连续面对K、M、H等多个目标域,且数据顺序有随机、按类等多种排列。TADD在全部9种设定下都取得了最佳或持平的最佳结果,且方差控制得很好。这说明双重蒸馏让模型具有了极强的鲁棒性,不会被后续域的数据冲刷掉之前学到的知识。

效率与鲁棒性:轻量适配器兼顾速度与稳定性

性能强是一方面,但TTA方法必须考虑实际部署的效率。TADD在这方面做得相当出色。
从计算效率看,表8展示了每批次的适应时间。TADD仅需0.143秒,比BATCLIP(0.179秒)还快25%。原因在于TADD只更新一个轻量的适配器,梯度传播链极短;而BATCLIP需要反向传播到整个CLIP骨干来更新LayerNorm参数,计算量自然大得多。
表8:计算效率对比。
更关键的是鲁棒性。TTA方法必须能处理任何batch size。表7展示了在HMDB→UCF上不同batch size下的表现。TADD在batch size=1的极端条件下仍保持88.6%,远高于BATCLIP的66.4%和ST2ST的17.2%。随着batch size增大,TADD的性能还持续提升(最高91.7%)。这种对batch size的稳定性在实际部署中非常重要——因为测试时的数据到达模式是不可控的。
表7:batch size对HMDB→UCF性能的影响。
消融实验(表6)也印证了双重蒸馏的互补性。单独使用Lzs时,性能在某些方向出现倒退;单独使用Lpl虽然能保留源域知识,但缺乏CLIP语义锚定时,面对强域漂移仍力不从心。两者结合则实现了“1+1>2”的效果。
表6:Daily-DA上损失组件的消融实验。
不过,实验中也有一些需要留意的细节。例如,λ=0.1的设定可能依赖于具体数据集;Gt的更新步数t(实验中默认20步)也可能会影响最终效果。这些超参数在实际应用中可能需要根据目标域的特点进行微调。

总结与展望:从视频TTA迈向通用TTA

TADD提出了一套优雅且高效的方法论。它的核心贡献在于:利用基础模型(CLIP)的稳定语义作为锚点,配合一个轻量适配器的在线更新,既保留源域知识,又适应目标域变化。这个范式很可能会影响未来视频TTA乃至通用TTA的研究方向。
展望未来,有几个方向值得深挖:
一是将双重蒸馏推广到更多基础模型(如EVA-CLIP、SigLIP等),验证其通用性;
二是探索自适应的λ调节策略,让模型自动决定在何时更依赖零样本知识,何时更依赖源域知识;
三是研究适配器结构与在线更新的关系,当前的两层MLP虽然高效,但可能在高维视频特征下存在表达瓶颈;
四是将TADD扩展到更大的视频模型(如VideoMAE、InternVideo),而这些模型本身可能已经具有较强的域泛化能力,如何与TADD的轻量更新范式结合是值得期待的方向。
最后提一点,论文的代码目前还未开源,如果作者团队能将TADD与BATCLIP等方法的公平对比代码一并放出,那么该工作的可复现性和社区影响力将会大大提升。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

TADD中的“双重蒸馏”具体指哪两个蒸馏?它们分别对应什么损失函数和输入?双重蒸馏包括:(1)零样本蒸馏(Lzs),让目标适配器Gt的预测分布趋近冻结CLIP的零样本预测分布,对应公式为Lzs = DKL(Gt(z) · W^⊤ ∥ z · W^⊤);(2)目标蒸馏(Lpl),让Gt的预测分布趋近冻结源适配器Gs的预测分布,对应公式为Lpl = DKL(Gt(z) · W^⊤ ∥ Gs(z) · W^⊤)。其中z是视频级特征,W是文本嵌入矩阵。

TADD的方法设计跟DALL-V有什么区别?两者都用了CLIP+双适配器的结构且受DALL-V启发,但关键区别在于:(1) DALL-V是离线SFDA方法,需要全量目标数据迭代训练和知识蒸馏到学生网络,而TADD是在线TTA方法,只更新Gt,严格逐批推理。(2) DALL-V使用伪标签进行知识对齐,而TADD使用双蒸馏损失(零样本+目标)进行在线优化,不需要伪标签。

TFADD在一个批次内,Gt会更新几次(即t值是多少),这个t值对性能影响大吗?实验中默认t=20,即每个批次执行20步SGD更新。论文补充实验表明,当t从1增加到20时,性能单调提升;再将t增加到40,性能基本持平。这说明20步是一个合理的平衡点,既能充分适应,又不至于过拟合单批次数据。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

TADD的“双重蒸馏”思路本身并非石破天惊,但它的工程化创新——将零样本蒸馏与源域判别蒸馏组合,并仅在轻量适配器上做在线更新——使得这个方法在严重分布漂移下表现出了远超现有方法的稳定性和性能。这种“简单有效”的范式创新值得认可。

实验合理度:★★★★★

实验设计非常全面:不仅覆盖了三个标准基准、四种适应设置(闭集、部分集、多目标、多顺序),还有详细的消融、效率、batch size和超参数分析。对比方法的选择也很合理,覆盖了图像级和视频级TTA方法,以及更强的离线SFDA方法。

学术研究价值:★★★★☆

TADD为视频TTA领域提供了一个极佳的基础标杆。双重蒸馏的思路很可能被后续工作复用在其他基础模型上,或者拓展到更复杂的场景(如开放集、持续学习等)。研究启发价值很高。

稳定性:★★★★☆

从batch size=1的极端条件测试和其他顺序实验来看,TADD的鲁棒性很强。扣的一颗星在于:对λ超参数和更新步数t的稳健性未做充分验证,需要进一步确认。

适应性以及泛化能力:★★★★☆

在三个具有完全不同分布特征的基准上表现优秀,且能处理部分集和多目标这种复杂场景,适应性很强。但目前仅验证了动作识别这一任务,泛化到其他视频理解任务(如视频分割、跟踪)仍有待探索。

硬件需求及成本:★★★★★

TADD在训练侧的硬件需求与CLIP+MLP适配器相当。在使用中,由于只需要更新131K参数的小适配器,推理效率极高(0.143s/批次),远比需要回传整个CLIP的BATCLIP更实用。5星实至名归。

复现难度:★★★☆☆

论文对实现细节的描述足够清晰(CLIP版本、学习率、优化器、采样帧数等),但代码未开源。由于TADD依赖预训练的源适配器,这部分需要读者自己实现,可能带来一定的复现成本。如果作者能放出预训练适配器的权重文件,复现难度会大大降低。

产品化成熟度:★★★★☆

TADD的设计非常贴近实际部署需求:只有131K额外参数,推理效率高,batch size鲁棒,不依赖源域数据。特别适合视频监控、自动驾驶、安防等场景中的在线模型自适应。扣掉的一星在于:对基于CLIP的范式存在依赖,如果换成更开放的场景(如开放词汇动作识别)可能还需要额外调整。

可能的问题:1) 论文中部分对比实验(例如与BATCLIP的对比)存在数据集偏差(CLIP预训练数据中本就有UCF101等),可能需要更多验证性分析。2) 没有探讨在视频帧数量或采样策略变化下的鲁棒性。3) 代码未开源,复现的难度较高。


主要参考文献

[1] Andre Sacilotti, Samuel Felipe dos Santos, Jurandy Almeida. Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts. ACM MM 2026.
[2] Shuhao Li, et al. ST2ST: Video Test-Time Adaptation through Self-Distillation. CVPR 2025.
[3] Dequan Wang, et al. Tent: Fully Test-Time Adaptation by Entropy Minimization. ICLR 2021.
[4] Jian Liang, et al. Do We Really Need to Access the Source Data? Source Hypothesis Transfer for Unsupervised Domain Adaptation. ICML 2020. (SHOT)
[5] Waqar Nabi, et al. ViTTA: Test-Time Adaptation for Video Transformers via Temporal Consistency. ECCV 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
视频TTA搞不定?TADD双重蒸馏让你一步封神!想跟龙哥一起撸代码、聊论文、发顶会?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 视频TTA+上海+圣保罗+小龙人),按格式备注,秒过进群!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。