← 返回 PaperDaily 大模型与智能体

CVPR 2026新范式:连续蒸馏SE2D,外部数据也会“教坏”学生?

这篇论文把“蒸馏”从一次性教学,改成了连续换老师的长期训练。更有意思的是,外部数据既能帮学生学到新东西,也可能顺手把旧知识冲掉,SE2D就是专门来收拾这个烂摊子的。

CVPR 2026新范式:连续蒸馏SE2D,外部数据也会“教坏”学生?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文把“蒸馏”从一次性教学,改成了连续换老师的长期训练。更有意思的是,外部数据既能帮学生学到新东西,也可能顺手把旧知识冲掉,SE2D就是专门来收拾这个烂摊子的。


原论文信息如下:
论文标题:
Continual Distillation of Teachers from Different Domains
发表日期:
2026年05月
发表单位:
The University of Tokyo, National Institute of Informatics, Indiana University Bloomington, Japanese-French Laboratory for Informatics, CNRS
原文链接:
https://arxiv.org/pdf/2605.04059.pdf
开源代码链接:
https://github.com/Nicolas1203/continual_distillation
项目链接:
https://github.com/Nicolas1203/continual_distillation

持续蒸馏:学生模型如何从不断更新的“导师”序列中学习?

这篇论文最有意思的地方,不是“蒸馏”本身,而是把蒸馏这件事从“只跟一个老师学”改成了“老师还会换班”。以前的知识蒸馏,默认学生模型面对的是一个固定老师;而这篇工作提出的 持续蒸馏(Continual Distillation, CD),则是让学生模型按顺序从一串教师模型里学习,而且后面的老师来了,前面的老师就“不可见”了。
这听起来像学校里不断换代课老师,但教材还不能翻旧账。更现实一点说,论文瞄准的是一种很像大模型时代的场景:模型越来越大,存储和访问成本越来越高,旧版本老师模型可能因为接口更新、权限限制、存储压力而逐渐不可用。于是,问题就变成了:如何让一个学生模型,持续吸收不同领域老师的知识,又尽量不把前面学到的东西忘掉?
图4:Self External Data Distillation(SE2D)整体流程图
图4:Self External Data Distillation(SE2D)整体流程图。学生模型一边跟当前教师蒸馏,一边拿自己上一个阶段的检查点,在外部数据上做“自我蒸馏”,目的是稳住那些容易被后续老师冲掉的旧知识。
从工程视角看,这个设定其实很接地气。现实里很多团队并不是“从零训练一个万能模型”,而是不断接入新的模型、不同版本的服务、不同域的数据能力。问题不是“有没有老师”,而是“老师太多,且不能同时抱住”。所以这篇工作并不是在玩概念,而是在补一个很真实的空缺:数据会流动,老师也会流动,但学生还得活下去。

持续蒸馏面临的两大挑战:数据不可见与知识遗忘

论文先把问题拆得很清楚:持续蒸馏不是单纯“换老师继续学”,而是同时卡在两个坑里。第一个坑是老师训练数据不可见。第二个坑是前面老师教过的东西,后面容易被冲掉
先说数据不可见。知识蒸馏最理想的状态,是老师和学生都在同一批数据上对齐;但这里不行。老师训练时见过的数据,学生蒸馏时可能拿不到,甚至根本不知道存在。于是论文把蒸馏数据拆成两类:内部数据(Internal Data, ID),也就是所有老师都认识的共享部分;以及外部数据(External Data, ED),也就是老师没见过、但学生拿来做蒸馏的额外数据。
图2:内部数据与外部数据,以及不同教师训练域的示意图
图2:内部数据与外部数据,以及不同教师训练域的示意图。论文假设老师之间共享一部分域,同时各自还带着一些独有域;外部数据则是老师训练时没见过的那部分数据。
第二个坑更微妙。很多人会以为,既然外部数据是“老师没见过的”,那它对蒸馏应该没啥用。论文偏偏发现:外部数据不仅有用,而且很有用。它能触发一种叫 Unseen Knowledge Transfer, UKT 的现象,中文可以理解为“未见知识迁移”:学生虽然没在训练数据里见过某个域,但只要老师知道,学生还是有机会从老师的输出里把这部分知识捞出来。
图3:未见知识迁移(UKT)与未见知识遗忘(UKF)示意图
图3:未见知识迁移(UKT)与未见知识遗忘(UKF)示意图。先用外部数据蒸馏时,学生能从老师那里学到训练数据之外的知识;但当后续老师接管后,前面通过外部数据学到的知识又可能被新的蒸馏过程冲淡。
问题在于,UKT 不是白送的福利,它会伴随一个反面角色:Unseen Knowledge Forgetting, UKF,即“未见知识遗忘”。前一个老师通过外部数据塞给学生的那些“老师私藏知识”,在后一个老师到来时,很容易被覆盖掉。这个遗忘和经典持续学习里的灾难性遗忘还有点不一样:这里忘掉的不是学生自己见过的数据,而是老师通过蒸馏“间接传递”过来的知识。说白了,连“转述来的知识”都保不住,蒸馏这门课就有点悬了。🤨

关键发现:外部数据是双刃剑,既能迁移又能引发遗忘

这部分是论文最核心的“反差点”。很多方法在蒸馏时只盯着“怎么把老师知识尽量搬给学生”,但这篇论文发现,外部数据越像“老师没见过的空白区”,越可能帮学生挖出老师的隐藏知识;可一旦蒸馏过程继续推进,旧知识也更容易被后来的老师压下去。
论文里把这个现象讲得很朴素:当学生只在内部数据上蒸馏时,它基本只能学到老师在共享域上的知识;而一旦把外部数据加进来,学生会突然对老师“没教过的域”也有了响应。这不是魔法,而是因为外部数据把老师的输出不确定性暴露出来了,老师在这些样本上的软输出,恰好给了学生更多可迁移的信息。
表1:不同域重叠设置下,CIFAR20 上学生模型的逐步准确率
表1:不同域重叠设置下,CIFAR20 上学生模型的逐步准确率。这里最直观的信号是:外部数据比例越高,学生在训练中没见过的域上表现越容易被激活,UKT 越明显。
但外部数据不是越多越好,也不是随便找点“看起来像没见过的图”就行。论文明确指出,外部数据的来源质量非常关键。如果外部数据和教师知识域太不搭,或者教师本身在这些样本上输出质量太差,迁移效果就会明显打折,甚至出现“帮倒忙”的情况。换句话说,外部数据这把刀,既能切菜,也能切手,关键看怎么拿。🧐
这也是为什么论文没有把结论写成“外部数据万能”,而是更谨慎地把它定义成一种可控的增强信号。论文后面的实验也反复证明:当外部数据与教师域更相关时,SE2D 更容易发挥;当外部数据过于离谱时,效果就会变得摇摆,甚至不如简单的自蒸馏稳。

提出SE2D:一种平衡知识迁移与遗忘的简单方法

SE2D 的全称是 Self External Data Distillation,中文可以叫自外部数据蒸馏。名字看着有点拗口,但做法其实很直接:学生除了跟当前老师蒸馏,还会拿自己上一个阶段保存下来的检查点,在外部数据上再蒸馏一次。这个“自己教自己”的动作,作用不是重复劳动,而是稳住那些后续老师容易冲掉的旧知识。
图1:持续蒸馏问题总览
图1:持续蒸馏问题总览。学生模型依次从多个教师模型学习,但每次蒸馏时都只能访问当前教师,旧教师不可见,目标是让学生保住所有教师已知域上的能力。
SE2D 的关键点有两个。第一,它不是简单地把自蒸馏和普通蒸馏并排相加,而是把自蒸馏限定在外部数据上。第二,它只保留学生自己的上一阶段输出,而不是重新去找历史老师。这样做的好处很明显:历史老师都不在了,学生只能靠自己“补课”,而外部数据正好成了稳定器。
从损失函数上看,论文采用的是基于 logits 的蒸馏损失,也就是让学生输出分布去贴近老师输出分布。这里的 logits 可以理解为 softmax 之前的原始分数;而 KL 散度(Kullback–Leibler divergence,中文常译为 KL 散度) 则是衡量两个分布有多不像的指标。温度系数 T 用来把输出分布“软化”,让学生更容易学到老师的相对偏好,而不是只盯着单个最大值。
如果把它写成流程,逻辑大概就是这样:
    输入:教师序列 T1, T2, …, TN;固定蒸馏数据 D = Di ∪ De
    初始化学生模型 S
    
    对于每个阶段 t = 1 到 N:
        1) 用当前教师 Tt 在 D 上对学生 S 做蒸馏
        2) 若 t > 1,则取上一个学生检查点 S(t-1)
        3) 仅在外部数据 De 上,对 S 与 S(t-1) 做自蒸馏约束
        4) 更新学生参数,进入下一阶段
    
    输出:最终学生模型 S
    这套设计看起来朴素,但它抓住了持续蒸馏最关键的矛盾:既要从新老师那里继续吸收知识,又不能把旧老师通过外部数据传下来的信息清空。SE2D 的思路不是“阻止学习”,而是“给遗忘上刹车”。

    实验结果:SE2D有效缓解遗忘,但对外部数据质量敏感

    实验部分的结论并不花哨,但很扎实:外部数据确实能带来未见知识迁移,而 SE2D 则能在多数设置下进一步缓解未见知识遗忘。尤其是在 CIFAR20 这类相关域更清晰的场景里,SE2D 的优势比较明显。
    表2:CIFAR20 上不同外部数据设置下的最终性能对比
    表2:CIFAR20 上不同外部数据设置下的最终性能对比。相关外部数据时,SE2D 在旧域上的保持能力更强;但当外部数据换成更不相关的 MNIST 时,整体收益会明显缩水,说明方法对外部数据来源比较敏感。
    如果只看 CIFAR20 的结果,SE2D 在相关外部数据下能把平均表现往上推一截,尤其对早期域的保留更明显;但在更难的 DomainNet 上,优势就没那么稳定,甚至有些设置下还会被自蒸馏反超。这个现象其实并不意外,因为 DomainNet 的域差异更大、样本更杂、教师质量也更不均匀,外部数据上的监督信号本来就更容易变形。
    表3:Digits 任务下内部数据与相关外部数据的性能对比
    表3:Digits 任务下内部数据与相关外部数据的性能对比。这里能看到,相关外部数据能明显改善学生在多个域上的保持能力,而 SE2D 通常能进一步把旧域拉回来一点,但提升幅度受数据匹配程度影响很大。
    表4:DomainNet 上的最终性能对比
    表4:DomainNet 上的最终性能对比。这个表最能说明问题:当域差异本身太大时,外部数据不一定总能带来稳定收益,SE2D 的效果会明显依赖教师质量和外部数据是否真的“相关”。
    论文还给了遗忘度量和逐步准确率曲线,整体趋势和表格是一致的:普通蒸馏方法在后续阶段都会出现不同程度的 UKF,自蒸馏能缓和一点,但常常会牺牲新知识吸收;SE2D 则更像是在两者之间找平衡点。这个平衡点不是完美的,但已经比“只顾往前冲,旧知识一路掉”强太多。
    图5:CIFAR20 上各域平均准确率变化
    图5:CIFAR20 上各域平均准确率变化。整体趋势显示,SE2D 比多数基线更能稳住历史域的表现,但它并不是无条件碾压,外部数据的相关性仍然是决定成败的关键。
    从实验设计上看,这篇论文有个加分项:它没有只挑一个数据集就宣布胜利,而是覆盖了相关与不相关外部数据、不同域差异强度、不同老师质量等多种情形。这样做的好处是,结论不会显得像“挑了一个特别容易赢的局”。当然,代价也很明显:方法的上限更依赖数据选择,实际落地时不能把外部数据当成随手捡来的便宜货。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:

    这篇论文到底解决什么问题?它解决的是“老师模型会不断换、旧老师还可能拿不到”的蒸馏问题。核心目标是让学生模型在顺序学习多个教师时,尽量保住前面老师传下来的知识,同时继续吸收后面老师的新知识。

    UKT 和 UKF 分别是什么意思?UKT 是 Unseen Knowledge Transfer,中文可理解为“未见知识迁移”,指学生通过外部数据学到训练数据之外的知识;UKF 是 Unseen Knowledge Forgetting,中文可理解为“未见知识遗忘”,指后续蒸馏把前面通过外部数据学到的知识冲掉了。

    SE2D 为什么只在外部数据上做自蒸馏?因为内部数据本来就属于老师共享知识的“安全区”,真正容易丢的是外部数据带来的那部分未见知识。把自蒸馏放在外部数据上,相当于专门给最脆弱的记忆加保险,而不是把力气浪费在已经比较稳的部分。

    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★☆☆

    把“持续学习”搬到“持续蒸馏”上,这个角度挺新,但方法本身没有故弄玄虚,核心还是围绕外部数据和自蒸馏做稳定化。

    实验合理度:★★★★☆

    实验覆盖了相关/不相关外部数据、不同数据集和不同教师质量,结论基本站得住;不过某些场景里收益波动明显,说明问题并不简单。

    学术研究价值:★★★★☆

    它提出了一个比传统蒸馏更贴近现实的新设定,尤其适合讨论“老师模型流动”的问题,对后续研究有启发。

    稳定性:★★★☆☆

    能缓解遗忘,但对外部数据来源和教师质量比较敏感,不是拿来就能稳跑的“工业级保险箱”。

    适应性以及泛化能力:★★★☆☆

    在相关域上更好用,在域差异很大时会打折扣,说明泛化能力还受数据分布限制。

    硬件需求及成本:★★★★☆

    方法本身主要是 logits 蒸馏和额外一次自蒸馏,计算开销不算离谱,训练成本比大模型重训友好得多。

    复现难度:★★★★☆

    代码已开源,流程也比较清晰,复现门槛不高;难点主要在数据域划分和教师训练设置要对齐论文。

    产品化成熟度:★★★☆☆

    适合多版本模型迭代、旧教师不可持续访问的场景,但要先解决外部数据筛选和教师质量评估,否则效果会飘。

    可能的问题:方法依赖外部数据与教师域的相关性,且对教师质量敏感;如果外部数据选得不对,SE2D 可能帮不上忙,甚至拖后腿。


    主要参考文献

    [1] Nicolas Michel, Maorong Wang, Jiangpeng He, Toshihiko Yamasaki. Continual Distillation of Teachers from Different Domains. arXiv:2605.04059, 2026.
    [2] 官方开源代码:https://github.com/Nicolas1203/continual_distillation
    [3] 项目演示图:https://github.com/Nicolas1203/continual_distillation/raw/main/docs/assets/overview.png

    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

    end
    欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
    『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
    持续蒸馏、跨域迁移、知识不忘本,这类论文最适合来群里一起拆,少走弯路,少踩坑。👇
    wechat_helperdianzan
    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。