← 返回 PaperDaily
视觉与图像
一张黑图就能蒸馏?VCSD让Qwen3-VL全系飙升4.77%
自蒸馏方法通常需要特权答案或视觉证据标注来制造教师-学生不对称性,而本论文来自马里兰大学等机构,提出一个极其简洁的替代方案:只需要一张内容擦除的黑色图像,与原始图像下教师模型的预测做对比,就能构建出有效的自蒸馏目标。在Qwen3-VL和Qwen3.5全系模型上,VCSD稳定提升1.86%-4.77%,且无需外部教师、推理时零开销。方法既巧妙又实用,值得关注。
龙哥读论文
发布于 2026-08-14 09:11:26
阅读 3
查看原文
原论文信息如下:
蒸馏也要“不对称”:VCSD如何用一张黑图让模型自我提升?
想象一下,你请了一个学霸给自己当家教,这个学霸所有的解题思路和资料都和你一模一样。你觉得他能教出什么新花样吗?大概率是教了等于没教。
这就是自蒸馏(Self-Distillation) 领域长期面临的尴尬。特别是在线策略自蒸馏(On-Policy Self-Distillation, OPSD) ,它让模型自己扮演老师和学生两个角色。但问题是,如果老师和学生看到的信息一模一样,老师给出的指导信号(即软标签或目标分布)就很难比学生已有的知识更有价值,这种学习就容易陷入“原地踏步”。
为了解决这个问题,以往的方法脑洞大开:有的给老师看标准答案(特权答案),有的给老师看图片的局部高亮区域(视觉证据),让老师“开点小灶”,知道得比学生多一些,这样教起来才有价值。但这些方案要么需要额外的人工标注,要么需要复杂的视觉定位模型,成本高、通用性差。
来自马里兰大学、加州大学圣地亚哥分校、杜克大学和MBZUAI的研究人员,提出了一个极其清奇的想法:如果给老师看的,不是更好的信息,而是一张“内容被抹除”的黑图 呢?老师给出的两个预测(看原图和看黑图)之间的差异,本身就构成了一个极具价值的“不对称”信号。
他们把这种方法叫做视觉对比自蒸馏(Visual Contrastive Self-Distillation, VCSD) 。核心思想非常符合人类直觉:你要教模型“看懂”图像?不如先问问它:“没有这张图,你又会怎么猜?”两者的差异,恰恰就是图像内容所提供的独特信息。
这就像让一个只见过彩色照片的人,和另一个只见过素描画像的人,同时去猜一张彩色照片的内容。前者能轻松说出“红色苹果”,后者可能只能猜“圆形水果”。两个答案的差值,就完美地捕捉了“颜色”这个视觉信息。VCSD巧妙地利用了这个心理学原理,来完成模型的自我的提升。
传统知识蒸馏(Knowledge Distillation, KD)需要一个强大的、独立训练的大模型作为教师。而OPSD试图让模型自己教自己,成本更低,但核心挑战在于如何创造“教师”和“学生”之间的信息不对称。VCSD给出的答案异常简洁:教师的输入不是更好的信息,而是一个“对照实验”——通过对比正常输入和屏蔽关键信息(这里是视觉内容)后的输入,来提取该信息的特定贡献。
方法揭秘:条件对比 + 合理性约束,构建有效的自蒸馏目标
VCSD的方法论非常精妙,我们一步步来拆解。首先,整个框架围绕四个核心角色展开:可训练的学生模型(Student, π_θ) 、其指数移动平均(Exponential Moving Average, EMA)版本作为教师模型(Teacher, π_φ) 、原始的图片-问答对,以及一个至关重要的内容擦除的控制图像(Content-erased Control) ,在论文中默认是一张内容被抹去的全黑图像。
核心步骤一:在线策略采样(On-Policy Sampling)
学生模型根据原始图像和提示,自主生成一个完整的回答。这个回答的每一步生成都是基于学生自己的当前策略,“在线”二字的价值正在于此,因为它避免了训练和推理之间的分布不匹配。
核心步骤二:条件对比(Conditional Contrast)
这是VCSD最天才的一步。在学生生成回答的每一个位置t,教师模型都会计算两个概率分布:一个基于原始图像J ,另一个基于内容擦除的控制图像J_ctrl 。由于提示、前缀和模型参数完全一致,唯一的变量就是图像内容。
随后,计算词汇级别的对数概率差异 Δ_t(v)。这个差异Δ_t(v)正是衡量“视觉内容J”对预测token v的“独家贡献”。
单纯的Δ_t(v)并不健壮:一个在“看黑图”时几乎不可能出现的token,在“看原图”时出现的概率变化可能很大,但它仍然可能是一个非常不可能的选项。因此,论文引入了合理性约束(Plausibility Constraint) 。
只有那些在原始图像分布下概率足够高的token(在论文中,指概率不低于最大概率×0.1即β=0.1的token),才会进入合理性支持集(Support Set) S_t 。这个约束确保了后续的优化不会让模型去追逐一些虽然对比度很大但概率很低的“噪声”。
最终,对比塑造的教师目标 q_t*被定义为在S_t上的重新归一化分布。它巧妙地结合了两者:原始图像的分布p_φ,t^J作为基准,而Δ_t(v)作为一个指数权重(乘以对比强度系数α)来调整。公式巧妙地确保了原始图像分布提供了“基线”,而Δ_t(v)则像一个放大器,放大了那些真正依赖于视觉内容的token。
有了教师目标q_t*,就可以通过前向KL散度(Forward KL Divergence) 对学生进行监督。VCSD使用了模式覆盖(mode-covering)的前向KL,而不是模式寻找(mode-seeking)的反向KL,实验证明前者更适合蒸馏这种多峰值的视觉分布。整个过程中,梯度只流向学生,教师保持冻结。每优化一次学生后,教师参数通过EMA进行滑动更新。
实验亮眼:Qwen3-VL全系提升,最高+4.77%平均准确率
论文在通义千问的视觉语言模型系列Qwen3-VL 和Qwen3.5 上进行了严格的验证,模型规格从2B到9B。训练数据采用了ViRL39K 数据集,评估则覆盖了7个具有挑战性的视觉语言基准,包括通用感知(BLINK, MMStar)、视觉数学(MathVista)、细粒度感知(V* Bench, HRBench4K/8K)以及抗幻觉能力(HallusionBench)。
Qwen3-VL-2B规模 :VCSD在7个基准上的平均准确率从基础模型的62.27%猛涨至67.04%,提升了+4.77% 。相比之下,传统的OPSD方法仅为64.89%,VCSD比它高出2.15%。不仅平均分高,VCSD在感知、数学、幻觉等每一个子任务上都实现了提升,非常全面。
更大模型 Qwen3-VL-4B和8B :VCSD的表现依然亮眼,分别提升了+1.86%和+3.75%。值得注意的是,在4B规模上,传统的OPSD几乎没能提升性能(仅+0.1%),而VCSD带来了显著的增益,这说明其发现视觉信号不对称性的能力是OPSD无法比拟的。
Qwen3.5系列 :VCSD在9B模型上取得了平均准确率79.24%,比基础模型高出+4.27%,且全面超越了传统OPSD。而传统OPSD在这些模型上甚至常常出现负优化——性能比基础模型还差。
为了验证每一个设计机构的有效性,论文还进行了详尽的消融实验。
图3(a)的实验清晰的说明:没有了合理性约束(β=0,即对整个词表进行对比),模型在训练初期尚可与完整版媲美,但随着训练步数增加,性能开始出现雪崩式坍塌。而加上合理性约束(β=0.1)后,训练曲线非常稳定。这说明约束有效防止了对比信号中的噪声通过自监督迭代被不断放大,稳定性极高。
在图3(b)中,α在1.0到1.5之间性能达到峰值且稳定。α=0退化为原始的教师分布(基线仍比OPSD好因为加入了合理性约束),α太大(≥2)则可能让对比信号喧宾夺主,性能又开始回落。这个峰形揭示了适度对比 带来的增益,并且对参数选择相当鲁棒。
表3的结果令人印象深刻,将控制图像替换为高斯噪声、高斯模糊甚至直接不给图像(仅使用视觉编码器输出一个空矩阵),VCSD的性能都没有明显下降,平均准确率都在67%左右。这说明VCSD对控制图像的构造方式不敏感。
论文通过引入锚点系数λ(见公式15)对比了不同锚点强度的影响。表4显示,如果λ=0(彻底放弃原图分布作为锚点),性能跌落到平均62.5%。当λ提升到1(标准设定),性能达到最佳。这证明原始图像分布不仅为对比提供了候选人,其本身的概率权重至关重要。
图4展示了VCSD的训练动态,清晰地显示了VCSD的训练曲线一直位于最上方。图5则是问答案例。在MathVista测试集中,面对“这些立方体共有多少个千?”的问题,基础模型和传统的OPSD模型都数错了(标红),而VCSD却能像火眼金睛一般找到隐藏的数量(标绿),并算出正确答案。
理论支撑:KL正则化政策更新与条件互信息近似
VCSD不只是一个工程算法,它背后有坚实的理论支撑。论文将目标构建过程诠释为一个一步KL正则化的策略更新 。
具体来说,如果把基于原始图像的教师分布归一化后作为参考策略,把条件对比度的差值Δ_t(v)看作一个“视觉证据奖励”,那么VCSD构建的目标q_t*,恰好是该奖励在KL散度约束下 的最优解。这个解本质上是将原始图像教师的认知作为先验知识(Prior),然后根据视觉对比奖励进行了一个小幅、受控的“单步策略优化”。
此外,这个对比差值Δ_t(v)还可以从信息论 角度来理解。条件点互信息(Pointwise Mutual Information, PMI)衡量的是一个事件(token v)和另一个条件(图像J)之间的依赖关系。Δ_t(v)恰好是对PMI的一个有效近似。当图像J存在时,那些PMI很高的token(例如,看到苹果形状时生成“红色”),正是视觉内容贡献的主要信息。VCSD通过增大这些token的权重,使得模型更倾向于输出依赖于视觉证据,而非基于语言先验猜测的答案。
总结与启发:无需特权答案,视觉对比自蒸馏开辟新路径
VCSD提出了一种非常优雅和高效的自蒸馏范式。它通过一个简单的“控制变量法”,巧妙地将模型对特定输入信息(这里是视觉内容)的依赖度,转化成了可优化的对比信号 。VCSD的成功表明,在自蒸馏领域,构造不对称性的关键可能不在于给教师“开小灶”,而在于给教师一个智能的“参照系”。
对于AI行业而言,VCSD的价值在于其极致的简洁和可推广性。它省去了复杂的辅助模块,让模型在纯无监督环境下(只需原图和问答对)就能完成自我强化。特别是对抗幻觉能力的提升 ,极大增强了在自动驾驶、医学影像等高风险场景的部署潜力。不过,它也存在局限:目前只适用于多模态视觉语言场景,且对控制图像的有效性依赖于视觉编码器的泛化能力。
这个方法是“对比学习思想在知识蒸馏层面的一次华丽变体”。它证明了输入端的“控制变量对比”可以替代教师端的“知识碾压”。对后续研究很有启发性,也许在文本、音频或结构化数据 上,我们也可以通过某些条件扰动来构造不对称信号。
龙迷三问
问题1:VCSD和传统的值函数蒸馏或其他对比学习方法(如CLIP)有什么区别? VCSD和CLIP虽然都包含“对比”二字,但本质完全不同。CLIP是在嵌入空间进行的对比学习,它通过拉近匹配的图像-文本对、推远不匹配的对来学习表示。而VCSD是在输出空间(词汇级别的概率分布)进行的对比蒸馏。它不是通过正负样本对学习特征,而是比较同一个模型在不同输入条件下的输出分布来提取特定信息。它与值函数蒸馏也不同,不需要训练一个独立的奖励模型或批评者网络。
问题2:如果控制图像不仅是黑图,还可以是部分遮挡的图,效果会更好吗? 论文中通过消融实验(表3)已经回答了这个问题,各种内容擦除手段(高斯噪声 、模糊、无图像)效果旗鼓相当。这说明模型在缺乏具体视觉信息时,对“什么是无信息”的判断相对一致。但是,如果控制图像设计得更精妙(比如只擦除关键物体而保留背景),也许能更精准地控制要提取的视觉信息粒度。这也暗示了VCSD一个有趣的扩展方向:对比不同维度的视觉特征。
问题3:VCSD会不会导致模型语言能力退化?因为它过分强调了视觉相关的tokens。 这是一个很好的顾虑,也是图3(c)的实验想要验证的事情。答案是不会。通过保留原始图像教师的锚定,VCSD的整体优化是一个保守的更新。它只在合理性支持集内进行概率重组,不会强制模型输出视觉发现但语言上不通顺的token。而且,因为EMA教师参数本身包含强大的语言先验,对比过程只是放大了视觉贡献,而非覆盖了语言知识。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性:★★★★★ 用输入条件对比替代特权信息来构筑蒸馏不对称性,在方法设计上极具原创性。将控制变量思想引入自蒸馏,属于范式层面的创新。
实验合理度:★★★★☆ 实验设计非常规范,覆盖多个模型家族和尺寸,对比基准全面,消融实验设计详实。唯一需要注意的是,某些更先进的多模态对比解码方法(如M3ID)没有作为Baseline出现。
学术研究价值:★★★★★ 极高的研究价值。它打开了“输入对比蒸馏”这个新方向。可以启发更多工作探索在输入空间的不同模态、不同部分上做减法,来提取特定于该模态或部分的监督信号。
稳定性:★★★★☆ VCSD引入了合理性约束,在实践中能有效防止训练中的性能塌陷,证明了其稳定性。但对超参数α的设定仍有一定依赖性。
适应性以及泛化能力:★★★☆☆ 当前VCSD的实验全部集中在视觉-语言模型上,其核心思想能否泛化到纯文本(比如通过Mask输入中的特定关键词)或多模态的其他组合(如音频-文本),是未来的一个探索方向。
硬件需求及成本:★★★★★ 方法极其轻量。训练时只比传统SFT多一次教师模型的前向传播(且教师与学生参数共享大部分),推理时与原始模型零成本无异。对硬件要求非常友友好。
复现难度:★★★★☆ 论文清晰地描述了所有细节:损失函数、超参数、训练策略,并且模型和数据集都是开源的。唯一的挑战是需要较大显存(B200)且训练步数较短(90步),多卡并行需要配置。
产品化成熟度:★★★★☆ 很高。由于其零推理成本增加和对抗幻觉的出色表现,可以直接集成到现有的大语言模型(LLM)后训练管线中。作为进阶版的RL-Free训练工具,它可能在视觉Agent等对幻觉极度敏感的领域率先落地。
可能的问题: 1. 理论上,该方法依赖于VLM的视觉编码器能将“黑图”视作无信息输入,如果视觉编码器对“无图像”比较没有对齐,可能会影响效果(尽管表3显示效果鲁棒)。 2. 方法目前仅在ViRL39K单一数据上训练,跨不同数据分布的泛化能力尚未得到验证。
主要参考文献
[1] Agarwal, R., et al. On-policy distillation of language models: Learning from self-generated data. 2024.
[2] Li, X., et al. Contrastive decoding: Evidence-based text generation for multimodal models. 2023.
[3] Zhao, H., et al. Self-distillation with privileged answers for reasoning tasks. 2026.
[4] Bai, J., et al. Qwen3-VL: A versatile vision-language model family. 2025.
[5] Wang, P., et al. ViRL39K: A large-scale dataset for visual reinforcement learning. 2026.
[6] Guan, L., et al. HallusionBench: You make me hallucinate. 2024.
[7] Yuan, Z., et al. Evidence-focused visual crops for self-distillation. 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想深入探究VCSD的对比蒸馏细节?快来加入龙哥读论文粉丝群,与同好一起探讨视觉语言模型自蒸馏新思路!
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 视觉语言模型+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。群内定期分享最新论文解读,还有机会与作者直接交流!