公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~

龙哥推荐理由:
少样本增量学习(FSCIL)一直是个“鱼和熊掌”都想兼得的难题,既要记住旧知识,又要快速学会新类别。CVPR 2026的这篇QR-Prompt,把VLM的残差特征做成“小纸条”,既稳定又灵活,在三个基准数据集上都刷了新SOTA。对于搞小样本、增量学习的朋友,这篇是必读品了。
原论文信息如下:
视觉-语言模型在少样本增量学习中面临哪些挑战?
少样本类别增量学习(FSCIL)让模型先学老类别,再每次给几个新样本(如5张)学会新类别,同时不能忘旧知识。这叫做“稳定性-可塑性”权衡。
传统FSCIL靠纯视觉模型(如ResNet),但数据太少易过拟合。后来大家转向视觉-语言模型(VLM),如CLIP。CLIP通过海量图文对训练,具备跨模态对齐和强迁移性,看似是FSCIL的天选之子。
但CLIP的训练目标是“对比学习”——让配对图文靠近,不配对的分开。为拉大特征距离,它会刻意“去相关”,压制维度间的自然依赖。就像把麻花辫梳直,卷曲里的“纹路”信息全丢了,而这些正是区分细粒度类别的关键。
直接拿CLIP视觉特征做FSCIL,会得到“扁平化”流形——类间距一样,类内细微差异也没了。新类别只有几张小样本,再丢特征信息等于裸学。现有提示学习方法也有坑:有的完全可学习(如CODA-Prompt),灵活性够但易“语义漂移”;有的静态或量化(如VQ-Prompt),稳定性有但表达能力被锁死。
龙哥觉得,这就像让武林高手既保留原门派绝学,又学隔壁功夫,不能走火入魔。论文《Quantized Residuals to Continuous Prompts》(CVPR 2026)给出了一个极其聪明的解——从残差特征入手。
残差特征为何比原始视觉特征更有效?
论文发现了一个宝藏:CLIP视觉特征和文本特征之间的“残差”。对一张图片,用CLIP分别提取视觉嵌入xv和文本嵌入xt,残差r = xv - xt。这表示视觉特征中“没有被文本对齐”的部分。对比学习后,文本特征保留全局粗粒度语义,残差中集中了局部细粒度变化——颜色、纹理、形状的细微差别。
为什么残差更香?图1(a)显示,视觉特征的维度间互相关集中在0附近(被去相关),而残差的互相关分布更宽,保留了维度间依赖关系,这正是区分细粒度类别所需的“特征组合”。图1(b)显示残差大小与图像特征Hessian强相关——Hessian越大,流形曲率越大。残差本质上“捕捉了视觉流形被压平前弯曲剧烈的局部几何结构”。
用大白话说:CLIP把特征流形熨平了,残差就是没被熨平的褶皱。少样本学习最需要这些“褶皱”里的细节。所以论文选择对残差下手。
龙哥忍不住夸一句:这个直觉太妙了。就像在KTV唱歌,原唱(文本特征)给泛泛的调子,你自己的声音(视觉特征)有各种“跑调”细节,残差就是那个差值。现在拿这个差值作为适应新歌的线索——聪明!
如何通过量化实现稳定性与可塑性的平衡?
找到了残差这个宝贝,论文设计了一个精巧的两阶段方案:先把残差特征量化(离散化)成一组“码本”,再把离散码本转换成连续提示。码本在初始训练后完全冻结,保证稳定性;提示连续化保证可塑性。
核心组件:判别性子空间量化(DSQ)
DSQ把高维残差空间RD分割成M个低维子空间,每个子空间学习一个码本,包含K个码字。对任意残差向量,拆成M段,每段找最近码字,用索引表示。这样连续残差被压缩成一串离散索引。
但不同于传统向量量化仅追求最小化重构误差,DSQ还干了两件额外的事:
1. 旋转对齐流形曲率:学习正交变换R,将残差空间坐标轴旋转到主曲率方向,使量化单元更好拟合流形局部线性区域。
2. 判别性正则化:在量化损失中加入类间-类内散度约束,让不同类别残差在量化编码空间中保持可区分性。损失函数:LDSQ = Lquantization + λ·Ldiscriminative,λ=0.1。
DSQ码本只在基类会话上训练,之后在所有增量会话中完全冻结。论文给出理论支撑——定理1(PAC-Bayesian泛化界):
定理1指出,泛化误差的宽松项随每个增量会话引入的新码字数量对数增长。冻结码本(新增码字数=0)则宽松项最小,泛化性最优。基类大量样本保证了经验风险的低偏差。
这从数学上证明了:冻结的DSQ码本既能提供稳定离散基底,又不会因新旧分布差异恶化泛化性能。定理2给出量化误差对分类间隔的影响上界,指导选择M和K。实验中M=32,K=32。
通过“先量化、后冻结”,QR-Prompt的稳定性有了保障。灵活性交给下面的层次化提示编码和提示组合器。
层次化提示编码如何将离散码转化为连续提示?
DSQ输出离散索引,不能直接扔给CLIP文本编码器。论文设计了层次化提示编码器(HPE)和提示组合器(PC)。
HPE:从离散索引到连续子空间嵌入
HPE维护M个独立嵌入表,每个子空间对应一个,大小K×Dp。查表得M个Dp维嵌入向量,表示每个子空间的“粗粒度属性”。然后HPE对这些子空间嵌入施加跨子空间多头交叉注意力,让不同子空间的属性交互,编码出“红色条纹”这类组合属性。图4展示了交互前后t-SNE图的变化。
PC:从子空间嵌入到类别自适应提示
HPE输出是M×Dp矩阵。PC用可学习查询向量Q0作为“语义槽”,对AL做交叉注意力,得到聚合提示向量p*。查询向量还会被该类别的平均残差向量调制,使提示对类别自适应。图4(c)展示了不同类别对子空间的注意力权重差异。
提示向量p*被追加到通用文本模板后,一起经过冻结的CLIP文本编码器,得到调整后的文本特征。HPE+PC训练采用InfoNCE损失。
实验结果如何证明方法的有效性?
论文在三个标准FSCIL基准数据集上评估:CUB200(细粒度鸟类)、CIFAR100(通用物体)、miniImageNet(更复杂)。CUB200用100基类+10个增量会话(每会话10类,每类5样本);CIFAR100和miniImageNet用60基类+8个增量会话(每会话5类,每类5样本)。对比方法包括L2P、DualPrompt、CODA-Prompt、VQ-Prompt、FeCAM、TEEN、BiMC、FDR等。
QR-Prompt在三个数据集上都取得了最佳结果。
从结果看,QR-Prompt优势一致:CUB200平均准确率82.12%,比第二好BiMC(80.49%)高1.63%,性能下降仅6.17%最低;CIFAR100平均79.32%,比BiMC提升近1%;miniImageNet平均97.43%,性能下降仅1.64%。可视化分析(图5)进一步揭示优势:t-SNE图中文本原型和视觉原型对齐更好;消融实验显示增加K或M可提升准确率但会饱和;saliency map说明QR-Prompt聚焦更判别性区域。
龙迷三问
QR-Prompt中的“QR”代表什么?“QR”是“Quantized Residuals”的缩写,即量化残差。整个方法全称是Quantized Residuals to Continuous Prompts,简称QR-Prompt。
DSQ和VQ-Prompt的量化有什么本质区别?VQ-Prompt对视觉特征直接做向量量化,主要减小存储和稳定性;DSQ专门对残差特征量化,额外学习判别性正则化和流形曲率对齐,使量化编码保持类别可区分性和几何结构。
论文中的HPE和PC为何只在基类会话训练,增量会话也微调吗?DSQ码本在基类训练后完全冻结;HPE和PC在基类会话中预训练,每个增量会话用新样本微调(仅更新HPE和PC的轻量参数)。DSQ冻结,微调HPE和PC不会导致灾难性遗忘,又能适应新类别。
龙哥点评
论文创新性分数:★★★★★
将VLM残差特征引入FSCIL,结合判别性子空间量化与层次化提示生成,思路清晰新颖。理论给出泛化界和间隔保持分析,完整度高。
实验合理度:★★★★★
三个标准数据集与8个方法对比,包含详细消融、参数分析、可视化,实验严谨,结果一致。
学术研究价值:★★★★☆
为VLM在FSCIL中的应用提供新范式,理论分析和实现细节对后续研究有启发。
稳定性:★★★★☆
DSQ码本冻结保证稳定性,后期会话性能平稳。但完全依赖基类学到的子空间划分,若基类与新类差异极大可能影响稳定性,不过实验表现良好。
适应性以及泛化能力:★★★★☆
三个数据集表现均衡,不同分辨率下均有收益。但对极端分布变化(如跨领域FSCIL)未评估,留有余地。
硬件需求及成本:★★★★☆
训练需基类大量数据,但增量微调轻量。推理额外开销小,总参数量仅0.45M,比CODA-Prompt(3.91M)小很多。
复现难度:★★★☆☆
论文提供详细超参数和算法描述,但未提及是否开源代码。DSQ和HPE+PC的联合训练有一定难度,但基本模块用PyTorch可复现。
产品化成熟度:★★★☆☆
依赖CLIP等VLM,云端推理可行。FSCIL适合持续学习应用,需进一步验证真实数据流性能。
可能的问题:依赖CLIP固定文本嵌入,若新类别名称在词汇外或语义模糊可能影响效果。DSQ码本大小M×K(1024个码字)在基类数量多时可能不够,论文未讨论动态扩展码本。总体瑕不掩瑜。
主要参考文献
[2] Wang et al. "L2P: Learning to Prompt for Continual Learning." CVPR 2022.
[3] Wang et al. "DualPrompt: Complementary Prompting for Rehearsal-free Continual Learning." ECCV 2022.
[4] Smith et al. "CODA-Prompt: Continual Decomposed Attention-based Prompting." CVPR 2023.
[5] Sinha et al. "VQ-Prompt: Vector Quantization for Continual Prompting." NeurIPS 2024.
[6] Radford et al. "Learning Transferable Visual Models From Natural Language Supervision." ICML 2021.
[7] Chen et al. "BiMC: Bi-Modal Calibration for Few-Shot Class-Incremental Learning with CLIP." CVPR 2025.
[8] Xue et al. "FDR: Feature Decomposition and Recomposition for Few-Shot Class-Incremental Learning." ICCV 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群