← 返回 PaperDaily 视觉与图像

CVPR 2026接收!QR-Prompt把残差变提示,少样本增量学习性能飙升

少样本增量学习(FSCIL)一直是个“鱼和熊掌”都想兼得的难题,既要记住旧知识,又要快速学会新类别。CVPR 2026的这篇QR-Prompt,把VLM的残差特征做成“小纸条”,既稳定又灵活,在三个基准数据集上都刷了新SOTA。对于搞小样本、增量学习的朋友,这篇是必读品了。

CVPR 2026接收!QR-Prompt把残差变提示,少样本增量学习性能飙升
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
少样本增量学习(FSCIL)一直是个“鱼和熊掌”都想兼得的难题,既要记住旧知识,又要快速学会新类别。CVPR 2026的这篇QR-Prompt,把VLM的残差特征做成“小纸条”,既稳定又灵活,在三个基准数据集上都刷了新SOTA。对于搞小样本、增量学习的朋友,这篇是必读品了。


原论文信息如下:
论文标题:
Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Models
发表日期: 2026
发表单位: Indian Institute of Science, India; Space Applications Centre, India
原文链接: https://openaccess.thecvf.com/content/CVPR2026/papers/Sinha_Quantized_Residuals_to_Continuous_Prompts_for_Few-Shot_Class_Incremental_Learning_CVPR_2026_paper.pdf

视觉-语言模型在少样本增量学习中面临哪些挑战?

少样本类别增量学习(FSCIL)让模型先学老类别,再每次给几个新样本(如5张)学会新类别,同时不能忘旧知识。这叫做“稳定性-可塑性”权衡。

传统FSCIL靠纯视觉模型(如ResNet),但数据太少易过拟合。后来大家转向视觉-语言模型(VLM),如CLIP。CLIP通过海量图文对训练,具备跨模态对齐和强迁移性,看似是FSCIL的天选之子。

但CLIP的训练目标是“对比学习”——让配对图文靠近,不配对的分开。为拉大特征距离,它会刻意“去相关”,压制维度间的自然依赖。就像把麻花辫梳直,卷曲里的“纹路”信息全丢了,而这些正是区分细粒度类别的关键。

直接拿CLIP视觉特征做FSCIL,会得到“扁平化”流形——类间距一样,类内细微差异也没了。新类别只有几张小样本,再丢特征信息等于裸学。现有提示学习方法也有坑:有的完全可学习(如CODA-Prompt),灵活性够但易“语义漂移”;有的静态或量化(如VQ-Prompt),稳定性有但表达能力被锁死。

龙哥觉得,这就像让武林高手既保留原门派绝学,又学隔壁功夫,不能走火入魔。论文《Quantized Residuals to Continuous Prompts》(CVPR 2026)给出了一个极其聪明的解——从残差特征入手。

图1:(a) 不同类别视觉特征(蓝色)与残差(橙色)的互相关分布;(b) 残差与图像特征向量Hessian之间的散点关系图。
图1:(a) 不同类别视觉特征(蓝色)与残差(橙色)的互相关分布;(b) 残差与图像特征向量Hessian之间的散点关系图。

残差特征为何比原始视觉特征更有效?

论文发现了一个宝藏:CLIP视觉特征和文本特征之间的“残差”。对一张图片,用CLIP分别提取视觉嵌入xv和文本嵌入xt,残差r = xv - xt。这表示视觉特征中“没有被文本对齐”的部分。对比学习后,文本特征保留全局粗粒度语义,残差中集中了局部细粒度变化——颜色、纹理、形状的细微差别。

为什么残差更香?图1(a)显示,视觉特征的维度间互相关集中在0附近(被去相关),而残差的互相关分布更宽,保留了维度间依赖关系,这正是区分细粒度类别所需的“特征组合”。图1(b)显示残差大小与图像特征Hessian强相关——Hessian越大,流形曲率越大。残差本质上“捕捉了视觉流形被压平前弯曲剧烈的局部几何结构”。

用大白话说:CLIP把特征流形熨平了,残差就是没被熨平的褶皱。少样本学习最需要这些“褶皱”里的细节。所以论文选择对残差下手。

龙哥忍不住夸一句:这个直觉太妙了。就像在KTV唱歌,原唱(文本特征)给泛泛的调子,你自己的声音(视觉特征)有各种“跑调”细节,残差就是那个差值。现在拿这个差值作为适应新歌的线索——聪明!

图2:本文提出的QR-Prompt框架概述。
图2:本文提出的QR-Prompt框架概述。残差特征映射到每个子空间中最接近的码本索引,再通过层次化提示编码(HPE)的查找表和交叉注意力生成子空间嵌入,最后提示组合器(PC)用可学习的查询注意力将子空间嵌入组合成有意义的连续提示。

如何通过量化实现稳定性与可塑性的平衡?

找到了残差这个宝贝,论文设计了一个精巧的两阶段方案:先把残差特征量化(离散化)成一组“码本”,再把离散码本转换成连续提示。码本在初始训练后完全冻结,保证稳定性;提示连续化保证可塑性。

核心组件:判别性子空间量化(DSQ)

DSQ把高维残差空间RD分割成M个低维子空间,每个子空间学习一个码本,包含K个码字。对任意残差向量,拆成M段,每段找最近码字,用索引表示。这样连续残差被压缩成一串离散索引。

但不同于传统向量量化仅追求最小化重构误差,DSQ还干了两件额外的事:

1. 旋转对齐流形曲率:学习正交变换R,将残差空间坐标轴旋转到主曲率方向,使量化单元更好拟合流形局部线性区域。

2. 判别性正则化:在量化损失中加入类间-类内散度约束,让不同类别残差在量化编码空间中保持可区分性。损失函数:LDSQ = Lquantization + λ·Ldiscriminative,λ=0.1。

DSQ码本只在基类会话上训练,之后在所有增量会话中完全冻结。论文给出理论支撑——定理1(PAC-Bayesian泛化界):

定理1指出,泛化误差的宽松项随每个增量会话引入的新码字数量对数增长。冻结码本(新增码字数=0)则宽松项最小,泛化性最优。基类大量样本保证了经验风险的低偏差。

这从数学上证明了:冻结的DSQ码本既能提供稳定离散基底,又不会因新旧分布差异恶化泛化性能。定理2给出量化误差对分类间隔的影响上界,指导选择M和K。实验中M=32,K=32。

通过“先量化、后冻结”,QR-Prompt的稳定性有了保障。灵活性交给下面的层次化提示编码和提示组合器。

层次化提示编码如何将离散码转化为连续提示?

DSQ输出离散索引,不能直接扔给CLIP文本编码器。论文设计了层次化提示编码器(HPE)和提示组合器(PC)。

HPE:从离散索引到连续子空间嵌入

HPE维护M个独立嵌入表,每个子空间对应一个,大小K×Dp。查表得M个Dp维嵌入向量,表示每个子空间的“粗粒度属性”。然后HPE对这些子空间嵌入施加跨子空间多头交叉注意力,让不同子空间的属性交互,编码出“红色条纹”这类组合属性。图4展示了交互前后t-SNE图的变化。

PC:从子空间嵌入到类别自适应提示

HPE输出是M×Dp矩阵。PC用可学习查询向量Q0作为“语义槽”,对AL做交叉注意力,得到聚合提示向量p*。查询向量还会被该类别的平均残差向量调制,使提示对类别自适应。图4(c)展示了不同类别对子空间的注意力权重差异。

提示向量p*被追加到通用文本模板后,一起经过冻结的CLIP文本编码器,得到调整后的文本特征。HPE+PC训练采用InfoNCE损失。

图3:HPE和PC的联合训练示意图。
图3:HPE和PC的联合训练示意图。通过端到端优化子空间嵌入和组合,最小化生成文本特征与视觉特征之间的InfoNCE损失。
图4:(a) 交叉子空间交互前的t-SNE图;(b) 交互后的t-SNE图;(c) 不同类别对8个子空间的注意力系数对比。
图4:(a) 交叉子空间交互前的t-SNE图,形成紧致簇;(b) 交互后簇扩大并交融,体现细粒度语义;(c) 不同类别对子空间注意力的对比。

实验结果如何证明方法的有效性?

论文在三个标准FSCIL基准数据集上评估:CUB200(细粒度鸟类)、CIFAR100(通用物体)、miniImageNet(更复杂)。CUB200用100基类+10个增量会话(每会话10类,每类5样本);CIFAR100和miniImageNet用60基类+8个增量会话(每会话5类,每类5样本)。对比方法包括L2P、DualPrompt、CODA-Prompt、VQ-Prompt、FeCAM、TEEN、BiMC、FDR等。

QR-Prompt在三个数据集上都取得了最佳结果。

表1(a):CUB200数据集上各方法性能对比。
表1(a):CUB200数据集上各方法性能对比。QR-Prompt在平均准确率和性能下降上均优于所有对比方法。
表1(b):CIFAR100数据集上各方法性能对比。
表1(b):CIFAR100数据集上各方法性能对比。
表1(c):miniImageNet数据集上各方法性能对比。
表1(c):miniImageNet数据集上各方法性能对比。

从结果看,QR-Prompt优势一致:CUB200平均准确率82.12%,比第二好BiMC(80.49%)高1.63%,性能下降仅6.17%最低;CIFAR100平均79.32%,比BiMC提升近1%;miniImageNet平均97.43%,性能下降仅1.64%。可视化分析(图5)进一步揭示优势:t-SNE图中文本原型和视觉原型对齐更好;消融实验显示增加K或M可提升准确率但会饱和;saliency map说明QR-Prompt聚焦更判别性区域。

图5:(a) t-SNE可视化;(b-c) 码本参数消融;(d) 显著图对比。
图5:(a) t-SNE图展示文本原型和视觉原型对齐改进;(b) 不同K值下的平均准确率;(c) 不同M值下的平均准确率;(d) QR-Prompt与零样本CLIP的显著图对比。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

QR-Prompt中的“QR”代表什么?“QR”是“Quantized Residuals”的缩写,即量化残差。整个方法全称是Quantized Residuals to Continuous Prompts,简称QR-Prompt。

DSQ和VQ-Prompt的量化有什么本质区别?VQ-Prompt对视觉特征直接做向量量化,主要减小存储和稳定性;DSQ专门对残差特征量化,额外学习判别性正则化和流形曲率对齐,使量化编码保持类别可区分性和几何结构。

论文中的HPE和PC为何只在基类会话训练,增量会话也微调吗?DSQ码本在基类训练后完全冻结;HPE和PC在基类会话中预训练,每个增量会话用新样本微调(仅更新HPE和PC的轻量参数)。DSQ冻结,微调HPE和PC不会导致灾难性遗忘,又能适应新类别。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

将VLM残差特征引入FSCIL,结合判别性子空间量化与层次化提示生成,思路清晰新颖。理论给出泛化界和间隔保持分析,完整度高。

实验合理度:★★★★★

三个标准数据集与8个方法对比,包含详细消融、参数分析、可视化,实验严谨,结果一致。

学术研究价值:★★★★☆

为VLM在FSCIL中的应用提供新范式,理论分析和实现细节对后续研究有启发。

稳定性:★★★★☆

DSQ码本冻结保证稳定性,后期会话性能平稳。但完全依赖基类学到的子空间划分,若基类与新类差异极大可能影响稳定性,不过实验表现良好。

适应性以及泛化能力:★★★★☆

三个数据集表现均衡,不同分辨率下均有收益。但对极端分布变化(如跨领域FSCIL)未评估,留有余地。

硬件需求及成本:★★★★☆

训练需基类大量数据,但增量微调轻量。推理额外开销小,总参数量仅0.45M,比CODA-Prompt(3.91M)小很多。

复现难度:★★★☆☆

论文提供详细超参数和算法描述,但未提及是否开源代码。DSQ和HPE+PC的联合训练有一定难度,但基本模块用PyTorch可复现。

产品化成熟度:★★★☆☆

依赖CLIP等VLM,云端推理可行。FSCIL适合持续学习应用,需进一步验证真实数据流性能。

可能的问题:依赖CLIP固定文本嵌入,若新类别名称在词汇外或语义模糊可能影响效果。DSQ码本大小M×K(1024个码字)在基类数量多时可能不够,论文未讨论动态扩展码本。总体瑕不掩瑜。


主要参考文献

[1] Abhishek Kumar Sinha et al. "Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Models." CVPR 2026.
[2] Wang et al. "L2P: Learning to Prompt for Continual Learning." CVPR 2022.
[3] Wang et al. "DualPrompt: Complementary Prompting for Rehearsal-free Continual Learning." ECCV 2022.
[4] Smith et al. "CODA-Prompt: Continual Decomposed Attention-based Prompting." CVPR 2023.
[5] Sinha et al. "VQ-Prompt: Vector Quantization for Continual Prompting." NeurIPS 2024.
[6] Radford et al. "Learning Transferable Visual Models From Natural Language Supervision." ICML 2021.
[7] Chen et al. "BiMC: Bi-Modal Calibration for Few-Shot Class-Incremental Learning with CLIP." CVPR 2025.
[8] Xue et al. "FDR: Feature Decomposition and Recomposition for Few-Shot Class-Incremental Learning." ICCV 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
QR-Prompt用残差+量化搞定了少样本增量学习,你是不是也想亲手试试?想第一时间获取更多像这样有潜力的“零门槛”复现方法,或者跟龙哥和各位高手一起讨论其中细节?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 少样本学习+北京+北大+XX),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。