← 返回 PaperDaily 视觉与图像

西交大提出Quant Experts:token级量化补偿

量化论文最怕两件事:一是把模型压小了,二是把精度也一起压没了。Quant Experts 这篇的思路很实在,不跟“全局统一补偿”死磕,而是把重要通道分成全局稳定和 token 相关两类,再用共享专家和路由专家分工处理,72B 模型在 W4A6 下还能追回 5.09% 平均精度,确实有点东西。

西交大提出Quant Experts:token级量化补偿
原论文信息如下:
论文标题:
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
发表日期:
2026年02月
发表单位:
Xi’an Jiaotong University, State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics
原文链接:
https://arxiv.org/pdf/2602.24059.pdf

大模型量化新思路:Quant Experts让视觉语言模型在低bit下性能满血复活,混合专家机制实现token级自适应补偿,Qwen2VL-72B精度提升5.09%

视觉语言模型一旦进入低比特量化,最先掉的往往不是“面子”,而是“脑子”。图看不准、字认不稳、推理链一抖就跑偏,最后模型虽然瘦了,成绩单也跟着瘦了。Quant Experts(QE)这篇工作就盯住了这个老问题:重要通道并不是静态不变的,它会随着模态、token,甚至上下文悄悄换位置。于是,本论文没有继续迷信“一把尺子量所有输入”,而是把通道分成两类,再用共享专家和路由专家分工补偿,思路很工程,也很直接。
封面
封面图:不同量化粒度的直观对比。论文想表达的核心很明确——量化不是只看全局,也要看 token 现场
这类工作最怕“看起来聪明,落地很累”。但 QE 的优点是,它没有把复杂性堆到天上,而是把复杂问题拆成了可实现的两层补偿:先稳住共性,再处理个性。这个方向很像工程里常见的套路:先保底,再精修。

从观察到创新:通道重要性的动态依赖本质

先把背景说人话:所谓后训练量化(Post-Training Quantization,PTQ),就是模型训练完以后,再把权重和激活从高精度压到低比特,省显存、省算力、推理也更便宜。问题在于,压缩不是白嫖,数值误差会被层层放大,尤其在视觉语言模型里,图像和文本混在一起,误差更容易“串门”。
过去很多方法的思路都比较朴素:找出敏感通道、做通道缩放、给敏感通道更高精度,或者用一个全局低秩适配器把量化误差整体补回来。问题是,这些方法默认“重要通道”像一群老干部,位置稳定、职责固定;但论文的观察很直接:同一层里,重要通道会随 token 变化而迁移,而且不同模态之间也不一样。比如,当模型处理一张包含密集文字的文档图片时,某些通道会变得异常活跃;而当模型转而处理一张自然风景图时,这些通道的重要性可能迅速下降,另一批通道则被激活。这种动态性在以往的静态补偿方案中被完全忽略了。
图2:Qwen2VL-2B 中 Transformer 块的 token 值分布与重要通道位置可视化
图2:Qwen2VL-2B 中 Transformer 块的 token 值分布与重要通道位置可视化。上半部分是 token 的值分布,下半部分是重要通道的位置。亮度和标记变化说明了一个很关键的事实:重要通道不是固定点位,而是会跟着输入内容跑。例如,在文本 token 集中的区域,某些通道的亮度显著增加,而在图像 token 集中的区域,则是另一批通道被高亮。这种分布上的“漂移”直接挑战了传统方法中“一劳永逸”的通道选择策略。
公式:计算每层重要通道的方式
公式含义并不复杂:先根据权重矩阵的行均值算出每个输入通道的“底子”,再把当前 token 的激活值和这个底子相乘,取 Top-k,就能得到该 token 对应的重要通道集合。这里的 k 不是玄学参数,而是控制“看多少个最重要通道”的窗口大小。通过调整 k 值,可以灵活控制补偿的粒度:k 值越大,被保护的通道越多,但可能引入冗余;k 值越小,补偿越精准,但可能遗漏一些次重要的通道。论文通过实验发现,存在一个最优的 k 值区间,使得补偿效果最佳。
图3:重要通道的频率分布与平均激活值
图3:重要通道的频率分布与平均激活值。红叉标出的,是静态全局方法在校准集上识别出的重要通道。图里最有意思的地方在于:少数通道高频出现,多数通道只在特定 token 下冒头。这就把重要通道分成了两派:一派是 token-independent important channels,中文可以理解为token 无关重要通道,更像全局稳定器;另一派是 token-dependent important channels,中文是token 相关重要通道,更像局部触发器。从图中可以清晰看到,高频通道(如通道 0、15、30)几乎在所有 token 上都被标记为重要,而低频通道(如通道 100、200)则只在少数几个 token 上出现。这种“长尾分布”是 QE 方法设计的核心依据。
这一步其实很关键。以前很多量化方法只盯着“谁最敏感”,QE 进一步问的是:这些敏感通道到底是一直敏感,还是只在某些 token 上敏感?前者适合统一补偿,后者就不能拿同一把尺子硬量,否则补偿策略会变成“平均主义”,看似公平,实则经常补不到点上。例如,一个只在处理“车牌号”这类密集文本时重要的通道,如果被全局补偿策略平均对待,它在处理“蓝天白云”图片时不仅无益,甚至可能引入噪声。QE 通过区分这两类通道,从根本上避免了这种“误补偿”。

核心设计:共享专家先保底,路由专家再补局部误差

QE 的整体结构可以理解为一个“先粗修、再精修”的量化修复系统。它先用校准数据统计每层通道的重要性频率,再把重要通道分成两组:token 无关通道交给共享专家(Shared Expert,SE),token 相关通道交给路由专家(Routed Experts,REs)。两类专家都不是大块头网络,而是轻量级低秩适配器,核心目标只有一个:把量化后丢掉的那点信息尽量补回来。这种分工明确的设计,使得每个专家都能专注于自己擅长的领域,避免了单一模块既要处理全局共性又要处理局部特性的矛盾。
图4:Quant Experts 的整体框架
图4:Quant Experts 的整体框架。共享专家负责稳定的全局补偿,多个路由专家负责动态的局部补偿,每个专家内部都用低秩适配器实现。这个设计很像把“固定补丁”和“动态补丁”拆开做,避免一个补丁既要管全局又要管局部,最后谁都管不明白。从图中可以看到,输入 token 首先经过共享专家,得到一个全局补偿后的中间表示;然后,这个中间表示会输入到路由器,路由器根据当前 token 的特征,从多个路由专家中选择最合适的 1-2 个进行局部补偿;最后,所有补偿结果相加,得到最终的输出。
先看共享专家。论文把 token-independent 通道视为主要的全局误差来源,因为这些通道在大多数 token 上都频繁出现,像是模型表达能力里的“常驻骨干”。共享专家的做法是:这些通道不直接参与低比特量化,而是通过 whitening SVD 方式重建误差,再配合通道缩放减轻激活值过大带来的干扰。这里的 whitening SVD 可以简单理解为:先把误差矩阵“洗一洗”,让不同方向的尺度更均衡,再做低秩分解,尽量用更少参数表达主要误差。具体来说,whitening 操作通过计算误差矩阵的协方差并进行白化,使得后续的 SVD 分解能够更高效地捕捉到误差的主要成分,而不是被某些尺度特别大的方向所主导。
公式:量化误差重建目标
这个目标函数表达的是:希望“原始误差”减去“共享专家补的部分”和“路由专家补的部分”之后,乘到输入 token 上的残差尽量小。换句话说,不是比谁把参数做得更复杂,而是比谁能把量化误差真正压下去。公式中的第一项是原始量化误差,第二项是共享专家的补偿,第三项是路由专家的补偿。通过最小化这个残差,整个系统能够协同工作,确保补偿的准确性和高效性。
再看路由专家。token-dependent 通道不是一锅端,而是先根据共现关系聚类,再把它们分成多个子群。这里的“共现关系”很像超市购物篮:如果某些通道总是一起出现,那它们大概率属于同一类 token 触发模式。QE 先构建共现矩阵,再用 NPMI(Normalized Pointwise Mutual Information,中文可译为归一化点互信息)衡量通道之间的关联强度,之后用谱聚类把它们分组。这个过程的目的不是“分得漂亮”,而是让每个路由专家专门负责一类局部误差。例如,一组通道可能总是在处理“图表中的数字”时被激活,另一组通道则总是在处理“自然场景中的物体”时被激活。通过聚类,QE 能够自动发现这些隐含的“职责分工”,并为每一类分工配备一个专门的专家。
公式:token 相关通道的共现矩阵
公式里,Ot,il 表示第 l 层中,第 t 个 token 与第 i 个 token 相关通道是否同时出现。把所有 token 的这种“是否同时出现”收集起来,就得到共现矩阵。它是后面聚类和路由的基础。共现矩阵的维度是 C×C,其中 C 是 token 相关通道的数量。矩阵中的每个元素 (i, j) 表示通道 i 和通道 j 在所有 token 中同时被标记为重要的次数。这个矩阵直观地反映了通道之间的“协作模式”。
公式:NPMI 与相似度矩阵
这里先算单个通道的出现概率 p(i),再算两个通道一起出现的概率 p(i,j),最后得到相似度 Si,j。NPMI 越高,说明两个通道越容易在同一个 token 里一起“上岗”。这一步的价值在于:路由专家不是瞎分组,而是按统计共性分组,这样每个专家才更像“专科医生”。NPMI 的取值范围是 [-1, 1],值越大表示正相关性越强。通过设定一个阈值(例如 0.2),可以过滤掉那些共现关系不显著的通道对,从而得到更干净的相似度矩阵。
图6:基于共现关系的聚类结果
图6:Qwen2VL-2B 中基于共现关系的聚类结果。左边是相似度矩阵,中间是聚类后通道分组,右边是 t-SNE 投影。可以看出,QE 的聚类不是“图上好看”,而是确实把共现关系比较强的通道分到了一起。这个结果对后续路由很重要,因为路由器要做的不是重新发明分类,而是在正确的分组上选择正确的专家。从 t-SNE 投影中可以清晰地看到,不同颜色的点(代表不同聚类)在空间中形成了明显的簇,说明聚类结果具有很好的可分离性。
推理阶段则更干脆:共享专家固定启用,保证全局补偿稳定;路由专家由轻量路由器动态选择,负责当前 token 的局部误差修复。也就是说,QE 不追求让每个 token 都走同一条路,而是承认 token 有差异,直接让模型“看菜下饭”。这种做法的好处是兼顾了稳定性和适应性,代价则是多了一点路由和聚类的工程复杂度,但比起动不动就端到端重训全模型,已经算相当克制了。路由器本身是一个小型 MLP,输入是当前 token 的激活值,输出是每个路由专家的选择概率。在推理时,只选择概率最高的 top-1 或 top-2 专家进行激活,从而控制计算开销。
公式:路由损失
这个损失项的意思很直接:让路由器选出来的专家误差尽量小。它的作用不是替代主任务训练,而是让路由决策更靠谱。具体来说,路由损失会惩罚那些“选错了专家”的情况,即当某个 token 的真实重要通道属于聚类 A,但路由器却选择了负责聚类 B 的专家时,损失会增大。通过反向传播,路由器会逐渐学会将 token 映射到正确的专家上。
公式:总损失
总损失由路由损失和分类损失组成。简单说,就是既要选对专家,也要让专家的职责分配更清晰。分类损失是标准的交叉熵损失,用于确保模型在量化后仍能正确完成原有的分类或生成任务。路由损失则是一个辅助损失,用于优化路由器的选择策略。两者结合,使得 QE 在补偿量化误差的同时,不会偏离原始任务目标。QE 的妙处不在于公式多,而在于它把“补偿谁、怎么补、何时补”拆成了能落地的几个小问题。

论文主体思路

为了让主干更清楚,这里把论文的核心信息整理成一张表。它不是为了凑版面,而是为了把“这篇方法到底在解决什么、怎么做、靠什么训练、适合什么场景”一次说透。
*表格超出部分左右可以滑动
项目内容
应用场景大规模视觉语言模型的后训练量化,重点覆盖 OCR、文档理解、图表推理、多模态问答等任务
问题建模在低比特量化下,补偿量化误差,使量化模型尽量接近全精度模型的输出表现
模型 Backbone 及选择原因Qwen2VL 系列与 InternVL2 系列,覆盖 2B 到 72B 规模,代表性强,适合验证方法在不同尺寸和不同结构 VLM 上的泛化能力
损失函数以误差重建目标为核心,结合路由损失与分类损失,优化共享专家和路由专家的分工
训练数据集校准集来自增强版 COCO Caption 数据,共采样 128 组图文对
测试数据集OCRBench、TextVQA、DocVQA、InfoVQA、ChartQA、VizWiz-VQA、ScienceQA、MMMU、MMStar、MuirBench、AI2D 等
训练方法先做通道重要性统计与聚类,再构建共享专家和多路由专家;可选进行轻量 refinement,仅训练路由专家和路由器
实验效果在多个量化设置下稳定优于 RTN、SmoothQuant、AWQ、LQER、MBQ;72B 模型在 W4A6 下平均精度最高提升 5.09%
方法优势兼顾全局稳定补偿与 token 级局部补偿,能处理模态差异和 token 动态变化
方法缺点需要额外的校准、聚类与路由设计;相比纯静态方法,系统复杂度更高
如果只看一句话总结,QE 的主线就是:先识别哪些通道“长期重要”,再识别哪些通道“按 token 临时重要”,最后用不同专家分别补偿。这比“所有重要通道统一处理”更贴近真实分布,也更符合视觉语言模型里模态和语义交织的特点。整个流程可以概括为三个步骤:第一步,通过校准数据统计通道重要性频率,区分 token 无关和 token 相关通道;第二步,对 token 相关通道进行共现聚类,形成多个子群;第三步,为每个子群分配一个路由专家,并训练一个路由器来动态选择专家。

实验结果分析

这篇论文的实验设计整体是比较扎实的。首先,模型覆盖了 2B、7B、8B 到 72B,说明方法不是只在“某一个幸运模型”上有效;其次,任务覆盖 OCR、文档、图表、科学推理和通用多模态理解,能比较全面地看出量化损失到底落在哪些能力上。更重要的是,实验同时做了权重量化、激活量化和权重-only 量化,说明 QE 不是只会在单一场景里刷分。例如,在 W4A6(4-bit 权重,6-bit 激活)这种极低比特设置下,QE 的提升尤为显著,而在 W8A16(8-bit 权重,16-bit 激活)这种相对宽松的设置下,QE 也能带来稳定的增益,证明了其在不同量化压力下的鲁棒性。
从方法逻辑上看,QE 的结果之所以容易成立,是因为它解决的不是“如何更激进地压缩”,而是“如何更聪明地补偿压缩造成的误差”。共享专家负责高频稳定通道,路由专家负责低频但关键的 token 相关通道,这种分工天然比单个全局低秩适配器更有表达力。尤其在视觉语言模型里,token 语义变化大、模态切换频繁,静态补偿很容易顾此失彼,QE 正好补的是这个短板。例如,在 DocVQA 任务中,模型需要同时理解文档的布局和文字内容,不同 token 的重要性差异极大,QE 的动态补偿机制能够精准地修复那些对布局和文字敏感的通道。
论文还特意做了消融实验,验证共享专家、路由专家、随机路由、随机聚类这些因素。这个设计很重要,因为它能回答一个老问题:提升到底是来自“多加了参数”,还是来自“分得对”。如果随机路由和随机聚类掉点明显,就说明 co-occurrence clustering 和 token-aware routing 不是装饰品,而是方法本体的一部分。论文的结论也确实指向这一点:正确建模通道共现关系,比单纯堆一个低秩模块更有效。消融实验结果显示,当使用随机路由(即随机选择专家)时,平均精度下降了约 2-3 个百分点;当使用随机聚类(即随机分组通道)时,精度下降约 1-2 个百分点。这充分证明了 QE 中聚类和路由设计的必要性。
表1:Qwen2VL-2B 的主要实验结果
表1:Qwen2VL-2B 的主要实验结果。可以看到,在 W4A6、W4A8 和 W3A16 等设置下,QE 都稳定优于 RTN、SmoothQuant、LQER 和 MBQ。特别是在更苛刻的低比特设置里,QE 的平均精度恢复更明显,说明它对量化误差的“止血”能力确实更强。例如,在 W4A6 设置下,QE 在 OCRBench 上的得分比第二名 MBQ 高出 3.2 个百分点,在 TextVQA 上高出 2.8 个百分点。
表2:InternVL2-8B 的主要实验结果
表2:InternVL2-8B 的主要实验结果。这里的趋势和 Qwen2VL 类似,QE 在多个任务上都能把量化带来的损失往回拉。尤其在 OCR、文档理解和图表推理这些对细节特别敏感的任务上,提升更说明问题:token 级补偿对细粒度视觉理解是有价值的。在 ChartQA 任务上,QE 比基线方法提升了 4.1 个百分点,这表明其对图表中数字和文本的混合理解能力得到了有效恢复。
表3:Qwen2VL-72B 的主要实验结果
表3:Qwen2VL-72B 的主要实验结果。72B 规模上,QE 在 W4A6 下平均精度提升达到 5.09%。这个数字很关键,因为大模型越大,量化后通常越难救;QE 还能把成绩拉回来,说明它不是只对小模型有效,而是能在更大规模上保持一致性。对实际部署来说,这种结果比“某个小模型涨 0.5 分”更有说服力。在 72B 模型上,QE 的额外计算开销相对于模型本身的推理成本几乎可以忽略不计,这使得它在实际部署中极具吸引力。
表4:Qwen2VL-2B 的消融实验结果
表4:Qwen2VL-2B 的消融实验结果。共享专家和路由专家缺一不可,随机路由和随机聚类也会带来明显退化。这说明 QE 的核心优势并不只是“多了几个模块”,而是模块之间的分工关系确实对准了误差来源。当移除共享专家时,平均精度下降约 1.5 个百分点;当移除路由专家时,精度下降约 3.0 个百分点,说明路由专家在动态补偿中扮演了更重要的角色。
表5:路由专家精炼策略的消融结果
表5:路由专家精炼策略的消融结果。论文还提供了一个轻量 refinement 方案,只训练路由专家和路由器,不动其他参数。这个设计很务实,说明作者并没有把“训练一下”当成万能解药,而是尽量控制额外成本。实验结果显示,即使只进行轻量 refinement,也能带来约 1.0 个百分点的额外提升,而训练成本仅为全量微调的 10% 左右。
表7:QE 的线性层复杂度分析
表7:QE 的线性层复杂度分析。量化方法最怕的不是“精度高一点点”,而是“补偿后推理成本爆炸”。这张表的意义就在于说明 QE 没有把系统复杂度抬得离谱,整体仍然保持在可接受范围内。对真正要部署的团队来说,这比只会涨分更重要。分析显示,QE 引入的额外 FLOPs 仅占模型总 FLOPs 的 0.5% 以下,内存开销增加也控制在 2% 以内。
论文还给出了一些补充实验,比如不同重要通道数量下的性能变化,以及在 MMLU 上的量化结果。这些附加实验的作用很朴素:证明方法不是只在少数任务上“运气好”,而是对通道数、任务类型和模型规模都比较稳。尤其是重要通道数量的敏感性分析,能帮助后续复现者理解参数怎么选,而不是盲目照抄。实验发现,当 k 值(重要通道数量)从 32 增加到 128 时,性能持续提升;但当 k 值超过 128 后,性能提升趋于饱和,甚至略有下降。这为实际应用提供了一个明确的参数选择指导。
表13:重要通道数量对性能的影响
表13:重要通道数量对性能的影响。这个实验告诉读者,QE 不是“通道越多越好”,而是存在一个比较合理的保护窗口。换句话说,量化补偿也讲究分寸,补过头了同样可能让系统变笨。当 k 值过大时,一些不重要的通道也被纳入补偿范围,反而引入了噪声,导致性能下降。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是视觉语言模型量化后精度掉得太快的问题。QE 不是简单找更大模型来“硬扛”,而是把量化误差按 token 依赖关系拆开,再分别用共享专家和路由专家补偿。传统的全局补偿方法,如 LQER,使用一个低秩矩阵来补偿所有通道的误差,但忽略了通道重要性的动态变化。QE 通过区分 token 无关和 token 相关通道,实现了更精细化的补偿。

token-independent 和 token-dependent 分别是什么意思?前者指那些在多数 token 上都经常出现的稳定重要通道,更像全局骨干;后者指只在特定 token 或特定上下文里才重要的通道,更像局部触发器。QE 正是按这两类通道采用不同补偿方式。例如,在处理一张“带有路标的风景图”时,token-independent 通道负责处理通用的视觉特征(如边缘、颜色),而 token-dependent 通道则专门处理路标上的文字信息。

NPMI 和谱聚类在这里是干什么的?NPMI(归一化点互信息)用来衡量两个通道是否经常一起出现,谱聚类则根据这个共现关系把 token-dependent 通道分组。这样每个路由专家就能专门负责一类局部误差,而不是乱枪打鸟。例如,通过 NPMI 分析,可能会发现通道 A、B、C 总是在处理“数字”时一起出现,而通道 D、E、F 总是在处理“人脸”时一起出现。谱聚类就会将 {A, B, C} 分为一组,{D, E, F} 分为另一组,并为每组分配一个专家。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是凭空造一个新模块,而是把“重要通道的动态依赖”这个真实问题拆开来处理,思路扎实,创新点也清楚。

实验合理度:★★★★☆ 模型规模、量化设置、任务类型都铺开了,消融也做得比较完整,基本能支撑方法有效的结论。

学术研究价值:★★★★☆ 把视觉语言模型量化从“全局静态补偿”推进到“token-aware 自适应补偿”,对后续研究有明显启发意义。

稳定性:★★★☆☆ 结果整体稳定,但仍依赖校准、聚类和路由质量,属于“可用且有希望”,还不是完全无脑部署型方案。

适应性以及泛化能力:★★★★☆ 从 2B 到 72B 都能吃到收益,说明方法不是只对某一个模型结构有效,泛化性不错。

硬件需求及成本:★★★☆☆ 比纯静态量化多了聚类、路由和低秩重建,训练和部署都更复杂,但仍远低于全量重训。

复现难度:★★★☆☆ 论文给了清晰流程,但涉及校准集、聚类、SVD、路由器,细节不少,复现不算轻松。

产品化成熟度:★★★☆☆ 适合对精度敏感、又必须压缩成本的多模态场景;如果业务对延迟极端敏感,还要再评估路由开销。

可能的问题:方法依赖校准分布和聚类质量,遇到分布漂移时路由可能失准;复杂度比静态量化更高,部署时要算清收益账。


主要参考文献

[1] Chenwei Jia, Baoting Li, Xuchong Zhang, Mingzhuo Wei, Bochen Lin, Hongbin Sun. Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization. arXiv:2602.24059, 2026.
[2] SmoothQuant, AWQ, GPTQ, LQER, ASER, MBQ 等相关工作见论文正文引用。

量化不是把模型“压扁”就完事,关键是别把关键通道也一并压没了。想继续追这种既讲原理、又讲工程代价的论文,欢迎加入龙哥读论文粉丝群,和一群认真但不死板的同行一起拆模型、看实验、聊落地。扫描下方二维码或加龙哥助手微信 kangjinlonghelper,备注“研究方向+地点+学校/公司+昵称”即可。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。