← 返回 PaperDaily
视觉与图像
西交大提出Quant Experts:token级量化补偿
量化论文最怕两件事:一是把模型压小了,二是把精度也一起压没了。Quant Experts 这篇的思路很实在,不跟“全局统一补偿”死磕,而是把重要通道分成全局稳定和 token 相关两类,再用共享专家和路由专家分工处理,72B 模型在 W4A6 下还能追回 5.09% 平均精度,确实有点东西。
龙哥读论文
发布于 2026-08-14 09:11:22
阅读 3
查看原文
原论文信息如下:
大模型量化新思路:Quant Experts让视觉语言模型在低bit下性能满血复活,混合专家机制实现token级自适应补偿,Qwen2VL-72B精度提升5.09%
视觉语言模型一旦进入低比特量化,最先掉的往往不是“面子”,而是“脑子”。图看不准、字认不稳、推理链一抖就跑偏,最后模型虽然瘦了,成绩单也跟着瘦了。Quant Experts(QE)这篇工作就盯住了这个老问题:重要通道并不是静态不变的 ,它会随着模态、token,甚至上下文悄悄换位置。于是,本论文没有继续迷信“一把尺子量所有输入”,而是把通道分成两类,再用共享专家和路由专家分工补偿,思路很工程,也很直接。
这类工作最怕“看起来聪明,落地很累”。但 QE 的优点是,它没有把复杂性堆到天上,而是把复杂问题拆成了可实现的两层补偿:先稳住共性,再处理个性。这个方向很像工程里常见的套路:先保底,再精修。
从观察到创新:通道重要性的动态依赖本质
先把背景说人话:所谓后训练量化 (Post-Training Quantization,PTQ),就是模型训练完以后,再把权重和激活从高精度压到低比特,省显存、省算力、推理也更便宜。问题在于,压缩不是白嫖,数值误差会被层层放大,尤其在视觉语言模型里,图像和文本混在一起,误差更容易“串门”。
过去很多方法的思路都比较朴素:找出敏感通道、做通道缩放、给敏感通道更高精度,或者用一个全局低秩适配器把量化误差整体补回来。问题是,这些方法默认“重要通道”像一群老干部,位置稳定、职责固定;但论文的观察很直接:同一层里,重要通道会随 token 变化而迁移 ,而且不同模态之间也不一样。比如,当模型处理一张包含密集文字的文档图片时,某些通道会变得异常活跃;而当模型转而处理一张自然风景图时,这些通道的重要性可能迅速下降,另一批通道则被激活。这种动态性在以往的静态补偿方案中被完全忽略了。
这一步其实很关键。以前很多量化方法只盯着“谁最敏感”,QE 进一步问的是:这些敏感通道到底是一直敏感,还是只在某些 token 上敏感? 前者适合统一补偿,后者就不能拿同一把尺子硬量,否则补偿策略会变成“平均主义”,看似公平,实则经常补不到点上。例如,一个只在处理“车牌号”这类密集文本时重要的通道,如果被全局补偿策略平均对待,它在处理“蓝天白云”图片时不仅无益,甚至可能引入噪声。QE 通过区分这两类通道,从根本上避免了这种“误补偿”。
核心设计:共享专家先保底,路由专家再补局部误差
QE 的整体结构可以理解为一个“先粗修、再精修”的量化修复系统。它先用校准数据统计每层通道的重要性频率,再把重要通道分成两组:token 无关通道 交给共享专家(Shared Expert,SE),token 相关通道 交给路由专家(Routed Experts,REs)。两类专家都不是大块头网络,而是轻量级低秩适配器,核心目标只有一个:把量化后丢掉的那点信息尽量补回来。这种分工明确的设计,使得每个专家都能专注于自己擅长的领域,避免了单一模块既要处理全局共性又要处理局部特性的矛盾。
先看共享专家。论文把 token-independent 通道视为主要的全局误差来源,因为这些通道在大多数 token 上都频繁出现,像是模型表达能力里的“常驻骨干”。共享专家的做法是:这些通道不直接参与低比特量化,而是通过 whitening SVD 方式重建误差,再配合通道缩放减轻激活值过大带来的干扰。这里的 whitening SVD 可以简单理解为:先把误差矩阵“洗一洗”,让不同方向的尺度更均衡,再做低秩分解,尽量用更少参数表达主要误差。具体来说,whitening 操作通过计算误差矩阵的协方差并进行白化,使得后续的 SVD 分解能够更高效地捕捉到误差的主要成分,而不是被某些尺度特别大的方向所主导。
再看路由专家。token-dependent 通道不是一锅端,而是先根据共现关系聚类,再把它们分成多个子群。这里的“共现关系”很像超市购物篮:如果某些通道总是一起出现,那它们大概率属于同一类 token 触发模式。QE 先构建共现矩阵,再用 NPMI(Normalized Pointwise Mutual Information,中文可译为归一化点互信息 )衡量通道之间的关联强度,之后用谱聚类把它们分组。这个过程的目的不是“分得漂亮”,而是让每个路由专家专门负责一类局部误差。例如,一组通道可能总是在处理“图表中的数字”时被激活,另一组通道则总是在处理“自然场景中的物体”时被激活。通过聚类,QE 能够自动发现这些隐含的“职责分工”,并为每一类分工配备一个专门的专家。
推理阶段则更干脆:共享专家固定启用,保证全局补偿稳定;路由专家由轻量路由器动态选择,负责当前 token 的局部误差修复。也就是说,QE 不追求让每个 token 都走同一条路,而是承认 token 有差异,直接让模型“看菜下饭”。这种做法的好处是兼顾了稳定性和适应性,代价则是多了一点路由和聚类的工程复杂度,但比起动不动就端到端重训全模型,已经算相当克制了。路由器本身是一个小型 MLP,输入是当前 token 的激活值,输出是每个路由专家的选择概率。在推理时,只选择概率最高的 top-1 或 top-2 专家进行激活,从而控制计算开销。
论文主体思路
为了让主干更清楚,这里把论文的核心信息整理成一张表。它不是为了凑版面,而是为了把“这篇方法到底在解决什么、怎么做、靠什么训练、适合什么场景”一次说透。
*表格超出部分左右可以滑动
项目 内容
应用场景 大规模视觉语言模型的后训练量化,重点覆盖 OCR、文档理解、图表推理、多模态问答等任务
问题建模 在低比特量化下,补偿量化误差,使量化模型尽量接近全精度模型的输出表现
模型 Backbone 及选择原因 Qwen2VL 系列与 InternVL2 系列,覆盖 2B 到 72B 规模,代表性强,适合验证方法在不同尺寸和不同结构 VLM 上的泛化能力
损失函数 以误差重建目标为核心,结合路由损失与分类损失,优化共享专家和路由专家的分工
训练数据集 校准集来自增强版 COCO Caption 数据,共采样 128 组图文对
测试数据集 OCRBench、TextVQA、DocVQA、InfoVQA、ChartQA、VizWiz-VQA、ScienceQA、MMMU、MMStar、MuirBench、AI2D 等
训练方法 先做通道重要性统计与聚类,再构建共享专家和多路由专家;可选进行轻量 refinement,仅训练路由专家和路由器
实验效果 在多个量化设置下稳定优于 RTN、SmoothQuant、AWQ、LQER、MBQ;72B 模型在 W4A6 下平均精度最高提升 5.09%
方法优势 兼顾全局稳定补偿与 token 级局部补偿,能处理模态差异和 token 动态变化
方法缺点 需要额外的校准、聚类与路由设计;相比纯静态方法,系统复杂度更高
如果只看一句话总结,QE 的主线就是:先识别哪些通道“长期重要”,再识别哪些通道“按 token 临时重要”,最后用不同专家分别补偿 。这比“所有重要通道统一处理”更贴近真实分布,也更符合视觉语言模型里模态和语义交织的特点。整个流程可以概括为三个步骤:第一步,通过校准数据统计通道重要性频率,区分 token 无关和 token 相关通道;第二步,对 token 相关通道进行共现聚类,形成多个子群;第三步,为每个子群分配一个路由专家,并训练一个路由器来动态选择专家。
实验结果分析
这篇论文的实验设计整体是比较扎实的。首先,模型覆盖了 2B、7B、8B 到 72B,说明方法不是只在“某一个幸运模型”上有效;其次,任务覆盖 OCR、文档、图表、科学推理和通用多模态理解,能比较全面地看出量化损失到底落在哪些能力上。更重要的是,实验同时做了权重量化、激活量化和权重-only 量化,说明 QE 不是只会在单一场景里刷分。例如,在 W4A6(4-bit 权重,6-bit 激活)这种极低比特设置下,QE 的提升尤为显著,而在 W8A16(8-bit 权重,16-bit 激活)这种相对宽松的设置下,QE 也能带来稳定的增益,证明了其在不同量化压力下的鲁棒性。
从方法逻辑上看,QE 的结果之所以容易成立,是因为它解决的不是“如何更激进地压缩”,而是“如何更聪明地补偿压缩造成的误差 ”。共享专家负责高频稳定通道,路由专家负责低频但关键的 token 相关通道,这种分工天然比单个全局低秩适配器更有表达力。尤其在视觉语言模型里,token 语义变化大、模态切换频繁,静态补偿很容易顾此失彼,QE 正好补的是这个短板。例如,在 DocVQA 任务中,模型需要同时理解文档的布局和文字内容,不同 token 的重要性差异极大,QE 的动态补偿机制能够精准地修复那些对布局和文字敏感的通道。
论文还特意做了消融实验,验证共享专家、路由专家、随机路由、随机聚类这些因素。这个设计很重要,因为它能回答一个老问题:提升到底是来自“多加了参数”,还是来自“分得对”。如果随机路由和随机聚类掉点明显,就说明 co-occurrence clustering 和 token-aware routing 不是装饰品,而是方法本体的一部分。论文的结论也确实指向这一点:正确建模通道共现关系,比单纯堆一个低秩模块更有效 。消融实验结果显示,当使用随机路由(即随机选择专家)时,平均精度下降了约 2-3 个百分点;当使用随机聚类(即随机分组通道)时,精度下降约 1-2 个百分点。这充分证明了 QE 中聚类和路由设计的必要性。
论文还给出了一些补充实验,比如不同重要通道数量下的性能变化,以及在 MMLU 上的量化结果。这些附加实验的作用很朴素:证明方法不是只在少数任务上“运气好”,而是对通道数、任务类型和模型规模都比较稳。尤其是重要通道数量的敏感性分析,能帮助后续复现者理解参数怎么选,而不是盲目照抄。实验发现,当 k 值(重要通道数量)从 32 增加到 128 时,性能持续提升;但当 k 值超过 128 后,性能提升趋于饱和,甚至略有下降。这为实际应用提供了一个明确的参数选择指导。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是视觉语言模型量化后精度掉得太快的问题。QE 不是简单找更大模型来“硬扛”,而是把量化误差按 token 依赖关系拆开,再分别用共享专家和路由专家补偿。传统的全局补偿方法,如 LQER,使用一个低秩矩阵来补偿所有通道的误差,但忽略了通道重要性的动态变化。QE 通过区分 token 无关和 token 相关通道,实现了更精细化的补偿。
token-independent 和 token-dependent 分别是什么意思? 前者指那些在多数 token 上都经常出现的稳定重要通道,更像全局骨干;后者指只在特定 token 或特定上下文里才重要的通道,更像局部触发器。QE 正是按这两类通道采用不同补偿方式。例如,在处理一张“带有路标的风景图”时,token-independent 通道负责处理通用的视觉特征(如边缘、颜色),而 token-dependent 通道则专门处理路标上的文字信息。
NPMI 和谱聚类在这里是干什么的? NPMI(归一化点互信息)用来衡量两个通道是否经常一起出现,谱聚类则根据这个共现关系把 token-dependent 通道分组。这样每个路由专家就能专门负责一类局部误差,而不是乱枪打鸟。例如,通过 NPMI 分析,可能会发现通道 A、B、C 总是在处理“数字”时一起出现,而通道 D、E、F 总是在处理“人脸”时一起出现。谱聚类就会将 {A, B, C} 分为一组,{D, E, F} 分为另一组,并为每组分配一个专家。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是凭空造一个新模块,而是把“重要通道的动态依赖”这个真实问题拆开来处理,思路扎实,创新点也清楚。
实验合理度: ★★★★☆ 模型规模、量化设置、任务类型都铺开了,消融也做得比较完整,基本能支撑方法有效的结论。
学术研究价值: ★★★★☆ 把视觉语言模型量化从“全局静态补偿”推进到“token-aware 自适应补偿”,对后续研究有明显启发意义。
稳定性: ★★★☆☆ 结果整体稳定,但仍依赖校准、聚类和路由质量,属于“可用且有希望”,还不是完全无脑部署型方案。
适应性以及泛化能力: ★★★★☆ 从 2B 到 72B 都能吃到收益,说明方法不是只对某一个模型结构有效,泛化性不错。
硬件需求及成本: ★★★☆☆ 比纯静态量化多了聚类、路由和低秩重建,训练和部署都更复杂,但仍远低于全量重训。
复现难度: ★★★☆☆ 论文给了清晰流程,但涉及校准集、聚类、SVD、路由器,细节不少,复现不算轻松。
产品化成熟度: ★★★☆☆ 适合对精度敏感、又必须压缩成本的多模态场景;如果业务对延迟极端敏感,还要再评估路由开销。
可能的问题: 方法依赖校准分布和聚类质量,遇到分布漂移时路由可能失准;复杂度比静态量化更高,部署时要算清收益账。
主要参考文献
[1] Chenwei Jia, Baoting Li, Xuchong Zhang, Mingzhuo Wei, Bochen Lin, Hongbin Sun. Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization. arXiv:2602.24059, 2026.
[2] SmoothQuant, AWQ, GPTQ, LQER, ASER, MBQ 等相关工作见论文正文引用。
量化不是把模型“压扁”就完事,关键是别把关键通道也一并压没了。想继续追这种既讲原理、又讲工程代价的论文,欢迎加入龙哥读论文粉丝群,和一群认真但不死板的同行一起拆模型、看实验、聊落地。扫描下方二维码或加龙哥助手微信 kangjinlonghelper,备注“研究方向+地点+学校/公司+昵称”即可。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群