← 返回 PaperDaily 大模型与智能体

告别零点开销!CVPR 2026提出DASQ,精度+17%功耗反降

把模型“减肥”这件事,龙哥之前也聊过不少,比如大模型量化、混搭量化之类的。但今天这篇CVPR 2026的文章视角很刁钻——它发现视觉模型权重那些看起来不对称的“坏脾气”,其实只是被少数几个“刺头”(离群点)给带歪了。把刺头一拔,底下全是规规矩矩的对称分布。于是作者干脆利落地抛弃了硬件不友好的“非对称量化零点”,搞了个密集+稀疏的二重奏。这波操作不仅精度反超了

告别零点开销!CVPR 2026提出DASQ,精度+17%功耗反降
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header
龙哥推荐理由:
把模型“减肥”这件事,龙哥之前也聊过不少,比如大模型量化、混搭量化之类的。但今天这篇CVPR 2026的文章视角很刁钻——它发现视觉模型权重那些看起来不对称的“坏脾气”,其实只是被少数几个“刺头”(离群点)给带歪了。把刺头一拔,底下全是规规矩矩的对称分布。于是作者干脆利落地抛弃了硬件不友好的“非对称量化零点”,搞了个密集+稀疏的二重奏。这波操作不仅精度反超了现有方法,而且在FPGA上实测功耗更低,确实让人眼前一亮。

原论文信息如下:
论文标题:
Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weights
发表日期:
CVPR 2026
发表单位:
DENSO CORPORATION, DENSO IT Laboratory

量化新范式:告别开销巨大的零点,挖掘视觉模型权重的“隐形对称”

大家做模型部署时,应该都跟 量化(Quantization) 打过不少交道。把 FP32 的模型压缩成 INT4、INT2,推理速度起飞,但精度往往会掉一截。为了保住精度,学界和工业界普遍采用 非对称量化(Asymmetric Quantization,AsymQ)——给每个权重通道加上一个零点偏移(zero-point),来拟合那些“歪歪扭扭”的分布。这个零点确实能提升精度,但代价也不小:它让乘法器的位宽增加了一位,硬件面积和功耗直接飙升约 1.3 倍(具体可参考论文附录 C)。对于以乘累加(MAC)阵列为主体的芯片来说,这简直就是“伤筋动骨”。
那么问题来了:零点真的非得用吗?DENSO CORPORATION 和 DENSO IT Laboratory 的研究人员决定彻底重新思考这个问题。他们发现了一个隐藏的规律:视觉模型(CNN、ViT)的权重分布,在剔除掉少数几个“离群点”(outliers)之后,剩余的“核心”部分竟然是对称的!请看下面这个来自 ViT-B 某层的分析:
图1: ViT-B某层权重中隐藏的对称性
图1:ViT-B 某层权重中隐藏的对称性。左图:原始分布(100%百分位)与移除外点后的截断分布(99%百分位)对比,外点一去掉,分布立刻对称了;右图:所有输出通道的中值都向零靠拢。
而且这种现象不是个例,论文图2展示了不同层、不同外点比例下,平均绝对中值 随着外点减少而趋近于零,卷积层和全连接层都一样。
图2: 不同外点百分比下各层的平均绝对中值
图2:不同外点占比下各层的平均绝对中值,外点越少,中值越接近零,对称性越强。
这就意味着:权重分布的不对称,完全是被少数“刺头”带歪的!只要把刺头单独拎出来,剩下的主体可以用硬件喜爱的 对称量化(Symmetric Quantization,SymQ) 来搞,完全没有零点开销。于是,作者提出了一种全新的量化框架——Dense and Additive Sparse Quantization(DASQ,密集加性稀疏量化)
来看看 DASQ 和传统 AsymQ 在思路上的直接对比——下图(图3)一目了然:左边是 AsymQ,先加零点再乘法,MAC 单元输入宽度增加;右边是 DASQ,把零点替换成并行的稀疏 MatMul + 轻量位移操作,密集部分和稀疏部分各管各的。
图3: AsymQ与DASQ量化方案与架构对比
图3:(a) AsymQ 需要零点加法,增加乘法器宽度;(b) DASQ 用并行的稀疏 MatMul + 位移操作替代零点,硬件效率更高。

视觉模型权重的“素颜”真相:移除外点后,一片对称

为什么外点一去掉权重就对称了?直观上,神经网络的权重经过训练后,大多数参数都集中在零附近(类似拉普拉斯或高斯分布),但总有少数几个极端值被推得很远。传统做法——比如非对称量化(AsymQ)——试图用零点去平移整个分布,结果如图4(a)所示:4-bit AsymQ 虽然覆盖了外点,但零点附近的量化等级大量闲置,等效位宽被浪费了。而 DASQ 的做法如图4(b)所示:用 2-bit SymQ 量化核心分布(去掉外点后),再用 8-bit SymQ 单独量化那 1% 的外点,两个阶段都没有零点,量化等级被充分利用,MSE 反而比 4-bit AsymQ 还低!
图4: AsymQ与DASQ量化对比
图4:同图1a的权重。(a) 4-bit AsymQ 有很多量化等级空置;(b) DASQ 用 2-bit SymQ 量化核心 + 8-bit SymQ 量化外点,等级完全利用,MSE 更优。
这个观察是本文的核心洞察:权重的“素颜”其实是左右对称的,外点只是“浓妆”。DASQ 就是给权重“卸妆”,把基础肌肤(密集核心)和浓妆(稀疏外点)分开处理,各取所需。

DASQ:一拆为二,密集核 + 稀疏离群点,各取所需

DASQ 的核心公式非常简单: 权重 ≈ 密集量化 + 稀疏量化
权重 ≈ 密集量化矩阵 + 稀疏量化矩阵
其中 密集矩阵 使用低比特对称量化(比如 2-bit),稀疏矩阵 使用对称量化但位宽可以更高(比如 4-bit 或 8-bit),而且稀疏度极高(论文默认 98%)。优化目标是在给定的稀疏度约束下,最小化量化误差: 最小化 ||W - (W_D_hat + W_S_hat)||^2, 约束 L0 范数
最小化 ‖W - (Ŵ_D + Ŵ_S)‖²,约束 Ŵ_S 的非零比例为 1-p(p 为稀疏度)
优化采用交替迭代:先固定稀疏部分,优化密集部分的步长;然后根据当前误差构造稀疏掩码,再优化稀疏部分的步长。步长通过最小化 MSE 获得: 步长优化公式
步长 Δ_i 通过最小化该通道权重的 MSE 得到
完整的优化流程见论文 Algorithm 1(此处用文字简述):
输入:权重 W,密集位宽 k_D,稀疏位宽 k_S,稀疏度 p,最大迭代 T
1. 初始化密集部分 W_D = W - M(W, p),M 为根据 p 阈值提取的稀疏掩码(保留极大值)
2. 迭代 t=0..T:
    - 优化密集步长 Δ_D 并量化得到 Ŵ_D
    - 更新稀疏掩码:对剩余误差 W - Ŵ_D 取 top p 部分,得 W_S
    - 优化稀疏步长 Δ_S 并量化得到 Ŵ_S
    - 若步长变化小于阈值则停止,否则更新 W_D = W - Ŵ_S 并继续
这样拆分的妙处在于:密集部分因为没有外点干扰,可以用很小的步长精准量化;稀疏部分虽然值大,但数量极少(仅 2%),额外计算量可以忽略不计。而且两者都采用对称量化,硬件实现干净利落。

硬件加速巧设计:并行计算+位移位,速度翻倍功耗减半

DASQ 不仅仅在算法上优雅,硬件实现也下了一番功夫。推理时,密集 MatMul 和稀疏 MatMul 并行执行。但要在同一个硬件核心中实现并行,还得解决稀疏 MatMul 可能拖后腿的问题。论文采取了两条策略:
第一,约束稀疏步长与密集步长之比为 2 的幂次,即 Δ_S/Δ_D ≈ 2^u,这样稀疏 MatMul 的结果只需要一个位移操作(shift)即可与密集结果对齐,完全不需要乘法器。第二,利用高稀疏度:稀疏部分只有 2% 的非零元素,因此稀疏 MatMul 的计算量极小,几乎总能比密集 MatMul 先完成。由此,整体吞吐就由密集 MatMul 主宰,与 AsymQ 相当甚至更快,但精度和能效都更高。
在 AMD Xilinx ZCU102 FPGA 上,论文用 LUT 实现了低精度 MAC(因为 DSP 块在低于 8-bit 时效率不高)。结果如表4所示: 表4: FPGA资源利用与性能分析
表4:FPGA资源与性能对比。DASQ 在 LUT 使用和 GOPS/W 能效方面均优于 AsymQ。
特别值得关注的是图7的实测结果:在 ViT-S 模型上,W4/A4/SW4 的 DASQ 对比 W4/A4 的 AsymQ,FPGA 功耗更低,而 Top-1 精度却提升了 6.7%!即使把稀疏位宽升到 8-bit(SW8),LUT 增加有限,精度还能再涨。
图7: FPGA归一化功耗与Top-1精度
图7:FPGA上 ViT-S 的归一化功耗与 Top-1 精度。DASQ 在所有配置下均以更低功耗达到更高精度。
插图

实验遍地开花:CNN、Transformer齐给力,FPGA上真章

实验部分非常扎实,覆盖了图像分类(ImageNet)、目标检测与实例分割(COCO),模型囊括 CNN 和 Transformer,还在 FPGA 上做了真实硬件验证。
ImageNet 分类:ViT 大获全胜
表1展示了 ViT-B 在 W3/A4 和 W4/A4 下的结果。注意:RepQ-ViT 在 W3/A4 下直接崩到了 26.98%,而 DASQ+RepQ-ViT 一下拉升到 75.24%!即便是强大的 ERQ,DASQ 也能进一步提点,而且 BOPs 还更低。
表1: ImageNet上ViT-B的Top-1精度与BOPs
表1:ViT-B 在 ImageNet 上的结果。DASQ 用更少的 BOPs 实现了更高精度,尤其在 W3/A4 低比特下提升巨大。
图5的散点图展示了更多 ViT 模型(ViT-S、DeiT-T/S/B、Swin-S/B)的结果,DASQ 始终位于左上角(高精度+低 BOPs),统治力十足。
图5: Vision Transformer在ImageNet上的Top-1精度与BOPs
图5:各 ViT 模型在 ImageNet 上的精度-BOPs 分布,DASQ 始终处于最优 Pareto 前沿。
ImageNet 分类:CNN 也不落下风
表2是 ResNet-50 在 W2/A4 这个极度低比特设置下的结果。QDrop 基线只有 70.08%,DASQ 直接干到 72.63%,比之前最好的 CL-Calib(70.92%)高出 1.71%,BOPs 还减少了 30%。
表2: ImageNet上ResNet-50的Top-1精度
表2:ResNet-50 在 W2/A4 下的结果。DASQ 大幅领先所有现有方法。
图6展示了更多 CNN 模型(Res18、MobileNetV2、RegNet600M、RegNet3.2G),DASQ 全部征服。
图6: CNN在ImageNet上的Top-1精度与BOPs
图6:各 CNN 模型在 ImageNet 上的精度-BOPs 分布,DASQ 同样占据最优。
COCO 目标检测与实例分割
表3使用了 Mask R-CNN + Swin-T/Swin-S 骨干。对称基方法 PTQ4ViT、APQ-ViT 表现很差甚至崩掉,非对称方法 RepQ-ViT、ERQ 稳定但 BOPs 高。DASQ 集成 RepQ-ViT 后,Swin-T 的 AP_box 从 36.1 提升到 41.5,AP_mask 从 36.0 提升到 39.1;Swin-S 也全面超越。BOPs 比 AsymQ 方法低约 18%。
表3: COCO上Mask R-CNN的检测与分割结果
表3:COCO 检测/分割结果。DASQ 以更低 BOPs 取得最高的 AP_box 和 AP_mask。
消融实验:对称 vs 非对称,稀疏度的影响
图8很有意思:在 DASQ 框架下,用 SymQ 还是 AsymQ 去量化核心部分?结果加上了稀疏矩阵后,两份的差距急剧缩小,在 p=0.95 时仅差 0.19%。这说明 DASQ 的稀疏分量有效地弥补了对称量化相对于非对称量化的劣势,让我们可以放心使用硬件高效的 SymQ。
图8: SymQ与AsymQ在ViT-S上的对比
图8:SymQ vs AsymQ 在 DASQ 框架下的对比。足够稀疏时两者差异几乎消失,DASQ 让 SymQ 也能达到 AsymQ 的精度。

总结与展望:是否该重新思考非对称量化?

本文提出 DASQ,直接挑战了低比特 PTQ 中非对称量化(AsymQ)的统治地位。基本原理非常简单:权重分布中 98% 的核心区域是对称的,只有 2% 的外点是“刺头”。把刺头单独用稀疏对称量化处理,核心用低比特对称量化,结果精度更高、BOPs 更低、硬件实现更简单。FPGA 实测也证明了这一点。
不过,DASQ 也有一些局限性:论文只针对视觉模型(CNN、ViT),尚未测试在 NLP/LLM 上的效果;另外逐深度卷积(depthwise conv)因为每个通道权重太少,无法做密集-稀疏分解,仍然需要 AsymQ。未来如果能将这种“先找对称、再拆外点”的思想推广到更大范围的模型和层类型,可能会终结非对称量化在低比特视觉 PTQ 中的支配地位。
插图

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

DASQ的稀疏矩阵具体是怎么生成的?论文用交替优化:每轮先量化密集部分,然后对剩余误差取绝对值最大的 p%(比如 2%)作为稀疏矩阵的值,再量化稀疏部分。这样稀疏矩阵专门捕获密集量化后误差大的元素,也就是那些“刺头”。

DASQ与传统剪枝(pruning)的区别是什么?剪枝是直接把不重要的权重置零,网络变稀疏,但精度可能下降。DASQ的稀疏矩阵是量化后的结果,稀疏度是人为指定的(默认为 98%),而且稀疏矩阵仍然保留量化后的小数值,不是简单置零。更关键的是,DASQ专门用来处理权重分布中的极值,让密集部分可以用低位宽对称量化。

为什么DASQ在FPGA上能效更高?两个原因:一是 DASQ 去掉了 AsymQ 中的零点加法,乘法器位宽不变,LUT 面积减少;二是稀疏矩阵采用位移操作代替乘法,功耗更低。而且稀疏部分处理速度快,与密集部分并行时不会成为瓶颈,整体吞吐不变,功耗下降,所以能效比(GOPS/W)提升。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

想法非常巧妙:发现权重分布移除外点后的对称性,并据此用对称量化+稀疏替代非对称量化。虽然密集-稀疏分解不是全新概念,但用于消除量化零点且取得如此好的效果,在 PTQ 领域属于首创。

实验合理度:★★★★★

对比方法涵盖当前 SOTA(QDrop、BRECQ、MRECG、CL-Calib、RepQ-ViT、ERQ 等),覆盖 CNN 和 ViT 多种架构,还有 COCO 上的检测/分割任务,以及 FPGA 实测。消融也清晰。实验设计非常扎实。

学术研究价值:★★★★★

挑战了非对称量化在低比特视觉 PTQ 中的必要性,揭示了权重分布的真实性质。这一发现可能启发后续研究重新审视其他领域的量化策略,有很强的理论贡献。

稳定性:★★★★✰

在各种模型和比特设置下 DASQ 都表现稳定,但论文只验证了视觉任务,对其他模态(如 NLP、语音)的适应性未知。逐深度卷积仍需 AsymQ,是对稳定性的一些削弱。

适应性以及泛化能力:★★★✰✰

目前仅限于视觉模型中的卷积和全连接层(深度可分离层除外)。若要扩展到 LLM 或更通用的架构,需要重新验证权重分布的对称性假设。

硬件需求及成本:★★★★★

相比 AsymQ,DASQ 在 FPGA 上 LUT 使用更少、功耗更低、能效更高。稀疏部分仅需位移操作,硬件开销极低。

复现难度:★★★★✰

论文给出了详细的算法伪代码和优化步骤,并开源了代码(基于 PyTorch),复现难度较低。但 FPGA 实现需要 Vitis HLS 工具链,门槛稍高。

产品化成熟度:★★★★✰

已经在 FPGA 上验证,证明可以在实际硬件中以更低功耗运行。但还需要在更多不同芯片(如 GPU、NPU、ASIC)上验证兼容性,距离大规模产品化还有一定距离。

可能的问题:作者未测试 LLM 任务,且深度可分离卷积仍需 AsymQ 是一个硬伤。稀疏矩阵的推理需要专门的硬件支持或稀疏库,在通用处理器上效果可能打折扣。此外,交替优化可能需要多次迭代,增加了 PTQ 的校准时间。


主要参考文献

[59] QDrop: Randomly dropping quantization for extremly low-bit post-training quantization, ICLR 2022.
[31] RepQ-ViT: Scaling reproducibility for vision transformer quantization, CVPR 2023.
[70] ERQ: Efficient and reliable quantization for vision transformers, CVPR 2024.
[30] BRECQ: Pushing the limit of post-training quantization by block reconstruction, ICLR 2021.
[44] Adaround: Adaptive rounding for post-training quantization, ICML 2020.
[54] CL-Calib: Calibrating quantization via contrastive learning, CVPR 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
DASQ都抛弃了零点,你还不抛弃拖延症?快来群里和志同道合的小伙伴一起学习,让量化知识不再“稀疏”,让进步变得“密集”!欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 模型量化+上海+电装+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。