← 返回 PaperDaily
大模型与智能体
235B大模型也能三元化?CAT-Q仅用512样本压到1.58比特
大模型量化里最难啃的骨头之一,就是把权重压到三元还别把精度摔碎。CAT-Q这篇很有意思:不用百亿token重训,靠后训练量化就能把1.7B到235B模型压到1.58比特,且对QAT三元方法也不怵,值得认真看看。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
大模型量化里最难啃的骨头之一,就是把权重压到三元还别把精度摔碎。CAT-Q这篇很有意思:不用百亿token重训,靠后训练量化就能把1.7B到235B模型压到1.58比特,且对QAT三元方法也不怵,值得认真看看。
原论文信息如下:
大模型量化:从“千亿预算”到“千元成本”的革命性突破
大模型一旦长大,显存、算力、能耗就一起跟着“发福”。而量化的思路很朴素:把参数从高精度压到更低精度,尽量少丢信息,尽量多省资源。CAT-Q 盯上的不是常见的 8 比特、4 比特,而是更狠的 1.58 比特三元量化,也就是把权重压成 {1, 0, -1} 这三种状态。名字听着像“数学题里最小公倍数”,本质上却是把模型从“精装大平层”直接搬进“极简公寓”。
传统三元量化最尴尬的地方在于:一旦权重只剩三种取值,信息损失就会像漏水一样明显。以前很多方法只好祭出 QAT,即 Quantization-Aware Training,量化感知训练。它的套路是:训练阶段就模拟量化,让模型慢慢适应低比特世界。好处是效果通常更稳,坏处也很直白——训练 token 数动不动就是百亿、千亿级,算力账单看了都想报警。
CAT-Q 的野心就在这里:不重新“养”一个三元模型,而是直接对预训练大模型做 后训练量化(PTQ,Post-Training Quantization,后训练量化)。也就是说,只拿一小撮校准样本,给现成模型做“瘦身手术”。这就像不是重新培养一个运动员,而是请现役选手去做一次科学减脂:目标不是练出新肌肉,而是别把原来的爆发力给减没了。😏
这篇论文最有意思的地方,不是单纯地把精度压低,而是把“压低”这件事做得更像工程,而不是玄学。它要回答的问题很现实:三元量化为什么难?难在权重分布一变就容易失真,难在离散化过程不可导,优化起来像在摸黑走钢丝。CAT-Q 不是上来就硬怼,而是先想办法让权重“更好量化”,再想办法让量化“更好优化”。
硬件友好的1.58比特世界:CAT-Q如何保持“加法/减法”优势
三元量化之所以诱人,除了省显存,还有一个很朴素的理由:它保留了加法和减法的硬件友好性。和浮点乘法相比,整数加减通常更省能耗、更容易并行,也更适合做高吞吐推理。三元权重里还有一个“0”状态,这意味着不少位置可以直接跳过,稀疏性也能顺带蹭一点福利。
论文里提到的 1.58 比特,并不是随口起的花名,而是三元编码的经典表达方式。因为三种状态对应的信息量接近 log2(3),约等于 1.58 比特。换句话说,模型参数像被压缩成“只有三档的调音台”:高、中、低,别再指望它像 16 比特那样精细,但它至少还能唱歌,不至于直接跑调。
问题在于,三元量化的“硬件友好”不等于“优化友好”。如果直接把高精度权重硬切成 {1, 0, -1},很多细节会被一刀切掉。尤其对大语言模型来说,某些层对误差极其敏感,权重分布稍微歪一点,最后的任务表现就会像被人偷偷拔了网线。
这也是 CAT-Q 的第一层思路:先让权重分布更适合三元化,再谈真正的离散化。它没有试图发明什么“黑科技硬件指令”,而是从优化侧下手,让量化结果尽量保留原模型的统计特征。这个思路很工程,也很聪明:既然硬件喜欢三元,那就别跟硬件较劲,先把模型驯服了再说。
“可学习调制”+“软化二值化”:以简驭繁的后训练量化术
CAT-Q 的两个核心组件分别是 LM 和 ST。LM 是 Learnable Modulation,可学习调制;ST 是 Softened Ternarization,软化三元化。别被名字吓到,拆开看其实很接地气:LM 负责“把权重摆得更顺眼”,ST 负责“别一上来就把梯子抽走”。
LM 的直觉很简单。预训练权重里通常有均值、幅度、阈值这些统计量,直接三元化时,少数离群点会把整体分布带偏。CAT-Q 引入三个可学习因子,分别调整均值、幅度和阈值,让权重分布先做一次“温和整形”。论文里把这个过程称为“调制”,本质上就是:先把权重变得更像能被三元表示的样子,再去离散化。
这里还有个关键点:论文采用的是“解耦式学习”,即让调制后的权重去学习阈值和三元权重,但重建目标仍然保持硬件友好的形式,不额外引入复杂的部署负担。这个设计挺像修车:不是把发动机换成火箭引擎,而是先把火花塞和油路调顺,最后车还是那台车,跑起来却更稳。
ST 则是在优化路径上动脑筋。因为三元化本身是离散操作,不可导,直接优化非常别扭。CAT-Q 没有硬着头皮一条路走到黑,而是设计了一个 平滑过渡函数:先从接近恒等映射开始,随着训练推进,逐渐变得越来越“像三元化”,最后再切到硬三元。这样做的好处是,模型不会在训练早期就被粗暴离散化吓到,梯度也更容易稳定下来。
如果把 LM 比作“把衣服裁剪得更合身”,那 ST 就像“试穿时先拉拉链、再扣扣子、最后才正式出门”。这个两阶段策略的妙处在于,它不是单纯追求某个瞬间的最优离散点,而是让优化过程本身更容易走到那个点。
为了进一步降低重建误差,CAT-Q 还不是只量一层,而是采用 滑动层量化。这意味着相邻层会一起参与重建,邻居之间不再“各扫门前雪”。这招的逻辑也很朴素:大模型的层与层之间并不是孤岛,单层量化容易把局部误差放大,滑窗一起看,往往更容易把整体输出拉回正轨。
这部分如果总结成一句话,就是:LM 负责“对齐分布”,ST 负责“稳定收敛”,滑窗重建负责“照顾上下文”。三者合起来,才让后训练三元量化从“理论上能做”变成“工程上真能跑”。
实验验证:仅用512个样本,就能打败“百亿token”训练的模型
这篇论文最抓眼球的部分,还是实验。CAT-Q 只用 512 个校准样本,每个样本长度 2048 token,整体大约 100 万 token,就能把 1.7B 到 8B 的模型压成三元模型,而且在不少设置下还能超过一些用 100B token 训练出来的 QAT 三元模型。这个对比很扎心:别人是“拿粮食堆出来”的,CAT-Q 是“拿调参技巧抠出来”的。
从表1能读出的第一层信息是:模型越大,量化带来的性能下降通常越小。尤其像 70B 级别模型,三元化后的跌幅明显比小模型温和,这符合“大模型冗余更高”的经验判断。换句话说,大模型像肌肉男,少吃一点还能撑住;小模型本来就瘦,再减就容易虚。
更有意思的是,CAT-Q 不只在 W1.58A16 下能跑,在 W1.58A8 下也能工作。A8 表示激活用 8 比特,A16 表示激活用 16 比特。也就是说,CAT-Q 不仅在权重端省得狠,激活端也能继续压缩,给部署留出更多空间。对于真正关心推理成本的人来说,这比“只在论文里好看”要实用得多。
如果把这些结果连起来看,CAT-Q 的意义就很清楚了:它把三元量化从“必须依赖重训练”这条老路上拽了回来,证明后训练也能做得很强。尤其在中小模型上,它已经不是“能用就行”,而是能和一些重训练方法正面掰手腕。这就像本来以为只能靠长期集训的项目,突然发现临场战术也能打出高水平,确实有点东西。🤨
泛化到235B参数:后训练量化的“无限”可能
真正让这篇论文站稳脚跟的,不只是小模型上的好成绩,而是它敢把方法往更大的模型上推。作者报告说,CAT-Q 可以把 14B 到 235B 参数 的模型量化成三元模型,并且在 8 张 A100-80GB GPU 上只需要大约 8 到 60 小时。这个数字很关键,因为它说明 CAT-Q 不是“实验室玩具”,而是至少具备了向超大模型扩展的工程潜力。
不过,论文也没有假装“所有大模型都毫无代价地完美三元化”。实验里能看到,MoE 模型通常比同规模稠密模型更敏感,性能掉得更明显。这很合理,因为 MoE(Mixture of Experts,混合专家模型)只激活部分专家,参数利用方式更稀疏,量化误差更可能直接打到实际被激活的那一小撮路径上。简单说,稠密模型像整班同学一起答题,MoE 像抽签派代表上场,代表一旦被量化“坑”了,影响就更直接。
这类结果的价值在于,它回答了一个很现实的问题:后训练三元量化能不能从“能跑”走向“可扩展”。CAT-Q 的答案是,至少在论文展示的模型范围内,答案偏乐观。虽然还不能说它已经彻底解决所有超大模型的量化难题,但它起码把门踹开了一条缝,而且缝还不小。
未来展望:1.58比特大模型的星辰大海,龙迷三问,龙哥点评,参考文献
CAT-Q 这类方法的意义,不只是把模型压小一点,而是把“高精度训练、低精度部署”之间的鸿沟再往前推了一步。对实际应用来说,这意味着很多原本被算力卡住的场景,可能开始有机会用更低成本跑起来,比如边缘设备上的轻量推理、私有化部署、或者需要大量并发的服务端推理。
不过,后训练三元量化要真走向大规模落地,还是有几个现实问题绕不开。第一,校准数据虽然少,但质量不能太随意,样本分布如果和目标任务差得太远,量化收益可能打折。第二,MoE 和超大模型的稳定性还要继续摸索,尤其是不同层、不同专家之间的敏感度差异。第三,三元量化虽然省算力,但对硬件和推理框架的支持程度仍然决定了它能不能真正“跑得快”。
龙迷三问
这篇论文到底解决了什么问题?它解决的是“大模型三元量化太贵、太难训”的问题。CAT-Q 用后训练量化替代大规模重训练,只靠少量校准样本,就能把预训练大模型压到 1.58 比特,同时尽量保住性能。
LM 和 ST 分别是什么意思?LM 是 Learnable Modulation,可学习调制,负责让权重分布和三元阈值更适合量化;ST 是 Softened Ternarization,软化三元化,负责让离散化过程先平滑过渡、再硬切收尾,降低优化难度。
为什么只用 512 个样本也能做出不错效果?因为 CAT-Q 不是靠数据量硬堆,而是靠更合理的优化设计。LM 先修正分布,ST 再稳定收敛,滑动层重建进一步利用层间依赖,所以少量校准数据也能发挥较大作用。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 不是首次提出三元量化,但把后训练量化做成可扩展、可优化、还能对比重训练方法的方案,这个组合拳挺新。
实验合理度:★★★★☆ 对比了多种 QAT 与 PTQ 方法,覆盖模型规模也比较广;不过超大模型的细节还可以再补得更充分一些。
学术研究价值:★★★★☆ 它把“低比特大模型”从训练范式上往前推了一步,对后续量化研究很有启发。
稳定性:★★★☆☆ 论文里已经比硬三元化稳不少,但三元量化本身仍然偏脆,尤其面对不同架构和 MoE 模型时。
适应性以及泛化能力:★★★★☆ 覆盖 1.7B 到 235B,Dense 和 MoE 都试了,泛化面算是比较宽。
硬件需求及成本:★★★★☆ 相比重训练省得多,但校准和重建仍需 GPU 资源;优点是成本已经从“天价”降到“可谈”。
复现难度:★★★★☆ 代码已开源,整体可复现性不错;但超大模型量化对环境和显存仍有要求。
产品化成熟度:★★★☆☆ 在部分模型和任务上已经很有产品潜力,但要真正大规模上线,还需要更稳定的硬件支持和更细的场景验证。
可能的问题:三元量化再强也还是激进压缩,若下游任务分布变化大,性能波动可能会明显;MoE 场景也还有继续打磨空间。
主要参考文献
Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Anbang Yao. CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs. arXiv:2606.26872v1, 2026.
项目与代码:https://github.com/IntelChina-AI/BitTern
原文链接:https://arxiv.org/pdf/2606.26872v1.pdf
1.58比特不是玄学,是真能落地的压缩手艺。想继续挖大模型量化、推理加速、开源复现这些硬核干货,欢迎加入龙哥读论文粉丝群,一起把“算得动、跑得快、还不太掉点”研究明白~

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称,方便更快通过并拉你进对应方向的小群。
图像处理、大模型、自动驾驶、机器人、AI医疗、AI金融,龙哥群里都有人,来一起把论文聊透~

