← 返回 PaperDaily 大模型与智能体

235B大模型也能三元化?CAT-Q仅用512样本压到1.58比特

大模型量化里最难啃的骨头之一,就是把权重压到三元还别把精度摔碎。CAT-Q这篇很有意思:不用百亿token重训,靠后训练量化就能把1.7B到235B模型压到1.58比特,且对QAT三元方法也不怵,值得认真看看。

235B大模型也能三元化?CAT-Q仅用512样本压到1.58比特
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
大模型量化里最难啃的骨头之一,就是把权重压到三元还别把精度摔碎。CAT-Q这篇很有意思:不用百亿token重训,靠后训练量化就能把1.7B到235B模型压到1.58比特,且对QAT三元方法也不怵,值得认真看看。


原论文信息如下:
论文标题:
CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs
发表日期:
2026年06月
发表单位:
IntelChina-AI
原文链接:
https://arxiv.org/pdf/2606.26872v1.pdf
开源代码链接:
https://github.com/IntelChina-AI/BitTern
项目链接:
https://github.com/IntelChina-AI/BitTern

大模型量化:从“千亿预算”到“千元成本”的革命性突破

大模型一旦长大,显存、算力、能耗就一起跟着“发福”。而量化的思路很朴素:把参数从高精度压到更低精度,尽量少丢信息,尽量多省资源。CAT-Q 盯上的不是常见的 8 比特、4 比特,而是更狠的 1.58 比特三元量化,也就是把权重压成 {1, 0, -1} 这三种状态。名字听着像“数学题里最小公倍数”,本质上却是把模型从“精装大平层”直接搬进“极简公寓”。
传统三元量化最尴尬的地方在于:一旦权重只剩三种取值,信息损失就会像漏水一样明显。以前很多方法只好祭出 QAT,即 Quantization-Aware Training,量化感知训练。它的套路是:训练阶段就模拟量化,让模型慢慢适应低比特世界。好处是效果通常更稳,坏处也很直白——训练 token 数动不动就是百亿、千亿级,算力账单看了都想报警。
CAT-Q 的野心就在这里:不重新“养”一个三元模型,而是直接对预训练大模型做 后训练量化(PTQ,Post-Training Quantization,后训练量化)。也就是说,只拿一小撮校准样本,给现成模型做“瘦身手术”。这就像不是重新培养一个运动员,而是请现役选手去做一次科学减脂:目标不是练出新肌肉,而是别把原来的爆发力给减没了。😏
图1:CAT-Q 的整体学习流程与三元模型部署方式
图1:CAT-Q 的整体学习流程与三元模型部署方式。先在校准数据上做权重重建,再把三元权重部署到硬件友好的推理流程里,核心目标就是“少训练、少折腾、别掉太多分”。
这篇论文最有意思的地方,不是单纯地把精度压低,而是把“压低”这件事做得更像工程,而不是玄学。它要回答的问题很现实:三元量化为什么难?难在权重分布一变就容易失真,难在离散化过程不可导,优化起来像在摸黑走钢丝。CAT-Q 不是上来就硬怼,而是先想办法让权重“更好量化”,再想办法让量化“更好优化”。

硬件友好的1.58比特世界:CAT-Q如何保持“加法/减法”优势

三元量化之所以诱人,除了省显存,还有一个很朴素的理由:它保留了加法和减法的硬件友好性。和浮点乘法相比,整数加减通常更省能耗、更容易并行,也更适合做高吞吐推理。三元权重里还有一个“0”状态,这意味着不少位置可以直接跳过,稀疏性也能顺带蹭一点福利。
论文里提到的 1.58 比特,并不是随口起的花名,而是三元编码的经典表达方式。因为三种状态对应的信息量接近 log2(3),约等于 1.58 比特。换句话说,模型参数像被压缩成“只有三档的调音台”:高、中、低,别再指望它像 16 比特那样精细,但它至少还能唱歌,不至于直接跑调。
问题在于,三元量化的“硬件友好”不等于“优化友好”。如果直接把高精度权重硬切成 {1, 0, -1},很多细节会被一刀切掉。尤其对大语言模型来说,某些层对误差极其敏感,权重分布稍微歪一点,最后的任务表现就会像被人偷偷拔了网线。
图2:静态估计、直接学习与可学习调制的重建误差对比
图2:静态估计、直接学习与可学习调制的重建误差对比。可以看到,单纯把缩放因子和阈值“设死”或“直接学”,都不如 CAT-Q 的可学习调制来得稳,说明关键不是更用力,而是更会调。
这也是 CAT-Q 的第一层思路:先让权重分布更适合三元化,再谈真正的离散化。它没有试图发明什么“黑科技硬件指令”,而是从优化侧下手,让量化结果尽量保留原模型的统计特征。这个思路很工程,也很聪明:既然硬件喜欢三元,那就别跟硬件较劲,先把模型驯服了再说。

“可学习调制”+“软化二值化”:以简驭繁的后训练量化术

CAT-Q 的两个核心组件分别是 LMST。LM 是 Learnable Modulation,可学习调制;ST 是 Softened Ternarization,软化三元化。别被名字吓到,拆开看其实很接地气:LM 负责“把权重摆得更顺眼”,ST 负责“别一上来就把梯子抽走”。
LM 的直觉很简单。预训练权重里通常有均值、幅度、阈值这些统计量,直接三元化时,少数离群点会把整体分布带偏。CAT-Q 引入三个可学习因子,分别调整均值、幅度和阈值,让权重分布先做一次“温和整形”。论文里把这个过程称为“调制”,本质上就是:先把权重变得更像能被三元表示的样子,再去离散化。
这里还有个关键点:论文采用的是“解耦式学习”,即让调制后的权重去学习阈值和三元权重,但重建目标仍然保持硬件友好的形式,不额外引入复杂的部署负担。这个设计挺像修车:不是把发动机换成火箭引擎,而是先把火花塞和油路调顺,最后车还是那台车,跑起来却更稳。
图3:软化三元化的两阶段过渡过程
图3:软化三元化的两阶段过渡过程。第一阶段先用可导的连续映射慢慢逼近三元输出,第二阶段再切到硬三元化收尾,避免一上来就“硬切”导致优化崩掉。
ST 则是在优化路径上动脑筋。因为三元化本身是离散操作,不可导,直接优化非常别扭。CAT-Q 没有硬着头皮一条路走到黑,而是设计了一个 平滑过渡函数:先从接近恒等映射开始,随着训练推进,逐渐变得越来越“像三元化”,最后再切到硬三元。这样做的好处是,模型不会在训练早期就被粗暴离散化吓到,梯度也更容易稳定下来。
如果把 LM 比作“把衣服裁剪得更合身”,那 ST 就像“试穿时先拉拉链、再扣扣子、最后才正式出门”。这个两阶段策略的妙处在于,它不是单纯追求某个瞬间的最优离散点,而是让优化过程本身更容易走到那个点。
图B:加入软化三元化前后的校准损失曲线对比
图B:加入软化三元化前后的校准损失曲线对比。可以看到,虽然优化轨迹不一样,但引入 ST 后最终能收敛到更低的损失,这说明“先软后硬”的路线确实比“上来就硬掰”更靠谱。
为了进一步降低重建误差,CAT-Q 还不是只量一层,而是采用 滑动层量化。这意味着相邻层会一起参与重建,邻居之间不再“各扫门前雪”。这招的逻辑也很朴素:大模型的层与层之间并不是孤岛,单层量化容易把局部误差放大,滑窗一起看,往往更容易把整体输出拉回正轨。
这部分如果总结成一句话,就是:LM 负责“对齐分布”,ST 负责“稳定收敛”,滑窗重建负责“照顾上下文”。三者合起来,才让后训练三元量化从“理论上能做”变成“工程上真能跑”。

实验验证:仅用512个样本,就能打败“百亿token”训练的模型

这篇论文最抓眼球的部分,还是实验。CAT-Q 只用 512 个校准样本,每个样本长度 2048 token,整体大约 100 万 token,就能把 1.7B 到 8B 的模型压成三元模型,而且在不少设置下还能超过一些用 100B token 训练出来的 QAT 三元模型。这个对比很扎心:别人是“拿粮食堆出来”的,CAT-Q 是“拿调参技巧抠出来”的。
表1:CAT-Q 在多种预训练大模型上的三元量化结果
表1:CAT-Q 在多种预训练大模型上的三元量化结果。这里覆盖了 Qwen3、Llama2 和 Ring-flash-2.0 等不同架构与规模,说明这套方法不是“只对某一台机器灵”,而是有一定通用性。
从表1能读出的第一层信息是:模型越大,量化带来的性能下降通常越小。尤其像 70B 级别模型,三元化后的跌幅明显比小模型温和,这符合“大模型冗余更高”的经验判断。换句话说,大模型像肌肉男,少吃一点还能撑住;小模型本来就瘦,再减就容易虚。
更有意思的是,CAT-Q 不只在 W1.58A16 下能跑,在 W1.58A8 下也能工作。A8 表示激活用 8 比特,A16 表示激活用 16 比特。也就是说,CAT-Q 不仅在权重端省得狠,激活端也能继续压缩,给部署留出更多空间。对于真正关心推理成本的人来说,这比“只在论文里好看”要实用得多。
表2:CAT-Q 与 QAT 三元方法在 W1.58A16 下的对比
表2:CAT-Q 与 QAT 三元方法在 W1.58A16 下的对比。这里最醒目的不是某个单项分数,而是训练成本:CAT-Q 用 1M token,QAT 方法动辄 10B、100B 甚至 300B token。这个差距不是“省一点”,而是“省到离谱”。
表3:CAT-Q 与 QAT 三元方法在 W1.58A8 下的对比
表3:CAT-Q 与 QAT 三元方法在 W1.58A8 下的对比。即便激活也压到 8 比特,CAT-Q 仍然能保持有竞争力的结果,说明它不是只会“纸面压缩”,而是能在更实际的部署设置里继续站住脚。
如果把这些结果连起来看,CAT-Q 的意义就很清楚了:它把三元量化从“必须依赖重训练”这条老路上拽了回来,证明后训练也能做得很强。尤其在中小模型上,它已经不是“能用就行”,而是能和一些重训练方法正面掰手腕。这就像本来以为只能靠长期集训的项目,突然发现临场战术也能打出高水平,确实有点东西。🤨

泛化到235B参数:后训练量化的“无限”可能

真正让这篇论文站稳脚跟的,不只是小模型上的好成绩,而是它敢把方法往更大的模型上推。作者报告说,CAT-Q 可以把 14B 到 235B 参数 的模型量化成三元模型,并且在 8 张 A100-80GB GPU 上只需要大约 8 到 60 小时。这个数字很关键,因为它说明 CAT-Q 不是“实验室玩具”,而是至少具备了向超大模型扩展的工程潜力。
图4:CAT-Q 在更大模型上的扩展性与实验现象
图4:CAT-Q 在更大模型上的扩展性与实验现象。论文强调了对 14B 到 235B 参数模型的量化能力,说明这套后训练方案并不局限于小模型试水。
不过,论文也没有假装“所有大模型都毫无代价地完美三元化”。实验里能看到,MoE 模型通常比同规模稠密模型更敏感,性能掉得更明显。这很合理,因为 MoE(Mixture of Experts,混合专家模型)只激活部分专家,参数利用方式更稀疏,量化误差更可能直接打到实际被激活的那一小撮路径上。简单说,稠密模型像整班同学一起答题,MoE 像抽签派代表上场,代表一旦被量化“坑”了,影响就更直接。
表9:LM 中是否保留均值项的消融对比
表9:LM 中是否保留均值项的消融对比。这个表说明,论文里的解耦设计不是随便拍脑袋,保留默认设定往往更稳,说明均值、幅度和阈值的协同关系确实值得认真处理。
表5:LM 与 ST 组件的消融实验
表5:LM 与 ST 组件的消融实验。消融结果通常最诚实:少了谁,性能就掉谁的账。这里能看出 LM 和 ST 都不是摆设,二者缺一都会让结果变差。
这类结果的价值在于,它回答了一个很现实的问题:后训练三元量化能不能从“能跑”走向“可扩展”。CAT-Q 的答案是,至少在论文展示的模型范围内,答案偏乐观。虽然还不能说它已经彻底解决所有超大模型的量化难题,但它起码把门踹开了一条缝,而且缝还不小。

未来展望:1.58比特大模型的星辰大海,龙迷三问,龙哥点评,参考文献

CAT-Q 这类方法的意义,不只是把模型压小一点,而是把“高精度训练、低精度部署”之间的鸿沟再往前推了一步。对实际应用来说,这意味着很多原本被算力卡住的场景,可能开始有机会用更低成本跑起来,比如边缘设备上的轻量推理、私有化部署、或者需要大量并发的服务端推理。
不过,后训练三元量化要真走向大规模落地,还是有几个现实问题绕不开。第一,校准数据虽然少,但质量不能太随意,样本分布如果和目标任务差得太远,量化收益可能打折。第二,MoE 和超大模型的稳定性还要继续摸索,尤其是不同层、不同专家之间的敏感度差异。第三,三元量化虽然省算力,但对硬件和推理框架的支持程度仍然决定了它能不能真正“跑得快”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“大模型三元量化太贵、太难训”的问题。CAT-Q 用后训练量化替代大规模重训练,只靠少量校准样本,就能把预训练大模型压到 1.58 比特,同时尽量保住性能。

LM 和 ST 分别是什么意思?LM 是 Learnable Modulation,可学习调制,负责让权重分布和三元阈值更适合量化;ST 是 Softened Ternarization,软化三元化,负责让离散化过程先平滑过渡、再硬切收尾,降低优化难度。

为什么只用 512 个样本也能做出不错效果?因为 CAT-Q 不是靠数据量硬堆,而是靠更合理的优化设计。LM 先修正分布,ST 再稳定收敛,滑动层重建进一步利用层间依赖,所以少量校准数据也能发挥较大作用。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是首次提出三元量化,但把后训练量化做成可扩展、可优化、还能对比重训练方法的方案,这个组合拳挺新。

实验合理度:★★★★☆ 对比了多种 QAT 与 PTQ 方法,覆盖模型规模也比较广;不过超大模型的细节还可以再补得更充分一些。

学术研究价值:★★★★☆ 它把“低比特大模型”从训练范式上往前推了一步,对后续量化研究很有启发。

稳定性:★★★☆☆ 论文里已经比硬三元化稳不少,但三元量化本身仍然偏脆,尤其面对不同架构和 MoE 模型时。

适应性以及泛化能力:★★★★☆ 覆盖 1.7B 到 235B,Dense 和 MoE 都试了,泛化面算是比较宽。

硬件需求及成本:★★★★☆ 相比重训练省得多,但校准和重建仍需 GPU 资源;优点是成本已经从“天价”降到“可谈”。

复现难度:★★★★☆ 代码已开源,整体可复现性不错;但超大模型量化对环境和显存仍有要求。

产品化成熟度:★★★☆☆ 在部分模型和任务上已经很有产品潜力,但要真正大规模上线,还需要更稳定的硬件支持和更细的场景验证。

可能的问题:三元量化再强也还是激进压缩,若下游任务分布变化大,性能波动可能会明显;MoE 场景也还有继续打磨空间。


主要参考文献

Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Anbang Yao. CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs. arXiv:2606.26872v1, 2026.
项目与代码:https://github.com/IntelChina-AI/BitTern
原文链接:https://arxiv.org/pdf/2606.26872v1.pdf

1.58比特不是玄学,是真能落地的压缩手艺。想继续挖大模型量化、推理加速、开源复现这些硬核干货,欢迎加入龙哥读论文粉丝群,一起把“算得动、跑得快、还不太掉点”研究明白~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,方便更快通过并拉你进对应方向的小群。
图像处理、大模型、自动驾驶、机器人、AI医疗、AI金融,龙哥群里都有人,来一起把论文聊透~
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。