← 返回 PaperDaily
大模型与智能体
英特尔CAT-Q来了:512样本把大模型压成1.58位
CAT-Q把“训练到位才能三元化”的老路,改成了更省钱的后训练方案。512个校准样本,就想把1.58位大模型做得又稳又准,思路很硬。
龙哥读论文
发布于 2026-08-14 21:47:10
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: CAT-Q把“训练到位才能三元化”的老路,改成了更省钱的后训练方案。512个校准样本,就想把1.58位大模型做得又稳又准,思路很硬。
原论文信息如下:
引言
大模型一旦开始“瘦身”,最怕的不是变小,而是变傻。CAT-Q盯上的就是这个痛点:不用昂贵的量化感知训练,只靠少量校准样本,就把预训练大模型压到1.58位,还尽量把性能稳住。
这篇论文最有意思的地方在于,它没有继续在“训练得更久、喂得更多”这条路上硬扛,而是从优化角度重新拆解三元量化的两大难点:权重分布对不齐,以及三元化过程不好收敛。前者靠可学习调制,后者靠软三元化,组合起来就有了一个更像工程方案的答案。
方法概述
CAT-Q的整体流程可以先记成一句话:先把权重“捋顺”,再把三元化“放软”,最后用滑动窗口把邻近层一起照顾到。这样做的目标很朴素——别让某一层单独硬扛,尽量让量化误差在层与层之间被摊平。
第一块是可学习调制 。它不满足于直接拿原始权重做三元化,而是先对权重分布做一个可学习的线性变换,同时把缩放因子和阈值也一起学掉。说白了,就是先给权重“理个发”,让它们更适合被剪成{-1,0,1},而不是一刀下去满地碎片。
第二块是软三元化 。传统做法一上来就硬三元化,梯度像踩在西瓜皮上,滑得很。CAT-Q先用一个可微的过渡函数慢慢逼近三元输出,等模型适应得差不多了,再切到硬三元化收尾。这个“两段式接力”是它稳定收敛的关键。
更有意思的是,它不是只盯着单层做重构,而是借用了滑动层的思路,把相邻层打包一起优化。这样一来,层与层之间的依赖关系也能被纳入考虑,量化误差不容易在某一层突然爆炸。
数据准备及实验设计
实验设置很直接:校准数据来自C4,默认只取512个样本,每个样本2048个token。模型覆盖Qwen3、Llama2和Ring-flash-2.0等多个家族,参数规模从17亿一路拉到2350亿,既有稠密模型,也有MoE模型,目的就是看这套方法到底能不能“通吃”。
评测上,论文主要用五个常识推理基准:PIQA、ARC-Easy、ARC-Challenge、HellaSwag 和 Winogrande。这个组合比较典型,既能看模型有没有“脑子”,也能看量化后是不是把常识理解一起打包送走了。
实验结果
先看最核心的结论:CAT-Q在1.7B到235B参数的大模型上都能做三元化,而且只用512个校准样本,就能把不少模型压到1.58位还保持可用精度。更夸张的是,它在训练代价上直接把“百B级token训练”变成“百万级token校准”,这个省法很有互联网精神。
在和2比特、双1比特等更常见的超低比特PTQ方法比较时,CAT-Q虽然权重位宽更低,但平均精度依然更有竞争力。换句话说,它不是“靠更宽松的条件赢”,而是在更苛刻的条件下还把成绩单交得不错。
实验结果分析
CAT-Q的优势并不只是“参数压小了”,而是它把三元量化里最麻烦的两个问题拆开处理了:一边用可学习调制缓解分布错位,一边用软三元化解决非可微优化。两个模块单独看都不算花活,放一起就很像一套完整的工程解法。
消融实验也支持这个判断:LM和ST是互补关系,不是“有一个就行”的替代关系。特别是软三元化的加入,让训练曲线更平滑、最终损失更低,这说明在极低比特场景里,优化过程本身就决定了结果上限。
不过,论文自己也很诚实地指出了边界:在数学推理和代码任务上,直接套用CAT-Q会掉得比较明显,说明常识类基准上的成功,不代表复杂推理也能顺手拿下。这个问题不算小,毕竟大模型真正值钱的地方,往往就在那些“不太常识”的题上。
总结与未来展望
CAT-Q给出的答案很明确:三元量化不一定非得靠大规模QAT硬堆,后训练阶段也能做出足够强的结果。它真正有价值的地方,是把“能压缩”这件事,和“还能用”这件事尽量拉到了一起。
接下来更值得期待的,可能不是继续把位宽往下拧,而是把这套思路搬到更难的推理任务、更复杂的部署内核,以及更通用的模型家族上。毕竟,真正的好量化,不只是把模型变瘦,而是让它瘦得还像个能干活的模型。
龙迷三问
CAT-Q为什么比传统三元量化更省事? 因为它不再依赖大规模量化感知训练,而是用少量校准样本做后训练量化,还把权重分布调整和三元化收敛问题拆开处理,工程上更轻。
它为什么要分成可学习调制和软三元化两步? 前者负责让权重更适合被三元化,后者负责让优化过程别一上来就“硬碰硬”。一个管分布,一个管收敛,分工很明确。
这类方法最需要注意什么? 别只看常识题上的成绩。论文已经提示了,在数学和代码等更复杂任务上,三元化后的性能还会明显掉,说明后续还得继续补强校准数据和优化策略。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 把后训练量化做成1.58位三元模型,还同时处理分布对齐和优化收敛,这个组合拳挺完整。
实验合理度:★★★★☆ 模型规模、架构类型、基准任务都覆盖得比较广,比较能说明方法不是只在单点上好看。
学术研究价值:★★★★☆ 它给三元量化提供了一条更便宜的路线,对后训练压缩研究有现实意义。
稳定性:★★★★☆ 软三元化和滑动层设计让训练过程更稳,消融也能支撑这一点。
适应性以及泛化能力:★★★★☆ 从1.7B到235B、从稠密到MoE都能跑,泛化面确实不窄。
硬件需求及成本:★★★★★ 只用512个校准样本,训练代价远低于QAT路线,成本优势非常突出。
复现难度:★★★☆☆ 思路不算玄学,但涉及滑动窗口、量化细节和部署格式,复现还是要花点心思。
产品化成熟度:★★★★☆ 已经给出llama.cpp部署验证,离工程可用又近了一步。
可能的问题: 在复杂推理、数学和代码任务上掉点明显,说明这套方法还没到“全场景通杀”的程度。
主要参考文献
Li, F., Liu, B., Wang, X., Zhang, B., and Yan, J. Ternary Weight Networks. arXiv preprint arXiv:1605.04711, 2016.
Zhu, C., Han, S., Mao, H., and Dally, W. J. Trained Ternary Quantization. In ICLR, 2017.
Ma, S., Wang, H., Ma, L., Wang, L., Wang, W., Huang, S., Dong, L., Wang, R., Xue, J., and Wei, F. The era of 1-bit LLMs: All large language models are in 1.58 bits. arXiv preprint arXiv:2402.17764, 2024.
Wang, H., Ma, S., and Wei, F. BitNet v2: Native 4-bit activations with Hadamard transformation for 1-bit LLMs. arXiv preprint arXiv:2504.18415, 2025.
Kaushal, A., Vaidhya, T., Mondal, A. K., Pandey, T., Bhagat, A., and Rish, I. Spectra: Surprising effectiveness of pretraining ternary language models at scale. In ICLR, 2025.
Huang, H., Wu, D., Cen, R., Yu, G., Li, Z., Liu, K., Zhu, J., Chen, P., Liu, X., and Wu, D. Tequila: Trapping-free ternary quantization for large language models. ICLR, 2026.
Wang, S., Li, C., Kang, Y., Fan, J., Ou, Z., and Yao, A. SliderQuant: Accurate post-training quantization for LLMs. In ICLR, 2026.
后训练量化挑战:分布错位与非可微优化
三元量化,简单说就是把大模型的权重尽量压到 {-1, 0, 1} 这三个值里。听起来像“把复杂问题一刀切”,但真下刀的时候,模型往往会当场表演一个“精度自由落体”。CAT-Q要解决的,就是这个极限压缩场景里的老大难:既要瘦身,又不能把脑子也一起瘦没了。
论文把问题拆成了两层。第一层是分布错位 :预训练时的高精度权重分布,和三元化后的离散分布差得有点远,直接硬转过去,信息损失就很大。第二层更麻烦,属于优化界的“拧巴现场”——三元化是非可微的,梯度不好传,直接硬量化很容易在校准阶段卡住,像人在门口来回踱步,就是进不去。
CAT-Q的设计很像“先安抚,再动刀”。它没有一上来就把权重往三元桶里塞,而是先做可学习调制 ,再做软三元化 。前者负责让权重分布更适合被压缩,后者负责让三元化过程别那么“硬核暴力”。
图2已经把这个差异画得很清楚:静态近似像拿老黄历算命,直接学习虽然能动起来,但还是容易偏;可学习调制的重构误差更低,说明它不是单纯“把参数设成可学”这么简单,而是真正改到了分布层面。这里的关键不是参数多了,而是参数学得更对路了。
这一步的核心意义在于:把不可微问题变成“先可微、后硬化”的两段式过程 。前半段让梯度能顺畅传递,后半段再把结果收紧到真正的三元权重。也就是说,CAT-Q不是在和非可微性硬碰硬,而是绕了个弯,把优化难题拆成了两步走。
如果把CAT-Q的流程压缩成一句话,那就是:先通过可学习调制降低分布错位,再借助软三元化保证收敛,最后用滑动窗口把层间依赖一起照顾到 。这套组合拳没有花里胡哨的噱头,胜在每一拳都打在痛点上。
CAT-Q最吸引人的地方,还是它把“训练成本”这件事压得极低。论文默认只用512个校准样本 ,每个样本2048个token,整体大约就是百万级token量级。对比那些动辄百亿、千亿token训练的三元模型,这差距已经不是“节省一点”,而是直接把预算表撕了一角。
这里的对比对象也很有代表性。BitNet 1.58-bit v1/v2、TriLM、Tequila 这些方法都依赖QAT,训练token往往是百B级甚至更高。CAT-Q在相近模型规模下,只靠少量校准数据就能拿到更有竞争力的结果,等于把“先大规模训练再量化”的路线,改成了“先有预训练模型,再低成本后处理”。
从表2和表3能看出,CAT-Q的优势不只是“省数据”,而是“省数据还不太掉线”。比如在1.7B到8B这类模型上,它用512个校准样本就能达到和强QAT方法相当、甚至更好的常识推理表现。更关键的是,训练token从100B甚至300B压到约1M,节省幅度接近10万倍 。这不是优化,这是把路费从买车票改成走路。
更有意思的是,论文还给出2M校准样本的结果,说明样本继续增多时,性能还能再往上推一点。这意味着CAT-Q不是只靠“少样本幸运值”撑场面,而是确实存在可持续的优化空间。
论文的另一个亮点,是它没有只在“小模型上刷存在感”,而是把范围拉到了1.7B到235B参数 。覆盖稠密模型、MoE模型,还跨了Qwen3、Llama2和Ring-flash-2.0等不同家族。这个范围一大,方法是不是“只会在单一设定里打工”就很容易看出来。
表1显示,随着模型规模变大,量化带来的性能损失通常会缓和一些,尤其是大模型在常识推理任务上的抗压能力更强。比如70B、235B这类体量的模型,量化后依然能维持相当可观的平均分,说明CAT-Q在大规模场景下没有明显失控。对一个三元量化方法来说,这已经很不容易了,毕竟很多方法连十几亿参数都还没站稳,就开始在大模型面前“腿软”。
MoE模型这边则更挑剔一些。由于激活参数更少、路由更敏感,量化后更容易掉点。论文观察到MoE模型比同规模稠密模型更脆弱,这个现象很合理,也说明CAT-Q并不是把所有模型都当成同一种“砖头”来处理,而是实打实地处理了不同架构的差异。
和2比特、双1比特等方法相比,CAT-Q的位宽更低,但结果却并没有掉到“不可用”那一档。表4里能看到,在Llama2-7B和Llama2-70B上,它和AWQ、GPTQ、OmniQuant、SliderQuant等方法放在一起比较,虽然任务和位宽设定不完全一样,但整体上说明了一件事:三元量化不是只能靠训练堆资源,后训练也能做得很像样 。
量化论文如果只停留在“表格上很好看”,通常还差最后一口气。CAT-Q在部署侧也做了验证,论文提到把三元模型放到实际推理框架里测试,观察其内存占用和生成速度表现。这个环节很重要,因为真正落地时,大家不只关心精度,还关心显存会不会爆、吞吐会不会慢到怀疑人生。
从原理上讲,三元权重天然有硬件友好优势。权重只有三种状态,很多乘法可以被更便宜的整数加减替代,至少在某些部署路径里,计算和存储压力都会明显下降。CAT-Q又把这个过程做成了后训练方案,所以它更像是“给现成大模型做轻量改装”,而不是从头造一台新机器。