← 返回 PaperDaily
大模型与智能体
752M模型压到1.58比特:常识还在知识全丢?
模型压缩领域一直有个终极诱惑:既然大模型这么贵,能不能把权重压到极致?三值化(Ternary Quantization)就是这条路上的狂飙选手——把每个权重压缩到只有三个取值{-1, 0, +1},理论上每个权重只需要约。
龙哥读论文
发布于 2026-09-03 00:20:11
阅读 1
查看原文
原论文信息如下:
三值化语言模型:能力分层退化还是通用替代?
模型压缩领域一直有个终极诱惑:既然大模型这么贵,能不能把权重压到极致?三值化(Ternary Quantization)就是这条路上的狂飙选手——把每个权重压缩到只有三个取值{-1, 0, +1},理论上每个权重只需要约1.585比特。要知道,现在主流大模型动辄BF16甚至FP32,1.58比特几乎是信息论极限级别的压缩。
但问题来了:把一个大模型压到这种程度,它还能用吗?是全面崩溃,还是有选择地保留某些能力?这篇论文给出了一个非常有意思的答案:三值化造成的退化不是均匀的,而是分层级的 ——有些能力大幅缩水,有些能力却意外幸存,甚至还能通过微调恢复大部分性能。
这篇名为《Capability-Stratified Degradation in Ternary Language Models》的研究,把Qwen3.5-0.8B(752M参数)通过量化感知训练(QAT,Quantization-Aware Training)转换为三值模型Cloe,然后从能力保持、表征分析、可学习性和部署效率四个维度做了系统性剖析。这个研究来自OneBit AI团队,论文作者为Anirudh Malik、Poojith Devan和M Sparsh Mehra。
从752M参数到1.58比特:Cloe的转换之路
先来认识一下这个研究的主角Cloe。它由Qwen3.5-0.8B转换而来,拥有约752M参数,包含24层Transformer,其中18层为线性注意力层、6层为全注意力层。隐藏维度1024,头维度256,词表大小248,320,采用绑定嵌入和语言模型头。
转换过程使用了量化感知训练(QAT) ,总共投入72.4M tokens。这里有个关键细节值得注意:论文严格验证了转换的“纯度”——所有186个目标线性层都被确认恰好只有3个不同的权重值,实测熵为1.5821比特/权重,非常接近理论极限1.5850比特/权重。这个验证之所以重要,是因为很多号称“三值化”的模型其实在计算图里偷偷保留了全精度权重,Cloe则明确排除了这种“作弊”可能性。论文还做了一个非常有趣的验证:把权重重建后与精确三值网格的偏差控制在约1.8×10⁻⁶的相对尺度,如果设置为λ=0走潜在权重路径,模型直接输出乱码——这证明模型确实依赖三值路径运行,而不是一个披着三值外衣的全精度模型。
三值化的核心数学操作可以用三个公式概括。首先是计算缩放因子s,也就是权重绝对值的均值;然后通过四舍五入和裁剪把权重映射到{-1, 0, +1}网格上;最后通过直通估计器(STE,Straight-Through Estimator)让梯度能够流过这个不可导的量化过程。
这三个公式中,s是均值缩放因子,W是原始权重矩阵,quantize函数表示先除以s、裁剪到[-1,1]区间、再四舍五入最后乘回s的过程。λ控制量化权重的混合比例,推理时设为1。这里有个值得注意的点:论文强调“1.58-bit模型”指的是权重表示本身,而不是整个检查点。由于248,320词的嵌入表仍然是BF16精度,整个检查点在磁盘上大约是6.47比特/参数。这个区分在工业界很重要——宣传“1.58比特”和实际存储占用是两回事。
能力保持的真相:哪些能力幸存,哪些能力消失?
评估一个压缩模型,最怕的就是只看一个总分然后简单判断“好”或“坏”。这篇论文在评估设计上做得相当扎实,先定义了一组评估工具,每个工具回答一个特定的问题。
这里有一个非常有趣的插曲。研究团队最初用标准的答案字母评分方式评估MMLU,结果Cloe只得了22.97%的准确率,看起来是灾难性失败。但检查输出分布时发现了蹊跷:Cloe在14,042道题中有13,852道都回答了“A”,占比高达98.6%!这显然不是能力问题,而是输出通道崩溃——模型只会复读机一样地输出“A”。这个发现暴露了一个重要的评测陷阱:如果模型不区分答案选项地输出,那么任何基于答案字母的评分都是没有意义的。
于是团队改用续写评分(Continuation Scoring) ——直接计算模型对候选答案文本的长度归一化对数概率,而不是让它选字母。同时引入了一个“防假阳性守卫”:只有在同时超过随机水平/多数类基线加两个标准误差,以及平衡准确率超过随机水平加两个标准误差时,才认定模型在该任务上具备真实能力。
在严格的守卫条件下,从29个基准测试中筛选出10个Cloe确实具备区分能力的任务。结果非常有意思:这10个任务上Cloe平均保留了全精度教师模型77.1%的性能。其中RACE(阅读理解)保留89%、PIQA(物理常识)保留88%、CommonsenseQA(常识推理)保留86%。这个结果说明,三值化对常识判断类任务的破坏远小于对知识获取类任务的破坏 。
但另一面,MMLU、MedMCQA这类依赖专家知识的任务就惨不忍睹了。GSM8K(算术推理)只有2.0%,基本可以判定为“不会算术”。再看表6,有些任务上教师模型本身也几乎不工作,比如CB(蕴含判断)教师只有8.9%——这里的保留率数字没有太大参考价值。论文也特别提醒不要把这些边界任务上的“高保留率”误读为三值化无损 。
表征与可学习性:信息丢失的机制解析
行为层面的数字虽然直观,但还不能回答一个更深层的问题:这些丢失的能力,到底是信息真的被删掉了,还是信息还在只是读不出来?这个问题直接决定了三值化模型的可用性。
研究团队使用线性探针(Linear Probe) 来回答这个问题。所谓线性探针,就是训练一个简单的多分类逻辑回归模型,直接去读隐藏层表征里的信息。如果探针能从表征中恢复出正确答案,说明信息还在;如果恢复不出来,说明信息真的丢了。探针在应用于Cloe之前先经过验证:当答案被显式线性编码时能恢复100%准确率,当信号不存在时约等于随机水平。
结果相当震撼:教师模型最后一层表征中能恢复43.76%的MMLU答案,而Cloe只有26.19%——距离25%的随机水平仅一步之遥。这意味着什么?MMLU这类专家型知识信息不是“藏在表征里但读不出来”,而是真的从表征中消失了 。
但有趣的是,这种信息丢失并没有导致表征多样性崩溃。通过计算隐藏状态的有效秩(Effective Rank) ,团队发现Cloe的有效秩为538.9,相对教师只有微小下降;微调后甚至反超教师达到602.1。这说明Cloe的隐藏状态仍然具有丰富的表示方向——只是那些方向的“内容”变了,部分专家知识被抹掉了,但表征的结构多样性并没有崩掉。
这就引出了一个关键区分:表征能力(Representational Capacity)和存储知识(Stored Knowledge)是两个不同的东西 。三值化可以保留丰富的激活几何结构,但不能保留原始预训练权重中编码的细粒度事实信息。
那么问题来了:如果知识已经丢了,模型还能学习新任务吗?这就要看“可学习性”。团队做了匹配微调实验——用完全相同的微调设置同时微调Cloe和教师模型,看Cloe能追回多少。在SST-2情感分类任务上,Cloe从61.9%提升到89.8%,达到匹配微调教师的95.6%。在XSum摘要生成任务上,Cloe的ROUGE-L从11.1提升到19.0,达到教师的79.4%,并且超过LEAD-1基线约2.4倍,说明它确实学到了摘要能力而不是简单复制原文。
这个结论非常有意思。一个专门知识大幅缩水的模型,仍然可以重新组织参数空间去获取新的下游任务能力。如果只看“知识保留率”就否定三值化模型的全部价值,那确实会错失它在“可学习性”上的潜力。
部署效率实测:存储、吞吐与内存的权衡
前面聊完了“能力”,现在来聊“代价”。毕竟三值化的终极目的是为了部署效率。团队在一台固定工作站上(AMD Ryzen 9 7900X CPU + 32GB内存 + NVIDIA RTX 5070 GPU 11.94GiB显存)对打包表示和潜在表示做了详细对比。
结果呈现出一种微妙的权衡关系。磁盘占用是最大亮点:打包表示只有634.65MB,相比潜在表示的1505.60MB缩小了2.37倍,这是最直观的存储收益。但打包路径在运行时内存上反而增加了8.1%(1578.36MiB vs 1460.59MiB),峰值内存增加了7.4%(1708.98MiB vs 1591.22MiB),加载时间慢了1.82倍(2.858秒 vs 1.570秒)。不过在稳态处理速度上,打包路径的prefill吞吐提升了22.3%(1806.76 tok/s vs 1477.03 tok/s),decode吞吐提升了24.2%(7.634 tok/s vs 6.145 tok/s)。
这里需要特别提醒:这篇论文比较的是“打包表示”和“潜在表示”,而不是和传统的FP/BF16全精度实现比。不能直接说是“全面超越全精度”。论文自己也说明,存储、加载和推理测量对应部署的不同阶段,这些指标不需要朝同一个方向变化。工程上要记住:紧凑的模型文件不等于低内存运行时 ——两者是不同的优化目标。
论文中Figure 6描绘了一个很有意思的概念图:三值化模型在经济成本、使用场景和模型能力的交叉点上找到了一个新位置。它不再试图做一个“更小的通用模型”,而是作为特定应用场景的“紧凑可学习基板”。
三值化的应用边界与未来展望
综合来看,这篇论文给出了一个非常清晰的“能力图谱”。团队用表格10总结了哪些能力变化、哪些能力幸存:
严重下降的部分非常明确:专家事实知识(MMLU)、算术推理(GSM8K)、语言建模质量(LAMBADA、WikiText-2困惑度)。幸存的部分同样清晰:常识判断类任务、表征多样性、下游可学习性。论文把这种情况称为“能力分层退化”(Capability-Stratified Degradation) ——这不是一个“全有或全无”的崩溃,而是一个看能力类型的差异化损伤。
从产品化的角度,团队给出了一个务实的应用映射判断。三值化模型特别适合那些任务范围窄、需要极低存储和部署成本的场景——比如边缘设备上的单一意图分类、关键词检测、简单情感分析。但绝不是通用对话助手或知识问答系统的“平替”。需要注意,表14中的映射是“部署假设”而非已证实的结论——团队说得很诚实。
论文也坦诚列出了局限性。QAT预算只有72.4M tokens,远低于正常预训练的数据量,这意味着观察到的退化可能包含“量化信息损失”和“恢复不充分”两部分——不能把所有退化都归咎于三值化本身。论文还提到运行时内存反而增加的问题,说明压缩推理路径还不够成熟。最后,也是非常重要的一个提醒:评估低比特模型必须警惕输出通道退化的陷阱 ——一个只会输出“A”的模型,用传统答案字母评分根本无法体现真实能力。
未来的方向其实已经很清楚了。一方面需要更多QAT预算来区分“量化损失”和“恢复不足”;另一方面,如果能解决嵌入表的存储瓶颈(目前248K词表的嵌入表仍然是BF16),整个模型才能真正逼近1.58比特/参数的极限。此外,针对三值化模型更适合的评估方法(比如续写评分)也值得进一步标准化,否则我们很难横向比较不同低比特模型的真实水平。
龙迷三问
这篇论文到底在解决什么问题? 将Qwen3.5-0.8B用7240万token量化训练成三值模型Cloe,29项基准评测显示能力分层退化:10项任务保持77.1%教师性能,微调后SST-2追平95.6%,磁盘占用缩小2.37倍、吞吐提升约24%。
这篇工作最值得看的点是什么? 在10个可判别任务上平均保留教师模型77.1%的性能;SST-2微调后达到教师模型的95.6%,XSum达到79.4%;打包模型磁盘占用减少2.37倍,prefill和decode吞吐量分别提升22.3%和24.2%
这篇工作的边界或风险在哪里? 优点:(1) 系统性地从多个维度评估三值化模型的能力保持情况,而非仅关注单一指标;(2) 发现了答案字母退化的评估陷阱并提出了解决方案;(3) 通过线性探针和有效秩分析深入探究了信息丢失的机制;(4) 提供了详细的部署效率测量。缺点:(1) QAT预算有限(仅72.4M tokens),无法区分量化固有损失和恢复不足;(2) 缺乏与PTQ方法的直接对比;(3) 微调实验仅报告单一种子结果;(4) 嵌入表仍为BF16,整体压缩率有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
通过量化感知训练(QAT)将预训练的752M参数语言模型转换为三值权重模型,并系统性地从能力保持、表征分析、下游可学习性和部署效率四个维度评估转换后的模型性能。
实验合理度: ★★★★☆
准确率、balanced accuracy、perplexity、ROUGE-L、effective rank、线性探针准确率、吞吐量、内存占用等
学术研究价值: ★★★★☆
通过量化感知训练(QAT)将预训练的752M参数语言模型转换为三值权重模型,并系统性地从能力保持、表征分析、下游可学习性和部署效率四个维度评估转换后的模型性能;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
在RTX 5070 GPU上,打包模型prefill吞吐量1806.76 tok/s,decode吞吐量7.634 tok/s,相比潜变量表示分别提升22.3%和24.2%。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) QAT预算有限(仅72.4M tokens),无法区分量化固有损失和恢复不足;(2) 缺乏与PTQ方法的直接对比;
[1] Malik A, Devan P, Mehra M S. Capability-Stratified Degradation in Ternary Language Models. arXiv:2608.28809.
[2] Wang S, et al. BitNet: Scaling 1-bit Transformers for Large Language Models. arXiv:2310.11453.
[3] Ma S, et al. The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits. arXiv:2402.17764.
[4] Liu Z, et al. CAT-Q: Calibration-based Ternary Quantization for Pretrained Models.
[5] Bengio Y, Léonard N, Courville A. Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation. arXiv:1308.3432.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!