← 返回 PaperDaily 大模型与智能体

752M模型压到1.58比特:常识还在知识全丢?

模型压缩领域一直有个终极诱惑:既然大模型这么贵,能不能把权重压到极致?三值化(Ternary Quantization)就是这条路上的狂飙选手——把每个权重压缩到只有三个取值{-1, 0, +1},理论上每个权重只需要约。

752M模型压到1.58比特:常识还在知识全丢?
原论文信息如下:
论文标题:
Capability-Stratified Degradation in Ternary Language Models
发表日期:
2026年08月
发表单位:
OneBit AI
原文链接:
https://arxiv.org/pdf/2608.28809v1.pdf

paperdaily_reaction_gif

三值化语言模型:能力分层退化还是通用替代?

模型压缩领域一直有个终极诱惑:既然大模型这么贵,能不能把权重压到极致?三值化(Ternary Quantization)就是这条路上的狂飙选手——把每个权重压缩到只有三个取值{-1, 0, +1},理论上每个权重只需要约1.585比特。要知道,现在主流大模型动辄BF16甚至FP32,1.58比特几乎是信息论极限级别的压缩。
但问题来了:把一个大模型压到这种程度,它还能用吗?是全面崩溃,还是有选择地保留某些能力?这篇论文给出了一个非常有意思的答案:三值化造成的退化不是均匀的,而是分层级的——有些能力大幅缩水,有些能力却意外幸存,甚至还能通过微调恢复大部分性能。
这篇名为《Capability-Stratified Degradation in Ternary Language Models》的研究,把Qwen3.5-0.8B(752M参数)通过量化感知训练(QAT,Quantization-Aware Training)转换为三值模型Cloe,然后从能力保持、表征分析、可学习性和部署效率四个维度做了系统性剖析。这个研究来自OneBit AI团队,论文作者为Anirudh Malik、Poojith Devan和M Sparsh Mehra。

从752M参数到1.58比特:Cloe的转换之路

先来认识一下这个研究的主角Cloe。它由Qwen3.5-0.8B转换而来,拥有约752M参数,包含24层Transformer,其中18层为线性注意力层、6层为全注意力层。隐藏维度1024,头维度256,词表大小248,320,采用绑定嵌入和语言模型头。
转换过程使用了量化感知训练(QAT),总共投入72.4M tokens。这里有个关键细节值得注意:论文严格验证了转换的“纯度”——所有186个目标线性层都被确认恰好只有3个不同的权重值,实测熵为1.5821比特/权重,非常接近理论极限1.5850比特/权重。这个验证之所以重要,是因为很多号称“三值化”的模型其实在计算图里偷偷保留了全精度权重,Cloe则明确排除了这种“作弊”可能性。论文还做了一个非常有趣的验证:把权重重建后与精确三值网格的偏差控制在约1.8×10⁻⁶的相对尺度,如果设置为λ=0走潜在权重路径,模型直接输出乱码——这证明模型确实依赖三值路径运行,而不是一个披着三值外衣的全精度模型。
图1:用于获得Cloe的转换流程总览
图1:用于获得Cloe的转换流程总览
三值化的核心数学操作可以用三个公式概括。首先是计算缩放因子s,也就是权重绝对值的均值;然后通过四舍五入和裁剪把权重映射到{-1, 0, +1}网格上;最后通过直通估计器(STE,Straight-Through Estimator)让梯度能够流过这个不可导的量化过程。
公式1:缩放因子s的计算
公式1:缩放因子s的计算
公式2:三值量化函数Q(W)
公式2:三值量化函数Q(W)
公式3:有效权重W_eff的直通估计器更新
公式3:有效权重W_eff的直通估计器更新
这三个公式中,s是均值缩放因子,W是原始权重矩阵,quantize函数表示先除以s、裁剪到[-1,1]区间、再四舍五入最后乘回s的过程。λ控制量化权重的混合比例,推理时设为1。这里有个值得注意的点:论文强调“1.58-bit模型”指的是权重表示本身,而不是整个检查点。由于248,320词的嵌入表仍然是BF16精度,整个检查点在磁盘上大约是6.47比特/参数。这个区分在工业界很重要——宣传“1.58比特”和实际存储占用是两回事。
表2:Cloe转换的核心配置
表2:Cloe转换的核心配置

能力保持的真相:哪些能力幸存,哪些能力消失?

评估一个压缩模型,最怕的就是只看一个总分然后简单判断“好”或“坏”。这篇论文在评估设计上做得相当扎实,先定义了一组评估工具,每个工具回答一个特定的问题。
表3:评估工具及每个工具回答的问题
表3:评估工具及每个工具回答的问题
这里有一个非常有趣的插曲。研究团队最初用标准的答案字母评分方式评估MMLU,结果Cloe只得了22.97%的准确率,看起来是灾难性失败。但检查输出分布时发现了蹊跷:Cloe在14,042道题中有13,852道都回答了“A”,占比高达98.6%!这显然不是能力问题,而是输出通道崩溃——模型只会复读机一样地输出“A”。这个发现暴露了一个重要的评测陷阱:如果模型不区分答案选项地输出,那么任何基于答案字母的评分都是没有意义的。
表4:暴露MMLU退化输出通道的答案字母分布
表4:暴露MMLU退化输出通道的答案字母分布
于是团队改用续写评分(Continuation Scoring)——直接计算模型对候选答案文本的长度归一化对数概率,而不是让它选字母。同时引入了一个“防假阳性守卫”:只有在同时超过随机水平/多数类基线加两个标准误差,以及平衡准确率超过随机水平加两个标准误差时,才认定模型在该任务上具备真实能力。
公式4:准确率超过随机和多数类基线加两个标准误差
公式4:准确率超过随机和多数类基线加两个标准误差
公式5:平衡准确率超过随机水平加两个标准误差
公式5:平衡准确率超过随机水平加两个标准误差
在严格的守卫条件下,从29个基准测试中筛选出10个Cloe确实具备区分能力的任务。结果非常有意思:这10个任务上Cloe平均保留了全精度教师模型77.1%的性能。其中RACE(阅读理解)保留89%、PIQA(物理常识)保留88%、CommonsenseQA(常识推理)保留86%。这个结果说明,三值化对常识判断类任务的破坏远小于对知识获取类任务的破坏
表5:基准测试性能及相对全精度教师的能力保留率
表5:基准测试性能及相对全精度教师的能力保留率
图2:代表性保留能力展示
图2:代表性保留能力。图中核心信息是非均匀退化:多个常识和合理性导向任务在三值化后仍显著高于随机水平
但另一面,MMLU、MedMCQA这类依赖专家知识的任务就惨不忍睹了。GSM8K(算术推理)只有2.0%,基本可以判定为“不会算术”。再看表6,有些任务上教师模型本身也几乎不工作,比如CB(蕴含判断)教师只有8.9%——这里的保留率数字没有太大参考价值。论文也特别提醒不要把这些边界任务上的“高保留率”误读为三值化无损
表6:能力边界与评估受限任务
表6:能力边界与评估受限任务

表征与可学习性:信息丢失的机制解析

行为层面的数字虽然直观,但还不能回答一个更深层的问题:这些丢失的能力,到底是信息真的被删掉了,还是信息还在只是读不出来?这个问题直接决定了三值化模型的可用性。
研究团队使用线性探针(Linear Probe)来回答这个问题。所谓线性探针,就是训练一个简单的多分类逻辑回归模型,直接去读隐藏层表征里的信息。如果探针能从表征中恢复出正确答案,说明信息还在;如果恢复不出来,说明信息真的丢了。探针在应用于Cloe之前先经过验证:当答案被显式线性编码时能恢复100%准确率,当信号不存在时约等于随机水平。
结果相当震撼:教师模型最后一层表征中能恢复43.76%的MMLU答案,而Cloe只有26.19%——距离25%的随机水平仅一步之遥。这意味着什么?MMLU这类专家型知识信息不是“藏在表征里但读不出来”,而是真的从表征中消失了
表7:表征层探针结果
表7:表征层探针结果。四选一MMLU分类的随机水平为25%
图3:从最后一层表征中可恢复的MMLU信息
图3:从最后一层表征中可恢复的MMLU信息。Cloe接近25%的四选一随机水平,教师模型保留了大量可恢复信号
但有趣的是,这种信息丢失并没有导致表征多样性崩溃。通过计算隐藏状态的有效秩(Effective Rank),团队发现Cloe的有效秩为538.9,相对教师只有微小下降;微调后甚至反超教师达到602.1。这说明Cloe的隐藏状态仍然具有丰富的表示方向——只是那些方向的“内容”变了,部分专家知识被抹掉了,但表征的结构多样性并没有崩掉。
表8:有效秩对比
表8:有效秩对比
这就引出了一个关键区分:表征能力(Representational Capacity)和存储知识(Stored Knowledge)是两个不同的东西。三值化可以保留丰富的激活几何结构,但不能保留原始预训练权重中编码的细粒度事实信息。
那么问题来了:如果知识已经丢了,模型还能学习新任务吗?这就要看“可学习性”。团队做了匹配微调实验——用完全相同的微调设置同时微调Cloe和教师模型,看Cloe能追回多少。在SST-2情感分类任务上,Cloe从61.9%提升到89.8%,达到匹配微调教师的95.6%。在XSum摘要生成任务上,Cloe的ROUGE-L从11.1提升到19.0,达到教师的79.4%,并且超过LEAD-1基线约2.4倍,说明它确实学到了摘要能力而不是简单复制原文。
表9:匹配下游学习结果
表9:匹配下游学习结果
图4:相对相同微调教师控制的下游可学习性
图4:相对相同微调教师控制的下游可学习性。绝对任务分数同样重要,见表9
这个结论非常有意思。一个专门知识大幅缩水的模型,仍然可以重新组织参数空间去获取新的下游任务能力。如果只看“知识保留率”就否定三值化模型的全部价值,那确实会错失它在“可学习性”上的潜力。

部署效率实测:存储、吞吐与内存的权衡

前面聊完了“能力”,现在来聊“代价”。毕竟三值化的终极目的是为了部署效率。团队在一台固定工作站上(AMD Ryzen 9 7900X CPU + 32GB内存 + NVIDIA RTX 5070 GPU 11.94GiB显存)对打包表示和潜在表示做了详细对比。
表11:部署测量所用的硬件和软件环境
表11:部署测量所用的硬件和软件环境
结果呈现出一种微妙的权衡关系。磁盘占用是最大亮点:打包表示只有634.65MB,相比潜在表示的1505.60MB缩小了2.37倍,这是最直观的存储收益。但打包路径在运行时内存上反而增加了8.1%(1578.36MiB vs 1460.59MiB),峰值内存增加了7.4%(1708.98MiB vs 1591.22MiB),加载时间慢了1.82倍(2.858秒 vs 1.570秒)。不过在稳态处理速度上,打包路径的prefill吞吐提升了22.3%(1806.76 tok/s vs 1477.03 tok/s),decode吞吐提升了24.2%(7.634 tok/s vs 6.145 tok/s)。
表12:打包与潜在部署测量对比
表12:打包与潜在部署测量对比
这里需要特别提醒:这篇论文比较的是“打包表示”和“潜在表示”,而不是和传统的FP/BF16全精度实现比。不能直接说是“全面超越全精度”。论文自己也说明,存储、加载和推理测量对应部署的不同阶段,这些指标不需要朝同一个方向变化。工程上要记住:紧凑的模型文件不等于低内存运行时——两者是不同的优化目标。
图5(a):磁盘占用对比
图5(a):磁盘占用对比
图5(b):解码吞吐对比
图5(b):解码吞吐对比
图5(c):预填充吞吐对比
图5(c):预填充吞吐对比
图5(d):加载时间对比 图5:当前打包与潜在部署测量
图5(d):加载时间对比。图5:当前打包与潜在部署测量。最强的收益是存储占用,吞吐在实测路径中也有提升,但运行时内存和加载时间仍是独立的工程考量
图6:综合实验支持的概念性部署论点
图6:综合实验支持的概念性部署论点
论文中Figure 6描绘了一个很有意思的概念图:三值化模型在经济成本、使用场景和模型能力的交叉点上找到了一个新位置。它不再试图做一个“更小的通用模型”,而是作为特定应用场景的“紧凑可学习基板”。

三值化的应用边界与未来展望

综合来看,这篇论文给出了一个非常清晰的“能力图谱”。团队用表格10总结了哪些能力变化、哪些能力幸存:
表10:三值化的能力分层结果概览
表10:三值化的能力分层结果概览
严重下降的部分非常明确:专家事实知识(MMLU)、算术推理(GSM8K)、语言建模质量(LAMBADA、WikiText-2困惑度)。幸存的部分同样清晰:常识判断类任务、表征多样性、下游可学习性。论文把这种情况称为“能力分层退化”(Capability-Stratified Degradation)——这不是一个“全有或全无”的崩溃,而是一个看能力类型的差异化损伤。
从产品化的角度,团队给出了一个务实的应用映射判断。三值化模型特别适合那些任务范围窄、需要极低存储和部署成本的场景——比如边缘设备上的单一意图分类、关键词检测、简单情感分析。但绝不是通用对话助手或知识问答系统的“平替”。需要注意,表14中的映射是“部署假设”而非已证实的结论——团队说得很诚实。
表14:潜在应用映射(部署假设而非已验证声明)
表14:潜在应用映射(部署假设而非已验证声明)
论文也坦诚列出了局限性。QAT预算只有72.4M tokens,远低于正常预训练的数据量,这意味着观察到的退化可能包含“量化信息损失”和“恢复不充分”两部分——不能把所有退化都归咎于三值化本身。论文还提到运行时内存反而增加的问题,说明压缩推理路径还不够成熟。最后,也是非常重要的一个提醒:评估低比特模型必须警惕输出通道退化的陷阱——一个只会输出“A”的模型,用传统答案字母评分根本无法体现真实能力。
表13:主要局限性及其对部署的含义
表13:主要局限性及其对部署的含义
未来的方向其实已经很清楚了。一方面需要更多QAT预算来区分“量化损失”和“恢复不足”;另一方面,如果能解决嵌入表的存储瓶颈(目前248K词表的嵌入表仍然是BF16),整个模型才能真正逼近1.58比特/参数的极限。此外,针对三值化模型更适合的评估方法(比如续写评分)也值得进一步标准化,否则我们很难横向比较不同低比特模型的真实水平。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?将Qwen3.5-0.8B用7240万token量化训练成三值模型Cloe,29项基准评测显示能力分层退化:10项任务保持77.1%教师性能,微调后SST-2追平95.6%,磁盘占用缩小2.37倍、吞吐提升约24%。
这篇工作最值得看的点是什么?在10个可判别任务上平均保留教师模型77.1%的性能;SST-2微调后达到教师模型的95.6%,XSum达到79.4%;打包模型磁盘占用减少2.37倍,prefill和decode吞吐量分别提升22.3%和24.2%
这篇工作的边界或风险在哪里?优点:(1) 系统性地从多个维度评估三值化模型的能力保持情况,而非仅关注单一指标;(2) 发现了答案字母退化的评估陷阱并提出了解决方案;(3) 通过线性探针和有效秩分析深入探究了信息丢失的机制;(4) 提供了详细的部署效率测量。缺点:(1) QAT预算有限(仅72.4M tokens),无法区分量化固有损失和恢复不足;(2) 缺乏与PTQ方法的直接对比;(3) 微调实验仅报告单一种子结果;(4) 嵌入表仍为BF16,整体压缩率有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

通过量化感知训练(QAT)将预训练的752M参数语言模型转换为三值权重模型,并系统性地从能力保持、表征分析、下游可学习性和部署效率四个维度评估转换后的模型性能。

实验合理度:★★★★☆

准确率、balanced accuracy、perplexity、ROUGE-L、effective rank、线性探针准确率、吞吐量、内存占用等

学术研究价值:★★★★☆

通过量化感知训练(QAT)将预训练的752M参数语言模型转换为三值权重模型,并系统性地从能力保持、表征分析、下游可学习性和部署效率四个维度评估转换后的模型性能;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在RTX 5070 GPU上,打包模型prefill吞吐量1806.76 tok/s,decode吞吐量7.634 tok/s,相比潜变量表示分别提升22.3%和24.2%。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) QAT预算有限(仅72.4M tokens),无法区分量化固有损失和恢复不足;(2) 缺乏与PTQ方法的直接对比;

主要参考文献

[1] Malik A, Devan P, Mehra M S. Capability-Stratified Degradation in Ternary Language Models. arXiv:2608.28809.
[2] Wang S, et al. BitNet: Scaling 1-bit Transformers for Large Language Models. arXiv:2310.11453.
[3] Ma S, et al. The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits. arXiv:2402.17764.
[4] Liu Z, et al. CAT-Q: Calibration-based Ternary Quantization for Pretrained Models.
[5] Bengio Y, Léonard N, Courville A. Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation. arXiv:1308.3432.


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球