← 返回 PaperDaily 大模型与智能体

DeepSeek边缘芯片109.4TFLOPS/W:三招压榨每一比特

DeepSeek 这回不只是把模型跑快,而是把“怎么在边缘设备上少算、少搬、少耗电”拆成了三把硬核手术刀。MIPS、MBLM、DAPPM 三招一套打下来,才有了 28nm 上 109.4 TFLOPS/W 这个挺扎眼的数字。

DeepSeek边缘芯片109.4TFLOPS/W:三招压榨每一比特
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
DeepSeek 这回不只是把模型跑快,而是把“怎么在边缘设备上少算、少搬、少耗电”拆成了三把硬核手术刀。MIPS、MBLM、DAPPM 三招一套打下来,才有了 28nm 上 109.4 TFLOPS/W 这个挺扎眼的数字。


原论文信息如下:
论文标题:
DSPE: An Energy-Efficient Edge Processor for DeepSeek Inference with MerkleTree-based Incremental Pruning, Multi-Stage Boothing Lookup and Dynamic Adaptive Posit Processing
发表日期:
2026年05月
发表单位:
Northeastern University, Imperial College London, Imperial Global Singapore, Xidian University, The Chinese University of Hong Kong, Shenzhen, Wisemaytech Co., Ltd., Institute of Microelectronics, Chinese Academy of Sciences, University of Chinese Academy of Sciences, Nanyang Technological University
原文链接:
https://arxiv.org/pdf/2605.08615v1.pdf

🚀 DeepSeek边缘部署的“三把火”:剪枝、布思与自适应Posit

DeepSeek 的问题很现实:模型本身很强,但塞进边缘设备里,往往就变成了“算得起、供不起、搬不动”。这篇论文没有走“再堆算力”的老路,而是直接对准三个最贵的环节下手:重复计算、位翻转开销、数值格式冗余。说白了,就是尽量少算、少搬、少耗电。
封面
图8:所提出处理器的版图。
这篇工作提出了 DSPE(DeepSeek Processing Element),核心是三把刀:MIPSMBLMDAPPM。前两个负责“把不该算的砍掉”,最后一个负责“把该算的算得更省电”。
图1:DeepSeek-V3结构示意图
图1:DeepSeek-V3 结构示意图。DeepSeek 是典型的多层 transformer 堆叠,推理链路包含注意力、MLP 和缓存复用。
DeepSeek-V3 推理时会不断复用历史上下文(KV Cache),但复用多了冗余也跟着来了。论文抓住的就是这点——既然很多中间结果本来就很像,为什么还要一遍遍重算?
注意力公式
这是 transformer 最基础的注意力公式。论文后面的优化,本质上就是围绕这个推理链路里的重复计算、缓存访问和矩阵乘法做文章。
MLA公式
MLA 是 Multi-Head Latent Attention,它让历史信息能更高效地被复用,这也是 KV Cache 重要的原因。
MoE公式
MoE 是 Mixture of Experts,它会按输入选择少数专家参与计算,但也带来路由、调度和重复访问问题。DSPE 就是盯着这些“省下来的算力又被系统复杂度吃掉”的地方开刀。

🧩 技一:MIPS —— 梅克尔树下的智能冗余剪枝

MIPS 的全称是 MerkleTree-based Incremental Pruning Scheme。它解决的不是“模型太笨”,而是“模型太爱重复劳动”。在 token 逐步解码时,邻近 token 的向量常常很像,很多相似度计算和缓存访问都在白白烧电。
图2:梅克尔树结构
图2:梅克尔树结构。它把一堆叶子节点逐层汇总成根节点,既能做完整性校验,也能“提前判断这坨东西是不是重复了”。
图5:基于梅克尔树的增量剪枝方案
图5:基于梅克尔树的增量剪枝方案。MIPS 的流程可以概括为三步:相似度重排、梅克尔树早判定、动态复用
“相似度重排”先用序列增量排序器把新向量按与历史向量的余弦相似度重排,相近的东西更容易复用。接着梅克尔树判断:重排后的向量被压到更紧凑的语义空间,逐层生成哈希,借助哈希树层级结构尽早发现当前输入是否已足够接近历史输入。
论文把判断分成三种:Early-SkipDiff-ReuseFull-Compute。哈希几乎一样就跳过;差一点点就查表复用;只有真的遇到新模式才完整建树算到底。
BS公式
BS 是 bit similarity,BV 是 bit-flips。翻转越少,说明输入越接近,越值得复用。
MIPS 在 MMLU 评测下能减少 33.5% 的 DRAM 访问和 36.2% 的 SRAM 访问。对边缘芯片来说,“少搬数据”往往比“少算一点”更值钱。

⚙️ 技二:MBLM —— 面向共享权重的多级布思查找优化

MBLM 的全称是 Multi-Stage Boothing Lookup Method。布思乘法本来就是为了减少部分积而生,但这篇论文更进一步:它不只关心“怎么乘”,还关心“这次乘法是不是根本不用认真乘”。
图6:多级布思查找方法
图6:多级布思查找方法。它针对共享权重场景下的乘法冗余,核心是把“重复、无效、位翻转太多”的乘法请求提前识别出来。
MBLM 先做一层过滤:如果权重或激活值太小,直接标成无效计算跳过。很多低幅值乘法对最终结果贡献很小,却会完整走一遍编码和存储访问,属于典型的“干活不少,产出不多”。
冗余评分公式
冗余评分由 Bayesian Network 输出。BN 根据 bit similarity 和重复长度等特征判断冗余程度:分数低就走 radix-4 Booth,分数高就切到 radix-8 Booth。简单说,就是“冗余少时稳一点,冗余多时激进一点”。
位相似度公式
位相似度越高,相邻乘法请求的模式越接近,越适合走查找复用和高阶 Booth 编码。论文还构造了 BVMVST,把“哪些位经常翻、哪些情况重复出现”统计清楚,方便查表和去重。
这一招的重点在于把 Booth 编码从“固定流程”变成“看脸下菜”。在 DeepSeek-V3 的 MMLU 评测中,MBLM 可让计算量减少 39.1%,说明它真的把乘法链路里那些重复翻转、重复编码的脏活累活给削掉了。

📐 技三:DAPPM —— 动态自适应Posit处理,精打细算每一比特

第三把刀是 DAPPM(Dynamic Adaptive Posit Processing Mechanism)。前两招在砍“重复算”,这一招在砍“每次算的时候还要多带几层冗余格式”的成本。边缘设备最怕的不是某一次算错,而是长期被精度切换和多余位宽拖累。
Posit 是一种替代浮点数的数值格式,范围和精度分配更灵活。论文提出的 DA-Posit,就是在这个基础上做“动态压缩”和“可恢复编码”。
DA-Posit指数公式
式子里的 E = k·2es + e 表示把 regime 和 exponent 合成复合指数。它让 DA-Posit 能把低位里高度相关的比特进行结构化压缩,再在需要时恢复。
图7:动态自适应Posit处理机制
图7:动态自适应 Posit 处理机制。思路可概括为两步:先按模式把输入拆开,再根据压缩状态选择不同规模的阵列乘法器 PE,最后做规范化和编码恢复。
DA-Posit 不是一味追求“位宽越小越好”,而是把低位中重复、相关、边界冗余的部分折叠掉。论文提到三种压缩模式:不压缩、压缩 1 位、压缩 2 位,借助 regime 的少量边界码做联合映射,不额外增加编码位宽。
硬件上,DAPPM 会根据模式选择不同规模的 Array Multiplier PE:16、9 或 4 个乘法单元,像“按需开火”,不是每次都全功率拉满。
表1:处理器设计对比
表1:处理器设计对比。这篇工作定位明确:目标放在DeepSeek 边缘推理的能效上,精度覆盖 Posit8 和 INT8/4 这类适合部署的格式。
在 DeepSeek-V3 的 MMLU 评测中,DAPPM 使计算速度提升约 1.47 倍,同时保持相同精度。这说明 DA-Posit 不是“为了省电牺牲精度”,而是尽量压掉冗余位宽,留住有用信息。

📊 实测成绩单:109.4 TFLOPS/W,能效碾压GPU

图3:DeepSeek边缘推理挑战
图3:DeepSeek 边缘推理挑战。冗余、位翻转、矩阵乘法延迟,三座大山一起压下来。
作者用 Verilog 实现 DSPE,通过 28nm CMOS 工艺完成综合与布局布线。最终芯片面积 8.23 mm²,工作电压 0.6V–1.1V,功耗 122–345 mW,最高频率 710 MHz
最高性能点达到 22.8 TFLOPS@POSIT8;0.6V、200MHz 低功耗配置下,峰值能效冲到 109.4 TFLOPS/W@POSIT8,相比 GPU H100@FP8 高出 19.35 倍。更准确的说法是:在特定精度、任务和功耗约束下,专用边缘架构把能效做到了非常夸张的水平。
图8:所提出处理器的版图
图8:所提出处理器的版图。能把三套机制塞进 28nm 工艺并跑出这个能效,说明论文确实做了硬件落地。
实验结果也要冷静看:这套设计明显是为 DeepSeek 推理定制,收益依赖“输入存在时序相似性”和“权重共享较强”的前提;DA-Posit 的生态兼容性和软件栈适配仍是现实门槛。它很强,但不是拿来就能无脑抄的那种强。

🤔 总结与展望:边缘智能的下一个里程碑

DSPE 的价值在于把大模型边缘部署最烦的三类问题拆开了:冗余计算怎么跳过、乘法位翻转怎么降、数值格式怎么压。这三件事能同时做对,还能落到 28nm 芯片上,确实不容易。
未来边缘大模型硬件可能不再只是“把算力堆高”,而是越来越像“把每一类冗余都专门做掉”。谁能把数据访问、位级运算和数值格式一起协同设计,谁就更有机会把能效做出差距。
真正落地还得过三关:模型适配、软件工具链、不同任务下的稳定收益。论文已经把“能做出来”证明了,接下来更难的是“换模型也好使、换任务也不崩”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是 DeepSeek 在边缘设备上推理时“太耗电、太占带宽、太多冗余”的问题。MIPS 负责减少重复向量计算,MBLM 负责减少乘法位翻转和无效编码,DAPPM 负责让数值表示更省位宽、更省电。

MIPS、MBLM、DA-Posit 分别是什么意思?MIPS 是基于梅克尔树的增量剪枝方案,核心是用哈希树提前判断是否重复;MBLM 是多级布思查找方法,核心是根据冗余程度选择不同 Booth 编码路径;DA-Posit 是动态自适应 Posit 格式,核心是把低位冗余折叠掉,同时还能恢复原始语义。

这类方法能直接拿去做产品吗?可以参考,但不能无脑照搬。它很适合 DeepSeek 这类具有明显序列相似性、缓存复用和共享权重特征的推理场景;如果模型结构、精度要求或输入分布差异很大,收益和稳定性都要重新验证。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。不是单点小修小补,而是把剪枝、查找、数值格式三条线一起打通,思路完整,工程味也很足。

实验合理度:★★★★☆。有芯片实现、有工艺参数、有能效对比,证据链比较扎实;不过部分收益强依赖任务和模型特性,外推时要谨慎。

学术研究价值:★★★★☆。它对“大模型边缘推理如何做专用硬件协同优化”给出了很清晰的答案,尤其适合后续研究缓存复用、位级近似计算和新数值格式。

稳定性:★★★☆☆。能效表现漂亮,但 MIPS 和 MBLM 都依赖输入相似性与冗余分布,换任务后未必还能保持同样收益。

适应性以及泛化能力:★★★☆☆。更像是面向 DeepSeek 系列推理的专用设计,泛化到其他大模型时需要重新评估数据模式和精度约束。

硬件需求及成本:★★★☆☆。28nm 工艺能做到这个能效不容易,但系统里包含缓存、查找表、树结构和多路径控制,设计复杂度不低。

复现难度:★★★☆☆。论文给了硬件思路和关键机制,但完整芯片复现门槛高,尤其是 DA-Posit 和多级查找路径的协同实现。

产品化成熟度:★★★☆☆。适合做特定边缘推理芯片或定制加速模块,但离通用产品还有软件栈、兼容性和跨模型验证这几道坎。

可能的问题:创新点很多,但也容易让人担心“机制太多、工程太重”。如果没有更广泛任务验证,109.4 TFLOPS/W 这种漂亮数字也要放在具体约束下理解。


主要参考文献

[1] X. Bi, D. Chen, G. Chen, S. Chen, D. Dai, C. Deng, H. Ding, K. Dong, Q. Du, Z. Fu, and H. Gao. DeepSeek LLM: Scaling open-source language models with longtermism. arXiv preprint arXiv:2401.02954 (2024).
[10] A. Liu, B. Feng, B. Xue, B. Wang, B. Wu, C. Lu, C. Zhao, C. Deng, C. Zhang, C. Ruan, and D. Dai. DeepSeek-V3 technical report. arXiv preprint arXiv:2412.19437 (2024).
[13] T. Tambe, J. Zhang, C. Hooper, T. Jia, P. N. Whatmough, J. Zuckerman, M. C. Dos Santos, E. J. Loscalzo, D. Giri, K. Shepard, L. Carloni, A. Rush, D. Brooks, and G.-Y. Wei. 22.9 A 12nm 18.1 TFLOPs/W sparse transformer processor with entropy-based early exit, mixed-precision predication and fine-grained power management. ISSCC 2023.
[19] Y. Wang, Y. Qin, D. Deng, et al. A 28nm 27.5 TOPS/W approximate-computing-based transformer processor with asymptotic sparsity speculating and out-of-order computing. ISSCC 2022.
论文原文:https://arxiv.org/pdf/2605.08615v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。