北航港大新作:扩散模型怕模拟存算噪声?早随机晚确定FID暴降2.58倍
模拟存内计算(CIM)这几年在AI硬件圈几乎成了“低功耗加速器”的代名词:它把矩阵向量乘法直接塞进存储阵列内部,省掉了芯片上最烧钱、最耗电的数据搬运,用来跑需要几十上百次迭代的扩散模型,理论能效相当诱人。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
模拟存内计算(CIM)这几年在AI硬件圈几乎成了“低功耗加速器”的代名词:它把矩阵向量乘法直接塞进存储阵列内部,省掉了芯片上最烧钱、最耗电的数据搬运,用来跑需要几十上百次迭代的扩散模型,理论能效相当诱人。
超导量子比特的读取一直是规模化的“卡脖子”环节——传统色散读取又慢又依赖微波。诺思罗普·格鲁曼团队这次直接甩出一套无微波方案:10纳秒制备与读取、99.7%保真度、282个器件验证,还顺带把量子信号转成数字逻辑,整套思路对超导量子计算控制系统而言,属于值得细读的硬核参考。
这篇文章切入角度很刁钻:别人都在优化模型算力,它却盯上了摄像头到内存的搬运能耗。用一个带语义感知的存储编码器,在保护行人检测精度的前提下,把前视相机接口能耗砍掉约36%,而且跨29个检测器、12个数据集验证,落地感很强。
FPGA上跑AI模型,压缩和加速是两件事吗?这篇综述梳理了2015-2026年25个协同设计案例,用五分类法重新组织,结果发现:只有1个案例报告了统一基线的压缩比与精度变化。想快速摸清FINN、HLS4ML、Vitis AI谁更靠谱,这套分类和开放挑战值得一读。
粒子物理的未来,正被一场“数据洪水”堵在门口。这不是比喻,而是字面意义上的每条读出链路每秒几十个G比特的洪流。
电源电压像坐过山车,芯片时钟就得跟着遭殃?这篇来自CISPA和IHP的流片实测论文,把一个曾只存在于仿真里的全数字自适应时钟频率校正电路,放到了130nm真实硅片上验证。没有PLL、全数字、1.2个时钟周期内响应,还顺手把亚稳态这个老大难问题用掩蔽锁存器给“治”了。做低功耗芯片、高性能处理器或对电压波动敏感的数字电路设计的朋友,这篇值得认真看一看。
模拟存内计算(CIM)部署扩散模型是低功耗生成的重要路径,但芯片非理想性会让引导信号悄悄“失真”。这篇北大港大合作的工作把失效通道定位到无分类器引导残差上,并给出免重训练、只改一个标量参数的优雅修复方案,在3个扩散模型上大幅恢复生成质量,值得所有关注AI芯片落地和扩散模型的读者一读。
预取器是芯片里的“预言家”,过去全靠人类工程师手搓,如今Google联合UC Berkeley让LLM进化智能体自己“进化”出一个三级预取器,直接拿下DPC4冠军,IPC比人类顶级方案还高0.3%,低带宽场景下更是领先2%。这是AI自动硬件设计第一次真正在权威竞赛里赢过人类冠军,值得所有做体系结构和AI的人围观。
LLM智能体调芯片,烧的是真实美元。这篇鲁汶大学新作给出两个反常识答案:精心雕琢的长期记忆,不如普通拼接有用;真正决定优化质量与成本比的,是推理力度该何时加码。Ares靠一个耐心计数器动态调度,等成本下PPA优化深度提升23–27%,成本仅SotA的12%——继6月聊过让智能体学会止损之后,省钱这件事从动作层面卷到了芯片设计。
当LLM服务的上下文长度从几百到百万不等时,GPU内存成了最大的短板。SK海力士与KAIST联手拿出硬核方案——NELSSA,把长上下文请求“请”到CXL互联的PNM(近内存处理)芯片上执行,GPU只管短请求和FFN。实测解码吞吐量飙涨5.5倍,P99延迟骤降15倍,而且是在真实硬件上跑出来的!这可能是下一代LLM基础设施的关键拼图。
继2026年7月聊过DeepSeek边缘芯片的极致能效后,龙哥今天带来一篇更硬核的芯片测试——为HL-LHC升级量身打造的HCCStar ASIC质子束实测。三模冗余保护效果如何?数据丢失率低至10⁻¹⁰,每年每bit仅约10次修正翻转。这不是理论推断,是实打实的辐射数据。
视频扩散Transformer最烦的不是“能不能生成”,而是“生成一段视频到底要烧掉多少算力”。Kaleido不跟稀疏注意力硬卷,而是从潜空间通道相关性下手,顺手把算法和硬件一起改了,思路很工程,也很狠。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球