← 返回 PaperDaily 视觉与图像

北航港大新作:扩散模型怕模拟存算噪声?早随机晚确定FID暴降2.58倍

模拟存内计算(CIM)这几年在AI硬件圈几乎成了“低功耗加速器”的代名词:它把矩阵向量乘法直接塞进存储阵列内部,省掉了芯片上最烧钱、最耗电的数据搬运,用来跑需要几十上百次迭代的扩散模型,理论能效相当诱人。

北航港大新作:扩散模型怕模拟存算噪声?早随机晚确定FID暴降2.58倍
原论文信息如下:
论文标题:
ASSERT: Adaptive Stochastic Sampling for Robust Diffusion Models on Analog Compute-in-Memory Hardware
发表日期:
2026年09月
发表单位:
北京航空航天大学集成电路科学与工程学院、智存研究院、香港大学电机电子工程系、北京大学集成电路学院
原文链接:
https://arxiv.org/pdf/2609.00955v1.pdf

模拟存内计算(CIM)这几年在AI硬件圈几乎成了“低功耗加速器”的代名词:它把矩阵向量乘法直接塞进存储阵列内部,省掉了芯片上最烧钱、最耗电的数据搬运,用来跑需要几十上百次迭代的扩散模型,理论能效相当诱人。可在实际芯片上,剧情往往没有想象中那么美——同一个扩散模型,在数字芯片上出图干干净净,换到模拟CIM芯片上,越跑越糊、结构崩坏,甚至出现“鬼脸”。 这并非模型结构出了错,而是模拟器件本身不完美。权重存储在物理单元里,编程误差、热噪声、泄漏电流、ADC量化误差等都会悄悄扰动权重;更“恶心”的是,这种扰动在每次采样时都固定存在,一步、两步看不出问题,扩散模型跑几十步就可能把误差滚成雪球。 既然硬件不完美,为什么不让采样器自己“会来事”一点?北航、港大等联合团队在ASP-DAC 2027提出的ASSERT,就是一种完全不训练、不改模型结构、也不增加网络调用次数的采样侧解法,能让扩散模型在模拟CIM噪声下大幅“回血”,高分辨率数据集上FID最多降到原来的约1/2.58,CIFAR-10步数研究中甚至可见约1/7.68的FID下降。这背后的直觉其实一句话就能概括:早随机,晚确定

模拟存内计算上的扩散模型为何如此脆弱?

先给不熟悉存内计算的读者补个背景。CIM(Compute-in-Memory,计算存储一体/存内计算)是一种让计算发生在存储阵列内部的硬件架构。传统芯片是冯·诺依曼结构,处理单元和内存分开,数据频繁搬动既费时又费电;CIM则把乘法累加操作“摊”进存储单元所在位置完成,尤其适合矩阵向量乘法(MVM, Matrix-Vector Multiplication)这种神经网络中最常见的运算。 扩散模型采样恰好是MVM消耗大户。一个标准的单步去噪,往往要跑一遍完整的骨干网络;采样100步,网络推理也接近上百次,算下来几乎全是MVM。因此业界不少团队尝试用CIM给扩散模型做硬件加速,论文背景里提到的AIG-CIM等工作相比GPU能带来两个数量级以上的吞吐和能效提升。
图1:扩散模型推理(左)及其CIM加速架构(右)
图1:扩散模型推理(左)及其CIM加速架构(右)
但模拟CIM这类硬件也有“小脾气”:存储单元的模拟状态不可能像数字内存那样精确,写入权重时会有编程偏差、读取时会叠加热噪声和随机电报噪声,输出还要经过ADC(模数转换器)量化,误差源一长串。论文采用了一个很有意思的做法——没有用理想化的高斯噪声做抽象建模,而是基于多颗物理CIM芯片采集到的真实MVM数据来校准噪声模型。 论文把噪声拆成了两部分:一部分是加在存储权重上的扰动εW,另一部分是加在输出激活上的计算噪声εY。写成公式就是这个样子:
公式1:CIM噪声下的矩阵向量乘模型
公式1:CIM噪声下的矩阵向量乘模型。输出 y 等于输入 x 乘上带扰动的权重 (W+εW),再加上输出端计算噪声 εY。
关键点在于,权重扰动的方差并不是各处均匀的,而是和权重本身的幅度近似呈线性关系。校准后,σW2=αW|W|+bW,其中的αW和bW都要根据实际CIM芯片的测量结果去拟合。
公式2:权重噪声方差与权重幅度的关系
公式2:权重噪声方差 σW2 随权重幅度 |W| 线性变化,αW、bW 由物理芯片测量值拟合得到。
既然噪声模型已经物理校准过,剩下要回答的问题是:为什么扩散模型对这种噪声尤其敏感,敏感点又在哪里?论文用DDPM和DDIM两种常见采样器测了CIFAR-10图像生成的FID随硬件噪声增强的变化。FID(Fréchet Inception Distance)是一种衡量生成图像分布与真实图像分布差异的指标,数值越低说明生成质量越好。从图2可以看到,噪声稍微增强,FID就快速恶化;图3则给出了更直观的视觉感受——100步DDIM采样下,人脸从清晰逐步变成碎纹理,生成效果迅速“崩盘”。
图2:硬件噪声增强下DDPM(左)与DDIM(右)在CIFAR-10上的FID变化
图2:硬件噪声增强下DDPM(左)与DDIM(右)在CIFAR-10上的FID。横轴为权重扰动强度,纵轴FID越高说明生成质量越差。
图3:CelebA-HQ数据集上,100步DDIM在渐强硬件噪声下的生成样本变化
图3:CelebA-HQ数据集上,100步DDIM在渐强硬件噪声下的生成样本。噪声越大,人脸的全局结构越难维持。

早期去噪阶段:误差累积的“重灾区”

扩散模型的去噪过程并非每一步都同等重要。想象一张图片从满是噪点的大米粥开始“显影”:最开始的几十步负责构筑轮廓、确定构图,后面几十步只负责修补纹理细节。ASSERT论文首先想知道,加入固定噪声后,到底哪一段去噪过程最伤不起。 实验设计很直接:把经过芯片校准的噪声映射只作用在某一段去噪区间,比如只让第99到80步受噪声影响,或者只让第20到0步受影响,然后观察FID差异。结果非常鲜明:早期高噪声阶段对误差极其敏感,几乎决定了最终图像能不能“成相”;后期精修阶段即使被干扰,最终影响也小得多。论文用一组“分段加噪声”的柱状图把这种规律展示得明明白白。
图4:固定硬件噪声下,逐段加入噪声映射时的各阶段FID(左)及对应生成样本(右)
图4:固定硬件噪声下,只在指定去噪区间施加噪声映射时的FID对比(左)及对应生成样本(右)。早期区间(如99-80步)造成的质量恶化最严重。
为什么偏偏是早期最脆弱?论文抛出了一阶误差递归分析。对同一张干净的样图,令噪声路径和干净路径使用相同的随机数,两者之差ei+1会满足这样的递推关系:
公式3:采样轨迹上误差的一阶前向递推
公式3:采样轨迹上误差的一阶前向递推。Ji 是当前去噪函数对状态xt的雅可比矩阵,Hi 是去噪函数对权重的雅可比矩阵,ai 表示该步是否被固定噪声映射污染。
看不懂矩阵也没有关系,可以把Ji理解成“误差从这一步传到下一步的放大通道”。将递归一路展开到最终样本,每一步引入的扰动都会乘上大量的雅可比链式因子,最终叠加成总误差。扩散模型在早期高噪声阶段,干净样本估计中的噪声分量几乎被显著放大,一步小扰动产生的结构破坏会跟着后面几十步反复传播、修复不了,所以才会成为整个采样过程的阿喀琉斯之踵。 更麻烦的地方在于,这种硬件权重扰动在反复采样中保持不变。前一步让网络“误判了一点点”,下一步进入的是已经被污染的状态,而权重偏差还是同一张“污染地图”,于是各步误差方向高度相关,误差不是各干各的随机噪声,而更像有一支“固定队伍”每步都朝同一个方向拉偏。论文用一阶误差展开把问题归结为误差向量间交叉项的作用:确定性DDIM轨迹上,不同步的误差贡献有很强对齐,交叉项合力把总误差越堆越大。

ASSERT:自适应随机采样的核心机制

既然误差之所以凶猛,是因为“固定误差在每一步都往同一个方向使劲”,那解决方案就呼之欲出了:在早期加入可控的随机性,把后续激活轨迹从固定误差方向上“摇晃”开,让不同步之间的误差不再整齐划一。这就是ASSERT的全称由来——Adaptive Stochastic Sampling for Robust Diffusion Models on Analog Compute-in-Memory Hardware,即面向模拟存内计算硬件的自适应随机采样。 论文用到的随机化工具是DDIM本身携带的随机项。DDIM并不是一套不能改的确定性采样器,它其实是一族采样器:当随机度参数η=0时退化为常见确定性DDIM;η>0时会把“额外的随机噪声z”混入每一步更新。ASSERT没有改网络权重,也没有换采样器,只是给η设定了一条随时间去变化的自适应调度曲线。
图5:随机DDIM、确定性DDIM与ASSERT在采样轨迹上的行为差异示意图
图5:随机DDIM、确定性DDIM与ASSERT在采样轨迹上的行为差异示意。ASSERT在早期引入随机性以摆脱固定误差对齐,在后期回归确定性以保留细节。
DDIM从t时刻状态xt到s时刻状态xs的单步更新公式为:
公式4:带随机项的DDIM更新公式
公式4:带随机项的DDIM更新。x̂0 是模型预测出的干净图像估计,εθ(xt,t) 是模型预测的噪声,z 是标准高斯随机向量。
这里第二项的系数和第三项的标准差σts都会随η伸缩,η越大,z注入越多,采样轨迹越“随机”。ASSERT的思路是让η在采样开始阶段维持一个较高的值,等熬过最容易累积误差的“高危区”后,再用余弦衰减把η平滑降到很低,让后续精修阶段尽量接近确定性DDIM,以保住干净场景下的生成品质。 从消融结果来看,“何时开始衰减”和“最大随机强度”至关重要。论文也发现在早期很窄的一段窗口里注入随机性效果有限,如果window太窄,误差还没被打散就到了确定阶段;比较理想的做法是让高随机性覆盖早期的一整段区间再平滑过渡。论文给出的调度公式为:
公式5:ASSERT的随机度调度函数
公式5:ASSERT的随机度调度。ri 是当前去噪进度,τtrans 控制早期高随机持续比例,ηmax 控制最大随机强度;ri≥τtrans 后η按余弦函数平滑衰减。
为了验证调度设计,论文把ASSERT与线性递减、恒定高随机、恒定低随机、反向后期高随机等几种调度做了对比。图6左展示了不同调度的η变化轨迹,图右是CIFAR-10噪声环境下的最终FID。可见“早期随机、晚期确定”的ASSERT能拿到最低FID,而后期还保持高随机或者反向在后期加随机的调度,效果都不理想——这也再次印证,精修阶段需要的是“稳”,而不是“皮”。
图6:不同随机度调度曲线(左)及相应噪声CIFAR-10 FID(右)
图6:不同随机度调度曲线(左)及对应噪声CIFAR-10 FID(右),ASSERT的“前期高随机、后期确定性”组合效果最佳。

实验结果:FID大幅降低,鲁棒性显著提升

实验部分首先覆盖了多个数据集和不同采样步数。论文在CIFAR-10上选取不同去噪步数,与传统DDIM在相同硬件噪声条件下做对比。由于ASSERT只是改变了采样器系数和随机数,模型权重、网络调用次数、去噪步数统统没有变。也就是说,ASSERT是在“不加算力、不改模型”的约束下把质量“抢救”了回来。
表1:CIFAR-10在不同去噪步数下的FID对比
表1:CIFAR-10在不同去噪步数下的FID。ASSERT在多种步数设定下均显著优于确定性DDIM,降低幅度随噪声条件不同而不同。
除了步数,调度超参的选择也会影响最终收益。表2给出了CIFAR-10上不同最大随机度ηmax和余弦衰减起点τtrans组合的FID。可以看到,ηmax不能太小否则不足以打散固定误差,也不能太大否则会引入过多随机噪声破坏图像结构;τtrans需要让高随机区间和容易出问题的早期去噪阶段基本重合,找到一个合适的“覆盖范围”。
表2:CIFAR-10的FID与随机度和余弦衰减起点之间的关系
表2:CIFAR-10的FID与ηmax及余弦衰减起点τtrans的敏感性分析,帮助理解ASSERT调参规律。
进一步地,论文在CelebA-HQ、LSUN Bedroom、LSUN Church等高分辨率数据集和多种采样器上做了扩展验证。图7汇总了不同数据集、不同采样器、不同权重噪声强度下的FID曲线,ASSERT几乎在所有设定下都能拿到更低的FID,部分配置下把FID降到确定性DDIM的约1/2.58。在CIFAR-10步数研究中,最夸张的配置甚至能降到约1/7.68。
图7:不同数据集、采样器和权重噪声水平下的FID对比
图7:不同数据集、采样器和权重噪声幅度下的FID。ASSERT在多数条件下保持更低FID,且在噪声更强的高分辨率设定下优势更突出。
值得强调的一点是,ASSERT并不是“对所有噪声无差别免疫”。图8右按噪声来源拆分FID后发现,权重噪声是主要破坏者,而输出噪声因为每一步都会重新采样,本身就有一定随机性,破坏相对有限。ASSERT能有效应对的正是前者:通过改变激活轨迹,削弱同一张权重误差地图跨步造成的相关性。 论文还充分展示了硬件上的可验证性。图8左给出了芯片误差验证结果,显示论文的噪声注入模型和物理CIM芯片实测误差分布较为一致,并不是停留在仿真幻想里。右侧的可视化样本则直观地展示了从“崩坏的人脸/卧室/教堂”到清晰生成的显著改善。
图8:芯片误差验证(左)与按噪声来源拆分的FID(右)
图8:芯片误差验证(左)与按噪声来源拆分的FID(右)。权重噪声是导致扩散模型退化的主要来源,ASSERT抑制的正是这种固定噪声。
图9:LSUN Bedroom、CelebA-HQ与LSUN Church在无噪声/噪声推理下的生成样本对比
图9:LSUN Bedroom、CelebA-HQ与LSUN Church等数据集在干净推理与噪声推理下的样本对比。确定性DDIM在噪声下结构明显崩坏,ASSERT能大幅恢复图像质量。

局限与展望:从算法到系统的下一步

ASSERT的工程代价极低:不需要训练,不需要微调,不需要重新映射权重,也不需要增加任何网络推理次数。但它并不是“随手一改就能包治百病”的银弹。 一个现实约束是,ASSERT需要在采样早期额外生成随机数,并对每条调度曲线做一定的离线配置。ηmax和τtrans的选择需要根据芯片噪声强度和数据集进行调整,实际操作中通常要先在目标芯片上做一轮快速标定。此外,ASSERT目前主要处理的是相对固定的空间权重扰动——如果硬件噪声本身随时间发生显著漂移,或者出现某些非常慢的时变漂移,调度的适配能力还需要进一步验证。 从研究角度看,这篇工作的价值更多在于把“扩散模型采样器设计”和“底层硬件非理想性”这两个原本相隔甚远的领域拉到了一起。过去人们常把CIM噪声当作一个纯粹的器件问题,要么靠更精准的编程校准,要么靠昂贵的重训练;ASSERT提示我们,采样算法本身也有相当大的抵抗噪声的空间。这也为后续“算法-硬件协同设计”开了个头:未来可以把ASSERT的随机度调度和芯片在位校准、权重映射优化或噪声感知蒸馏结合起来,在更低的系统成本下逼近数字芯片的生成质量。 当然,当前实验仍然偏向图像扩散模型,对于视频扩散模型、多模态生成等任务,噪声敏感性是否表现出相同的“前期敏感”规律,还有待验证。如果能够把这种“误差去对齐”和扩散模型的理论分析结合得更深,说不定还能解释更多关于扩散模型可解释性的问题。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?模拟存算一体(CIM)硬件在扩散模型推理时引入的固定权重扰动,会让画面逐步崩塌。北航、港大等团队提出免训练采样法ASSERT:早期高随机、后期平滑转确定,打散跨步误差,高分辨率数据FID最多降低2.58倍。
这篇工作最值得看的点是什么?ASSERT在多个数据集和噪声水平下均取得最低的噪声FID。在高分辨率数据集上,相比确定性DDIM,ASSERT在噪声水平0.08时分别取得2.39×(CelebA-HQ)、2.58×(Church)和2.54×(Bedroom)的FID降低;在CIFAR-10步数研究中,500步时取得7.68×的FID降低(从163.38降至21.27)。
这篇工作的边界或风险在哪里?优点:(1) 免训练、免硬件修改,仅改变采样器系数,易于部署;(2) 基于物理芯片测量校准的噪声模型,实验可信度高;(3) 提供了一阶误差传播的理论分析框架,解释了早期阶段更脆弱的原因;(4) 在多个数据集和多种噪声水平下均取得显著FID改善。缺点:(1) 需要额外的随机数生成能力,对硬件有一定要求;(2) 在干净(无噪声)条件下,ASSERT的FID略差于确定性DDIM;(3) 超参数η_max和τ_trans需要根据噪声水平调整,缺乏自适应机制;(4) 理论分析中的充分条件(如非收缩Jacobian、非负交叉项)未直接验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把硬件噪声鲁棒性问题从“改模型”挪到“改采样调度”,用误差跨步相关性解释早期脆弱性,角度新颖且结论有一定反直觉性。不是全新范式,但足够眼前一亮。

实验合理度:★★★★☆

覆盖CIFAR-10、CelebA-HQ、LSUN Bedroom/Church等多个数据集,且有物理芯片校准和芯片误差验证,实验链条比较扎实。扣一星在于对照组主要为自建调度,缺少更多非DDIM类采样器在CIM噪声下的横向对比。

学术研究价值:★★★★☆

首次系统揭示扩散模型去噪阶段对CIM固定噪声的时间敏感性,并用雅可比展开解释了随机化为何有效,能够启发后续算法-硬件协同研究。

稳定性:★★★☆☆

在显著噪声水平下能大幅止损,但效果依赖η_max和τ_trans的合理设定;噪声如果超出标定范围或出现明显时变漂移,ASSERT的收益可能变化,需要重新标定。

适应性以及泛化能力:★★★★☆

在多种分辨率、多个经典数据集和两类常见扩散采样器上均有效,且不限定具体CIM器件,只要能用权重噪声模型刻画就能适配。但目前验证集中在图像生成任务,对文生图、视频生成的迁移效果未知。

硬件需求及成本:★★★★☆

不需要训练和额外网络推理,主要增加的是随机数生成与少量调度控制逻辑,相比动辄微调大模型的方法成本低很多。不过为生成高质量随机数,需要保证部署环境有可用的随机源。

复现难度:★★★★☆

方法需要的数学推导、调度公式和实验流程叙述得比较清楚,只要拿到噪声校准数据即可复现,不需要特殊训练流程。扣一星是因为目前未见开源代码。

产品化成熟度:★★★☆☆

采样侧改动非常轻,适合直接嵌入现有CIM推理流程,但其落地需要先完成芯片噪声校准和调度参数挑选,产品化前期仍要额外投入;对于噪声特性稳定、重复部署量大、且不需要处理时变退化的场景最适用。

可能的问题:当前主要基于固定权重扰动地图假设,面对时变噪声场景的验证不足;实验以图像扩散为主,语义无关;缺少更大规模Diffusion Transformer类模型和端到端完整系统验证。


主要参考文献

Yuanuo Feng, Yizhe Chen, Wenshuai Yao, Yuxin Xie, Ngai Wong, Wenyong Zhou, and Wang Kang. ASSERT: Adaptive Stochastic Sampling for Robust Diffusion Models on Analog Compute-in-Memory Hardware. In Proceedings of the 32nd Asia and South Pacific Design Automation Conference (ASP-DAC'27).
Ho J, Jain A, Abbeel P. Denoising Diffusion Probabilistic Models. NeurIPS 2020.
Song J, Meng C, Ermon S. Denoising Diffusion Implicit Models. ICLR 2021.
论文预印本:https://arxiv.org/pdf/2609.00955v1.pdf

融会贯通

把ASSERT放进PaperDaily已收录论文的大背景中看,CIFAR-10这类经典基准已有不少论文能拿到很低的干净环境FID,例如MIT一项图像生成与超分统一工作在CIFAR-10上取得过2.65的FID。需要提醒读者的是,这类干净环境SOTA与ASSERT报告的不是同一个比较坐标:ASSERT要解决的是同一个预训练模型在模拟CIM噪声下“保住多少质量”的问题,而不是直接冲击无噪声FID排名;其对比核心是相同模型、相同步数、相同噪声条件下的FID下降幅度。因此在阅读“FID降低2.58倍”这类结论时,要留意比较基准与噪声设置,不能简单把它和无噪声环境下的FID榜单混在一起比较。 从更广的研究趋势看,ASSERT代表了一类很聪明的做法:当底层硬件不完美时,与其费大力气修改硬件或重新训练模型,不如先看看模型本身的推理过程有哪些“冗余自由度”可利用。扩散模型迭代采样天然具备调度、随机性、步长等大量可调节的自由度,这些自由度在GPU上可能只是锦上添花,在CIM硬件上却可能用来换取鲁棒性。这种“零训练、零模型改动”的干预思路,大概率会成为未来AI系统与新兴硬件协同设计的重要方向。

end
扩散模型遇上模拟CIM噪声别头大,算法侧「抗噪采样」正当时。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像生成+上海+某大

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。