← 返回 PaperDaily 视觉与图像

模拟存内计算秒变“猪队友”?北大港大出手:只调一个引导参数,扩散模型FID狂降75%!

模拟存内计算(CIM)部署扩散模型是低功耗生成的重要路径,但芯片非理想性会让引导信号悄悄“失真”。这篇北大港大合作的工作把失效通道定位到无分类器引导残差上,并给出免重训练、只改一个标量参数的优雅修复方案,在3个扩散模型上大幅恢复生成质量,值得所有关注AI芯片落地和扩散模型的读者一读。

模拟存内计算秒变“猪队友”?北大港大出手:只调一个引导参数,扩散模型FID狂降75%!
原论文信息如下:
论文标题:
When Guidance Goes Off-Scale: Recalibrating Diffusion Transformers under Analog Compute-in-Memory Nonidealities
发表日期:
2026年08月
发表单位:
北京大学集成电路学院;香港大学电机电子工程系
原文链接:
https://arxiv.org/pdf/2608.19644v1.pdf
大家有没有想过一个问题:一个跑得好好的扩散模型,如果把它部署到专门的AI芯片上,生成质量会不会突然“翻车”?
翻车也就算了,如果连翻车的原因都找不到,那才叫一个头大。
今天聊的这篇论文,来自北京大学集成电路学院和香港大学电机电子工程系,研究的正是这个扎心的问题:扩散Transformer(DiT)模型部署到模拟存内计算(Analog Compute-in-Memory,简称CIM)芯片上时,生成质量为什么会大幅下降?以及,怎么用一个近乎“零成本”的办法把它救回来。
先说结论:论文发现罪魁祸首不是模型本身,而是扩散采样中的“无分类器引导残差”(CFG residual)被芯片非理想性不成比例地扭曲了。更妙的是,修复方案不需要重新训练、不需要改芯片、不需要动采样器,只需要把CFG的引导尺度(guidance scale)这一个标量重新调一下,就能把FID从59.22拉回20.49。注意,这还是在模拟芯片噪声σCIM=0.20这种比较恶劣的条件下。
说实话,第一次看到这个结果,龙哥是有点怀疑的。调一个参数就能缩小87%的CIM导致的FID差距?这也太“白菜价”了吧。不过仔细读完论文的残差诊断和轨迹级分析之后,发现这个方案确实有点东西,不是那种硬凹出来的“炼丹技巧”。

引言:扩散模型搬进存内计算芯片之后

扩散模型这几年在图像生成领域算是“统治级”的存在了,从DALL·E到Stable Diffusion再到各种DiT架构,生成质量一路飙升。但高质量的背后是高昂的计算代价:DiT采样需要在很多时间步上反复评估一个巨大的去噪网络,而且每一步都要在内存和计算单元之间反复搬运大权重矩阵。这种“内存墙”问题在传统数字芯片上越来越突出,尤其到了边缘设备或者需要低功耗推理的场景,简直让人头大。
于是,模拟存内计算(CIM)进入了大家的视野。这种架构的思路很直接:把矩阵乘法直接放进存储阵列里执行,权重存在哪就在哪算,省掉了海量的数据搬运,能效比大幅提升。听起来很美对不对?但天下没有免费的午餐。模拟CIM天生带着一堆非理想性:编程方差、电导漂移、读取噪声、混合信号外围效应……这些都会扰动实际部署后的有效权重和计算精度。
之前的很多研究都是在讨论CIM怎么加速扩散模型,但对“现代预训练DiT模型在模拟CIM非理想性下,生成质量到底会怎么退化”这件事,理解其实是不够的。尤其是无分类器引导(Classifier-Free Guidance,简称CFG)作为扩散采样中最主要的条件控制机制,它和非理想性之间的相互作用,之前的文献里几乎没人系统研究过。这篇论文就是冲着这个空白来的。
图1:四个提示词下的定性对比,每个三元组依次展示干净生成、使用干净选定引导的CIM生成与使用重校准引导的CIM生成
四个提示词下的定性对比。每个三元组依次展示干净生成、使用干净选定引导的CIM生成与使用重校准引导的CIM生成。可以看到,仅仅重校准引导尺度,就能把CIM下的图像结构从“一塌糊涂”拉回“基本能看”的水平。

模拟存内计算如何悄悄破坏扩散模型的生成质量?

先来搭一个基本框架。论文考虑的是混合模拟CIM部署方式,如上图所示:注意力投影和全连接层里的静态线性权重被映射到CIM阵列上执行,而层归一化、非线性激活、softmax、依赖数据的注意力乘积以及调度器更新这些操作仍然保留在数字域。这样既保留了原来的DiT架构,又加速了反复去噪评估中占主导地位的矩阵运算。
图2:混合模拟CIM部署示意图。(a) 基于CIM的矩阵乘法;(b) DiT映射:线性层在CIM阵列上执行,其他操作保持数字实现
图2:混合模拟CIM部署。(a) 基于CIM的矩阵乘法;(b) DiT映射:线性层在CIM阵列上执行,其他操作保持数字实现。
CIM非理想性的建模方式,论文借鉴了硬件研究中常用的高斯权重扰动模型:每个被映射的线性权重矩阵会乘上一个(1 + σCIM·Ξ)的因子,其中Ξ是标准正态分布的随机噪声,σCIM控制扰动的严重程度。采样得到的噪声实现在整条去噪轨迹中保持不变,这反映了部署后的CIM阵列中持续的权重相关偏差。需要注意,这个公式是算法层面的代理模型,不是完整的电路级建模。
关键问题来了:CFG是怎么工作的?无分类器引导把无条件去噪预测和条件去噪预测组合起来:εw,t = ut + w·gt,其中ut是无条件预测,ct是条件预测,gt = ct - ut就是CFG残差,标量w控制条件残差的强度。在干净数字推理下选好的引导尺度w0,直接搬到CIM上用,默认的假设是:CFG残差应该足够稳定,以至于干净条件下的引导校准可以直接迁移。论文告诉我们:这个假设在CIM非理想性下,会翻车。

无分类器引导残差:一个被忽视的失效通道

论文最核心的洞察,在于发现了CFG残差是一个“减法敏感的失效通道”。这个说法有点绕,用大白话解释一下。
在CIM扰动下,无条件分支和有条件分支各自的预测其实并没有坏得太离谱。换句话说,每个分支和干净版本相比,偏差都不算大。但是CFG真正使用的不是这两个分支本身,而是它们的差——gt = ct - ut。这个差值的绝对值本来就比分支预测小得多。两个“还算准”的分支预测,各自带上一点误差,相减之后误差不但没有抵消,反而可能相对被放大得很厉害。就好比两个人各自猜一个数,各差5%,但这两个数本身很接近,相减后的差值可能被误差完全淹没。
论文把这个问题用数学表达了出来。在CIM实现ξ下,有效权重θ~(ξ)在给定隐状态xt处的预测扰动被定义为:δt(xt, y; ξ) = εθ~(ξ)(xt, t, y) - εθ(xt, t, y)。对于两个CFG分支,可以写成:ũt = ut + δu,t,čt = ct + δc,t。那么带噪残差就是:g̃t = čt - ũt = gt + δg,t,其中δg,t = δc,t - δu,t。
这个减法暴露了差分分支误差。即使δu,t和δc,t相对于分支预测来说很小,它们的差相对于更小的残差gt来说也可能是巨大的。更进一步,论文把带噪残差分解成与干净残差对齐的分量和一个正交分量:g̃t = αt·gt + ηt,其中αt = ⟨g̃t, gt⟩ / ‖gt‖²,ηt与gt正交。这里αt·gt是保留的干净对齐分量,ηt是与gt正交的残差分量。
把分解代入CFG公式后得到:ε̃w,t = ut + δu,t + w(αt·gt + ηt)。这个式子揭示了一个可控的权衡:改变w无法直接消除公共分支漂移δu,t,但它会同时缩放保留的有用分量αt·gt和正交残差分量ηt。这就意味着,引导尺度w是一个“开关”,但不是一个“净化器”——它放大或者缩小目标信号的同时,也会把噪声一起放大缩小。
图3:PixArt-Σ在1024×1024分辨率下,随着CIM非理想性增强(σCIM从0.05到0.20),在干净选定尺度w0=2.0下的生成效果变化
图3:PixArt-Σ在1024×1024分辨率下,随着CIM非理想性增强(σCIM从0.05到0.20),在干净选定尺度w0=2.0下的生成效果变化。可以看到噪声越大,图像崩得越厉害。
为了验证这个诊断,论文做了一组残差诊断实验,结果很直观。如下图所示,无条件预测和有条件预测各自的余弦相似度(cos(u, ũ)和cos(c, č))在CIM扰动下依然较高,说明分支级别的方向保持得还不错。但是CFG残差的余弦相似度cos(g, g̃)明显更低,说明残差的方向被旋转得更厉害。同时,保留的α值下降,相对误差‖δg‖/‖g‖很大,进一步证实了残差被不成比例地扭曲。
图4:CIM非理想性下的CFG与残差诊断。(a) 分支扰动;(b) 残差旋转;(c) 干净对齐分解;(d-e) σ=0.20时的时间步统计,阴影表示95%置信区间
图4:CFG与残差诊断。(a) 分支扰动;(b) 残差旋转;(c) 干净对齐分解;(d–e) σ=0.20时的时间步统计,阴影表示95%置信区间。注意无条件与有条件预测的余弦相似度都还挺高,但残差的余弦相似度明显掉得更快。

引导重校准:一个无需重训练的采样端修复方案

基于上述诊断,论文提出了引导重校准(Guidance Recalibration)方案。这个方法简单到让人怀疑是不是走错了片场:在目标CIM运行条件下,只重新选择CFG的引导尺度w,其他一切都不变。预训练去噪器、CIM映射、调度器、采样预算全部保持不变。
具体做法是:给定一个独立的校准数据集Dcal和一个候选引导尺度集合W,通过最小化某个目标函数L来选择合适的w*。在主实验中,L选的是FID,C由σCIM来索引。选定的尺度w*对后续同一运行条件下的所有样本固定使用,不需要每个提示词单独调整,不需要额外的去噪器评估。
一个很自然的问题是:校准需要多少数据?论文专门测试了小校准集的效果:只用256个校准提示选择引导尺度,然后在2000个不相交的提示上评估。在σCIM=0.15时,重校准把FID从51.09降到43.92;在σCIM=0.20时,从79.94降到44.03,而干净参考是43.58。可见,一个小型校准子集就足以确定一个可迁移的工作点,让重校准成为部署时一个非常轻量的步骤。
表:小校准集引导重校准实验结果
表:小校准集(256提示选择、2000提示评估)下的引导重校准实验结果。
图5给出了一个概念性的轨迹示意,帮助理解重校准在采样过程中到底起了什么作用。
图5:概念性采样轨迹示意图
图5:概念性采样轨迹。(a) 干净推理;(b) CIM推理使用干净选定尺度w0;(c) CIM推理使用重校准尺度w*。阴影等高线表示语义盆地,箭头表示基础更新和引导更新。每个轨迹段是两个分量箭头的向量和。

轨迹级分析:为什么适度放大引导能恢复语义一致性?

为什么把引导尺度调大一点就能奏效?这需要从闭环采样的角度来理解。扩散采样不是一步到位的,它是一个迭代过程:每一步的去噪输出会改变隐状态,而新的隐状态又作为下一步的输入。引导重校准作用于这个闭环系统,而不是在单个时间步上去匹配干净预测。
把反向采样过程写成通用形式:xt-1 = St(xt, ε̃w,t)。改变w不仅影响当前步的更新,还会改变后续所有去噪评估所接收到的隐状态。对采样器在当前状态处做局部线性化,可以得到:Δxt(w) = vu,t + w·Bt·rt。其中vu,t是基础更新(由无条件预测主导),rt是采样器传播后的残差控制信号,Bt是预测到状态的局部映射。
关键在于:当rt中保留了促进目标一致结构的成分时,增大w可以加强这个保留的控制信号,帮助轨迹更早进入目标语义区域。一旦轨迹进入了目标语义盆地的邻域,学习到的去噪场会提供局部吸引力,后续步骤就会持续精炼同样的语义内容。换句话说,重校准不需要在每个时间步都复现干净轨迹,而是为带噪闭环采样器选择一个有利的运行点。
但收益是有边界的:过度增大引导会同时放大整个失真残差,包括那些与目标进展不对齐的分量,而公共漂移δu,t又无法通过改变w来控制。这些误差在闭环轨迹上累积,导致过条件化和质量下降。所以最优引导尺度是有限的,并且依赖于CIM噪声水平——这就是论文强调的“有限、噪声依赖的最优点”。
论文通过时间步语义进入分析来验证这个轨迹级解释。在每个反向步骤中,把调度器一致的预测干净样本x̂0|t解码出来,用CLIP图像嵌入在候选文本中检索匹配,统计top-1检索率。结果显示,重校准后的轨迹更早进入提示一致语义区域,而且这个“持久语义进入指标”是稳定可靠的。
图8:时间步语义进入分析
图8:时间步语义进入分析。(a) 两个提示词在20步预测干净轨迹中均匀取10个检查点,三行分别对应干净推理、CIM with w0、CIM with wσ*;(b–d) 所有步骤上的提示检索top-1准确率;(e) θ=0.30时的持久语义进入指标。

实验验证:三个扩散Transformer模型上的全面恢复

实验覆盖了三个有代表性的DiT模型:文本到图像生成的PixArt-Σ和PixArt-α(512×512,MS-COCO 2014验证集),以及类条件生成的DiT-XL/2(256×256,ImageNet验证集)。每个设置都使用了30,000个样本进行大规模评估。PixArt系列使用DPM-Solver调度器、20步去噪;DiT-XL/2使用50步。所有设置都先在一个独立的3,000样本扫描中确定干净条件下的w0和CIM条件下的w*,然后在3万样本评估中固定使用。
首先看引导尺度的响应曲线。图6清晰展示了FID关于w的变化呈现“有限最小值”而非单调改善:在σCIM∈{0, 0.05}时最优尺度是1.5,随着噪声增强到0.10、0.15、0.20,最优尺度分别移到2.0、2.5、4.5。在σCIM=0.20时,重校准把FID从75.94降到37.42,而继续增大w反而会让FID变差。CLIPScore虽然一直上升然后饱和,但分布质量已经恶化——这说明只追求提示对齐是不够的,必须考虑分布保真度。
图6:3,000提示PixArt-Σ扫描的引导响应
图6:3,000提示PixArt-Σ扫描的引导响应。(a) FID随w变化;(b) CLIPScore随w变化;(c) 在w和wσ*处的FID对比。
表1给出了30,000样本规模下的大规模评估结果。在σCIM=0.20时,重校准把PixArt-Σ的FID从59.22降到20.49,PixArt-α从72.37降到21.12,DiT-XL/2从20.89降到6.62。KID同向变化,条件对齐、精确率、密度和覆盖率也都全面提升。三个模型在σCIM=0.20时,一个共享的重校准尺度就能缩小至少87%的CIM导致FID差距。这个提升幅度确实惊人。
表1:三个扩散Transformer在大规模CIM模拟映射下的评估结果
表1:三个DiT模型在多个模拟CIM映射下的大规模评估(30,000样本/设置)。带噪条目报告w0 → wσ*;两者一致时只显示一个值。下划线标记重校准终点,粗体表示优于干净引导基线。
定性结果同样说明问题。图7展示了PixArt-Σ在σCIM=0.15时的文本到图像生成,以及SD3.5 Medium在σCIM=0.10时的文本渲染。重校准不仅恢复了物体结构和提示特定细节,还让渲染文字更清晰可读——说明恢复不限于聚合分布指标,而是深入到具有挑战性的语义和结构细节。
图7:CIM噪声下的定性对比
图7:CIM噪声下的定性对比。左:PixArt-Σ文本到图像生成(σCIM=0.15,w0=1.5 vs wσ*=2.5);右:SD3.5 Medium文本渲染(σCIM=0.10,w0=1.5 vs wσ*=3.0)。
论文还把引导重校准与其他采样端引导控制方法做了比较,包括CFG Rescale、APG、C²FG和Limited-Interval Guidance,这些方法都在相同的CIM设置下做了配置搜索。结果如下表所示:所有方法都比直接用干净最优尺度好,说明引导残差在CIM噪声下仍然是一个有效的修正通道;但引导重校准直接针对目标运行点的残差强度进行重校准,效果最好。
表2:采样端引导控制方法的FID对比
表2:共享3,000提示PixArt-Σ对比中采样端引导控制方法的FID。
最后,论文通过一组“残差手术”实验进一步确认了故障机制。在σCIM=0.20条件下,分别恢复干净残差的对齐增益、移除正交噪声分量、恢复基础更新:恢复对齐增益把FID从75.41降到44.49,移除正交分量反而使FID恶化到127.75,恢复基础更新只能部分改善(FID=42.83)。这说明正交噪声分量在过度引导下会被急剧放大,是质量崩塌的重要推手;而重校准正是通过放大保留的有用分量、同时避免过度放大正交噪声,找到了一个平衡点。
表3:残差手术分析
表3:残差手术分析(σCIM=0.20,3,000提示)。(a) 端点反事实实验;(b) 从未处理CIM(0)到完整干预(1)的连续插值路径上的FID。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?扩散Transformer部署到模拟存内计算芯片后,无分类器引导残差会被不成比例地扭曲。北大港大团队发现只调CFG缩放系数即可免重训练恢复质量,在三个模型上FID大幅回落,最高缩小87%质量差距。
这篇工作最值得看的点是什么?在σCIM=0.20时,重校准将PixArt-Σ的FID从59.22降至20.49,PixArt-α从72.37降至21.12,DiT-XL/2从20.89降至6.62,均恢复至接近干净推理水平,且所有指标全面改善。
这篇工作的边界或风险在哪里?优点:无需重训练、无需修改模型或采样器,仅调整引导缩放因子即可显著恢复生成质量;方法简单高效,适用于多种DiT模型;提供了轨迹级别的理论解释。缺点:需要针对每个CIM工作条件进行校准扫描;仅调整标量引导缩放因子,无法完全消除CIM非理想性的影响;对极端噪声水平的效果有待验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种无需重训练、仅调整无分类器引导(CFG)缩放因子的采样端重校准方法,以缓解模拟存内计算非理想性对扩散Transformer采样质量的退化。

实验合理度:★★★★☆

FID, KID, CLIPScore, ImageNet Top-1准确率, Precision, Density, Coverage, DINO-clean余弦相似度

学术研究价值:★★★★☆

提出一种无需重训练、仅调整无分类器引导(CFG)缩放因子的采样端重校准方法,以缓解模拟存内计算非理想性对扩散Transformer采样质量的退化;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(论文聚焦于硬件部署下的推理质量,未报告具体计算量)

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:需要针对每个CIM工作条件进行校准扫描;仅调整标量引导缩放因子,无法完全消除CIM非理想性的影响;对极端噪声水平的效果有待验证。

主要参考文献

[1] Yao W, Zhou W. When Guidance Goes Off-Scale: Recalibrating Diffusion Transformers under Analog Compute-in-Memory Nonidealities. arXiv:2608.19644, 2026.
[2] Ho J, Jain A, Abbeel P. Denoising Diffusion Probabilistic Models. NeurIPS, 2020.
[3] Peebles W, Xie S. Scalable Diffusion Models with Transformers. ICCV, 2023.
[4] Ho J, Salimans T. Classifier-Free Diffusion Guidance. arXiv:2207.12598, 2022.
[5] Sebastian A, et al. Memory devices and applications for in-memory computing. Nature Nanotechnology, 2020.
[6] Shafiee A, et al. ISAAC: A Convolutional Neural Network Accelerator with In-Situ Analog Arithmetic in Crossbars. ISCA, 2016.
[7] Chen J, et al. PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis. ICLR, 2024.
[8] Chen J, et al. PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Synthesis. ECCV, 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
存内计算虽好,引导参数别乱调~ 想和龙哥一起追踪扩散模型部署新姿势?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像生成+上海+北大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。