← 返回 PaperDaily 视觉与图像

共享VAE也不怕:UIUC新方法靠去噪器频谱指纹破案

这篇论文最有意思的地方,不是“又做了一个归因器”,而是直接把目光从生成结果挪到了去噪器本身。8个扩散模型里,哪怕是共享VAE、共享骨干的近亲,SDS 也能把它们分开,实用性很强。

共享VAE也不怕:UIUC新方法靠去噪器频谱指纹破案
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是“又做了一个归因器”,而是直接把目光从生成结果挪到了去噪器本身。8个扩散模型里,哪怕是共享VAE、共享骨干的近亲,SDS 也能把它们分开,实用性很强。


原论文信息如下:
论文标题:
Diffusion Model Attribution via Spectral Coupling of Denoiser Responses
发表日期:
2026年06月
发表单位:
University of Illinois Urbana-Champaign
原文链接:
https://arxiv.org/pdf/2606.28321v1.pdf
开源代码链接:
https://github.com/Pragati-Meshram/SGS
项目链接:
https://github.com/Pragati-Meshram/SGS

揭秘AI生成图像的“身世之谜”:8个模型无一错判,准确率99.9%

生成图像这件事,早就不是“看起来像不像”那么简单了。真正麻烦的是:一张图生成得再漂亮,也可能根本说不清它到底出自哪个扩散模型。更糟糕的是,许多模型共享相似骨干、相同编码器,甚至训练得像“亲兄弟”,导致只看最终图片,归因信号几乎被抹平。
这篇论文的思路很直接,也很狠:别盯着图像本身,去盯着去噪器怎么“想”。作者提出 Spectral Denoising Signatures,简称 SDS(Spectral Denoising Signatures,频谱去噪签名)。它不是靠重建、反演,也不是靠水印,而是给扩散模型的去噪过程做一次“频谱体检”,看看不同模型在处理频率扰动时,能量是怎么在各个频段之间流动的。
封面
图1:SDS 在 8 个扩散模型上做源模型归因的整体表现示意。最抓眼球的点不是“又做了个分类器”,而是它几乎把那些共享 VAE、共享骨干的近似模型也分开了。

现有方法之困:为什么说“看图像”归因不靠谱?

先把问题说人话:如果只给一张生成图,想判断它出自 Stable Diffusion、SDXL,还是 PixArt-α,听上去像侦探破案,实际更像“盲猜”。因为扩散模型不是一次性吐图,而是一步步去噪;而且不同模型在训练数据、骨干结构、微调方式上差异很大,但最后产物可能长得非常像。尤其当模型共享同一个自编码器时,图像层面的差别会进一步缩小,很多基于输出图像的归因方法就会直接失灵。
论文里点名批评了两类方法。第一类是“看最终图”的分类器方法,问题是输出太像,特征太弱;第二类是做反演、看重建损失的方法,问题是太慢,而且一旦候选模型共享编码器,重建误差就会一起“躺平”,谁也分不出来。说白了,图像是结果,不一定是证据。真正有辨识度的,可能藏在模型生成过程里,而不是最后那张图上。
这也是 SDS 的切入点:不去问“它生成了什么”,而去问“它是怎么把噪声一点点改写成图像的”。这个角度一换,很多原来靠输出空间硬猜的方案,就显得有点像拿体温计测血压——不是完全没用,但方向确实不对。

核心洞察:模型“指纹”藏在去噪器的“思想”里

扩散模型的去噪器,本质上是在学一个“从噪声回到数据分布”的方向场。论文里把这个方向场和 score function(得分函数) 联系起来:它近似描述了在某个噪声状态下,数据分布往哪里更“像真图”。这意味着,模型的训练数据、架构偏好、蒸馏方式等信息,不只会体现在最后生成结果上,也会体现在去噪时对不同频率成分的处理方式上。
作者做了一个很关键的观察:即便是 SD v1.4 和 SD v1.5 这种“近亲”,只看图片几乎分不出差别,但只要拿频率扰动去试探它们的去噪反应,模型之间的差异就会从“隐身状态”浮出来。更有意思的是,这种差异不是靠某一张图的局部纹理凑出来的,而是一个跨频段、跨时间步的整体几何结构。论文把它称为 spectral geometry(频谱几何)
这个判断很重要,因为它解释了为什么 SDS 能把“看起来差不多”的模型分开:它不是在找某个脆弱的像素痕迹,而是在找模型在去噪过程中形成的稳定路数。换句话说,图像像不像,未必重要;去噪时怎么分配频率能量,才更像模型身份证。🤔
图2:频谱耦合签名与图像特征的可分性对比
图2:频谱耦合签名是线性可分的,而像素特征和傅里叶特征几乎看不出差别。这个图基本把论文的核心逻辑说透了:真正能分模型的,不是最终图像表面那层“妆”,而是去噪器内部对频率扰动的响应方式。

Spectral Denoising Signatures (SDS) 原理:给去噪器做“脑电波”检查

SDS 的流程可以理解成三步:先把图像变成统一的潜变量,再往不同频率环里塞一点“定向噪声”,最后看去噪器如何把这些噪声重新分配到各个频段。这个过程不需要反演、不需要优化,也不需要改模型参数,基本就是老老实实做前向查询。
图3:SDS整体流程图
图3:SDS 的整体流程。上半部分是原型构建:参考图像先经过共享 VAE 编码成潜变量,再在不同频率环上注入带限噪声,记录去噪残差中的跨频段能量耦合,最后对多张图取平均得到模型原型。下半部分是源模型归因:未知来源图像按同样方式提取签名,再和原型做匹配,找出最像的候选模型。
它的关键设计,藏在“频率耦合”这四个字里。论文不是简单统计某个频段的能量,而是看“输入某个频段后,输出能量跑到了哪些频段”。这就像做脑电图,不是只看大脑有没有信号,而是看信号在不同脑区之间怎么联动。作者把频域分成若干同心环,每个环代表一段空间频率:低频更像全局结构,高频更像细节纹理。然后在某个环上施加扰动,观察去噪器残差在其他环里怎么分布,最终形成一个 K×K 的耦合矩阵
这个矩阵不是一次就够,而是会在多个时间步、多个扰动强度下重复采样。论文里把频率环数记作 K,扰动强度个数记作 S,采样时间步数记作 Tn。这里的 Tn(number of probing timesteps,探测时间步数量) 不是扩散总步数,而是挑出来专门做探测的若干步。最终把这些矩阵展平,就得到模型签名。默认设置下,签名维度是 3×5×8×8 = 960。
图4:t-SNE可视化对比
图4:SDS 签名的 t-SNE 可视化。左图是分类器前的原始签名空间,已经能看到部分模型自然聚类;右图是经过线性投影后的结果,8 个模型几乎完全分开。这个图说明了一件事:SDS 不是“分类器硬背答案”,而是签名空间本身就带有明显结构。
更妙的是,它还把“原型”这个概念用得很实。对每个候选模型,作者只要用少量参考图像提取签名并求平均,就能得到一个模型原型。查询图像的签名与这些原型做相似度比较,就能直接定位来源模型。也就是说,SDS 既能走“零训练”的原型匹配路线,也能走监督分类路线;而实验告诉读者,线性分类器已经足够强,说明这个签名空间的分离并不是偶然。
如果把整个方法翻成一句话,就是:给模型输入一组频率“刺激”,再观察它的去噪反应曲线,最后把反应曲线当成模型指纹。这套思路的漂亮之处在于,它把“模型身份”从输出图像中剥离出来,落到了去噪函数本身上,既更稳定,也更符合扩散模型的工作机理。

实验结果分析

这组实验设计,整体上是比较“会挑事”的:作者不是拿几个差异很大的模型简单过一遍,而是专门选了一个难度很高的闭集场景,里面既有同骨干、同 VAE、只换数据的模型,也有架构差异很大的模型,还有蒸馏出来的变体。换句话说,能分开这些模型,才说明方法不是靠投机取巧。
从结果结构上看,SDS 的优势不是“某一项偶尔高一点”,而是在最难的共享 VAE 场景里也没塌。这很关键,因为很多归因方法一遇到相似模型就开始掉链子,最后只能在容易样本上刷分。SDS 的高分说明它抓到的是更底层、更稳定的模型差异,而不是表层输出噪声。
表1:不同提示词分布上的归因准确率
表1:在不同提示词分布上的 Top-1 准确率。原型来自 SD-Prompts,直接拿去 MS-COCO 上测试。可以看到,训练型分类器会有一定掉点,但线性分类器仍能保持 96.20% 的准确率,说明签名确实有较强的模型内在属性;而零训练的原型匹配几乎不受提示词分布变化影响,说明原型中心本身很稳定。
这件事背后的逻辑也很顺:SDS 在做签名时用了共享 VAE、统一 scheduler、空文本条件,这些设计都在尽量消掉内容因素,让签名更多反映模型本身。于是当提示词从 SD-Prompts 换到 MS-COCO 时,原型几乎不动,分类器边界只会轻微漂移。也就是说,掉点不是因为方法失效,而是因为监督分类器学到了一点分布相关边界;真正的签名核心仍然相当稳。
表3:与非侵入式基线方法的对比
表3:与 RONAN、LATENTTRACER 的对比。基线方法依赖解码器重建损失,一旦候选模型共享自编码器,分数就会集体失灵;SDS 直接看去噪器,结果在 8 个模型上几乎全满分。这个对比非常说明问题:不是基线不努力,而是它们盯错了对象。
鲁棒性实验也很有说服力。旋转、JPEG 压缩、裁剪、亮度变化这些操作,对 SDS 的影响很小;噪声和模糊会让原型匹配更难,但线性分类器依然能稳住。这里并不矛盾,因为这些扰动主要破坏的是像素表面,而 SDS 看的却是去噪器对频率扰动的响应结构。只要模型的去噪几何没变,外部图像做点“美容手术”并不会把指纹抹掉。
图5:8模型混淆矩阵
图5:8 个扩散模型的混淆矩阵结果。最难的仍然是 SD v1.4 和 SD v1.5,这也符合直觉——它们共享大量权重,确实最像“同门师兄弟”。但线性分类器在这组实验里几乎把所有混淆都清掉了,整体 Top-1 准确率达到 99.9%。
如果只看这一组结果,SDS 的结论已经很清楚:模型身份不是写在图像表面,而是藏在去噪轨迹里。而且这种信号不是玄学,能被线性模型直接读出来,说明它在签名空间里足够规整、足够稳定。对工程落地来说,这比“某个复杂神经分类器偶尔跑得很高”更有价值,因为线性分类器更便宜、更可解释,也更容易部署。

总结与展望:一个可靠的AI“侦探工具”

SDS 最值得肯定的地方,不是“又把准确率刷高了”,而是它把扩散模型归因这件事,重新放回了扩散模型最本质的部件——去噪器。它证明了一个很朴素但很重要的判断:当输出图像不够可靠时,应该去看生成过程中的内部机制,而不是继续在结果图上打转。
当然,这个方法也不是“万能钥匙”。它目前是闭集归因,前提是候选模型集合已知;它还需要对白盒候选模型有前向访问;而且原型构建阶段仍然依赖一定数量的参考图像。换句话说,它非常像一把高精度的侦探工具,但不是开箱即用的黑盒魔法。
不过,正因为它抓住的是去噪几何而非表面特征,这个方向很值得继续挖。后续如果能把闭集扩展到开放集、把白盒访问要求进一步压缩,或者把签名提取做成更轻量的在线检测模块,SDS 就不只是论文里的漂亮结果,而可能成为生成内容溯源系统里的一个实用组件。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“生成图像到底是谁做的”这个归因问题。以前很多方法盯着最终图片或重建误差,遇到共享编码器、相似架构就容易失效;SDS 直接看去噪器的频谱响应,所以能把 8 个扩散模型分得很开。

SDS 里的“频谱耦合”是什么意思?就是给某个频率环加扰动,再看去噪器把这股能量分配到哪些输出频段。它不是只看某一层特征,而是看频率之间怎么“串门”,因此更像模型的行为指纹。

为什么线性分类器就够用了?因为签名空间里不同模型已经形成了明显的全局均值差异,线性边界就能把它们分开。这个结果反过来也说明:SDS 抓到的是规整、稳定、可分的模型差异,而不是靠复杂模型硬记忆样本。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把归因信号从输出图像转移到去噪器频谱耦合上,这个角度挺新,而且切得很准,不是那种“换个名字继续做分类”的小修小补。

实验合理度:★★★★★

八模型闭集、共享 VAE、跨提示词、强扰动、强基线,难度给得很足;结果也和方法设计一致,可信度比较高。

学术研究价值:★★★★★

它回答了一个很基础也很关键的问题:扩散模型的“身份信息”到底藏在哪里。这个回答对后续溯源、版权、检测都很有启发。

稳定性:★★★★☆

对常见图像扰动很稳,但前提仍是白盒访问候选模型,且主要面向闭集归因;工程上能用,但不是随手就能扔进黑盒场景。

适应性以及泛化能力:★★★★☆

跨提示词、跨数据分布表现不错,说明签名本身挺稳;但开放集、未知模型、未知采样器下的表现还需要进一步验证。

硬件需求及成本:★★★☆☆

单次只做前向查询,推理成本不算离谱,但要对多个时间步、多种频率环、多种扰动重复 probing,整体开销仍比普通分类高。

复现难度:★★★★☆

代码已开源,方法流程也比较清楚;难点主要在于模型环境、VAE 共享设置和 probing 细节要对齐,不算特别轻松,但可复现性不错。

产品化成熟度:★★★☆☆

适合做内容溯源、版权审查、模型归因的专业工具模块,但要进产品还得补开放集识别、候选库管理和更轻量化的在线检测链路。

可能的问题:方法依赖白盒候选访问和闭集假设,开放集与大规模候选库下的成本和误报控制还没完全交代清楚。


主要参考文献

Pragati Shuddhodhan Meshram, Varun Chandrasekaran. Diffusion Model Attribution via Spectral Coupling of Denoiser Responses. arXiv:2606.28321v1, 2026.
项目代码:https://github.com/Pragati-Meshram/SGS

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
扩散模型、图像生成、模型安全、论文拆解都在群里聊,少走弯路,少看营销,多看硬货。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。