← 返回 PaperDaily 视觉与图像

USTC新方法DNA:89.11%追踪生成图像来源

这篇工作最有意思的地方,不是“又做了一个归因方法”,而是把问题拆成了两层:先认家族,再认具体变体。家族内模型长得太像,单一信号很容易翻车,DNA 直接把 VAE 和 backbone 各自擅长的证据分开用,思路很工程,也很像真正能落地的取证流程。

USTC新方法DNA:89.11%追踪生成图像来源
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇工作最有意思的地方,不是“又做了一个归因方法”,而是把问题拆成了两层:先认家族,再认具体变体。家族内模型长得太像,单一信号很容易翻车,DNA 直接把 VAE 和 backbone 各自擅长的证据分开用,思路很工程,也很像真正能落地的取证流程。


原论文信息如下:
论文标题:
DNA: Dual-stage Native Attribution for Generated Image Source Tracing
发表日期:
2026年07月
发表单位:
中国科学技术大学、合肥工业大学
原文链接:
https://arxiv.org/pdf/2607.13685v1.pdf

揭秘图像生成模型溯源新范式:DNA框架如何实现从家族到变体的精准追踪?

封面
图1:问题设定与DNA提出的整体范式。论文要解决的不是“这图是不是AI画的”,而是“这图到底是哪一个生成模型做出来的”。在开放集场景下,未知来源图片先要判断是否属于已知家族,再进一步锁定具体变体,这才是真正能落地的取证问题。
这篇工作最有意思的地方,不是又造了一个“更强分类器”,而是把生成模型的内部结构拆开看:VAE负责家族级线索,backbone负责变体级线索。听起来像一句学术口号,实际上很像办案:先看姓氏,再看身份证号。家族内模型长得太像,单靠一个信号硬猜,基本就是在给取证工作添堵。
DNA 的核心判断非常直接:生成图像的来源追踪,不能只停留在“是否由某类模型生成”,还得继续追到“到底是哪一个版本”。在开源模型生态里,这个问题越来越现实。基础模型、微调版本、蒸馏版本、同家族不同 checkpoint 混在一起,视觉上差异很小,但版权、责任和溯源要求却一点都不含糊。
所以,DNA 的思路不是“再训练一个更大的识别网络”,而是把归因流程拆成两段:先做开放集家族筛选,再做封闭集变体鉴别。前者负责把未知来源挡在门外,后者负责在候选家族内部做精细区分。这个设计很工程,也很像真正的法医流程,不追求一口气吃成胖子,而是先缩小嫌疑范围,再逐个排查。

家族筛选与变体鉴别解耦:VAE→backbone层级带来的“粗到细”洞察

先说人话:生成模型并不是一整块铁板。很多主流潜空间生成模型都由两部分组成,第一部分是 VAE(Variational Autoencoder,变分自编码器),负责把图像压到潜空间里;第二部分是生成 backbone,负责在潜空间里做扩散或者流匹配生成。论文把这两层的“记忆点”分开来看,发现它们擅长的事情不一样。
VAE 更像“家族指纹”。同一家族的不同变体,往往共享同一个 VAE,或者使用高度兼容的 VAE,所以 VAE 的重建行为更容易反映家族共享特征。问题也正出在这里:一旦进入同家族内部,这个信号就开始钝化,像是只知道“同一个小区”,却分不清“哪一栋楼”。
backbone 则更像“个人习惯”。它真正学习的是去噪或流场预测的细节,模型版本不同,训练策略不同,预测误差的分布就会出现细微差异。论文把这类差异称为 native prediction consistency(原生预测一致性),意思是:如果一张图真是某个模型生成的,那么这个模型在处理它时,应该更“顺手”,预测误差也更稳定。
图2
图2:两层结构上的归因信号对比。左边说明 VAE 信号在跨家族时很有区分度,但在同家族变体之间会塌缩;右边说明 backbone 的原生预测误差在不同噪声水平下能拉开源模型与非源模型的差距,经过归一化后,真正的源模型会得到最低分。
这套“粗到细”的洞察很关键,因为它解释了为什么以前很多被动归因方法总卡在一个尴尬位置:单层信号要么太粗,只能分家族;要么太细,但训练成本高、泛化差。DNA 不是硬把一个信号调到全能,而是承认不同层次的证据本来就不一样,干脆各司其职。
图3
图3:DNA 的整体流程。查询图像先经过 AEDR 做开放集家族判断,若被判为未知来源,流程直接结束;若落入某个已知家族,再交给 NPC 做家族内的变体级归因。

无需训练的归属新思路:AEDR与NPC双阶段协同发力

DNA 的第一阶段叫 AEDR(Autoencoder Double-Reconstruction,自动编码器双重重建)。它不是靠训练一个分类头,而是直接看 VAE 对图像做两次串联重建后的误差变化。直白点说,就是让 VAE 连着“照两遍镜子”,看它对这张图到底有多熟。
为什么要双重重建?因为单次重建容易被图像内容复杂度带偏。两次重建之后,属于同一分布的图像会表现出更稳定的重建特征,而不属于该家族的图像则更容易出现偏移。论文在这里还引入了阈值估计,把不同家族的重建分数变成可比较的筛选信号,用来做开放集判断。
图4
图4:DNA 的细节流程图。上半部分是 AEDR:通过核密度估计(KDE, Kernel Density Estimation,核密度估计)来设定阈值,完成家族识别与拒识;下半部分是 NPC:先选出具有区分力的噪声步,再在语义条件下计算原生预测误差,最终完成变体鉴别。
第二阶段是 NPC(Native Prediction Consistency,原生预测一致性)。这个模块更像“问卷调查”:把图像对应的潜变量加上不同强度的噪声,再喂给候选模型,看它在多个噪声水平下的预测误差是否稳定、是否更低。若图像真属于某个模型,这个模型通常在自己的“地盘”上会更稳,误差曲线也更占优。
NPC 里还有两个很实用的小动作。第一是只挑选具有区分力的噪声步,避免把所有时间步都拿来硬算,省掉一堆无效开销;第二是把误差做标准化和校准,减少不同图像、不同模型之间的尺度差异。说白了,就是不让“谁嗓门大谁赢”,而是尽量让真正的源模型靠证据说话。
表2
表2:扩散模型与流匹配模型在“原生预测”视角下的统一写法。论文把两类模型都写成“先构造带噪潜变量,再预测对应原生目标”的形式,这样 NPC 就能在同一框架下同时适配 denoising diffusion(去噪扩散)flow matching(流匹配)
这一步的价值在于,它没有把方法绑死在某一种生成范式上。现在很多工作只在扩散模型上好使,换到 flow matching 就开始“水土不服”。DNA 的做法更像是在统一底层逻辑后再设计归因规则,兼容性明显更强。

实验验证:DNA在六个家族中端到端准确率超过89%,远超基线方法

为了把这件事讲清楚,论文专门构建了 DNA-30K。它包含 3 万张图像,覆盖 6 个家族、24 个候选模型,同时还加入未知生成图像和自然图像。这个设计很重要,因为真实取证场景里,输入图片并不保证来自“已知列表”,开放集拒识是必须项。
表1
表1:现有归因基准的对比。可以看到,之前不少数据集要么偏向跨架构、要么偏向大规模分类,但对“同家族变体归因”覆盖不足,尤其是同时覆盖扩散与流匹配、还带开放集评估的基准并不多。
表3
表3:DNA-30K 的组成。每个模型提供 1000 张图像,均分为 500 张校准集和 500 张测试集。这个划分很朴素,但对训练无关方法来说足够关键,因为阈值、时间步和校准参数都要靠这部分小样本来估计。
先看阶段一。论文用多种二分类和开放集设置验证 AEDR 的家族筛选能力。整体上,AEDR 能把家族级别的候选范围压得比较稳,说明 VAE 这层信号确实适合做“先筛一遍”的粗粒度判断。更重要的是,它不是只在单一家庭里表现好,而是在家族数增加时仍能维持较强区分度。
表5
表5:六个家族上的阶段一开放集归因准确率。这里看的不是“能不能识别某张图”,而是“能不能把它稳稳地分到正确家族,或者果断拒绝未知来源”。
图6
图6:当候选家族数量从 1 增加到 6 时,阶段一准确率的变化。曲线整体仍明显高于随机基线,说明 AEDR 的家族筛选并不是“碰运气”。
再看阶段二。论文把真实家族作为 oracle 输入,单独考察 NPC 的变体级鉴别能力。结果很有说服力:DNA 在同家族内的混淆矩阵里,错误主要集中在相邻变体之间,而不是像一些基线那样“满天飞”。这说明 NPC 不是靠模糊特征乱猜,而是确实抓到了模型内部的细粒度差异。
图5
图5:六个家族上阶段二的闭集混淆矩阵。DNA 的错误更集中、边界更清晰,说明它对同家族变体的区分能力确实更强。
最终的端到端结果是这篇论文最亮眼的地方之一。DNA 在六个家族上的总体归因准确率达到 89.11%,而随机猜测只有不到 1%。这不是“涨了几个点”的小修小补,而是在一个明显更难的任务上,把可用性从“基本没戏”拉到了“值得认真看”。
更关键的是,论文不是只报一个总分,而是做了模块组合、候选规模扩展、采样配置变化、校准样本减少等多组验证。结果显示,DNA 对超参数不算敏感,校准样本少时也还能保持较稳的表现。这一点很重要,因为取证方法如果特别娇气,实验室里再漂亮,真进系统就容易翻车。
表9
表9:计算开销与准确率对比。DNA 的优势不是“只靠堆算力赢”,而是在训练-free 的前提下,把速度、准确率和开放集能力做到了较平衡的状态。
表10
表10:不同生成时采样配置下的鲁棒性。即使采样设置变化,DNA 依然能保持比较稳定的阶段一、阶段二和端到端表现,说明它并不只是在某个“理想参数点”上好看。
表11
表11:校准样本减少时的表现。样本越少,系统越容易抖,但 DNA 仍维持了可用的识别能力,说明它对标注资源的依赖并不算重。
表14
表14:组件消融实验。消融结果说明,AEDR 负责“先把家族找准”,NPC 负责“再把变体分清”,两者叠加后才能把端到端性能推到最高。
论文还专门比较了不同语义条件输入方式。结果表明,使用真实提示词最好,使用自动生成描述也能维持不错表现,而完全不加语义条件则会损失一部分精度。这说明 NPC 并不是纯靠噪声统计,它确实利用了语义约束来增强原生预测一致性的可分性。
表15
表15:不同语义条件策略下的阶段二表现。语义信息不是装饰品,而是 NPC 的有效辅助信号。

现实挑战与未来方向:JPEG压缩下的鲁棒性提升与开放集归属探索

这篇论文的优点很明确,但边界也同样清楚。首先,DNA 主要针对的是“已知家族 + 已知变体”的归因框架,真正更难的情况是:候选家族里没有这个变体,甚至没有这个家族。论文已经做了开放集家族拒识,但对同家族未知变体的开放集归属,仍然只是初步探索。
表16
表16:同家族开放集拒识分析。这个结果说明,面对家族内部未知变体时,系统还能看到一定的可分性,但离“完全放心交给系统自动判案”还有距离。
其次,论文自己也展示了对 JPEG 压缩等现实扰动的讨论。生成图像在传播过程中经常会被二次压缩、裁剪、缩放,甚至被平台重新编码;这类变化会让原本细粒度的预测一致性信号变弱。也就是说,DNA 已经比很多基线更像能上岗的工具,但要变成“平台级取证组件”,还得继续补鲁棒性这门课。
不过,这项工作真正值得肯定的地方在于,它没有把问题包装成“一个万能模型解决一切”,而是老老实实承认:图像溯源本来就是层级化问题。先做家族筛选,再做变体鉴别,既符合模型结构,也符合工程现实。这个思路如果继续往前推,很可能会成为生成图像取证里更实用的一条主线。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“生成图片来自哪个模型”的溯源问题,而且不是只分辨大类,而是要在同家族的多个相似变体之间精确定位来源。这个问题比普通真假检测更难,也更贴近版权追踪和责任归因。

AEDR 和 NPC 分别是什么意思?AEDR 是 Autoencoder Double-Reconstruction,指用 VAE 做两次串联重建来做家族级筛选;NPC 是 Native Prediction Consistency,指比较候选模型在多个噪声水平下的原生预测误差,用来做变体级鉴别。前者看“像不像这个家族”,后者看“是不是这个具体版本”。

为什么要分两阶段,而不是一个模型直接判完?因为家族级证据和变体级证据本来就不在同一层。VAE 更适合做粗筛,backbone 更适合做细分;硬把两种信号揉成一个分类器,既难训练,也容易把未知来源和相似变体混在一起。分两阶段,反而更符合生成模型的结构现实。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。创新点不在“又发明了一个更大网络”,而在于把层级归因讲通了:VAE 做家族筛选,backbone 做变体鉴别,思路清楚,且和问题结构贴得很紧。

实验合理度:★★★★☆。有 DNA-30K、开放集评估、消融、鲁棒性、校准样本和候选规模扩展,验证链条比较完整;如果能再补更多真实平台压缩和跨域传播场景,会更像工业取证。

学术研究价值:★★★★☆。这篇工作对生成模型归因的层级化理解很有启发,尤其对“同家族变体”这个长期被忽略的难点,给出了比较系统的处理方式。

稳定性:★★★☆☆。在校准样本和采样配置变化下表现还算稳,但面对真实网络传播中的裁剪、重压缩、二次编辑,仍需要更多验证。

适应性以及泛化能力:★★★☆☆。对扩散和流匹配都能覆盖,这是加分项;但开放集家族外未知变体的处理还不够彻底,泛化边界仍然清晰。

硬件需求及成本:★★★★☆。不需要训练额外网络是大优点,阶段一和阶段二都以查询和重建为主,整体比重训练型归因方法更友好。

复现难度:★★★☆☆。方法逻辑不复杂,但要复现 DNA-30K、校准流程和两阶段阈值设置,还是有一定工程量的。

产品化成熟度:★★★☆☆。适合作为取证辅助模块或研究原型,离大规模在线平台的“自动判案”还有距离,尤其要补真实场景鲁棒性。

可能的问题:同家族未知变体和真实传播扰动下仍可能掉点,开放集家族外拒识虽有结果,但离全面可部署还差最后一公里。


主要参考文献

[1] DDPM: Denoising Diffusion Probabilistic Models.
[2] Flow Matching.
[3] Latent Diffusion Models.
[34] AEDR: Autoencoder Double-Reconstruction for Generated Image Source Tracing.
[Current] DNA: Dual-stage Native Attribution for Generated Image Source Tracing. https://arxiv.org/pdf/2607.13685v1.pdf

*图像溯源这事,最怕“看着都像,实际不是一回事”。想继续追更AI论文的拆解、代码和招聘信息,欢迎进龙哥读论文星球,一起把复杂论文拆成大白话~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),一起聊图像溯源、生成模型和AI落地,少走弯路,多看门道。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。