← 返回 PaperDaily
视觉与图像
USTC新方法DNA:89.11%追踪生成图像来源
这篇工作最有意思的地方,不是“又做了一个归因方法”,而是把问题拆成了两层:先认家族,再认具体变体。家族内模型长得太像,单一信号很容易翻车,DNA 直接把 VAE 和 backbone 各自擅长的证据分开用,思路很工程,也很像真正能落地的取证流程。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
这篇工作最有意思的地方,不是“又做了一个归因方法”,而是把问题拆成了两层:先认家族,再认具体变体。家族内模型长得太像,单一信号很容易翻车,DNA 直接把 VAE 和 backbone 各自擅长的证据分开用,思路很工程,也很像真正能落地的取证流程。
原论文信息如下:
揭秘图像生成模型溯源新范式:DNA框架如何实现从家族到变体的精准追踪?
这篇工作最有意思的地方,不是又造了一个“更强分类器”,而是把生成模型的内部结构拆开看:VAE负责家族级线索,backbone负责变体级线索。听起来像一句学术口号,实际上很像办案:先看姓氏,再看身份证号。家族内模型长得太像,单靠一个信号硬猜,基本就是在给取证工作添堵。
DNA 的核心判断非常直接:生成图像的来源追踪,不能只停留在“是否由某类模型生成”,还得继续追到“到底是哪一个版本”。在开源模型生态里,这个问题越来越现实。基础模型、微调版本、蒸馏版本、同家族不同 checkpoint 混在一起,视觉上差异很小,但版权、责任和溯源要求却一点都不含糊。
所以,DNA 的思路不是“再训练一个更大的识别网络”,而是把归因流程拆成两段:先做开放集家族筛选,再做封闭集变体鉴别。前者负责把未知来源挡在门外,后者负责在候选家族内部做精细区分。这个设计很工程,也很像真正的法医流程,不追求一口气吃成胖子,而是先缩小嫌疑范围,再逐个排查。
家族筛选与变体鉴别解耦:VAE→backbone层级带来的“粗到细”洞察
先说人话:生成模型并不是一整块铁板。很多主流潜空间生成模型都由两部分组成,第一部分是 VAE(Variational Autoencoder,变分自编码器),负责把图像压到潜空间里;第二部分是生成 backbone,负责在潜空间里做扩散或者流匹配生成。论文把这两层的“记忆点”分开来看,发现它们擅长的事情不一样。
VAE 更像“家族指纹”。同一家族的不同变体,往往共享同一个 VAE,或者使用高度兼容的 VAE,所以 VAE 的重建行为更容易反映家族共享特征。问题也正出在这里:一旦进入同家族内部,这个信号就开始钝化,像是只知道“同一个小区”,却分不清“哪一栋楼”。
backbone 则更像“个人习惯”。它真正学习的是去噪或流场预测的细节,模型版本不同,训练策略不同,预测误差的分布就会出现细微差异。论文把这类差异称为 native prediction consistency(原生预测一致性),意思是:如果一张图真是某个模型生成的,那么这个模型在处理它时,应该更“顺手”,预测误差也更稳定。
这套“粗到细”的洞察很关键,因为它解释了为什么以前很多被动归因方法总卡在一个尴尬位置:单层信号要么太粗,只能分家族;要么太细,但训练成本高、泛化差。DNA 不是硬把一个信号调到全能,而是承认不同层次的证据本来就不一样,干脆各司其职。
无需训练的归属新思路:AEDR与NPC双阶段协同发力
DNA 的第一阶段叫 AEDR(Autoencoder Double-Reconstruction,自动编码器双重重建)。它不是靠训练一个分类头,而是直接看 VAE 对图像做两次串联重建后的误差变化。直白点说,就是让 VAE 连着“照两遍镜子”,看它对这张图到底有多熟。
为什么要双重重建?因为单次重建容易被图像内容复杂度带偏。两次重建之后,属于同一分布的图像会表现出更稳定的重建特征,而不属于该家族的图像则更容易出现偏移。论文在这里还引入了阈值估计,把不同家族的重建分数变成可比较的筛选信号,用来做开放集判断。
第二阶段是 NPC(Native Prediction Consistency,原生预测一致性)。这个模块更像“问卷调查”:把图像对应的潜变量加上不同强度的噪声,再喂给候选模型,看它在多个噪声水平下的预测误差是否稳定、是否更低。若图像真属于某个模型,这个模型通常在自己的“地盘”上会更稳,误差曲线也更占优。
NPC 里还有两个很实用的小动作。第一是只挑选具有区分力的噪声步,避免把所有时间步都拿来硬算,省掉一堆无效开销;第二是把误差做标准化和校准,减少不同图像、不同模型之间的尺度差异。说白了,就是不让“谁嗓门大谁赢”,而是尽量让真正的源模型靠证据说话。
这一步的价值在于,它没有把方法绑死在某一种生成范式上。现在很多工作只在扩散模型上好使,换到 flow matching 就开始“水土不服”。DNA 的做法更像是在统一底层逻辑后再设计归因规则,兼容性明显更强。
实验验证:DNA在六个家族中端到端准确率超过89%,远超基线方法
为了把这件事讲清楚,论文专门构建了 DNA-30K。它包含 3 万张图像,覆盖 6 个家族、24 个候选模型,同时还加入未知生成图像和自然图像。这个设计很重要,因为真实取证场景里,输入图片并不保证来自“已知列表”,开放集拒识是必须项。
先看阶段一。论文用多种二分类和开放集设置验证 AEDR 的家族筛选能力。整体上,AEDR 能把家族级别的候选范围压得比较稳,说明 VAE 这层信号确实适合做“先筛一遍”的粗粒度判断。更重要的是,它不是只在单一家庭里表现好,而是在家族数增加时仍能维持较强区分度。
再看阶段二。论文把真实家族作为 oracle 输入,单独考察 NPC 的变体级鉴别能力。结果很有说服力:DNA 在同家族内的混淆矩阵里,错误主要集中在相邻变体之间,而不是像一些基线那样“满天飞”。这说明 NPC 不是靠模糊特征乱猜,而是确实抓到了模型内部的细粒度差异。
最终的端到端结果是这篇论文最亮眼的地方之一。DNA 在六个家族上的总体归因准确率达到 89.11%,而随机猜测只有不到 1%。这不是“涨了几个点”的小修小补,而是在一个明显更难的任务上,把可用性从“基本没戏”拉到了“值得认真看”。
更关键的是,论文不是只报一个总分,而是做了模块组合、候选规模扩展、采样配置变化、校准样本减少等多组验证。结果显示,DNA 对超参数不算敏感,校准样本少时也还能保持较稳的表现。这一点很重要,因为取证方法如果特别娇气,实验室里再漂亮,真进系统就容易翻车。
论文还专门比较了不同语义条件输入方式。结果表明,使用真实提示词最好,使用自动生成描述也能维持不错表现,而完全不加语义条件则会损失一部分精度。这说明 NPC 并不是纯靠噪声统计,它确实利用了语义约束来增强原生预测一致性的可分性。
现实挑战与未来方向:JPEG压缩下的鲁棒性提升与开放集归属探索
这篇论文的优点很明确,但边界也同样清楚。首先,DNA 主要针对的是“已知家族 + 已知变体”的归因框架,真正更难的情况是:候选家族里没有这个变体,甚至没有这个家族。论文已经做了开放集家族拒识,但对同家族未知变体的开放集归属,仍然只是初步探索。
其次,论文自己也展示了对 JPEG 压缩等现实扰动的讨论。生成图像在传播过程中经常会被二次压缩、裁剪、缩放,甚至被平台重新编码;这类变化会让原本细粒度的预测一致性信号变弱。也就是说,DNA 已经比很多基线更像能上岗的工具,但要变成“平台级取证组件”,还得继续补鲁棒性这门课。
不过,这项工作真正值得肯定的地方在于,它没有把问题包装成“一个万能模型解决一切”,而是老老实实承认:图像溯源本来就是层级化问题。先做家族筛选,再做变体鉴别,既符合模型结构,也符合工程现实。这个思路如果继续往前推,很可能会成为生成图像取证里更实用的一条主线。
龙迷三问
这篇论文到底解决什么问题?它解决的是“生成图片来自哪个模型”的溯源问题,而且不是只分辨大类,而是要在同家族的多个相似变体之间精确定位来源。这个问题比普通真假检测更难,也更贴近版权追踪和责任归因。
AEDR 和 NPC 分别是什么意思?AEDR 是 Autoencoder Double-Reconstruction,指用 VAE 做两次串联重建来做家族级筛选;NPC 是 Native Prediction Consistency,指比较候选模型在多个噪声水平下的原生预测误差,用来做变体级鉴别。前者看“像不像这个家族”,后者看“是不是这个具体版本”。
为什么要分两阶段,而不是一个模型直接判完?因为家族级证据和变体级证据本来就不在同一层。VAE 更适合做粗筛,backbone 更适合做细分;硬把两种信号揉成一个分类器,既难训练,也容易把未知来源和相似变体混在一起。分两阶段,反而更符合生成模型的结构现实。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆。创新点不在“又发明了一个更大网络”,而在于把层级归因讲通了:VAE 做家族筛选,backbone 做变体鉴别,思路清楚,且和问题结构贴得很紧。
实验合理度:★★★★☆。有 DNA-30K、开放集评估、消融、鲁棒性、校准样本和候选规模扩展,验证链条比较完整;如果能再补更多真实平台压缩和跨域传播场景,会更像工业取证。
学术研究价值:★★★★☆。这篇工作对生成模型归因的层级化理解很有启发,尤其对“同家族变体”这个长期被忽略的难点,给出了比较系统的处理方式。
稳定性:★★★☆☆。在校准样本和采样配置变化下表现还算稳,但面对真实网络传播中的裁剪、重压缩、二次编辑,仍需要更多验证。
适应性以及泛化能力:★★★☆☆。对扩散和流匹配都能覆盖,这是加分项;但开放集家族外未知变体的处理还不够彻底,泛化边界仍然清晰。
硬件需求及成本:★★★★☆。不需要训练额外网络是大优点,阶段一和阶段二都以查询和重建为主,整体比重训练型归因方法更友好。
复现难度:★★★☆☆。方法逻辑不复杂,但要复现 DNA-30K、校准流程和两阶段阈值设置,还是有一定工程量的。
产品化成熟度:★★★☆☆。适合作为取证辅助模块或研究原型,离大规模在线平台的“自动判案”还有距离,尤其要补真实场景鲁棒性。
可能的问题:同家族未知变体和真实传播扰动下仍可能掉点,开放集家族外拒识虽有结果,但离全面可部署还差最后一公里。
主要参考文献
[1] DDPM: Denoising Diffusion Probabilistic Models.
[3] Latent Diffusion Models.
[34] AEDR: Autoencoder Double-Reconstruction for Generated Image Source Tracing.
[Current] DNA: Dual-stage Native Attribution for Generated Image Source Tracing. https://arxiv.org/pdf/2607.13685v1.pdf
*图像溯源这事,最怕“看着都像,实际不是一回事”。想继续追更AI论文的拆解、代码和招聘信息,欢迎进龙哥读论文星球,一起把复杂论文拆成大白话~

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),一起聊图像溯源、生成模型和AI落地,少走弯路,多看门道。

