← 返回 PaperDaily 视觉与图像

Adobe新作:给扩散模型加“概念级”水印,画风被抄也能溯源91%+

AI生成内容的版权保护一直是个复杂话题。生成一张"梵高风格的戴珍珠耳环的猫"成本不到一秒,但版权归属问题却难以解决。传统水印在像素空间里做文章,但容易失效。

Adobe新作:给扩散模型加“概念级”水印,画风被抄也能溯源91%+
原论文信息如下:
论文标题:
TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery
发表日期:
2026年02月
发表单位:
Adobe Research, University of California, San Diego, DECaDE, University of Surrey
原文链接:
https://arxiv.org/pdf/2602.19019.pdf

当一张图里同时有"猫"和"梵高画风",你能证明谁才是原创吗?看看Adobe的TokenTrace给AI内容加了怎样的"隐形身份证"?🤚

AI生成内容的版权保护一直是个复杂话题。生成一张"梵高风格的戴珍珠耳环的猫"成本不到一秒,但版权归属问题却难以解决。传统水印在像素空间里做文章,但容易失效。Adobe的TokenTrace选择在"提示词语义空间"中嵌入水印,确保概念的独立验证。

图4:多自定义概念预测的定性示例

从"一个token"到"一幅画":水印如何与概念语义深度绑定?

Token在自然语言处理中是"词元"。提示词会被切成几个token,每个token转换成高维向量,组成提示词嵌入,指导扩散模型生成图像。传统水印方法倾向于整体标记图像,难以区分独立概念。TokenTrace让水印跟随语义走,直接在令牌嵌入阶段嵌入密钥信息,确保概念的独立验证。

图2:TokenTrace整体流程图。

双条件嵌入:为什么同时扰动文本和噪声能破解多概念归因难题?

TokenTrace提出"双条件嵌入",并行扰动文本提示嵌入和初始化噪声。文本令牌上的水印提供概念特异性,潜在空间中的高斯扰动提供几何稳固性。秘密被同时映射到"说了什么"和"怎么起笔"两个层面,确保水印的完整性。

查询式解码:如何从一张图中精准"提取"每个概念的独立签名?

TokenTrace采用查询式归因机制,通过查询提示词精准提取特定概念的水印。查询提示词指明要提取的概念,确保模块只关注相关区域或特征,实现多概念的精准分类或验证。

图1:TokenTrace预测的概念嵌入的t-SNE可视化。

实验数据说话:单概念与多概念归因的全面性能对比

实验设计验证了TokenTrace在单概念和多概念归因上的性能。TokenTrace在WikiArt和ImageNet数据集上表现优异,刷新了最优水平。多概念归因中,TokenTrace展现出与基线最大的差距,准确率显著提升。

表1:不同归因方法在WikiArt和ImageNet数据集上的性能对比。 表2:多概念归因性能比较。

消融与鲁棒性分析:方法设计的每个环节都不可或缺

消融研究验证了设计架构的必要性。每个模块都有其价值,损失组合方案达到高分但训练开销大。比特秘密长度的取舍展示了容量与精度间的妥协关系。模型在应对不同数量级别的概念库时表现稳定。

表3:WikiArt数据集上目标函数的消融研究。 表4:WikiArt数据集上不同类型失真条件下的消融研究。

总结与展望:生成式AI时代的知识产权保护新范式

TokenTrace提供了一套智能体归因框架,通过双条件嵌入法与查询式解码机制,实现多概念的独立认证。它为溯源技术向前推进了一大步,能够查出图中各个概念的来源。未来可能结合更强的概念特征矢量,进一步提升溯源能力。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对扩散模型“借画风”难溯源,TokenTrace把概念签名同时嵌进文本语义与初始潜噪声;查询式TokenTrace解码模块可从同一张图中分离验证多概念。
这篇工作最值得看的点是什么?TokenTrace在WikiArt上达到91.67%归因准确率、98.33%比特准确率,在ImageNet上达到90.43%归因准确率、95.82%比特准确率,均显著优于所有被动和主动基线方法;在多概念归因任务中(定制化2概念和通用4概念),TokenTrace分别达到88.62%和81.57%归因准确率,优于CustomMark的85.14%和72.78%;加入提示加权后(TokenTraceP)进一步提升至90.53%和86.
这篇工作的边界或风险在哪里?优点:(1)提出双条件嵌入策略,在语义域和潜域同时嵌入水印,从根本上避免了像素域方法的空间重叠问题;(2)查询式TokenTrace模块能够有效解耦并独立归因多个重叠概念;(3)参数高效设计(仅训练轻量投影和注意力层),支持增量学习,避免灾难性遗忘;(4)在单概念和多概念任务上均达到SOTA性能,且保持高视觉保真度和鲁棒性。缺点:(1)需要训练多个组件(概念编码器、秘密映射器、TokenTrace模块、秘密解码器),训练复杂度较高;(2)秘密长度增加时性能下降明显(64位时归因准确率降至84.18%);(3)对定制化概念的多概念组合仍存在图像质量退化问题;(4)查询提示需要从预定义集合中选择,限制了实际应用的灵活性。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出TokenTrace框架,通过双条件策略(同时扰动文本提示嵌入和初始潜噪声)将概念秘密嵌入扩散模型的生成过程,并设计基于查询的TokenTrace模块实现多概念的解耦与独立归因。

实验合理度:★★★★☆

归因准确率(Attribution Accuracy,预测比特秘密与真实秘密完全匹配的百分比)、比特准确率(Bit Accuracy,单个比特正确预测的平均百分比)、CSD分数(风格保持的余弦相似度)、CLIP分数(整体语义相似度)。

学术研究价值:★★★★☆

提出TokenTrace框架,通过双条件策略(同时扰动文本提示嵌入和初始潜噪声)将概念秘密嵌入扩散模型的生成过程,并设计基于查询的TokenTrace模块实现多概念的解耦与独立归因;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练在8块A100 NVIDIA GPU上进行,batch size为6/GPU,训练10,000次迭代。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;(2)查询式TokenTrace模块能够有效解耦并独立归因多个重叠概念;(3)参数高效设计(仅训练轻量投影和注意力层),支持增量学习,避免灾难性遗忘;(4)在单概念和多概念任务上均达到SOTA性能,且保持高视觉保真度和鲁棒性。

主要参考文献

[1] Zhang, L., Agarwal, S., Collomosse, J., Xie, P., & Asnani, V. (2026). TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery. arXiv preprint arXiv:2602.19019.
[2] ProMark: Proactive Diffusion Watermarking for Causal Attribution. (详见原论文引用)
[3] CustomMark: Text-prompt Customized Multi-Concept Watermarking. (详见原论文引用)
[4] Radford, A., et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021.
[5] Rombach, R., et al. High-Resolution Image Synthesis with Latent Diffusion Models (Stable Diffusion). CVPR 2022.

end

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球