← 返回 PaperDaily 视觉与图像

武汉大学最新研究:用扩散模型的"天性"反制模仿,一招让照片"神隐"

当你想保护自己的照片不被AI拿去“换脸”,现有方法都是在图像上加点看似“聪明”的扰动。但武大这项研究告诉你:别跟扩散模型死磕了,让它自我怀疑才是王道!一句话:用魔法打败魔法,效果直接翻三倍。

武汉大学最新研究:用扩散模型的"天性"反制模仿,一招让照片"神隐"
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
当你想保护自己的照片不被AI拿去“换脸”,现有方法都是在图像上加点看似“聪明”的扰动。但武大这项研究告诉你:别跟扩散模型死磕了,让它自我怀疑才是王道!一句话:用魔法打败魔法,效果直接翻三倍。


原论文信息如下:
论文标题:
VOID: Defeating Unauthorized Mimicry in Latent Diffusion Models

发表日期:
2026年06月

发表单位:
武汉大学(第一单位)、香港科技大学(广州)、西安交通大学

原文链接:
https://arxiv.org/pdf/2606.13351v1.pdf

开源代码链接:
https://doi.org/10.5281/zenodo.20233998

LDM防御的“阿克琉斯之踵”:语义为何总是“阴魂不散”?

潜在扩散模型(LDM)火了之后,AI换脸、模仿画风变得极其简单。主流防御是“语义导向”(Semantic-Steering):给照片加肉眼难见的微小扰动,欺骗LDM产生错误。但武大研究者发现,这种防御有致命缺陷。
根本原因一:LDM有“自我修复”强迫症。 扩散模型天生要“净化”外部噪声,被保护的图像特征与原图相似度极高,扰动只是表面覆盖。
研究人员分析了24种语义-steering防御,将被保护图像、原图、扰动映射到LDM潜在空间,计算余弦相似度,结果见图3。
图3:干净样本、被保护样本和扰动样本之间的成对潜在余弦相似度,比较了基于逃避(Evasion)[38](左)和基于投毒(Poisoning)[61](右)的防御方法。
图3:干净样本、被保护样本和扰动样本之间的成对潜在余弦相似度。
根本原因二:LDM能“提纯”原始语义。 通过DDIM反转,LDM可近乎完美地还原原始图像,把扰动当无关噪声丢弃。
根本原因三:VAE编码器“掐灭”防御信号。 VAE编码器有μ分支(决定语义)和σ分支(决定不确定性)。计算利普希茨常数发现(表1):μ分支平均仅0.78,σ分支高达6.46,敏感度高出8倍多。传统防御信号通过μ分支时被大幅削弱。
表1:五个VAE编码器的利普希茨常数。
表1:五个VAE编码器的利普希茨常数。
幸存下来的扰动在扩散加噪过程中也会被指数级稀释(图6)。传统防御等于“白给”。
图6:在Stable Diffusion v1.5 [53]的前向扩散过程中,保护性信号的衰减情况。
图6:前向扩散过程中保护性信号的衰减情况。
插图

核心思路:与其“螳臂当车”,不如“借力打力”

既然外部信号总被“清洗”,武大团队思路绝妙:让你“清理”不了自己内部的东西。新框架VOID颠覆了“语义导向”范式,开创“语义破坏”新思路。
VOID的核心洞察:LDM必须容忍自身内部的概率性错误,否则生成流形会崩塌。那我们放大它内部的不确定性,让它自己走向毁灭。
第一招:编码不确定性放大(EUA) VAE编码器有重参数化技巧:z = μ + σ ⊙ n。σ分支对输入变化超级敏感。VOID通过EUA损失函数专门最大化VAE编码器预测的方差σ。
VOID联合优化目标函数:最大化编码不确定性损失,最小化引导信号抵消损失。
图注:VOID的联合优化目标函数。
第二招:引导信号抵消(GSC) 扩散模型有无分类器引导(CFG),通过计算条件与无条件噪声预测的差值得到引导向量Δεt。VOID的GSC模块最小化这个向量的标准差,把它压成毫无信息量的随机信号。
CFG引导向量计算公式:条件预测减去无条件预测。
图注:CFG引导向量 Δεt 的计算公式。
EUA在前面“捣乱”,GSC在后面“断后”,LDM的生成轨迹被彻底带偏,只能输出垃圾。

方法概述:从内部“引爆”生成轨迹

VOID的输入是原始图像x和代理提示词(通过BLIP自动生成)。流程多步迭代优化:
1. 计算视觉掩码(HGPM): 利用HVS的JND模型,确保扰动只限制在人眼几乎无法察觉的区域。
2. 执行EUA和GSC: 循环迭代中随机选择时间步t,并行执行EUA(放大方差)和GSC(压缩CFG标准差)。
3. 联合优化并应用掩码: 组合损失函数更新扰动,再乘以上一步的HVS掩码,保证图片清晰自然。
4. 分时最优选择(TPOS): 记录每个时间步区间内的最佳扰动状态,最后挑选整体最优的作为最终保护扰动。
插图

效果炸裂:FID飙升223%,LPIPS仅0.096,还能硬刚黑盒攻击

1. 有效性:“一骑绝尘” 表3显示,VOID在5个数据集、6种攻击方式下全面领先。核心指标FID从最强防御Smooth的113.08提升到365.61,提升223%!
表3:防御效果的定量评估。结果在5个数据集(TI-Dataset [17], DB-Dataset [52], CelebA-HQ [28], VGGFace2 [7] 和 WikiArt [54])和6种模仿方法(FT [50], SV [4], LR [24], SE [45], IP [50] 和 CN [72])上取平均值。箭头表示更好保护性能的方向。加粗和下划线分别表示最佳和第二佳结果。
表3:防御效果的定量评估。
2. 视觉不可察觉性:“几乎看不出区别” 表4显示,VOID的PSNR达34.41 dB,SSIM为0.89,LPIPS低至0.096,是所有方法中唯一低于0.1的。
表4:不可察觉性评估。VOID与24种方法中视觉效果排名前四的基线方法进行了比较。
表4:不可察觉性评估。
3. 鲁棒性与迁移性:“打不死的小强” 跨模型迁移性(表5)显示,用SD v1.5生成的扰动对抗SD v2.1或LCM时,VOID依然稳定领先。对抗自适应攻击(表11)中,即使攻击者知道VOID全部细节,VOID的FID仍远高于其他方法。
表5:在TI-Dataset [17] 上的跨模型迁移性评估。加粗表示防御方法中的最佳表现。
表5:跨模型迁移性评估。
表11:在TI-Dataset [17] 上的强自适应攻击结果。扰动在SD v1.5上生成,并在不同目标模型下进行标准和KL正则化训练评估。
表11:强自适应攻击结果。
效果图(图1)直观展现了VOID与其他方法的对比。
图1:防御未授权模仿的可视化比较。尽管当前最先进(SOTA)方法无法阻止高保真度的身份重建,但VOID从根本上破坏了生成轨迹,使得合成输出在语义上空洞无效。敏感内容已做模糊处理。
图1:防御未授权模仿的可视化比较。

总结与思考:开创防御新范式

VOID的最大贡献在于指出旧有范式的结构性缺陷,提供全新攻击视角。以前的方法像给高手递有问题的水,VOID则直接攻击他体内经脉。这个思考维度的转变最值得称道。
当然,在强自适应攻击下(表11),VOID性能虽仍领先但有所下降。如何在保证图像质量前提下提高对极端白盒攻击的鲁棒性,是值得探索的方向。
VOID因其开创性思路、扎实分析和无与伦比的实验效果,有成为里程碑式工作的潜力。龙哥强烈建议读原文。

龙迷三问

问:VOID主要解决了什么问题?答:解决现有防御无法阻止利用LDM进行未授权图像模仿的问题。通过放大模型自身不确定性实现更有效保护。

问:LDM和CFG是什么意思?答:LDM是潜在扩散模型,CFG是无分类器引导。VOID通过攻击CFG机制实现破坏效果。

问:实用性如何?普通人可以用吗?答:保护单张图片约需0.74秒,具有跨模型迁移性。开源代码已公布,可集成到App或插件中,但目前缺乏傻瓜式应用。

欢迎在评论区留言讨论~

龙哥点评

论文创新性分数:★★★★★

范式颠覆,逻辑自洽,满分。

实验合理度:★★★★★

5数据集、10类攻击、24种对比,全面严苛。

学术研究价值:★★★★★

开创防御新范式,启发性极强。

稳定性:★★★☆☆

白盒自适应攻击下效果下降,非绝对金身。

适应性及泛化能力:★★★★☆

多数据集表现优异,跨模型迁移性佳,但对新架构LDM待验证。

硬件需求及成本:★★★★☆

单张0.74秒,计算开销可接受。

复现难度:★★★★☆

有开源代码,但需深入理解扩散模型。

产品化成熟度:★★☆☆☆

研究阶段概念验证,需解决实时性和普适性。

可能的问题:

1. 黑盒场景代理提示词策略,若攻击者用大相径庭的提示词,效果可能打折扣。2. 未验证对基于Transformer的新型扩散模型的防御效果。3. 大规模部署后可能形成新的猫鼠游戏。

主要参考文献

[1] Robin Rombach, et al. “High-Resolution Image Synthesis with Latent Diffusion Models.” In CVPR, 2022.
[2] Diederik P. Kingma, et al. “Auto-Encoding Variational Bayes.” In ICLR, 2014.
[3] Nataniel Ruiz, et al. “DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation.” In CVPR, 2023.
[4] Chumeng Liang, et al. “Adversarial Example Does Good: Preventing Painting Imitation from Diffusion Models via Adversarial Examples.” In ICML, 2023.
[5] Hadi Salman, et al. “Raising the Cost of Malicious AI-Powered Image Editing.” In NeurIPS, 2023.
[6] Shawn Shan, et al. “Glaze: Protecting Artists from Style Mimicry by Text-to-Image Models.” In USENIX Security, 2023.
[7] Github, https://doi.org/10.5281/zenodo.20233998 (VOID 开源代码).
[8] arXiv:2606.13351v1 (原论文).

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨。想了解更多原文细节,可点击"阅读原文"

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。备注:研究方向+地点+学校/公司+昵称
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。