← 返回 PaperDaily
视觉与图像
武汉大学最新研究:用扩散模型的"天性"反制模仿,一招让照片"神隐"
当你想保护自己的照片不被AI拿去“换脸”,现有方法都是在图像上加点看似“聪明”的扰动。但武大这项研究告诉你:别跟扩散模型死磕了,让它自我怀疑才是王道!一句话:用魔法打败魔法,效果直接翻三倍。
龙哥读论文
发布于 2026-08-17 00:20:07
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 当你想保护自己的照片不被AI拿去“换脸”,现有方法都是在图像上加点看似“聪明”的扰动。但武大这项研究告诉你:别跟扩散模型死磕了,让它自我怀疑才是王道!一句话:用魔法打败魔法,效果直接翻三倍。
原论文信息如下:
LDM防御的“阿克琉斯之踵”:语义为何总是“阴魂不散”?
潜在扩散模型(LDM)火了之后,AI换脸、模仿画风变得极其简单。主流防御是“语义导向”(Semantic-Steering):给照片加肉眼难见的微小扰动,欺骗LDM产生错误。但武大研究者发现,这种防御有致命缺陷。
根本原因一:LDM有“自我修复”强迫症。 扩散模型天生要“净化”外部噪声,被保护的图像特征与原图相似度极高,扰动只是表面覆盖。
研究人员分析了24种语义-steering防御,将被保护图像、原图、扰动映射到LDM潜在空间,计算余弦相似度,结果见图3。
根本原因二:LDM能“提纯”原始语义。 通过DDIM反转,LDM可近乎完美地还原原始图像,把扰动当无关噪声丢弃。
根本原因三:VAE编码器“掐灭”防御信号。 VAE编码器有μ分支(决定语义)和σ分支(决定不确定性)。计算利普希茨常数发现(表1):μ分支平均仅0.78,σ分支高达6.46,敏感度高出8倍多。传统防御信号通过μ分支时被大幅削弱。
幸存下来的扰动在扩散加噪过程中也会被指数级稀释(图6)。传统防御等于“白给”。
核心思路:与其“螳臂当车”,不如“借力打力”
既然外部信号总被“清洗”,武大团队思路绝妙:让你“清理”不了自己内部的东西。新框架VOID颠覆了“语义导向”范式,开创“语义破坏”新思路。
VOID的核心洞察:LDM必须容忍自身内部的概率性错误,否则生成流形会崩塌。那我们放大它内部的不确定性,让它自己走向毁灭。
第一招:编码不确定性放大(EUA) VAE编码器有重参数化技巧:z = μ + σ ⊙ n。σ分支对输入变化超级敏感。VOID通过EUA损失函数专门最大化VAE编码器预测的方差σ。
第二招:引导信号抵消(GSC) 扩散模型有无分类器引导(CFG),通过计算条件与无条件噪声预测的差值得到引导向量Δεt。VOID的GSC模块最小化这个向量的标准差,把它压成毫无信息量的随机信号。
EUA在前面“捣乱”,GSC在后面“断后”,LDM的生成轨迹被彻底带偏,只能输出垃圾。
方法概述:从内部“引爆”生成轨迹
VOID的输入是原始图像x和代理提示词(通过BLIP自动生成)。流程多步迭代优化:
1. 计算视觉掩码(HGPM): 利用HVS的JND模型,确保扰动只限制在人眼几乎无法察觉的区域。
2. 执行EUA和GSC: 循环迭代中随机选择时间步t,并行执行EUA(放大方差)和GSC(压缩CFG标准差)。
3. 联合优化并应用掩码: 组合损失函数更新扰动,再乘以上一步的HVS掩码,保证图片清晰自然。
4. 分时最优选择(TPOS): 记录每个时间步区间内的最佳扰动状态,最后挑选整体最优的作为最终保护扰动。
效果炸裂:FID飙升223%,LPIPS仅0.096,还能硬刚黑盒攻击
1. 有效性:“一骑绝尘” 表3显示,VOID在5个数据集、6种攻击方式下全面领先。核心指标FID从最强防御Smooth的113.08提升到365.61,提升223%!
2. 视觉不可察觉性:“几乎看不出区别” 表4显示,VOID的PSNR达34.41 dB,SSIM为0.89,LPIPS低至0.096,是所有方法中唯一低于0.1的。
3. 鲁棒性与迁移性:“打不死的小强” 跨模型迁移性(表5)显示,用SD v1.5生成的扰动对抗SD v2.1或LCM时,VOID依然稳定领先。对抗自适应攻击(表11)中,即使攻击者知道VOID全部细节,VOID的FID仍远高于其他方法。
效果图(图1)直观展现了VOID与其他方法的对比。
总结与思考:开创防御新范式
VOID的最大贡献在于指出旧有范式的结构性缺陷,提供全新攻击视角。以前的方法像给高手递有问题的水,VOID则直接攻击他体内经脉。这个思考维度的转变最值得称道。
当然,在强自适应攻击下(表11),VOID性能虽仍领先但有所下降。如何在保证图像质量前提下提高对极端白盒攻击的鲁棒性,是值得探索的方向。
VOID因其开创性思路、扎实分析和无与伦比的实验效果,有成为里程碑式工作的潜力。龙哥强烈建议读原文。
龙迷三问
问:VOID主要解决了什么问题? 答:解决现有防御无法阻止利用LDM进行未授权图像模仿的问题。通过放大模型自身不确定性实现更有效保护。
问:LDM和CFG是什么意思? 答:LDM是潜在扩散模型,CFG是无分类器引导。VOID通过攻击CFG机制实现破坏效果。
问:实用性如何?普通人可以用吗? 答:保护单张图片约需0.74秒,具有跨模型迁移性。开源代码已公布,可集成到App或插件中,但目前缺乏傻瓜式应用。
龙哥点评
论文创新性分数: ★★★★★
范式颠覆,逻辑自洽,满分。
实验合理度: ★★★★★
5数据集、10类攻击、24种对比,全面严苛。
学术研究价值: ★★★★★
开创防御新范式,启发性极强。
稳定性: ★★★☆☆
白盒自适应攻击下效果下降,非绝对金身。
适应性及泛化能力: ★★★★☆
多数据集表现优异,跨模型迁移性佳,但对新架构LDM待验证。
硬件需求及成本: ★★★★☆
单张0.74秒,计算开销可接受。
复现难度: ★★★★☆
有开源代码,但需深入理解扩散模型。
产品化成熟度: ★★☆☆☆
研究阶段概念验证,需解决实时性和普适性。
1. 黑盒场景代理提示词策略,若攻击者用大相径庭的提示词,效果可能打折扣。2. 未验证对基于Transformer的新型扩散模型的防御效果。3. 大规模部署后可能形成新的猫鼠游戏。
主要参考文献
[1] Robin Rombach, et al. “High-Resolution Image Synthesis with Latent Diffusion Models.” In CVPR, 2022.
[2] Diederik P. Kingma, et al. “Auto-Encoding Variational Bayes.” In ICLR, 2014.
[3] Nataniel Ruiz, et al. “DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation.” In CVPR, 2023.
[4] Chumeng Liang, et al. “Adversarial Example Does Good: Preventing Painting Imitation from Diffusion Models via Adversarial Examples.” In ICML, 2023.
[5] Hadi Salman, et al. “Raising the Cost of Malicious AI-Powered Image Editing.” In NeurIPS, 2023.
[6] Shawn Shan, et al. “Glaze: Protecting Artists from Style Mimicry by Text-to-Image Models.” In USENIX Security, 2023.
[7] Github, https://doi.org/10.5281/zenodo.20233998 (VOID 开源代码).
[8] arXiv:2606.13351v1 (原论文).
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨。想了解更多原文细节,可点击 "阅读原文" 。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
备注:研究方向+地点+学校/公司+昵称 。