← 返回 PaperDaily 视觉与图像

KAIST最新:AI整图重绘也能精准定位篡改,IoU达0.92

当扩散模型把整张图都“重画”一遍,你还能看出哪里被改过吗?现有主动防篡改定位方法在“全再生”场景下集体崩盘,AUC直接掉到0.5左右。KAIST这篇APT论文第一个系统研究该问题,用潜空间锚点对齐扰动把FR场景定位IoU做到0.92,碾压最强基线WAM(0.84),且能泛化到未知篡改类型。想搞懂AI取证下一个赛点,这篇值得读。

KAIST最新:AI整图重绘也能精准定位篡改,IoU达0.92
原论文信息如下:
论文标题:
APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images
发表日期:
2026年08月
发表单位:
KAIST(韩国科学技术院)
原文链接:
https://arxiv.org/pdf/2608.30656v1.pdf
项目链接:
https://suhyeonha.github.io/APT
AI生成图像狂飙的时代,社交媒体上的"实锤图"越来越像薛定谔的猫——你以为亲眼所见,其实可能是扩散模型在后台把整张图重新涂过一遍。以前大家关心"图有没有被P过",现在问题升级了:不但要问"改没改",还得问"到底改了哪里"。
韩国科学技术院(KAIST)的研究者把这个问题彻底摆到台面上:现有主动防篡改定位技术,遇到"整图重新生成"的扩散修复输出时几乎集体失灵,AUC直接掉到掷硬币水平。听起来像末日预言?别急,他们还真带来了一个解法——APT(Anchor-aligned Perturbations),在"全再生"设定下把定位IoU做到了0.92,远超最强基线WAM的0.84。

扩散模型时代的取证困境:现有主动防御为何失效?

先解释一下什么是主动篡改定位(proactive tamper localization)。思路很简单:在图片发布之前,先嵌入一个肉眼不可见的信号;等有人怀疑图片被篡改时,再通过检测信号在哪里被破坏,来标记篡改区域。这类方法中比较有代表性的有WAM、OmniGuard、StableGuard等,它们各有各的信号嵌入和提取策略。
问题出在哪?出在这些方法默认的篡改模型——拼接(Splicing,SP)。所谓拼接,就是假设篡改者是"生成一块区域→复制粘贴回原图"。在这一假设下,背景部分原封不动,嵌入信号在篡改区域之外被完整保留,检测自然准确。
但扩散模型的原生输出根本不是拼接。以Stable Diffusion Inpainting为例,输入掩码和文本提示后,模型执行的是一整套噪声采样+迭代去噪流程,连背景区域都会被重新生成一遍。论文把这种设定称为全再生(Fully Regenerated,FR)。从数学表示上就能看出两者本质差异:
拼接(SP)是掩码内外"各取所需"的复合:x′SP = x′⊙m + x⊙(1−m),即生成内容贴回原图,背景严格不变。
SP拼接公式
全再生(FR)则直接采用模型原始输出:x′FR = x′。此时,背景区域虽然语义上看起来没变,但像素级信号已经被噪声采样和去噪流程彻底改写。
FR公式
现有方法在FR下有多惨?论文实验给出了扎心数据:StableGuard和OmniGuard的AUC直接掉到约0.5,相当于纯靠猜;WAM虽然稍好,但IoU也只有0.84。换句话说,在扩散模型真正的工作方式面前,过去那套防御体系几乎是"裸奔"的。
图1:全再生(FR)修复下主动定位的脆弱性对比
全再生(FR)修复下主动定位的脆弱性。拼接(SP)假设(b)把合成区域贴回原图,信号得以保留;而全再生设定(a)直接采用修复输出,整图信号均被破坏。现有方法(c)在FR下难以定位,APT(d)在两种设定下都能输出准确掩码。

锚定对齐:一种全新的半脆弱定位信号设计

既然要同时满足"背景扛得住重绘、前景一碰就碎",那就需要一种半脆弱(semi-fragile)信号。APT的核心思路可以概括为:在VAE潜空间中嵌入扰动,让每个空间位置的特征向量都"对齐"到一个预先定义的锚向量方向上。
这里的关键术语是锚向量(anchor vector)。简单来说,它就是一个预先固定、随机生成并归一化的单位方向向量。APT从Rademacher分布中采样锚向量并归一化到单位范数,使得它和自然图像特征的余弦相似度在统计上接近零。这样一来,"是否对齐"就变成了一个清晰的判别信号。
在数学上,这对应一个超圆锥(hypercone)决策边界:特征向量与锚向量的夹角小于等于θ时,判定为"已对齐"。
超圆锥决策边界公式
其中v是提取的特征向量,a是锚向量,θ是允许的最大角度偏差。
那么问题来了:为什么要在VAE潜空间嵌入,而不是直接在像素域加扰动?因为扩散修复模型内部自带VAE编码-解码链路,像素域信号过一遍VAE就会被压缩重建给冲掉。既然篡改路径必然经过VAE,那就直接在潜空间里做手脚——相当于在"同一条传输链路"里埋信号,保留效果自然好得多。
整个嵌入流程是这样的:原图x经VAE编码器得到潜变量z,加上可学习扰动δ得到扰动潜变量z̃,然后通过VAE解码器得到临时扰动图像,再送入图像编码器提取稠密特征图。每个空间位置的特征向量都用余弦相似度衡量与锚向量的对齐程度,并用Hinge损失约束其对齐到预设阈值τ以上。图像编码器用的是DINOv3-ConvNeXt-Small,特征图空间尺寸为32×32,每个特征向量对应原图一个8×8像素块。
图2:APT全流程概览
图2:APT流程概览。(a) 定位标记嵌入阶段,在VAE潜空间优化可学习扰动,使空间特征向量对齐到预定义锚点。(b) 验证阶段,从待检测图像提取逐向量余弦相似度图,经零训练预测器或浅层掩码解码器输出定位掩码。
这套机制为什么能在FR下活下来?论文给出了一个很巧妙的解释:扩散修复模型在重建背景时,会高度依赖原始潜变量中的信息——这些潜变量里带着锚对齐的信号,所以背景区域在重绘后依然保持对齐;而前景合成内容是扩散模型从自然图像分布里新采样出来的,其特征与随机锚方向统计上天然不相关,于是对齐直接崩塌。结果就是,背景亮、前景暗,篡改区域在相似度图上变成一块"黑洞"。

硬负样本挖掘与噪声分支:如何让对齐更鲁棒?

光有锚定对齐还不够,实际优化中会遇到两个麻烦。
第一个麻烦是特征分布不均匀。预训练图像编码器提取的特征在超球面上并不是均匀分布的,有些空间位置天生就难对齐。如果只做全局平均的Hinge损失,少数"顽固分子"可能始终掉队,在相似度图上形成假阳性噪点。为此,论文提出硬负样本挖掘损失(hard negative mining loss):把当前Hinge损失最大的Top-K个空间向量单独挑出来,重点惩罚。
总损失函数公式
总损失函数如上,包含干净分支和噪声分支各自的对齐损失,加上PSNR感知损失和LPIPS感知损失。其中L_hinge保证全局平均对齐,L_hard专门处理难样本,而λ_p和λ_l控制感知失真权重。
第二个麻烦是VAE重绘失真。扩散模型在背景重建时,潜变量要经过噪声注入和去噪,这会给信号带来随机扰动。为了模拟这种失真,APT增加了一个噪声扰动分支(noisy perturbation branch):用随机矩形掩码选出一块区域,往潜变量里注入高斯噪声,让扰动学会"带着噪声也能对齐"。
噪声注入公式
其中m_rand是随机二进制矩形掩码,ν是高斯噪声,z̃是已嵌入扰动的潜变量。噪声注入后的潜变量同样参与对齐损失计算。
整个优化过程冻结所有模型参数,只更新扰动δ,使用Adam优化器学习率设为1.0,迭代150步。RTX 4090上一张图平均耗时42.52秒。像素域扰动还受ℓ无穷范数约束,预算ε=16/255,确保人眼几乎不可见。
验证阶段则非常轻量:提取特征→计算逐向量余弦相似度→上采样到像素级→温度缩放后过sigmoid,就能得到一个定位掩码,完全不需要训练。如果追求更精细的边界,可以再加一个极浅的mask解码器,它只用干净图和合成的相似度图来训练,不需要成对的篡改样本,这个设计相当省事。

实验结果:从FR到SP的全面验证

论文在COCO验证集前100张图上做了系统评测,分辨率256×256,篡改区域通过扩展物体分割掩码1.2倍后生成。对比方法包括WAM、OmniGuard、StableGuard三个主流主动定位方案,并统一把基线水印强度调整到与APT相同的PSNR(约32.3-32.8),避免"靠画质换性能"的不公平比较。
先看最关键的FR全再生设定。
表1和表2:全再生(FR)设定下的定量性能与跨模型迁移性
表1(左)与表2(右):FR设定下SD-Painter主表定量性能及跨四种扩散修复模型的迁移性。红=最优,蓝=次优。APT在AUC和IoU上均显著优于基线。
StableGuard在FR下IoU只有0.07,OmniGuard的AUC跌到0.49,完全是"信号被抹干净"的状态。WAM相对坚挺,IoU达到0.84,但APT直接把IoU推到0.90,配上浅层解码器的APT*更是达到0.92,AUC保持在0.97。这组数字说明,锚点对齐信号确实具备跨噪点、跨重绘的生存能力。
图3:FR设定下四种修复模型的定性定位对比
图3:FR设定下四种修复模型(SD-Painter、BrushNet、ControlNet、HD-Painter)的定性对比。基线方法因背景信号破坏产生退化或近均匀预测,APT与APT*则稳定输出精确掩码。
跨模型迁移性同样硬核:无论面对结构注入型的BrushNet、ControlNet,还是混合背景融合型的HD-Painter,APT*的平均IoU稳定在0.93左右。这说明APT依赖的不是某种修复工具的特定伪影,而是"锚对齐——半脆弱"这个通用的信号机制。
再看SP拼接设定作为对照。
表3:拼接(SP)设定下的定量性能
表3:拼接(SP)设定下SD-Painter定量性能。所有方法都接近完美,APT*保持AUC 0.99、IoU 0.95,虽不刻意优化拼接边界,但依然具备竞争力。
表4:拼接(SP)设定下跨修复模型的迁移性
表4:SP设定下跨修复模型的迁移性能。所有方法均保持高水准,APT与APT*与最强基线基本持平。
在SP设定下,所有方法都接近满分,APT*的IoU也能到0.95。这说明APT在两种篡改范式下都没有"偏科",这是它最难得的地方。
消融实验表格和余弦相似度分布图
消融实验(表6)与余弦相似度分布(图5):噪声分支和硬负样本损失在FR与SP上提供正交增益,完整模型取得最优;对齐后的背景与合成前景在余弦相似度分布上明显分离。
消融实验结果显示,去掉噪声分支或硬负样本损失,FR下的IoU都会明显回落,两者提供的增益是正交互补的。论文还把余弦相似度分布画了出来:背景区域在重绘后依然保持高对齐,前景合成区域则明显偏移,这正好从分布层面验证了"半脆弱"机制确实在工作。
表5:图像退化下的鲁棒性评估
表5:图像退化(如压缩、噪声、模糊等)下的鲁棒性评估。APT*在未见过的退化类型上保持稳定,浅层解码器能有效恢复部分信号损失。
更严格的鲁棒性测试里,APT*在图像压缩、噪声、模糊等退化条件下依然保持不错的定位能力,这说明浅层解码器学到的不只是"记忆掩码形状",而是真正理解了相似度图到掩码的映射关系。
v2-74ba8bc1c6c52a48ea1c3c5c67685ca3_hd.jpg

局限与展望:APT的边界与未来方向

APT的亮点足够亮,但论文也坦诚地留下了一些边界。
首先是嵌入成本。每张图像需要42.52秒的优化时间(RTX 4090),虽然推理极快,但放到大规模图片库场景里,嵌入阶段的算力开销仍然是个现实门槛。
其次是适用范围。APT属于主动防御,必须在图片发布前嵌入信号。对于已经在网络上流传、没有嵌入信号的图片,APT无能为力。此外,如果篡改者采用"整图生成后再做重编码/加性后处理"等更激进的破坏手段,锚对齐信号同样可能被进一步削弱。
第三是评测规模。论文以COCO验证集100张图为主基准,虽然附录补充了500张图的实验(APT*平均IoU 0.92),但真实社交媒体场景中的图像噪声、压缩、裁剪、二次编辑等复杂因素,仍然需要更大规模、更贴近实战的评测来进一步验证。
未来方向也清晰:更快或可并行的嵌入策略、自适应蒸馏锚向量、以及将APT与被动取证方法结合的混合方案,都是值得探索的路径。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?扩散模型修复会整图重绘,让现有主动篡改定位方法集体失效(AUC≈0.5)。韩国KAIST提出APT,在VAE潜空间嵌入锚点对齐扰动,利用前后景对齐差异在整图重绘后仍能精准定位篡改区域。
这篇工作最值得看的点是什么?在FR设置下,APT*达到IoU 0.92,显著优于最强基线WAM(0.84),而StableGuard和OmniGuard崩溃至接近随机水平(AUC≈0.5)。在SP设置下,APT和APT*保持竞争力(AUC 0.99)。跨四种修复模型(BrushNet、ControlNet、HD-Painter、SD-Painter)平均IoU 0.93,并验证了对非相同VAE和流匹配模型的迁移性。
这篇工作的边界或风险在哪里?优点:(1)首次系统研究全再生(FR)设置下的主动篡改定位,填补重要空白;(2)锚定对齐机制巧妙利用前景-背景对齐差异实现定位,无需依赖拼接边界等视觉线索;(3)硬负样本挖掘损失和噪声扰动分支有效提升对齐均匀性和鲁棒性;(4)免训练预测和浅层解码器两种验证方式灵活。缺点:(1)优化耗时较长(42.52秒/图像),实际部署效率受限;(2)对同图复制-移动篡改可能失效(复制区域保留锚定对齐);(3)锚向量作为秘密密钥,若泄露则防御失效;(4)SP设置下IoU略低于基线方法。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

首次系统定义并研究主动定位在"全再生(FR)"设定下的失效问题,锚点对齐式半脆弱潜空间扰动这个思路相当新颖,跳出了"像素域/频域加水印"的旧框架。

实验合理度:★★★★☆

跨四种主流扩散修复模型、SP与FR双设定、统一PSNR对比、含鲁棒性测试和消融,设计得比较系统;唯一小遗憾是主实验100张图规模偏小,好在附录补充了500张图验证。

学术研究价值:★★★★★

给整个主动取证领域指出了一个此前被忽视的关键设定,未来做水印、取证、图像可靠性验证的研究者,都绕不开"FR下信号能否存活"这个问题。

稳定性:★★★★☆

在四种修复模型和多种退化条件下都保持稳定,FR下AUC 0.97、IoU 0.92的表现很扎实;不过对于更极端的"二次截图+强压缩+语义级编辑"组合攻击,稳定性还有待进一步验证。

适应性以及泛化能力:★★★★☆

跨模型泛化好是最大亮点,AP T*在四种修复模型上平均IoU 0.93;但当前锚向量对所有位置统一,若遇到更复杂的多区域、多语义篡改,泛化表现还需更多测试。

硬件需求及成本:★★★☆☆

验证端推理极轻量,部署友好;但嵌入端每张图42.52秒(RTX 4090)的优化耗时,在大规模图片保护场景下会成为瓶颈,批量加速方案是落地关键。

复现难度:★★★★☆

论文描述细致,网络结构、超参数、训练细节都给得很全,项目页面也提供了可视化对比;但代码暂未明确放出,需要读者自己实现。

产品化成熟度:★★☆☆☆

离成熟产品还有距离。嵌入耗时和"仅限发布前保护"两个硬约束,限制了它在实时或存量图片场景中的应用;更适合新闻机构发图前保护、版权平台确权等特定场景先行落地。

可能的问题:主实验规模偏小,100张COCO图片的代表性有限;锚向量统一设定简化了优化但可能限制更复杂篡改场景的区分度;嵌入阶段42秒/张的耗时没有提供加速方案;与被动取证方法的融合也尚未讨论。


主要参考文献

[1] Suhyeon Ha, Woo Jae Kim, Joonsung Jeon, Sooel Son, Sung-eui Yoon. APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images. arXiv:2608.30656, 2026.
[2] Rombach et al. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022.(Stable Diffusion / SD-Painter 基础模型)
[3] WAM: Watermarking as a Localized Segmentation Task.(式3所引零比特水印框架见论文原文引用[7])
[4] 论文项目主页:https://suhyeonha.github.io/APT
[5] 论文全文:https://arxiv.org/pdf/2608.30656v1.pdf

end
AI重绘整图也骗不过锚点对齐的眼睛~想第一时间get各种AI篡改新套路?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。