← 返回 PaperDaily
视觉与图像
密歇根大学提出PE-Mamba:双向Mamba扫描,AI假图检测冲到96.6%!
AI生成的假图肉眼越来越难辨,可检测器却还停留在“加权平均”的老路子。本文提出的PE-Mamba,把Transformer层间特征当有序序列,用双向Mamba扫描来聚合取证线索,只训练1.3%参数就把主流假图检测基准刷到新SOTA,思路清奇又实用。
龙哥读论文
发布于 2026-08-16 00:20:00
阅读 3
查看原文
原论文信息如下:
生成式AI的"照妖镜":PE-Mamba如何识破AI假图
先看一组让人后背发凉的数字:深度伪造(Deepfake)相关金融欺诈的平均单次损失超过60万美元,预计到2027年,这类欺诈造成的累计损失将高达400亿美元 。与此同时,生成式AI造图的能力几乎每个月都在刷新认知。从GAN到扩散模型,AI生成的图像在纹理、光照、构图层面已经无限逼近真实照片,肉眼鉴别基本上宣告失效。
这就产生了一个很有意思的攻防局面:生成模型拼命让假图“以假乱真”,检测模型则要在看不见的细节里找出破绽。早期检测方法抓的是频谱伪影、上采样痕迹、纹理异常这类“低级线索”,但新一代扩散模型把这些痕迹抹得越来越干净,老办法面对未见过的生成器时泛化能力急转直下。
本论文带来的PE-Mamba框架,思路相当清奇:把Transformer各个层输出的中间特征,当作一条有顺序、有语义递进关系的序列,然后用双向Mamba扫描来建模这份“层间证据链” 。简单说,就是把“第1层到第48层”从无序的集合,变成一条从浅层纹理到深层语义的定向河流,正着扫一遍、反着扫一遍,把取证线索串成完整的逻辑链。
结果相当能打:在UniversalFakeDetect基准上做到96.6%的平均分类准确率(mACC)和99.5%的平均精确率(mAP) ,在AIGCDetect基准上做到95.3%的mACC和98.1%的mAP,正面击败18个现有检测器。更夸张的是,整个方案只训练了1.3%的总参数量(其中纯LoRA部分仅0.13%) ——用极小的训练代价,换来跨生成器泛化能力的显著提升。
从加权平均到双向扫描:跨层特征聚合的范式革新
要理解PE-Mamba的价值,得先回顾一下假图检测领域的一条重要经验:Transformer不同层的特征,携带的是不同类型的取证线索 。浅层特征保留着局部纹理、边缘统计和频率模式——这些正是GAN和扩散模型最容易留下破绽的地方;深层特征则编码更高层的语义内容,能捕捉结构组织和构图逻辑上的异常。
Koutlis等人(2024)的研究已经证明,把多层ViT特征做加权平均聚合,效果远超只用最后一层输出。这个结论奠定了跨层特征聚合的基石。但问题在于,传统的加权平均策略本质上是把各层特征当作一个“无序集合” ——每一层分配一个权重,然后加权求和。层与层之间的先后顺序、语义递进关系,被彻底丢弃了。
PE-Mamba的核心洞察恰恰在于:层与层之间不是无序的,而是一条有方向的语义演化链 。从浅层的纹理、边缘、频率,到中层的局部结构,再到深层的全局语义,这是一个天然的序列。既然是序列,就应该用擅长处理序列的架构来建模——于是作者想到了选择性状态空间模型(Selective State Space Models,简称SSMs),也就是Mamba系列模型的核心组件。
这里需要交代一个背景:Mamba架构(Gu和Dao,2023)提出了一种内容自适应的门控机制,能在线性复杂度下对长序列进行选择性建模。Vision Mamba(Zhu等人,2024)和VMamba(Liu等人,2024)把双向SSM扫描引入视觉任务,通过多方向扫描图像块序列来高效捕捉空间依赖关系。PE-Mamba的巧妙之处在于:不把SSM用在空间维度的patch序列上,而是用在“网络深度维度的层序列”上 。扫描对象是Transformer每一层输出的CLS令牌(分类令牌,即表示整张图像语义的聚合向量),扫描路径是“第1层→第48层”和“第48层→第1层”。
这一设计有个很自然的解释:正向扫描(浅层→深层)是在做“从证据到结论”的推理聚合,逐步把低层纹理线索积累成高层语义判断;反向扫描(深层→浅层)则是在做“从结论回溯证据”的上下文精炼,让深层语义反过来指导对浅层线索的重新解读。两个方向互相补充,恰好对应了人类鉴别真伪时的两种认知路径。
三大组件协同:BSA、SWA与SGA的巧妙设计
PE-Mamba的整体框架是这么运作的:输入的448×448图像先经过一个冻结的PE-Core-G14-448视觉Transformer骨干(patch size为14×14,嵌入维度D=1536,共48层)。骨干网络完全冻结不动,只在所有注意力层的QKV投影矩阵上挂了LoRA低秩适配器(Low-Rank Adaptation,一种参数高效微调方法,通过注入低秩分解矩阵实现任务适配,秩r=8,缩放系数α=8,dropout概率p=0.1)。
然后,通过注册前向钩子(forward hooks),从每一个Transformer块的第二个归一化层提取CLS令牌,堆叠成一个形状为L×D的张量g(L=48层,D=1536)。注意,这里提取的是每一层的CLS令牌,而不是最后一块的最终输出。每个层的CLS令牌先经过一个共享投影模块,把维度从1536压缩到统一的1024维(D′),得到投影后的序列g′∈R^(48×1024)。
第一个组件是BSA(双向选择性聚合器,Bidirectional Selective Aggregator) ,这是整个框架的核心创新。它包含两个独立的选择性SSM块:一个按自然层序(第1层→第48层)正向扫描,另一个按逆序(第48层→第1层)反向扫描。正向扫描不断积累“从浅层纹理到深层语义”的取证证据,反向扫描则进行“从深层语义到浅层线索”的上下文重解读。每个SSM块内部,输入经过投影后拆成主路径x′和门控信号z两条分支,主路径先做深度卷积(卷积核大小4)和SiLU激活以获取局部上下文,然后进入状态空间的递推更新:
扫描结束后,对正向和反向隐藏状态序列分别做平均池化,得到两个1024维的向量z_fwd和z_bwd,再拼接起来过一个Merge模块(线性层+层归一化+GELU激活),融合成z_m:
第二个组件是SWA(Softmax加权聚合器,Softmax-Weighted Aggregator) ,它走了一条和BSA完全互补的路线:不引入任何顺序假设,直接对48个投影后的层令牌做可学习的softmax加权求和,生成全局摘要向量z_α:
第三个组件是SGA(Sigmoid门控融合,Sigmoid-Gated Blend) ,负责把BSA的方向性序列证据和SWA的全局层间聚合动态地融合起来。核心是一个可学习的标量门控γ,初始化为0,这样sigmoid(γ)=0.5,训练开始时两个分支的权重恰好相等,然后让模型根据训练信号自适应地调节偏向哪一边:
融合后的表示z经过第二个投影模块(结构与第一个投影相同)精炼,最后送入由三个“线性层+GELU+Dropout”块加一个输出层组成的检测头,输出一个logit值,用二分类交叉熵损失优化。
三大组件的分工很清楚:BSA负责“沿着层序找线索”,SWA负责“全局视野补盲区”,SGA负责“动态平衡两边”。这个设计最聪明的地方在于:它没有用BSA替代所有聚合策略,而是让顺序建模与全局聚合并行存在、由门控自动调优 。因为层序建模虽然合理,但并非所有取证线索都严格遵循“浅层→深层”的递进关系,某些伪造痕迹可能只在特定层出现,全局加权正好能兜住这种非顺序性的线索。
实验数据说话:96.6%准确率背后的泛化密码
论文的实验设计非常严苛,值得先说明一下训练协议。PE-Mamba只使用ProGAN生成的数据(4个类别)训练,然后在19个从未见过的生成器上做零样本(zero-shot)评估,覆盖三个生成器家族:GAN族(CycleGAN、BigGAN、StyleGAN、StyleGAN2、GauGAN、StarGAN)、其他生成模型族(Deepfakes、SITD、SAN、CRN、IMLE)和扩散模型族(Guided、LDM、GLIDE、DALL-E等)。
只见过ProGAN一种生成器,就要识别出十几种从未见过的生成器造出来的图 ——这就相当于一个人只见过一种笔迹的伪造文件,考试时却要辨认几十种从没见过的笔迹。能做到96.6%的平均准确率,说明方法抓到的不是某一种生成器的“特例伪影”,而是生成式模型共通的、深层的取证规律。
细看表格数据,几个关键点值得注意。第一,PE-Mamba在大多数类别上不是“微弱领先”,而是断层式碾压:在StarGAN上做到100.0%的ACC,在GauGAN上100.0%,在BigGAN上99.9%,在CRN上98.2%(此前最好方法仅93.8%),在Deepfakes上90.4%。第二,在相对困难的扩散模型类别上,PE-Mamba同样保持高水平,LDM 200步CFG类别做到98.1%的ACC,GLIDE各配置均超过98%。第三,在AP指标上,PE-Mamba以99.5%的平均精确率大幅领先第二名,说明它的预测置信度具有良好的校准性,不仅“判得对”,而且“判得稳”。
在AIGCDetect基准上的表现同样亮眼,这个基准包含更多样化的生成模型和更真实的图像分布。PE-Mamba在完全不重新训练、直接使用UniversalFakeDetect上训练好的权重的情况下,取得95.3%的mACC和98.1%的mAP,同样超越18个对比检测器。真正做到“一个模型打天下”。
参数效率与鲁棒性的双重胜利
PE-Mamba在参数效率上交出了一份让人意外的成绩单。全部可训练参数仅占总参数量的1.3%(其中LoRA部分仅0.13%) 。这意味着超过98.7%的模型权重保持冻结,只有极少量的适配模块参与学习。对于动辄需要8张甚至16张A100才能微调的大规模视觉Transformer来说,这种效率优势直接决定了方法能否被中小型实验室复现。
计算成本的账也算得过来。论文在双路48GB GPU上训练,输入分辨率448×448,骨干网络完全冻结、只做前向推理和特征提取。SSM聚合器的额外计算量远小于Transformer骨干本身的推理成本。这意味着PE-Mamba在推理阶段的主要开销其实来自PE-Core骨干网络的单次前向传播,额外的聚合模块几乎可以忽略不计。
鲁棒性方面,论文对图像扰动进行了系统评估——JPEG压缩、高斯模糊、高斯噪声等常见后处理操作下,PE-Mamba的性能衰减幅度小于大多数对比方法。这意味着在真实社交媒体场景中(图片几乎必然经过压缩和重新编码),PE-Mamba的检测能力不会因为图像被“折腾”过就崩溃。
Grad-CAM可视化进一步揭示了模型的学习行为:预训练的PE-Core在真假图像上都会产生弥散的、语义驱动的激活;而PE-Mamba学会了在真实图像上抑制激活,在伪造图像上集中关注真正有鉴别力的区域——GAN生成图像的物体边界、Deepfakes的人脸伪影、扩散图像的全局合成纹理。这种“知道该看哪里”的能力,正是跨模型泛化的视觉基础。
消融实验进一步验证了各组件的必要性。完整PE-Mamba达到96.6%的mACC;移除BSA后,准确率显著下降,证明方向性层序建模确实是性能的核心来源;再移除SWA,性能进一步受损,说明全局聚合分支提供了BSA无法替代的互补信息;SGA门控的去除同样导致性能回退,证实自适应融合策略的独特价值。LoRA超参数实验显示,秩r=8、缩放系数α=8、dropout p=0.1附近的表现最优。
SSM层数的消融(表5)显示1层SSM已经足够:单层双向扫描在保持极低额外参数量的同时,提供了最优的跨层聚合能力;增加SSM层数不仅带来参数膨胀,性能反而下降——这大概率是因为深层SSM开始过拟合ProGAN的训练分布。状态维度(表6)和扩展因子(表7)的消融同样显示了适中的维度设置(d_state=16,d_expand=2)最优,过大反而破坏泛化。聚合组件消融(表8)和骨干网络选择(表9)则从不同角度确认了PE-Mamba设计选择的有效性。
未来展望:从静态图像到视频深伪检测
PE-Mamba目前聚焦于静态图像检测,但“跨层特征的有序聚合”这一思想可以很自然地扩展到视频深伪检测领域。视频帧本身就是时间维度的序列,如果把“层序列建模”与“帧序列建模”结合,用SSM同时建模空间维度上的层间递进关系和时序维度上的帧间上下文,理论上能进一步提升对换脸视频和生成式视频的检测能力。
另一个值得探索的方向是生成模型的对抗性攻击。检测器在进步,生成器也在进步——未来的生成模型可能会专门针对检测器的弱点进行优化,从而抹除当前方法所依赖的取证痕迹。PE-Mamba基于双向SSM的“证据链聚合”能否在对抗攻击下保持稳定,需要进一步研究。
龙迷三问
这篇论文到底在解决什么问题? 生成式AI让假图越来越难以分辨,密歇根大学等机构提出PE-Mamba:冻结PE-Core主干、仅用LoRA微调,用双向选择性扫描把Transformer层间特征按“从纹理到语义”的顺序聚合。
这篇工作最值得看的点是什么? 在UniversalFakeDetect上达到96.6% mACC和99.5% mAP,在AIGCDetect上达到95.3% mACC和98.1% mAP,均超越18种对比方法,且仅训练1.3%的参数。
这篇工作的边界或风险在哪里? 优点:1)创新性地将双向选择性SSM应用于跨层特征聚合,显式建模层间有序语义演进;2)参数高效,仅训练1.3%参数即达SOTA;3)跨生成器泛化能力强,在GAN和扩散模型上均表现稳定;4)对图像扰动具有鲁棒性。缺点:1)依赖大规模预训练backbone(PE-Core),计算量较大;2)在Midjourney和ADM等特定生成器上性能相对较低;3)未利用图像间关系信息。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出PE-Mamba框架,利用双向选择性状态空间模型(SSM)对预训练视觉transformer各层的CLS token进行有序序列建模,替代传统加权平均聚合,实现AI生成图像检测的跨层特征融合。
实验合理度: ★★★★☆
ACC(准确率)、AP(平均精度)、mACC(平均准确率)、mAP(平均平均精度)
学术研究价值: ★★★★☆
提出PE-Mamba框架,利用双向选择性状态空间模型(SSM)对预训练视觉transformer各层的CLS token进行有序序列建模,替代传统加权平均聚合,实现AI生成图像检测的跨层特征融合;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
1869.3 GFLOPs,推理时间62.5 ms/图像,总参数量1904.32M,可训练参数24.25M(1.3%),其中LoRA仅2.46M(0.13%)。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1)依赖大规模预训练backbone(PE-Core),计算量较大;2)在Midjourney和ADM等特定生成器上性能相对较低;
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!