← 返回 PaperDaily 视觉与图像

密歇根大学提出PE-Mamba:双向Mamba扫描,AI假图检测冲到96.6%!

AI生成的假图肉眼越来越难辨,可检测器却还停留在“加权平均”的老路子。本文提出的PE-Mamba,把Transformer层间特征当有序序列,用双向Mamba扫描来聚合取证线索,只训练1.3%参数就把主流假图检测基准刷到新SOTA,思路清奇又实用。

密歇根大学提出PE-Mamba:双向Mamba扫描,AI假图检测冲到96.6%!

paperdaily_reaction_gif


原论文信息如下:
论文标题:
PE-Mamba: Bidirectional Selective Layer Aggregation for AI-Generated Image Detection(PE-Mamba:用于AI生成图像检测的双向选择性层聚合)
发表日期:
2026年08月
发表单位:
美国密歇根大学弗林特分校创新与技术学院、韩国航空大学电子与信息工程学院
原文链接:
https://arxiv.org/pdf/2608.07999v1.pdf

生成式AI的"照妖镜":PE-Mamba如何识破AI假图

先看一组让人后背发凉的数字:深度伪造(Deepfake)相关金融欺诈的平均单次损失超过60万美元,预计到2027年,这类欺诈造成的累计损失将高达400亿美元。与此同时,生成式AI造图的能力几乎每个月都在刷新认知。从GAN到扩散模型,AI生成的图像在纹理、光照、构图层面已经无限逼近真实照片,肉眼鉴别基本上宣告失效。
这就产生了一个很有意思的攻防局面:生成模型拼命让假图“以假乱真”,检测模型则要在看不见的细节里找出破绽。早期检测方法抓的是频谱伪影、上采样痕迹、纹理异常这类“低级线索”,但新一代扩散模型把这些痕迹抹得越来越干净,老办法面对未见过的生成器时泛化能力急转直下。
本论文带来的PE-Mamba框架,思路相当清奇:把Transformer各个层输出的中间特征,当作一条有顺序、有语义递进关系的序列,然后用双向Mamba扫描来建模这份“层间证据链”。简单说,就是把“第1层到第48层”从无序的集合,变成一条从浅层纹理到深层语义的定向河流,正着扫一遍、反着扫一遍,把取证线索串成完整的逻辑链。
结果相当能打:在UniversalFakeDetect基准上做到96.6%的平均分类准确率(mACC)和99.5%的平均精确率(mAP),在AIGCDetect基准上做到95.3%的mACC和98.1%的mAP,正面击败18个现有检测器。更夸张的是,整个方案只训练了1.3%的总参数量(其中纯LoRA部分仅0.13%)——用极小的训练代价,换来跨生成器泛化能力的显著提升。
图1:PE-Mamba框架总览
PE-Mamba框架总览。冻结的PE-Core视觉Transformer配合QKV投影上的LoRA适配,从所有第二个归一化层提取逐层CLS令牌,经首个投影层映射到统一嵌入空间。BSA通过正向(浅层→深层)和反向(深层→浅层)选择性扫描处理投影后的令牌,得到z_m;SWA计算学习到的全局摘要z_α。SGA通过可学习门控自适应融合z_m和z_α,融合后的表示经第二个投影层精炼后送入检测头,判断图像为真实还是AIGI。

从加权平均到双向扫描:跨层特征聚合的范式革新

要理解PE-Mamba的价值,得先回顾一下假图检测领域的一条重要经验:Transformer不同层的特征,携带的是不同类型的取证线索。浅层特征保留着局部纹理、边缘统计和频率模式——这些正是GAN和扩散模型最容易留下破绽的地方;深层特征则编码更高层的语义内容,能捕捉结构组织和构图逻辑上的异常。
Koutlis等人(2024)的研究已经证明,把多层ViT特征做加权平均聚合,效果远超只用最后一层输出。这个结论奠定了跨层特征聚合的基石。但问题在于,传统的加权平均策略本质上是把各层特征当作一个“无序集合”——每一层分配一个权重,然后加权求和。层与层之间的先后顺序、语义递进关系,被彻底丢弃了。
PE-Mamba的核心洞察恰恰在于:层与层之间不是无序的,而是一条有方向的语义演化链。从浅层的纹理、边缘、频率,到中层的局部结构,再到深层的全局语义,这是一个天然的序列。既然是序列,就应该用擅长处理序列的架构来建模——于是作者想到了选择性状态空间模型(Selective State Space Models,简称SSMs),也就是Mamba系列模型的核心组件。
这里需要交代一个背景:Mamba架构(Gu和Dao,2023)提出了一种内容自适应的门控机制,能在线性复杂度下对长序列进行选择性建模。Vision Mamba(Zhu等人,2024)和VMamba(Liu等人,2024)把双向SSM扫描引入视觉任务,通过多方向扫描图像块序列来高效捕捉空间依赖关系。PE-Mamba的巧妙之处在于:不把SSM用在空间维度的patch序列上,而是用在“网络深度维度的层序列”上。扫描对象是Transformer每一层输出的CLS令牌(分类令牌,即表示整张图像语义的聚合向量),扫描路径是“第1层→第48层”和“第48层→第1层”。
这一设计有个很自然的解释:正向扫描(浅层→深层)是在做“从证据到结论”的推理聚合,逐步把低层纹理线索积累成高层语义判断;反向扫描(深层→浅层)则是在做“从结论回溯证据”的上下文精炼,让深层语义反过来指导对浅层线索的重新解读。两个方向互相补充,恰好对应了人类鉴别真伪时的两种认知路径。

三大组件协同:BSA、SWA与SGA的巧妙设计

PE-Mamba的整体框架是这么运作的:输入的448×448图像先经过一个冻结的PE-Core-G14-448视觉Transformer骨干(patch size为14×14,嵌入维度D=1536,共48层)。骨干网络完全冻结不动,只在所有注意力层的QKV投影矩阵上挂了LoRA低秩适配器(Low-Rank Adaptation,一种参数高效微调方法,通过注入低秩分解矩阵实现任务适配,秩r=8,缩放系数α=8,dropout概率p=0.1)。
然后,通过注册前向钩子(forward hooks),从每一个Transformer块的第二个归一化层提取CLS令牌,堆叠成一个形状为L×D的张量g(L=48层,D=1536)。注意,这里提取的是每一层的CLS令牌,而不是最后一块的最终输出。每个层的CLS令牌先经过一个共享投影模块,把维度从1536压缩到统一的1024维(D′),得到投影后的序列g′∈R^(48×1024)。
接下来就是三大组件的协同工作:

第一个组件是BSA(双向选择性聚合器,Bidirectional Selective Aggregator),这是整个框架的核心创新。它包含两个独立的选择性SSM块:一个按自然层序(第1层→第48层)正向扫描,另一个按逆序(第48层→第1层)反向扫描。正向扫描不断积累“从浅层纹理到深层语义”的取证证据,反向扫描则进行“从深层语义到浅层线索”的上下文重解读。每个SSM块内部,输入经过投影后拆成主路径x′和门控信号z两条分支,主路径先做深度卷积(卷积核大小4)和SiLU激活以获取局部上下文,然后进入状态空间的递推更新:

公式1:离散状态转移矩阵与输入矩阵计算
公式1:离散状态转移矩阵Ā_i和输入矩阵B̄_i的计算。Δ_i是步长参数,A是状态矩阵(在log空间参数化并保持固定),⊙表示逐元素乘法。零阶保持(zero-order hold)将连续系统离散化,使得SSM块能够以循环方式逐层处理序列。
公式2:隐藏状态递推更新
公式2:隐藏状态h_i的递推更新和输出y_i的计算。注意这里的递推结构天然带有硬性的因果归纳偏置——每一步的输出只依赖当前及之前的输入,这与可学习加权平均(静态权重、无顺序概念)有本质区别。C_i是输出矩阵,状态维度d_state=16。
扫描结束后,对正向和反向隐藏状态序列分别做平均池化,得到两个1024维的向量z_fwd和z_bwd,再拼接起来过一个Merge模块(线性层+层归一化+GELU激活),融合成z_m:
公式3:前向/后向扫描平均池化
公式3:前向和后向扫描隐藏状态序列的平均池化。L是Transformer层数(48),h^f和h^b是前向/后向扫描的隐藏状态序列。对整条序列做平均池化,而不是只取最终状态,确保所有层位置的证据都被整合进来。

第二个组件是SWA(Softmax加权聚合器,Softmax-Weighted Aggregator),它走了一条和BSA完全互补的路线:不引入任何顺序假设,直接对48个投影后的层令牌做可学习的softmax加权求和,生成全局摘要向量z_α:

公式4:Softmax加权聚合
公式4:Softmax加权聚合。α∈R^(L×D′)是从标准正态分布初始化的可学习参数,σ(·)是softmax操作,g′_ℓ是第ℓ层的投影后CLS令牌。SWA提供的是一个无顺序偏见的全局聚合视图。

第三个组件是SGA(Sigmoid门控融合,Sigmoid-Gated Blend),负责把BSA的方向性序列证据和SWA的全局层间聚合动态地融合起来。核心是一个可学习的标量门控γ,初始化为0,这样sigmoid(γ)=0.5,训练开始时两个分支的权重恰好相等,然后让模型根据训练信号自适应地调节偏向哪一边:

公式5:Sigmoid门控融合
公式5:Sigmoid门控融合。δ(·)表示sigmoid函数,γ是可学习的标量门控(初始化为0)。模型通过这个门控自适应地决定在多大程度上依赖方向性序列证据(z_m)或全局层间聚合(z_α)。
融合后的表示z经过第二个投影模块(结构与第一个投影相同)精炼,最后送入由三个“线性层+GELU+Dropout”块加一个输出层组成的检测头,输出一个logit值,用二分类交叉熵损失优化。
三大组件的分工很清楚:BSA负责“沿着层序找线索”,SWA负责“全局视野补盲区”,SGA负责“动态平衡两边”。这个设计最聪明的地方在于:它没有用BSA替代所有聚合策略,而是让顺序建模与全局聚合并行存在、由门控自动调优。因为层序建模虽然合理,但并非所有取证线索都严格遵循“浅层→深层”的递进关系,某些伪造痕迹可能只在特定层出现,全局加权正好能兜住这种非顺序性的线索。

实验数据说话:96.6%准确率背后的泛化密码

论文的实验设计非常严苛,值得先说明一下训练协议。PE-Mamba只使用ProGAN生成的数据(4个类别)训练,然后在19个从未见过的生成器上做零样本(zero-shot)评估,覆盖三个生成器家族:GAN族(CycleGAN、BigGAN、StyleGAN、StyleGAN2、GauGAN、StarGAN)、其他生成模型族(Deepfakes、SITD、SAN、CRN、IMLE)和扩散模型族(Guided、LDM、GLIDE、DALL-E等)。
只见过ProGAN一种生成器,就要识别出十几种从未见过的生成器造出来的图——这就相当于一个人只见过一种笔迹的伪造文件,考试时却要辨认几十种从没见过的笔迹。能做到96.6%的平均准确率,说明方法抓到的不是某一种生成器的“特例伪影”,而是生成式模型共通的、深层的取证规律。
表1和表2:UniversalFakeDetect基准上各检测器的ACC和AP对比
表1和表2:UniversalFakeDetect基准上18个检测器与PE-Mamba的ACC和AP对比。所有检测器仅用ProGAN训练(4个类别),在其余生成器上零样本评估。∗表示在ProGAN上重新训练以保证公平对比。PE-Mamba以96.6%的mACC和99.5%的mAP全面领先。
细看表格数据,几个关键点值得注意。第一,PE-Mamba在大多数类别上不是“微弱领先”,而是断层式碾压:在StarGAN上做到100.0%的ACC,在GauGAN上100.0%,在BigGAN上99.9%,在CRN上98.2%(此前最好方法仅93.8%),在Deepfakes上90.4%。第二,在相对困难的扩散模型类别上,PE-Mamba同样保持高水平,LDM 200步CFG类别做到98.1%的ACC,GLIDE各配置均超过98%。第三,在AP指标上,PE-Mamba以99.5%的平均精确率大幅领先第二名,说明它的预测置信度具有良好的校准性,不仅“判得对”,而且“判得稳”。
在AIGCDetect基准上的表现同样亮眼,这个基准包含更多样化的生成模型和更真实的图像分布。PE-Mamba在完全不重新训练、直接使用UniversalFakeDetect上训练好的权重的情况下,取得95.3%的mACC和98.1%的mAP,同样超越18个对比检测器。真正做到“一个模型打天下”。
表3:AIGCDetect基准上各检测器的ACC/AP对比
表3:AIGCDetect基准上PE-Mamba与对比检测器的ACC/AP表现。为了评估真实泛化能力,所有检测器均直接使用表1和表2中在ProGAN上训练好的权重,不做任何重新训练或适配。

参数效率与鲁棒性的双重胜利

PE-Mamba在参数效率上交出了一份让人意外的成绩单。全部可训练参数仅占总参数量的1.3%(其中LoRA部分仅0.13%)。这意味着超过98.7%的模型权重保持冻结,只有极少量的适配模块参与学习。对于动辄需要8张甚至16张A100才能微调的大规模视觉Transformer来说,这种效率优势直接决定了方法能否被中小型实验室复现。
计算成本的账也算得过来。论文在双路48GB GPU上训练,输入分辨率448×448,骨干网络完全冻结、只做前向推理和特征提取。SSM聚合器的额外计算量远小于Transformer骨干本身的推理成本。这意味着PE-Mamba在推理阶段的主要开销其实来自PE-Core骨干网络的单次前向传播,额外的聚合模块几乎可以忽略不计。
表10:PE-Mamba配置的计算成本
表10:PE-Mamba配置的计算成本明细。可训练参数量、FLOPs和推理延迟等关键指标均有明确量化,为实际部署提供了直接参考。
鲁棒性方面,论文对图像扰动进行了系统评估——JPEG压缩、高斯模糊、高斯噪声等常见后处理操作下,PE-Mamba的性能衰减幅度小于大多数对比方法。这意味着在真实社交媒体场景中(图片几乎必然经过压缩和重新编码),PE-Mamba的检测能力不会因为图像被“折腾”过就崩溃。
Grad-CAM可视化进一步揭示了模型的学习行为:预训练的PE-Core在真假图像上都会产生弥散的、语义驱动的激活;而PE-Mamba学会了在真实图像上抑制激活,在伪造图像上集中关注真正有鉴别力的区域——GAN生成图像的物体边界、Deepfakes的人脸伪影、扩散图像的全局合成纹理。这种“知道该看哪里”的能力,正是跨模型泛化的视觉基础。
图2:Grad-CAM可视化对比
图2:Grad-CAM可视化对比。预训练PE-Core与PE-Mamba在来自不同生成器的真实图像和AIGI上的注意力差异。预训练模型在真假图像上均产生弥散、语义驱动的激活;PE-Mamba则学会在真实内容上抑制激活,集中关注伪造图像中具有取证鉴别力的区域——包括GAN生成图像的物体边界、Deepfakes的人脸伪影,以及扩散生成内容的全局合成纹理。
消融实验进一步验证了各组件的必要性。完整PE-Mamba达到96.6%的mACC;移除BSA后,准确率显著下降,证明方向性层序建模确实是性能的核心来源;再移除SWA,性能进一步受损,说明全局聚合分支提供了BSA无法替代的互补信息;SGA门控的去除同样导致性能回退,证实自适应融合策略的独特价值。LoRA超参数实验显示,秩r=8、缩放系数α=8、dropout p=0.1附近的表现最优。
图3:LoRA超参数消融
图3:LoRA超参数消融实验:(a) 秩r,(b) 缩放系数α,(c) 丢弃概率p。金色星星标记最优ACC设置。
图4:投影层与训练步数消融
图4:投影模块消融实验:(a) 投影层数n,(b) 投影维度D′,(c) 训练步数。最优设置为2000步、n=2、D′=1024。金色星星标记最优ACC设置。
SSM层数的消融(表5)显示1层SSM已经足够:单层双向扫描在保持极低额外参数量的同时,提供了最优的跨层聚合能力;增加SSM层数不仅带来参数膨胀,性能反而下降——这大概率是因为深层SSM开始过拟合ProGAN的训练分布。状态维度(表6)和扩展因子(表7)的消融同样显示了适中的维度设置(d_state=16,d_expand=2)最优,过大反而破坏泛化。聚合组件消融(表8)和骨干网络选择(表9)则从不同角度确认了PE-Mamba设计选择的有效性。
表5:SSM层数消融
表5:SSM层数消融。1层SSM双向扫描在性能与参数量之间取得最佳平衡,额外增加SSM层数会导致过拟合和性能下降。
表6和表7:状态维度与SSM扩展因子消融
表6和表7:状态维度d_state与SSM扩展因子d_expand的消融实验。d_state=16、d_expand=2为最优配置,过大或过小均导致性能下降。
表8:聚合组件消融
表8:聚合组件消融。移除BSA、SWA或SGA中任一组件均导致性能下降,确认三大组件各自贡献了不可替代的信息。
表9:不同骨干网络选择对比
表9:不同骨干网络的选择对比。PE-Core-G14-448作为骨干在性能和泛化上表现最优,验证了大规模预训练视觉模型作为取证特征提取器的潜力。

未来展望:从静态图像到视频深伪检测

PE-Mamba目前聚焦于静态图像检测,但“跨层特征的有序聚合”这一思想可以很自然地扩展到视频深伪检测领域。视频帧本身就是时间维度的序列,如果把“层序列建模”与“帧序列建模”结合,用SSM同时建模空间维度上的层间递进关系和时序维度上的帧间上下文,理论上能进一步提升对换脸视频和生成式视频的检测能力。
鲁棒性评估结果
鲁棒性评估:不同图像扰动条件下的检测性能对比。PE-Mamba在JPEG压缩、高斯模糊、高斯噪声等常见后处理下的性能衰减小于大多数对比方法,展示了真实场景部署的潜力。
另一个值得探索的方向是生成模型的对抗性攻击。检测器在进步,生成器也在进步——未来的生成模型可能会专门针对检测器的弱点进行优化,从而抹除当前方法所依赖的取证痕迹。PE-Mamba基于双向SSM的“证据链聚合”能否在对抗攻击下保持稳定,需要进一步研究。
训练集规模与多样性影响分析
训练集规模与多样性影响分析:不同训练数据条件下PE-Mamba的检测性能变化,为实际应用中的数据配置提供参考。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?生成式AI让假图越来越难以分辨,密歇根大学等机构提出PE-Mamba:冻结PE-Core主干、仅用LoRA微调,用双向选择性扫描把Transformer层间特征按“从纹理到语义”的顺序聚合。
这篇工作最值得看的点是什么?在UniversalFakeDetect上达到96.6% mACC和99.5% mAP,在AIGCDetect上达到95.3% mACC和98.1% mAP,均超越18种对比方法,且仅训练1.3%的参数。
这篇工作的边界或风险在哪里?优点:1)创新性地将双向选择性SSM应用于跨层特征聚合,显式建模层间有序语义演进;2)参数高效,仅训练1.3%参数即达SOTA;3)跨生成器泛化能力强,在GAN和扩散模型上均表现稳定;4)对图像扰动具有鲁棒性。缺点:1)依赖大规模预训练backbone(PE-Core),计算量较大;2)在Midjourney和ADM等特定生成器上性能相对较低;3)未利用图像间关系信息。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出PE-Mamba框架,利用双向选择性状态空间模型(SSM)对预训练视觉transformer各层的CLS token进行有序序列建模,替代传统加权平均聚合,实现AI生成图像检测的跨层特征融合。

实验合理度:★★★★☆

ACC(准确率)、AP(平均精度)、mACC(平均准确率)、mAP(平均平均精度)

学术研究价值:★★★★☆

提出PE-Mamba框架,利用双向选择性状态空间模型(SSM)对预训练视觉transformer各层的CLS token进行有序序列建模,替代传统加权平均聚合,实现AI生成图像检测的跨层特征融合;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

1869.3 GFLOPs,推理时间62.5 ms/图像,总参数量1904.32M,可训练参数24.25M(1.3%),其中LoRA仅2.46M(0.13%)。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)依赖大规模预训练backbone(PE-Core),计算量较大;2)在Midjourney和ADM等特定生成器上性能相对较低;

主要参考文献


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球