← 返回 PaperDaily 视觉与图像

东南大学最新研究:噪声放大一招制敌,AI生成视频检测准确率飙升至91.92%!

AI视频生成已经卷到真假难辨,有时肉眼都看不出来,但算法放大招了!东南大学这篇工作另辟蹊径,不跟生成模型硬刚画面,而是从数字图像的“底层逻辑”——位平面入手。简单说,就是把视频拆成最细的“基因”片段,把AI留下的蛛丝马迹放大、再放大,然后交给分类器。效果相当炸裂,在标准测试集上直接甩开所有现有方法一大截,还顺手建了个专门为难检测器的数据集,真·专治各种不服。

东南大学最新研究:噪声放大一招制敌,AI生成视频检测准确率飙升至91.92%!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
AI视频生成已经卷到真假难辨,有时肉眼都看不出来,但算法放大招了!东南大学这篇工作另辟蹊径,不跟生成模型硬刚画面,而是从数字图像的“底层逻辑”——位平面入手。简单说,就是把视频拆成最细的“基因”片段,把AI留下的蛛丝马迹放大、再放大,然后交给分类器。效果相当炸裂,在标准测试集上直接甩开所有现有方法一大截,还顺手建了个专门为难检测器的数据集,真·专治各种不服。如果你对“打假”感兴趣,这篇不容错过!


原论文信息如下:
论文标题:
Revealing Artifacts via Noise Amplification: A Novel Perspective for AI-Generated Video Detection
发表日期:
2026年06月
发表单位:
东南大学 (Southeast University)
原文链接:
https://arxiv.org/pdf/2606.16742v1.pdf

位平面揭秘:AI视频的“指纹”在哪里?

先抛个问题:明明AI生成的视频肉眼看上去就跟真的一样,为啥检测算法还能揪出来?答案藏在一个很基础的图像处理概念里——位平面(bit-plane)。
一幅彩色图像可以拆成三个通道(红、绿、蓝),每个通道的每个像素值用8位二进制表示,从最低位(bit-0)到最高位(bit-7)。这8个位平面中,低位平面(bit-0, bit-1, bit-2)记录像素值最细微的变化——可以理解为图像的“噪声层”或“细节层”。
真实视频和AI生成视频在内容上可能难分伯仲,但在这些“噪声层”里,AI的生成痕迹却暴露无遗。看下面这张图,对比真实视频和AI生成视频的低三位平面,AI视频中的伪影更清晰、更不规则,就像在光滑的地板上撒了沙子一样显眼。
图1:真实视频和AI生成视频的低位平面对比,显示出AI视频中存在更清晰、更不规则的伪影。
图1:真实视频和AI生成视频的低位平面对比(人物、车辆、自然、植物四类内容)。右下角是实际视频中对应的原始帧,左边三列分别显示 bit-0、bit-1、bit-2 的三个最低位平面。可以看出,AI生成帧在低位平面上留下了更明显的伪影。
瞧见没?这其实给了研究者一个启发:AI生成模型虽然在宏观画面上下功夫,却很难完全模拟真实世界的微观噪声分布。东南大学的团队正是抓住了这个漏洞,提出用低位平面提取“噪声指纹”。
具体怎么做?先把视频的每一帧 RGB 图像分解成三个通道,对每个通道的像素值做位平面分解:
公式1:像素值由8个加权位平面求和得到,其中 x_k^c 表示通道c的第k个位平面。
然后只保留最低的三个位平面,重构出一个“低比特图像”:
公式2:低比特图像 z^c 由 bit-0,bit-1,bit-2 加权求和得到,值域0~7。
这样一来,每帧得到一个噪声图,整套视频就变成了“噪声序列”。对比一下真实视频和AI生成视频的噪声序列(图3),差距肉眼可见。
图3:真实视频和AI生成视频的噪声序列可视化。AI视频的噪声帧中存在更多不寻常的伪影。
图3:噪声序列可视化。左列为真实视频各帧的噪声图,右列为AI生成视频的噪声图。注意右侧人脸区域、植物边缘等位置出现了明显的不规则纹理——这些就是AI留下的“指纹”。
既然找到了指纹,下一步就是把它放大,让神经网络一眼就能认出。这就要进入NAMP方法的第二个核心环节。
插图

噪声放大三部曲:从像素到帧的全面增强

提取出来的噪声信号值很小(0~7之间的整数),直接送进去训练,神经网络很难学到东西。于是论文提出了噪声放大(Noise Amplification)策略,从三个层面下手:像素级强度增强、区域级空间放大、帧级时间聚合。整体流程见图2。
图2:NAMP方法整体流程。输入RGB视频帧→位平面切片得到8个位平面→取低三位组成噪声序列→经过强度增强、空间放大和时间聚合→得到采样后的噪声帧→送入分类器判别真假。
图2:NAMP方法整体流程图。从RGB视频帧开始,经过位平面切片、低比特提取、噪声放大(强度增强+空间放大+时间聚合),最后用判别器网络进行真假分类。
第一层:像素级强度增强。最简单的操作,把低比特图像的值从0~7线性拉伸到0~255。这样一来,原本微弱的噪声信号变得明显,神经网络可以轻松捕捉到像素级别的差异。
第二层:区域级空间放大。AI生成的伪影往往只出现在画面的某些局部区域(比如人物脸部、物体边缘),而不是整幅图像。如果直接放大整帧图像,计算量会爆炸。本文的做法是:随机将噪声帧分割成不重叠的小块(例如16×16),计算每个块的散度得分,选出得分最高的块,然后上采样回原尺寸。散度得分通过四个卷积核计算水平和垂直方向的差异:
公式3:散度得分 g_p 是四个方向卷积核(水平、垂直、两个对角)与小块图像卷积结果的 L1 范数之和。
其中 g₁=[-1 1], g₂=g₁^T (转置),g₃=[[-1,0],[0,1]],g₄=[[0,-1],[1,0]]。这个得分能综合描述块内水平、垂直和对角的纹理复杂度。得分越高,说明该块内噪声变化越剧烈,越可能包含AI生成的伪影。
第三层:帧级时间聚合。视频的本质是时间序列,单帧的伪影可能不稳定,但跨帧的伪影模式会更明显。论文给出两种简单采样方法:体素法(voxel-based)和逐帧法(frame-wise)。体素法将第一帧选出的块位置固定,后续所有帧都从相同位置裁剪,这样保留了原始视频的时间动态;逐帧法则对每一帧重新独立选块。实验表明体素法效果更好,因为它保留了时空连续性。
经过这三步处理,原本微弱的噪声信号被充分增强,最终输入到一个标准的3D视频分类网络(如I3D、SlowFast、TimeSformer)中做真假分类。整个流程端到端,不需要任何手工特征工程。

HardGVD挑战:专治“硬骨头”视频数据集

现有的AI视频检测基准如GenVidBench已经很大了,但南大团队注意到一个现象:某些类别(植物、车辆、人物、建筑、自然场景)的视频,现有模型特别容易判错。于是他们专门把这些“硬骨头”挑出来,构建了一个新的挑战性数据集——Hard Generated Video Detection (HardGVD)
HardGVD包含5个子集:4个AI生成子集(分别用CogVideo、Text2Video-Zero、Tune-A-Video、VideoCrafter生成),以及1个真实视频子集(从YouTube、Bilibili和HD-VG数据集中选取)。总视频数4000,真假各半,确保类别平衡。每个AI子集都包含了植物、车辆、人物等困难类别,而且视频质量非常高(FID低于25,LPIPS低于0.15,VMAF大部分超过90),与真实视频极度接近。
图4:HardGVD数据集示例帧,包含真实子集和四个AI生成子集的画面。
图4:HardGVD数据集各子集示例帧。从上到下依次为真实视频(YT-BI)、COG、T2VZ、TAV、VC。注意不同子集的分辨率、拍摄视角和光照条件各不相同,增加了检测难度。
表1:HardGVD数据集统计信息,包括各子集来源、帧数、FPS、视频数量、分辨率、FID、LPIPS、VMAF指标。
表1:HardGVD数据集详细信息。注意所有AI子集的FID都低于25,LPIPS低于0.15,VMAF接近90或以上,说明生成质量极高,与真实视频难以区分。
这样的数据集对于评估检测算法的鲁棒性意义重大:如果算法能在HardGVD上取得良好表现,说明它不是靠“记忆”生成模型的常见伪影,而是真正学会了辨别AI生成内容的本质特征。

碾压式结果:91.92%准确率,领先10%以上

在最大的公开基准GenVidBench上,NAMP方法交出了惊人的成绩单。
表2:GenVidBench上各方法对比。NAMP+I3D在5个子集上的平均准确率达到91.92%,比第二名MViTV2(79.90%)高出12.02个百分点。
表2:GenVidBench数据集上各方法对比(准确率百分比)。NAMP结合I3D取得了91.92%的平均准确率,远超所有现有方法。注意第二名的MViTV2只有79.90%,其他方法更是普遍低于70%。而专门为图像伪造检测设计的ESSP和LOTA在视频任务上表现极差,说明图像和视频检测之间存在巨大的域差距。
更令人惊叹的是,NAMP在5个子集上全部超过80%的准确率,而其他方法几乎都有明显短板——有的子集上甚至只有个位数准确率。这种均衡表现说明NAMP不是“偏科生”,而是真正的全能选手。
消融实验进一步验证了每个组件的必要性。
表5:消融实验结果。同时使用噪声提取和补丁选择(空间放大)时平均准确率91.92%;去掉补丁选择降为66.74%;去掉噪声提取降为53.39%;两者都去掉只剩38.10%。
表5:消融研究。Noise指基于位平面的噪声提取,Patch指补丁选择和空间放大。两者同时使用达到91.92%,缺少任何一个组件准确率都大幅下降,尤其是同时缺少时只剩38.10%——足以证明这两个设计是NAMP的灵魂。
论文还对比了不同的补丁选择策略和聚合方式。
表6:补丁选择策略(最大、最小、随机)和聚合方式(体素vs逐帧)的影响。
表6:补丁选择和聚合的影响。最大得分策略显著优于最小和随机策略(高出21%和17%)。体素聚合优于逐帧聚合,说明保留时间动态信息对检测非常关键。
另外,不同位平面数量的影响也很有意思:使用bit-0~2三个低位平面效果最好(91.92%),只用bit-0降到76.72%,多用到bit-3反而下降到85.93%。这说明伪影主要集中在最底层位平面,更高位包含真实内容信息过多,反而干扰判别。

稳健性与泛化:新模型也逃不过它的“火眼金睛”

一个优秀的检测算法不仅要能在已知模型上表现好,还要能泛化到从未见过的视频生成模型上。论文做了两轮泛化测试。
跨数据集测试:将在GenVidBench上训练好的模型,直接拿到HardGVD上进行测试。结果见表3。
表3:HardGVD上的跨数据集检测结果。NAMP+I3D平均准确率69.95%,远高于I3D(50.80%)和ESSP(39.80%)。
表3:跨数据集测试结果。注意HardGVD的难度更大,现有方法基本失效,I3D只有50.80%准确率(接近随机),ESSP更是掉到39.80%。而NAMP通过噪声放大保留了关键判别特征,依然能达到69.95%的准确率,虽然在T2VZ和TAV子集上表现优秀(84.6%、90.6%),但整体仍有提升空间。
新模型泛化测试:用2026年最新发布的WANX和LTX-Video生成高分辨率长视频(1280×720,120帧),直接测试未经任何微调的模型。结果见表4。
表4:对WANX和LTX-Video新模型的检测结果。NAMP在WANX上84.00%,在LTX-Video上75.33%,远超其他方法。
表4:对两个全新视频生成模型的检测。TimeSformer和I3D等主流方法准确率不足60%,有的甚至不到30%,而NAMP在WANX上达到84%,在LTX-Video上达到75.33%。这说明基于位平面的噪声特征具有跨模型的通用性,而不仅仅是过拟合到训练集见过的生成模型上。
此外,论文还做了对扰动(JPEG压缩、高斯模糊、H.264压缩)的鲁棒性测试,NAMP在大部分扰动下仍能保持较高准确率,表11显示即使在最严重的压缩下(CRF=30)也有70%以上的AUC。
表11:鲁棒性评估。在各种JPEG压缩、高斯模糊和H.264压缩下NAMP仍保持70%以上AUC。
表11:鲁棒性评估。在JPEG压缩(质量95%/90%/85%)、高斯模糊(σ=1,2,3)、H.264压缩(CRF 18,24,30)下,NAMP的AUC虽然有所下降,但大部分情况仍高于70%,优于大多数对比方法。这表明噪声放大策略对常见的视频后处理操作具有一定的抵抗力。
最后,论文还展示了部分分类错误的困难案例(图5),这些案例既有AI生成视频被误判为真实,也有真实视频被误判为AI。分析这些失败案例有助于未来进一步改进方案。
图5:NAMP在GenVidBench上误分类的困难案例可视化。上方为AI生成视频(附文本提示),下方为真实视频。
图5:困难案例展示。例如,左图的AI生成视频“一只毛茸茸的小狗在草地上奔跑”被错误分类为真实,可能因为复杂背景中的噪声模式与真实视频接近;右图的真实视频被错误分类为AI,可能因为拍摄时存在压缩噪声或低光条件产生了类似AI的伪影。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?这篇论文解决的是AI生成视频的检测问题。具体来说,就是从视频的位平面中提取噪声信号并进行放大,然后利用标准的3D视频分类网络来区分真实视频和AI生成的视频。文中提出了NAMP方法,并在大规模基准GenVidBench和新构建的HardGVD数据集上取得了领先结果。

NAMP中的“空间放大”为什么选用梯度散度得分来选择补丁?因为AI生成视频的伪影往往出现在局部纹理变化剧烈的区域(比如人物眼睛、汽车边缘、植物叶片边界),而梯度散度得分能够综合度量一个图像块内部的水平和垂直纹理复杂度。得分最高的块通常就是伪影最集中的区域。作者还对比了基于纹理、运动、光流的其他策略,实验证明梯度散度得分效果最好。

HardGVD数据集和GenVidBench有什么不同?GenVidBench是一个大型通用基准,包含多种生成模型和开放场景;HardGVD则聚焦于GenVidBench中被模型频繁误判的“困难类别”(如植物、车辆、人物、建筑、自然场景),并专门针对这些类别收集了更多AI生成视频和真实视频。此外,HardGVD中的视频质量极高(FID<25,VMAF>90),更接近真实视频,因此挑战性更大。用HardGVD评估能更好地反映检测算法的真实鲁棒性。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆把位平面分析从图像检测拓展到视频检测,并提出三阶段噪声放大策略(强度+空间+时间),思路新颖且有效。但不是第一个将位平面用于AI内容检测的(LOTA等已用于图像),所以扣一星。

实验合理度:★★★★★实验设计非常全面:在标准基准GenVidBench上对比十余种方法,在自建HardGVD上做跨数据集评估,对新模型泛化测试,还做了充分的消融和鲁棒性分析。对比方法涵盖主流的视频分类网络和图像检测方法,设置公平合理。满分。

学术研究价值:★★★★☆提出了一种基于视频底层噪声特征的检测范式,为后续AI生成视频检测开辟了新思路。构建的HardGVD数据集可作为困难案例的基准,推动领域发展。但方法相对简单,理论深度一般,所以四星。

稳定性:★★★★☆在多种扰动(压缩、模糊)下仍能保持较高准确率,稳定性不错。但在HardGVD跨数据集测试中,某些子集准确率偏低(COG只有42.6%),说明稳定性仍有提升空间。

适应性以及泛化能力:★★★★☆对新模型(WANX、LTX-Video)泛化能力强(84%和75%),跨数据集也能达70%,说明泛化性出色。但HardGVD上的表现差异较大(TAV 90.6%,COG 42.6%),对不同生成模型的适应性不均衡。

硬件需求及成本:★★★★☆方法简单,只需要位平面提取和卷积运算,计算量不大。使用I3D作为判别器,推理速度可以满足实时需求。但训练时需要16帧采样,对显存有一定要求。整体合理。

复现难度:★★★★★方法简单清晰,所有组件开源(论文中链接),数据集的构建细节公开,只要按论文描述即可复现。代码预计将开源,复现难度低。

产品化成熟度:★★★☆☆目前还是在学术基准上验证,实际部署需要考虑多种视频编解码、分辨率、帧率变化,以及对抗攻击。在HardGVD上平均准确率不足70%,离成熟产品还有距离。但作为检测模块集成到安全系统中是可行的。

可能的问题:1) 在HardGVD上整体准确率偏低(70%),无法满足实际安全需求;2) 位平面的选择(bit-0~2)是否对所有生成模型都最优?文中只在有限模型上验证;3) 对抗攻击下可能失效(未测试)。


主要参考文献

[1] GenVidBench: A large-scale benchmark for AI-generated video detection. Shao et al. 2026.
[2] LOTA: Looking at the overlooked artifacts for AI-generated image detection. Zhu et al. 2025.
[3] ESSP: Enhanced spatial selection for detecting AI-generated images. Chen et al. 2024.
[4] I3D: Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. Carreira & Zisserman, CVPR 2017.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
AI视频真假博弈,就像一场无休止的猫鼠游戏。想加入前沿的AI检测玩家行列,一起捕获最新技术与实战技巧吗?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。