← 返回 PaperDaily
视觉与图像
东南大学最新研究:噪声放大一招制敌,AI生成视频检测准确率飙升至91.92%!
AI视频生成已经卷到真假难辨,有时肉眼都看不出来,但算法放大招了!东南大学这篇工作另辟蹊径,不跟生成模型硬刚画面,而是从数字图像的“底层逻辑”——位平面入手。简单说,就是把视频拆成最细的“基因”片段,把AI留下的蛛丝马迹放大、再放大,然后交给分类器。效果相当炸裂,在标准测试集上直接甩开所有现有方法一大截,还顺手建了个专门为难检测器的数据集,真·专治各种不服。
龙哥读论文
发布于 2026-08-23 00:20:08
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: AI视频生成已经卷到真假难辨,有时肉眼都看不出来,但算法放大招了!东南大学这篇工作另辟蹊径,不跟生成模型硬刚画面,而是从数字图像的“底层逻辑”——位平面入手。简单说,就是把视频拆成最细的“基因”片段,把AI留下的蛛丝马迹放大、再放大,然后交给分类器。效果相当炸裂,在标准测试集上直接甩开所有现有方法一大截,还顺手建了个专门为难检测器的数据集,真·专治各种不服。如果你对“打假”感兴趣,这篇不容错过!
原论文信息如下:
位平面揭秘:AI视频的“指纹”在哪里?
先抛个问题:明明AI生成的视频肉眼看上去就跟真的一样,为啥检测算法还能揪出来?答案藏在一个很基础的图像处理概念里——位平面 (bit-plane)。
一幅彩色图像可以拆成三个通道(红、绿、蓝),每个通道的每个像素值用8位二进制表示,从最低位(bit-0)到最高位(bit-7)。这8个位平面中,低位平面(bit-0, bit-1, bit-2) 记录像素值最细微的变化——可以理解为图像的“噪声层”或“细节层”。
真实视频和AI生成视频在内容上可能难分伯仲,但在这些“噪声层”里,AI的生成痕迹却暴露无遗。看下面这张图,对比真实视频和AI生成视频的低三位平面,AI视频中的伪影更清晰、更不规则,就像在光滑的地板上撒了沙子一样显眼。
瞧见没?这其实给了研究者一个启发:AI生成模型虽然在宏观画面上下功夫,却很难完全模拟真实世界的微观噪声分布。东南大学的团队正是抓住了这个漏洞,提出用低位平面提取“噪声指纹”。
具体怎么做?先把视频的每一帧 RGB 图像分解成三个通道,对每个通道的像素值做位平面分解:
既然找到了指纹,下一步就是把它放大,让神经网络一眼就能认出。这就要进入NAMP方法的第二个核心环节。
噪声放大三部曲:从像素到帧的全面增强
提取出来的噪声信号值很小(0~7之间的整数),直接送进去训练,神经网络很难学到东西。于是论文提出了噪声放大(Noise Amplification) 策略,从三个层面下手:像素级强度增强、区域级空间放大、帧级时间聚合 。整体流程见图2。
第一层:像素级强度增强 。最简单的操作,把低比特图像的值从0~7线性拉伸到0~255。这样一来,原本微弱的噪声信号变得明显,神经网络可以轻松捕捉到像素级别的差异。
第二层:区域级空间放大 。AI生成的伪影往往只出现在画面的某些局部区域(比如人物脸部、物体边缘),而不是整幅图像。如果直接放大整帧图像,计算量会爆炸。本文的做法是:随机将噪声帧分割成不重叠的小块(例如16×16),计算每个块的散度得分,选出得分最高的块,然后上采样回原尺寸。散度得分通过四个卷积核计算水平和垂直方向的差异:
第三层:帧级时间聚合 。视频的本质是时间序列,单帧的伪影可能不稳定,但跨帧的伪影模式会更明显。论文给出两种简单采样方法:体素法(voxel-based)和逐帧法(frame-wise)。体素法将第一帧选出的块位置固定,后续所有帧都从相同位置裁剪,这样保留了原始视频的时间动态;逐帧法则对每一帧重新独立选块。实验表明体素法效果更好,因为它保留了时空连续性。
经过这三步处理,原本微弱的噪声信号被充分增强,最终输入到一个标准的3D视频分类网络(如I3D、SlowFast、TimeSformer)中做真假分类。整个流程端到端,不需要任何手工特征工程。
HardGVD挑战:专治“硬骨头”视频数据集
现有的AI视频检测基准如GenVidBench已经很大了,但南大团队注意到一个现象:某些类别(植物、车辆、人物、建筑、自然场景)的视频,现有模型特别容易判错。于是他们专门把这些“硬骨头”挑出来,构建了一个新的挑战性数据集——Hard Generated Video Detection (HardGVD) 。
HardGVD包含5个子集:4个AI生成子集(分别用CogVideo、Text2Video-Zero、Tune-A-Video、VideoCrafter生成),以及1个真实视频子集(从YouTube、Bilibili和HD-VG数据集中选取)。总视频数4000,真假各半,确保类别平衡。每个AI子集都包含了植物、车辆、人物等困难类别,而且视频质量非常高(FID低于25,LPIPS低于0.15,VMAF大部分超过90),与真实视频极度接近。
这样的数据集对于评估检测算法的鲁棒性意义重大:如果算法能在HardGVD上取得良好表现,说明它不是靠“记忆”生成模型的常见伪影,而是真正学会了辨别AI生成内容的本质特征。
碾压式结果:91.92%准确率,领先10%以上
在最大的公开基准GenVidBench上,NAMP方法交出了惊人的成绩单。
更令人惊叹的是,NAMP在5个子集上全部超过80%的准确率,而其他方法几乎都有明显短板——有的子集上甚至只有个位数准确率。这种均衡表现说明NAMP不是“偏科生”,而是真正的全能选手。
另外,不同位平面数量的影响也很有意思:使用bit-0~2三个低位平面效果最好(91.92%),只用bit-0降到76.72%,多用到bit-3反而下降到85.93%。这说明伪影主要集中在最底层位平面,更高位包含真实内容信息过多,反而干扰判别。
稳健性与泛化:新模型也逃不过它的“火眼金睛”
一个优秀的检测算法不仅要能在已知模型上表现好,还要能泛化到从未见过的视频生成模型上。论文做了两轮泛化测试。
跨数据集测试 :将在GenVidBench上训练好的模型,直接拿到HardGVD上进行测试。结果见表3。
新模型泛化测试 :用2026年最新发布的WANX和LTX-Video生成高分辨率长视频(1280×720,120帧),直接测试未经任何微调的模型。结果见表4。
此外,论文还做了对扰动(JPEG压缩、高斯模糊、H.264压缩)的鲁棒性测试,NAMP在大部分扰动下仍能保持较高准确率,表11显示即使在最严重的压缩下(CRF=30)也有70%以上的AUC。
最后,论文还展示了部分分类错误的困难案例(图5),这些案例既有AI生成视频被误判为真实,也有真实视频被误判为AI。分析这些失败案例有助于未来进一步改进方案。
龙迷三问
这篇论文解决什么问题? 这篇论文解决的是AI生成视频的检测问题。具体来说,就是从视频的位平面中提取噪声信号并进行放大,然后利用标准的3D视频分类网络来区分真实视频和AI生成的视频。文中提出了NAMP方法,并在大规模基准GenVidBench和新构建的HardGVD数据集上取得了领先结果。
NAMP中的“空间放大”为什么选用梯度散度得分来选择补丁? 因为AI生成视频的伪影往往出现在局部纹理变化剧烈的区域(比如人物眼睛、汽车边缘、植物叶片边界),而梯度散度得分能够综合度量一个图像块内部的水平和垂直纹理复杂度。得分最高的块通常就是伪影最集中的区域。作者还对比了基于纹理、运动、光流的其他策略,实验证明梯度散度得分效果最好。
HardGVD数据集和GenVidBench有什么不同? GenVidBench是一个大型通用基准,包含多种生成模型和开放场景;HardGVD则聚焦于GenVidBench中被模型频繁误判的“困难类别”(如植物、车辆、人物、建筑、自然场景),并专门针对这些类别收集了更多AI生成视频和真实视频。此外,HardGVD中的视频质量极高(FID<25,VMAF>90),更接近真实视频,因此挑战性更大。用HardGVD评估能更好地反映检测算法的真实鲁棒性。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 把位平面分析从图像检测拓展到视频检测,并提出三阶段噪声放大策略(强度+空间+时间),思路新颖且有效。但不是第一个将位平面用于AI内容检测的(LOTA等已用于图像),所以扣一星。
实验合理度:★★★★★ 实验设计非常全面:在标准基准GenVidBench上对比十余种方法,在自建HardGVD上做跨数据集评估,对新模型泛化测试,还做了充分的消融和鲁棒性分析。对比方法涵盖主流的视频分类网络和图像检测方法,设置公平合理。满分。
学术研究价值:★★★★☆ 提出了一种基于视频底层噪声特征的检测范式,为后续AI生成视频检测开辟了新思路。构建的HardGVD数据集可作为困难案例的基准,推动领域发展。但方法相对简单,理论深度一般,所以四星。
稳定性:★★★★☆ 在多种扰动(压缩、模糊)下仍能保持较高准确率,稳定性不错。但在HardGVD跨数据集测试中,某些子集准确率偏低(COG只有42.6%),说明稳定性仍有提升空间。
适应性以及泛化能力:★★★★☆ 对新模型(WANX、LTX-Video)泛化能力强(84%和75%),跨数据集也能达70%,说明泛化性出色。但HardGVD上的表现差异较大(TAV 90.6%,COG 42.6%),对不同生成模型的适应性不均衡。
硬件需求及成本:★★★★☆ 方法简单,只需要位平面提取和卷积运算,计算量不大。使用I3D作为判别器,推理速度可以满足实时需求。但训练时需要16帧采样,对显存有一定要求。整体合理。
复现难度:★★★★★ 方法简单清晰,所有组件开源(论文中链接),数据集的构建细节公开,只要按论文描述即可复现。代码预计将开源,复现难度低。
产品化成熟度:★★★☆☆ 目前还是在学术基准上验证,实际部署需要考虑多种视频编解码、分辨率、帧率变化,以及对抗攻击。在HardGVD上平均准确率不足70%,离成熟产品还有距离。但作为检测模块集成到安全系统中是可行的。
可能的问题: 1) 在HardGVD上整体准确率偏低(70%),无法满足实际安全需求;2) 位平面的选择(bit-0~2)是否对所有生成模型都最优?文中只在有限模型上验证;3) 对抗攻击下可能失效(未测试)。
主要参考文献
[1] GenVidBench: A large-scale benchmark for AI-generated video detection. Shao et al. 2026.
[2] LOTA: Looking at the overlooked artifacts for AI-generated image detection. Zhu et al. 2025.
[3] ESSP: Enhanced spatial selection for detecting AI-generated images. Chen et al. 2024.
[4] I3D: Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. Carreira & Zisserman, CVPR 2017.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
AI视频真假博弈,就像一场无休止的猫鼠游戏。想加入前沿的AI检测玩家行列,一起捕获最新技术与实战技巧吗?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群