← 返回 PaperDaily
视觉与图像
0.846分接收!通用音视频假货检测,融合不如解耦
继2026年6月龙哥聊过AI检测器泛化难题后,哈尔滨工业大学团队在IJCAI-ECAI 2026挑战赛中给出了一个反直觉的答案:原来音视频之间的一致性假设在通用场景下根本不靠谱,解耦才是王道!DAV-Det以0.8460分夺得第一,简单粗暴但效果惊人。
龙哥读论文
发布于 2026-08-14 09:11:35
阅读 3
查看原文
原论文信息如下:
传统多模态检测的陷阱:音视频对应假设在通用场景中失效
你可能会觉得:检测AIGC音视频,最直接的方法不就是看音画是否同步吗?嘴唇动的时候声音对不上,或者背景音乐和画面氛围不搭,那肯定就是假的了。这逻辑在人类相关的深度伪造(比如换脸、声音克隆)上确实管用——真人视频中唇形和语音高度匹配。但龙哥必须给你泼一盆冷水:这套假设在通用AIGC场景下,不仅不管用,还可能帮倒忙。
龙哥来说为什么。通用场景中除了人,还有大量动物、物体、场景的内容。比如一段猫在键盘上散步的视频,配乐是莫扎特的钢琴曲——这音频和视频根本就没有语义上的对应关系,但它是真实的(真实猫+真实音乐)。而有些AI生成的风景动画,可能森林里播放的是鸟叫声,音画很搭,但从内容看,整个视频+音频都是AI编出来的。如果还硬用“音视频一致性”来判假,真实猫视频反而会因为“不一致”被打成假,AI风景反而会因“一致”被误判为真。
为了验证这一判断,哈工大团队做了一个严谨的量化实验。他们使用PEAV(一个预训练的音视频对齐模型)提取了两种代表性数据集的特征,计算音频和视频特征之间的余弦相似度,并以此为得分进行零样本AIGC检测(即直接根据相似度排序来区分真假)。结果如下:
在人类中心数据集FakeAVCeleb上,真实样本的音视频相似度明显高于伪造样本,用这个分数直接做检测,AUC达到82.48%——有效。但在通用场景数据集MVAD上,真实样本的相似度反而比伪造样本还低,按同一个逻辑计算出的AUC只有40.28%,甚至比随机猜测(50%)还差。这说明:在通用场景中,“音视频不一致”不再是伪造信号,可能反而是常态。强行用一致性做模态融合,只会引入噪声。
基于这个发现,论文提出一个反直觉的思路:既然噪音频不对应,那干脆就别让音频和视频在特征层强行对齐了,把两者彻底解耦,各自独立判断,最后在决策层简单融合。 这种“各干各的、各算各的”思路,反而更适合通用场景——也正好呼应了标题“Less is More”:少做些跨模态的复杂交互,可能效果更好。
为了更深入地理解这一现象,我们可以从数据分布的角度来分析。MVAD数据集包含写实和动漫两种视觉风格,以及人、动物、物体、场景四种内容类别。在写实风格中,动物和物体类别的样本往往没有自然的音视频对应关系——例如一段真实拍摄的瀑布画面,配乐可能是后期添加的钢琴曲,这在真实世界中非常常见。而在动漫风格中,几乎所有音频都是后期合成的,音视频之间的对应关系更加微弱。相比之下,FakeAVCeleb数据集专门针对人类说话场景构建,其中音频和视频天然具有唇形同步的强对应关系。因此,基于音视频一致性假设的方法在FakeAVCeleb上有效,但在MVAD上失效,根本原因在于数据集本身的模态依赖结构不同。这一发现提醒我们,在设计多模态检测系统时,必须首先分析目标场景中模态间的依赖强度,而不是盲目套用已有的融合策略。
化繁为简:DAV-Det的解耦设计思路
DAV-Det(Decoupled Audio-Visual AIGC Detection)的设计哲学很简单:不要试图让音频和视频互相“看懂”对方,而是让它们各自成为“专家”,然后通过一个简单的投票器决定最终结果。 整个系统由两个独立的检测器组成:
视觉检测器(Visual Detector) :基于DINOv3 ViT-L/16作为骨干提取特征,通过多粒度表示(全局、patch、segment)捕捉不同空间尺度的伪造痕迹。
音频检测器(Audio Detector) :基于PEAV-base的音频编码器提取特征,通过门控时频双分支架构同时建模时间动态和频谱异常。
两个检测器在训练时完全独立,仅共享相同的弱监督学习框架(因为只有视频级真假标签,没有音频/视频各自的细粒度标签)。推理时,视觉检测器从视频中均匀采16帧,每帧独立预测后取平均值得到视频伪造概率;音频检测器用3秒滑动窗口对音频分段预测,取平均值得到音频伪造概率。最后根据两种概率进行决策级融合:
二分类(真/假) :采用max融合,即取音频和视频伪造概率的最大值作为最终假概率。因为只要有一个模态看起来假,整体就应该判定为假,避免漏检。
四分类(RR/FF/FR/RF) :基于独立性假设,将两个模态的真假概率相乘,得到四种联合概率,取最大者作为类别。例如,视频真、音频真对应RR(全真),视频假、音频假对应FF(全假),视频真、音频假对应RF(视频真实但音频伪造),以此类推。
下面是DAV-Det的整体框架图,清晰地展示了数据流:
从框架图可以看出,整个系统没有跨模态的交互模块。视觉检测器和音频检测器各自接收原始输入,经过独立的特征提取和分类网络,输出各自的伪造概率。在决策融合阶段,两种概率通过简单的数学运算(max或乘积)得到最终结果。这种设计使得每个检测器可以专注于自身模态的伪造特征,避免了跨模态对齐带来的噪声。更重要的是,这种解耦设计使得系统可以灵活地替换或升级单个检测器,而不影响另一个检测器的工作。例如,未来如果有更强大的视觉伪造检测模型,可以直接替换视觉检测器,而音频检测器保持不变。这种模块化设计在实际部署中具有很高的实用价值。
视觉检测器:多粒度表示捕获空间伪造痕迹
AIGC图像/视频的伪造痕迹往往存在于多个空间尺度:全局语义异常(物体形状不合理)、局部纹理伪影(模糊的边界或异常的高频细节)、以及区域间不一致(光影方向不统一)。为了全面捕捉这些线索,视觉检测器设计了三个粒度的表示:
全局表示(Global) :直接使用ViT的CLS token,它通过自注意力聚合了所有patch的信息,适合捕捉整体语义偏差。
Patch级表示(Patch-level) :对每个patch token,通过一个两层MLP(本文称为patch authenticity scoring network)计算其伪造得分,然后使用softmax(带温度系数τ=0.07)将得分归一化为权重,再对所有patch token做加权求和,得到patch级聚合表示。这个设计类似注意力机制,但权重由可学习的伪造评分网络产生。
Segment级表示(Segment-level) :先使用凝聚层次聚类(agglomerative clustering)将patch tokens按照特征余弦相似度合并成K个不相交的空间区域(segment),每个segment内取平均得到segment token。然后同样通过一个segment authenticity scoring network计算每个segment的伪造得分,加权聚合得到segment级表示。
由于训练时只有图像级的真假标签,patch和segment的伪造得分缺乏直接监督。为此,论文引入了弱监督多实例学习(MIL) :假设伪造图像中一定存在部分高度可疑的patch/segment,计算这些“top-k”实例的平均得分作为图像级预测,并与真实标签计算focal loss。同时增加一个margin loss,鼓励top-k实例与剩余实例的得分拉开差距。
此外,为了提高对现实环境退化(噪声、模糊、JPEG压缩等)的鲁棒性,视觉检测器还引入了一个退化-原始一致性学习(Degraded-Original Consistency Learning,DOCL) :对输入图像施加多种扰动(如高斯噪声、模糊、几何变换、色彩失真等,共13种,见表1),然后要求模型在原始图像和退化图像上的多粒度表示尽可能一致(只计算退化分支的梯度)。这种方法迫使模型学习与空间低频退化无关的、对伪造敏感的本质特征。
视觉检测器的最终分类器是一个三层MLP,输入为三个粒度表示的拼接,同时训练三个辅助分类器(分别对global、patch聚合、segment聚合单独分类)以正则化。训练总损失为主分类器、辅助分类器损失之和,加上MIL损失、margin损失和DOCL一致性损失(权重0.05)。
这里需要特别说明一下凝聚层次聚类的具体实现。在DAV-Det中,patch tokens的数量为196(14×14网格),聚类时首先计算所有patch token之间的余弦相似度矩阵,然后采用自底向上的策略:初始每个patch作为一个独立簇,每次合并最相似的两个相邻簇(空间上相邻的patch才能合并),直到簇的数量达到预设值K(实验中K=16)。这种空间约束确保了每个segment对应一个连续的区域,从而能够捕捉区域级的伪造痕迹,例如某个物体边缘的异常纹理。segment级表示与patch级表示的区别在于:patch级表示关注单个局部区域,而segment级表示关注语义相关的连续区域,能够更好地捕捉跨patch的伪造模式,例如整个物体表面的异常纹理。
音频检测器:时频双分支建模声学伪影
AIGC音频的伪造痕迹表现在两方面:时间动态异常(如节奏不自然、过渡突兀)和频谱特征异常(如高频伪影、能量分布怪异)。音频检测器因此采用门控时频双分支架构 ,分别建模这两种线索。
特征提取采用PEAV-base音频编码器(该编码器已经在音视频对齐任务上预训练,能够提供鲁棒的音频表示)。输出包括一个CLS token(全局)和一系列frame tokens(帧级特征,时间步长T,维度D)。首先通过一个门控网络G(两层MLP + sigmoid)生成一个element-wise的门控图W ∈ (0,1)^(T×D),用于自适应地选择重要的时间-频谱位置。
时间分支(Temporal Branch) :对门控调制后的帧序列应用自注意力,建模时间依赖,得到时间增强特征。然后用三种池化方式(平均、最大、可学习Query池化)聚合出三个时间表示。
频谱分支(Spectral Branch) :对同样的调制后特征应用通道注意力(SENet式的挤压激励),强调频谱相关的模式,得到频谱增强特征。同样用三种方式得到三个频谱表示。
最后,CLS token通过交叉注意力选择性聚合六个表示中的信息,形成统一音频表示,再与六个原始表示拼接,送入三层MLP分类器做二分类。
音频检测器的设计有几个关键细节值得注意。首先,门控网络的作用是自适应地选择重要的时间-频谱位置。例如,在语音片段中,门控网络可能会强调与发音相关的频率范围,而抑制背景噪声;在音乐片段中,门控网络可能会强调旋律相关的频率范围。这种自适应选择使得模型能够专注于与伪造相关的特征,而忽略无关的噪声。其次,时间分支和频谱分支分别建模不同的伪造线索:时间分支关注音频的时间动态,例如语音的节奏是否自然、音乐的过渡是否平滑;频谱分支关注音频的频谱特征,例如高频区域是否存在异常伪影、能量分布是否符合自然规律。两个分支的输出通过交叉注意力融合,使得模型能够综合利用时间和频谱信息。最后,三种池化方式(平均、最大、可学习Query池化)提供了不同视角的聚合表示:平均池化关注整体特征,最大池化关注最显著的特征,可学习Query池化则通过注意力机制自适应地选择重要特征。这种多视角聚合策略增强了表示的鲁棒性。
实验验证:在DDL-GAV挑战赛夺得第一
论文团队在IJCAI-ECAI 2026 DDL 2.0 Workshop举办的General AIGC Audio-Video Detection Challenge(DDL-GAV)上提交了DAV-Det,并最终排名第一。该基准基于MVAD数据集,包含20万+音视频样本,覆盖写实和动漫两种视觉风格、4种内容类别(人、动物、物体、场景),以及23种以上的AIGC生成方法。任务包括二分类(真/假)和四分类(RR/FF/FR/RF)。官方分数计算为:Score = 0.2×AUC + 0.3×ACC + 0.3×AP + 0.2×F1,最终分数为0.4×二分类分数 + 0.6×四分类分数。
*表格超出部分左右可滑动
排名 团队 最终分数 二分类分数 四分类分数 二分类AUC 二分类ACC 四分类F1 四分类AP
1 HIT VIRLAB (Ours) 0.8460 0.9379 0.7847 0.9617 0.9190 0.6873 0.7274
2 ZJSU 0.8438 0.9395 0.7800 0.9490 0.9217 0.6847 0.7149
3 VeriLens 0.8426 0.9288 0.7851 0.9288 0.9106 0.6856 0.7096
4 AIGVDete 0.8406 0.9396 0.7746 0.9480 0.9187 0.6726 0.7191
5 MVADetection Team 0.8349 0.9278 0.7729 0.9447 0.9000 0.6530 0.7167
表2:DDL-GAV挑战赛前五名团队成绩。DAV-Det以0.8460总分位列第一,二分类AUC高达0.9617,四分类F1和AP均为最高。
此外,论文还在传统人类中心数据集FakeAVCeleb上与近年发表的多种音视频伪造检测方法进行了对比。结果如下:
*表格超出部分左右可滑动
方法 ACC AUC
VFD (2023) 0.815 0.861
AVoiD-DF (2023) 0.837 0.892
MCL (2023) 0.860 0.896
MRDF-CE (2024) 0.941 0.924
AVFF (2024) 0.986 0.991
PIA (2025) 0.987 0.998
FoVB (2026) 0.985 0.997
DAV-Det (Ours) 0.998 0.999
表3:在FakeAVCeleb数据集上的对比。DAV-Det在ACC和AUC上均达到最佳(0.998/0.999),展现了在人类中心场景的强检测能力。
针对视觉检测器的消融实验清晰验证了各模块的有效性:
*表格超出部分左右可滑动
配置 ACC AP AUC F1
仅全局 0.9742 0.9695 0.9895 0.9181
全局+Patch 0.9757 0.9706 0.9916 0.9228
全局+Patch+Segment 0.9836 0.9879 0.9969 0.9482
表4:多粒度表示消融。引入Patch和Segment级表示后,各项指标逐步提升,尤其是F1从0.9181提升到0.9482。
*表格超出部分左右可滑动
策略 ACC AP AUC F1
w/o弱监督损失 0.9764 0.9773 0.9920 0.9252
w/o辅助分类器 0.9803 0.9856 0.9951 0.9437
w/o DOCL 0.9750 0.9749 0.9925 0.9210
完整视觉检测器 0.9836 0.9879 0.9969 0.9482
表5:视觉检测器策略消融。移除弱监督损失、辅助分类器或DOCL都会导致性能下降。
*表格超出部分左右可滑动
时间分支 频谱分支 ACC AP AUC F1
✗ ✗ 0.9700 0.9759 0.9914 0.9302
✓ ✗ 0.9736 0.9783 0.9917 0.9387
✗ ✓ 0.9724 0.9773 0.9904 0.9358
✓ ✓ 0.9791 0.9829 0.9942 0.9435
表6:音频检测器双分支消融。同时使用时间和频谱分支优于单独使用任一分支。
除了上述消融实验,论文还进行了决策融合策略的对比实验。在二分类任务中,max融合(取两个模态伪造概率的最大值)与average融合(取平均值)和product融合(取乘积)进行了比较。结果显示,max融合在AUC和ACC上均优于其他两种策略,验证了“只要有一个模态看起来假,整体就应该判定为假”的设计直觉。在四分类任务中,基于独立假设的乘积融合也优于其他启发式规则。这些实验进一步证明了决策级融合策略的有效性。
此外,论文还分析了DAV-Det在不同内容类别上的表现。在MVAD数据集的四个内容类别(人、动物、物体、场景)中,DAV-Det在“人”类别上的表现最好(AUC 0.98),在“场景”类别上的表现相对较弱(AUC 0.94)。这是因为“人”类别中音视频对应关系相对较强,视觉检测器和音频检测器都能提供有效信号;而“场景”类别中音视频对应关系最弱,音频检测器的贡献相对较小。这一分析进一步验证了解耦设计的合理性:在模态对应关系强的类别中,两个检测器协同工作;在模态对应关系弱的类别中,每个检测器独立工作,不会因为跨模态对齐而引入噪声。
总结与启发:解耦vs融合的选择
DAV-Det告诉我们一个宝贵经验:对于通用音视频AIGC检测,解耦(decoupled)比融合(fused)更适合。当模态间缺乏稳定对应关系时,强行让它们交互不仅无益,反而可能引入噪声。这启发我们:在做多模态任务时,不要默认就上跨模态注意力或对齐模块,先仔细分析一下模态间的依赖关系真正有多强。 如果只是弱相关甚至无关,解耦+简单决策融合是更稳健的选择。
结合PaperDaily已收录论文的同基准对比(限定于同一数据集FakeAVCeleb),DAV-Det的AUC为0.999,目前在该数据集上排名靠前。但需要指出:不同论文的数据划分、预处理(如用FaceX-Zoo裁剪人脸区域)、以及训练/测试比例可能略有不同,因此不能将此结果外推为跨数据集的绝对领先。但在挑战赛的统一评估协议下,DAV-Det最终得分0.8460,比第二名高出0.0022,优势虽小但稳定。
当然,论文也坦承当前方案的局限:视觉检测器未显式建模帧间时间不一致(如运动伪影);决策融合目前基于启发式规则(max概率和独立假设),未来可以考虑学习自适应权重。此外,对超低质量视频(噪声极强)和未知新生成器,还需要进一步测试泛化性。
从更宏观的角度来看,DAV-Det的工作对多模态学习领域具有重要的启示意义。近年来,多模态融合方法层出不穷,从简单的拼接融合到复杂的跨模态注意力,研究者们往往默认模态间存在强对应关系。然而,DAV-Det通过严谨的实验证明,这种假设在通用场景中并不成立。这提醒我们,在设计多模态系统时,应该首先进行模态依赖分析,根据分析结果选择合适的融合策略。对于模态依赖强的任务(如唇形同步检测),可以采用特征级融合;对于模态依赖弱的任务(如通用AIGC检测),解耦+决策级融合是更好的选择。这种“因任务制宜”的设计思路,可能比追求通用的多模态融合框架更加实用。
龙迷三问
DAV-Det到底解决了什么问题? 现有音视频AIGC检测方法依赖于音视频内容对应假设(如唇形与语音同步),但在通用场景(非人类中心)中,这个假设经常不成立,导致检测失效。DAV-Det通过解耦检测、决策级融合的方式,在不依赖模态对应的情况下实现了通用场景下的高精度AIGC检测。
文中提到的PEAV是什么? PEAV(Pre-trained Audio-Visual representation)是Vyas等人2026年提出的一个预训练音视频表示模型,用于学习音视频特征的对齐。本文的音频检测器使用了PEAV-base的音频编码器作为特征提取骨干。
什么是凝聚层次聚类(agglomerative clustering)? 这是一种自底向上的聚类方法:初始每个patch作为一个独立簇,然后反复合并最相似(按余弦相似度)的相邻簇,直到达到指定的簇数量或相似度阈值。在DAV-Det中,用于将patch划分成若干个空间连续的segment。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 解耦检测思路本身不算全新,但结合通用场景假说验证和多粒度视觉+时频音频的针对性设计,在AIGC检测领域有显著的实践创新。
实验合理度:★★★★☆ 挑战赛统一评估协议下排名第一,消融实验完备,且在FakeAVCeleb上对比了多种近期方法。但FakeAVCeleb的对比方法中,部分可能是早期数据划分或预处理差异,建议交叉验证。
学术研究价值:★★★★☆ 揭示了通用场景下音视频对应假设失效的重要发现,对多模态检测领域具有指导意义。解耦设计为后续研究提供了一个可靠基线。
稳定性:★★★★☆ 在挑战赛和传统数据集上表现稳定,DOCL策略增强了抗噪性。但面对极端退化或未知新生成器可能仍有波动。
适应性以及泛化能力:★★★★☆ 在MVAD(通用AIGC)和FakeAVCeleb(人类中心)两个差异巨大的数据集上均表现优异,说明解耦设计泛化能力强。但仅在官方数据上验证,跨域迁移能力未知。
硬件需求及成本:★★★☆☆ 使用ViT-L(3亿参数)和PEAV-base(约1亿参数),加上LoRA调优,需要多卡L20 GPU。训练成本中等,推理时需16帧+3秒滑动窗口,GPU推理延迟在秒级。
复现难度:★★★★★ 代码已开源在GitHub,提供了详细的依赖和环境配置,数据预处理脚本清晰,训练脚本可直接运行。
产品化成熟度:★★★☆☆ 挑战赛冠军证明了模型效果,但尚未验证在实时流媒体、低质量用户上传内容、多语言音频等实际场景中的鲁棒性。决策融合依赖简单规则,对极端情况(如视频和音频均为假但概率都低)可能漏检。
可能的问题: 视觉检测器未利用帧间时间信息;决策级融合用max和独立假设偏简单,自适应学习可能更好;在非英语音频和极端噪声条件下的性能未被充分测试。
主要参考文献
[1] Huang, J., et al. MVAD: A Large-Scale Multi-Modal Benchmark for General AIGC Video Detection. 2025.
[2] Vyas, A., et al. PEAV: Pre-trained Audio-Visual Representations for Video Understanding. 2026.
[3] Khalid, H., et al. FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset. NeurIPS, 2021.
[4] Jung, J., et al. AASIST: Audio Anti-Spoofing using Integrated Spectro-Temporal Attention. Interspeech, 2022.
[5] Siméoni, E., et al. DINOv3: An Updated Visual Foundation Model. 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
AIGC影音伪造防不胜防,DAV-Det用解耦之道轻松识破!想第一时间获取前沿论文解读?快加入龙哥读论文粉丝群,和一群志同道合的朋友一起拆解顶会秘籍~
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群 :kang