← 返回 PaperDaily
前沿研究
ACM MM接收方案:音频伪造检测冲上96.1%的秘诀
音频深度伪造早已不止"语音换脸"——环境声、歌声、音乐都能被AI伪造。这篇ACM Multimedia 2026挑战赛总结,双赛道评测方案与冠军系统一次讲清,音频安全和AI信任方向的从业者值得细读。
龙哥读论文
发布于 2026-08-19 00:20:15
阅读 5
查看原文
原论文信息如下:
各位还记得前两年刷屏的「AI换声」骗局吗?某公司高管接到「领导」电话,声音一模一样,结果被骗走巨额资金。那时候的音频伪造还主要集中在语音上,也就是所谓的语音深度伪造(audio deepfake,即用深度学习模型合成的、足以以假乱真的假音频)。但这两年,事情正在起变化——AI不仅能克隆人声,还能伪造环境声、歌声、甚至一整段交响乐。换句话说,音频伪造已经从「单一物种」进化成了「全类型攻击」。
这种趋势带来的挑战是实实在在的:以前做音频伪造检测(Audio Deepfake Detection,ADD),只需要判断一段语音是真是假;现在,AI生成的雨声、汽车鸣笛、翻唱歌曲、电子音乐片段,全都可能成为虚假信息传播的载体。更棘手的是,真实场景中的音频还伴随着压缩、重采样、噪声、混响等各种「污染」,让检测器在实验室里跑得好好的,一上线就「翻车」。
正是在这样的背景下,ACM Multimedia 2026 举办了 AT-ADD(All-Type Audio Deepfake Detection,全类型音频深度伪造检测)大挑战赛。最近这篇挑战赛总结论文一口气把比赛的任务设计、数据集构建、夺冠方案和遗留问题全盘托出,干货密度相当高。 音频伪造新威胁:从语音到全类型音频的检测挑战
AT-ADD挑战赛概览。该挑战赛旨在解决真实声学与信道条件下的鲁棒语音伪造检测,以及跨语音、环境声、歌声和音乐的全类型音频伪造检测问题。
先把这个问题的严重性说透。过去几年,语音深度伪造检测领域的标志性赛事是 ASVspoof(Automatic Speaker Verification Spoofing and Countermeasures Challenge,自动说话人验证防欺骗挑战赛)和 ADD 系列挑战赛,它们把文本转语音(Text-to-Speech,TTS)和语音转换(Voice Conversion,VC)生成的假语音识别率推到了相当高的水平。但这类赛事的评估集大多集中在「干净」或「轻度扰动」的语音上,跟真实互联网场景里那种五花八门的音频形态有明显的落差。
AT-ADD 挑战赛想捅破的两层窗户纸非常明确:第一,检测器在真实声学环境和信道条件下的鲁棒性不够,录音设备、混响、编解码、音量变化等都会让模型性能明显下滑;第二,检测器面对异构音频类型时泛化能力不足,能检测语音伪造的系统,放到环境声、歌声、音乐上往往就「抓瞎」了。
论文归纳了当前音频生成技术的几条主线:TTS 和 VC 仍在快速迭代,文本到音频生成(Text-to-Audio,TTA)、文本到音乐生成(Text-to-Music,TTM)以及歌声转换(Singing Voice Conversion,SVC)也已经从实验室走向开源社区。一个普通人只需要几行代码,就能批量合成指定内容的语音、指定风格的歌曲、指定场景的环境音,甚至一段完整的背景音乐。这种「全类型可伪造」的现实,已经让音频取证(audio forensics)从单一语音检测走向多媒体信任治理的深水区。
AT-ADD 挑战赛正是在这样的威胁模型下应运而生。它由通信领域和互联网企业的研究团队联合发起,旨在构建一个更接近真实部署条件的评测基准。整篇论文以挑战赛总结的形式呈现,详细披露了两个赛道的任务定义、数据集统计、参赛系统设计方案和最终排行榜,对音频安全领域的研究者和工程师来说,参考价值非常直接。
双赛道设计:鲁棒性与类型泛化的双重考验
AT-ADD 的一个巧妙之处在于,它没有把「鲁棒性」和「类型泛化」揉在同一个任务里,而是拆成了两个互补的赛道,让参赛团队可以针对各自的难点做专门优化。
Track 1:鲁棒语音深度伪造检测 ,任务定义很直接:给定一段语音,判断它是真实录音还是深度伪造。这里的「伪造」特指基于深度神经网络方法生成的语音,而压缩、重采样、变速、变调等信号层面的变换,以及重放攻击(replay attack,即用录音设备重新播放真实语音的录音),都不改变样本原有的真实/伪造标签。换句话说,检测器必须透过各种「噪音污染」,去判断音频底层的真实身份。
Track 1 的评估集在生成器和真实语音两个维度都设了「门槛」。假语音全部由训练阶段未出现过的 26 种生成方法合成,涵盖了当前主流的 TTS 和 VC 技术路线;真实语音则来自多种录音设备(智能眼镜、手机、车载系统等)、多语言、多声学环境,其中 20% 的真实样本还额外叠加了速度扰动、音量变化、重采样等信号扰动。这样的设计让「在训练集上过拟合」彻底失效,检测器必须在分布偏移(distribution shift)条件下保持判断力。
Track 2:全类型音频深度伪造检测 的野心更大。输入音频的类型完全未知,可能是语音、环境声、歌声或者音乐,系统需要在不知道类型标签的前提下直接给出真实/伪造的二分类判断。这模拟的正是现实中的部署场景:一个音频内容审核系统永远不可能预知下一段上传的音频是电话录音、街头环境声还是翻唱歌曲。与 Track 1 相比,Track 2 更侧重跨类型的泛化能力,因此评估集去掉了信号扰动和重放攻击,让比赛焦点集中在「类型不可知」的检测上。
两个赛道都遵循封闭设置(closed setting):参赛队伍只能使用官方提供的训练集和开发集,允许做信号级数据增强,可以使用可追溯的通用预训练模型,但禁止使用外部的深度伪造检测数据集,也禁止对进展集和评估集做任何形式的自适应。这个规则把「刷榜」的路堵死了,大家只能老老实实拼模型设计、增强策略和融合技巧。
数据集构建:覆盖四类音频的深度伪造基准
要支撑「全类型」的检测研究,数据集的质量直接决定了比赛的天花板。AT-ADD 的数据集构建工作量相当大,尤其是 Track 2,横跨语音、环境声、歌声和音乐四种音频类型,每种类型的真实样本和伪造样本来源都做了仔细的区分。
语音子集直接复用 Track 1 的数据,但评估集做了简化处理,去掉了信号扰动和重放攻击,以保证 Track 2 的评估聚焦于跨类型泛化。环境声子集基于 AudioCaps 构建,真实样本按不重叠方式切分训练、开发、评估集,伪造样本由文本到音频(TTA)模型根据真实音频的文本描述生成,评估集中的伪造音频则使用了 4 种未见过的生成方法,同时还从 AVQA、CompA-R、VocalSound、TUT2016 等公共数据集引入了 4K 条分布外(Out-of-Distribution,OOD)真实环境声,用于测试模型的泛化边界。歌声子集来自 OpenCpop、M4Singer 和 KiSing 三个数据集,伪造样本通过歌声转换生成,且严格保证源歌手和目标歌手不重叠,评估集的伪造音频由 5 种未见方法生成。音乐子集来自 MusicCaps,伪造音频由文本到音乐(TTM)模型生成,评估集同样引入了 FMA 和 FortisAVQA 的分布外真实音乐样本。
从数据规模上看,Track 2 的训练集达到了 14.6 万条,评估集超过 22.9 万条,Track 1 的评估集也有 14.6 万条。这个体量在音频伪造检测的基准里属于第一梯队。进展集(progress set)的划分值得一提 :它从评估集分布中采样,占完整评估集的 20%,让参赛队伍在比赛期间可以有限度地验证模型在目标分布上的表现,同时又保留了评估集的大部分样本作为最终排名的依据。
表1:AT-ADD Track 1 与 Track 2 的数据集统计(单位:条)。Track 2 覆盖语音、环境声、歌声和音乐四种音频类型,训练集约14.7万条,评估集约23万条。
还有一个细节体现了数据构建的严谨性:在生成伪造语音时,用于克隆的参考说话人与源说话人严格保证不是同一个人,训练集和评估集使用不同的参考说话人池,防止说话人身份信息泄漏给检测器「开小灶」。这种对数据泄漏的警觉,在学术基准里不是常态,但在实际部署中却是决定模型真实泛化能力的关键。
冠军方案解析:自监督表示与数据增强的制胜组合
看完了任务和数据,最硬核的部分来了:冠军们到底是怎么做的?
Track 1 冠军 WaveShield 的方案很有代表性。它使用了一个三成员集成系统,骨干是 W2V-BERT 2.0 自监督模型,搭配 AASIST、AASIST3 和 Adapter-MFA 三种不同的后端。这里的 AASIST(Audio Anti-Spoofing using Integrated Spectro-Temporal Graph Attention Networks) 是音频反欺骗领域的经典模型,它把音频的频谱和时序信息建模成图结构,通过图注意力网络捕获伪造痕迹。WaveShield 每个子系统都采用「冻结-微调」两阶段训练:先用 LoRA 低成本微调让前端适配数据分布,再联合微调整个模型,配合 AM-Softmax 损失和 Focal Loss 处理类别不均衡。数据增强方面走的是「饱和式轰炸」路线:MUSAN 噪声、RIR 混响、编解码伪影、信号扰动、重放模拟、分段级真实样本拼接,几乎把真实信道里可能出现的劣化都覆盖了。
亚军 Fosafer 的策略是「多尺度 + 多特征」。它集成了 0.3B、1B、2B 三种规模的 XLSR 前端,配合 TSSDNet 和 ATSSDNet 后端,外加一路 GFCC 增强分支,在线增强覆盖噪声、背景音乐、环境声、混响、音量变化、滤波、静音插入、变速变调等,随机对 30% 的官方训练样本做在线增强。季军 sonomsl 则把小波提示调优(wavelet prompt tuning)和 XLSR-1B 结合,用 DANN 和 GroupDRO 做领域正则化,减少模型对生成器和信道条件捷径的依赖。
Track 2 的冠军 starfire 走的是完全不同的路线——硬路由 + 分支专家 。系统先用一个冻结的 BEATs 音频路由器把输入分类成语音/环境声/歌声/音乐四种类型,然后交给对应的分支检测器。语音分支用 wav2vec2-XLSR + AASIST,非语音分支用 EAT-large + AASIST 检测器,分别针对音乐和环境声做数据组成偏置训练。最终决策采用类别特定阈值和保守的多片段池化策略,而不是简单地对全局分数取平均。这个设计的精巧之处在于:它承认了「一个模型通吃所有音频类型」在当前技术条件下还不现实,与其强行统一,不如先分类再检测,让每个专家只负责自己擅长的领域。
有意思的是,亚军 orange9 选择了与冠军相反的「统一端到端」路线。它的 E2E-ATADD 把 EAT-large 和 wav2vec2-XLSR-300m 两个前端的隐层用可学习的 softmax 权重聚合,拼接后过 SwiGLU 激活,再用多头注意力池化后送入 MLP 分类器。训练时对合并的 train/dev 数据做五折交叉验证,配合 RawBoost 增强、加权交叉熵损失和五片段推理。虽然最终成绩略低于冠军,但「统一模型」的简洁性对实际部署其实更有吸引力——毕竟不是每个团队都有资源维护四个专家分支。
表2:Track 1 鲁棒语音深度伪造检测和 Track 2 全类型音频深度伪造检测的最终排行榜(Macro-F1,%)。Track 1 冠军 WaveShield 达到 90.71%,Track 2 冠军 starfire 达到 96.10%。
从最终排行榜来看,Track 1 的前几名分数咬得很紧:WaveShield 90.71%、Fosafer 86.67%、sonomsl 86.63%、ThreeTO 83.79%、NKU-HLT 83.68%,冠军的领先幅度接近 4 个点,说明在大规模数据增强和模型融合上的投入确实能换来实打实的收益。Track 2 的梯队差距更明显:starfire 96.10%、orange9 95.58%、ThreeTO 93.95%、Fosafer 91.62%、KETI-KU 91.10%。值得注意的是,Track 2 的整体分数普遍高于 Track 1,这并不说明 Track 2 更简单,而是因为环境声、歌声和音乐的伪造音频往往带有更明显的生成痕迹,相比之下,经过真实信道污染和未见生成器集合双重考验的语音检测才是那块最难啃的骨头。
挑战与展望:全类型音频伪造检测的未来方向
论文的讨论部分坦诚地指出了当前技术方案的共性规律和遗留问题。从参赛系统的设计模式来看,自监督学习(Self-Supervised Learning,SSL)音频表示已经成为绝对的主流——W2V-BERT 2.0、XLSR、EAT、BEATs 这些预训练模型几乎成了每个强队的标配。这背后的逻辑不难理解:深度伪造检测本质上是一个细粒度模式识别任务,数据量有限且伪造痕迹往往非常微弱,从头训练一个特征提取器既费力又不讨好,而 SSL 模型在海量无标注音频上学到的通用声学表征,恰好能提供足够丰富的「先验知识」,帮助检测器捕捉那些人类耳朵几乎听不出来的伪影。
数据增强同样是拉开差距的关键因素。从 MUSAN 噪声、RIR 混响到 RawBoost、编解码往返(codec round-trip)、重放模拟,头部队伍在增强策略上的「军备竞赛」几乎到了令人发指的程度。这本质上是在用「物理模拟」对抗「真实世界的分布偏移」——既然没法穷举所有真实信道条件,那就尽可能地在训练阶段把模型「虐」到对各种劣化免疫。
融合策略的差异也值得玩味。Track 1 的强队普遍采用「多子系统分数融合」的暴力美学路线,而 Track 2 的冠军 starfire 则选择了「先路由后检测」的结构化路线。这两种范式实际上是两种不同世界观的碰撞:前者相信「多样性集成能覆盖更大的假设空间」,后者相信「分而治之才能让每个分支做到极致」。从结果看,两者都有效,但结构化路由在计算效率上更有优势——毕竟不用同时跑四个完整模型。
论文也指出了几个尚未解决的硬骨头。第一,对未见生成器的泛化仍然是最大的挑战,Track 1 的评估集特意使用了 26 种训练阶段完全没见过的生成方法,即便如此,冠军系统也只能达到 90.71% 的 Macro-F1,距离「可信赖」的部署标准还有距离。第二,真实语音域的扰动(录制设备、声学环境、语言多样性)对检测器的干扰比想象中严重,说明模型在「理解语音内容」和「捕捉伪造痕迹」之间还没有找到完美的平衡点。第三,Track 2 的整体分数虽然高,但不同音频类型之间的难度差异很大,总分高的系统不一定在每种类型上都均衡,未来需要更细粒度的分类型报告。
展望未来,论文建议后续赛事按生成器、扰动类型、音频类型做更细的分解报告,并强调可复现性细节的披露。这个建议非常务实——音频伪造检测的研究要往前走,不仅需要更高的分数,更需要可解释、可对比、可复现的评估体系。
龙迷三问
这篇论文到底在解决什么问题? ACM Multimedia 2026音频防伪挑战赛总结:双赛道覆盖语音、环境声、歌声与音乐四类音频,最优方案Macro-F1达90.71%和96.10%。冠军系统普遍采用自监督表示、数据增强与结构化融合,也暴露未知生成器泛化等难
这篇工作最值得看的点是什么? Track 1最佳系统(WaveShield)在最终评估集上达到90.71% Macro-F1;Track 2最佳系统(starfire)达到96.10% Macro-F1。结果显示强系统普遍结合大规模自监督音频表示、数据增强、多裁剪推理和结构化融合或路由。
这篇工作的边界或风险在哪里? 优点:(1) 构建了覆盖全类型音频的深度伪造检测基准数据集,填补了现有基准在音频类型多样性上的空白;(2) 双赛道设计分别针对鲁棒性和类型泛化两个关键挑战,任务设置合理;(3) 封闭设置确保了参赛系统之间的公平比较;(4) 对参赛系统的分析揭示了有效设计模式。缺点:(1) 未提供按生成器、扰动类型、音频类型细分的性能报告,难以深入分析失败模式;(2) 未提供基线系统的性能参考;(3) 对参赛系统的描述较为简略,缺乏技术细节。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
本文是ACM Multimedia 2026 AT-ADD挑战赛的总结报告,系统描述了全类型音频深度伪造检测的两个赛道(鲁棒语音深度伪造检测和类型无关的全类型音频检测),包括任务定义、数据集构建、评测协议、参赛系统分析及结果总结。
学术研究价值: ★★★★☆
本文是ACM Multimedia 2026 AT-ADD挑战赛的总结报告,系统描述了全类型音频深度伪造检测的两个赛道(鲁棒语音深度伪造检测和类型无关的全类型音频检测),包括任务定义、数据集构建、评测。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
不适用(本文为挑战赛总结报告,未统一报告计算量)
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 未提供按生成器、扰动类型、音频类型细分的性能报告,难以深入分析失败模式;
[1] Yuankun Xie, Haonan Cheng, Jiayi Zhou, et al. AT-ADD: All-Type Audio Deepfake Detection Challenge Summary. ACM Multimedia 2026.
[2] Jee-weon Jung, Hee-Soo Heo, Hemlata Tak, et al. AASIST: Audio Anti-Spoofing using Integrated Spectro-Temporal Graph Attention Networks. ICASSP 2022.
[3] Arun Babu, Changhan Wang, Andros Tjandra, et al. XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale. arXiv:2111.09296, 2021.
[4] Hemlata Tak, Massimiliano Todisco, Xin Wang, et al. RawBoost: A Raw Data Boosting and Augmentation Method Applied to Automatic Speaker Verification Anti-Spoofing. ICASSP 2022.
[5] Sanyuan Chen, Yu Wu, Chengyi Wang, et al. BEATs: Audio Pre-Training with Acoustic Tokenizers. ICML 2023.
[6] Edward J. Hu, Yelong Shen, Phillip Wallis, et al. LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022.
[7] Alec Radford, Jong Wook Kim, Tao Xu, et al. Robust Speech Recognition via Large-Scale Weak Supervision. ICML 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!