← 返回 PaperDaily 视觉与图像

80队参赛!URGENT 2026把语音增强卷到评测层

这篇不是单纯“拼模型”的比赛总结,而是把语音增强真正落地时最容易翻车的两件事摊开了:数据怎么选,模型怎么评。结果很直白——堆数据不一定赢,选对数据和评测方式才更像正经工程。

80队参赛!URGENT 2026把语音增强卷到评测层
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header
这篇不是单纯“拼模型”的比赛总结,而是把语音增强真正落地时最容易翻车的两件事摊开了:数据怎么选,模型怎么评。结果很直白——堆数据不一定赢,选对数据和评测方式才更像正经工程。

原论文信息如下:
论文标题:
ICASSP 2026 URGENT Speech Enhancement Challenge
发表日期:
2026年03月
发表单位:
Shanghai Jiao Tong University, Technische Universitat Braunschweig, Waseda University, Carnegie Mellon University, Meta
原文链接:
https://arxiv.org/pdf/2603.04385.pdf

语音增强新篇章:URGENT 2026挑战赛概览

语音增强这件事,表面上像“把噪声去掉”这么简单,真落到真实环境里,麻烦就开始排队了:有回声、有压缩失真、有丢包、有风噪,还有各种没见过的语言、口音、年龄层、唱歌、耳语,甚至情绪一上来,模型就开始装聋作哑。ICASSP 2026 URGENT Speech Enhancement Challenge做的事情,就是把这些“工程里最容易翻车的地方”摆上台面,逼着系统去面对真正的复杂世界。
封面:ICASSP 2026 URGENT 语音增强挑战赛,重点强调通用增强与质量评估两条赛道。
这篇工作最有意思的地方,不是再造一个“更大”的模型,而是把语音增强真正落地时最容易翻车的两件事摊开了:数据怎么选,模型怎么评。结果很直白——堆数据不一定赢,选对数据和评测方式才更像正经工程。
这项挑战赛延续了 URGENT 系列的思路。这里的 URGENT 是 Universal, Robust, and Generalizable speech EnhancemeNT,中文可以理解为“通用、鲁棒、可泛化的语音增强”。名字起得很实在:不是只在某个干净测试集上好看,而是要在真实世界里也能扛住。
这次挑战赛还有一个很现实的信号:80 多支队伍注册,29 支提交有效结果。对一个偏工程落地的语音方向来说,这个参与度说明大家已经不满足于“实验室里能跑”,而是开始认真琢磨“到了真实场景还能不能用”。

两大核心赛道:通用增强与质量评估

这次挑战赛分成两条赛道,思路很像“先把音频修好,再判断修得好不好”。Track 1 做通用语音增强,Track 2 做增强后语音的质量评估。前者解决“怎么修”,后者解决“修得怎么样”。这两个问题看起来像一对亲兄弟,实际上一个偏生成,一个偏打分,难点完全不一样。
图1:挑战赛两条赛道的任务定义与评测目标。Track 1 面向通用语音增强,Track 2 面向增强语音的主观质量预测。
Track 1 的要求很狠:单个系统要同时处理不同采样率、不同失真类型、不同语言和不同输入格式,而且事先不知道输入到底是哪种情况。这就不是“专门给某一类噪声做手术”,而是逼模型当一个全科医生。挑战里覆盖了七类失真:加性噪声、混响、削波、带宽限制、编解码失真、丢包和风噪。现实一点说,通信、会议、直播、车载、移动端,几乎都能碰到这些问题。
Track 2 则更像“语音增强界的裁判”。它要预测增强后语音的 MOS(Mean Opinion Score,平均意见分),也就是人耳主观听感的平均打分。这里的重点不是合成语音,而是增强语音的真实主观质量。这点很关键,因为有些系统客观指标看着漂亮,听起来却像“把噪声赶走了,顺手把人声也打包带走了”。
Track 2 采用的评价目标也更贴近实际:既看 utterance level(单条语音样本层面),也看 system level(系统层面)。这意味着模型不能只会“偶尔答对”,而是要整体稳定地把不同增强系统的优劣分开。

数据多样性与质量:从海量到精选

这篇论文最值得关注的,不是“训练数据越多越好”,而是反过来强调:数据质量和筛选策略,可能比盲目堆量更重要。这话听起来不新鲜,但在语音增强里,很多团队还是会下意识把“更多数据”当成安全牌,结果训练集越大,噪声越杂,模型越容易学歪。
图2:Track 1 的训练数据来源与多样性构成。数据覆盖有声书、朗读、多语种、儿童、老人、唱歌、情绪语音等多种语音形态。
训练数据来自多个公开语音、噪声和房间脉冲响应来源,包括 LibriVox、LibriTTS、多语种 Librispeech、CommonVoice、儿童语音、老人语音、唱歌语音、情绪语音等。噪声则来自 Audioset、WHAM!、FSD50K 和 Free Music Archive,房间响应则通过 DNS5 Challenge 的资源模拟。这个数据池一看就很“杂”,但挑战赛真正想要的不是杂,而是广度 + 可控质量
这里最有意思的一点是,挑战赛明确鼓励选手从大语料里挑高质量子集,而不是“全都喂进去图个心安”。官方基线采用了一种数据整理方法,从原始 2500 小时训练集里筛出 700 小时高质量语音。这个设计非常像现实工程:不是仓库越满越好,而是工具箱里真正顺手的那几件最值钱。
盲测集也不简单,除了模拟样本,还包含真实录音,并且加入了训练中没见过的五种语言:HI、KR、AR、JP、IT。这里的 HI、KR、AR、JP、IT 分别对应 印地语、韩语、阿拉伯语、日语、意大利语。这类设计的杀伤力很强,因为模型如果只是记住了训练集里的语言分布,到了新语言就容易露馅。
Track 2 的数据更像“打分老师的题库”。训练集覆盖了合成语音、语音转换、电话失真、背景噪声,以及各种语音增强系统输出,并且全部带有人类 MOS 标注。盲测集则直接用了 URGENT 2025 盲测阶段中的 8000 条 MOS 标注样本,来自 16 个系统。换句话说,这不是纸上谈兵的评分,而是拿真实增强系统的输出做判断。

评测体系:客观指标与主观听感并重

语音增强比赛最怕什么?最怕模型在某个指标上“刷分”,但人耳一听完全不是那回事。所以这次挑战赛的评测体系做得比较克制:先用一堆客观指标筛,再用主观听测定胜负。这个设计虽然麻烦,但比单看一个分数靠谱得多。
图3:Track 1 的两阶段评测流程。第一阶段用多种客观指标做资格筛选,第二阶段再进入主观听测和最终排名。
Track 1 的第一阶段采用多指标排序,思路参考了 Friedman 检验。Friedman 检验本质上是一个非参数排序方法,适合在多个系统、多个指标上做稳健比较。这里用到的指标也很全:既有非侵入式指标,如 DNSMOS、NISQA、UTMOS、SCOREQ;也有侵入式指标,如 PESQ、ESTOI、POLQA;还有下游无关指标,如 SpeechBERTScore、LPS;以及下游相关指标,如说话人相似度、情感相似度、语种识别准确率、字符准确率。说白了,就是不让系统只在一个角度“钻空子”。
进入第二阶段后,前 6 名系统要接受人类听众的主观评测,采用 ITU-T P.808 标准的 ACR 和 CCR。这里的 ACR 是 Absolute Category Rating,绝对类别评分,CCR 是 Comparison Category Rating,比较类别评分。人类听感最后会转成 MOS 和 CMOS,用来决定最终排名。这个流程很“笨”,但也很诚实:语音好不好,最后还是得让耳朵说话。
Track 2 的评测则更偏机器学习式回归和排序结合。它同时看均方误差、线性相关系数、Spearman 相关系数和 Kendall’s tau,而且要在 utterance 和 system 两个层面都算。最后不是简单平均,而是先做 dense ranking,再按误差类和相关类指标分组平均,得到整体排名。这个做法的好处是,不会因为某个指标尺度奇怪就把整个结果带偏。
图4:Track 2 的质量评估任务与多指标排名逻辑。模型既要预测单条语音的 MOS,也要在系统级别保持排序一致性。

竞赛结果:混合模型与数据筛选是制胜关键

结果部分给出的信号其实很一致:混合式生成 + 判别框架,再加上高质量数据筛选,是这次比赛里最吃香的路线。这个结论并不玄学,反而非常工程:生成模型负责“把脏东西修掉”,判别模型负责“别把干净信息也修没了”。
图5:Track 1 主要结果与排名概览。最终前列系统普遍采用混合式方案,在客观指标和主观听感上都更稳定。
Track 1 共有 23 个有竞争力的提交进入比较,前 6 名进入最终主观评测。结果显示,领先系统大多不是单一路线,而是生成式与判别式的双分支或多阶段流水线。生成部分用来恢复语音,判别部分用来保住信号细节、说话人特征和语言信息。这个组合的逻辑很顺:单纯生成容易“修过头”,单纯判别又可能恢复能力不足,混搭后反而更均衡。
更值得注意的是,多个高排名队伍都强调了数据整理的重要性,包括基于 MOS 的过滤、借助预训练恢复模型做数据清洗,以及针对性增强。这个现象和挑战赛的设计高度一致:当数据来源很杂时,真正拉开差距的往往不是“谁训练得更猛”,而是“谁先把脏数据和低价值样本处理掉”。
Track 2 的结果同样说明,质量评估不是随便套个回归器就完事。排名靠前的系统在训练时更好地利用了多指标监督,并改进了模型结构,在 utterance 和 system 两个层面都保持了较高相关性。值得一提的是,URGENT-PK 作为比赛外模型,在系统级相关性上表现最好,说明围绕感知排序设计的模型,确实更适合干这类“听感打分”任务。
图6:Track 2 结果与相关性指标表现。高排名系统在误差和相关性指标上都更均衡,不只是单点指标好看。
从更务实的角度看,这次结果说明了两件事。第一,语音增强已经进入“不只是修复,更要保真”的阶段;第二,语音质量预测也在从“泛化到所有声音”转向“专门理解增强语音的感知特征”。这两个方向都很现实,也都很难。

未来展望:迈向更广泛的通用语音技术

这篇挑战赛的价值,不只在于给出一个榜单,更在于把未来的研究方向说得很清楚:通用语音增强必须同时处理多失真、多语言、多说话风格和真实录音。如果模型只能在某个标准测试集上跑得漂亮,那离产品落地还差好几道门槛。
从工程角度看,未来最值得继续深挖的,可能不是单纯把网络堆得更大,而是三件更朴素的事:第一,继续提升数据筛选和清洗能力;第二,让模型更好地处理采样率变化和未知失真;第三,把客观指标和主观听感之间的鸿沟缩小。说白了,别只会考高分,还得让人听着顺耳。
对普通从业者来说,这篇论文最直接的启发是:做语音增强,不要只盯着模型结构,数据策略和评测策略往往更决定上限。对学生来说,别老想着“换个更复杂的网络就能赢”,先把数据分布、失真类型、评价指标和主观听感之间的关系搞明白,很多坑就能提前避开。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它不是在做一个单独的新模型,而是在组织一个更接近真实世界的语音增强挑战赛:让系统面对多种失真、语言、口音和输入条件,同时还要学会判断增强后的语音到底好不好。

MOS、ACR、CCR 这些缩写是什么意思?MOS 是平均意见分,用来表示人类主观听感;ACR 是绝对类别评分,CCR 是比较类别评分,二者都属于主观听测方法,常用于语音质量评估。

为什么这次比赛特别强调数据筛选?因为语音增强里,数据不是越多越好。来源太杂、质量参差不齐时,模型很容易学到错误映射;先把高质量数据筛出来,往往比盲目扩量更有效。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

挑战赛本身不是全新题目,但把“通用增强 + 增强后质量评估”放在同一框架里,且进一步强调数据筛选和真实多样性,方向是对的,创新更多体现在任务设计和评测组织上。

实验合理度:★★★★☆

客观指标、主观听测、不同层级相关性一起上,评测逻辑比较完整。唯一的遗憾是挑战赛论文篇幅有限,结果分析还不够细。

学术研究价值:★★★★☆

对语音增强和语音质量评估都有明确启发,尤其适合后续做数据策略、感知排序和多任务监督的人继续接力。

稳定性:★★★☆☆

挑战赛结果说明混合式方案更稳,但跨语言、跨失真、跨录音条件的泛化仍然是老大难,离“随便扔进去都能稳”还有距离。

适应性以及泛化能力:★★★★☆

任务本身就是为泛化能力设计的,覆盖失真、语言和风格都很广;但真正做到全场景通吃,仍需要更强的数据和模型协同。

硬件需求及成本:★★★☆☆

Track 1 里混合式系统和多阶段流水线通常不便宜,训练和推理成本都不会太低;Track 2 相对轻一些,但高质量标注和评测成本也不小。

复现难度:★★★☆☆

挑战赛框架清晰,但要复现高排名系统,往往还需要大量数据清洗、训练细节和调参经验,不是拷贝代码就能原样起飞。

产品化成熟度:★★★☆☆

适合做研究原型和工程方向验证,离大规模稳定部署还需要更多边界测试,尤其是新语言、真实噪声和复杂录音条件。

可能的问题:挑战赛更像方向性总结,细粒度消融和失败案例分析偏少;数据清洗虽重要,但具体可复制的方法还不够展开。


主要参考文献

[1] P. C. Loizou, Speech Enhancement: Theory and Practice. CRC Press, 2007.
[2] D. Wang and J. Chen, “Supervised Speech Separation Based on Deep Learning: An Overview,” IEEE/ACM Trans. ASLP., vol. 26, no. 10, pp. 1702–1726, Oct. 2018.
[4] K. Saijo et al., “Interspeech 2025 URGENT Speech Enhancement Challenge,” in Proc. Interspeech, 2025, pp. 858–862.
[7] C. Li et al., “Less Is More: Data Curation Matters in Scaling Speech Enhancement,” in Proc. IEEE ASRU, 2025.
[8] W. Wang et al., “Improving Speech Enhancement with MultiMetric Supervision from Learned Quality Assessment,” arXiv preprint arXiv:2506.12260, 2025.
原文链接:https://arxiv.org/pdf/2603.04385.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
语音、图像、大模型、机器人、医疗、金融,想找同好一起拆论文,来这儿就对了。
别让好论文只停在“看过”,让它真正变成“用过”。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。