← 返回 PaperDaily 视觉与图像

NVIDIA新作:一个语音增强模型,30种延迟随便切

这篇论文最有意思的地方,是把“实时语音增强”里最容易打架的两个指标——算法延迟和计算延迟——拆开管了。一个模型就能切出30种延迟配置,既能讲究效果,也能照顾设备脾气,属于很实用的工程型思路。

NVIDIA新作:一个语音增强模型,30种延迟随便切
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,是把“实时语音增强”里最容易打架的两个指标——算法延迟和计算延迟——拆开管了。一个模型就能切出30种延迟配置,既能讲究效果,也能照顾设备脾气,属于很实用的工程型思路。


原论文信息如下:
论文标题:
One Model, Many Latencies: Universal Speech Enhancement for Diverse Real-Time Applications
发表日期:
2026年06月
发表单位:
NVIDIA, Academia Sinica, Taipei, Taiwan
原文链接:
https://arxiv.org/pdf/2606.25621v2.pdf
开源代码链接:
https://huggingface.co/nvidia/Real-time RE-USE
实时语音增强这件事,表面上像“把噪声擦掉”这么简单,实际上工程里最爱出幺蛾子:有的模型效果不错,但一上流式场景就卡顿;有的模型跑得飞快,但声音听起来像隔着一层毛玻璃;还有的模型在实验室里很美,到了真机上就开始“表演失常”。这篇论文最实用的地方,就是正面解决了一个很现实的问题:如何让同一个语音增强模型,适配不同设备、不同应用、不同延迟预算。对于语音通话、流式识别、在线会议这类场景,这不是锦上添花,而是能不能上线的分水岭。
封面
图2:本文提出的统一框架示意图。它同时支持通过可配置的前瞻帧控制算法延迟,并通过早退机制控制计算延迟。低延迟预算时,推理可以沿着图中的橙色路径提前结束。

语音增强新突破:一个模型搞定所有实时场景延迟预算

先把概念捋顺。语音增强,就是把“被噪声、混响、压缩失真、丢包、风噪等折腾过的语音”尽量恢复得更清楚。实时语音增强则更苛刻:不能等整段语音都进来再处理,得边来边出结果,否则通话和流式识别就会被延迟拖成“慢动作回放”。
本论文的关键词是 universal speech enhancement,中文可理解为“通用语音增强”:一个模型尽量覆盖多种退化类型、多种采样率、多种应用场景,而不是每个场景都单独训一个小模型。这里的“universal”不是嘴上说说的“啥都能干”,而是论文在多语言、多采样率、多退化条件上做了统一建模,目标很明确:一套权重,尽量通吃
但问题也随之来了:实时系统里的“延迟”不是一个数,而是两个人在吵架。一个叫算法延迟,一个叫计算延迟。前者决定模型为了做出第一个输出,要先偷看多少未来信息;后者决定模型拿到数据后,自己要算多久才能吐出结果。很多论文只盯着其中一个,另一个就像被遗忘在角落里的行李箱,结果一上真实设备就露馅。
图1
图1:语音增强系统的总延迟可以拆成算法延迟计算延迟两部分。前者偏“等多久再开口”,后者偏“开口之后算得快不快”。
论文这里先给出一个很重要的现实判断:不同应用对延迟的容忍度完全不一样。比如语音通话可能能忍 50–150 毫秒,流式识别常见预算大概在 100–200 毫秒。更要命的是,设备也分三六九等,A100、3090、4090 和普通端侧芯片,算力差距足以让同一个模型变成“神速”或“龟速”。所以,真正有用的不是训练一个只会在某个固定点上表现最好的模型,而是训练一个能在多个延迟预算之间切换的模型

延迟分身术:算法延迟与计算延迟如何“随心而变”?

这篇论文最妙的地方,就是把“延迟可调”拆成两个独立旋钮。算法延迟通过 look-ahead frames(前瞻帧)来调;计算延迟则通过 early exit(早退)来调。前者回答“要不要看一点未来”,后者回答“网络要走到多深才停”。
先说前瞻帧。对于基于频域的语音增强模型,输入通常先经过短时傅里叶变换,也就是 STFT,英文全称是 Short-Time Fourier Transform,中文叫短时傅里叶变换。如果模型想“看未来”,就得在卷积层里给右边多留一点 padding;如果想完全因果,就让右侧 padding 为零。论文举了个很直白的例子:卷积核大小为 3 时,0、1、2 帧前瞻可以分别通过不同的左右 padding 配置实现。听起来像是在给模型装“单向望远镜”,想看多远,拧一下镜头就行。
但这里有个坑:如果只用同一层卷积、靠不同 padding 来切换前瞻,模型会学得比较别扭。论文的观察是,这种做法会影响后续序列建模的学习效率,验证集上的 UTMOS 学习曲线也能看出差异。于是作者借鉴了“多专家”思路,弄了并行卷积层,每个分支对应一种前瞻设置。训练时随机抽一个分支参与前向计算,推理时则由用户按延迟预算直接指定。这里没有复杂路由器,没有“谁更聪明就让谁上”,因为选择标准很朴素:预算说了算
图3
图3:不同模型结构下,验证集 UTMOS 分数的学习曲线。可以看到,单纯共享卷积配置并不一定最顺手,分支化设计更有利于学习稳定。
再说计算延迟。这里用的是 early exit,英文全称可理解为 early-exit mechanism,中文就是早退机制:网络不必每次都跑到最后一层,中间层如果已经“够用了”,就可以提前输出。这个思路最早在深层网络里就很常见,论文也引用了相关工作。它的好处很直接:设备算力不够时,可以牺牲一点深度,换来更低的推理时间。
不过早退也有代价。中间层本质上是“半成品”,它既要兼顾前面,又要给后面留余地,所以性能通常不如专门训练到某个固定深度的模型。论文一开始做实验时发现,所有出口共用一个 decoder 时,学习更稳定;如果每层都单独配 decoder,反而容易把表示空间训乱。于是作者没有简单粗暴地“一层一头到底”,而是设计了一个两阶段训练策略,这部分就是后面最关键的修补手术。
顺带一提,论文还特别强调一个常被忽略的现实约束:实时处理不只是“平均上够快”,而是每个处理步的计算时间都必须小于对应 hop size,否则延迟会越积越多,最后像堵车一样彻底失控。这个提醒很朴素,但很有用,因为不少论文喜欢拿离线测法当实时结果,数字看着漂亮,真上流式就露馅。龙哥只能说一句:实验室里跑得飞快,不等于路上不堵车。🤨

两阶段训练策略:如何让灵活模型实力媲美专用模型?

前面已经说了,灵活模型最怕两件事:一是不同前瞻设置互相打架,二是不同深度出口各自为政。论文的解决方案很像“先统一思想,再分头精修”。这就是所谓的两阶段训练
第一阶段叫共享 decoder 阶段。训练时,模型会随机采样不同的出口层和不同的前瞻分支,但所有出口共用同一个 decoder。这样做的核心目的,不是让每个出口都立刻变强,而是先把大家拉进同一个表示空间,别一上来就各讲各话。这个阶段相当于先给模型上“统一教材”,保证基础语义一致。
第二阶段才是多 decoder 阶段。当共享 decoder 收敛后,作者把它复制成多个独立 decoder,每个输出层都有自己的参数,但初始化都来自共享权重。与此同时,decoder 前面的编码器和序列建模模块继续用更小学习率微调。这个操作的妙处在于:既保留了统一表示空间,又给每个出口留出个性化空间。它不是推倒重来,而是“先打地基,再做精装修”。
表1
表1:URGENT 2025 挑战赛非盲测结果。这里同时列出了非侵入式指标、侵入式指标、任务无关指标、任务相关指标,以及算法延迟和计算延迟。可以看到,算法延迟按“40 毫秒 + 前瞻帧数 × 20 毫秒”计算,计算延迟则在 A100 上测得。
从表1能看出两件事。第一,单纯 early-exit 已经能把计算延迟压下来,但性能和专用模型相比还是有差距;第二,加入并行卷积之后,模型不仅能灵活切换前瞻设置,还能保持和 early-exit 接近的表现。再往前走一步,加入多 decoder 阶段后,大多数指标都有进一步提升,尤其是任务相关指标 CAcc(ASR 的字符准确率)更明显。也就是说,这个两阶段策略不是摆设,它确实在帮模型把“灵活”和“好用”尽量往一起拽。
论文的骨干网络也值得顺手讲一下。作者沿用并改造了 USEMamba 和 RE-USE 的思路,使用 Mamba 作为序列建模模块。Mamba 的全称是 Selective State Space Model 相关的线性时间序列建模框架,中文常译为选择性状态空间模型。它适合流式处理,因为推理方式更像 RNN,能按时间步逐步更新状态,不必像某些大块头结构那样每次都全量重算。为了满足实时约束,论文还把双向 temporal Mamba 改成了单向版本,把普通卷积换成因果卷积,并把 instance normalization 换成只沿通道维做的 layer normalization。这个改法很务实:少一点花里胡哨,多一点流式友好。

30种配置任你选:实时语音增强效果实测惊艳全场

真正让这篇论文从“思路不错”变成“工程上有戏”的,是它的配置自由度。作者在 URGENT 2025 数据集上展示了 30 种不同延迟配置,也就是 10 个出口层 × 3 个前瞻设置。听起来像是给模型开了个“自助餐厅”:预算紧,就少拿一点;预算宽,就多拿一点;同一个模型,不用重新训练一套。
图4
图4:性能指标与总延迟之间的关系。可以看到,模型在多个延迟点上都能给出可用结果,且不同出口与前瞻组合形成了连续的性能-延迟曲线。
图4的价值在于,它不是只给一个“最好点”,而是把一整条曲线摆出来。对于工程部署来说,这比单点 SOTA 更有意义,因为真实设备的预算往往不是论文作者拍脑袋定的,而是产品经理、芯片性能、业务场景一起商量出来的。图里还能看出一个很有意思的趋势:对 UTMOS 这类感知质量指标来说,增加模型深度往往比增加前瞻更有效;但对 ASR 准确率来说,增加一个前瞻帧的收益很明显,再继续加第二个前瞻帧,收益就开始变小了。换句话说,“多看一点未来”有用,但不是无限有用
表2
表2:VoiceBank-DEMAND 基准上的实时语音增强结果。为了看跨数据集泛化,除 DEMUCS 外,其余模型都没有在该训练集上训练。
表2则更像一次“换场考试”。论文把模型拿到常用的 VoiceBank-DEMAND 基准上测了一遍,并且为了公平起见,大多数对比方法都没有用该数据集训练。结果显示,在相近的算法延迟下,本文方法在 PESQ、ESTOI 和 SI-SDR 上都拿到了最好的表现;如果把前瞻从 0 提到 1,所有指标还能继续提升。这里的 SI-SDR 指的是 Scale-Invariant Signal-to-Distortion Ratio,中文可译为尺度不变信号失真比,是语音增强里常见的信号保真指标。这个结果说明,本文方法并不是只会在挑战赛数据上“刷题”,换个常用基准也能站得住。
更重要的是,论文给出了一个很实用的部署思路:用户先在自己的硬件上测试不同出口层和前瞻设置的总延迟,找到最合适的组合后,只保留对应的层和分支,最后得到的模型大小和专用模型一样,不会额外背着一堆没用的参数跑。这个设计对产品化很友好,因为它把“灵活性”留在训练阶段,把“瘦身”留到部署阶段,避免上线时模型像背着行李箱去短跑。
如果把这篇论文的贡献浓缩成一句话,那就是:它不是单纯追求更高分,而是在真实延迟约束下,尽量把“一个模型适配多种场景”变成可落地的工程方案。这类工作不一定最炫,但往往最接近真正会被用起来的技术。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是实时语音增强里“一个模型很难同时适配不同延迟预算”的问题。论文把总延迟拆成算法延迟和计算延迟,再分别用前瞻帧和早退机制去控制,从而让同一个模型能覆盖多种部署场景。

look-ahead frames 和 early exit 分别是什么意思?look-ahead frames 就是模型允许看到的未来帧数,决定算法延迟;early exit 是网络在中间层提前输出的机制,决定计算延迟。前者像“先看一眼再说”,后者像“差不多就先交卷”。

为什么还要做两阶段训练?因为灵活模型最怕“每个出口都学成自己的小脾气”。先用共享 decoder 统一表示空间,再用多 decoder 细化各出口,能更稳地缩小灵活模型和专用模型之间的性能差距。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 这篇论文的核心不是发明了全新任务,而是把实时语音增强里两个关键延迟维度拆开控制,并做成可部署的统一框架,工程创新很实在。

实验合理度:★★★★☆ 对比了挑战赛数据和常用基准,还把算法延迟、计算延迟、实时处理约束都放进来,评价维度比较完整,算是比较讲规矩。

学术研究价值:★★★★☆ 对通用语音增强、流式建模和延迟控制都有启发,尤其适合后续做统一模型与部署策略的人参考。

稳定性:★★★☆☆ 两阶段训练和多分支设计提升了稳定性,但毕竟还是依赖硬件和出口选择,真正落地时还要看具体设备表现。

适应性以及泛化能力:★★★★☆ 多语言、多采样率、多退化条件都覆盖到了,跨数据集测试也不错,泛化能力相对扎实。

硬件需求及成本:★★★☆☆ 2.9M 到 3.7M 参数不算夸张,但早退和计算延迟仍受硬件影响,低端设备上还得认真挑出口。

复现难度:★★★★☆ 模型权重已开放,思路和训练策略也说得比较清楚,复现门槛不高;但精确对齐实时测延迟仍需要认真按硬件测。

产品化成熟度:★★★★☆ 这类“一个模型多配置”的设计非常贴近产品部署,尤其适合需要按设备分档的语音应用。

可能的问题:灵活性做出来了,但不同硬件、不同前瞻和出口组合的最优点还得现场测;此外,性能与专用模型仍有小差距。


主要参考文献

[8] S.-W. Fu, R. Chao, X. Yang, S.-F. Huang, R. E. Zezario, R. Nasretdinov, A. Jukic, Y. Tsao, and Y.-C. F. Wang, “RE-USE: Rethinking training architectures and data quality for universal speech enhancement,” arXiv preprint arXiv:2603.02641, 2026.
[12] S. Teerapittayanon, B. McDanel, and H.-T. Kung, “Branchynet: Fast inference via early exiting from deep neural networks,” ICPR, 2016.
[20] K. Saijo et al., “Interspeech 2025 URGENT speech enhancement challenge,” Interspeech, 2025.
[22] R. Chao et al., “Universal speech enhancement with regression and generative Mamba,” Interspeech, 2025.
原文链接:https://arxiv.org/pdf/2606.25621v2.pdf
开源模型:https://huggingface.co/nvidia/Real-time RE-USE

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
实时跟进语音增强、实时部署、低延迟模型这些硬核话题,别让好论文只停留在“看过”。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。