← 返回 PaperDaily
视觉与图像
NVIDIA新作:一个语音增强模型,30种延迟随便切
这篇论文最有意思的地方,是把“实时语音增强”里最容易打架的两个指标——算法延迟和计算延迟——拆开管了。一个模型就能切出30种延迟配置,既能讲究效果,也能照顾设备脾气,属于很实用的工程型思路。
龙哥读论文
发布于 2026-08-15 00:20:09
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最有意思的地方,是把“实时语音增强”里最容易打架的两个指标——算法延迟和计算延迟——拆开管了。一个模型就能切出30种延迟配置,既能讲究效果,也能照顾设备脾气,属于很实用的工程型思路。
原论文信息如下:
实时语音增强这件事,表面上像“把噪声擦掉”这么简单,实际上工程里最爱出幺蛾子:有的模型效果不错,但一上流式场景就卡顿;有的模型跑得飞快,但声音听起来像隔着一层毛玻璃;还有的模型在实验室里很美,到了真机上就开始“表演失常”。这篇论文最实用的地方,就是正面解决了一个很现实的问题:如何让同一个语音增强模型,适配不同设备、不同应用、不同延迟预算 。对于语音通话、流式识别、在线会议这类场景,这不是锦上添花,而是能不能上线的分水岭。
语音增强新突破:一个模型搞定所有实时场景延迟预算
先把概念捋顺。语音增强 ,就是把“被噪声、混响、压缩失真、丢包、风噪等折腾过的语音”尽量恢复得更清楚。实时语音增强 则更苛刻:不能等整段语音都进来再处理,得边来边出结果,否则通话和流式识别就会被延迟拖成“慢动作回放”。
本论文的关键词是 universal speech enhancement ,中文可理解为“通用语音增强 ”:一个模型尽量覆盖多种退化类型、多种采样率、多种应用场景,而不是每个场景都单独训一个小模型。这里的“universal”不是嘴上说说的“啥都能干”,而是论文在多语言、多采样率、多退化条件上做了统一建模,目标很明确:一套权重,尽量通吃 。
但问题也随之来了:实时系统里的“延迟”不是一个数,而是两个人在吵架。一个叫算法延迟 ,一个叫计算延迟 。前者决定模型为了做出第一个输出,要先偷看多少未来信息;后者决定模型拿到数据后,自己要算多久才能吐出结果。很多论文只盯着其中一个,另一个就像被遗忘在角落里的行李箱,结果一上真实设备就露馅。
论文这里先给出一个很重要的现实判断:不同应用对延迟的容忍度完全不一样。比如语音通话可能能忍 50–150 毫秒,流式识别常见预算大概在 100–200 毫秒。更要命的是,设备也分三六九等,A100、3090、4090 和普通端侧芯片,算力差距足以让同一个模型变成“神速”或“龟速”。所以,真正有用的不是训练一个只会在某个固定点上表现最好的模型,而是训练一个能在多个延迟预算之间切换的模型 。
延迟分身术:算法延迟与计算延迟如何“随心而变”?
这篇论文最妙的地方,就是把“延迟可调”拆成两个独立旋钮。算法延迟 通过 look-ahead frames (前瞻帧)来调;计算延迟 则通过 early exit (早退)来调。前者回答“要不要看一点未来”,后者回答“网络要走到多深才停”。
先说前瞻帧。对于基于频域的语音增强模型,输入通常先经过短时傅里叶变换,也就是 STFT ,英文全称是 Short-Time Fourier Transform ,中文叫短时傅里叶变换 。如果模型想“看未来”,就得在卷积层里给右边多留一点 padding;如果想完全因果,就让右侧 padding 为零。论文举了个很直白的例子:卷积核大小为 3 时,0、1、2 帧前瞻可以分别通过不同的左右 padding 配置实现。听起来像是在给模型装“单向望远镜”,想看多远,拧一下镜头就行。
但这里有个坑:如果只用同一层卷积、靠不同 padding 来切换前瞻,模型会学得比较别扭。论文的观察是,这种做法会影响后续序列建模的学习效率,验证集上的 UTMOS 学习曲线也能看出差异。于是作者借鉴了“多专家”思路,弄了并行卷积层 ,每个分支对应一种前瞻设置。训练时随机抽一个分支参与前向计算,推理时则由用户按延迟预算直接指定。这里没有复杂路由器,没有“谁更聪明就让谁上”,因为选择标准很朴素:预算说了算 。
再说计算延迟。这里用的是 early exit ,英文全称可理解为 early-exit mechanism ,中文就是早退机制 :网络不必每次都跑到最后一层,中间层如果已经“够用了”,就可以提前输出。这个思路最早在深层网络里就很常见,论文也引用了相关工作。它的好处很直接:设备算力不够时,可以牺牲一点深度,换来更低的推理时间。
不过早退也有代价。中间层本质上是“半成品”,它既要兼顾前面,又要给后面留余地,所以性能通常不如专门训练到某个固定深度的模型。论文一开始做实验时发现,所有出口共用一个 decoder 时,学习更稳定;如果每层都单独配 decoder,反而容易把表示空间训乱。于是作者没有简单粗暴地“一层一头到底”,而是设计了一个两阶段训练策略 ,这部分就是后面最关键的修补手术。
顺带一提,论文还特别强调一个常被忽略的现实约束:实时处理 不只是“平均上够快”,而是每个处理步的计算时间都必须小于对应 hop size,否则延迟会越积越多,最后像堵车一样彻底失控。这个提醒很朴素,但很有用,因为不少论文喜欢拿离线测法当实时结果,数字看着漂亮,真上流式就露馅。龙哥只能说一句:实验室里跑得飞快,不等于路上不堵车。🤨
两阶段训练策略:如何让灵活模型实力媲美专用模型?
前面已经说了,灵活模型最怕两件事:一是不同前瞻设置互相打架,二是不同深度出口各自为政。论文的解决方案很像“先统一思想,再分头精修”。这就是所谓的两阶段训练 。
第一阶段叫共享 decoder 阶段 。训练时,模型会随机采样不同的出口层和不同的前瞻分支,但所有出口共用同一个 decoder。这样做的核心目的,不是让每个出口都立刻变强,而是先把大家拉进同一个表示空间,别一上来就各讲各话。这个阶段相当于先给模型上“统一教材”,保证基础语义一致。
第二阶段才是多 decoder 阶段 。当共享 decoder 收敛后,作者把它复制成多个独立 decoder,每个输出层都有自己的参数,但初始化都来自共享权重。与此同时,decoder 前面的编码器和序列建模模块继续用更小学习率微调。这个操作的妙处在于:既保留了统一表示空间,又给每个出口留出个性化空间 。它不是推倒重来,而是“先打地基,再做精装修”。
从表1能看出两件事。第一,单纯 early-exit 已经能把计算延迟压下来,但性能和专用模型相比还是有差距;第二,加入并行卷积之后,模型不仅能灵活切换前瞻设置,还能保持和 early-exit 接近的表现。再往前走一步,加入多 decoder 阶段后,大多数指标都有进一步提升,尤其是任务相关指标 CAcc(ASR 的字符准确率)更明显。也就是说,这个两阶段策略不是摆设,它确实在帮模型把“灵活”和“好用”尽量往一起拽。
论文的骨干网络也值得顺手讲一下。作者沿用并改造了 USEMamba 和 RE-USE 的思路,使用 Mamba 作为序列建模模块。Mamba 的全称是 Selective State Space Model 相关的线性时间序列建模框架,中文常译为选择性状态空间模型 。它适合流式处理,因为推理方式更像 RNN,能按时间步逐步更新状态,不必像某些大块头结构那样每次都全量重算。为了满足实时约束,论文还把双向 temporal Mamba 改成了单向版本,把普通卷积换成因果卷积,并把 instance normalization 换成只沿通道维做的 layer normalization。这个改法很务实:少一点花里胡哨,多一点流式友好。
30种配置任你选:实时语音增强效果实测惊艳全场
真正让这篇论文从“思路不错”变成“工程上有戏”的,是它的配置自由度。作者在 URGENT 2025 数据集上展示了 30 种不同延迟配置 ,也就是 10 个出口层 × 3 个前瞻设置。听起来像是给模型开了个“自助餐厅”:预算紧,就少拿一点;预算宽,就多拿一点;同一个模型,不用重新训练一套。
图4的价值在于,它不是只给一个“最好点”,而是把一整条曲线摆出来。对于工程部署来说,这比单点 SOTA 更有意义,因为真实设备的预算往往不是论文作者拍脑袋定的,而是产品经理、芯片性能、业务场景一起商量出来的。图里还能看出一个很有意思的趋势:对 UTMOS 这类感知质量指标来说,增加模型深度往往比增加前瞻更有效;但对 ASR 准确率来说,增加一个前瞻帧的收益很明显,再继续加第二个前瞻帧,收益就开始变小了。换句话说,“多看一点未来”有用,但不是无限有用 。
表2则更像一次“换场考试”。论文把模型拿到常用的 VoiceBank-DEMAND 基准上测了一遍,并且为了公平起见,大多数对比方法都没有用该数据集训练。结果显示,在相近的算法延迟下,本文方法在 PESQ、ESTOI 和 SI-SDR 上都拿到了最好的表现;如果把前瞻从 0 提到 1,所有指标还能继续提升。这里的 SI-SDR 指的是 Scale-Invariant Signal-to-Distortion Ratio ,中文可译为尺度不变信号失真比 ,是语音增强里常见的信号保真指标。这个结果说明,本文方法并不是只会在挑战赛数据上“刷题”,换个常用基准也能站得住。
更重要的是,论文给出了一个很实用的部署思路:用户先在自己的硬件上测试不同出口层和前瞻设置的总延迟,找到最合适的组合后,只保留对应的层和分支,最后得到的模型大小和专用模型一样,不会额外背着一堆没用的参数跑。这个设计对产品化很友好,因为它把“灵活性”留在训练阶段,把“瘦身”留到部署阶段,避免上线时模型像背着行李箱去短跑。
如果把这篇论文的贡献浓缩成一句话,那就是:它不是单纯追求更高分,而是在真实延迟约束下,尽量把“一个模型适配多种场景”变成可落地的工程方案 。这类工作不一定最炫,但往往最接近真正会被用起来的技术。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是实时语音增强里“一个模型很难同时适配不同延迟预算”的问题。论文把总延迟拆成算法延迟和计算延迟,再分别用前瞻帧和早退机制去控制,从而让同一个模型能覆盖多种部署场景。
look-ahead frames 和 early exit 分别是什么意思? look-ahead frames 就是模型允许看到的未来帧数,决定算法延迟;early exit 是网络在中间层提前输出的机制,决定计算延迟。前者像“先看一眼再说”,后者像“差不多就先交卷”。
为什么还要做两阶段训练? 因为灵活模型最怕“每个出口都学成自己的小脾气”。先用共享 decoder 统一表示空间,再用多 decoder 细化各出口,能更稳地缩小灵活模型和专用模型之间的性能差距。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 这篇论文的核心不是发明了全新任务,而是把实时语音增强里两个关键延迟维度拆开控制,并做成可部署的统一框架,工程创新很实在。
实验合理度: ★★★★☆ 对比了挑战赛数据和常用基准,还把算法延迟、计算延迟、实时处理约束都放进来,评价维度比较完整,算是比较讲规矩。
学术研究价值: ★★★★☆ 对通用语音增强、流式建模和延迟控制都有启发,尤其适合后续做统一模型与部署策略的人参考。
稳定性: ★★★☆☆ 两阶段训练和多分支设计提升了稳定性,但毕竟还是依赖硬件和出口选择,真正落地时还要看具体设备表现。
适应性以及泛化能力: ★★★★☆ 多语言、多采样率、多退化条件都覆盖到了,跨数据集测试也不错,泛化能力相对扎实。
硬件需求及成本: ★★★☆☆ 2.9M 到 3.7M 参数不算夸张,但早退和计算延迟仍受硬件影响,低端设备上还得认真挑出口。
复现难度: ★★★★☆ 模型权重已开放,思路和训练策略也说得比较清楚,复现门槛不高;但精确对齐实时测延迟仍需要认真按硬件测。
产品化成熟度: ★★★★☆ 这类“一个模型多配置”的设计非常贴近产品部署,尤其适合需要按设备分档的语音应用。
可能的问题: 灵活性做出来了,但不同硬件、不同前瞻和出口组合的最优点还得现场测;此外,性能与专用模型仍有小差距。
主要参考文献
[8] S.-W. Fu, R. Chao, X. Yang, S.-F. Huang, R. E. Zezario, R. Nasretdinov, A. Jukic, Y. Tsao, and Y.-C. F. Wang, “RE-USE: Rethinking training architectures and data quality for universal speech enhancement,” arXiv preprint arXiv:2603.02641, 2026.
[12] S. Teerapittayanon, B. McDanel, and H.-T. Kung, “Branchynet: Fast inference via early exiting from deep neural networks,” ICPR, 2016.
[20] K. Saijo et al., “Interspeech 2025 URGENT speech enhancement challenge,” Interspeech, 2025.
[22] R. Chao et al., “Universal speech enhancement with regression and generative Mamba,” Interspeech, 2025.
原文链接:https://arxiv.org/pdf/2606.25621v2.pdf
开源模型:https://huggingface.co/nvidia/Real-time RE-USE
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!