← 返回 PaperDaily 视觉与图像

WS Audiology最新研究:告别回声,2ms极速消除自语音,仅需0.18G算力!

远场设备增强语音回传时,往返延迟超10ms会引发烦人回声。这篇WS Audiology的工作创新提出“自语音消除”任务,设计延迟低至2ms、计算量极小的Mamba-MinGRU模型,在极低算力下解决痛点。继SEMamba++通用语音修复后,本文聚焦低延迟流式场景下的专项消除,非常实用。

WS Audiology最新研究:告别回声,2ms极速消除自语音,仅需0.18G算力!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
远场设备增强语音回传时,往返延迟超10ms会引发烦人回声。这篇WS Audiology的工作创新提出“自语音消除”任务,设计延迟低至2ms、计算量极小的Mamba-MinGRU模型,在极低算力下解决痛点。继SEMamba++通用语音修复后,本文聚焦低延迟流式场景下的专项消除,非常实用。


原论文信息如下:
论文标题:
Don't Listen to Me: A Lightweight, Low-Latency Model for Own-Voice Cancellation in Far-Field Speech Enhancement
发表日期:
2026年06月
发表单位:
WS Audiology, Lynge, Denmark; DTU Compute, Technical University of Denmark; Verth, Denmark
原文链接:
https://arxiv.org/pdf/2606.23332v1.pdf

告别回声:自语音消除新任务,让远场语音更纯净

想象一下,你正用桌面麦克风开线上会议。你说的话被拾取、增强后通过耳机传回,但延迟几毫秒,让你感觉像听到回声,非常烦人。传统做法是消除延迟,但硬件成本高。WS Audiology、DTU等机构的研究者提出反直觉思路:既然自己的声音延迟回来让人难受,干脆从混合信号里“拿掉”它,只保留其他说话人和环境音。
这就是论文核心贡献——提出新任务自语音消除(Own-Voice Cancellation, OVC)。它与目标说话人提取(TSE)相反:TSE是“只听你想听的人”,OVC是“别听我的,听别人的”。
图1:自语音消除与目标说话人提取的区别
图1:OVC与TSE的区别。TSE保留注册说话人,OVC移除注册说话人,两者都进行降噪和说话人分离。
OVC与传统声学回声消除(AEC)不同:AEC需要扬声器播放的参考信号,而OVC只需一段极短的注册语音,无需参考信号即可完成消除,应用场景更广。远场设备往返时间易超10ms,听觉心理学表明超过15-20ms的延迟会让听众不适。既然无法消灭物理延迟,不如直接剔除自己的声音。

2ms极速响应:Mamba-MinGRU轻量模型架构解析

模型必须足够快。论文提出基于MambaMinGRU的轻量网络Mamba-MinGRU,用线性递归替代卷积和Transformer,降低计算开销并支持因果推理。
图2:时域条件化ConvTasNet的高层架构
图2:系统高层架构。输入混合音频经编码器得到特征,送入掩蔽网络。注册语音通过辅助网络提取说话人嵌入,条件化掩蔽网络,最终解码器恢复波形。
整体流程采用“编码器-掩蔽网络-解码器”结构。混合音频经1D卷积编码映射到高维特征,掩蔽网络生成时间掩码抑制注册说话人,解码器重构波形。核心创新在于掩蔽网络,用Mamba-MinGRU块替代传统时间卷积堆叠。
模块结构:1. 前置归一化;2. 线性扩展与分裂;3. 短因果深度可分离卷积;4. MinGRU时间混合;5. 门控与投影。MinGRU本质是线性递归,通过最小化设计实现并行训练和流式推理。
图3:Mamba-MinGRU掩蔽网络的详细架构
图3:Mamba-MinGRU掩蔽网络详细架构。输入经归一化和线性投影后,通过N个Mamba-MinGRU块,最后线性投影并应用Sigmoid。
模型所有因果配置保持仅2ms算法延迟。编码器卷积核长度32个采样点,在16kHz下对应2ms,完美避开自语音感知“雷区”。

性能与效率兼得:线性RNN辅助网络如何提升效果?

辅助网络从注册语音提取说话人嵌入,通过元素级乘法条件化中间特征。论文对比了传统ConvTasNet辅助网络(1.66M参数,1.67 GMAC/s)和更简单的双向线性RNN(1.61M参数,0.26 GMAC/s)。结果出人意料:线性RNN辅助网络不仅大幅降低计算量,还提升了性能。非因果双全混合场景下,线性RNN辅助网络的SDR达13.57 dB,优于ConvTasNet的13.42 dB。
原因可能是线性RNN能更有效利用全局上下文信息,提取更鲁棒的说话人表征,而ConvTasNet受限于卷积核感受野。正如标题“Don't Listen to Me”所暗示,逻辑清晰:无法物理解决延迟,就用算法移除自己,关键在于用高效线性RNN执行实时任务。

实验说话:SDR与计算量双重对比,优势一目了然

实验在LibriSpeech + WHAM!噪声动态混合数据集上评测,指标包括SDR和pMOS,分完整混合场景(F)和纯降噪场景(D)。
表1:主要实验结果对比
表1:动态OVC测试集评估结果。Causal ✓表示因果推理;F为完整混合场景;D为纯降噪场景;SDR为信号失真比改善量;pMOS为预测平均意见分;MACs为每秒乘加操作数;RTF为实时因子。
关键信息:1. OVC与TSE难度相当(非因果SDR 13.42 vs 13.66 dB)。2. Mamba-MinGRU大幅降本:主网络计算量从4.97 GMAC/s降至0.33 GMAC/s,SDR基本持平。3. 线性RNN辅助网络提升效果:SDR从13.38 dB提升至13.57 dB,辅助网络计算量从1.67降至0.26 GMAC/s。4. 因果模型中,Mamba-MinGRU的SDR与TD-SpeakerBeam接近(11.50 vs 11.13 dB),计算量更低。5. 小型模型仅2.17M参数,0.18 GMAC/s,因果条件下SDR达11.47 dB,RTF为0.82,满足实时处理。
论文还研究了说话人音高对OVC性能的影响。
表2:说话人音高差异对OVC性能的影响
表2:不同音高组的影响。当注册说话人音高相同时效果较差(高音SDR 11.09 dB,低音10.91 dB),音高不同时SDR显著提升(注册者低音达12.24 dB)。说明音高差异是影响OVC效果的重要因素

更多挑战与未来展望:多说话人、混响环境下的性能与潜力

论文对3、4、5个说话人场景进行了评估。
图4:多干扰说话人场景下的SDR改善量
图4:多干扰说话人场景下的SDR改善量。随着说话人数增加,所有模型SDR下降,平均每增加一个说话人下降约2 dB。在5个说话人极端场景下,线性RNN辅助的Mamba-MinGRU模型(c4)仍保持相对最高SDR,说明其鲁棒性更好。
论文指出当前局限性:训练时最多两个干扰说话人,多说话人泛化能力有待提升。未来工作包括扩展训练集、加入混响条件、优化资源有限设备部署。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

OVC和传统AEC有什么区别?AEC需要扬声器播放的参考信号,从麦克风输入中减去。OVC只依赖一段注册语音,告诉模型“这是谁的声音”,直接移除该说话人,适用于无参考信号的场景。

MinGRU如何工作?MinGRU简化了传统GRU,将递归写成线性形式,可用并行扫描高效计算。核心公式为h_t = (1 - z_t) * h_{t-1} + z_t * h_tilde_t,其中z_t是更新门。这使得MinGRU既保留RNN流式推理能力,又能并行训练。

“2ms算法延迟”如何实现?编码器1D卷积核长度设为32,在16kHz采样率下对应2ms。因果模型只需等待卷积核填满即可处理,整体延迟完全可控在2ms。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将TSE任务反转定义OVC新任务,具有实用价值和开创性。

实验合理度:★★★★☆

对比充分,含音高分析,但缺少真实录音环境测试。

学术研究价值:★★★★☆

开辟了有实际意义的子方向,对低延迟流式推理有启发性。

稳定性:★★★☆☆

多说话人场景性能下降明显,实际应用需进一步验证。

适应性以及泛化能力:★★★☆☆

对变长注册、混响等泛化能力有待验证。

硬件需求及成本:★★★★★

小型模型计算量仅0.18 GMAC/s,RTF为0.82,硬件需求极低。

复现难度:★★★☆☆

超参数详细,但未开源代码,需自行实现Mamba-MinGRU模块。

产品化成熟度:★★★☆☆

处于概念验证阶段,真实环境表现未知。

可能的问题:训练数据仅含两个说话人,测试3-5人场景导致性能下降且公平性存疑。纯降噪场景下线性RNN辅助网络SDR波动较大,论文解释不充分。


主要参考文献

[1] M. Delcroix, K. Kinoshita, T. Ochiai, et al. "Listen only to me! How well can target speech extraction handle false alarms?" 2022, arXiv:2204.04811 [eess.AS].
[2] M. Delcroix, T. Ochiai, K. Zmolikova, et al. "Improving Speaker Discrimination of Target Speech Extraction With Time-Domain Speakerbeam," in ICASSP 2020, pp. 691–695.
[3] A. Gu and T. Dao, "Mamba: Linear-Time Sequence Modeling with Selective State Spaces," 2024, arXiv:2312.00752 [cs.LG].
[4] L. Feng, F. Tung, M. O. Ahmed, et al. "Were RNNs All We Needed?" 2024, arXiv:2410.01201 [cs].
[5] H. Sato, T. Moriya, M. Mimura, et al. "SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling," 2024, arXiv:2407.01857 [eess.AS].

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
🎧 听腻了回声,来群里聊聊无声的AI吧!欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 语音处理+上海+WS Audiology+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。