← 返回 PaperDaily
视觉与图像
根特大学最新研究:频谱自适应损失让高频重建误差直降15%
语音增强有个老毛病——噪声压下去了,说话声的高频细节也跟着"缩水"了。根特大学这回不堆模型,而是从损失函数下手,让网络学会按频率和语音能量"区别对待",高频重建误差直降15%以上。方法轻巧,思路值得一看。
龙哥读论文
发布于 2026-09-03 00:20:10
阅读 1
查看原文
原论文信息如下:
语音增强中的"跷跷板"难题:噪声抑制与频谱保真如何兼得?
语音增强这个方向,听起来不如大模型那么热闹,但却是所有语音交互产品里最"刚需"的一环。无论是线上的电话会议、智能音箱的远场唤醒,还是助听器里的实时处理,背后都需要一个能在噪声里把说话声"捞"出来的模型。而且,随着端侧AI的普及,市场对这类模型的要求也在变得越来越具体:算力要低、延迟要小、效果还要好。这三者凑在一起,基本上就是在逼着研究者们"螺蛳壳里做道场"。
根特大学IDLab的这篇论文,切入点非常刁钻。它没有去设计更花哨的网络结构,而是把目光盯在了训练损失函数上,并且精准地指出了当前主流损失函数的一个隐秘痛点:幅度-相位补偿效应 。
这名字听起来有点学术,但其实道理很直白。很多轻量级语音增强模型用的损失函数,是幅度损失和相位感知损失的加权组合。相位感知损失的作用是让模型估计的复数频谱尽量接近真实频谱,这能帮助噪声抑制。但是,当模型对某个频率点的相位预测不自信的时候,这个损失函数会"诱导"模型把该频率点的幅度往零了压。因为这样一来,相位误差带来的损失就变小了。结果就是:模型为了"省事",把不少中高频段的语音能量给一起削掉了。这就是所谓的"过衰减"(over-attenuation)。
如果只是轻微的衰减,人耳可能还察觉不到。但问题在于,这种衰减主要集中在2kHz以上的中高频区域,而这里恰恰是辅音清晰度和语音"明亮感"的关键频段。衰减多了,声音就会变得闷、含糊,听起来像隔着一层被子。这在电话会议里尤其致命——本来对方那边的环境噪声就大,增强完噪声是没了,但说话声也跟着"闷"掉了,听感非常糟糕。
图中λ表示相位感知损失在总损失中的权重。λ等于0时,模型只优化幅度,噪声抑制很差,语谱图上能看到大片的噪点残留;λ等于1时,噪声是压得很干净了,但语谱图上中高频段的语音纹理也变得非常淡,能量被明显削弱了。λ取0.3是个折中,既保留了一部分噪声,也牺牲了一部分高频。这就像跷跷板的两头,怎么压都不对。
以往的主流做法是,在相位感知损失之外再额外加一个纯幅度损失项,用标量权重去平衡。但论文指出,这种全局统一的权重本质上是个"和稀泥"的方案:因为过衰减主要发生在中高频,而噪声残留主要集中在低频,用一个标量去同时管两头,注定了只能互相妥协,没法从根本上解决问题。
频谱自适应损失:让损失函数"看人下菜碟"
既然问题出在"一刀切"的权重上,那解决方案自然就是"看人下菜碟"——针对不同频率、不同信号特性,给相位感知损失配上不同的权重。
论文提出了两种频谱加权损失函数。第一种叫Sigmoid加权损失 ,思路很直接:既然过衰减主要发生在中高频,那就给相位感知损失加一个随频率变化的Sigmoid权重,让它在低频段保持较高的贡献,在中高频段自动"退居二线"。这个权重函数是固定的,对所有语音都用同一套调制曲线。
Sigmoid加权的效果立竿见影,但论文作者并没有满足于此。他们进一步观察到一个很有趣的现象:相位估计的误差分布和语音本身的能量分布是强相关的。看下图,相位估计误差大的区域,往往对应着语音能量低的区域;反之,能量高的区域,相位预测通常也更可靠。
基于这个观察,论文提出了第二种,也是更核心的频谱自适应损失 。它不再使用固定的频率权重曲线,而是从干净语音的真实对数幅度谱中,实时计算出一个信号相关的权重。简单来说,对于能量较高的频点,说明这里大概率是语音的谐波成分,相位预测比较可靠,就适当保留相位感知损失的权重;对于能量较低的频点,相位预测不可靠,那就把权重压低,避免模型为了优化不可靠的相位而错误地压低幅度。
用论文里的公式来表达的话,频谱自适应损失的权重是通过对真实对数幅度谱做时间维平均,再经过Sigmoid变换、归一化和一维平滑得到的。整个流程中,损失的调制是逐帧逐频点动态变化的,相当于给网络提供了一个"实时监控探头",让它知道哪里该信相位、哪里不该信。
HyST-Net:轻量级流式语音增强的新骨干
有了新的损失函数,还需要一个趁手的评估模型。论文顺带设计了一个名为HyST-Net的轻量级流式语音增强网络。这个模型本身不算惊艳,但它的设计思路有其巧妙之处,值得说道说道。
HyST-Net采用的是经典的U-Net结构,编码器和解码器都是因果卷积。它最大的特点在瓶颈层:采用了MHA(多头注意力)加GRU的混合频谱-时序建模 策略。之前的一些模型,比如双路径RNN相关的变体,在频谱维和时序维都用同一种模块(要么都是RNN,要么都是Transformer)。但HyST-Net选择"对症下药":频谱维用MHA,因为它可以并行处理所有频点,而且频谱维的上下文在每一帧都是完整可见的,不存在时序上的因果限制;时序维用GRU,因为它的循环状态非常紧凑,不需要像Transformer那样缓存大量键值对,内存占用更小,推理效率更高。
这种设计带来的收益非常直接。在论文的对比实验中,HyST-Net在保持与FTF-Net相当增强性能的前提下,计算量(MACs计算量(MACs)降低了16.3%,参数量减少了21%。更亮眼的是实时性:在CPU上严格按照逐帧流式推理(不做块级缓冲)、也不加ONNX优化的前提下,HyST-Net的实时因子(RTF)只有0.22,而FTF-Net高达1.05——也就是说,HyST-Net的处理速度快了约4.77倍。FTF-Net的高延迟主要来自RNN在频谱维的逐帧顺序建模,每个频点都得排着队等前面的算完;HyST-Net用MHA在频谱维并行处理,天然绕开了这个瓶颈。
表1的对比数据可以更清楚地展示这一点。
表1:因果流式条件下,HyST-Net与轻量级基线模型的评估结果对比。MACs表示每秒乘加操作数,Param为参数量,RTF为实时因子。
从表1来看,HyST-Net的增强性能与FTF-Net基本处于同一水平:DNSMOS同为3.23,PESQ为2.86对2.91,ESTOI为0.914对0.917,SI-SDR为17.41对17.48,差距都很小。但计算开销全面更优:MACs从318.2降到266.4,减少了16.3%;参数从0.14M降到0.11M,减少了21%。和CRUSE的轻量变体(CRUSE-64-1xGRU2)相比,两者的RTF几乎一样(0.22对0.26),但HyST-Net的参数量只有0.11M,比CRUSE的2.85M少了约96%,四项增强指标反而还略好一点。
这个结果说明两件事。第一,HyST-Net作为一个流式轻量级骨干,性能足以支撑损失函数的公平评估,不会因为模型太弱而掩盖不同损失函数之间的差异。第二,混合建模思路——频谱维用MHA、时序维用GRU——确实能在保持增强效果的前提下显著降低推理开销。对于想在端侧跑实时语音增强的工程师来说,这个网络结构本身就有参考价值,模型在瓶颈层估计的是压缩域的理想比率掩码(ideal ratio mask,IRM),通过复数除法直接得到增强频谱,这也是它能在低参数量下依然保持较高性能的原因之一。
实验结果:高频重建显著改善,中频更均衡
接下来是重头戏:新的损失函数到底带来了什么改变?
实验设置遵循DNS Challenge的标准流程。训练集使用DNS提供的干净语音和噪声语料合成了140小时宽带语音,信噪比从-5dB到20dB不等。评估在DNS Challenge公开合成测试集上进行。STFT配置为512点窗口、50%重叠,采用平方根von Hann窗。所有损失都以多分辨率形式实现,STFT大小取320、512、768三种,与FTF-Net的配置保持一致,称为L_MR_Mix、L_MR_Sig和L_MR_Adp。优化器用的是AdamW,指数衰减率设为(0.9, 0.99),训练策略上完全对齐,保证对比的公平性。
表2给出了基于HyST-Net的不同损失函数的完整评估结果。
表2:基于HyST-Net的不同损失函数的评估结果。除常规总体指标外,还专门在2-4kHz中频(MF)和4-8kHz高频(HF)子带做了C-RMSE、M-RMSE、LSD和SI-SDR的细致评估。
先看总体指标(DNSMOS、PESQ、ESTOI、SI-SDR),三种损失几乎打平,最大差距也只有0.05。这个结果在预料之中:论文明确指出,这些标准指标主要由低频成分主导,对中高频段的失真并不敏感。换句话说,总体指标持平不代表损失函数没有差异,真正需要关注的是分频段的单独评估。
论文在2-4kHz(中频)和4-8kHz(高频)两个子带做了更细致的分析。高频区域的改善非常显著:两种新损失都带来了一致且稳定的进步。C-RMSE从0.0273降到0.0246左右,降幅约9.5%;M-RMSE从0.0237降到0.0200左右,降幅约15.2%;LSD从8.67降到7.48,直接提升了1.18dB;SI-SDR也从13.92升到14.36,增加了0.43dB。这组数据清楚地表明,频谱加权策略确实有效缓解了高频段的幅度过衰减问题,而且两种损失在高频的表现非常接近——说明只要对相位感知损失做频率维度的调制,就能在高频获得稳定的收益。
中频区域则出现了有趣的差异。Sigmoid加权损失(L_MR_Sig)的C-RMSE略有改善(0.0534对0.0539),但M-RMSE反而略差(0.0452对0.0445),LSD更是从7.78退步到7.88。这说明固定频率权重的调制方式在中频段并不适用——中频段的过衰减不存在一个统一的频率模式,用一条固定的Sigmoid曲线去压权重,反而会在某些频点上矫枉过正。而频谱自适应损失(L_MR_Adp)在中频段全面胜出:C-RMSE从0.0539降到0.0522,M-RMSE从0.0445降到0.0427,LSD从7.78降到7.46,SI-SDR从13.18升到13.48。这正是信号依赖加权的优势所在:权重不是按照预设的频率曲线硬编码,而是根据每个样本自身的能量分布动态调整。高能量的谐波频段保留相位约束的强度,低能量、相位预测不可靠的频段则主动放松约束,从而避免了盲目的幅度压缩。
图4的语谱图对比可以直观地看到这一效果。
图4:不同损失函数下增强语音的语谱图对比。L_MR_Adp在中高频区域恢复了更多能量,同时保持了低频段的有效噪声抑制。
可以明显看到,L_MR_Mix增强后的语谱图在中高频区域有不少能量缺口,语音纹理显得稀疏;L_MR_Sig有所改善,但中频区域仍有部分能量损失;而L_MR_Adp的结果最接近干净参考,中高频的谐波结构清晰可见,同时低频噪声也压得很干净,没有引入可见的伪影。
更多样本的语谱图对比、音频试听以及频谱权重可视化可以在论文演示页面中查看:https://aspire.ugent.be/demos/IWAENC2026HZ/
从主观听感的角度,频谱自适应损失增强后的语音在"明亮感"上确实有可感知的提升。高频辅音比如"sh""s"这类擦音,原本容易被削得像含了口水说话,现在能听得更清楚。论文作者在演示页还提供了一个限制案例分析:L_MR_Adp在极少数样本上可能引入细微的高频嘶嘶声,这个发现也为后续改进留下了空间。
总结与展望:迈向全频段均衡的语音增强
这篇论文的核心贡献可以概括为三点。第一,揭示了幅度-相位补偿效应在频率维度上的非均匀性:相位感知损失导致的过衰减主要集中在2kHz以上的中高频段,而传统标量加权无法同时兼顾低频噪声抑制与中高频保真。第二,提出两种频谱加权损失——固定频率调制的Sigmoid加权损失和信号依赖的频谱自适应损失。前者验证了频率维度调制的有效性,后者通过真实对数幅度谱动态调整相位感知分量的权重,在高频和中频都取得了更均衡的重建效果。第三,设计了HyST-Net混合建模骨干,用"频谱维MHA+时序维GRU"的组合,在低延迟流式场景下实现了效率与效果的平衡。
从实际应用的视角看,频谱自适应损失最大的价值在于:它不需要修改模型结构,只需要替换训练损失函数,就能让现有语音增强模型在中高频段获得一致的改善。对于已经在端侧部署了固定模型、想在不增加算力的情况下提升听感的团队来说,这是一个低成本、低风险的优化路径。尤其在同声传译、蓝牙耳机、助听器这类对延迟和算力极其敏感的设备上,这个思路很实用。
当然,这项研究也留下了一些值得继续深挖的问题。信号依赖权重目前依赖干净语音的真实对数幅度谱,这在有监督训练中可以直接获得,但面对无监督或自监督的语音增强场景时,如何估计参考幅度谱是一个待解决的难题。另外,L_MR_Adp在少数样本上可能引入细微的高频嘶嘶声,说明权重调制还不够完美,未来可以考虑引入感知约束或者更精细的频率平滑策略来抑制这类伪影。把频谱自适应的思路扩展到时域损失、感知损失甚至扩散模型训练目标中,也可能会带来新的惊喜。总的来说,这篇论文给出了一条不堆模型、只改目标函数的优雅路径,让人对"损失函数设计"这个方向的潜力有了新的认识。
龙迷三问
这篇论文到底在解决什么问题? 针对语音增强中相位感知损失导致的中高频能量过衰减问题,根特大学提出两种频谱加权损失函数,并设计了轻量级流式增强网络HyST-Net作为评估骨干。实验表明,频谱自适应损失在高频与中频重建上均取得一致提升,实现了更均衡的全频段频谱重建
这篇工作最值得看的点是什么? HyST-Net在保持与FTF-Net相当增强性能的同时,MACs降低16.3%,参数减少21%,RTF加速4.77倍。两种提出的损失函数在高频区域均一致提升重建指标,L_MR_Adp在中频区域进一步改善,实现全频段更均衡的频谱重建。
这篇工作的边界或风险在哪里? 优点:1)提出频谱自适应损失函数,有效解决中高频段幅度过度衰减问题;2)设计轻量级HyST-Net网络,在流式场景下实现显著加速;3)实验设计全面,包含整体指标和分频段指标评估。缺点:1)频谱自适应损失依赖干净语音的log幅度谱作为权重,训练时需要干净参考;2)sigmoid加权损失的超参数(截止频率、陡度等)需要经验调优;3)未在真实场景数据上验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
在损失函数层面引入频谱自适应调制,角度精准,设计简洁。不算颠覆性突破,但提出了一个通用性很强的改进范式,对后续损失函数设计有启发意义。
实验合理度: ★★★★☆
分频段评估做得非常细致,MF/HF子带的多指标设计很有针对性。但仅在DNS一个数据集上验证,没有跨数据集泛化实验,说服力有所保留。
学术研究价值: ★★★★☆
对补偿效应与频率、信号能量之间相关性的实证分析,为后续语音增强损失函数的研究提供了有价值的参考依据。
稳定性: ★★★☆☆
总体指标持平不退化,高频稳定改善,中频L_MR_Adp全面占优。但个别样本可能引入高频嘶嘶声,稳定性还有提升空间。
适应性以及泛化能力: ★★★☆☆
在DNS宽带语音上验证有效,但未覆盖低信噪比、非线性失真、真实录音等更复杂的场景;对干净幅度谱的依赖也限制了在无监督场景下的直接应用。
硬件需求及成本: ★★★★★
模型仅0.11M参数、266.4M MACs/s,CPU上RTF为0.22,对端侧实时部署非常友好。损失函数的计算开销集中在训练阶段,推理完全不受影响。
复现难度: ★★★★☆
方法描述清晰,超参给得完整,结构图有细节。但没有开源代码,需要花时间自行实现和调试,对刚入门的朋友有一定门槛。
产品化成熟度: ★★★☆☆
作为训练trick,替换损失函数就能用,迁移成本低。但clean幅度谱依赖、少量样本伪影等问题,在真实产品落地前需要进一步验证和打磨。
可能的问题: 只在DNS一个数据集上评估,泛化证据不足;L_MR_Adp依赖干净对数幅度谱,在标签不准或低信噪比场景下可能不稳定;少数样本的高频嘶嘶声说明权重调制粒度还不够细。
[1] Braun S, Gamper H, Reddy C K, et al. Towards efficient models for real-time deep noise suppression[C]. ICASSP 2021.
[2] Schröter H, Maier A, Escalante-B A, et al. DeepFilterNet2: Towards real-time speech enhancement on embedded devices for full-band audio[C]. IWAENC 2022.
[3] Zhao H, Madhu N. Study of lightweight transformer architectures for single-channel speech enhancement[C]. EUSIPCO 2025.
[4] Wang Z Q, Wichern G, Le Roux J. On the compensation between magnitude and phase in speech separation[J]. IEEE Signal Processing Letters, 2021.
[5] Braun S, Tashev I. A consolidated view of loss functions for supervised deep learning-based speech enhancement[C]. TSP 2021.
[6] Reddy C K, et al. Interspeech 2021 deep noise suppression challenge[C]. Interspeech 2021.
[7] Zhao H, Madhu N. Towards balanced spectral reconstruction: Spectrally adaptive loss for streaming speech enhancement[J/OL]. arXiv:2608.30739, 2026.
[8] 演示页面: https://aspire.ugent.be/demos/IWAENC2026HZ/
语音增强路漫漫,中高频段最难缠;频谱自适应来帮忙,噪声抑制不误伤。欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 语音增强+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!