← 返回 PaperDaily 视觉与图像

去噪+分类一体两吃:这家新方法给USV分析送来“干净耳朵”

夜深人静,研究员对着硬盘里几十TB的野外小鼠录音发愁:录音里除了小鼠50kHz以上的超声“对唱”,还有空调、风扇、鼠笼碰撞、脚步等各色噪声,信号早被压到墙角。

去噪+分类一体两吃:这家新方法给USV分析送来“干净耳朵”
原论文信息如下:
论文标题:
Training Set Synthesis for Bioacoustic Denoising: A Case Study with Mice
发表日期:
2026年08月
发表单位:
Acoustic Research Institute, Austrian Academy of Sciences
原文链接:
https://arxiv.org/pdf/2608.10054v1.pdf

夜深人静,研究员对着硬盘里几十TB的野外小鼠录音发愁:录音里除了小鼠50kHz以上的超声“对唱”,还有空调、风扇、鼠笼碰撞、脚步等各色噪声,信号早被压到墙角。更头疼的是,想做深度学习去噪,却没人给小鼠录过“干净版”的纯享音频。换作是你,会不会当场想逃?
这篇工作给出的答案是:没有干净训练数据,那就顺着声谱图上的脊线自己“造”一套。它把信号处理里的脊线追踪和深度学习的训练集合成、损失函数设计串在了一起,不需要人工标注,也不需要赌运气去录“无噪版”小鼠叫声。

小鼠超声发声为何需要专用去噪?

先科普一个背景:小鼠的超声发声(Ultrasonic Vocalizations,简称USV)频率通常在50到60kHz左右,远超人耳听觉范围,是行为神经科学里研究社交、情绪和发育的重要信号。USV带有明显的基频和谐波结构,很多下游分析(比如音节分类、个体识别、声学特征提取)都要先依赖清晰的时间-频率轮廓。换句话说,噪声一上来,整条分析流水线都可能跟着崩
传统去噪方法,比如谱减法(Spectral Subtraction)、维纳滤波(Wiener Filtering)、noisereduce这类工具,基本都是假设噪声谱相对平稳,然后从无声段估计噪声特征再扣掉。可在真实的野外或饲养间录音里,背景噪声不但强度会变,频谱也时不时漂移。噪声一变,这些方法就容易“误刀”掉一些微弱但关键的叫声成分,尤其是那些刚好压在噪声底上的弱哨声。论文里提到的多窗重排谱(Multitaper Reassigned Spectrogram)等手段虽然能增强信号,但面对和USV频带重叠的噪声,依然力不从心。
深度学习里的U-Net在语音增强、音乐分离上已经证明很强,但它监督训练需要大量“带噪-干净”配对数据。生物声学里恰恰拿不到干净参考:野外录音连“纯小鼠无伴奏版”都没有,更别说做成千上万条。论文的思路是:把训练数据直接合成出来,用信号处理先验补上“买不起”的干净标签。

核心创新:脊线引导的训练集合成与损失设计


论文主体思路

先把整篇论文的骨架列出来,后续每一节再一步步拆开看。
*表格超出部分左右可以滑动 TABLE I: Number of USVs in each class (C, C2, C3, D, F, U, UI, UP), across the training, validation, and testing subsets of the correct-ridge dataset, and the testing subset of the incorrect-ridge dataset. “Subset” indicates the data split used for training or evaluation of the proposed denoiser and classifier.
TABLE I: Number of USVs in each class (C, C2, C3, D, F, U, UI, UP), across the training, validation, and testing subsets of the correct-ridge dataset, and the testing subset of the incorrect-ridge dataset. “Subset” indicates the data split used for training or evaluation of the proposed denoiser and classifier.

从噪声录音里“造”出干净目标

什么是脊线(Ridge)?简单说,声谱图里每个时间点上,能量沿频率轴出现的局部极大值连成的一条亮色曲线。对USV来说,脊线基本就是那条“基频+第一个谐波”的轨迹。它不是纯粹拿来看的,而是论文整个去噪范式的核心。
训练集合成流程如下:输入带噪信号x,先用经验维纳收缩(Empirical Wiener Shrinkage)做一次预去噪,压制平稳底噪;接着计算两种多窗重排时频表示——MTRS-STFT(Multi-Taper Reassigned Short-Time Fourier Transform,多窗重排短时傅里叶变换)和MTRS-CQT(Multi-Taper Reassigned Constant-Q Transform,多窗重排常数Q变换),拿它们做多分量脊线追踪,找到基频和谐波的频率轨迹。然后以脊线位置为中心生成高斯掩码,把重排谱上属于叫声的区域“抠”出来,最后经过二维卷积和相位恢复,合成出近似干净的信号s̃。整体流程见图1。
图1 训练集合成流程图
图1:训练集合成流程图。输入带噪信号先经维纳收缩去底噪,再计算两种多窗重排时频表示用于多分量脊线追踪,随后生成脊线引导掩码并应用到重排谱上,最终通过二维卷积和相位恢复合成干净训练目标。
这里最关键的一步是掩码生成。论文用了一个截断高斯函数,只在脊线两边各L/2个频率点内有非零值,离脊线越远权重越低,公式如下:
公式1 高斯掩码定义
公式(1)中, ∥k∥∥r∥[∥n∥]∥  是第n个时间帧上脊线对应的频率索引,σ=L/4控制高斯衰减速度。整条掩码的最大值归一化为1,相当于在声谱图上“沿脊线画一条渐变亮带”,把脊线附近的能量留下,其它区域全部压掉。
光有掩码还不够,还要把重排谱“还原”成普通STFT幅度谱。论文采用的做法是用Hann窗及其离散傅里叶变换构成的内核,对掩蔽后的重排谱做二维卷积:
公式2 重排谱反卷积
公式(2)中, ∥W∥[∥n∥,∥k∥]∥  是由Hann窗和其频谱外积构成的卷积核。经过这一步,得到了接近原始STFT幅度谱的表示,再用快速Griffin-Lim算法恢复相位,就能反变换回时域波形。这里有一点值得注意:脊线追踪结果不需要“完美正确”,只要大致对准脊线走向,合成出的音频就足够当训练目标用。这为整个方法的实用性和鲁棒性松了很大一口气。

脊线引导的损失函数

合成训练集解决了“数据从哪来”的问题,但第二个问题接踵而至:去噪器在训练时,凭什么知道该优先保护哪些时频点?论文的答案是:把脊线信息写进损失函数。
通常去噪训练会对所有时频区域一视同仁,可实际上脊线附近的信息量远高于背景噪声区。论文设计了一个动态权重矩阵:在脊线附近±b个频率点以内,根据当前掩码幅度自适应分配权重;幅度越低的脊线区域权重越大,因为微弱叫声成分在去噪时最容易先被“洗掉”。权重公式如下:
公式5 脊线引导权重
公式(5)中,α=0.3是防止脊线区域权重过小的下限因子,γ=10控制整体放大倍数, ∥O∥∥{∥x∥∥r∥,∥m∥a∥x∥}∥ 是当前样本中实部掩码的最大值。权重会被裁剪到[6.0,10.0]区间内,避免个别点数值过大让训练失稳。可以看出,掩码幅度越小的地方,权重越大,这正好帮助网络重点保护“气若游丝”式的弱叫声。
加权回归损失可以理解为:对每个时频点,分别计算预测cRM的实部和虚部与目标值的平方差,再乘上对应的权重矩阵并求平均。权重高的地方,网络会被“逼着”把脊线附近的复数掩码预测得更准。除此以外,论文还额外加了一个噪声惩罚项,专门压制非脊线区域输出无关能量:
公式7 噪声惩罚项
公式(7)里, ∥1∥∥{∥∥{∥w∥∥r∥[∥n∥,∥k∥]∥=∥1∥∥}∥}∥  只在权重为1(即非脊线区域)时激活, ∥|∥∥t∥i∥l∥d∥e∥{∥X∥}∥[∥n∥,∥k∥]∥|∥  用噪声输入幅度给惩罚加权。也就是说,网络在噪声区多输出一点能量,就会被罚一次。最终总损失是加权回归损失与噪声惩罚项的线性组合:
公式8 总损失
公式(8)中,α_noise=0.8是噪声惩罚的相对权重,在实验中通过小规模试验确定。整体设计思路就是:数据合成阶段用脊线“圈出”该学的内容,损失函数阶段再用脊线“重点盯防”容易丢的细节。

U-Net去噪器如何工作?

有了训练集和损失函数,剩下的“体力活”全部交给U-Net。U-Net最早来自医学图像分割,结构像一个回字形:左边编码器一层层卷积和下采样,把输入抽象成越来越高层级的特征;右边解码器一层层上采样,把特征还原回原始分辨率;中间的跳跃连接就像传送带,把编码器的局部细节直接送到解码器同层,避免重建时细节丢失。对USV去噪来说,好处很直接:脊线这种细长的时频结构,很容易在深层网络里被“平均”掉,有了跳跃连接,基频弯曲和谐波的微小调频模式都能保留下来。
图2 去噪器训练流程图
图2:去噪器训练流程图。U-Net以噪声信号为输入,预测压缩后的复数比率掩码(cRM),脊线引导损失在训练时突出对脊线区域的约束。
具体到输入输出设计:U-Net吃进去的是带噪信号的STFT幅度谱,输出的是复数比率掩码(complex Ratio Mask,简称cRM)的实部和虚部。cRM和传统幅度掩码的区别值得单独拎出来说:幅度掩码只对幅度做增益修正,相位直接用带噪信号的相位,低信噪比时相位误差会直接拖垮重建质量;cRM则直接在复数域对每个时频点做增益,等于同时修正幅度和相位,对USV这种窄带谐波信号特别友好。
训练目标由合成干净信号和合成带噪信号在复数谱上的比值给出:
公式3 理想复数比率掩码
公式(3)中, ∥S∥∥{∥∥t∥i∥l∥d∥e∥{∥s∥}∥}∥  和  ∥S∥∥{∥∥t∥i∥l∥d∥e∥{∥x∥}∥}∥  分别是合成干净信号与合成带噪信号的复数频谱,ε=1e-8是为了数值稳定性加的小常数。理想掩码在物理上可能幅度很大,为了让网络好回归,论文又用带饱和特性的压缩函数把它压到有限区间:
公式4 掩码压缩
公式(4)里,B=15控制输出范围,C=0.1控制压缩曲线斜率。网络预测的是压缩后的O_x,推理时还需要逆变换回未压缩的掩码,才能正确应用到噪声频谱上:
公式9 逆压缩
公式(9)使用对数函数把网络输出还原成可用的复数掩码,乘到带噪STFT上,再逆STFT(Inverse Short-Time Fourier Transform)就把时域去噪信号重建出来了。整个流程的训练环节见图2,预测环节和训练环节共用同一个网络,只是不再走损失函数。

实验结果:SI-SDR、脊线跟踪与分类全面提升

论文的实验设计并不只是看一个指标,而是从信号质量、脊线跟踪、下游分类三个角度去验证。信号质量用的是尺度不变信号失真比(Scale-Invariant Signal-to-Distortion Ratio,简称SI-SDR),它衡量重建信号相比真实干净信号的距离,比普通信噪比更严格。
首先看合成测试集的结果。论文把噪声叠加到合成干净信号上,分别在-10dB到20dB的输入信噪比(Signal-to-Noise Ratio,SNR)下评测。结果如图3所示。
图3 SI-SDR结果
图3:SI-SDR在去噪前后的对比。左图是不同输入SNR下,噪声输入、本文去噪器以及基线方法(分析式去噪器、Biodenoising、noisereduce的平稳/非平稳模式)的均值±标准差;右图是每个样本的SI-SDR提升量分布。
从结果看,输入SNR越低,本文方法的SI-SDR提升越明显;即使在20dB这个本身信号已经比较清楚的条件下,依然没有掉链子。特别是右边那个散点图,很多样本的提升都稳定落在正值区间,说明去噪对每个样本都有正向贡献,而不是“平均好看、个别翻车”。
接下来看脊线跟踪。由于真实田野录音没有干净参考,论文采用“任务导向”的评估方式:请专家对真实录音里的USV脊线做人工标注,看去噪后自动脊线追踪的精确率、召回率和频率偏差。结果见表2和表3。
表2 基础脊线跟踪指标
表2:基础脊线跟踪评估。Precision表示检测到的脊线中正确匹配人工标注的比例,deviation报告所有跟踪点的平均频率差±标准差。DeepSqueak按原文约定方式跟踪,其它方法用MATLAB的tfridge函数。加粗为最优结果。
表3 谐波脊线跟踪指标
表3:谐波脊线跟踪评估。Precision和Recall以百分比报告,deviation表示所有跟踪点的平均频率差±标准差。谐波脊线采用本文第III-B节描述的基于自相关的方法跟踪。加粗为最优结果。
两个表里,本文提出的去噪器在处理真实田野录音时,脊线跟踪的精确率和召回率都有明显提升,频率偏差也显著缩小。尤其值得注意的是,论文还专门构造了一个“错误脊线”测试子集,故意收集那些最初脊线追踪失败的样本。即使在这些样本上,去噪后的脊线跟踪结果依然有正向改善,说明整个系统的容错能力比想象中好。图4给出了一个直观的可视化对比。
图4 脊线跟踪可视化对比
图4:两个示例USV的声谱图(上方)和对应的基础脊线跟踪结果(下方),并与人工标注对比。时频表示用STFT计算。DeepSqueak类方法按DeepSqueak方式追踪,其它方法对经不同去噪或增强处理的信号使用MATLAB的tfridge函数追踪。
最后是下游分类评估。USV分类是很多行为研究的关键步骤,论文用BootSnap分类器分别基于三种音频训练:原始带噪音频、分析式去噪音频、本文方法去噪音频。模型分别在野生小鼠的正确脊线子集、错误脊线子集,以及家养小鼠数据集上测试,结果见表4和表5。
表4 野生小鼠分类性能
表4:三个BootSnap模型在原始音频、分析式去噪音频、本文方法去噪音频上训练后的USV分类性能比较。所有训练条件都额外使用BootSnap内置默认去噪以保持流程兼容。模型在正确脊线和不正确脊线的野生小鼠测试子集上评估,报告类F1和宏F1分数(%)。加粗为最优。
表5 家养小鼠分类性能
表5:三个BootSnap模型在家养小鼠数据集上的USV分类性能比较,报告类F1和宏F1分数(%)。加粗为更优模型。
可以看到,用本文去噪后的音频重新训练分类器,宏F1分数在野生小鼠和家养小鼠上都有提升。最难得的一点是“错误脊线”子集上也有正收益。也就是说,即使脊线追踪不太完美,依靠去噪-重训的闭环,依然能把分类准确率拉上来,这比只能在精心挑选数据上刷点的做法实用得多。图5展示了不同子集样本去噪前后的声谱图。
图5 原始与去噪声谱图对比
图5:四个数据集的原始音频(上)和去噪音频(下)声谱图对比:(a)训练集(野生小鼠,正确脊线),(b)测试集(野生小鼠,正确脊线),(c)测试集(野生小鼠,错误脊线),(d)测试集(家养小鼠),均来自音节类别C3。这些样本用于训练和评估BootSnap分类器,去噪由本文方法完成。颜色强度代表信号幅度。

方法局限与未来展望

这篇方法虽然漂亮,但边界条件必须说清楚。第一,它面向的是“局部正弦+可追踪脊线”的叫声,比如小鼠USV、海豚哨声、狨猴叫声。如果碰到宽带或强噪声化的声音(比如某些鸟类的嘈杂鸣叫),脊线本身都不存在,整个合成路线自然无从谈起。
第二,训练集合成前的维纳收缩需要从一段“纯噪声段”估计噪声谱。如果录音里实在找不到一段不含USV的噪声片段,这一步就需要人工介入。野外数据一般有充足的空闲噪声段,但自动批处理时仍要留个心眼。
第三,脊线追踪误差会通过合成目标传导给去噪器。论文的实验已经证明中等误差可以被容错,但如果输入信噪比低到连人都看不清脊线,任何追踪算法都难以输出可信结果,合成训练集的可靠性也会大打折扣。
展望来看,下一步比较诱人的方向是:把脊线追踪模块也做成可学习的神经网络,和去噪U-Net联合微调,做成端到端的“追踪→合成→去噪”闭环。另外,小鼠USV只是案例,这套范式完全可以平移到更多存在明显频率轮廓的物种上。若再配上低资源部署,就能直接嵌入野外声学监测设备,让实时去噪成为可能。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对生物声学缺乏干净训练数据的痛点,奥地利声学研究所提出脊线引导训练集合成与脊线加权损失,训练U-Net去噪器。
这篇工作最值得看的点是什么?所提方法在所有输入SNR水平上均显著提升SI-SDR(最低SNR从-10.17dB提升至16.52dB),脊线跟踪精度达96%(频率偏差0.8±1.5kHz),分类F1分数在正确脊线数据上从83%提升至89%,错误脊线数据上从69%提升至72%。
这篇工作的边界或风险在哪里?优点:无需干净训练数据,利用脊线信息实现训练集合成和损失加权,在低SNR条件下效果显著,对下游任务(脊线跟踪、分类)有明确改进。缺点:仅适用于具有可跟踪脊线的窄带类发声信号,对极微弱信号恢复有限,高SNR信号偶尔出现SI-SDR下降,解析重建对脊线估计误差敏感。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种基于多分量脊线跟踪的训练集合成方法,利用脊线信息生成伪干净训练数据,并设计脊线引导损失函数训练U-Net预测复杂比率掩码实现生物声学信号去噪。

实验合理度:★★★★☆

SI-SDR(尺度不变信号失真比)、脊线跟踪精度/召回率/频率偏差、USV分类F1分数。

学术研究价值:★★★★☆

提出一种基于多分量脊线跟踪的训练集合成方法,利用脊线信息生成伪干净训练数据,并设计脊线引导损失函数训练U-Net预测复杂比率掩码实现生物声学信号去噪;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确报告FLOPs,在NVIDIA A100-SXM4 (40GB) GPU上训练。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:仅适用于具有可跟踪脊线的窄带类发声信号,对极微弱信号恢复有限,高SNR信号偶尔出现SI-SDR下降,解析重建对脊线估计误差敏感。

主要参考文献

[1] Abbasi R, Balazs P, Lostanlen V, et al. Training Set Synthesis for Bioacoustic Denoising: A Case Study with Mice. arXiv:2608.10054v1.
[2] Ronneberger O, Fischer P, Brox T. U-Net: Convolutional Networks for Biomedical Image Segmentation. MICCAI 2015.
[3] Sainburg T, Thielk M, Gentner T Q. noisereduce: A Simple and Flexible Noise Reduction Tool. Journal of Open Source Software, 2020.
其余参考文献详见原论文:https://arxiv.org/pdf/2608.10054v1.pdf

融会贯通

结合PaperDaily已收录论文的范围观察,和本文最接近的路线是Biodenoising那类方法:先用预训练语音增强模型或经典去噪工具把录音粗略“洗”一遍,再把洗出来的结果当作伪干净目标去训练下游模型。本文走的是另一条路——用脊线追踪加相位恢复,从带噪信号中直接解析出可解释的干净目标,不依赖任何语音领域模型的隐式偏好。
两条路线孰优孰劣目前还谈不上绝对领先。本文胜在目标生成可控、可解释,弱点在于脊线追踪本身还会误差累积;Biodenoising胜在通用性强,弱点在于预训练模型的去噪偏好可能与目标物种不匹配。需要提醒读者:本文分类实验只对比了分析式去噪器和不去噪两种基线,并未在相同数据划分下与其它监督式深度去噪器做平行比较,因此“全面提升”这个结论最好结合自己的数据集再验证一遍,并注意不同实验设置带来的偏差。以上判断仅限于PaperDaily已收录论文的对比范围,不构成全领域绝对结论。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球