← 返回 PaperDaily
视觉与图像
顶级会议新研究:让语音增强模型学会唱歌,原能力还不掉
一边是700小时的大规模语音增强数据,一边是只有35小时的歌声分离标注集,AI界“贫富差距”在这篇论文里被LoRA一招填平。只需6-12%额外参数,就能让语音增强模型“开口唱歌”,还稳稳保住原有看家本领,这买卖划算。
龙哥读论文
发布于 2026-08-19 00:20:00
阅读 3
查看原文
原论文信息如下:
龙哥在写这篇解读之前,正好刷到一条短视频:一位歌手在录音棚里清唱,混音师一键把人声从伴奏里“抠”出来,画面丝滑得让人以为是在变魔术。评论区有人问:这技术要是能教会给AI语音助手,让它们直接在嘈杂的KTV包间里精准听清你唱到跑调的第几句,该多好?结果还真有论文在琢磨这事——只不过方向反过来了:让一个本来只负责“听清说话”的语音增强模型,去干“分离唱歌人声”的活儿。听起来像让一个语文老师去教数学?但人家不仅教了,还只用6-12%的额外参数量就上岗了。
这篇由格拉茨音乐与表演艺术大学和伦敦国王学院合作完成的最新论文,把歌声分离任务重新定义成了一次跨域迁移:既然语音增强模型已经在几百上千小时的数据里学会了“从干扰中恢复干净的语音信号”,那为什么不让它把这套本事直接搬到音乐场景里,去分离伴奏中的歌声呢?模型参数不用从头学,微调一下就行——于是“从语音增强到歌声分离”的“跨界歌手”就这么诞生了。
让语音增强模型学会唱歌:从语音增强到歌声分离的域自适应新思路
先聊一个现实困境:数据量级的“贫富差距”。顶级的语音增强(Speech Enhancement, SE)模型为什么强?因为它们吃了大量带标注的数据。比如URGENT挑战赛(Universality, Robustness, and Generalizability for Speech Enhancement,即“语音增强的普适性、鲁棒性和泛化性挑战赛”)提供的训练语料大约有700小时 音频,涵盖了噪声、混响、设备失真等各种退化条件。而歌声分离(Singing Voice Separation, SVS)任务呢?学术界常用的两个开源多轨数据集MUSDB18-HQ和MoisesDB加在一起,可用训练数据大约只有35小时 ——两者相差整整20倍。
数据少,模型就难训练。歌声分离模型通常只能从零开始训练,在这么小的数据量上,很容易过拟合,泛化能力也堪忧。本文提出的核心思路是:与其“白手起家”,不如“改行复用”。 语音增强和歌声分离本质上都是“从混合信号中恢复干净的目标人声”的任务,唯一的区别在于干扰源:语音增强面对的干扰是环境噪声、混响等声学退化,而歌声分离面对的干扰是结构化的音乐伴奏。数学形式上也高度统一:
语音增强的混合信号模型:y[n] = Ds(s[n]) + n[n],其中s[n]是干净语音,Ds(·)是非线性退化算子(如噪声叠加、混响等),n[n]是干扰声学信号。歌声混合信号模型:y[n] = Dv(v[n]) + a[n],其中v[n]是干净歌声,Dv(·)是音乐制作相关的处理(如压缩、均衡等),a[n]是伴奏信号。两个公式几乎一一对应,只是退化算子和干扰信号在频谱特性上差别很大。
既然形式上这么接近,那么语音增强模型在海量数据上学到的“从干扰中恢复人声”的表示能力,能不能迁移到歌声分离场景中?本文给出的答案是:能,而且只需要很小的代价。
两大微调策略对决:全量微调vs LoRA参数高效微调
既然决定“改行”,那具体怎么改?本文对比了两种主流策略:全量微调(Full Fine-tuning) 和基于LoRA的参数高效微调 。
全量微调好理解:把预训练好的语音增强模型的所有参数都放开,用歌声分离数据重新训练。这种方式的好处是模型可以充分“重塑”自己以适应新领域,但代价也很明显——灾难性遗忘(Catastrophic Forgetting) :模型在适应歌声分离的同时,会逐渐忘记原本擅长的语音增强能力,新旧任务“顾此失彼”。
LoRA(Low-Rank Adaptation,低秩自适应)则是另一条路。它最初是2022年为了高效微调大语言模型提出的方法,核心思想很巧妙:预训练模型的权重在微调时完全冻结 ,只额外插入一些低秩矩阵作为“适配器”。原始模型参数完全不动,所以理论上模型原有的能力被完整保留;而新增的参数量极小,通常只有原模型的个位数百分比。对于预训练权重矩阵W₀,LoRA的前向计算可以表示为:h = W₀x + (α/r)·BAx,其中B∈R^(d×r)和A∈R^(r×k)是训练时唯一需要更新的低秩矩阵,秩r远小于原始维度,α是控制适配分支贡献大小的缩放因子。当α设为0时,适配分支被完全移除,模型就恢复成原始的语音增强模型。
这也意味着LoRA天然具备“双模式切换”的能力:需要打电话降噪时,关掉适配分支;需要分离歌曲人声时,打开适配分支。一个模型,两个技能,互不干扰。
在本文的设置中,LoRA的秩r被当作超参数进行搜索。对于判别式模型BSRNN,实验了r = 16、32、128三档(r = 8被测试后因分离性能不足被放弃),缩放因子α统一设为2r。对于生成式模型SGM,由于训练一个模型就要大约6天时间(3块NVIDIA RTX 6000 Blackwell Max-Q GPU),无法系统地搜索秩,固定使用r = 16、α = 32。
判别式与生成式模型的跨域迁移能力大比拼
光有适配策略还不够,模型本身的架构选择同样关键。本文选择了两种极具代表性的架构,分别代表深度学习中两条主流技术路线:判别式模型 和生成式模型 。
判别式路线的代表是BSRNN(Band-Split Recurrent Neural Network,频带分割循环神经网络) 。它的工作方式很像一位“分频段处理专员”:先把输入音频的短时傅里叶变换频谱划分成34个不重叠的子频带——低频段分得细(0-4kHz细分为20个200Hz的窄带),高频段分得粗(7-21kHz分为7个2kHz的宽带,21-24kHz一个3kHz超宽带)——然后用双向长短时记忆网络(BiLSTM)分别对每个子频带进行时序建模,再用另一个BiLSTM跨频带捕捉子带间的依赖关系,最后生成一个复数掩码作用在原始混合信号上,从而估计出干净的人声。这种“分而治之”的思路让它既能精细刻画语音的谐波结构,又能高效处理音乐伴奏这种宽带信号。
生成式路线的代表是SGMSE(Score-based Generative Model for Speech Enhancement,基于分数的语音增强生成模型) 。它走的是扩散模型的路子:通过随机微分方程(SDE, Stochastic Differential Equation)定义一个人声信号逐步被污染成混合信号的正向过程,然后训练一个神经网络去学这个过程的逆过程——也就是说,给定一段带伴奏的混合歌曲,模型通过迭代去噪逐步还原出干净的歌声。不同于BSRNN的确定性输出,SGMSE是随机的,同一个输入可以生成多个不同版本的干净歌声估计,这对处理音乐制作中的不确定性非常有用。
这两个模型的预训练数据规模也不同:BSRNN在URGENT数据集上预训练(约700小时),SGMSE则在EARS-WHAM数据集上预训练(约87小时)。这为后面观察“生成式模型小数据预训练+跨域微调”的效果提供了很好的对照。
实验揭秘:LoRA如何在保持语音增强能力的同时实现高效歌声分离
纸上谈兵没意思,来看实验结果。本文在三个测试集上进行评估:EARS-WHAM测试集(评估语音增强,视为源域)、GenSVS测试集(评估歌声分离,视为目标域)、MSRBench测试集(评估歌声修复,即歌声分离的域外泛化场景)。指标的选取也很有讲究:语音增强用SI-SDR(尺度不变信噪比)和PESQ(感知语音质量评估),歌声分离则用更适合音乐信号的SDR(信号失真比)以及MERT-MSE(一种基于音乐理解模型的嵌入空间均方误差)和MR-Loss(感知加权的多分辨率损失)等与主观听感相关性更高的指标。
先看歌声分离(GenSVS)的成绩。BSRNN全量微调后的SDR达到9.87dB,而LoRA(秩128)也能达到9.23dB;SGMSE全量微调为7.62dB,LoRA(秩16)为7.23dB。关键的信息是:两种微调策略都显著优于从零训练的同类架构 ——BSRNN从零训练只拿到8.05dB,SGMSE从零训练只有6.94dB。本文的两种微调方式比从零训练高出0.29到1.8dB不等。这说明语音增强的预训练表示确实能被有效迁移到歌声分离任务中。
再看语音增强(EARS-WHAM)的表现。全量微调后,BSRNN的PESQ从2.80掉到2.52,SGMSE从2.49掉到2.09——灾难性遗忘确实发生了。而LoRA微调的两个模型,语音增强指标与预训练基础模型几乎完全一致(BSRNN的PESQ都是2.80,SGMSE都是2.49),因为LoRA适配器可以随时“关掉” ,模型在结构上就保证了源域能力不会丢失。
更有意思的是域外泛化表现。表2展示的是模型从域内测试集(GenSVS)到域外测试集(MSRBench)的性能变化。可以看到,生成式模型SGMSE在跨域泛化上全面优于判别式BSRNN :全量微调时SGMSE的SDR提升了1.62dB,BSRNN只提升0.24dB;从零训练时SGMSE提升1.89dB,BSRNN提升1.15dB。哪怕SGMSE的预训练数据比BSRNN少了近8倍(87小时vs 700小时),它在MSRBench上依然能获得更低的MERT-MSE。这个结果说明,扩散模型基于分数的生成框架在捕捉数据分布的本质结构上更有优势,面对训练时没见过的音乐制作风格和录音条件,它的泛化能力更稳健。
下面这张权衡图直观地展示了“目标域性能”和“源域性能”之间的取舍关系:
从图中可以清楚地看到,全量微调的模型(橙色)在横向(歌声分离性能)上冲得很远,但纵向(语音增强PESQ)明显下降。LoRA微调的模型(绿色)则聚在图的右下区域——歌声分离性能接近全量微调,同时语音增强PESQ几乎没掉。这正是LoRA“既要又要”的优势所在。
最后看看参数成本。表3给出了各模型变体的参数量和计算复杂度:
BSRNN使用LoRA秩16时,额外参数量仅为6.06%;秩32时为12.12%;秩128时膨胀到48.49%。但注意看性能提升:从秩16到秩128,GenSVS的SDR只从8.76dB涨到9.23dB,涨幅不到0.5dB——高秩带来的收益非常有限。这说明对这个域迁移任务来说,低秩就已经足够捕捉“语音域”与“歌声域”之间的差异了 。SGMSE的LoRA秩16额外参数也只有7.75%。而全量微调虽然不增加参数量,但会破坏原有模型的能力,所谓“免费的才是最贵的”。
跟业界参考模型对比一下:文中列出的MelRoFo(S)是一个参数量与SGMSE相当的判别式歌声分离模型,MelRoFo(L)则大了三倍以上且用了额外的训练数据。本文的LoRA-BSRNN(秩128)在参数量只有MelRoFo(L)约三分之一的条件下,GenSVS的SDR达到了9.23dB,和MelRoFo(S)的8.98dB差不多;而MelRoFo(L)虽然以11.78dB领先,但其参数规模和训练数据量都远超本文方案。本文的目标本来就不是追求SOTA,而是证明“语音增强预训练 + 轻量级适配”是一条高效可行的歌声分离模型训练路线。
总结与展望:轻量级域自适应的未来方向
本文的核心贡献可以概括为三点:第一,把歌声分离重新定义为语音增强的域自适应问题,验证了“大规模语音增强预训练+小规模歌声微调”的可行性;第二,系统比较了全量微调和LoRA两种策略,证明了LoRA在保留源域能力的同时能达到接近全量微调的目标域性能;第三,揭示了生成式模型在跨域泛化上的优势,为后续在音频通用分离框架中集成多种模型提供了参考。
未来的方向也很清晰:一是扩展“预训练-适配”范式到更多音频源(比如乐器分离),寻找更优的源域组合;二是把LoRA适配器应用到多轨音乐分离中,让一个基础模型通过多个可插拔的适配器分别处理不同乐器;三是在更大的歌声分离数据集上验证这套方法的扩展性。
对于从事音频AI研发的团队来说,这个思路尤其值得借鉴:与其在一个数据稀缺的领域从零训练一个大模型,不如先在数据丰富的邻近领域预训练,再通过LoRA这类轻量级适配器快速迁移。这种“预训练一次,到处微调”的模式,或许是应对标注数据不足的通用解法。
龙迷三问
这篇论文到底在解决什么问题? 提出将歌声分离重新定义为语音增强的域自适应问题。全量微调与LoRA微调均优于从零训练0.29-1.8dB,其中LoRA仅增加6-12%参数即可保留原始语音增强能力并取得接近全量微调的分离性能,生成式模型跨域泛化表现更佳。
这篇工作最值得看的点是什么? 全量微调在SVS和SVR上取得最高性能(BSRNN SDR 9.87/10.11 dB),但SE性能下降(PESQ下降0.28-0.40);LoRA微调在保持SE性能的同时达到全量微调90%以上的SVS性能,仅增加6-12%参数;生成式模型在跨域泛化上表现更优。
这篇工作的边界或风险在哪里? 优点:1) 创新性地将SVS重新定义为SE的域自适应问题,有效利用大规模SE预训练数据;2) LoRA策略在保持源域性能的同时实现目标域适配,缓解灾难性遗忘;3) 系统比较了判别式和生成式模型的迁移效果。缺点:1) 两种模型使用不同的预训练数据集(700h vs 87h),对比不够公平;2) SGM的LoRA仅测试了单一rank;3) 未达到SOTA性能,MelRoFo (L)仍是最优。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
将歌声分离任务重新定义为从语音增强到歌声分离的领域自适应问题,通过全量微调和LoRA参数高效微调两种策略,将大规模预训练的语音增强模型(判别式BSRNN和生成式SGMSE)迁移到数据稀缺的歌声分离场景。
实验合理度: ★★★★☆
SDR、SI-SDR、PESQ、DistillMOS、MERT-MSE、MR-Loss
学术研究价值: ★★★★☆
将歌声分离任务重新定义为从语音增强到歌声分离的领域自适应问题,通过全量微调和LoRA参数高效微调两种策略,将大规模预训练的语音增强模型(判别式BSRNN和生成式SGMSE)迁移到数据稀缺的歌声分离场景;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
BSRNN全量微调399.64 GMACs/s,LoRA 16为895.07 GMACs/s;SGM base为399.64 GMACs/s,LoRA 16为895.07 GMACs/s
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: ,有效利用大规模SE预训练数据;2) LoRA策略在保持源域性能的同时实现目标域适配,缓解灾难性遗忘;3) 系统比较了判别式和生成式模型的迁移效果。缺点:1) 两种模型使用不同的预训练数据集(700h vs 87h),对比不够公平;2) SGM的LoRA仅测试了单一rank;
主要参考文献
[1] W. Zhang, R. Scheibler, K. Saijo, et al. "URGENT challenge: Universality, robustness, and generalizability for speech enhancement," in Proc. Interspeech, 2024, pp. 4868–4872.
[2] J. Richter, S. Welker, J.-M. Lemercier, et al. "Speech enhancement and dereverberation with diffusion-based generative models," IEEE/ACM Trans. Audio, Speech, Lang. Process., vol. 31, pp. 2351–2364, 2023.
[3] E. J. Hu, Y. Shen, P. Wallis, et al. "LoRA: Low-rank adaptation of large language models," in Proc. ICLR, 2022.
[4] Y. Luo and J. Yu. "Music source separation with band-split RNN," IEEE/ACM Trans. Audio, Speech, Lang. Process., vol. 31, pp. 1893–1901, 2023.
[5] Y. Song, J. Sohl-Dickstein, D. P. Kingma, et al. "Score-based generative modeling through stochastic differential equations," in Proc. ICLR, 2021.
[6] J. Richter, Y.-C. Wu, S. Krenn, et al. "EARS: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation," in Proc. Interspeech, 2024, pp. 4873–4877.
[7] P. A. Bereuter, B. Stahl, M. D. Plumbley, et al. "Towards reliable objective evaluation metrics for generative singing voice separation models," in Proc. WASPAA, 2025.
[8] 原论文链接:https://arxiv.org/pdf/2607.11630v1.pdf
[9] 开源代码:https://github.com/pablebe/se2svs
*本文解读基于论文《TEACHING SPEECH ENHANCEMENT MODELS TO SING: DOMAIN ADAPTATION FROM SPEECH ENHANCEMENT TO SINGING VOICE SEPARATION》(Paul A. Bereuter, Mark D. Plumbley, Alois Sontacchi),仅代表龙哥个人理解,不构成对论文结论的官方解读。*
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
语音增强学唱歌,LoRA轻巧显神通!🎵 想第一时间听龙哥唠音频AI新姿势?速来「龙哥读论文」微信群,和同频道友一起拆解歌声分离、语音增强的硬核套路~
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 音频处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群