← 返回 PaperDaily 视觉与图像

告别臃肿模型!QC-GAN用数学魔法,让手机也能秒变降噪大师

继此前聊过给模型减负的HALO插件后,这次朝日新闻和东京女子基督教大学带来更极致的玩法:用数学界古老的"四元数"给语音增强模型瘦身。0.89M参数干到PESQ 3.48,性能逼近2倍大模型,35K超小模型同样惊艳。最关键的是,四元数天生就是为处理幅度和相位这种耦合信息量身定制,一句话:厉害的还在后头。

告别臃肿模型!QC-GAN用数学魔法,让手机也能秒变降噪大师
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
继此前聊过给模型减负的HALO插件后,这次朝日新闻和东京女子基督教大学带来更极致的玩法:用数学界古老的"四元数"给语音增强模型瘦身。0.89M参数干到PESQ 3.48,性能逼近2倍大模型,35K超小模型同样惊艳。最关键的是,四元数天生就是为处理幅度和相位这种耦合信息量身定制,一句话:厉害的还在后头。


原论文信息如下:
论文标题:
QC-GAN: A Parameter-Efficient Quaternion Conformer GAN for High-Fidelity Speech Enhancement

发表日期:2026年06月

发表单位:日本朝日新闻(The Asahi Shimbun Company)、东京女子基督教大学(Tokyo Woman's Christian University)

原文链接:https://arxiv.org/pdf/2606.18611v1.pdf

好的,没问题!龙哥这就根据最新的论文和你的要求,给你整一篇既有干货又幽默风趣的公众号文章。来,咱们直接开整,感受一下日本学者怎么用“四元数”把语音增强模型做到极致瘦身。 图4:在VoiceBank+DEMAND测试样本上的频谱图对比。黄色虚线框标出了语音前的静音区域(0–0.5秒),QC-GAN (Tiny)在此区域的噪声抑制效果最接近干净参考。
哈喽,各位龙迷们,今天龙哥要跟大家聊个很有意思的活儿:给语音降噪模型“瘦身”。
大家知道,现在给手机、耳机做语音增强(就是把背景噪音去掉),模型是越做越大,动辄几百万、上千万的参数,像CMGAN、MP-SENet这些大佬,性能是够顶,但为了跑它们,你的手机芯片得嗷嗷叫。那么问题来了,能不能用更小的模型,干同样的活?
插图
今天论文的主角——朝日新闻和东京女子基督教大学的联合团队,就给出了一个相当“装逼”的答案:用古老的四元数(Quaternion)数学,把模型参数量砍到只有0.89M,性能却几乎没掉,甚至有点小惊喜。这操作,简直是把数学玩出了花!
###

子标题1: 引言:语音增强的挑战与三叶草的新思路

说白了,语音增强,就是跟一个叫“相位”的老哥较劲。很多模型只关心声音的“音量”(幅度),却把更重要的“相位”给扔了。相位错了,声音听起来就会怪怪的,像有人在你耳朵边放了个电子合成器。而要想把“相位”和“幅度”这对“小冤家”一起处理好,模型就得够大,参数管够。
那怎么在参数量不变的情况下,把这对“冤家”一起搞定呢?这就要请出我们今天的主角——四元数
四元数说白了,是一种有4个分量的“超级复数”,它有一个很神奇的乘法规则叫“哈密顿积”(Hamilton product)。最妙的是,这个乘法规则天然地就把四个分量给“耦合”在一起了,你中有我,我中有你。
下图完美展示了这个思想:普通的实数层(Real-valued layer)看幅度和相位,是把它俩当两个独立的信息去处理。而四元数层(Quaternion layer)则通过哈密顿积这个“铁索”,把幅度和相位的信息死死地绑在一起,作为一个整体来学习。
图1:实数层与四元数层的特征学习对比。实数层独立处理幅度和相位,而四元数层通过哈密顿积将它们耦合在一起,作为归纳偏置。
图1:实数层与四元数层的特征学习对比。实数层独立处理幅度和相位,而四元数层通过哈密顿积将它们耦合在一起,作为归纳偏置。
这就厉害了!因为这种耦合,四元数层的参数用量,理论上就是同等效果的实数层的 四分之一。这个思想,就是QNN(Quaternion Neural Networks,四元数神经网络)的核心。讲真,用数学结构来当先验知识、来约束模型,这比手动加一堆Loss高到不知道哪里去了!
###

子标题2: 核心方法:QC-GAN如何用四元数Conformer实现高效增强

理解了四元数这个核心兵器,咱们再来拆解一下QC-GAN这个模型。它基于目前超火的CMGAN架构,但把里面“心脏”部分都换成了四元数版本。整个架构如下图所示:
图2:所提出的QC-GAN的整体架构,包括四元数编码器、QG-扩张密集网络编码器(b)、两阶段四元数Conformer瓶颈(c)、双支路解码器(掩码和复数残差)以及度量鉴别器(d)。整体生成器架构如(a)所示。
图2:所提出的QC-GAN的整体架构,包括四元数编码器、QG-扩张密集网络编码器(b)、两阶段四元数Conformer瓶颈(c)、双支路解码器(掩码和复数残差)以及度量鉴别器(d)。
来,咱捋一捋它怎么一步步降噪的:

第一步:把语音信号变成四元数特征。 咱们不直接用幅度谱,而是把幅度和相位都打包成四个通道。一个通道放对数幅度的差分,一个放对数幅度,剩下俩放相位的余弦和正弦,这样通过哈密顿积,模型就能在更少参数下捕捉到相位和幅度之间的“爱恨纠葛”。

第二步:四元数编码器(QG-Dilated DenseNet)。 这其实是一个四元数版本的密集连接网络,用了膨胀卷积(dilated convolution),感受野更大,能看更广的频谱图。更重要的是,它加入了门控机制(Gating),能把噪音那部分的路给堵住,只让有用的语音信息通过,非常精妙。

第三步:两阶段四元数Conformer瓶颈。 这是最核心的设计之一。它把原本的Transformer换成了四元数版本(Q-MHSA,即Quaternion Multi-Head Self-Attention,四元数多头自注意力),并且分两步走:先在时间维度上做自注意力,再在频率维度上做自注意力。这样做的目的就是为了捕捉全局的长距离依赖,让模型能听到整个句子,而不是只看过眼前那一点点。

第四步:双路解码器。 解码器分为两条路:一条预测幅度掩码,另一条预测相位残差,最后融合起来,合成出干净语音的复数谱,再通过逆STFT变回时域波形。两条路分工明确,各司其职。

第五步:MetricGAN训练。 一般的模型用均方误差(MSE)来训练,而QC-GAN用了一个判别器(Discriminator)来近似PESQ(Perceptual Evaluation of Speech Quality,语音质量感知评估)这种主观感知指标。让生成器学会“怎么做人”,说人话,以提高听众的舒适度。

###

子标题3: 结果揭秘:极小参数下的卓越性能与相位保持优势

光说不练假把式。咱们直接上硬菜,看看这“瘦身”效果到底有多牛。
第一,怕不是要吊打“大胖子”模型。 来看看表1,QC-GAN的Base版本,参数量只有0.89M,是CMGAN(1.83M)的一半,是SE-Mamba(2.26M)的三分之一不到!但它PESQ干到了3.48,比CMGAN的3.41还高,甚至逼平了MP-SENet的3.50。这不是吊打,这是“以轻博重”啊,朋友们!
表1:在VoiceBank+DEMAND数据集上与最新方法的性能对比。粗体表示每项指标的最佳性能。
表1:在VoiceBank+DEMAND数据集上与最新方法的性能对比。粗体表示每项指标的最佳性能。
第二,极致压缩下的“小钢炮”QC-GAN(Tiny),只有35K!35K是什么概念?一张512x512的灰度图的大小!它PESQ居然有3.23,比同样小尺寸的LiSenNet(3.07)、LSENet(3.12)都要高。STOI(Short-Time Objective Intelligibility,短时客观可懂度)也达到了0.94,这意味着语音的清晰度几乎没损失。这简直是“麻雀虽小,五脏俱全”的完美诠释!
表2:在VoiceBank+DEMAND数据集上与超紧凑模型的对比。MACs为实值。对于QC-GAN,括号内为参数化层的qMAC计数(0.22 G;1 qMAC = 16实数MAC);†其实MAC值还包含注意力计算。
表2:在VoiceBank+DEMAND数据集上与超紧凑模型的对比。MACs为实值。
第三,相位保持优势明显。 这不是吹的,从图4的频谱图就能看出一二。黄色虚线框是说话前的静音区域,QC-GAN(Tiny)在这里的降噪效果最接近干净参考,把背景噪声压得死死的,没有产生任何怪声。
图4:在VoiceBank+DEMAND测试样本上的频谱图对比。黄色虚线框标出了语音前的静音区域(0–0.5秒),QC-GAN (Tiny)在此区域的噪声抑制效果最接近干净参考。
图4:在VoiceBank+DEMAND测试样本上的频谱图对比。黄色虚线框标出了语音前的静音区域。
第四,实战能力也不错。 在更复杂的DNS-Challenge 3数据集上,Base模型以0.89M的参数,在OVRL、BAK等指标上超过了1.83M的CMGAN。就连极小的Tiny模型,也比3.7M的DCCRN表现更好。这说明它泛化能力强,能应对真实的复杂环境。
表3:使用DNSMOS指标在DNS-Challenge 3盲测集上的性能比较。所有模型均在DNS-Challenge 3训练数据上从头训练。
表3:使用DNSMOS指标在DNS-Challenge 3盲测集上的性能比较。
###

子标题4: 深入分析:四元数表示为何有效?相位误差与计算权衡

光看结果,我们说它牛。但龙哥得带你们再深挖一层:为什么四元数这个小妖精就能这么有效?
论文做了一组非常干净的消融实验(表4)!他们把QC-GAN里的四元数层全部换成普通的实数层,但保持其他设置完全一样。结果:
表4:消融研究:QC-GAN (35K参数) 与 Real-NN (32K, 140K参数) 在可比和匹配容量模型大小下的对比。TS-Conformer 表示实值的两阶段Conformer。
表4:消融研究:QC-GAN (35K参数) 与 Real-NN (32K, 140K参数) 的对比。
  • 参数匹配时:实数版Real-NN(32K)的PESQ是3.12,而QC-GAN(35K)是3.23。这说明,在相同参数量下,四元数结构的学习效率更高。
  • 容量匹配时:把实数版的参数扩大到4倍,变成Real-NN(140K),它的PESQ才涨到3.29。而QC-GAN(35K)仍然以3.23的成绩紧紧咬住。四分之一的价格,买到几乎一样的性能,这笔买卖太划算了!
更关键的是,论文还专门分析了相位重建。他们计算了几种相位误差指标,结果如下:
图5:VoiceBank+DEMAND测试集上的相位重建指标。数值越低表示相位保持得越好。QC-GAN在所有三项指标上都优于两个Real-NN变体。
图5:VoiceBank+DEMAND测试集上的相位重建指标。数值越低表示相位保持得越好。
一目了然!在图5中,所有三种相位误差指标,QC-GAN都是最低的,相位恢复得最准!图6也给了一个直观的例子,在语音活动区域,QC-GAN的相位误差(底部图中更淡的颜色)明显比实数版的Real-NN要小。
图6:QC-GAN与Real-NN (32K)的相位重建:频谱图(上)和以干净语音幅度加权的绝对相位误差(下)。QC-GAN的平均加权相位误差降低了14.7% (0.414 -> 0.353 rad)。
图6:QC-GAN与Real-NN (32K)的相位重建:平均加权相位误差降低了14.7%。
这铁证如山,证明了四元数的那套内在耦合机制,确实让模型在修复相位上拥有天然优势。
插图
另外,可能有龙迷会问:“四元数运算这么复杂,算得过来吗?” 论文也给出了RTF(Real-Time Factor,实时因子)的计算结果。如表5所示,虽然四元数层的计算复杂度更高,但得益于参数量的大幅减少,QC-GAN在A100显卡上的RTF依然低至0.49,满足实时处理要求。
表5:RTF对比。MACs为实值,针对1秒音频。CPU: Intel Xeon Gold 6342 (4线程);GPU: NVIDIA A100 80GB PCIe。
表5:RTF对比。QC-GAN在GPU上具备实时处理能力。
###

子标题5: 总结与展望:QC-GAN的未来方向

总的来说,QC-GAN这篇工作,龙哥认为是近段时间把“参数效率”做到极致的一个典范。它没有发明一种全新的、颠覆性的网络结构,而是用了一个古老而优雅的数学工具,把现有骨架的潜力榨干了。这种“四两拨千斤”的思路,实在是令人拍案叫绝。
展望未来,这个四元数思路的潜力远不止于此。它完全可以被应用到其他需要处理“耦合”信息的任务中,比如图像去模糊、视频超分等等。或许在不久的将来,边缘设备上的AI都能用上“四元数”这个秘密武器。
但论文也不是没有缺点。比如,它虽然在PESQ这种指标上表现很好,但在另一个指标CBAK(背景噪声抑制)上,比CMGAN还是稍微差了一点点。此外,四元数运算在消费级硬件(比如手机芯片)上的优化可能还不够成熟,要全面铺开还需要时间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?这篇论文主要解决在语音增强任务中,如何用极少的参数量(0.89M和35K),达到与大型模型(如CMGAN、SE-Mamba等)相当甚至更好的语音质量(主要是PESQ指标)。它利用四元数神经网络的特性,在保持甚至提升相位重建精度的同时,大幅减少模型参数,有助于将高质量语音增强模型部署到手机、耳机等资源受限的移动设备上。

文章中提到的“PESQ”和“STOI”代表什么意思?PESQ,全称是Perceptual Evaluation of Speech Quality,即语音质量感知评估,是一个用于客观评估语音质量的标准算法,得分范围通常是-0.5到4.5,分数越高表示语音质量越好。STOI,全称是Short-Time Objective Intelligibility,即短时客观可懂度,它评估的是语音的清晰度和可懂度,得分范围是0到1,分数越高表示语音越清晰、越容易听懂。文中用这两个指标来衡量模型的增强效果。

四元数相比实数有什么优势?可以打个比方吗?四元数的优势在于它能用一个“结构”将四个分量天然地耦合在一起。我们可以打个比方:在语音增强中,幅度和相位就像是让声音“好听”的一对舞伴。普通的实数层,相当于让一个教练(网络)分别给男舞者(幅度)和女舞者(相位)指导动作,但他俩没练过配合,跳起来可能不协调。而四元数层,相当于让教练直接教“一对舞伴”怎么配合跳一支完整的舞(哈密顿积),这样不仅教的效率更高(参数少),而且他俩配合的默契度(耦合性)也远超各自为政。所以,四元数网络能更好地学会“幅度”和“相位”这对舞伴如何“共舞”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

首次将四元数神经网络成功应用于单通道语音增强任务,并创新性地融合到了Conformer架构中,非常具有启发性。

实验合理度:★★★★☆

对比实验做的很充分,不仅有主流的SoTA模型,还有专门的超紧凑模型对比,以及详细的消融实验(包括与实数版本的等参数量和等容量对比),很有说服力。

学术研究价值:★★★★★

展示了数学归纳偏置(四元数代数)在现代深度学习中的巨大潜力,为设计超轻量化模型提供了全新的、优雅的范式,启发性极强。

稳定性:★★★☆☆

模型在标准数据集上表现稳定,但作为一种新型代数运算在现有硬件上的实现,其在不同算力、不同精度下的稳定性还有待进一步验证。

适应性以及泛化能力:★★★★☆

在VoiceBank+DEMAND和DNS-Challenge 3两个不同难度的数据集上都取得了很好效果,证明其泛化能力不错,能适应真实的复杂噪声环境。

硬件需求及成本:★★★★☆

参数量极少是最大优势,大大降低了部署门槛。虽然四元数单次计算更复杂,但整体算力需求依然小于传统大型模型,适合部署在移动端。

复现难度:★★★☆☆

论文方法描述得非常详细,包括损失函数的权重、网络结构的具体配置等。但如果要完整复现,需要自行实现四元数卷积和注意力,有一定的工作量。

产品化成熟度:★★★★☆

具备很高的产品化潜力。其超轻量特性非常适合TWS耳机、智能手表等低功耗设备。目前的主要瓶颈在于,并非所有移动端推理框架都原生支持四元数运算,需要一些定制优化。

可能的问题:虽然在PESQ等感知指标上表现优异,但在某些子指标(如CBAK,背景噪声抑制)上,相比CMGAN等模型仍有微弱差距。未来可以探索更高效的四元数计算优化,并在更广泛的任务(如音乐分离)上进行验证。


主要参考文献

[1] Vaswani, A. et al. (2017). Attention is all you need. NIPS.
[2] Gulati, A. et al. (2020). Conformer: Convolution-augmented transformer for speech recognition. Interspeech.
[3] Zhao, S. et al. (2024). SE-Mamba: Speech enhancement via selective state space model. arXiv:2403.04682.
[4] Cao, R. et al. (2022). CMGAN: Conformer-based metric GAN for speech enhancement. TASLP.
[5] Wu, Z. et al. (2023). MP-SENet: A speech enhancement model with parallel conformers. ICASSP.
[12] Rix, A. W. et al. (2001). Perceptual evaluation of speech quality (PESQ): A new method for speech quality assessment. IEEE.
[13] Hamilton, W. R. (1844). On quaternions. Proceedings of the Royal Irish Academy.
[27] Fu, S. W. et al. (2020). MetricGAN: Generative adversarial networks based black-box metric scores optimization for speech enhancement. ICML.
[36] Valentini-Botinhao, C. et al. (2016). Noisy speech database for training speech enhancement algorithms and TTS models. University of Edinburgh.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
用四元数魔法,让语音增强告别参数焦虑! 欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 语音处理+上海+朝日新闻+小龙),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。