← 返回 PaperDaily 大模型与智能体

Yann LeCun、何凯明参与的新作S-JEPA:告别硬聚类,51.8M参数语音模型碾压一众90M以下

Yann LeCun和何凯明两位大神的名字同时出现在作者栏,这排面,拉满了!他们提出了一种全新的自监督语音学习范式S-JEPA,用软聚类取代了硬聚类,彻底告别了HuBERT那种需要中断训练、重新聚类的繁琐流程。更有意思的是,它只用51.8M参数,就在SUPERB语音识别上碾压了所有90M参数以下的方法,效果直逼94.7M的HuBERT-Base。这背后隐藏着

Yann LeCun、何凯明参与的新作S-JEPA:告别硬聚类,51.8M参数语音模型碾压一众90M以下
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
Yann LeCun和何凯明两位大神的名字同时出现在作者栏,这排面,拉满了!他们提出了一种全新的自监督语音学习范式S-JEPA,用软聚类取代了硬聚类,彻底告别了HuBERT那种需要中断训练、重新聚类的繁琐流程。更有意思的是,它只用51.8M参数,就在SUPERB语音识别上碾压了所有90M参数以下的方法,效果直逼94.7M的HuBERT-Base。这背后隐藏着怎样精妙的设计?龙哥带你看懂它!


原论文信息如下:
论文标题:
S-JEPA: Soft Clustering Anchors for Self-Supervised Speech Representation Learning
发表日期:
2026年06月
发表单位:
Carnegie Mellon University, New York University, Columbia University, Northeastern University, Stanford University, Amazon GenAI 等
原文链接:
https://arxiv.org/pdf/2606.19398v1.pdf
开源代码链接:
https://github.com/gioannides/s-jepa

告别硬聚类与离线重训练:S-JEPA如何革新自监督语音学习?

自监督语音学习(Self-Supervised Learning, SSL)这几年几乎被 HuBERT 和 WavLM 这类“硬聚类”方法统治。它们先把音频特征用 k-means 聚类成离散的 ID,然后训练编码器去预测被遮罩位置的 cluster ID。这套“预测离散 ID”的配方确实好用,但有两个让人头大的毛病:第一,k-means 强制每个帧只能属于一个类别,在语音边界(比如音素切换、噪声过渡)这些模糊地带,硬生生把不确定性拍扁成一个 ID;第二,每次聚类完一轮就要中断训练,等重新对全库做一次聚类,然后重启训练——整个 pipeline 就像老式绿皮火车,走走停停。
本论文提出的 S-JEPA 直接把这两个问题干掉了。它把硬聚类变成软聚类——用高斯混合模型(Gaussian Mixture Model, GMM)的软后验概率代替 k-means 的硬标签,而且训练过程不再需要中断重聚类,变成一条连续的优化轨迹。这背后是一个 JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)风格的编码器-预测器对,专门预测被遮罩位置的 GMM 软后验,损失函数就用 KL 散度(Kullback-Leibler divergence)。听起来是不是有点像 HuBERT 的“软版本”?但龙哥要告诉你,光是“软化”还不够,后面还有连续训练、自适应层选择等一套骚操作,直接让它在 SUPERB 评测上刷出新记录。😏
图1: S-JEPA:JEPA风格的编码器-预测器对,在掩码位置匹配软GMM后验,GMM在阶段1(冻结,基于MFCC特征)和阶段2(基于EMA编码器特征在线更新)中拟合。唯一的训练信号是掩码位置的KL散度;预训练后丢弃预测器、聚类头和GMM。
图1: S-JEPA整体架构,Encoder + Predictor + Cluster Head,用GMM软目标做自监督训练。

核心创新:用软目标捕捉语音边界的模糊性

HuBERT 的硬标签强迫每个帧只能属于一个 cluster,但语音信号里有很多过渡区域——比如一个音素从 /p/ 过渡到 /a/,这中间的声音到底像哪个?硬聚类会强行给它打上一个标签,丢掉宝贵的模糊信息。S-JEPA 的做法是用一个 K 分量的对角线协方差 GMM,对每个帧计算它属于每个分量的后验概率(即软后验),这样边界帧的后验会在多个分量之间分配概率,而不是被拍死在那个“最强”分量上。这种软目标通过 KL 散度让预测器去匹配 GMM 后验,训练起来也更稳定。
具体来说,S-JEPA 的训练目标可以写成:
L = KL( qt || pt ),其中 qt 是 GMM 在帧 t 上的后验分布,pt 是预测器输出的 softmax 分布。
这个损失只在被遮罩的位置计算,当然在两个阶段的细节上略有区别(第一阶段还在可见位置也加损失)。预测器输出的分布和 GMM 后验都是对同一个 K 分量做分布,所以 KL 散度完全适用。这样一来,边界帧的模糊性就被保留下来,而且整个目标都是软性的,没有任何 argmax 操作。
插图

两阶段连续训练:在线更新GMM,省去离线重聚类成本

HuBERT 的“两阶段”需要先训练一轮,然后停下来用 k-means 重聚类全部数据,再训练第二轮。S-JEPA 把重聚类变成了在线更新,让训练始终不中断。两阶段分别为:

阶段1(Phase 1):用 MFCC 特征(39维,包括13个倒谱系数加一阶二阶差分)拟合一个 K=100 的 GMM,然后冻结。训练时对每个 utterance 的 MFCC 算后验,作为 KL 散度的目标。这一阶段损失同时加在可见和遮罩位置,并带有去噪增强。

阶段2(Phase 2):EMA(指数移动平均)编码器开始工作,初始化自阶段1的编码器。GMM 换成 K=500,输入不再是 MFCC,而是 EMA 编码器某个层的特征。这个 GMM 不再冻结,而是每隔一个 minibatch 用 EMA 编码器的输出更新其参数(高斯混合的均值、方差通过 EM 算法的变体在线更新)。训练损失在阶段2后期只加在遮罩位置,去噪增强关闭。

除了在线更新,还有两个亮点:自适应层选择周期性切换EMA衰减。自适应层选择是用“有效秩”(effective rank)作为代理——有效秩衡量一个层输出的特征表示的丰富程度(奇异值分布越均匀,有效秩越高)。在阶段2,每隔一定步数计算每层 EMA 编码器特征的有效秩,选择有效秩最高的层作为 GMM 的输入层。论文发现,阶段2开始时有效秩最高的是第2层,后来转为第4层,自适应切换避免了人工固定层的 suboptimal。
周期性切换EMA衰减是为了让GMM既能看到特征的最新变化(快倒时 EMA 快速跟踪),又能稳定下来让预测器好好学习(慢倒时 EMA 几乎静止)。论文在两个值之间按固定步长翻转:先快后慢再快……这样在时间上把“更新 GMM”和“优化预测器”两个需求解耦。
(a) Phase 1. 第2层成为最具表达力的层,激励其作为Phase 2初始GMM输入层的选择。 (b) Phase 2. 在在线GMM下,第4层从第一个测量点开始就占据主导,且L4-L2差距扩大。
图2: 各层有效秩在整个训练过程中的变化,展示了自适应层选择的效果。

效果实证:以小博大,在更少参数下匹敌甚至超越HuBERT

S-JEPA 在 Superb 评测的三个任务上进行了冻结编码器评估:ASR(词错误率 WER,LibriSpeech test-clean)、情感识别(ER,准确率)、槽填充(SF,F1和CER)。训练数据是 LibriLight + Granary 英语子集,约83,000小时。编码器只有6层 transformer,51.8M参数,瞄准的是低于90M参数的方法。
表1: SUPERB基准上的冻结编码器评估。ASR使用贪婪CTC解码。粗体表示sub-90M块内最佳。
表1展示了 S-JEPA 与所有12种参数低于90M的方法的对比:WER 最低(12.10%,比第二好的 DeCoAR 2.0 的13.02%低近1个点),情感识别准确率最高(64.83%),槽填充F1与 DeCoAR 2.0 打平(83.05 vs 83.28),而参数只有 DeCoAR 2.0 的58%(51.8M vs 89.8M)。更惊艳的是,S-JEPA 在情感识别上基本匹配了94.7M参数的 HuBERT-Base(64.83% vs 64.92%),而参数只有它的55%。这些结果都是在单次训练、没有教师蒸馏、没有离线重聚类的情况下取得的。
图3: S-JEPA在SUPERB上推动了低于90M参数的帕累托前沿。参数数量 vs. (a) ASR WER和(b)情感识别准确率。虚线:所有SSL方法的帕累托前沿。阴影区域:S-JEPA在51.8M–90M范围内对先前最好的改进。
图3更直观地展示了帕累托前沿:S-JEPA 在 ASR 和 ER 两项上都处于所有 sub-90M 方法的右上角,独占了一个新的最优区域。
另外,论文还在 LibriSpeech 四个探测任务上比较了 S-JEPA、HuBERT、WavLM 的冻结特征。下表的线性探测结果显示,S-JEPA 在说话人识别、性别分类和章节识别上领先,其中章节识别差距明显(93.2% vs HuBERT 88.2%)。音素分类上 S-JEPA 线性探测不如 WavLM,但用 MLP 探测后反超(88.0% vs 87.5%),说明 S-JEPA 的特征包含了更多非线性可恢复的语音信息。
表2: S-JEPA在说话人、性别和章节识别上领先,在音素分类上从非线性探测中获益更多。
表2:探测准确率。章节识别是最有区分度的比较:同一本书的章节通常由同一说话人朗读,因此线索是细微的韵律和录音差异而非说话人身份。
插图

深入分析:预测器熵的双峰分布,验证软目标的有效性

软目标到底有没有保留边界模糊性?论文做了一个很漂亮的分析:取出已经训练好的 S-JEPA 的预测器,在约153K个 held-out 帧上计算每个帧的预测熵 Ht = - Σ pt,k log2 pt,k(单位比特)。如果预测器对所有帧都自信满满,熵会集中在 0 附近;如果软目标退化为均匀分布,熵会接近 log2500 ≈ 9。实际结果是——双峰分布!
(b) 约153K帧(N=500 dev-clean utterance)上的每帧预测器熵。参考竖线在0.5、1和2比特处。
图4(b)显示:多数帧的熵低于 0.3 比特(高置信),但有一个清晰的次峰接近 1 比特——这正是完美二分类(两个 cluster 各 50%)的熵。36.6% 的帧熵超过 1 比特,意味着超过三分之一的帧处于一个“两个类别势均力敌”的模糊状态。如果换成硬标签,这些帧会被迫选一个,丢掉一半的信息。S-JEPA 的软目标则原封不动地保留了这种不确定性。
论文还展示了单个 utterance 上的逐帧 top-3 后验概率,直观地看到在单词边界附近,排名第一的后验概率从接近 1.0 掉到 0.3-0.45,排名第二的则窜上来形成竞争。这直接可视化了软目标的行为——不是简单的熵很大,而是结构化的两路竞争,正是边界模糊性的表现。

总结与展望:S-JEPA的未来潜力与局限

S-JEPA 用软聚类锚点、在线 GMM 更新和 JEPA 架构,彻底告别了硬聚类和离线重聚类的繁琐,在参数效率和训练简便性上取得了突破。论文也坦言几个局限:训练和评测仅限英语,未测试声调语言和低资源场景;周期性切换 EMA 衰减缺少更理论化的替代方案;GMM 的在线更新和自适应层选择虽然在本文设置中有效,但缺乏严谨的理论保证。不过,就凭它用一半参数追平 HuBERT-Base 的表现,以及那美丽的双峰熵分布,这篇工作已经足够让人印象深了。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1: 什么是什么JEPA?和普通预测模型有什么区别? JEPA 全称 Joint-Embedding Predictive Architecture,联合嵌入预测架构。它的核心思想是用一个编码器把输入和遮掩后的特征都映射到抽象空间,然后用一个预测器去预测被遮掩区域在抽象空间中的表示,而不是直接预测像素或语音波形。S-JEPA 在这个框架下,把预测目标从离散标量 ID 换成了 GMM 的软后验分布,本质上还是预测“表示”,只是这个表示是类别分布形式。

Q2: 为什么 GMM 后验是软的?与k-means的硬标签比好在哪里? k-means 硬标签给每个帧分配唯一的 cluster ID(argmax),但语音边界帧可能同时具有多个音素特征。GMM 后验是每个帧属于每个分量的概率,可以同时给多个分量非零概率,比如 0.4/0.6,从而保留模糊信息。论文的实验证明这种软目标使预测器在边界帧上产生双峰熵分布,说明模型确实学到了不确定性,而不是被强迫做出确定选择。

Q3: S-JEPA 的在线GMM更新与离线重聚类相比,计算量怎样? 离线重聚类需要在整个训练语料上跑一遍 k-means(比如 HuBERT 第二阶段要先在全部数据上运行一次 k-means 得到新标签,然后才能开始训练),这一步非常耗时且打断训练。S-JEPA 的在线更新在每个 minibatch 内完成 GMM 的 E-M 步骤(用 EMA 编码器的输出计算充分统计量并指数移动平均),不需要额外的全数据扫描,计算量基本可忽略,因此训练可以连续进行,总训练时间更短。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

将软聚类(GMM)引入自监督语音学习的 masked prediction 任务,并用在线更新替代离线重聚类,整体思路清晰,虽然不是完全颠覆式创新,但在 speech SSL 领域是一个干净且有效的改进。

实验合理度:★★★★✰

采用标准 SUPERB 协议,对比方法覆盖全面(包括同样低参数的 DistilHuBERT、DeCoAR 2.0 等),对比公平;额外做了探测实验和熵分析,论证充分。但缺少对硬标签的公平对照实验(论文中坦诚这是一个局限,留给未来工作)。

学术研究价值:★★★★☆

提出了一个可复现且高效的软目标训练范式,双峰熵的发现为理解语音 SSL 的目标性质提供了新视角,对后续研究有启发价值。

稳定性:★★★✰✰

冻结编码器评估下效果稳定,但论文未详细讨论训练过程中的波动或对超参数(如 GMM 初始化的 K 值、EMA 衰减切换频率)的敏感性。

适应性以及泛化能力:★★★✰✰

仅在英文语音上验证,未测试声调语言、重口音、噪声环境或非语音音频;论文也坦诚这是未来工作。

硬件需求及成本:★★★★✰

51.8M 参数的编码器训练成本中等,单次训练无需额外重聚类步骤,与 HuBERT 相比训练时间更短,适合有中等算力的团队。

复现难度:★★★★✰

论文提供了完整可运行代码(GitHub 链接:https://github.com/gioannides/s-jepa),训练超参数附录提供,在 speech SSL 领域属于较易复现的工作。

产品化成熟度:★★★✰✰

离线推理时仅需编码器(51.8M),在普通 GPU 或高配 CPU 上可以运行,但 WER 仍高于 Base-class 模型(如 HuBERT-Base 6.42% vs 12.10%),适用于对参数数量敏感但允许较高 WER 的场景,如端侧设备初步语音理解。

可能的问题:

缺少与相同计算量下硬标签 HuBERT 的 ablation(论文坦诚有待补上);EMA 衰减切换策略稍显临时;未在更多样化数据集上验证。

主要参考文献

[1] HuBERT: Hsu et al., HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units, IEEE/ACM Trans. ASLP, 2021.
[2] JEPA: Assran et al., Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture, CVPR 2023.
[3] WavLM: Chen et al., WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing, IEEE JSTSP, 2022.
[4] SUPERB: Yang et al., SUPERB: Speech Processing Universal PERformance Benchmark, Interspeech 2021.
[5] DistilHuBERT: Chang et al., DistilHuBERT: Speech Representation Learning by Layerwise Distillation of Hidden-Unit BERT, ICASSP 2022.
[6] 代码开源: https://github.com/gioannides/s-jepa

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
告别硬聚类,拥抱软目标,S-JEPA的“柔”性智慧令人拍案叫绝!想和龙哥一起探索更多像S-JEPA这样巧妙的AI前沿技术吗?快来加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 语音+上海+CMU+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。