← 返回 PaperDaily 视觉与图像

六种音频编码器正面PK!澳洲高校首次系统性评测:从分类到推荐,谁才是音乐推荐的最优解?

分类任务的学霸,放到推荐系统里可能就成了学渣,这事儿你敢信?澳洲高校团队把六种主流音频编码器拉到KNN、SASRec和TIGER三种推荐范式下正面对决,还顺带拆解了语义ID的量化玄机。音频推荐选型,看这篇就够了。

六种音频编码器正面PK!澳洲高校首次系统性评测:从分类到推荐,谁才是音乐推荐的最优解?
原论文信息如下:
论文标题:
从分类到推荐:音频嵌入模型在基于内容音乐推荐中的实证分析
发表日期:
2026年08月
发表单位:
新南威尔士大学、麦考瑞大学
原文链接:
https://arxiv.org/pdf/2608.06928v2.pdf
你有没有过这样的体验:打开音乐App,想找点新歌听听,结果推荐列表里永远是你听腻的那几首?不是你口味刁钻,而是推荐系统可能压根没真正"听懂"你喜欢的歌。传统协同过滤靠的是"和你相似的人听了什么",可一旦遇到一首全新发布、还没人听过的歌,它就彻底抓瞎了。这时候,音频内容本身就成了救命稻草——毕竟,歌好不好听,音色、节奏、编曲就摆在那里,声音不会说谎。
问题来了:现在大把的预训练音频模型(什么Wav2Vec、HuBERT、MERT、CLAP),在分类、识别这类任务上个个都是好手。但这些模型学到的声音表示,放到推荐系统里就一定好用吗?答案还真不一定。新南威尔士大学和麦考瑞大学的研究团队就把这事儿彻底捋了一遍,做了一次横跨三大推荐范式的系统性评测,结论相当有意思。

从分类到推荐:音频嵌入模型在音乐推荐中的全面评测

先说说研究动机。音频嵌入模型,说白了就是把一段声音波形压成一个向量。这个向量得能代表声音的特点——音色、节奏、和声、配器,甚至更高层的语义。有了这个向量,下游任务就能拿来干活了。但问题在于,这些模型在训练时的目标函数五花八门:有的是做掩码预测(像Wav2Vec 2.0、HuBERT),有的是做对比学习(像Music2Vec),还有的是做音频-文本对齐(像CLAP)。这些目标都是为了"理解音频内容"而设计的,但理解音频内容跟"猜你喜欢听什么"是两码事。就好比一个音乐学院的教授,你让他分析一首歌的和声进行、曲式结构,他头头是道;但你要是问他"你推荐我下一首听什么",他可能还不如你那个天天刷歌单的朋友靠谱。
道理其实很简单:推荐是关系型的、依赖行为的。两首歌即使音色、风格都很接近,但一个人可能就只喜欢其中一首——因为它是某个歌手的,或者因为它在某个特别的时刻陪过他。反过来,两首风格迥异的歌,也可能因为出现在同一个歌单里而被同一个人喜欢。所以,在分类任务上表现好的音频嵌入,其向量空间的结构未必适合推荐。
之前有人做过类似的评测(Tamm和Aljanaki在2026年的工作),但他们只覆盖了传统推荐和序列推荐,没碰近两年特别火的生成式推荐(Gen-Rec)。生成式推荐不一样,它不直接打分排序,而是把物品表示成离散的ID序列,然后用Transformer自回归地"生成"下一个要推荐的物品。这中间多了一道量化步骤,音频嵌入要先被压缩成离散码本,再喂给生成模型。那这量化过程会不会把有用的信息丢掉?不同音频嵌入在量化之后谁更抗造?这些问题,之前没人系统研究过。

三大推荐范式下的音频嵌入表现:谁才是真正的赢家?

研究团队挑了六种有代表性的音频编码器,横跨语音、音乐、通用音频三大领域,预训练目标也从掩码预测到师生蒸馏再到跨模态对齐,覆盖面相当全。评测的推荐系统则是三种典型范式:传统的基于内容的最近邻(KNN)、序列推荐(SASRec)和生成式推荐(TIGER)。两种音乐数据集:LFM1b的子集和Music4All-Onion的子集,各取了约5000首歌曲。所有模型都用冻结的预训练权重提取特征,然后喂给不同推荐系统,保证公平。
这里需要先说明一下三种接口的差异,这是理解实验结果的关键。KNN是最简单的:把所有用户听过的歌的嵌入向量求平均,得到用户向量,然后跟每首歌的嵌入算余弦相似度,排序取前50。整个过程没有任何训练,纯粹看预训练嵌入的"原生态"几何结构好不好用。SASRec则是用交互序列训练的,物品嵌入初始化成音频向量,但之后会跟着推荐任务一起更新——相当于给了模型一个"改造"原始嵌入的机会。TIGER最特殊,它先把连续音频向量用残差量化(RVQ)转成离散的语义ID序列,再用Transformer自回归地生成下一个物品的ID。这里的音频嵌入要先过一道量化关卡,信息会有损失,所以对嵌入质量的要求又不一样。
六种音频编码器的标准化配置表
表1:两个数据集上使用的六种音频编码器标准化配置。最终所有曲目向量都做了L2行归一化。
结果相当有戏剧性。在KNN这种"裸用"场景下,CLAP-Music(音乐领域微调的CLAP)一枝独秀,Recall@50在LFM上达到0.0393,比最差的Wav2Vec 2.0(0.0200)快翻了一倍。这其实不意外,因为CLAP是用音频-文本对比学习训练的,它的嵌入空间天然更接近"语义相似",而语义相似跟用户偏好有更强的相关性。相比之下,Wav2Vec 2.0和HuBERT这些语音模型学的是声学结构,跟音乐偏好的关系就比较远了。
但到了SASRec这里,画风突变。所有嵌入的Recall@50都冲到了0.42以上,差距缩到很小——最好的CLAP-G是0.4375,最差的HuBERT也有0.4251。这说明只要有足够的交互数据,SASRec完全有能力把初始嵌入"掰"到自己需要的方向。预训练嵌入再差,也能被交互信号救回来一部分。这不就是那句老话吗:天赋不够,努力来凑。放到推荐系统里,预训练嵌入是天赋,交互训练就是努力。
三种推荐系统下六种音频嵌入的性能对比表
表2:K=50时不同音频嵌入和推荐系统下的推荐性能。结果为五次随机种子的均值±标准差。加粗和带下划线分别表示最佳和次佳结果。
TIGER的情况就比较微妙了。CLAP-Music在LFM上依然是最强的(Recall@50=0.3678),CLAP-G在Onion上略胜(0.3524对0.3530,其实很接近)。但最让人惊讶的是,Wav2Vec 2.0这种在KNN里垫底的嵌入,在TIGER下也能跑到0.30以上。不过TIGER整体的方差明显比SASRec大,同一嵌入不同随机种子跑出来能差好几个点,这说明生成式推荐对初始化和训练过程更敏感,稳定性是个需要关注的问题。
如果把所有36项对比(6嵌入×2数据集×3指标)放在一起数一数,SASRec拿了34个第一,TIGER只在2项上超过了SASRec(具体是Wav2Vec2在LFM上的Recall@50和MRR@50)。这说明在交互数据足够多的情况下,序列推荐依然是目前最稳的范式。数据的威力,确实比模型的精巧架构大多了。

语义ID设计的关键:宽度与深度的博弈

如果说前面是音频嵌入的"选秀",那后面这部分就是"造ID"的手艺活了。生成式推荐的核心是把物品变成一串离散ID,这靠的是残差向量量化(RVQ)。RVQ的原理不复杂:先用第一个码本找一个最接近的码字,剩下的残差交给第二个码本,依此类推。码本里有多少个码字叫宽度(W),串几个码本叫深度(D)。宽度决定每一层的分叉数,深度决定ID的长度和精细度。论文做了三组干预实验:固定深度改宽度(W从64到4096)、固定宽度改深度(D从1到12)、还有固定一套量化器但只用前1个/前2个/全部3层码本的"前缀"实验。
结果非常明确:宽度比深度重要得多。在36项对比中,W=1024或4096拿下了27项最佳。但深度这边就惨了,D=3反而是最优的,在30项对比里排第一。更刺激的是,深度增加到6或12时,很多配置直接"崩了"——性能掉到0.05以下,基本等于随机猜了。看下图最直观:宽深扫描的图中,D=6和D=12的很多点都沉到图底部的失败区了,而宽度扫描的曲线相对平滑,即使W=4096也能保持稳定。
LFM-AM-4996数据集上语义ID容量与推荐性能的关系图
图1(a):LFM-AM-4996数据集上,语义ID在宽度(D=3)和深度(W=4096)扫描下的容量表现。纵轴范围限制在[0.15, 0.30]以比较未崩溃的运行。彩色×标记表示NDCG@50<0.15的异常运行,指示失败位置而非截断值。不可用的D=1配置已省略。
Onion-Dedup-5000数据集上语义ID容量与推荐性能的关系图
图1(b):Onion-Dedup-5000数据集上,语义ID在宽度(D=3)和深度(W=4096)扫描下的容量表现。纵轴范围限制在[0.15, 0.30]以比较未崩溃的运行。彩色×标记表示NDCG@50<0.15的异常运行,指示失败位置而非截断值。不可用的D=1配置已省略。
为啥更深反而更差?原因在于:后几层RVQ主要是在补全重构细节,这些细节对于区分音色、音高可能有帮助,但对推荐来说——用户真的在乎第7层残差是+0.03还是-0.02吗?大概率不在乎。多出来的这些码反而增加了序列长度,让生成模型要预测的token变多,解码复杂度也上去了。一句话总结就是:你为了让上帝看清楚翅膀上的羽毛,结果把上帝累趴在半路上了。
前缀实验进一步印证了这一点。只用前两个码本(P12)在27项对比中拿了第一,甚至比全部三个码本(P123)在每个对比中都更好。这说明推荐需要的关键信息在前两层就基本齐了,第三层不但帮不上忙,反而添乱。有一个直观的可视化能说明这个问题——把原始嵌入和不同层级重构的嵌入用PCA降到二维再用t-SNE画出来,可以看到P1还比较模糊,P12已经跟原始分布相当接近了,而P123并没有明显的进一步改善。
残差量化重构的定性几何可视化图
图2:残差量化器累积重构的定性几何可视化(代表性前缀来源:Onion-Dedup-5000,CLAP-Music,历史C4,W=256,D=3)。从左到右依次为:原始L2归一化音频嵌入、第一个码本(P1)重构、前两个码本(P12)重构、全部三个码本(P123)重构。所有面板使用相同的1000个均匀采样物品(种子

预训练目标与数据的影响:对齐优于预测,音乐域优于通用域

把六种编码器放在一起横向比较,会发现两条非常清晰的规律。第一条规律关于预训练目标:基于音频-文本对齐的CLAP系列在KNN和TIGER下显著优于基于掩码预测或对比预测的Wav2Vec 2.0、HuBERT、Music2Vec和MERT。第二条规律关于预训练数据:在音乐数据上训练的模型(Music2Vec、MERT、CLAP-Music)整体优于在语音或通用音频上训练的模型。这两条规律独立存在,但在CLAP-Music这个模型上实现了交汇——它既用了对齐目标,又用了音乐域数据,结果就是六种嵌入里综合表现最强的那个。
不过,这两条规律都有一个重要的前提限定:在SASRec下它们基本不成立。因为SASRec的交互信号训练会把所有嵌入往同一个任务相关的方向拉,预训练阶段带来的差异被大幅稀释。这里的启示是:如果你手里有海量的用户行为数据,那么预训练嵌入的选择空间其实很大,随便拿一个像样的音频模型都能做出不错的推荐效果;但如果你面临的是冷启动场景——没有足够交互数据——那么选择一个对齐目标训练的音乐域嵌入就至关重要了。
论文还观察到一个有趣的细节:在SASRec的LFM实验中,CLAP-G的Recall@50(0.4375)比CLAP-Music(0.4311)还要略高。这说明通用域的CLAP在具备足够交互适配能力时,并不输给音乐域版本。数据的泛化性在任务适配中被成功激活了。但在KNN的Onion实验中,CLAP-Music(0.0467)对CLAP-G(0.0285)的优势又非常显著。所以选择哪个嵌入,本质上取决于你的下游管线能提供多少任务监督。

实践指南:如何为音乐推荐系统选择音频嵌入?

把论文的核心发现翻译成落地建议,大致可以归纳为三条。第一条:如果推荐系统主要依赖内容相似度(比如冷启动场景、新歌探索),优先选择CLAP-Music或CLAP-G这类基于音频-文本对齐的嵌入,并且确保预训练数据包含音乐域内容。第二条:如果推荐系统可以拿到足够的用户交互数据进行端到端训练(比如SASRec这类序列模型),那么嵌入选择不必过度纠结,通用音频模型甚至语音模型也能达到接近的效果——把精力放在交互建模上回报更高。第三条:如果走生成式推荐路线,语义ID的码本宽度建议设到1024以上,量化深度控制在2到3层即可,千万不要盲目加深,否则容易带来训练不稳定甚至性能崩溃的风险。
论文的实验设置本身也值得留意。LFM1b和Music4All-Onion两个数据集各取约5000首歌曲子集,LFM子集有7987个用户、190万条交互,Onion子集有8855个用户、197万条交互。评估采用留一法(leave-one-out),用最后一次交互做测试、倒数第二次做验证。三个指标Recall@50、NDCG@50和MRR@50都是推荐领域的标准评估方式。音频特征提取方面,Wav2Vec 2.0、HuBERT、Music2Vec统一使用30秒16kHz音频,MERT使用5秒24kHz音频,CLAP使用48kHz音频,各有各的最佳实践配置。
最后聊一点方法论上的启示。这篇论文给研究社区提供了一个非常有价值的评测范式:不要只在一个推荐模型上比较嵌入,而要在多个由浅入深的接口上对比,从而把"嵌入本身的表示质量"和"下游系统的适应能力"两个因素解耦开来。KNN测的是嵌入的"原生质量",SASRec测的是"可塑性",TIGER测的是"量化鲁棒性"。这种三层评测框架,未来完全可以迁移到其他多媒体推荐场景,比如视频推荐、播客推荐,甚至是多模态商品推荐。
当然,这项研究也有其边界。约5000首歌曲的目录规模相对较小,真实的工业级推荐系统面对的可能是数千万首歌曲的候选池,语义ID的碰撞问题和解码复杂度在更大规模下会变得更加严峻。此外,论文聚焦于音频内容特征,没有考虑歌词、封面、元数据等同样重要的辅助信号。这些都是未来值得补全的方向。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?新南威尔士大学等机构首次系统评测六种预训练音频编码器在三大音乐推荐范式中的表现。结果显示,CLAP类对齐模型在直接使用时优势明显,交互训练可缩小差距;语义ID设计上,增加码本宽度优于增加量化深度。
这篇工作最值得看的点是什么?CLAP-Music在18个评估设置中13个取得最佳性能,SASRec在36个比较中34个排名第一,音乐域预训练嵌入在54个比较中45个优于通用音频或语音域嵌入。
这篇工作的边界或风险在哪里?优点:系统性地评估了多种音频嵌入在三种推荐范式中的表现,填补了生成式推荐中音频嵌入评估的空白;深入分析了RVQ语义ID设计对生成式推荐的影响,提供了实用的设计指导;实验设计全面,覆盖多种嵌入模型和推荐系统。缺点:数据集规模较小(约5000曲目),可能无法完全代表大规模真实场景;仅使用离线指标,未考虑用户满意度等在线指标;未覆盖艺术家、流派、流行度等其他内容信息。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

系统评估六种预训练音频编码器在三种推荐范式(基于内容、序列、生成式)中的表现,并深入分析RVQ语义ID的宽度、深度及前缀长度对生成式推荐性能的影响。

实验合理度:★★★★☆

Recall@50, NDCG@50, MRR@50

学术研究价值:★★★★☆

系统评估六种预训练音频编码器在三种推荐范式(基于内容、序列、生成式)中的表现,并深入分析RVQ语义ID的宽度、深度及前缀长度对生成式推荐性能的影响;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(本文为实证研究,未报告具体计算量)

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:数据集规模较小(约5000曲目),可能无法完全代表大规模真实场景;仅使用离线指标,未考虑用户满意度等在线指标;

主要参考文献

[1] Li Q, Lou H, Huang C, et al. From Classification to Recommendation: Empirical Analysis of Audio Embedding Models Application for Content-Based Music Recommendation[J]. arXiv preprint arXiv:2608.06928v2, 2026.
[2] Baevski A, Zhou Y, Mohamed A, et al. wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations[C]. NeurIPS 2020.
[3] Hsu W N, Bolte B, Tsai Y H H, et al. HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2021.
[4] Li Y, Yuan R, Zhang G, et al. MERT: Acoustic Music Understanding Model with Large-Scale Self-Supervised Training[J]. ICLR 2024.
[5] Elizalde B, Deshmukh S, Al Ismail M, et al. CLAP: Learning Audio Concepts from Natural Language Supervision[C]. ICASSP 2023.
[6] Kang W C, McAuley J. Self-Attentive Sequential Recommendation[C]. ICDM 2018.
[7] Rajput S, Mehta N, Singh A, et al. Recommender Systems with Generative Retrieval[C]. NeurIPS 2023.
[8] Zeghidour N, Luebs A, Omran A, et al. SoundStream: An End-to-End Neural Audio Codec[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2021.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
听歌识曲哪家强?音频编码谁称王?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 音频处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
🎵 爱研究的你,快来一起聊聊音频和推荐的下一站~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。