← 返回 PaperDaily 大模型与智能体

索尼AI联手UPF:旋律相似性人类vs机器谁说了算?

AI音乐抄袭怎么判?机器说了不算,人耳朵说了也不算?这篇论文拉来83位专业音乐人,花两个月时间打造了含1105次感知评估的MATCHA数据集,把旋律、和声、节奏、人声和音色五个维度拆开揉碎,第一次系统度量“人类听觉判断”和“计算相似度指标”之间的对齐程度,给AI音乐生成的可信评估立了一把新尺子。

索尼AI联手UPF:旋律相似性人类vs机器谁说了算?
原论文信息如下:
论文标题:
On the Human and Computer Alignment of Attribute-Based Music Matches
发表日期:
2026年09月

发表单位:
庞培法布拉大学音乐技术组、索尼AI、欧洲委员会联合研究中心

原文链接:
https://arxiv.org/pdf/2609.00987v1.pdf

开源代码链接:
https://github.com/roserbatlleroca/matcha

AI生成音乐越来越逼真,如何判断AI歌曲是否抄袭成了难题。音乐相似性见仁见智,旋律、和声、节奏、音色等各有关注点。计算机音乐信息检索领域用相似度指标度量音乐间的相似性,但这些指标与人类专家判断是否一致仍未解决。
庞培法布拉大学音乐技术组联合索尼AI和欧洲委员会联合研究中心发布了一项研究,邀请83位专业音乐人设计300个音乐三元组对比任务,产出1105次属性级别感知评估,构建MATCHA数据集。实验揭示人类专家在拆开音乐属性后能达成高度一致,而AI计算指标与人类听觉对齐程度仅“部分及格”。

音乐抄袭检测:人类耳朵与AI算法的对决

生成式AI在音乐领域发展迅速,AI能产出逼真作品,但生成模型可能记忆并复刻训练数据片段。AI生成旋律与受版权保护歌曲相似是否算抄袭?作者署名和版权费如何处理?
研究者尝试用计算相似度指标检测AI音乐“复制粘贴”,如音频指纹比对、音频向量余弦相似度、封面歌识别算法等。这些方法在各自任务上表现不错,但未正面回答计算指标与人类专家判断能否对齐。
音乐相似性不是单一维度概念,两首歌可能旋律相似但和声不同,节奏相同但音色差异大。直接问受试者“像不像”答案五花八门,但拆开问“旋律像不像”“节奏像不像”情况会好些。本文核心思路是分别量旋律、和声、节奏、人声、音色五个维度。

三元组实验设计:如何让专家"对号入座"

论文设计了一个感知实验,采用三元组强制选择范式:每个测试用例包含一个参考音频片段和两个待比较片段A和B,参与者针对某个音乐属性判断A和B中哪个更匹配。提问使用“匹配”而非“抄袭”等敏感词。
实验包含300个三元组,150个来自人类创作音乐,150个来自AI生成音乐。人类创作部分细分为SMP数据集和Discogs-VI数据集,AI生成部分分为Stable Audio Open模型生成和媒体报道中AI音乐疑似抄袭案例。
人类创作音乐三元组中,干扰项经过精心设计,28%来自同一艺术家另一首歌,22%来自同一录音另一段落,30%来自风格相似的另一首歌,8%随机选择。这样设计避免实验变成简单找茬游戏。
AI生成三元组构建也花了心思。对于“较相似”样本,使用DDIM逆推技术从参考音频反推出初始噪声向量,再在采样过程中引入随机性,生成音频保留参考样本旋律和结构骨架。对于“较不相似”样本,使用Music Flamingo模型生成文本描述,再用QWEN 3.5进行摘要压缩,最后用文本提示词生成音频。
数据采集过程是个不小的人力工程。实验通过定制网页远程进行,持续约两个月,共184人参与,最终保留83位有效参与者。参与者中超过63%是受过专业训练的音乐从业者或专家级音乐专业人士。每个三元组至少由3位参与者独立评估,平均每个三元组获得3.7次独立评估。
图3:任务说明页面中提供的示例用例,附带答案及推理过程
图3:任务说明页面中提供的示例用例,附带答案及推理过程
图4:三元组强制选择任务的显示界面,测试用户尚未收听三个样本时的状态(此时响应按钮被停用),同时总得分为零;图5:参与者在加入实验前需要接受的知情同意书,清楚说明了纳入/排除标准
图4:三元组强制选择任务的显示界面(未收听状态);图5:参与者知情同意书

MATCHA数据集:300个音乐三元组的诞生

经过两个月的数据采集和清洗,研究者发布了MATCHA数据集,全称Musical Attribute-based Triplet Comparison with Human Annotations。规模虽不大,但对于音乐感知研究来说已相当可观,尤其考虑到标注者的专业水准和实验设计的严谨程度。
数据集构成可用下表概括。来自SMP数据集的75个三元组和Discogs-VI数据集的75个三元组构成人类创作音乐部分;Stable Audio Open生成的120个三元组加上媒体文章的30个真实疑似抄袭案例构成AI生成音乐部分。HP、HV和AM子集绝大多数样本含人声,AS子集为纯器乐。
*表格超出部分左右可以滑动 T<sub>a</sub>bl<sub>e</sub> 1<sub>:</sub> Sti<sub>mu</sub>li di<sub>s</sub>t<sub>r</sub>ib<sub>u</sub>ti<sub>on across</sub> dif<sub>eren</sub>t <sub>re</sub>f<sub>erence</sub> sources, considerin<sub>g</sub> case ori<sub>g</sub>in, section (Sec.), source name, <sub>num</sub>b<sub>er o</sub>f <sub>cases, num</sub>b<sub>er o</sub>f <sub>cases con</sub>t<sub>a</sub>i<sub>n</sub>i<sub>ng voca</sub>l<sub>s, an</sub>d <sub>overa</sub>ll <sub>percen</sub>t<sub>age o</sub>f <sub>cases.</sub>
T<sub>a</sub>bl<sub>e</sub> 1<sub>:</sub> Sti<sub>mu</sub>li di<sub>s</sub>t<sub>r</sub>ib<sub>u</sub>ti<sub>on across</sub> dif<sub>eren</sub>t <sub>re</sub>f<sub>erence</sub> sources, considerin<sub>g</sub> case ori<sub>g</sub>in, section (Sec.), source name, <sub>num</sub>b<sub>er o</sub>f <sub>cases, num</sub>b<sub>er o</sub>f <sub>cases con</sub>t<sub>a</sub>i<sub>n</sub>i<sub>ng voca</sub>l<sub>s, an</sub>d <sub>overa</sub>ll <sub>percen</sub>t<sub>age o</sub>f <sub>cases.</sub>

表1:不同参考来源的刺激分布情况,包括案例来源类别、子集名称、来源名称、案例数量、含人声案例数及总体案例占比
数据集首次从属性层面为音乐相似性判断提供了大规模人类感知标注。过去研究要么只看整体相似度,要么只关注单一属性,而MATCHA同时覆盖旋律、和声、节奏、人声和音色五个维度,每个维度都有足够多独立标注。数据集发布意味着任何新的计算相似度指标都可在MATCHA上检验与人类听觉判断的对齐程度。

人类听觉的一致性:比想象中好得多

过去研究认为人类对音乐相似性判断主观性强,一致性低。但本文从属性层面切入,得出专家能达成高一致性结论。
实验采用平均一致性百分比和Fleiss' κ系数衡量标注者间一致性。人类创作音乐三元组中,无论来自剽窃检测数据集还是翻唱版本数据集,标注者间一致性可观。旋律维度平均一致性超过85%,Fleiss' κ系数约0.60,κ值在0.60以上被认为是“实质性一致”。和声和音色维度分歧较大,一致性在75%左右,但仍高于整体音乐相似度研究表现。
图1:按音乐属性和刺激类别统计的标注者间一致性,上方为平均一致性百分比,下方为Fleiss' κ系数。刺激类别包括:人类剽窃检测数据(HP)、人类翻唱版本数据(HV)、AI Stable Audio生成数据(AS)和AI媒体文章案例数据(AM)。AS案例为纯器乐,未标注人声维度。
图1:按音乐属性和刺激类别统计的标注者间一致性(上方为平均一致性百分比,下方为Fleiss' κ系数)
计算指标大比拼:谁最懂人类听觉?
解决了"人类专家能否达成一致"后,文章进入另一个环节:计算指标与人类专家判断是否对齐?实验设计直接——把每道三元组题目的人类标注结果聚合成"人类标准答案",再用计算算法独立跑一遍,给两个比较样本分别算出与参考样本的相似度分数,最后做相关性分析。
每道题有一个参考样本R和两个比较样本A、B,多位专家独立判断"A更像R"还是"B更像R"。研究者把每个样本的专家回答汇总成一个分数,计算方式如下:
人类响应的聚合公式
公式:s = (nB - nA) / (nA + nB + nN)
其中nA表示选择"A与参考更匹配"的专家人数,nB表示选择"B与参考更匹配"的专家人数,nN表示选择"两者都不匹配"的专家人数。分数范围在-1到1之间:接近1说明专家认为B更像参考样本,接近-1说明专家认为A更像参考样本,接近0说明专家意见分裂或两者都不像。s的绝对值大小反映专家意见凝聚程度——绝对值越大,说明人类判断越明确。
有了每个人类题目的"s值"后,再用同样三元组跑计算指标,看计算指标给A、B打的相似度分数能否预测s值的正负和大小。采用的相关性指标是Kendall's τ相关系数,衡量两组排序一致性程度。τ值越接近1,说明计算指标排序与人类专家判断越同步。
本文对标的计算指标来自MiRA框架,即音乐复制评估框架(Music Replication Assessment)。框架核心思路是不依赖单一指标,用四个互补相似度度量刻画音乐复制程度。
第一个指标是CoverID,即封面歌曲识别算法(Cover Song Identification)。算法识别翻唱版本,提取音乐和声和旋律特征,对转调和速度变化有鲁棒性,捕捉旋律和和声维度相似性。
第二个指标是基于PaSST音频分类器计算的KL散度。PaSST是基于Transformer架构的音频分类模型,预训练于AudioSet。参考样本和比较样本输入模型,得到类别概率分布,算两个分布间KL散度,数值越小表示声学内容越接近,反映整体声学统计特性相似性,关联音色和制作层面相似度。
第三个指标是CLAP音频嵌入的余弦相似度。CLAP通过大规模图文音对比学习,把音频片段编码成语义丰富向量表示,反映语义层面相似程度。
第四个指标是DEfNet嵌入的余弦相似度,模型在Discogs网站海量音乐元数据上训练,捕捉音乐风格、流派和音色特征。对音乐风格和制作细节表征能力强。
四个指标跑完所有三元组后,结果用下图展示。图中计算每个指标与人类聚合判断间的Kendall's τ相关系数,并按音乐属性和数据集子集拆开呈现,加粗数值表示统计显著。
图2:计算相似度指标与聚合参与者响应之间的Kendall's τ相关系数,按音乐属性和数据集子集拆分展示,加粗数值表示统计显著
图2:计算相似度指标与人类聚合响应之间的Kendall's τ相关系数(按音乐属性和数据子集拆分,加粗值表示p<0.05统计显著)
结果显示计算指标与人类判断间的τ值在0.2到0.4之间,"有相关性但不强"。具体到不同属性,CoverID在旋律维度表现突出,尤其在人类剽窃检测数据子集上,τ值达到0.46,说明旋律走向和和声进行是封面识别算法核心能力;但在音色维度上预测力弱。DEfNet在音色维度表现最好,在AI媒体案例子集上与人类判断的τ值达到0.48,说明嵌入模型能捕捉人类关注音色信息。CLAP表现中规中矩,部分子集和声和节奏维度有对齐度。KL散度在各属性上表现均衡,但无突出强项。
在AI生成音乐样本上,所有计算指标与人类判断相关性低于人类创作样本。这意味着现有计算指标在检测AI音乐复制时不可靠。AI生成音频统计分布与真实录音差异,特征提取器在AI音频上表现"水土不服"。这提醒AI音乐抄袭检测行业:在人类创作音乐上表现良好的检测算法,检测AI生成音乐时效果可能打折扣。

AI生成音乐的"照妖镜":从复制检测到伦理思考

本文MATCHA数据集设计将AI生成音乐单独拎出作为刺激源,设置两个AI子集:Stable Audio Open生成仿制音频和媒体报道中AI涉嫌抄袭案例。对照回答实际问题:AI生成音乐与已有作品在某音乐属性上高度相似时,人类能否分辨?计算工具能否报警?
实验数据表明AI生成子集标注者一致性略低于人类创作子集,但在AI媒体案例分析子集AM上,音色维度Fleiss' κ达0.64,为所有子集和属性组合中最高,说明AI生成音乐与已知歌曲音色模仿时,人类辨识能力靠谱。而在AI主动生成子集AS上,各属性一致性偏低,尤其和声维度κ值仅0.36。原因是AS子集通过DDIM逆推加受控噪声生成,保留参考样本旋律骨架,但和声走向偏离,人类专家难以判断"和声像谁"。
论文详细列出DDIM逆推和采样过程超参数设置。DDIM是高效扩散模型采样方法,能在较少采样步数下生成高质量图像或音频。逆推阶段η参数固定为0.0,确保重构过程确定性;生成阶段在不同样本间平衡η取值,为生成结果引入随机变化。具体参数如下表所示。
表4:DDIM逆推和采样过程中使用的超参数,逆推阶段η固定为0.0以保证确定性重构,生成阶段η跨样本取值以增加生成多样性
表4:DDIM逆推和采样过程中使用的超参数
参与实验的83位专家背景值得一提。研究者通过自报方式收集参与者音乐专业水平和职业角色分布,具体数据如下表所示。
表2:最终参与者群体自报的音乐专业水平分布(N=83),按音乐训练和职业经验水平排序
表2:最终参与者群体自报的音乐专业水平分布(N=83)
表3:最终参与者群体自报的音乐角色分布(N=83),音乐研究者、演奏者、声音工程师占大多数
表3:最终参与者群体自报的音乐角色分布(N=83)
超过63%参与者是受过专业训练的音乐从业者或专家级音乐专业人士,音乐研究者、乐器演奏者和声音工程师占比最高。这种高专业水平标注者池为数据集标注质量提供保障。但也带出一个问题:专业音乐人与普通听众对音乐相似性感知是否一致?本文实验招募的是专业人士,结论能否推广到普通听众有待验证。
从复制检测到伦理思考,研究价值在于把AI音乐抄袭检测从"玄学"推向"实证"。过去几年,AI音乐版权纠纷频繁见诸报端,知名唱片公司起诉AI音乐生成公司事件时有发生。但法律诉讼需要证据,鉴定音乐"抄袭"需要可操作、可复现、经过人类验证判断标准。MATCHA数据集为领域提供经过专家校准的"标准尺"。任何新的检测算法都可在MATCHA上检验判断与83位专家一致性。这就像给没有考试科目出标准试卷,虽不能保证百分百公平,但至少有了对照基准。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文介绍庞培法布拉大学与索尼AI等机构联合提出的MATCHA数据集,通过300个音乐三元组和83位专家的1105次感知评估,系统检验旋律、和声、节奏、人声、音色五个维度上人类判断与计算指标的对齐程度,为AI音乐生成与抄袭检测评估提
这篇工作最值得看的点是什么?实验发现属性级判断能获得实质性标注者间一致性(旋律一致性>85%,κ≈0.60),但计算指标与人类判断仅呈现部分对齐。CoverID与旋律和声对齐最强,嵌入类指标(CLAP和DEfNet)在音色、节奏和人声上表现较好,KL散度对音乐细节不敏感。AS子集因生成伪影导致一致性接近随机水平。
这篇工作的边界或风险在哪里?优点:(1)首次系统评估属性级音乐相似性的人类判断与计算指标对齐度;(2)构建了包含人类创作和AI生成音乐的MATCHA数据集,具有生态效度;(3)实验设计严谨,包含控制案例和多重标注策略。缺点:(1)AS子集生成策略存在缺陷,导致该子集结果难以解释;(2)仅覆盖西方音乐传统,泛化性受限;(3)属性间天然交织,完全分离存在困难。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

属性级三元组感知数据集的思路并不算横空出世,但把旋律、和声、节奏、人声、音色五个维度拆开、并且同时覆盖人类创作和AI生成音乐的尝试是第一次,数据集本身填补了一个明确空白。

实验合理度:★★★★☆

83位专业标注者、300个三元组、1105次评估的规模在感知实验里相当扎实,干扰项的构造策略也考虑了难度均衡。扣一星在于AI生成样本主要来自单一模型,覆盖面有限。

学术研究价值:★★★★☆

数据集开源加上清晰的实验范式,给后续音乐相似性研究和AI音乐版权检测提供了一个可复用的基准。在生成式AI伦理问题日益受到关注的背景下,这种实证型研究有很强的学术牵引力。

稳定性:★★★☆☆

标注者间一致性在旋律维度表现稳定,但在和声和音色维度上仍有明显分歧,说明这些属性的感知本身就存在个体差异。作为研究基准稳定性尚可,但距离"可靠检测工具"还有距离。

适应性以及泛化能力:★★★☆☆

数据主要来自西方流行音乐和翻唱场景,对非西方音乐、电子音乐、实验音乐等风格的覆盖有限。AI生成部分仅使用Stable Audio Open,模型泛化能力需更多生成器验证。

硬件需求及成本:★★★★☆

数据集本身是离线标注产物,计算开销主要体现在DDIM逆推生成AI样本的阶段,这部分用普通单卡即可完成。实际使用数据集跑指标推理的成本很低,基础GPU就能搞定。

复现难度:★★★★☆

数据集已开源到GitHub,MiRA框架的相关代码也有迹可循。主要门槛在于对音频样本版权的清洗和授权,好在论文已经把这部分处理好了,用起来相对省心。

产品化成熟度:★★★☆☆

作为AI音乐抄袭检测的评估基准,MATCHA已经具备实用价值,可以直接用于检测算法的横向对比。但直接作为面向C端或B端的"抄袭鉴定产品"还不够,需要结合法律规范和更多场景验证。

可能的问题:数据集样本全部由专业音乐人标注,结论向普通听众的推广需谨慎;AI生成子集的音频均来自同一个模型,代表性可能不足;计算指标与人类判断的τ值普遍在0.2~0.4之间,间接说明现有算法距离实用化还有相当距离。


主要参考文献

[1] Batlle-Roca R, Choi W, Serrà J, et al. On the Human and Computer Alignment of Attribute-Based Music Matches[J]. arXiv preprint arXiv:2609.00987, 2026.
[2] Batlle-Roca R, et al. MiRA: A framework for music replication assessment[C]. 2024.
[3] Serrà J, Serra X, Andrzejak R G. Cross recurrence quantification for cover song identification[C]. ISMIR, 2009.
[4] Koutini K, et al. Efficient training of audio transformers with patchout[C]. Interspeech, 2022.
[5] Wu Y, et al. Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation[C]. ICASSP, 2023.
[6] Alonso-Jiménez P, et al. Large-scale music genre annotation with multi-track embedding models[C]. 2020.
[7] Spijkervet J, Burgoyne J A. Contrastive learning of musical representations[C]. ISMIR, 2021.

融会贯通

结合PaperDaily已收录的论文来看,音乐AI领域的评估基准正在经历一轮"从任务指标到人类感知对齐"的范式转换。以往的音乐生成评估大多使用音频重建质量(如FAD、CLAP分数)或人工主观评分(如MOS),但这些指标与人类对具体音乐属性的判断之间存在多少差距,一直缺乏系统度量。MATCHA把评估粒度细化到旋律、和声、节奏、人声、音色五个属性,用83位专业音乐人的感知标注给计算指标划定了一条"人类对齐线"——这条线让后续研究者在开发新指标时有了明确的目标函数。
需要提醒的是,目前PaperDaily已收录的论文里,还没有其他工作在MATCHA这组数据上做过同类基准对比,因此本文中关于人类与计算指标对齐程度的结论属于对该数据集的首次系统性分析,后续如果有新的检测算法用MATCHA做评测,才能进一步验证这些发现的普适性。另外,不同研究在计算指标实现细节上可能存在差异(比如音频预处理方式、嵌入模型版本),横向对比时要注意这些潜在的setting差异。
从产业视角看,这个数据集的发布恰逢AI音乐版权纠纷进入高发期。各大音乐平台和版权方都在寻找可靠的技术手段来识别AI音乐是否复制了受版权保护的内容。MATCHA所提供的"属性级人类感知基准",有望成为技术界和法律界沟通的共同语言:当计算指标在旋律维度上达到与人类专家相当的判断水平时,技术工具才真正有资格作为版权争议的辅助证据。这个数据集离那个目标还有距离,但方向已经对了。

end
听歌识曲靠耳朵,AI判抄袭靠算法,两边对不上怎么办?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 音乐AI+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,音乐AI小伙伴可以在大模型群里继续聊~
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。