← 返回 PaperDaily 大模型与智能体

Apple最新研究:10个标注员就够了!KL散度饱和曲线给出标注预算最优解

苹果最新研究揭示了一个没人细想过的问题:收集标注时,花了钱不等于拿到了“对”的信息。KL散度和熵相关性对标注数量的要求天差地别。更扎心的是,免费的标签平滑无法取代标注员提供的“物品特有不确定性”信号。这篇文章会让你重新思考数据标注的预算分配,获得实实在在的降本增效理论基础。

Apple最新研究:10个标注员就够了!KL散度饱和曲线给出标注预算最优解
🐉 龙哥读论文知识星球来了!
手机屏幕太小?纸质论文太慢?星球每日按分类深度拆解前沿AI论文+行业资讯,几分钟掌握核心,再也不用担心被海量信息淹没! 👇扫码加入「龙哥读论文」知识星球,高效获取AI前沿干货~ xingqiu_header

龙哥推荐理由:
苹果最新研究揭示了一个没人细想过的问题:收集标注时,花了钱不等于拿到了“对”的信息。KL散度和熵相关性对标注数量的要求天差地别。更扎心的是,免费的标签平滑无法取代标注员提供的“物品特有不确定性”信号。这篇文章会让你重新思考数据标注的预算分配,获得实实在在的降本增效理论基础。


原论文信息如下:
论文标题:
Metric-Dependent Annotation Saturation for Learning from Label Distributions
发表日期:
2026年05月
发表单位:
Apple
原文链接:
https://arxiv.org/pdf/2605.29797

Apple Research最新论文 | Metric-Dependent Annotation Saturation for Learning from Label Distributions

人类分歧中蕴含的信号:为什么软标签比标签平滑更有效?

在自然语言推理(NLI)任务中,一个样本被100个标注员标注后,结果可能像这样:62%的人认为是“蕴含”,25%认为是“中性”,13%认为是“矛盾”。但大多数模型训练时只取多数票“蕴含”,把剩下的38%标注信息直接丢弃了。这就像用一个点的估计去描述一个分布,模型自然会在模糊样本上表现得过度自信。
使用完整的标注分布(即软标签)来训练模型,在计算机视觉领域已被证明有效,NLP领域也在跟进。但有人会问:为什么不直接用免费的标签平滑(Label Smoothing)代替呢?标签平滑把one-hot标签与均匀分布混合,不花一分钱就能得到软目标。直觉上,在那些人类确实分歧很大的样本上,均匀分布可能是个合理的近似。如果真是这样,那么花大价钱收集100个标注员就显得很傻。
苹果这篇论文直接检验了假设,发现部分正确:标签平滑在高熵(人类分歧大)样本上确实表现不错,但在低熵(人类一致)样本上反而有害——因为它把概率质量错误地分配到了错误类别上。这种“样本无关”的不确定性处理方式,导致模型无法学会哪些样本是模糊的
论文在ChaosNLI数据集(包含3113个NLI样本,每个都有100个独立标注)上做了细致实验。对比了7种训练配置:硬标签(多数票)、硬标签+温标缩放、5种不同强度的标签平滑(α取0.05到0.5),以及软标签(用100人分布)。
主要结果见Table 1。在熵相关性(Entropy Correlation)这个指标上,软标签达到r=0.643,而所有标签平滑配置都挤在r=0.446~0.489之间,相差0.154以上(p<0.001)。注意,熵相关性衡量的是模型预测熵与人类标注熵之间的相关程度——它直接回答了“模型是否知道哪些样本模糊”。标签平滑对这个信号完全没有贡献,因为它对所有样本均匀施加不确定性,不会改变排序。
表1:主要实验结果。不同训练配置在多数票参考(左)和分布感知指标(右)上的表现。软标签在熵相关性上显著领先标签平滑。
图1可视化了这个结果:硬标签的预测熵与人类熵相关性只有0.497(左),而软标签达到0.613(右),且点更紧密地聚在对角线附近。
图1:熵相关性散点图。硬标签训练(左)r=0.497,软标签训练(右)r=0.613,沿对角线聚类更紧密。
Table 2进一步展示了标签平滑在哪里失败:按人类熵三分位分层,标签平滑(α=0.3)在高熵样本上KL散度0.167甚至优于软标签的0.172,但在低熵样本上却差得离谱(0.180 vs 0.114)。这恰恰证明了“均匀分布”只能糊弄模糊样本,在清晰样本上它会引入错误。
表2:按人类熵三分位分层的KL散度。标签平滑在高熵区间稍好,但在低熵区间严重退化。
一句话总结:软标签包含了标签平滑永远无法模拟的样本特定不确定性信号。这为后续探讨“到底需要多少标注员”打下了基础。

标注效率曲线揭示:不同指标对标注数量的要求大不相同

既然软标签不可替代,那下一个问题就是:每个样本需要多少标注员才能捕获到足够的信号?论文通过子采样实验构建了标注效率曲线:从每个样本的100个标注中随机抽取N∈{3,5,10,20,50,100}个,用子样本的软标签训练模型,然后计算该训练方式在各项指标上获得了从硬标签到完整软标签(100人)改进的百分比。
结果揭示了一个关键现象:指标依赖的饱和(论文称之为differential saturation)。不同的评价指标对标注数量的要求完全不同。
图2:标注效率曲线,显示每个标注数量N下捕获的硬标签→软标签(100)改进百分比。KL散度迅速饱和,熵相关性则持续改善到N=50。
从图2可以直观看到,KL散度(分布匹配)在N=10时就已经达到了91%的改进幅度,而熵相关性(不确定性排序)在同一N值下只达到74%,差距显著。具体数字见表3。
表3:效率曲线结果。N=3时KL已捕获81%,熵相关仅51%;N=10时KL达91%,熵相关74%;到N=20才接近89%。
为什么KL散度饱和这么快?因为它被多数类概率主导,而多数类概率用少数几个标注员就能估计得不错。熵相关性依赖于整个分布的形状,特别是少数类的比例,需要更多标注员才能稳定。这种差异在N=3时最明显:KL已经拿到81%的改进,熵相关只有51%,差了整整30个百分点。
图3展示了所有6个指标的完整效率曲线,可以看到Brier-soft和Dist-ECE等指标也有各自的饱和模式,但KL和熵相关的对比最为突出。
图3:所有6个指标的完整效率曲线。KL和熵相关差异最大。
这个发现意味着,标注预算不能一刀切,必须根据下游评价指标来定。

实验验证:从KL散度到熵相关性,标注预算应“因指标制宜”

论文的核心贡献在于提供了首个系统性的标注效率曲线,并给出了量化建议:如果目标是最小化KL散度(即让模型预测分布接近人类分布),那么每个样本10个标注员就足够了(捕获87-95%的改进)。但如果你需要模型在选择性预测主动学习课程学习中正确排序样本的不确定性,那熵相关性才是关键指标,这时需要20-50个标注员才能稳定收敛。
为了确保结论不是偶然,论文做了多种稳健性验证:
首先,重复3个独立的数据划分(split seeds 42,43,44),软标签在全部9个seed-split组合上均胜出标签平滑(KL和熵相关均胜出9/9)。相对改进幅度:KL减少37-53%,熵相关提升22-47%。
表5:跨数据划分的稳健性。相对KL降低37-53%,熵相关提升22-47%。
其次,通过Brier分数Murphy分解(Table 4)揭示了机制:标签平滑虽然降低了可靠性(REL从0.033降到0.012),但分辨率(RES)几乎没有提升(0.160→0.161),而软标签同时在可靠性和分辨率上取得进步(REL=0.005,RES=0.171)。分辨率正是衡量模型能否按模糊程度对样本进行排序的能力。
表4:Brier分数Murphy分解。标签平滑降低可靠性但几乎不提升分辨率;软标签两者兼得。
论文还做了留出标注员评估:把100个标注员中的80个用于训练,20个留出用于评估,软标签仍然显著优于标签平滑(KL 0.171 vs 0.212,熵相关0.577 vs 0.425),排除了评价循环的疑虑。

跨模型与跨领域验证:方法的稳健性与泛化能力

主要实验使用DeBERTa-v3-base,为了验证发现不局限于单一架构,论文在RoBERTa-large-mnli(355M参数)上重复了对比实验。结果见Table 6:软标签在熵相关上的领先优势从+0.154扩大到+0.249(r=0.615 vs 最佳标签平滑r=0.366),验证了定性分离。
表6:RoBERTa-large-mnli对比实验。软标签在熵相关上的领先从+0.154扩大到+0.249。
RoBERTa的效率曲线(Table 7)同样显示出差异饱和:N=3时KL捕获86%,熵相关仅54%,差距32个百分点,与DeBERTa的30个点几乎一致。
表7:RoBERTa-large-mnli效率曲线。N=3时KL 86% vs 熵相关54%,差异饱和模式复现。
论文还进行了预训练消融实验:去掉NLI预训练,从原始DeBERTa-v3-base直接训练,软标签的熵相关优势反而从+0.154扩大到+0.175,说明优势不是初始化带来的。
更令人信服的是跨领域探索:在DICES-990数据集(内容安全任务,2分类,每样本约70个标注)上也观察到了差异饱和——KL在N=3时达到90%改进,熵相关仅62%。虽然该数据集存在一些设计混杂因素(标注员数目不等、任务不同),但模式一致,暗示差异饱和可能是一个更普遍的现象。
表9:DICES-990效率曲线。差异饱和在内容安全任务中也出现。
论文还测试了Dirichlet平滑(在子采样计数上加入伪计数)能否补偿标注数量不足。结果发现,在N=10时加上Dirichlet平滑(α=1/K),KL散度几乎追平N=100(关闭99%的差距,p=0.004),但熵相关只关闭了87%(p=0.12,不显著)。差异饱和在更好的聚合方法下仍然存在。
表14:Dirichlet平滑效果。KL几乎闭合差距,熵相关仍有显著差距。

实践启示:如何科学地规划你的标注预算?

论文的发现为实际标注预算提供了清晰的指导原则:
第一,明确下游指标再定预算。如果你的最终目标是让模型输出分布尽可能接近人类分布(例如在风险评估中要准确校准),那么每个样本10个标注员就可以捕获90%以上的收益。但如果你需要模型能够识别哪些样本是模糊的(用于主动学习、选择性预测等),那么需要20-50个标注员。
第二,不要把标签平滑当作免费替代品。标签平滑虽然零成本,但它无法提供样本特定的不确定性信号。如果预算只够3-5个标注员,用软标签训练仍然优于多数票硬标签,但千万不要指望标签平滑能等效替代真实标注分布。
第三,考虑使用Dirichlet平滑作为补充。当标注数量很少时(例如N=10),加上Dirichlet伪计数可以显著改善KL散度,但对熵相关帮助有限。如果熵相关是核心指标,仍然需要增加标注员数量。
第四,警惕传统ECEs的误导。标准期望校准误差(ECE)是针对多数票标签计算的,惩罚了那些准确输出校准不确定性的模型。论文建议使用分布感知的评估指标(如Brier-soft、Dist-ECE、熵相关)来衡量模型在软标签设置下的表现。分布感知的评估指标(distribution-aware metrics)是指那些与人类标注分布进行比较的指标,而非与多数票标签比较。
最后,论文也坦诚了局限性:主要结果基于NLI任务(3分类),具体饱和阈值(N10 vs N50)可能在其他任务或更大类别数上发生变化。目前只在两个transformer架构上验证,对于解码器大语言模型是否适用有待研究。但无论如何,这篇论文为“标注预算应该根据评价指标来定”这一观点提供了坚实的实证基础。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?论文核心解决两个问题:(1)软标签(直接使用标注分布)是否包含标签平滑(免费技巧)无法复制的信号?答案是,是的,特别是样本特定的不确定性排序。(2)每个样本需要多少标注员才能捕获这种信号?论文发现不同指标需求不同——KL散度10人就够,熵相关性需要20-50人。

论文中的“熵相关性”和“KL散度”具体指什么?“熵相关性”(Entropy Correlation)是指模型预测分布的信息熵与人类标注分布的信息熵之间的皮尔逊相关系数r。信息熵衡量不确定性,熵越大表示标注员分歧越大。这个指标回答:模型是否知道哪些样本模糊。“KL散度”(Kullback-Leibler Divergence)是衡量模型预测分布与人类分布之间差异的指标,越小越好。KL散度主要由多数类概率主导,而熵相关需要整个分布形状信息。

论文的发现对实际项目有什么直接帮助?假设你要做一个情感分析系统,需要收集标注数据。如果最终目标只是让模型预测分布与人类一致(例如用于概率校准),那么每个样本只需10个标注员就能取得接近100人的效果——省下90%标注成本。但如果你希望模型能主动识别哪些样本是歧义的(用于主动学习挑选最不确定的样本去标注),那需要20-50个标注员才能得到可靠的不确定性排序。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

首次系统构建标注效率曲线并揭示“指标依赖的饱和”,明确证明标签平滑无法替代软标签的样本特定信号,概念清晰,实证扎实。

实验合理度:★★★★★

对比设置公平,包含硬标签、标签平滑(5个α)、软标签,且都加了温标缩放。子采样实验设计合理,用了多模型种子和子采样种子。统计检验充分(Holm-Bonferroni校正)。

学术研究价值:★★★★★

为“标注预算应因指标制宜”提供了定量经验证据,将加速软标签训练研究,并推动分布感知评估指标的普及。方法论可推广到其他任务。

稳定性:★★★★☆

跨划分、跨模型、跨领域都复现了定性模式,但具体饱和阈值可能随任务和类别数变化,需要更多验证。

适应性以及泛化能力:★★★★☆

主要基于NLI任务,跨领域验证只在内容安全上做了一次探索,且存在混杂因素。泛化到更广泛任务和大语言模型尚需验证。

硬件需求及成本:★★★★☆

采用DeBERTa-v3-base(86M参数)和RoBERTa-large(355M),训练成本中等。标注成本方面,论文建议N=10到50,远低于100,有实际降本意义。

复现难度:★★★☆☆

使用ChaosNLI数据集(公开),模型基于HuggingFace,代码细节完整。但需要100标注员级的基准数据,其他任务可能难以直接复现效率曲线。

产品化成熟度:★★★☆☆

直接指导标注预算制定,有实用价值。但需要先明确下游指标,且具体阈值在不同场景下可能调整。可以作为标标注管理工具的理论基础。

可能的问题:主要实验集中在NLI任务,跨领域证据薄弱。DICES-990数据集的混杂因素(标注员数目不等、任务不同)降低了结论强度。未测试解码器LLM,而这类模型在当下更重要。另外,论文没有深入探讨当标注员质量不均时(如Dawid-Skene模型)的影响,虽然附录提到会丧失分布信号,但缺乏系统分析。


主要参考文献

[1] Nie, Y., Williams, A., Dinan, E., et al. (2020). Adversarial NLI: A New Approach to Natural Language Understanding. In ACL.
[2] Peterson, J. C., Battleday, R. M., Griffiths, T. L., & Russakovsky, O. (2019). Human Uncertainty Makes Classification More Robust. In ICCV.
[3] Szegedy, C., Vanhoucke, V., Ioffe, S., Shlens, J., & Wojna, Z. (2016). Rethinking the Inception Architecture for Computer Vision. In CVPR.
[4] Müller, R., Kornblith, S., & Hinton, G. (2019). When Does Label Smoothing Help? In NeurIPS.
[5] Guo, C., Pleiss, G., Sun, Y., & Weinberger, K. Q. (2017). On Calibration of Modern Neural Networks. In ICML.
[6] Kohli, G. (2026). Metric-Dependent Annotation Saturation for Learning from Label Distributions. Apple. arXiv:2605.29797.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。