论文的核心贡献在于提供了首个系统性的标注效率曲线,并给出了量化建议:如果目标是最小化KL散度(即让模型预测分布接近人类分布),那么每个样本10个标注员就足够了(捕获87-95%的改进)。但如果你需要模型在选择性预测、主动学习或课程学习中正确排序样本的不确定性,那熵相关性才是关键指标,这时需要20-50个标注员才能稳定收敛。为了确保结论不是偶然,论文做了多种稳健性验证:首先,重复3个独立的数据划分(split seeds 42,43,44),软标签在全部9个seed-split组合上均胜出标签平滑(KL和熵相关均胜出9/9)。相对改进幅度:KL减少37-53%,熵相关提升22-47%。其次,通过Brier分数Murphy分解(Table 4)揭示了机制:标签平滑虽然降低了可靠性(REL从0.033降到0.012),但分辨率(RES)几乎没有提升(0.160→0.161),而软标签同时在可靠性和分辨率上取得进步(REL=0.005,RES=0.171)。分辨率正是衡量模型能否按模糊程度对样本进行排序的能力。论文还做了留出标注员评估:把100个标注员中的80个用于训练,20个留出用于评估,软标签仍然显著优于标签平滑(KL 0.171 vs 0.212,熵相关0.577 vs 0.425),排除了评价循环的疑虑。
跨模型与跨领域验证:方法的稳健性与泛化能力
主要实验使用DeBERTa-v3-base,为了验证发现不局限于单一架构,论文在RoBERTa-large-mnli(355M参数)上重复了对比实验。结果见Table 6:软标签在熵相关上的领先优势从+0.154扩大到+0.249(r=0.615 vs 最佳标签平滑r=0.366),验证了定性分离。RoBERTa的效率曲线(Table 7)同样显示出差异饱和:N=3时KL捕获86%,熵相关仅54%,差距32个百分点,与DeBERTa的30个点几乎一致。论文还进行了预训练消融实验:去掉NLI预训练,从原始DeBERTa-v3-base直接训练,软标签的熵相关优势反而从+0.154扩大到+0.175,说明优势不是初始化带来的。更令人信服的是跨领域探索:在DICES-990数据集(内容安全任务,2分类,每样本约70个标注)上也观察到了差异饱和——KL在N=3时达到90%改进,熵相关仅62%。虽然该数据集存在一些设计混杂因素(标注员数目不等、任务不同),但模式一致,暗示差异饱和可能是一个更普遍的现象。论文还测试了Dirichlet平滑(在子采样计数上加入伪计数)能否补偿标注数量不足。结果发现,在N=10时加上Dirichlet平滑(α=1/K),KL散度几乎追平N=100(关闭99%的差距,p=0.004),但熵相关只关闭了87%(p=0.12,不显著)。差异饱和在更好的聚合方法下仍然存在。
实践启示:如何科学地规划你的标注预算?
论文的发现为实际标注预算提供了清晰的指导原则:第一,明确下游指标再定预算。如果你的最终目标是让模型输出分布尽可能接近人类分布(例如在风险评估中要准确校准),那么每个样本10个标注员就可以捕获90%以上的收益。但如果你需要模型能够识别哪些样本是模糊的(用于主动学习、选择性预测等),那么需要20-50个标注员。第二,不要把标签平滑当作免费替代品。标签平滑虽然零成本,但它无法提供样本特定的不确定性信号。如果预算只够3-5个标注员,用软标签训练仍然优于多数票硬标签,但千万不要指望标签平滑能等效替代真实标注分布。第三,考虑使用Dirichlet平滑作为补充。当标注数量很少时(例如N=10),加上Dirichlet伪计数可以显著改善KL散度,但对熵相关帮助有限。如果熵相关是核心指标,仍然需要增加标注员数量。第四,警惕传统ECEs的误导。标准期望校准误差(ECE)是针对多数票标签计算的,惩罚了那些准确输出校准不确定性的模型。论文建议使用分布感知的评估指标(如Brier-soft、Dist-ECE、熵相关)来衡量模型在软标签设置下的表现。分布感知的评估指标(distribution-aware metrics)是指那些与人类标注分布进行比较的指标,而非与多数票标签比较。最后,论文也坦诚了局限性:主要结果基于NLI任务(3分类),具体饱和阈值(N10 vs N50)可能在其他任务或更大类别数上发生变化。目前只在两个transformer架构上验证,对于解码器大语言模型是否适用有待研究。但无论如何,这篇论文为“标注预算应该根据评价指标来定”这一观点提供了坚实的实证基础。
[1] Nie, Y., Williams, A., Dinan, E., et al. (2020). Adversarial NLI: A New Approach to Natural Language Understanding. In ACL.[2] Peterson, J. C., Battleday, R. M., Griffiths, T. L., & Russakovsky, O. (2019). Human Uncertainty Makes Classification More Robust. In ICCV.[3] Szegedy, C., Vanhoucke, V., Ioffe, S., Shlens, J., & Wojna, Z. (2016). Rethinking the Inception Architecture for Computer Vision. In CVPR.[4] Müller, R., Kornblith, S., & Hinton, G. (2019). When Does Label Smoothing Help? In NeurIPS.[5] Guo, C., Pleiss, G., Sun, Y., & Weinberger, K. Q. (2017). On Calibration of Modern Neural Networks. In ICML.[6] Kohli, G. (2026). Metric-Dependent Annotation Saturation for Learning from Label Distributions. Apple. arXiv:2605.29797.