← 返回 PaperDaily 视觉与图像

华为诺亚这篇PUe:有偏标记也能纠偏

这篇论文盯住了PU学习里最烦人的那个坑:标注不是随机来的,而是“挑着标”的。PUe的思路很朴素——先估计偏差,再把权重掰正,最后让分类器少吃冤枉亏。

华为诺亚这篇PUe:有偏标记也能纠偏
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇论文盯住了PU学习里最烦人的那个坑:标注不是随机来的,而是“挑着标”的。PUe的思路很朴素——先估计偏差,再把权重掰正,最后让分类器少吃冤枉亏。


原论文信息如下:
论文标题:
PUe: Biased Positive-Unlabeled Learning Enhancement by Causal Inference 发表日期:
2022年09月 发表单位:
Huawei Noah’s Ark Lab 原文链接:
http://arxiv.org/pdf/2209.14375.pdf 开源代码链接:
GitHub and Gitee(原文提及,未给出具体链接)

标记偏差,一个隐形的“毒药”,让AI学习困难重重

PU学习最别扭的地方,不是“只有正样本”,而是正样本并不是真的随机被标出来。现实里,能被标成正类的样本,往往更“显眼”、更“容易被注意到”,而不是正类中的公平代表。比如广告点击、疾病筛查、恶意网址识别,真正被标出来的那一小撮正样本,常常带着明显偏好。
这就引出两个经典假设。SCARSelected Completely At Random,中文叫“完全随机选择”,意思是:所有正样本被标记的概率都一样。这个假设很省事,但现实经常不买账。另一种更宽松的假设是 SAR,即 Selected At Random,中文是“按条件随机选择”,意思是:样本能不能被标出来,和它自身属性有关。
PUe 这篇工作盯住的,就是这个“标记偏差”问题。它的态度很直接:既然标记不是随机的,那就别假装随机;既然偏了,那就先估计偏到哪,再把训练时的权重掰回来。思路不花哨,但很对症。
封面
图2:PUe整体框架。先估计正样本的倾向性得分,再用归一化逆概率加权修正样本权重,最后把修正后的损失送进PU分类器。

PU学习也有“偏科”问题?来看华为诺亚实验室的破解之道

先把PU学习说人话:只有一小部分“正类”被标出来,剩下的大量数据既不是明确正类,也不能直接当负类,只能叫“未标注”。普通二分类是“正、负”两队直接开打,PU学习则像是“只知道一队里谁穿了红衣服,另一队里大多数人没写牌子”。
传统PU方法很多都默认:被标出来的正样本,是从所有正样本里“公平抽签”抽来的。这个假设一旦失真,风险估计器就开始飘,分类边界也会跟着歪。PUe的核心判断很清楚:不是PU方法不行,而是它太相信“标注是随机的”这件事了
图1
图1:本文方法与传统PU方法的分类示意图。PUe通过重加权修正分类平面,让决策边界更贴近真实分布。
这篇论文最有价值的地方,不是又发明了一个“更复杂的损失函数”,而是把因果推断里的倾向性得分逆概率加权搬进了PU学习。这里的“倾向性得分”可以理解成:一个正样本被标出来的概率到底有多大。这个概率不是越大越好,而是要尽量接近真实机制;否则,模型会把“容易被标出来的正样本”当成全体正样本的平均脸,结果自然偏。
PUe的整体流程可以概括成三步:先训练一个网络去估计每个已标记样本的倾向性得分;再把这个得分转成权重,并做归一化;最后把修正后的权重塞进现有的PU方法里,比如 uPU、nnPU、PUbN、Dist-PU。也就是说,PUe不是另起炉灶,而是给现成PU算法装了一个“纠偏外挂”。

归一化逆概率加权:为有偏数据“拨乱反正”的神器

PUe里最关键的词是 NIPW,即 Normalized Inverse Probability Weighting,中文叫“归一化逆概率加权”。拆开看就很直白:逆概率加权是“越难被标出来的样本,越要给更大的权重”;归一化则是“别把权重加到飞起,先拉回到一个可控范围”。
为什么要归一化?因为直接用倒数权重,容易出现一种很烦的情况:某些样本倾向性得分特别小,倒数一下就会特别大,训练时像拿着高压水枪往损失函数上猛冲,模型很容易被少数样本牵着跑。PUe把这个权重做成归一化版本,本质上是在“纠偏”和“稳定”之间找平衡。
论文还做了一个很实在的理论分析:当真实倾向性得分已知时,归一化带来的偏差是可控的,和样本归一化因子与总体归一化因子的差有关。说白了,就是“归一化会带来一点点偏差,但这点偏差是能算清楚、能约束住的”,而不是拍脑袋乱加权。
这部分最值得记住的,是它解决了一个工程上很常见的矛盾:只靠“理论上无偏”的权重,训练未必稳;稍微做一点归一化,反而更接近可用系统。这类设计很像老练工程师的手法:不是追求纸面最漂亮,而是追求机器真能跑。

拿什么来拯救你,我的倾向性得分?深度学习+正则化,用上!

倾向性得分不是凭空长出来的,得估计。论文这里没有停留在传统的线性模型,而是直接上了深度网络。原因也很现实:真实数据里的偏差往往不是一条直线能说清的,尤其是图像任务里,标记偏差和视觉特征之间的关系更像“复杂纠缠”,不是简单线性关系。
但深度网络也有老毛病:容易把倾向性得分估得太极端,出现“已标记样本接近1、未标记样本接近0”的退化解。听起来像很自信,实际上是把问题想简单了。PUe因此加了正则化,目的就是防止倾向性网络过拟合到“非黑即白”的程度。
图3
图3:不同αe取值对CIFAR-10上Dist-PUe性能的影响。可以看到,参数并不是越大越好,PUe对超参数存在明显敏感性。
这里还有一个容易被忽略的点:PUe不是只估计“谁更像正类”,而是估计“谁更可能被标成正类”。这两个概念很接近,但不一样。前者是分类问题,后者是选择机制问题。PUe把注意力从“内容本身”挪到“内容如何被标注”上,这就是因果推断味道最浓的地方。
论文还提到,倾向性得分估计并不追求绝对无偏,因为在现实里这几乎做不到。更重要的是让估计结果别太离谱,别把训练带偏。这个判断挺务实:有偏估计不一定致命,失控估计才致命

从MNIST到ADNI,PUe在不同战场上的“战果”斐然

实验部分很讲究:论文选了三个场景,MNIST、CIFAR-10 和 ADNI。前两个是模拟偏差数据集,能知道真实倾向性;ADNI 是更接近真实世界的医学数据,倾向性未知,更能测出方法是不是只会在“理想实验室”里表演。
这组实验的设计比较合理:一方面和 uPU、nnPU、PUbN、Dist-PU 做比较,覆盖了常见PU基线;另一方面还加了“有/无归一化”“不同标记分布”“不同超参数”的消融,能看出提升到底来自哪里,而不是单纯靠调参运气。
表1
表1:MNIST、CIFAR-10 和 ADNI 上的对比结果。PUe 系列方法在多数指标上优于对应基线,尤其在有偏标记场景里更明显。
从表1能看出,PUe 的提升不是“某一个指标突然飞天”,而是更像整体性修正。比如在 MNIST 上,uPUe、nnPUe、PUbNe、Dist-PUe 相比原始版本都有比较稳定的提升;在 CIFAR-10 和 ADNI 上,这种趋势也基本延续。论文给出的结论是:在有偏标记数据上,PUe 通常能带来约 1% 到 5% 的改进。
更有意思的是,使用“真实倾向性得分”并不总是最强,某些情况下“估计倾向性得分”反而更好。这一点很像因果推断里常见的现象:理论上更接近真值的东西,未必在有限样本和复杂模型里更好用。因为估计值带来的平滑效果,可能反而抑制了过拟合。
这里最值得肯定的是实验逻辑很完整:不仅证明“能提升”,还证明“为什么提升”。尤其在偏差越大时,PUe 的收益越明显;而当偏差极端到某些类标记太少时,收益会减弱,这也很诚实,没硬吹。
表2
表2:CIFAR-10 上不同标记分布下的消融结果。标记分布越偏,PUe 的改进通常越大;当分布极端失衡时,提升会变弱。
表2进一步说明,PUe 的收益和“标记分布偏差”强相关。这个结论很重要,因为它告诉读者:PUe 不是万能药,它对症的是“有偏标记”,不是所有PU问题都能一键通吃。偏差越像现实,方法越有用;偏差太极端,样本太少,倾向性估计本身也会难做。

总结与展望:PUe为有偏PU学习带来新解法

PUe 的价值,不在于把PU学习“彻底重写”,而在于它把一个长期被忽略的现实问题摆到了台面上:标记机制本身会偏,而且这个偏差会直接污染风险估计。它用因果推断的倾向性得分和归一化逆概率加权,把“偏差修正”做成了一个可以嵌进现有PU算法的模块。
它的优点也很清楚:思路扎实、和现有方法兼容、在有偏数据上确实能涨点;它的边界同样明确:倾向性得分估计本身就不容易,超参数也有敏感性,极端稀缺标记场景下仍然会受限。换句话说,这不是“拿来就能无脑上生产”的方案,但绝对是一个值得认真借鉴的框架。
对实际工程来说,这篇论文最有启发的地方是:当数据标注过程本身有选择偏差时,别急着怪模型不够强,先看看“标注机制”是不是已经把训练集带歪了。很多时候,模型不是学不会,而是学到了一个被偏差污染的世界观。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“有偏标记的PU学习”问题。不是所有正样本都公平地被标出来,PUe 通过估计倾向性得分并做归一化逆概率加权,尽量把训练过程拉回真实分布。

SCAR、SAR、倾向性得分分别是什么意思?SCAR 是“完全随机标记”,SAR 是“按条件随机标记”。倾向性得分则是某个正样本被标成正类的概率;它越准确,权重修正就越靠谱。

为什么要做归一化,而不是直接用逆概率权重?因为直接倒数容易把少数极小倾向性样本的权重放得太大,训练会非常不稳。归一化能在修正偏差的同时,把数值控制住,工程上更可用。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆ 不是凭空造新任务,而是把因果推断里的倾向性得分和归一化逆概率加权,比较自然地引入PU学习,思路扎实。

实验合理度:★★★★☆ 数据集、基线、消融都比较完整,尤其还看了不同标记分布和补充实验,结论可信度不错。

学术研究价值:★★★★☆ 对“有偏标记”这个现实问题给出了清晰建模,对后续弱监督、选择偏差修正都有参考意义。

稳定性:★★★☆☆ 归一化比直接倒数稳一些,但倾向性估计和超参数仍然敏感,极端稀缺标记场景下不算特别稳。

适应性以及泛化能力:★★★☆☆ 适合存在标记偏差的PU场景,离开这个前提后,收益会明显收缩。

硬件需求及成本:★★★☆☆ 训练要额外估计倾向性网络,成本高于原始PU方法,但还算是可接受的研究级开销。

复现难度:★★★☆☆ 方法链条不算短,涉及权重修正和多种PU基线,但原文给了算法和实验设置,复现门槛中等。

产品化成熟度:★★★☆☆ 在推荐、风控、医疗筛查等“标记有偏”的场景有落地潜力,但需要先验证倾向性估计是否稳定。

可能的问题:核心瓶颈还是倾向性得分估计,极端偏斜数据上容易不稳;方法有效,但不是万能补丁。


主要参考文献

[1] Jessa Bekker, Pieter Robberechts, and Jesse Davis. Beyond the selected completely at random assumption for learning from positive and unlabeled data. ECML PKDD 2019 / Machine Learning and Knowledge Discovery in Databases, 2020.
[7] Yunrui Zhao, Qianqian Xu, Yangbangyan Jiang, Peisong Wen, and Qingming Huang. Dist-PU: Positive-unlabeled learning from a label distribution perspective. CVPR 2022.
[11] Ryuichi Kiryo, Gang Niu, Marthinus C. du Plessis, and Masashi Sugiyama. Positive-unlabeled learning with non-negative risk estimator. NeurIPS 2017.
[14] Paul R. Rosenbaum and Donald B. Rubin. The central role of the propensity score in observational studies for causal effects. Biometrika, 1983.
[15] Keisuke Hirano, Guido W. Imbens, and Geert Ridder. Efficient estimation of average treatment effects using the estimated propensity score. Econometrica, 2003.
原文链接:http://arxiv.org/pdf/2209.14375.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
有偏数据别硬学,先把“偏心”的标签掰正再说。PUe这篇论文的价值很实在:它不是换个名字继续堆损失,而是直接盯住选择偏差,用倾向性得分把PU学习拉回正轨。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。