← 返回 PaperDaily 视觉与图像

哈工大SAGE新作:不靠标注,让模型摆脱“背景骗局”,最差组精度飙至89.5%

模型总爱“看背景下菜碟”?哈工大团队提出SAGE,不靠任何人工标注,用聚类子标签驱动扩散模型定向补数据,直接把最差组精度拉到89.5%,专治各种“背景骗局”。

哈工大SAGE新作:不靠标注,让模型摆脱“背景骗局”,最差组精度飙至89.5%
原论文信息如下:
论文标题:
SAGE: Subpopulation-Aware Generative Enhancement for Mitigating Spurious Correlations
end
AI 学会“看背景”下判断,你可别只会看热闹~ 想深入理解 SAGE 如何无标注抗虚假关联?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。群里已有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个方向的小伙伴,一起拆论文、聊落地,不亦乐乎~
wechat_helper dianzan

先别急着往下看,想一个更简单的场景:假如你想训练一个“猫狗分类器”,结果训练集里绝大多数猫都趴在沙发上,绝大多数狗都窝在草地上。模型学完后,表面上很聪明,平均精度轻轻松松上90,可它到底认的是“猫狗”还是“沙发草地”?这种靠环境线索蒙混过关的现象,在机器学习里被称作虚假相关(Spurious Correlations)。这里所说的“虚假”,并不是指数据造假,而是指某一特征与类别在训练集里高度相关、却在真实世界里并不稳定。比如背景、颜色、性别等,都可能成为模型偷懒的线索。

要评估模型在这种“陷阱”下有多脆弱,学术界通常会看一个比平均精度更严厉的指标:最差组精度(Worst-Group Accuracy, WGA)。做法是把测试样本按照“类别×虚假属性”划分成不同小组,然后取各组精度的最小值。平均精度高只能说明模型在多数情况下表现好,而WGA低则直接暴露了模型在罕见组合上的短板。例如Waterbirds数据集里,“水鸟+陆地背景”这类组合样本极少,模型平时基本没见过,一旦碰到就很可能认错,最终拉低的就是WGA。

现有应对虚假相关的方法,大致分成两条路线:一条默认你知道虚假属性是什么,甚至每个样本属于哪个组,然后直接在训练或模型选择阶段做干预;另一条虽然不要求组标签,但常常还需要一个精心人工构造、类别和属性都均衡的验证集来挑模型。问题是,现实世界里的数据往往又“脏”又“乱”,我们既不可能逐一标注哪个特征是虚假的,也不太可能专门维护一份人工均衡验证集。真正要解决的问题,其实是在两手空空的前提下,把模型的WGA提上去。

哈工大团队提出的SAGE,正是瞄准了这一“真空地带”。它不依赖任何组标签,不调用外部大语言模型或分割模型,也不需要人工均衡验证集,而是绕道数据层面解决问题:先自动找出训练集中哪些子群“人丁稀少”,再用条件生成模型把稀缺样本补上。下面这张图展示了三个常用基准数据集的子群构成。可以看到,无论Waterbirds中的背景类型、CelebA中的性别属性,还是MetaShift中的场景物体,都存在严重的分布不均衡。SAGE要补的,正是每个数据集右下角那一类“少数派”。

Waterbirds、CelebA和MetaShift的各子群数据分布概览
Waterbirds、CelebA和MetaShift上四个(类别,虚假属性)组的概览。类别标签遵循各基准的标准组ID约定。可以看出少数组的样本量严重偏低。

SAGE框架:两阶段生成式增强的巧妙设计

SAGE的全称是子群体感知生成式增强(Subpopulation-Aware Generative Enhancement),整体流程可以拆成两个设计目的完全不同的阶段。

第一个阶段先“认识数据”。SAGE把训练图片送进预训练视觉编码器提取特征,再用聚类把特征相似的图片归到一起。每个簇会被分配一个可学习的子标签令牌,相当于在生成模型里为某种视觉亚型注册一个“代号”。有了类别标签和子标签令牌组成的提示词,SAGE再用LoRA技术微调一个条件扩散生成模型。这个阶段的产物,是一个能够根据“类别+指定视觉亚型”去生成图片的定制生成器。

第二阶段则负责“补齐数据”。SAGE根据每个子群的密度倒过来分配生成配额:某个簇的样本越少,被采样生成的概率越高,以此把训练集里代表性不足的区域重点补足。与此同时,它还用一套均匀采样策略生成一个子标签均衡的合成验证集。这个合成验证集不是拿来做一般的“选模型”,而是用来做深度特征重加权(Deep Feature Reweighting, DFR)

为什么需要DFR这一步?关键在于,经验风险最小化(Empirical Risk Minimization, ERM)训练出来的骨干网络,其实已经保留了大量的核心语义特征,真正“跑偏”的主要是最后的线性分类层。DFR的做法是冻结特征提取器,只在一个属性均衡的小验证集上重新训练最后一层分类器。原版DFR依赖人工标注的组均衡验证集,而SAGE直接用生成器造出一个“伪均衡”验证集来替代它。训练集增强负责“多认识世界”,合成验证集重加权负责“纠正偏见”,两者形成互补,这也是SAGE思路比较巧妙的地方。

具体到生成条件的采样,SAGE设计了一个“逆密度采样”策略。假设某个簇内样本数为N_k,如果采样概率正比于N_k的倒数,那么样本数越少的簇越容易被生成。这个直觉很简单,但直接使用会带来一个隐患:聚类过程本身存在随机性,一些明明非常相似的图片可能被切进好几个不同的簇,相当于把同一种视觉模式“拆碎”了。若分别按逆密度加权,这些碎片合起来会获得过高的总采样概率,反而降低生成多样性。为此,SAGE先对同类内学到的子标签令牌嵌入做余弦相似度计算,把相似度过高的令牌合并成同一个语义组,再用合并后的组做逆密度与全局归一化。图2(见前文)正好展示了这个设计的效果:在类别标签不变的情况下,换了子标签令牌之后,生成图片的背景和外观风格确实发生了肉眼可见的变化。

逆密度采样初始概率
初始逆密度采样概率:N_k为簇k中的样本数,q为同类内簇的数量。样本越少的簇,理论采样权重越高。
若直接把上式当作最终概率,容易把聚类拆出来的冗余簇重复加权。因此SAGE把相似令牌合并成语义组后,使用下面的全局采样公式来训练数据:
合并令牌后的全局训练采样概率
合并令牌后的全局训练采样概率:先对合并组G_m求逆密度,再在组内均匀分配到每个子标签令牌。式中的|G_m|为组内子标签数量,分母在所有合并组上做全局归一化,兼顾了同一类内的冗余消除和不同类别间的长尾结构。

无需组标签:聚类驱动的子群体发现机制

SAGE整条流水线里最关键的一环,是如何在没有组标签的情况下找到“应该被补充”的子群。论文选择了一种在特征空间里做近邻传播聚类的方式。

近邻传播聚类(Affinity Propagation, AP)是一种不依赖预设簇数的方法。传统K-Means需要提前告诉算法“一共分多少类”,但在虚假属性未知时,我们根本不知道数据里有多少种背景、多少种视觉亚型。AP则是通过样本之间的信息传递,自动选出若干“代表点”,再让其余样本归属于最合适的代表点。它只需要一个相似度矩阵,矩阵里的相似度通常取负的平方欧氏距离。迭代过程中,算法维护两类消息——责任和可用性,前者衡量某个点适不适合当代表,后者衡量某个点有多大意愿选择别人当代表。收敛后,每个点都会找到自己的归属。

聚类完成之后,SAGE不是直接拿“簇编号”去生成,而是把每个簇映射成一个可学习的子标签令牌,并将这个令牌的嵌入加入文本编码器的词表。初始时,令牌嵌入用“photo”这个通用词来初始化,以减少数据集差异带来的训练不稳定。微调阶段,SAGE把提示词模板固定为“a photo of [类别标签], [子标签令牌]”。在扩散模型的交叉注意力机制里,类别标签提供全局锚点,子标签令牌则通过训练逐渐学会“代表这一类里某种特殊的视觉亚型”。这种做法,在没有外部属性标注的前提下,相当于让模型自己为每个子群“命名”。

一个很自然的疑问是:聚类得到的簇,真的能和虚假属性对上吗?论文给出了三个数据集的后验纯度统计:Waterbirds簇纯度达到93.66%,CelebA纯度达到98.17%,MetaShift纯度只有72.49%。这说明在较简单的偏置场景里,簇与真实虚假属性高度吻合;而MetaShift中即使对齐程度一般,SAGE依然有效。这个结果其实传递了一个更强的信号——SAGE并不要求簇必须完美等于真实组,只要簇能大致刻画数据分布中的稀疏区域,逆密度生成就能带来正向收益。

子标签令牌之间的合并策略同样值得留意。同一类别内的任意两个令牌如果嵌入方向过于接近,说明它们描述的是近似重复的视觉模式,合并后按语义组分配配额。这个合并阈值并非拍脑袋设定,而是根据同类令牌相似度均值动态缩放得到的。这样一来,既保留了AP聚类自动发现细粒度模式的优点,又不会让算法把一批几乎相同的图片误当成多个不同子群来过度生成。

实验结果:三大基准上的显著突破

论文在Waterbirds、CelebA和MetaShift三个基准上都做了完整评估,并严格区分了“训练/验证时是否看组标签”的条件。从主表数据来看,在“完全不使用组标签、也没有人工均衡验证集”的最严格设置下,SAGE的WGA分别达到89.5%、85.7%和79.1%。与同设置下的最佳无标签基线相比,它在CelebA上高出7.7个百分点,在MetaShift上高出5.6个百分点。更值得注意的是,在MetaShift上,SAGE甚至超过了所有使用组标签或人工验证集的方法,直接登顶全局第一。

相比传统非生成式方法,SAGE的优势来自它能够“造出数据里没有的新样本”。MaskTune、DISC这类方法本质上还是在原始训练样本上做文章,要么遮盖判别区域,要么做环境干预,它们无法凭空增加训练集中本来就不存在的组合。SAGE用条件扩散模型直接合成稀缺组合,等于把“没见过的世界”具象化给下游分类器看,因此在CelebA这种真实世界偏置上提升特别明显。

与生成式数据增强方法对比时,情况更有意思。ASPIRE同样不依赖人工组标注,但它需要借助大语言模型分析文本描述来发现虚假特征;DDB则要调用语言引导的分割模型和文本反演工具,并且还需要人工构造的组均衡验证集完成模型选择。SAGE把这些外部依赖全部砍掉,只靠“聚类+条件生成”两板斧。它在Waterbirds和CelebA上都明显超过ASPIRE+ERM和ASPIRE+DFR,效果如下表所示。

与生成式数据增强方法的最差组精度对比
表2:与生成式数据增强方法在Waterbirds和CelebA上的最差组精度对比。Group Info列说明该方法是否需要组标签引导生成或需要组均衡验证集做模型选择。SAGE是其中少见的全流程零依赖方法。

论文还对DFR前后的决策边界做了可视化。可以看到,ERM训练出的模型在合成验证集样本和真实测试样本上都存在明显偏移的决策边界,而经过DFR重加权后,绿色虚线的决策边界明显更贴合真正的类别分界。这个直观证据解释了为什么只重训最后一层、不改变任何深层特征,就能显著拉高最差组精度。

Waterbirds、CelebA和MetaShift上DFR前后的决策边界可视化
图3:Waterbirds(左)、CelebA(中)和MetaShift(右)上的决策边界可视化。左列为合成验证集样本与DFR后决策边界;右列为保留测试样本与ERM决策边界、DFR后决策边界的对比。绿虚线为DFR后决策边界,红虚线为ERM决策边界。

消融分析:各组件贡献的深度解析

SAGE最终的效果来自两个组件形成的“组合拳”:一个是用于训练分类器的混合训练集,另一个是用于DFR的合成均衡验证集。为了把两者的贡献彻底分开,论文特意设计了一套消融实验。下表展示了不接入DFR、只用混合训练集训练ERM分类器的结果。

不含DFR的混合训练集消融实验
表3:不含DFR的混合训练集消融实验。D为原始训练集;D_sg为使用通用Stable Diffusion按类别提示词生成、且与D_mix同规模的增强数据;D_mix为SAGE定向合成数据与原始数据的混合集。括号内给出了D_mix相对于D的最差组精度增益。

对照组D_sg很有意思。它把原版Stable Diffusion按普通类别提示词生成的图片加入到训练集,并把总规模补到和SAGE一致。结果显示,这种“无差别扩增”几乎没有带来正向收益,在某些数据集上甚至会让WGA小幅下降。原因不难理解:通用扩散模型生成的数据主要落在训练集已有的稠密区域,相当于把模型熟悉的分布又复制了一遍,并没有把稀缺组合补上。SAGE的D_mix则完全不同,它通过逆密度采样把生成配额集中在样本稀疏的簇上。仅在混合训练集这一项上,SAGE就在三个数据集上分别带来了4.3、5.2和6.1个百分点的WGA提升。这个结果清楚表明,真正的收益来自“知道该补哪里再生成”,而不是“多生成就有用”。

合成验证集的贡献同样通过消融做了单独验证。论文不混合训练集,而是只在原始数据上训练分类器,再分别使用人工构造的验证集和SAGE生成的合成验证集做DFR。结果呈现出鲜明的数据集差异:在Waterbirds上,人工验证集的DFR效果最好,因为它的虚假关联是人工设计的,分组定义恰好与真实分布严丝合缝;但在CelebA上,人工验证集的表现明显折戟,而SAGE的合成验证集反而大幅反超。MetaShift上合成验证集的DFR效果同样优于人工验证集。

生成均衡验证集的评估
表4:生成均衡验证集的评估。这里特意不使用混合训练集,只在原始数据集上训练,以便单独衡量验证集构造策略对DFR效果的影响。
这个看起来有些反直觉的结果,其实指向了一个深层问题:人工验证集的“均衡”只按少数几个粗粒度属性实现,CelebA中只有性别和发色两个二元属性,组内的视觉差异依然很大;而SAGE的合成验证集基于特征空间里更细粒度的子群做均匀覆盖,接近一种“细粒度伪均衡”。当真实数据的偏置并不像人工定义那样边界清晰时,这种来自数据分布的伪均衡反而比人工粗分组更可靠。

总结与展望:数据中心的鲁棒学习新范式

SAGE给鲁棒学习带来的启示,不只是“又多了一种能提升WGA的新方法”,而是把问题重心从模型侧重新拉回了数据侧。过去几年,研究者习惯了通过改造损失函数、设计特殊网络结构、增加对抗训练等手段来对抗虚假相关;SAGE却提出了一条更符合数据工程直觉的路线:如果数据分布本身就是偏的,那就直接把数据分布修好。


龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?数据不平衡常让模型靠“背景”等虚假关联做判断。哈工大提出SAGE,在无分组标签、无人工标注验证集条件下,用聚类子标签驱动扩散模型定向补数据,最差组精度最高提升7.7个百分点。
这篇工作最值得看的点是什么?SAGE在Waterbirds、CelebA和MetaShift上分别达到89.5%、85.7%和79.1%的最差组精度,在无组标签设置下分别超过最佳基线0.8、7.7和5.6个百分点,在MetaShift上超过所有列出的方法。
这篇工作的边界或风险在哪里?优点:(1) 无需组标签或人工筛选的平衡验证集,更贴近实际场景;(2) 通过聚类发现子群体,避免依赖外部模型(如LLM或分割工具);(3) 生成数据提供新的视觉实例,避免重复采样导致的过拟合。缺点:(1) 聚类质量直接影响生成效果,当聚类与虚假属性对齐不佳时(如MetaShift上纯度仅72.49%),性能提升受限;(2) 需要微调扩散模型,计算成本较高;(3) 子标签token的合并阈值β需要针对数据集调整。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出两阶段生成式增强框架SAGE,通过语义特征聚类发现子标签,微调条件扩散模型生成针对性的合成数据以填补欠表示区域,并构建子标签平衡的合成验证集用于最后一层重加权。

实验合理度:★★★★☆

最差组精度(Worst-Group Accuracy, WGA)和平均精度(Average Accuracy)

学术研究价值:★★★★☆

提出两阶段生成式增强框架SAGE,通过语义特征聚类发现子标签,微调条件扩散模型生成针对性的合成数据以填补欠表示区域,并构建子标签平衡的合成验证集用于最后一层重加权;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

Stable Diffusion微调在2张NVIDIA RTX 4090 GPU上运行;其他阶段在单张NVIDIA RTX 4090 GPU上运行

复现难度:★★★☆☆

https://github.com/luoym-lym/SAGE

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 聚类质量直接影响生成效果,当聚类与虚假属性对齐不佳时(如MetaShift上纯度仅72.49%),性能提升受限;(2) 需要微调扩散模型,计算成本较高;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。