← 返回 PaperDaily 视觉与图像

不算相似度,靠一致率聚类:CoOL的反常识思路

这篇 CoOL 很有意思:不靠距离、不算相似度,靠多个观察者“商量一致”来做聚类。更妙的是,它还把收敛监控、分布漂移检测一起打包了,属于那种思路怪,但讲得通的论文。

不算相似度,靠一致率聚类:CoOL的反常识思路
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇 CoOL 很有意思:不靠距离、不算相似度,靠多个观察者“商量一致”来做聚类。更妙的是,它还把收敛监控、分布漂移检测一起打包了,属于那种思路怪,但讲得通的论文。


原论文信息如下:
论文标题:
Cohort Organized Learning: Clustering Through Agreement
发表日期:
2026年06月
发表单位:
SLAC National Accelerator Laboratory; Kavli Institute for Particle Astrophysics and Cosmology, Stanford University
原文链接:
https://arxiv.org/pdf/2606.21743v1.pdf

一种无需距离的聚类方法:CoOL原理介绍

聚类这件事,传统思路基本都绕不开“距离”两个字:离得近的归一类,离得远的分开。可现实数据往往不太配合,尤其是高维数据,距离一旦失真,算法就像拿着近视眼镜去抓蚊子,忙活半天还不一定抓对。
这篇论文提出的 CoOL,全称是 Cohort Organized Learning,中文可以理解成“协同组织学习”或“成组协同学习”。它的核心想法很有意思:不直接算样本之间的距离,而是让多个可学习的观察者先各自猜,再通过一致性来逼近最终聚类。换句话说,CoOL不是问“你离谁近”,而是问“你们几个到底能不能先统一口径”。
图1:CoOL中的数据流与反向传播关系
图1:CoOL中的数据流与反向传播关系。多个观察者同时看同一批样本,先各自输出类别,再通过期望最大化把“意见”揉成共识,最后把共识反向传回网络继续训练。
这里的“观察者”并不是人,而是多个可微分的神经网络。它们都要给每个样本打标签,但标签不是直接拍脑袋定的,而是先由网络输出概率,再进入一轮 期望最大化(EM,Expectation Maximization,中文叫“期望最大化算法”)来整理意见。原始思想可以追溯到 Dawid 和 Skene 的经典工作:多个“专家”给出判断,EM 负责估计样本的真实类别,以及每个专家到底靠不靠谱。
CoOL把这个套路升级成了“可训练版本”:专家不再是固定的,而是神经网络;“靠谱程度”也不是写死的,而是在训练中一起学出来。于是,聚类不再靠距离矩阵那套老办法,而是靠多个模型之间的标签共识来完成。
图2:用于聚类的二维三类样本
图2:用于聚类的二维三类样本。这个例子并不“友好”,因为三类样本在空间里彼此缠得有点乱,正好用来测试 CoOL 到底是真有两把刷子,还是只是嘴上会说。
论文里先给出一个很直观的流程:第一步,用户定义观察者数量、类别数和训练超参数;第二步,所有观察者同时看同一批样本并输出类别概率;第三步,把这些输出送进 EM 迭代,估计样本属于各类的概率,以及每个观察者的可靠性矩阵;第四步,再把这些结果变成损失函数,反向传播回各个网络。这个设计最妙的地方在于,网络不是单打独斗,而是在训练中互相“掰手腕”后达成一致
为了让这个过程更容易懂,可以把 CoOL 想成一个小型评审团:每个评审先给出自己的判断,之后系统统计“谁和谁意见一致”,再逐轮修正各自的判断标准。最后不是某一个评审赢了,而是整个团体学会了如何更稳定地分组。插图

期望最大化驱动:CoOL如何让观察者达成共识

CoOL 的训练逻辑可以拆成“先猜、再统计、再修正”。先把每个观察者的输出平均一下,得到样本属于各类的初始概率:
公式1:初始类别概率的平均估计
这里 K 是观察者个数,sij(k) 是第 k 个观察者对第 i 个样本属于第 j 类的概率。第一步很朴素:先把所有观察者的意见平均,作为初始“共识草案”。
接着,EM 会估计每一类在数据中的比例:
公式2:类别比例估计
其中 pj 表示第 j 类样本的占比。它的作用像“班级里有多少人举手支持这个观点”,后面会作为先验参与更新。
然后轮到每个观察者“交作业”。论文没有直接用概率分布做统计,而是从每个观察者的输出里采样出一个离散标签,构造出二值矩阵,再估计可靠性矩阵:
公式3:未归一化可靠性矩阵 公式4:归一化后的可靠性矩阵
这里的 π(k) 可以理解为第 k 个观察者的“标签习惯表”:它反映了这个观察者更容易把哪一类错看成哪一类。CoOL 的妙处就在于,它不是把这些偏差当噪声扔掉,而是把偏差本身也学进去。
有了类别比例和可靠性矩阵之后,EM 会再次更新每个样本属于各类的后验概率:
公式5:样本类别后验概率更新
这一轮更新就是“谁更像谁”在概率层面重新洗牌。等 EM 走完一轮,再把结果变成损失函数,回传给网络训练。
公式6:总损失函数
这个损失函数很关键,它由两部分组成。第一部分是常见的交叉熵,负责让网络朝着当前共识去拟合;第二部分是一个基于 行列式 的正则项,目的是避免所有观察者最后都塌缩成“一个大类”。论文发现,如果没有这项约束,模型很容易走捷径:大家干脆都说“全都属于同一类”,那当然一致了,但这叫偷懒,不叫聚类。
所以作者又专门分析了两个梯度项:一个来自交叉熵,一个来自行列式正则。前者让“被选中的标签”获得更强梯度,后者则像一个全局约束,推动各观察者别老往同一个坑里跳。论文里还比较了不同正则写法,结论很明确:直接对未归一化的可靠性矩阵做行列式正则,更稳,也更容易把样本真正分开
公式7:交叉熵项的梯度 公式8:行列式正则项的梯度
这两条梯度路线,一个负责“朝正确标签收敛”,一个负责“防止所有人抱团躺平”。从优化角度看,CoOL 的训练其实像在拉扯:既要一致,又不能一致到只剩一个类。

无标签状态下的收敛监控指南

聚类最烦的一点就是:它不像分类任务,训练时还能拿真值标签对照一下。CoOL 也一样,很多时候根本没有标签可看,所以论文专门设计了一套“无标签监控面板”。
作者建议重点观察五个指标:损失一致率唯一类别数可靠性矩阵行列式,以及 Shannon Equitability Index(SEI,香农均衡指数)。其中 SEI 用来衡量类别分布是否均匀,公式如下:
公式9:Shannon均衡指数
SEI 越接近 1,说明类别越均衡;接近 0,说明数据或预测几乎塌成一个类。这个指标的妙处在于,它不需要知道真标签,也能看出模型是不是在“装作聚类,实际上全在一锅炖”。
图3:训练过程中一致率与唯一标签数的变化
图3:训练过程中一致率与唯一标签数的变化。上图是加入行列式正则后的结果,下图是去掉正则后的结果。可以看到,没有正则时,模型很容易滑向“所有样本都进同一类”的偷懒解。
图5:两种正则策略下的损失、行列式和SEI变化
图5:两种正则策略下的损失、行列式和SEI变化。虽然两种设置都能得到较高一致率,但只有直接对未归一化可靠性矩阵做正则,才更稳定地把样本分成真正有意义的多个类。
这套监控方式很实用,因为它给了一个“无标签时怎么判断训练有没有跑偏”的答案。一般来说,如果一致率持续上升、唯一类别数不塌缩、行列式逐渐变大、SEI 接近 1,那就说明 CoOL 在朝正确方向走。反过来,只要其中一项明显异常,基本就可以警惕模型是不是已经开始“集体摆烂”。

MNIST上的表现:CoOL的优势与局限

论文先在 MNIST 上做了比较系统的测试。这里不是为了刷最强成绩,而是想看 CoOL 在经典聚类任务上到底能不能站住脚。作者比较了卷积版 CoOL、全连接版 CoOL,以及 IDEC、TELL、SpectralNet 和 k-Means 等方法。
图6:不同超参数下的一致率与准确率关系
图6:不同超参数下的一致率与准确率关系。可以看到,一致率和最终准确率大体上是同步的,这说明“观察者们是否达成一致”确实能作为聚类质量的一个信号。
图7:不同类别数下可靠性矩阵行列式的变化
图7:不同类别数下可靠性矩阵行列式的变化。类别数一多,训练就明显更难,行列式也更容易卡住。这说明 CoOL 不是“无脑通吃”,它对类数上升还是挺敏感的。
表1:MNIST上不同深度聚类模型的对比结果
表1:MNIST上不同深度聚类模型的对比结果。CoOL 在 3 类和 5 类场景下效果不错,但到了 7 类和 9 类,性能下滑就比较明显了;相比之下,IDEC 在这组实验里更稳,尤其在高类别数时优势更明显。
从表1能看出,CoOL 的强项不是“在所有设置里碾压别人”,而是提供一种新的聚类机制:它在低类别数、结构相对清晰时能较好工作,而且一致率与准确率之间存在比较强的相关性。它的局限也很直接:类别数上去以后,训练更容易不稳定,甚至出现某些观察者学不动、行列式接近 0 的情况。
为了进一步看 CoOL 学到了什么,论文还把样本按聚类结果分组,统计每组内部的一致性。
表2:5类数字聚成4类时的样本分组统计
表2:5类数字聚成4类时的样本分组统计。很多组内部一致性很高,说明 CoOL 并不是胡乱分桶,而是确实学到了一些稳定的局部结构;但也有少量混杂组,提示它对边界样本仍然不够“铁面无私”。
如果把 MNIST 这部分总结成一句话,那就是:CoOL 证明了“靠共识做聚类”是可行的,但它并没有把所有传统方法都按在地上摩擦。它更像一种新路线,而不是现成的终极答案。

CIFAR-10上的尝试:预训练骨干网络的价值

MNIST 太“规整”,不太能代表真实世界。于是作者又拿 CIFAR-10 做了更难的测试。这里的重点不是直接拿原始像素硬刚,而是先用预训练骨干网络提取特征,再把这些特征喂给 CoOL。这个思路很现实:图像太复杂时,先让一个靠谱的 backbone 帮忙打底,再让 CoOL 去做聚类,成功率会更高。
表3:CIFAR-10上的CoOL表现
表3:CIFAR-10上的 CoOL 表现。结果显示,CoOL 在更复杂的数据上并不稳定,部分设置能收敛,部分设置则会失败,甚至在更高类别数下几乎跑不起来。
这说明一个很现实的问题:CoOL 的共识机制本身是有潜力的,但它对特征质量和优化稳定性比较挑剔。换句话说,如果输入特征已经比较“像样”,CoOL 才更容易把共识建立起来;如果特征太乱,它就会像一群人围着一团毛线球开会,越讨论越乱。
论文后面还讨论了训练耗时、内存占用、观察者数量、正则强度等因素。整体结论比较朴素:观察者越多,开销越大;正则太弱容易塌缩,太强又可能把类别结构压坏;而在高类别数场景里,训练窗口会明显变窄。也就是说,CoOL 不是“开箱即用的聚类神器”,而是一个需要认真调参、认真看监控曲线的研究型方法。

总结与未来:从理论到应用的潜力

CoOL 最值得记住的,不是它在某个基准上拿了多高分,而是它提出了一种新的聚类组织方式:让多个可学习观察者通过一致性来完成无监督分组。这个思路在科学数据、仪器数据、日志聚类、异常模式发现等场景里都有潜在价值,尤其适合那些“样本多、标签少、结构复杂”的任务。
不过,论文也把短板说得很清楚:它目前对类别数、初始化、正则强度、特征质量都比较敏感;在高类别数或复杂数据上,优化可能变得不稳定;而且它还依赖同时观察同一批样本,这在某些流式或异步场景里不一定方便。未来如果能把 EM 迭代做得更稳、把观察者之间的同步要求放宽、再结合更强的特征提取器,CoOL 可能会更接近实用。
从写论文的角度看,这篇工作也挺有启发:如果传统的距离或相似度定义不够可靠,不妨换个角度,看看能不能用“共识”“一致性”“互相校正”来建模。很多时候,问题不是数据不会分,而是我们总想拿同一把尺子去量所有东西。CoOL 的态度很直接:尺子不一定要先有,先让一群人把标准吵出来也行。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“无标签数据怎么聚类”这个老大难问题。CoOL 的做法不是直接算距离,而是让多个神经网络观察者先各自判断,再用 EM 让它们逐步达成一致,最终形成聚类结果。

文中的“观察者”和“可靠性矩阵”是什么意思?观察者就是多个可训练的神经网络,负责给样本打标签;可靠性矩阵则描述这个观察者把真实类别看成各个输出类别的偏好,能理解成“这个模型容易把谁认错成谁”的统计表。

为什么要看一致率、行列式和SEI这些指标?因为聚类没有真标签时,不能只靠“感觉像对了”。一致率看观察者有没有达成共识,行列式看可靠性矩阵有没有塌缩,SEI 看类别是否均衡,这三者合起来,能比较靠谱地判断训练是不是在往正确方向走。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆
CoOL 的“共识式聚类”思路挺新,不是传统距离聚类的小修小补,而是换了一套组织方式。

实验合理度:★★★☆☆
实验设计围绕机制验证展开,逻辑清晰;但在高类别数和复杂数据上稳定性一般,离“全面压制”还有距离。

学术研究价值:★★★★☆
它给无监督聚类提供了一条新路线,尤其对标签稀缺、结构复杂的数据有启发意义。

稳定性:★★★☆☆
低类别数时还能看,类数一高就容易不稳,说明方法还没到“随便扔数据都能跑”的程度。

适应性以及泛化能力:★★★☆☆
可以迁移到图像和向量数据,但对特征质量、同步输入和超参数比较敏感。

硬件需求及成本:★★★☆☆
多个观察者并行训练,开销不算低;好在模型结构不复杂,训练成本主要来自多网络协同。

复现难度:★★★☆☆
思路能懂,但 EM、采样、正则和监控指标一起上,调起来不算省心。

产品化成熟度:★★☆☆☆
更像研究原型,适合探索性分析,不太适合直接上生产线。

可能的问题:高类数时容易塌缩,且依赖同步观察与较好的特征输入,离大规模稳定应用还有一段路。


主要参考文献

Finn H. O’Shea, Maria Elena Monzani. Cohort Organized Learning: Clustering Through Agreement. arXiv:2606.21743v1, 2026.
Dawid, A. P., & Skene, A. M. Maximum likelihood estimation of observer error-rates using the EM algorithm. 1979.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!  

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。