← 返回 PaperDaily 视觉与图像

大连理工ACM MM 2026:视图不齐也能聚类,ACC提升近6%

多视图聚类最怕数据对不齐:设备故障、存储分离,大量样本的视图配对关系直接丢失。大连理工这篇ACM MM 2026工作,用锚点图加匈牙利算法的双重对齐策略,把对齐从“一次完成”升级为“二次校准”,在六个数据集上ACC最高比第二名提升5.97%,还顺手缓解了单次对齐误差大的老毛病。想看看GCN怎么在错位数据里找回结构的,这篇值得读。

原论文信息如下:
DAS-PMVC框架总体示意图

1. 视图对不齐,聚类全白干——什么是部分视图对齐问题

想象一下:几百人拍合影,左右两台相机各拍一张。事后要把同一个人对应起来,却发现由于设备故障,一部分人在两张图里根本对不上号。这时候让你按班级把人分出来,会不会一个头两个大?
这就是多视图聚类里臭名昭著的PVAP(Partial View Alignment Problem,部分视图对齐问题)。多视图聚类本身挺好理解:同一个东西,用不同方式去描述它。比如一部电影,可以用海报画面表示,也可以用字幕文本表示;一篇文章,可以看它的词语内容,也可以看它的引用关系。把多个视角的信息合起来做聚类,往往比只用单一视角效果好得多。
但问题恰恰出在“合起来”这一步。绝大多数多视图聚类方法都有个隐含假设:不同视图的样本是完全对齐的,第一个视图的第i个样本和第二个视图的第i个样本就是同一个东西。可在真实场景里,这个假设几乎不可能成立:采集设备硬件故障、不同设备的存储和处理相互独立、数据传输过程出现噪声……各种各样的情况都会导致样本对应关系的丢失。于是两个视图之间只有一部分样本能对上号,剩下的全是“无家可归”的错位样本。
图1:不同场景下的多视图数据示例。图(a)表示两个视图完全对齐;图(b)表示每个视图各自存在缺失样本;图(c)表示部分样本对齐、部分样本错位,即本文讨论的部分视图对齐场景。
过去遇到这种情况,一些方法干脆把没对齐的样本丢掉,把问题转换成不完整多视图聚类(incomplete multi-view clustering)。但这样做有一个很尴尬的后果:如果两个视图里能对上的样本只有一半,相当于直接丢弃了一半数据,信息损失太大了。更聪明的思路是:与其扔掉错位样本,不如想办法把它们重新对齐。
也有一批研究者已经在这条路上探索过,比如基于最大协方差分析(Maximum Covariance Analysis, MCA)配合匈牙利算法(Hungarian algorithm)做逐步对齐,或者基于非负矩阵分解(Non-negative Matrix Factorization, NMF)分别聚类再建立对应关系。但这些方法有两个明显的短板:一是它们大多是浅层模型,表示能力有限;二是它们把“视图对齐”和“下游聚类任务”分成两个独立步骤来做,不能在同一个框架里互相促进。
龙哥表情包
大连理工大学等单位的研究者们显然不满足于这种“治标不治本”的方案,他们提出的DAS-PMVC框架,就是要同时解决“对不齐”和“特征不够强”这两个难题。这项工作发表在第34届ACM国际多媒体会议上(ACM MM '26),论文全称是《DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement》。名字很长,翻译过来就是:通过双重对齐与结构增强实现部分多视图聚类的一套框架。

2. 双引擎驱动:锚点图粗对齐与匈牙利算法精对齐

DAS-PMVC的核心思路,用一句话概括就是:先把大体上对得上的样本归位,再对细节进行二次校准。整个框架最重要的设计就是双重对齐策略(Dual Alignment Strategy)。
第一重对齐发生在预训练阶段,靠的是锚点图(Anchor Graph)。这里要先解释一下锚点是什么。在部分对齐的多视图数据里,有一小部分样本在两个视图中是已知的、确定能对上的——这些样本就是天然的“锚点”,相当于GPS里的基准卫星。既然样本之间本来就存在对应关系,那就可以通过锚点作为桥梁,把那些还没对齐的样本映射到一个共同的潜在空间里,实现初始对齐。
可能有人会问:为什么不用更常见的KNN图(K-Nearest Neighbors,K近邻图)来做这件事?论文里给出的理由是:KNN图的构建对参数k太敏感,k选小了抓不住潜在的样本关系,k选大了图结构冗余、计算开销陡增;而且KNN图本质上只关注局部邻域,容易忽略全局结构。锚点图就聪明得多:它只选一小撮有代表性的点当锚点,然后计算每个样本和锚点之间的相似度,用这种方式同时兼顾局部信息和全局信息,计算复杂度也低。
具体怎么构建锚点图呢?假设有两个视图u和w,先从视图u里找到对齐样本作为锚点集合A(u),从视图w里找到对应的锚点集合A(w)。然后计算视图v中每个未对齐样本ui和锚点aj之间的相似度Wij,使用的是带高斯核的余弦距离:
Wij = exp(−D²(ui, aj)/σ²) / ΣjΣi exp(−D²(ui, aj)/σ²)
其中D²(·)表示平方余弦距离,σ是高斯核的带宽参数。算出来之后,还要做一步结构过滤(Structural Filtering):对每个样本,只保留它和最近的那几个锚点之间的连接,其他相似度直接置零。这一步说白了就是“断舍离”——把不相关的边砍掉,避免无关样本干扰后续对齐。
图2:锚点图结构对齐示意图。绿色和蓝色表示未对齐的样本;上半部分展示锚点选取和结构过滤过程,下半部分展示通过联合嵌入表示W引导原始样本完成初步对齐的过程。
到这里,两个视图的样本都被转换成了锚点空间里的表示W(u)和W(w)。因为它们共享同一套锚点,所以天然处在同一个维度空间里。接下来就是第一个关键步骤:基于这两个表示计算相似度矩阵S,然后用匈牙利算法寻找最优匹配,得到置换矩阵P,把视图w的样本顺序重新排列,让它尽量和视图u对齐。这一步得到的是“初步对齐”的数据,记为X̂(u)和X̂(w)。
第二重对齐则发生在正式训练阶段。既然粗对齐已经完成,那么样本的特征表达也已经可以学习了,这时候可以在特征空间里再做一次匹配。论文的做法是用多视图图卷积网络(Graph Convolutional Network, GCN)学习潜在特征H(v),然后在特征空间构造二部图,再次调用匈牙利算法求图匹配,得到对齐矩阵Qw,u,对特征H(v)做二次重排:
Ĥ(v) = Qw,uH(v)
为什么非要搞两次对齐?这就好比让一个新手整理档案,第一次按姓名拼音排了一遍,但里面还有不少错误,第二次再按身份证号核对一遍,错误率就大大降低了。论文的核心论点也在于此:现有的单次对齐方法会产生大量对齐误差,而双重对齐可以把误差显著降下来。

3. 结构增强特征学习如何让聚类“更有数”

对齐问题解决了,接下来要操心的是:学出来的特征到底适不适合聚类?如果特征之间没有区分度,聚类结果就是一团浆糊。DAS-PMVC把这部分工作叫作结构增强特征学习(Structure-Enhanced Feature Learning),包括三个组件:上面提过的结构过滤、预训练阶段的结构对齐损失、以及GCN训练中的邻接矩阵引导和结构重建损失。
整个训练过程分成两个阶段,损失函数的设计非常有代表性。
图3:两步训练损失函数示意图。预训练阶段的损失由样本重建损失和结构对齐损失组成;训练阶段的损失由样本重建损失、结构重建损失和对比损失组成。
预训练阶段用到两个损失。第一个是重建损失L1:把每个视图的编码器fv(·)输出的特征交给解码器dv(·),要求能还原原始样本数据,这保证编码器没有丢掉关键信息。第二个是结构对齐损失L2:取一部分对齐样本,把视图w的样本顺序打乱,要求两个视图编码后的潜在特征经过匈牙利算法对齐后,坐标尽量一致。这两个损失合在一起,让模型从一开始就朝着“特征紧凑、视图语义一致”的方向优化。
正式训练阶段,模型把预训练得到的对齐数据拿过来,为每个视图构建KNN相似度图G(v),然后送入多视图图卷积编码器。GCN的原理这里简单展开一下:图卷积的本质是让每个节点的特征沿着图的边向邻居节点传播聚合,经过多层堆叠后,每个节点就能“感知”到多跳范围内的结构信息。这正是DAS-PMVC需要的——对齐之后相似样本在图里会彼此靠近,GCN再一传播,同类样本的特征自然就聚拢了。
在GCN训练阶段,模型不仅要求能重建原始样本矩阵,还要求能重建样本之间的相似度图,这就是结构重建损失L3
L3 = Σv‖X̂(v) − X̄(v)‖²F + λ1Σv‖G(v) − Ḡ(v)‖²F
前一项是样本矩阵重建,后一项是图结构重建,λ1是正则化参数。强制模型重建图结构,等于是在逼它把“谁和谁是一类”的信息写进特征里,这一步是提升聚类判别力的关键。
最后的点睛之笔是引入对比损失L4(Contrastive Loss)。这里用到了对比学习(contrastive learning)的思想:已经对齐的样本对构成正样本对,让它们的特征距离尽量近;没有对齐关系的样本随机配对构成负样本对,让它们的特征距离尽量远。对比损失的定义比较讲究,论文里用了带边距m的距离度量,m根据当前批次的正负样本距离动态调整。这相当于给对齐过程加了一个实时反馈信号——一旦模型发现某个样本对的位置不对,对比损失就会把它往正确的方向拽。
最终的目标函数是L3和L4的组合。这里有一个很巧妙的闭环:锚点图做初步对齐,GCN在初步对齐的图上学习结构特征,对比损失反过来修正对齐误差,修正后的特征再用于更新图结构……两者交替优化,互相促进。用作者的话说,就是“双重结构引导”贯穿整个学习过程。

4. 六大基准×八种对比法:DAS-PMVC实验结果全览

方法讲完,来看硬核实验。作者在6个公开多视图数据集上做了验证,覆盖了小规模到大规模、低维到高维、少类别到多类别的各种情况。数据集信息如下:
表1:数据集描述。其中Caltech20包含2386个样本,2个视图,20个类别;BDGP包含2500个样本,2个视图,5个类别;Scene-15包含4485个样本,2个视图,15个类别;Aloi包含10000个样本,2个视图,100个类别;3Sources包含169个样本,2个视图,6个类别;BBCsports包含282个样本,2个视图,5个类别。
对比方法一共8种。其中PVC(Partially View-aligned Clustering,部分视图对齐聚类)、MvCLN(Multi-view Clustering with Contrastive Learning and Noise-resistant loss,带对比学习和抗噪损失的多视图聚类)、EGPVC(Enhanced Graph-based Partially View-aligned Clustering,基于图增强的部分视图对齐聚类)、ProImp、TCLPVC(Triple-Consistency-Learning Partial View Clustering,三重一致性学习的部分视图聚类)、EAGCP(Embedding Anchor Graph for Clustering with Partial Views,基于嵌入锚点图的部分视图聚类)都是专门处理部分对齐场景的主流方法。另外两个方法AE2-Nets和Cmib-Nets本身不处理部分视图对齐数据,作者的做法是先预训练自动编码器把原始数据映射到潜在空间,再用匈牙利算法建立对应关系,相当于给它们加了“外挂”来适配任务。
实验设置上,所有数据集的视图对齐率统一设为0.5,也就是只有一半样本保留正确的跨视图对应关系,剩下的样本顺序被随机打乱。评价指标使用聚类领域的三个标准:ACC(Accuracy,聚类准确率)、NMI(Normalized Mutual Information,归一化互信息)和ARI(Adjusted Rand Index,调整兰德指数),三个指标都是越高越好。
表2:在Scene-15、BBCsports、3Sources和Aloi数据集上、50%视图对齐率下的聚类性能比较。加粗为最优结果,加下划线为次优结果。
表3:在BDGP和Caltech20数据集上、50%视图对齐率下的聚类性能比较。加粗为最优结果,加下划线为次优结果。
从表2和表3可以看到几个明显的信息点。第一,DAS-PMVC在ACC指标上一骑绝尘:6个数据集拿了5个第一。3Sources数据集上ACC达到0.5341,比第二名EAGCP高出5.79个百分点;Caltech20上ACC达到0.5731,比第二名EGPVC高出5.97个百分点。第二,NMI和ARI成绩没有ACC那么亮眼,但仍然在多数数据集上保持领先。第三,在Aloi数据集上,DAS-PMVC的NMI和ARI未能超过TCLPVC,这个现象论文里也有解释:Aloi有100个类别,类别过多会导致类别间不平衡,对NMI和ARI这两项对分布敏感的指标造成明显影响。
ACC高说明什么?说明总体的“认人”能力很强,哪些样本应该归为一类,模型判断得很准。NMI和ARI偏低说明什么?说明聚类结果在类别之间的分布比例上不够均衡,可能某些小类别被合并了,或者某些大类别被拆散了。这在类别数量悬殊的数据集上其实是可以预料到的。
龙哥惊叹表情包
光看总体对比还不够,论文还做了两组消融实验来验证各模块的有效性。第一组实验对比了锚点图对齐和直接在原始属性上做对齐两种方案,在不同视图对齐率ar(从0.1到0.9)下的表现。
表4:在Caltech20、3source和Scene-15数据集上、不同视图对齐率下两种对齐方法的对齐率比较。ar表示初始对齐率(alignment rate)。
结果非常直观:锚点图对齐方法全面碾压属性直接对齐方法。最夸张的是3Sources数据集上,ar=0.9时锚点图对齐率达到0.91,属性对齐只有0.33;即使ar只有0.1,锚点图对齐仍然能到0.67。这充分说明了把样本映射到锚点共同空间再做匹配,远胜于在原始特征空间里硬找对应关系。
图4:在Caltech20、3source和Scene-15数据集上、不同视图对齐率下锚点对齐(Anchor)与属性对齐(Attribute)两种方法的对齐效果对比。
第二组消融实验更有意思:把DAS-PMVC里的锚点图对齐模块整个去掉,只保留GCN加对比学习和两步对齐部分,得到了一个名为PMGCN的对比模型。在BDGP和Caltech20上对比结果如下:
表5:DAS-PMVC与PMGCN在BDGP和Caltech20数据集上的聚类结果对比。PMGCN移除了锚点图对齐模块,仅保留图卷积对比学习网络和两步对齐部分。
去掉锚点图对齐后,Caltech20上ACC从0.5682掉到0.3502,掉了21.8个百分点;BDGP上从0.7926掉到0.5376,掉了25.5个百分点。这说明锚点图对齐模块不是可有可无的装饰品,而是整个框架性能的顶梁柱。回过头再想一下:如果没有锚点图先把样本大体归位,后面GCN面对的图结构里全是错乱的关系,学出来的特征自然也好不到哪里去。

5. 别急着照搬:这套方法在哪些场景会“失灵”

任何一个方法都有它的能力边界,DAS-PMVC也不例外。从实验数据能清楚地看到两个痛点场景。
第一个痛点是图结构天然稀疏或局部关系弱的数据。典型代表就是BDGP数据集。BDGP是从果蝇胚胎图像中提取的视觉特征和文本特征,论文指出这类数据的局部结构关系非常弱,图里有效边太少,GCN很难通过邻域传播捕捉到有用的潜在关系。这不是DAS-PMVC一个方法的问题——同为GCN路线的EAGCP在BDGP上也只有0.30的ACC,比随机猜好不了多少。可以说,只要方法依赖图结构,就会遇到“图建不起来就全完蛋”的困境。
第二个痛点是类别数量特别多且分布不平衡的数据。Aloi数据集有100个类别,DAS-PMVC的ACC虽然还是最高的,但NMI和ARI被TCLPVC反超。原因在于:类别过多时,聚类结果的分布均衡性会比总体准确率更难保证,NMI和ARI恰恰对这种不平衡非常敏感。
龙哥无语表情包
另外在实际部署前还需要掂量一下工程成本。DAS-PMVC的训练流程包括预训练和正式训练两个阶段,预训练阶段要做锚点图构建和匈牙利匹配,训练阶段要跑GCN和对比学习,整体的流程和超参数都比单阶段方法复杂。论文把复杂度分析放在附录里,也说明效率优化并不是这篇文章的重点。如果数据集动辄数十万样本,锚点图构建和匈牙利匹配的开销就需要认真评估了。不过换个角度看,锚点图本身已经是为大规模数据设计的降复杂度方案,真要硬刚超大图,应该还有优化的空间。

龙迷三问

下面是龙哥对大家可能的一些问题的解答:

论文里提到的“部分视图对齐”和“不完整多视图”到底有什么区别?二者的核心区别在于“缺失”的形式不同。不完整多视图(incomplete multi-view)指的是每个视图里有一部分样本整体没采到,样本在某个视图下是缺失的;而部分视图对齐(partial view alignment)指的是样本在两个视图中都存在,但不同视图之间的对应关系丢了,或者说配对关系部分错位了。打个比方:前者是“左边照片里少拍了几个人”,后者是“人都在,但左右两张照片里的人没法一一对上号”。论文明确强调,不能简单把后者转成前者来处理,因为那样要丢弃大量数据。

匈牙利算法在这里起什么作用?为什么要在锚点图之外再用它做第二次对齐?匈牙利算法是一种经典的组合优化算法,用于在多项式时间内求解二分图(bipartite graph)上的最大权匹配或最小代价匹配问题。通俗地说,给定两边的点以及两两之间的匹配代价,它能算出总代价最小的一组配对方案。在DAS-PMVC里,第一次用匈牙利算法是在锚点空间内对W矩阵找最优匹配,得到初始置换矩阵P;第二次是在GCN学到的特征空间里再做一次匹配,得到校准矩阵Q。两次对齐的理由在于:锚点空间的匹配比较粗糙,而特征空间经过GCN学习后判别性更强,在更“干净”的空间里做二次匹配能大幅降低误差。正是这个“粗对齐+精校准”的组合,让双重对齐策略明显优于单次对齐。

对比损失L4的定义里,边距m为什么要动态计算?对比损失的一般形式是让正样本对距离尽量小、负样本对距离尽量大,而“多大算大”需要一个边界值来界定。论文里的m并不是拍脑袋定死的常数,而是根据当前批次所有正样本对和负样本对的实际距离计算出来的:它等于正样本对距离的均值加上负样本对距离的均值。这个设计的巧妙之处在于,m会随着训练过程自动适应特征的尺度变化。训练初期特征比较散,m比较大;训练后期特征逐渐聚拢,m也跟着变小,这样对比损失的“推拉”力度始终在一个合理的范围内,不容易出现梯度振荡。中文可以理解为“自适应边距的对比损失”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

双重对齐策略把锚点图粗对齐和匈牙利算法精对齐串成一条流水线,构思巧妙,对比损失配合动态边距也体现了设计上的用心。不过每个单点技术本身都不是全新的,胜在组合方式的合理性。

实验合理度:★★★★☆

6个数据集、8种对比方法、3个指标,覆盖了不同规模和类别的场景,消融实验也做了两个维度(对齐方法对比和模块移除),实验设计相对完整。扣一星是因为Aloi上NMI和ARI的短板分析不够深入,BDGP上的失败原因更多是定性推测。

学术研究价值:★★★★☆

这项工作的价值在于为“先对齐后聚类”的单次对齐旧范式提供了一个升级样本:通过双重对齐加结构增强的组合,把对齐误差显著降下来。对后续做部分视图对齐、缺失视图补齐、跨模态匹配的研究者来说,有不错的参考价值。

稳定性:★★★☆☆

在两个阶段交替优化的框架里,超参数(λ₁、边距m、锚点数量、GCN层数)之间的相互影响可能比较敏感,不同数据集上需要花时间调参。实验结果也显示在部分数据集上存在指标波动,尚不具备拿来即用的成熟度。

适应性以及泛化能力:★★★☆☆

在多个数据集上ACC表现领先是可喜的,但对图结构稀疏的数据(如BDGP)和类别极多且不平衡的数据(如Aloi)有明显短板。框架对“视图间存在共享锚点”的依赖也意味着,如果锚点比例极低,性能可能大幅下滑。

硬件需求及成本:★★★☆☆

预训练加正式训练的两阶段流程、GCN的图传播、匈牙利算法的匹配计算,综合起来训练开销不小。但锚点图本身相比全量KNN图已经显著降低了图的边数和存储,在中等规模数据上是可接受的。

复现难度:★★★☆☆

论文给出了完整的数学定义和算法流程,但代码没有开源。锚点图构建、匈牙利匹配、GCN和对比学习的组合涉及不少实现细节和超参数调整,复现需要一定的工程量。

产品化成熟度:★★☆☆☆

当前定位是学术研究阶段的方法,在数据分布理想、类别均衡、锚点比例足够的情况下,可以用于实际的聚类分析任务。但训练流程复杂、调参成本高、对特殊数据分布敏感,直接产品化还有距离。

可能的问题:论文对Aloi和BDGP上的短板分析偏定性,缺少针对失败原因的深层机制研究;消融实验仅覆盖了两个数据集,说服力有限;对比方法中的AE2-Nets和Cmib-Nets属于后接匈牙利算法的适配方案,公平性上可以进一步讨论;代码未开源,制约了可复现性。


主要参考文献

[1] Shubin Ma, Liang Zhao, Chuanye He, et al. DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement. In Proceedings of the 34th ACM International Conference on Multimedia (MM '26), Rio de Janeiro, Brazil, 2026.
[2] 论文预印本地址:https://arxiv.org/pdf/2607.27761v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
数据对不齐别头大,锚点对齐有妙法;匈牙利算法再校准,聚类精度顶呱呱。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。