← 返回 PaperDaily 视觉与图像

告别t-SNE老套路:TabSOM用SOM一鱼两吃,布局解释全搞定

表格数据是工业界和医学界的主力军,却一直被深度学习冷落。这篇论文用自组织映射把表格编码成多通道图像,不仅让CNN在四个医学数据集上排名第一第二,还把方差压到全场最低,顺带给出两个可解释性工具。思路清爽,值得一读。

告别t-SNE老套路:TabSOM用SOM一鱼两吃,布局解释全搞定
原论文信息如下:
论文标题:
TabSOM: A tabular-to-image encoding method based on self-organizing maps
发表日期:
2026年08月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2608.13513v1.pdf
开源代码链接:
没有
开源数据集链接:
UCI Machine Learning Repository (public datasets)

表格数据也能用CNN?TabSOM让表格"画"成图像

在人工智能的世界里,有一对奇妙的“偏科生”。图像、语音这些数据,天生自带“空间结构”——像素挨在一起,它们之间往往有某种语义联系,所以卷积神经网络(CNN)和视觉Transformer这类深度学习模型一上场就大杀四方。而表格数据呢?每一行是一个样本,每一列是一个特征,特征之间看起来“貌合神离”,缺乏天然的空间关系。结果就是,深度学习模型在表格任务上常常被传统机器学习方法按在地上摩擦。
那么问题来了:有没有可能强行给表格数据“整容”,把它变成图像,然后让CNN来捡现成的便宜?这个思路已经在业界摸索了好几年,催生出一批所谓的tabular-to-image方法:DeepInsight、TINTO、REFINED等等。它们的基本操作是拿t-SNE、UMAP、PCA这类降维工具把特征投影到二维平面,让相似的特征在图像上靠得近一点,然后把每个样本的特征值填到对应的像素位置上。思路是通的,但毛病也明显:这些方法只把每个特征“单独”的值画了上去,特征跟特征之间那些微妙的关系——比如“血糖高的人往往胰岛素也偏高”——在图像里完全没有体现,白白浪费了CNN强大的模式识别能力。
本篇论文提出的TabSOM,就是冲着这个痛点来的。它用的是自组织映射(Self-Organizing Map,简称SOM)——一种老牌的、带拓扑保持性质的无监督神经网络。SOM能把高维空间里的样本映射到一个二维网格上,并且保持相似样本在网格上也相邻。TabSOM的做法是:先在表格数据上训练一个SOM,然后从SOM的“组件平面”(component plane)里提取每一个特征应该放在图像上的什么位置,再把特征之间的关系也画成一条条“连线”,最终渲染出一张多通道的“表格图像”。这套设计不仅让CNN在分类精度上拿到了医学数据集的头名,还顺带给出了两个基于SOM的可解释性工具。
图1:TabSOM编码的通道分解示意图
TabSOM编码的通道分解示意图,以Pima印第安人糖尿病数据集的四个样本为例,展示了单个通道(锐利节点通道、中等节点通道、边缘通道)及合成后的RGB图像和特征图。
上面这张图值得多看两眼。左边三列分别是R、G、B三个通道:前两个通道用不同粗细的高斯核把特征值“糊”在画布上,第三个通道则把特征之间的交互关系画成连线。可以看到,不同类别的样本在图像上呈现出不同的视觉纹理——这就是CNN喜欢的东西。

从SOM到图像:特征位置与关系如何确定

SOM这件事,得先从它的名字说起。自组织映射,Self-Organizing Map,是一种基于无监督竞争学习的神经网络。它的核心能力是拓扑保持——把高维空间里的样本“摊”到一个二维网格上,让相似的样本在网格上挨得近,不相似的样本离得远。这个网格上每一个节点都有一个“原型向量”,可以理解为这个节点所代表的一类样本的“平均长相”。训练完之后,拿着新样本跟所有节点的原型向量比距离,最近的那个节点就是它的最佳匹配单元(Best Matching Unit,BMU)。
BMU的寻找公式长这样:BMU公式
这个公式的意思是:在当前所有网格节点中,找到原型向量与样本x欧氏距离最小的那个节点,作为该样本的BMU。每一次迭代,SOM会把BMU附近的节点都往样本的方向拉一点,共同“学习”这个样本的特点。
TabSOM的第一个关键操作,是提取“组件平面”。什么是组件平面?把SOM网格上所有节点的原型向量按特征拆开:第j个特征在所有节点上的取值,就构成了一个H×W的“热力图”,这就是特征j的组件平面Φ_j。因为SOM的拓扑保持性质,组件平面不会是一堆随机噪声,而是呈现出平滑的空间变化——某个特征可能在网格的左上角特别“亮”,在右下角特别“暗”。这种平滑性,意味着一个特征在网格上是有一个“活动中心”的。
接下来,TabSOM要把每个特征“安置”到图像画布上的一个固定位置。它从组件平面里提取锚点(anchor),有两种方法:质心锚点和模式锚点。质心锚点相当于组件平面的“重心”,把每个像素位置按组件平面强度加权平均,公式如下:质心锚点公式
其中g(r,c)是网格坐标,Φ̃_j是归一化后的组件平面强度,γ是锐化指数(默认取2)。这个公式直观理解就是:组件平面越“亮”的地方,对锚点位置的贡献越大;γ越大,锚点越往峰值处靠拢。模式锚点则更直接——直接取组件平面最大值的位置,如果担心像素级精度不够,还可以用抛物线插值做亚像素精化。一般来说,特征数较少、组件平面比较弥散时用质心锚点;特征数多、大家都在抢地盘时用模式锚点更合适。
不过锚点算完之后还有一个问题:两个特征可能算出同一个位置,直接撞车。这时候就需要一个“无碰撞分配”的步骤。TabSOM把问题形式化为一个线性指派问题——每个特征分配到一个网格单元,代价是特征离锚点的位移距离,再减去特征组件平面在该单元处强度带来的收益:匈牙利指派公式
用匈牙利算法求解,保证每个特征都占到一个独立的网格单元,绝对不重叠。这一步相当于给每个特征落实了“房产证”。
位置搞定之后,还要把特征之间的关系画出来。怎么算关系?把两个特征的组件平面分别拉成向量,算它们的皮尔逊相关系数或余弦相似度:特征关系权重公式
然后设定一个阈值τ(默认0.5到0.6),相关系数超过阈值的特征对之间就形成一条边。因为SOM的拓扑结构让相似特征天然“住得近”,有边的特征在画布上也几乎总是相邻的——关系图和空间布局是自洽的。
最后一步是渲染。特征的位置和关系图都确定好了,剩下的就是把每一个样本的特征值“画”到图像上。TabSOM用了多尺度渲染:一个“锐利”通道(高斯带宽小)精确刻画每个特征值,一个“平滑”通道(高斯带宽大)提供区域性的整体纹理,还有一个“边缘”通道把特征关系画成连线。节点通道的公式为:节点通道渲染公式
其中x_j是特征j的取值,p_j是特征j在画布上的位置,(u,v)遍历所有像素中心。锐利通道让CNN能精确定位每个特征的位置,平滑通道则提供了卷积核感受野范围内的上下文信息——有点像给CNN同时递上了“地图”和“俯瞰图”。
边缘通道更妙。它不只是简单地把特征对之间的线段画出来,而是给每条边乘上了“交互强度”——两个端点特征在当前样本里都激活(正值)时,连线才亮起来:线段距离公式边缘通道渲染公式
这样就产生了一个3通道的图像:R通道锐利节点特征,G通道平滑节点特征,B通道关系交互特征。CNN拿到这张图,既能看单特征的“点”,又能看特征之间的“线”,信息量大增。
表1:表格转图像方法汇总
表1:表格转图像编码方法汇总,包括方法所属类别(参数化/非参数化)及图像布局所用的技术。可以看到TabSOM的思路与现有方法有本质区别——SOM同时承担了布局和关系建模两项职责。

不只是编码:SOM带来的可解释性新工具

表格转图像方法一直被吐槽的一点是:你把数据变成图像喂给CNN,模型确实work了,但它为什么work?哪个特征起作用?没人说得清。TabSOM的可贵之处在于,它把可解释性当成了一等公民,从SOM的结构里直接“长”出了两个解释工具。
第一个工具叫SOM类别分离重要性(class-separation importance)。思路是这样的:既然每个训练样本都能找到它的BMU,那么分别统计正类和负类样本在SOM网格上的分布密度——正类聚集在哪些节点,负类聚集在哪些节点,就能画出两张“类别激活图”。然后看某个特征的组件平面与这两张激活图的匹配程度:类别激活密度公式类别分离重要性公式
直观理解就是:如果特征j在正类样本集中的区域取值普遍偏高,在负类样本集中的区域取值普遍偏低,那它自然就是一个对区分类别有大贡献的特征。这个分数完全不依赖下游分类模型,纯粹从SOM和训练标签里算出来,有一种“上帝视角”的干净感。
第二个工具叫基于原型的部分依赖图(prototype-based partial dependence plot,简称prototype PDP)。经典的部分依赖图(Partial Dependence Plot,PDP)是把所有样本的某个特征都改成同一个值,然后看模型预测平均值怎么变化。问题是:它假设特征之间独立,而且对数据稀疏区域的预测并不可靠——因为模型可能在那里根本没有见过类似样本。TabSOM换了一个思路:每个SOM原型向量本身就是密度加权后“真实存在”的组合,把原型向量编码成图像、喂给CNN、得到预测概率:原型预测图公式
然后再按特征值做分箱,画出“特征取值-预测概率”的曲线。每个节点用它的命中数(即有多少训练样本的BMU是它)来加权:节点命中数公式
这样一来,数据稀疏的区域会在图上清楚显形——低命中数的点一看就很“虚”,不会误导读数。这比经典PDP要诚实得多。
图2:PID数据集特征重要性对比
图2:PID数据集上的特征重要性对比,包括随机森林的杂质重要性、XGBoost的增益重要性、SHAP值(基于随机森林计算)以及SOM派生的类别分离重要性。可以看到TabSOM的排名与传统方法有合理的一致性,同时捕捉到了一些结构性的互补信息。
图3:基于原型的部分依赖图
图3:PID数据集所有特征的基于原型的部分依赖图,每个面板绘制了SOM原型网格的预测概率与该特征组件平面取值的关系。可以看出部分特征与预测概率呈单调关系,而另一些呈现非线性甚至非单调的模式,这些模式在传统PDP里很难被准确捕获。

实验结果:稳定领先,方差最低

衡量一种表格转图像方法好不好,不能只看一两个数据集上的表现。TabSOM在四个公开的二分类数据集上做了全面评测:Pima印第安人糖尿病(PID,768样本,8特征)、牛津帕金森病(PAR,195样本,22特征)、QSAR生物降解(QSA,1055样本,41特征)和威斯康星乳腺癌(WBC,569样本,30特征)。
表2:数据集汇总
表2:本研究所用的四个数据集汇总,全部来自UCI机器学习公开仓库,样本量和特征维度覆盖了从低维到中高维的典型场景。
实验设置方面,每个数据集按80%/20%划分训练集和测试集,并用5折分层交叉验证评估泛化性能;类别不平衡通过仅在训练集上做随机欠采样处理,避免数据泄漏;所有特征都做了min-max归一化。分类器用的是同一个轻量级CNN——三个卷积块(16-32-64通道),后面接批归一化、ReLU、全局平均池化和一个线性输出。关键点是:所有表格转图像方法共用同一个CNN架构和同样的优化器配置,保证对比公平。评价指标采用AUROC(曲线下面积),报告5个随机种子下的均值和标准差。
结果非常有意思。TabSOM在PID上拿到0.8236的AUROC,在WBC上拿到0.9911,都是第一名;在PAR(0.8852)和QSA(0.9098)上排名第三。整体平均AUROC为0.9024,排名第二,仅次于Combination方法的0.9114。特别值得注意的是方差:TabSOM在所有数据集上的标准差只有0.018到0.039,是全场最稳定的方法之一。相比之下,DeepInsight(t-SNE)在PAR上的标准差高达0.2593,Fotomics在WBC上甚至到了0.3296——这些方法在不同随机种子下的表现像过山车一样忽上忽下,压根不敢拿去落地。
表3:表格转图像方法基准对比
表3:表格转图像方法在四个数据集上的基准对比,报告了5个随机种子的AUROC均值和标准差。加粗为每个数据集上的最佳成绩。TabSOM在两个数据集上排名第一,在两个数据集上排名第三,整体平均排名第二,且标准差在所有数据集上都处于最低水平之一。
另一个值得关注的规律是:在特征数最少的PID(8个特征)上,结构化方法(TabSOM、BarGraph、Combination、DistanceMatrix)对嵌入类方法的优势最大——TabSOM比TINTO(t-SNE)高出整整0.30的AUROC。这说明当特征数量不多时,如何组织特征的空间布局和关系,比单纯依赖降维嵌入的“自由摆放”要重要得多。而在特征数量较多且类别高度可分的WBC上,各种方法的差距缩小,大家都能做到0.95以上。
实验设计的合理之处在于:不同方法之间的比较尽可能控制了变量——同一个CNN骨架、同一种优化器、同样的特征归一化方式、同样的交叉验证流程。这让表3中的差异更多来自编码方式本身,而不是下游模型的参数差异。

局限与展望:TabSOM还能走多远

TabSOM当然不是完美的。论文目前只在四个二分类数据集上做了评测,样本量最大的也不过一千出头,这跟现代深度学习动辄百万级的数据规模相比,只能算“小范围验证”。多分类任务、回归任务、高维稀疏特征、混合类型数据(数值+类别)这些更贴近真实业务的场景,都还没有覆盖到。SOM的超参数(网格大小、学习率、邻域半径)对最终布局和结果的影响也还需要更系统的敏感性分析。
不过话说回来,这个工作最让人眼前一亮的其实是它的“组合哲学”:用SOM同时解决特征布局和特征关系这两个问题,把原本割裂的编码和解释统一起来。这种思路在表格转图像这个细分领域里是相当清奇的。未来如果能把TabSOM扩展到更大的数据集、更丰富的任务类型,再配合预训练视觉模型做迁移学习,想象空间不小。
另外,论文题目里的“based on self-organizing maps”其实有点谦虚——SOM在这里不只是布局工具,它还是可解释性的来源。这种“一鱼两吃”的设计,比那些只把降维当预处理、用完就丢的方法高到不知道哪里去了。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?TabSOM提出基于自组织映射的表格转图像编码方法,通过分量平面推导特征位置并编码特征关系,在四个医学数据集上对比12种方法排名第一或第二且方差最低,并提供两种可解释性工具。
这篇工作最值得看的点是什么?TabSOM在Pima上排名第一(0.8236),在WDBC上排名第一(0.9911),在PAR上排名第三(0.8852),在QSAR上排名第三(0.9098),整体平均AUCROC为0.9024,排名第二,且在所有数据集上展现出最低的方差。
这篇工作的边界或风险在哪里?优点:(1) 利用SOM拓扑保持特性提供可解释的特征放置;(2) 引入关系边通道编码特征间交互信息;(3) 提供两种SOM驱动的可解释性工具;(4) 性能稳定,方差低。缺点:(1) 在PAR和QSAR上略逊于Combination方法;(2) 仅在4个数据集上验证,规模有限;(3) 未与最新深度表格学习方法(如FT-Transformer)对比;(4) 未报告计算开销细节。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出基于自组织映射(SOM)的表格数据到图像编码方法TabSOM,利用SOM组件平面推导特征锚点位置,通过匈牙利算法实现无碰撞特征放置,并构建特征关系图作为额外图像通道,同时提供基于SOM的可解释性工具。

实验合理度:★★★★☆

Area Under the Receiver Operating Characteristic Curve (AUROC),报告5个随机种子的均值和标准差

学术研究价值:★★★★☆

提出基于自组织映射(SOM)的表格数据到图像编码方法TabSOM,利用SOM组件平面推导特征锚点位置,通过匈牙利算法实现无碰撞特征放置,并构建特征关系图作为额外图像通道,同时提供基于SOM的可解释性工。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确报告FLOPs,但SOM训练和匈牙利分配的计算成本与样本数无关,仅依赖于网格大小和特征数。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 在PAR和QSAR上略逊于Combination方法;(2) 仅在4个数据集上验证,规模有限;(3) 未与最新深度表格学习方法(如FT-Transformer)对比;

主要参考文献

[1] Chushig-Muzo D, Rodr´ıguez de Cara M A, Milara E, et al. TabSOM: A tabular-to-image encoding method based on self-organizing maps[J]. arXiv preprint arXiv:2608.13513, 2026.
[2] Sharma A, Vans E, Shigemizu D, et al. DeepInsight: A methodology to transform a non-image data to an image for convolution neural network architecture[J]. Scientific Reports, 2019, 9(1): 11399.
[3] Cueva E F, Perez A, Lozano J A, et al. TINTO: Converting Tidy Data into Images for Classification with 2-Dimensional Convolutional Neural Networks[J]. Information Sciences, 2022, 600: 317-331.
[4] Bazgir O, Zhang R, Dhruba S R, et al. REFINED: Representation of Features as Images with NEighborhood Dependencies[J]. IEEE Transactions on Computational Biology and Bioinformatics, 2020.
[5] Kohonen T. Self-Organizing Maps[M]. Springer, 2001.
[6] Zhu Y, Brettin T, Evrard Y A, et al. IGTD: Image-based gene expression data transformation[J]. BMC Bioinformatics, 2019, 20(1): 464.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
表格秒变图像,自组织映射显神通!想和龙哥一起深挖TabSOM的源码细节与医学应用前景吗?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。