论文标题:
A Fair Evaluation of Graph Foundation Models for Node Property Prediction
发表日期:
2026年6月
发表单位:
未明确列出(论文作者来自Yandex Research等机构)
原文链接:
https://arxiv.org/pdf/2606.24509v1.pdf
图基础模型(GFM)是救世主还是花架子?
「图基础模型」(Graph Foundation Model, GFM)这个词一出现,就让图机器学习圈儿里不少人心跳加速。想想看,一个模型,拿来就能处理社交网络、道路网络、引用网络、电商图……听起来就像AI界的瑞士军刀,恨不得人手一把。但龙哥得问一句:拿这刀切水果能行,但砍骨头会不会崩刃?最近一篇来自Yandex Research等机构的论文,专门干了一件「扒底裤」的活儿——对9个近两年提出的图基础模型进行了公平、严格的重新评估,把GFM和精心调优过的经典图神经网络(GNN)放在同一个擂台上比划。结果,有些模型直接被K.O.,而另一些虽然赢了,却掏出了让人肉疼的账单。龙哥先下个结论:不是所有GFM都是花架子,但大部分确实是。真正的实力派,藏在一个叫PFN的范式里。
一场针对节点预测任务的“公平审判”
节点属性预测(Node Property Prediction)是图机器学习中最常见的任务之一,应用场景包括社交网络欺诈检测、电商推荐、交通预测等。很多GFM都宣称自己擅长这个任务,但它们的实验设置五花八门:有的只挑一两个数据集,有的用弱基线,还有的干脆不公布调参细节。这不就是「又当裁判又当运动员」嘛。为了端平这碗水,论文团队做了几件硬核的事:• 数据集选择:抛弃了Cora、Citeseer等经典但存在很多问题的小数据集,改用GraphLand基准中的10个真实工业数据集(Bazhenov et al., 2025),涵盖分类和回归,且使用更贴近实际的数据划分(RL splits)。 • 基线强化:不仅用了经典GNN(GCN、GraphSAGE、GAT、LGT),还采用了两个独立研究团队(Platonov et al., 2023b 和 Luo et al., 2024)提出的更强架构改进——包括残差连接、归一化等现代技巧。 • 超参数搜索:对每个GNN做了100次TPE贝叶斯优化调参,不是拍脑袋定参数。 • GFM评估:涵盖9个近期GFM(包括OpenGraph、AnyGraph、GCOPE、SAMGPT、MDGFM、TS-GNN、G2T-FM、TAG、GraphPFN),支持上下文学习(ICL)和微调(FT)的都分别评测。最终的预测性能结果,让龙哥直呼「残忍」:表1:实验结果。对多分类数据集报告准确率(Accuracy),二分类报告AP,回归报告R²。平均排名和平均归一化得分分别针对分类数据集和所有数据集计算。Crit.-前缀和Class.-前缀分别指来自Platonov et al. (2023b)和Luo et al. (2024)的改进GNN。最佳结果用颜色标记:第一、第二、第三。表1一放,事儿就清楚了。经典GNN(Crit./Class.系列)在很多任务上表现相当不错,甚至能排进前三。而大多数GFM——OpenGraph、AnyGraph、GCOPE、SAMGPT、MDGFM、TS-GNN——在预测性能上全面落后于调优后的GNN,有的还落后得相当离谱。比如OpenGraph在hm-categories上只有9.88%,而最差的GNN也有62.54%。这不就是花架子吗?但表格中也有一群「异类」——G2T-FM、TAG、GraphPFN,它们均基于Prior-data Fitted Networks (PFNs)范式。这些模型在大多数数据集上超越了所有GNN,其中GraphPFN在微调后更是拿下了10个数据集全部第一,平均归一化得分直接拉到100。龙哥不禁要问:PFN到底是个什么神仙方法?
谁是真正的赢家?基于数据先验的PFN网络
PFN(Prior-data Fitted Networks)最初是为表格数据设计的(Hollmann et al., 2023; 2025),它的核心思路是:用一个Transformer模型在大量合成数据集上进行预训练,让模型学会把整个数据集的前半部分(训练集)作为上下文,然后直接预测后半部分(测试集)的标签。这就是所谓的「上下文学习」(In-Context Learning, ICL)——不需要对观测数据进行参数更新,一次前向传播就能适应新的特征空间和目标空间。后来,研究者发现这种方法也可以迁移到节点预测任务上,于是诞生了G2T-FM、TAG、GraphPFN等模型。这三者的区别在于:
G2T-FM(Eremeev et al., 2025):将节点特征和图结构信息拼接成「表格」,然后直接喂给一个预训练好的表格PFN(比如LimiX-16M)作为骨干网络进行推理或微调。
TAG(Hayler et al., 2025):也是将图转化为表格,但骨干网络可选TabPFNv2或LimiX,它只能做ICL推理,不支持微调。
GraphPFN(Eremeev et al., 2026):不走「图转表」的弯路,直接设计了一个原生支持图结构的Transformer架构,在图数据上训练PFN。它同时支持ICL和微调。
[1] Platonov, O., Bazhenov, G., Eremeev, D., Prokhorenkova, L. A Fair Evaluation of Graph Foundation Models for Node Property Prediction. arXiv:2606.24509, 2026.[2] Bazhenov, G., Platonov, O., Prokhorenkova, L. GraphLand: Evaluating graph machine learning models on diverse industrial data. NeurIPS, 2025.[3] Eremeev, D., et al. Turning tabular foundation models into graph foundation models. arXiv:2508.20906, 2025.[4] Eremeev, D., et al. GraphPFN: A prior-data fitted graph foundation model. ICML, 2026.[5] Hayler, H., et al. TAG: Tabular foundation models as graph backbones. arXiv, 2025.[6] Luo, Y., et al. A thorough evaluation of GNN baselines for node classification. arXiv, 2024.[7] Platonov, O., et al. A critical look at evaluation of GNNs under distribution shift. NeurIPS, 2023b. (注:文中引用的论文具体出处请参考原论文参考文献列表)