← 返回 PaperDaily 大模型与智能体

9个图基础模型只有2个能打?ICML论文曝光80%是花架子

当「图基础模型」遇上「公平评测」, 结果发现9个模型里7个是花架子?这不就是AI界的照妖镜嘛!😏 本文用最硬核的实验设计,把各路GFM拉到聚光灯下,扒掉了华丽外衣,告诉我们:经典GNN调好了,依然是条好汉。这篇ICML 2026论文,龙哥看得直呼过瘾,强烈建议所有的图学习研究者都来「上好这一课」!

9个图基础模型只有2个能打?ICML论文曝光80%是花架子
🐉 龙哥读论文知识星球来了!
被这篇评测文震撼到了?星球里还有更多这样「扒掉模型底裤」的硬核论文拆解!在星球,一天8篇不过瘾?无上限更新!不仅拆解方法,更直击实验、结论、优缺点,帮你避开「对比不公平」的坑,节省你80%的读论文时间! 👇扫码加入「龙哥读论文」知识星球,和龙哥一起用最锐利的眼光看透AI研究,拒绝被「花架子」模型忽悠! xingqiu_header

龙哥推荐理由:
当「图基础模型」遇上「公平评测」, 结果发现9个模型里7个是花架子?这不就是AI界的照妖镜嘛!😏 本文用最硬核的实验设计,把各路GFM拉到聚光灯下,扒掉了华丽外衣,告诉我们:经典GNN调好了,依然是条好汉。这篇ICML 2026论文,龙哥看得直呼过瘾,强烈建议所有的图学习研究者都来「上好这一课」!


原论文信息如下:
论文标题:
A Fair Evaluation of Graph Foundation Models for Node Property Prediction
发表日期:
2026年6月
发表单位:
未明确列出(论文作者来自Yandex Research等机构)
原文链接:
https://arxiv.org/pdf/2606.24509v1.pdf

图基础模型(GFM)是救世主还是花架子?

「图基础模型」(Graph Foundation Model, GFM)这个词一出现,就让图机器学习圈儿里不少人心跳加速。想想看,一个模型,拿来就能处理社交网络、道路网络、引用网络、电商图……听起来就像AI界的瑞士军刀,恨不得人手一把。但龙哥得问一句:拿这刀切水果能行,但砍骨头会不会崩刃?
最近一篇来自Yandex Research等机构的论文,专门干了一件「扒底裤」的活儿——对9个近两年提出的图基础模型进行了公平、严格的重新评估,把GFM和精心调优过的经典图神经网络(GNN)放在同一个擂台上比划。结果,有些模型直接被K.O.,而另一些虽然赢了,却掏出了让人肉疼的账单。
龙哥先下个结论:不是所有GFM都是花架子,但大部分确实是。真正的实力派,藏在一个叫PFN的范式里。

一场针对节点预测任务的“公平审判”

节点属性预测(Node Property Prediction)是图机器学习中最常见的任务之一,应用场景包括社交网络欺诈检测、电商推荐、交通预测等。很多GFM都宣称自己擅长这个任务,但它们的实验设置五花八门:有的只挑一两个数据集,有的用弱基线,还有的干脆不公布调参细节。这不就是「又当裁判又当运动员」嘛。
为了端平这碗水,论文团队做了几件硬核的事:
数据集选择:抛弃了Cora、Citeseer等经典但存在很多问题的小数据集,改用GraphLand基准中的10个真实工业数据集(Bazhenov et al., 2025),涵盖分类和回归,且使用更贴近实际的数据划分(RL splits)。
基线强化:不仅用了经典GNN(GCN、GraphSAGE、GAT、LGT),还采用了两个独立研究团队(Platonov et al., 2023b 和 Luo et al., 2024)提出的更强架构改进——包括残差连接、归一化等现代技巧。
超参数搜索:对每个GNN做了100次TPE贝叶斯优化调参,不是拍脑袋定参数。
GFM评估:涵盖9个近期GFM(包括OpenGraph、AnyGraph、GCOPE、SAMGPT、MDGFM、TS-GNN、G2T-FM、TAG、GraphPFN),支持上下文学习(ICL)和微调(FT)的都分别评测。
最终的预测性能结果,让龙哥直呼「残忍」:
表1:实验结果
表1:实验结果。对多分类数据集报告准确率(Accuracy),二分类报告AP,回归报告R²。平均排名和平均归一化得分分别针对分类数据集和所有数据集计算。Crit.-前缀和Class.-前缀分别指来自Platonov et al. (2023b)和Luo et al. (2024)的改进GNN。最佳结果用颜色标记:第一、第二、第三。
表1一放,事儿就清楚了。经典GNN(Crit./Class.系列)在很多任务上表现相当不错,甚至能排进前三。而大多数GFM——OpenGraph、AnyGraph、GCOPE、SAMGPT、MDGFM、TS-GNN——在预测性能上全面落后于调优后的GNN,有的还落后得相当离谱。比如OpenGraph在hm-categories上只有9.88%,而最差的GNN也有62.54%。这不就是花架子吗?
但表格中也有一群「异类」——G2T-FM、TAG、GraphPFN,它们均基于Prior-data Fitted Networks (PFNs)范式。这些模型在大多数数据集上超越了所有GNN,其中GraphPFN在微调后更是拿下了10个数据集全部第一,平均归一化得分直接拉到100。龙哥不禁要问:PFN到底是个什么神仙方法?
插图

谁是真正的赢家?基于数据先验的PFN网络

PFN(Prior-data Fitted Networks)最初是为表格数据设计的(Hollmann et al., 2023; 2025),它的核心思路是:用一个Transformer模型在大量合成数据集上进行预训练,让模型学会把整个数据集的前半部分(训练集)作为上下文,然后直接预测后半部分(测试集)的标签。这就是所谓的「上下文学习」(In-Context Learning, ICL)——不需要对观测数据进行参数更新,一次前向传播就能适应新的特征空间和目标空间。后来,研究者发现这种方法也可以迁移到节点预测任务上,于是诞生了G2T-FM、TAG、GraphPFN等模型。
这三者的区别在于:

G2T-FM(Eremeev et al., 2025):将节点特征和图结构信息拼接成「表格」,然后直接喂给一个预训练好的表格PFN(比如LimiX-16M)作为骨干网络进行推理或微调。

TAG(Hayler et al., 2025):也是将图转化为表格,但骨干网络可选TabPFNv2或LimiX,它只能做ICL推理,不支持微调。

GraphPFN(Eremeev et al., 2026):不走「图转表」的弯路,直接设计了一个原生支持图结构的Transformer架构,在图数据上训练PFN。它同时支持ICL和微调。

从表1可以看出:在不微调的ICL模式下,GraphPFN已经表现最好;微调之后,GraphPFN更是彻底拉开了距离。而G2T-FM和TAG在ICL模式下非常接近,都优于传统GNN。可以说,PFN范式是当前图基础模型里唯一能实战派

性价比之争:GPU时间和内存

性能好就是王者吗?别急,还得看成本。论文进一步对比了GNN和PFN-based GFM在训练、调参、推理上的时间消耗和显存占用。
表2:计算时间
表2:所需时间:超参数调优(Tun)、单次训练(Tr)、单次推理(Inf,包含PFN模型的推理时集成)。使用NVIDIA Tesla A100 80GB GPU。注意,GNN的最佳超参数在不同类型和数据集上差异很大。
从表2可以发现,GNN的推理时间极短——秒级,甚至亚秒级。而PFN-based GFM的推理时间则长得多:G2T-LimiX在某数据集上推理需要6.45分钟,TAG-LimiX甚至需要30分钟以上。不过,PFN的好处是,它可以在不进行任何数据集训练的情况下直接用ICL推理,而GNN必须先训练(且需要大量调参)。如果考虑总时间(调参+训练+推理),在某些小数据集上PFN可能更省时间——比如G2T-LimiX调参只要24.74分钟,而Crit.-GraphSAGE光调参就要2.16小时。
再看显存:
表3:显存占用
表3:单次训练(Tr)和单次推理(Inf)所需显存(VRAM,单位GB)。注意GNN最佳超参数在不同类型和数据集上差异很大。Crit./Class.前缀同上。
表3显示,PFN-based GFM推理时的显存需求也普遍高于GNN(例如GraphPFN在city-reviews上需要12.89 GB,而最好的GNN仅需0.49 GB)。这对于部署在有限显存的设备上是个挑战。龙哥觉得这很公平:PFN模型本质上是拿计算资源换「开箱即用」的便利性和更强的预测能力。在实时性要求高的工业场景,GNN依然是最佳选择;而在模型开发阶段或对延迟不敏感的场景,PFN可以省去大量调参时间。
插图

研究的局限性与未来展望

这篇论文虽然非常扎实,但也存在一些局限性。团队自己也承认:
• 评估仅覆盖了节点预测任务,其他任务如边预测、图分类等未涉及。
• 数据集全部来自GraphLand,虽然比传统数据集更接近现实,但仍有偏——比如大多数是社交或商品网络,缺少生物、化学等领域的图。
• 对于PFN-based GFM,预训练成本没有被计入(因为是一次性的),但实际中没有人能免费得到这个预训练模型——预训练需要大量GPU时间。
• 实验没有涉及超大图(超过千万节点)的场景,这对GNN和PFN都是重要考验。
未来方向包括:让PFN推理更高效(模型压缩、蒸馏),扩展PFN到更多任务类型,以及设计更公平、更全面的图基础模型评估基准。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?这篇论文解决了一个公认的难题:图基础模型(GFM)的评估标准混乱,导致无法判断哪个模型真正优秀。作者通过公平严格的实验对比,揭示了哪些GFM是真正能打过的,哪些只是花架子。

文章中提到的PFN到底是什么意思?能不能举个简单例子?PFN是Prior-data Fitted Networks的缩写,中文可译为「基于数据先验的网络」。它的想法是:用随机生成的合成数据集(比如随机生成一些特征和标签)来训练一个Transformer,让模型学会「看到训练数据就立即能预测」。举个例子:假如我们要预测某个用户的购买概率,PFN模型会把所有用户的特征和已知购买标签放在一起作为上下文输入,然后通过一次前向传播直接输出剩余用户的预测概率,不需要像传统GNN那样用梯度下降去优化参数。所以PFN可以做到「零样本」适应新数据集。

为什么OpenGraph、AnyGraph那些GFM表现那么差?这些模型有的是基于对比学习预训练的,有的是基于图自编码器等机制。论文分析认为,它们难以有效适应不同数据集之间截然不同的特征和目标空间。相比之下,PFN架构天然被设计用来处理这种「多数据集」场景——因为它直接在大量数据集上训练,学会了如何把新数据集的输入映射到输出。但要注意,这些模型可能在其他任务(比如链接预测)上表现不错,只是在节点预测上被GNN反超。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

该工作不是提出新模型,而是提供了一种系统、公平的评估范式,对现有GFM进行了严格的检验。创新性在方法论层面而非模型算法层面。

实验合理度:★★★★★

实验设计极为严谨:使用真实工业数据集、调优GNN基线(两套改进版本均进行100次超参数搜索)、GFM使用官方实现、注明每个模型的支持模式。对比公平,结论可靠。

学术研究价值:★★★★✰

对GFM领域具有重要的警示和引导作用——告诉后来者哪些方向值得投入(PFN范式),哪些方向需要重新思考。对研究社区贡献很大。

稳定性:★★★★✰

PFN-based GFMs在不同数据集上的表现一致性较高(GraphPFN始终排名前列),而非PFN模型波动极大。但PFN推理时间不稳定(数据集越大越慢),且有额外显存开销。

适应性以及泛化能力:★★★✰✰

目前仅验证了节点预测任务,且数据集来自GraphLand(偏社交/电商图)。对分子、生物图谱的泛化性未知。对超大图(>1亿节点)的适应性未测试。

硬件需求及成本:★★☆☆☆

PFN-based GFM推理时间和显存都显著高于GNN,尤其TAG模型在部分数据集上需要半小时推理。如果考虑预训练成本则更高。GNN在这项上完胜。

复现难度:★★★★✰

所有GFM使用作者提供的官方开源代码,GNN有详细的超参数分布表(附录中给出)。但PFN模型预训练数据未公开,用户只能直接使用预训练权重。整体复现性较好。

产品化成熟度:★★☆☆☆

PFN模型目前推理成本高,不适合高实时性场景(如欺诈检测需要毫秒级响应)。GNN仍是工业部署的首选。不过PFN在「低代码、少调参」场景下有一定潜力(如快速原型验证)。

可能的问题:评估未包含链路预测和图级任务,可能低估了某些GFM在其他任务上的能力。另外,PFN模型的预训练计算量未被纳入比较,但这部分成本并非所有用户都能承担。结论的普适性有待更多任务和领域的验证。


主要参考文献

[1] Platonov, O., Bazhenov, G., Eremeev, D., Prokhorenkova, L. A Fair Evaluation of Graph Foundation Models for Node Property Prediction. arXiv:2606.24509, 2026.
[2] Bazhenov, G., Platonov, O., Prokhorenkova, L. GraphLand: Evaluating graph machine learning models on diverse industrial data. NeurIPS, 2025.
[3] Eremeev, D., et al. Turning tabular foundation models into graph foundation models. arXiv:2508.20906, 2025.
[4] Eremeev, D., et al. GraphPFN: A prior-data fitted graph foundation model. ICML, 2026.
[5] Hayler, H., et al. TAG: Tabular foundation models as graph backbones. arXiv, 2025.
[6] Luo, Y., et al. A thorough evaluation of GNN baselines for node classification. arXiv, 2024.
[7] Platonov, O., et al. A critical look at evaluation of GNNs under distribution shift. NeurIPS, 2023b.

(注:文中引用的论文具体出处请参考原论文参考文献列表)

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看完了这篇打脸爽文,你是不是也想对自家模型来个公平评测?想第一时间获取更多像这样剥开华丽外衣、直击本质的论文拆解吗?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper,备注研究方向+地点+学校/公司+昵称,加入龙哥读论文粉丝群,和更多同道中人一起,拒绝标题党,拥抱真功夫!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。