← 返回 PaperDaily
前沿研究
脑胶质瘤IDH突变预测:图像基础模型 vs 影像组学,到底谁更靠谱?
影像基础模型(比如专为MRI设计的)在预测脑胶质瘤IDH突变时,居然打不过一个基于影像组学的表格基础模型?瑞士伯尔尼大学团队的最新研究做了个扎心的对比:四个主流视觉基础模型轮番上阵,结果被TabPFN表格模型轻松反杀。是基础模型“水土不服”,还是“老”方法被低估了?这篇关于胶质瘤IDH预测的系统性基准研究,值得所有关注AI医疗落地的读者一看。
龙哥读论文
发布于 2026-08-14 09:10:43
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 影像基础模型(比如专为MRI设计的)在预测脑胶质瘤IDH突变时,居然打不过一个基于影像组学的表格基础模型?瑞士伯尔尼大学团队的最新研究做了个扎心的对比:四个主流视觉基础模型轮番上阵,结果被TabPFN表格模型轻松反杀。是基础模型“水土不服”,还是“老”方法被低估了?这篇关于胶质瘤IDH预测的系统性基准研究,值得所有关注AI医疗落地的读者一看。
原论文信息如下:
胶质瘤是脑部最常见的恶性肿瘤,其治疗决策高度依赖分子分型。其中,异柠檬酸脱氢酶(IDH)突变状态是一个关键生物标志物——IDH突变型胶质瘤预后显著优于野生型,且对特定治疗方案更敏感。目前,IDH状态的金标准是手术活检后的基因测序,但活检有创、昂贵且存在取样误差。能否从常规的磁共振成像(MRI)中无创预测IDH状态?这个问题困扰了临床医生多年。
传统的影像组学(Radiomics)方法从MRI中手工提取纹理、形状等特征,再用机器学习分类器(如逻辑回归)预测。近年来,深度学习尤其是视觉基础模型(如CLIP、DINO)在医学图像分析中表现出惊人潜力。但问题来了:在这些极其稀少的脑胶质瘤IDH预测任务中,究竟是专为MRI设计的“特种兵”基础模型更强,还是“老炮”影像组学更靠谱?瑞士伯尔尼大学的研究团队给出了一个扎心的答案——具体到让你怀疑人生。
这篇论文系统比较了四个图像基础模型(BrainIA、MRI-CORE、BiomedCLIP、BrainDINO)与两个影像组学基线(逻辑回归、TabPFN)在四个公开成人胶质瘤队列及一个外部治疗后队列上的IDH预测性能。结果让人大跌眼镜:一个基于影像组学的表格基础模型TabPFN,居然在分布内测试中碾压了所有视觉基础模型!而在面对极大的分布偏移(如术后改变)时,BiomedCLIP凭借其广阔的图像-文本预训练优势扳回一局。这告诉我们:在医学影像AI落地时,“选谁”跟“怎么用”一样重要。
方法:系统比较多种基础模型与影像组学基线
为了公平比较,作者设计了一套严谨的两阶段流程:所有图像基础模型都通过“线性探测”(Linear Probing)方式使用——即冻结预训练编码器的权重,仅训练一个简单的线性分类头。这样能保证性能差异完全来自预训练的特征表示,而不是训练技巧。影像组学基线则从MRI中提取PyRadiomics特征(每张图像107个手工特征,包括形状、一阶统计量、纹理等),然后分别用逻辑回归和TabPFN(一个基于表格的基础模型)进行预测。TabPFN的特别之处在于它是一个基于Transformer的深度先验模型,无需梯度更新,直接通过在训练样本上作“上下文学习”(in-context learning)给出概率预测。
研究使用了四个公共成人胶质瘤队列(UCSF-PDGM、UPEN-GBM、UTSW-Glioma、EGD)和一个外部治疗后队列(UCSD-PTGBM),所有MRI包含FLAIR和对比增强T1两种序列。对于2D基础模型(MRI-CORE、BiomedCLIP、BrainDINO),从肿瘤掩膜的25%、50%、75%三个轴向层面提取切片特征并拼接;对于3D模型(BrainIA),则直接处理整个体积。图1展示了整体流程。
四个图像基础模型各有来头:BrainIA (大脑人工智能模型)是3D脑MRI专用模型,在脑肿瘤分割等任务上预训练;MRI-CORE (磁共振核心)是多解剖部位MRI通用模型;BiomedCLIP (生物医学对比语言-图像预训练)在数百万生物医学图像-文本对上进行对比学习,拥有最广阔的训练域;BrainDINO (脑部DINO)则是使用DINOv2自蒸馏策略在660万脑MRI切片上训练的脑专用模型。表1列出了各模型的关键参数与输入维度。
实验采用5折分层划分(按IDH标签、WHO分级、年龄三分位进行分层),确保每折具有代表性。评价指标包括AUROC(受试者工作特征曲线下面积)和AUPRC(精确率-召回率曲线下面积),同时评估概率校准的期望校准误差(ECE)。
结果:TabPFN在分布内表现最佳,BiomedCLIP在分布偏移下更具优势
结果出人意料:在分布内(即在同一数据集的训练/测试划分上),影像组学基线TabPFN以平均AUROC 0.92(±0.03)力压群雄,逻辑回归也以0.88紧随其后。而四个图像基础模型中,表现最好的BiomedCLIP仅达到0.85,BrainDINO为0.82,两个MRI专用模型(BrainIA、MRI-CORE)则稳定垫底。在AUPRC上,TabPFN同样领先(0.74)。图2的交叉队列热图清晰展示了这种“降维打击”。
但在跨队列迁移中,差距有所缩小。对于最困难的外部测试——治疗后队列UCSD-PTGBM(包含术后空腔、放疗改变等),BiomedCLIP以AUROC 0.74重新夺回第一,BrainDINO紧随其后(0.743),而TabPFN和逻辑回归都出现了较大幅度的下降(AUROC掉到0.68左右)。这说明:手工特征对术后外观变化非常敏感,但视觉基础模型学到的表示更加鲁棒。
校准性(Calibration)是另一个关键维度。一个模型可以正确排序(AUROC高),但给出的概率值可能严重偏离真实频率(比如预测置信度80%时实际上只有50%的阳性率)。表3的期望校准误差(ECE)显示:TabPFN在所有场景下都是最校准的(分布内ECE 0.03-0.10),BiomedCLIP次之;而BrainIA和MRI-CORE的ECE高达0.15-0.32。在外部队列上,BiomedCLIP虽然AUROC高,但ECE为0.13,而TabPFN的ECE仍保持在0.07,表明即使AUROC下降,其概率可信度依然很高。
这个结果让很多读者不禁怀疑:难道花大价钱搞出来的医学基础模型,竟然不如一个“陈旧”的影像组学加逻辑回归?其实原因在于:IDH预测任务中,肿瘤整体的纹理、形状等宏观特征已经提供了很强的鉴别信号,而手工特征经过精心筛选后,在小样本场景下反而比高维的深度学习特征更稳定。TabPFN的优势在于它利用了一个广阔的表格任务先验,能快速适应小样本分类,且天然具有优秀的校准性。图像基础模型虽然特征表征更丰富,但线性探测可能无法充分利用其潜力——如果有更多的训练数据或微调,结果可能翻转。
讨论与结论:任务需求决定模型选择
这篇研究给我们的核心启示是:在医学影像AI应用的决策中,没有绝对的“最优模型”,只有最合适的模型 。如果需要极高的准确率和校准概率来辅助治疗决策(如是否选择保守治疗),TabPFN+影像组学是当前最佳选择;但如果目标是筛选高风险患者进行进一步检查,或者系统将不断面对新的扫描仪、新医院的病例,那么BiomedCLIP这样的广泛预训练模型可能更鲁棒。
值得注意的是,两个MRI专用模型(BrainIA、MRI-CORE)表现最差,说明“领域特异性”预训练并不一定优于“大规模通用预训练”——BrainDINO虽然也是脑部专用,但得益于DINOv2+自蒸馏的强大训练策略,反而能接近BiomedCLIP。这表明预训练方法(而非仅仅训练数据域)才是决定下游性能的关键因素。这也呼应了先前在其他领域观察到的现象:大规模自监督学习(如DINO)往往比弱监督的对比学习(如CLIP)在密集任务上表现更好。
当然,本实验有一些局限:所有图像基础模型都只用了线性探测,没有尝试微调。考虑到小样本场景下微调容易过拟合或破坏预训练特征,这种做是合理的,但也意味着我们可能低估了这些模型的潜力。此外,肿瘤分割来源在不同队列间存在差异(手动 vs 自动),这可能引入干扰。未来的工作可以考虑更丰富的探针架构(如交叉注意力融合FLAIR/T1)、联合临床变量(年龄、分级),以及扩展到其他生物标志物(1p/19q、MGMT甲基化)。
龙迷三问
问:TabPFN是什么?它为什么能在小样本表格任务上表现这么好? 答:TabPFN(Tabular Prior-Data Fitted Network)是一个基于Transformer的表格基础模型,由Hollmann等人在2023年提出。它在一个由大量合成表格分类任务组成的先验分布上进行训练,因此在面对新的小样本表格任务时,不需要梯度更新,只需一次前向传播(上下文学习)就可以输出概率。它天然适合小样本场景,且输出概率校准好。在本研究中,它直接使用PyRadiomics提取的214维手工特征,没有经过任何微调。
问:本文中的AUROC、AUPRC、ECE分别代表什么? 答:AUROC是受试者工作特征曲线下面积,衡量模型区分正负类的能力,0.5表示随机,1表示完美。AUPRC是精确率-召回率曲线下面积,在类别不平衡时比AUROC更敏感。ECE(Expected Calibration Error)是期望校准误差,衡量模型预测概率与实际频率之间的一致性,越低说明模型“知道自己知道多少”。例如,一个模型在预测为0.9的样本中,实际阳性比例应接近90%。
问:为什么文中只说“线性探测”,而没有尝试对基础模型进行微调? 答:线性探测(Linear Probing)是指在冻结预训练编码器的情况下,只训练一个线性分类器。作者选择这种方式有两个原因:一是为了保证比较的公平性(所有模型使用完全相同的训练过程),二是避免在小样本场景下微调导致的过拟合或灾难性遗忘。实际上,在这类只有几十到几百个样本的医疗数据集中,微调往往不如线性探测稳定,且容易破坏预训练的通用特征。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
首次系统比较多种图像基础模型与表格基础模型在IDH预测上的性能,思路新颖,但方法本身没有提出新架构。
实验合理度: ★★★★☆
实验设计严谨,采用分层5折,考虑分布内、跨队列、外部环境等多维度,但缺少对基础模型微调的对比。
学术研究价值: ★★★★☆
为医学AI模型选择提供了重要基准,提醒研究者不要盲目追逐基础模型,具有很好的反思意义。
稳定性: ★★★☆☆
TabPFN在分布内稳定,BiomedCLIP在分布偏移下稳定,但整体结果受限于小样本和单一任务,鲁棒性需更多验证。
适应性以及泛化能力: ★★★★☆
跨队列和外部验证较全面,但仅针对IDH一个生物标志物,对其他标志物的适用性未知。
硬件需求及成本: ★★★★☆
TabPFN和逻辑回归计算量小,BiomedCLIP等需要GPU但推理成本可接受。
复现难度: ★★☆☆☆
论文声称代码将在接受后公开,目前未提供,且部分基础模型权重获取可能受限。
产品化成熟度: ★★☆☆☆
离临床部署还有距离,需要更大规模多中心验证、全自动分割流程、以及更全面的校准评估。
可能的问题: 仅采用线性探测,未探索微调潜力;外部队列UCSD-PTGBM为治疗后数据,可能低估基线方法;肿瘤分割来源不一致引入额外噪声。
主要参考文献
[1] Hollmann, N., Müller, S., Egensperger, K., Hutter, F.: TabPFN: A transformer that solves small tabular classification problems in a second. In: International Conference on Learning Representations 2023.
[2] Oquab, M., et al.: DINOv2: Learning robust visual features without supervision. 2024.
[3] Radford, A., et al.: Learning transferable visual models from natural language supervision. ICML 2021.
[4] Dong, H., et al.: MRI-CORE: A Foundation Model for Magnetic Resonance Imaging. 2025.
[5] 原始论文:A Benchmark of (MRI-)Foundation Models to Predict IDH Mutational Status in Glioma, arXiv:2606.23100.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
看完了?是不是觉得影像组学+TabPFN这个组合很香?
想知道如何高效跟踪AI医疗前沿?想第一时间获取最新论文解读和开源代码?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 AI医疗+上海+复旦+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群