← 返回 PaperDaily
视觉与图像
最新基准测试:预测脑胶质瘤IDH突变,传统放射组学竟效果优于四大MRI基础模型
让最先进的MRI基础模型和“老古董”放射组学同台竞技,结果传统方法完胜?这篇论文对所有搞医学影像AI的人来说,都是一盆清醒的冷水。它告诉你,大模型未必是万能药,基线方法才是真正的试金石。
龙哥读论文
发布于 2026-08-14 09:10:43
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更新AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 让最先进的MRI基础模型和“老古董”放射组学同台竞技,结果传统方法完胜?这篇论文对所有搞医学影像AI的人来说,都是一盆清醒的冷水。它告诉你,大模型未必是万能药,基线方法才是真正的试金石。
原论文信息如下:
为什么MRI基础模型预测胶质瘤突变,还不如传统的放射组学?
龙哥先问大家一个问题:如果让你用最新的AI大模型(还是专门为医学影像训的)去预测脑胶质瘤的基因突变,你觉得效果怎么样?是不是觉得肯定比传统手工设计特征的“老方法”强?
但今天这篇来自瑞士伯尔尼大学医院等机构的论文,结果可能让你大跌眼镜:用放射组学(Radiomics)手工提取的特征,配合一个轻量级的表格基础模型TabPFN,不仅在自家数据上吊打了所有MRI基础模型,在跨数据集迁移时也丝毫不虚。反而那些发了顶会、专门为大脑或者MRI训练的基础模型——BrainIA、MRI-CORE,表现却垫底。这是为啥?基础模型到底行不行?
这篇论文要解决的核心问题是:非侵入性地预测胶质瘤的IDH突变状态 (IDH即异柠檬酸脱氢酶基因,是WHO胶质瘤分级的核心分子标志物,直接指导治疗决策)。目前临床上需要靠活检,而MRI是常规扫描,如果能从MRI直接预测,价值巨大。最近涌现了大量医学影像基础模型,宣称能通用地提取图像特征。但真相如何?这篇工作系统比较了四种图像基础模型和两种放射组学基线,给出了答案。
四大MRI基础模型与放射组学方法的巅峰对决
论文选的四种图像基础模型,几乎覆盖了当前主流设计空间:
BrainIA ([26]):3D卷积结构,专门在大脑MRI上预训练,输入完整脑容积。
MRI-CORE ([8]):在多解剖部位(不只是大脑)的MRI切片上预训练的2D ViT。
BiomedCLIP ([31]):基于对比学习(CLIP)在生物医学图像-文本对上预训练的通用模型。
BrainDINO ([28]):用DINOv3自蒸馏框架在660万张大脑MRI切片上预训练,与BiomedCLIP同为ViT-B/16架构。
而放射组学基线则采用PyRadiomics提取107个手工特征(包括形状、一阶统计、纹理等),经特征选择后分别喂给逻辑回归(LogReg)和表格基础模型TabPFN([13])。TabPFN本身是一个在合成表格分类任务上预训练的Transformer,可以直接通过上下文学习给出概率,无需微调。
评估设置很严谨:在四个公共数据集(UCSF、UPEN、UTSW、EGD)上各自做5次分层训练/验证/测试,再交叉迁移,最后外加一个外部术后治疗队列(UCSD-PTGBM),模拟真实临床分布偏移。
谁是域内预测的王者?
先看同一个数据集内(train/test来自同一中心)的结果。下图对角线上的数值就是域内AUROC(曲线下面积,越高越好)。
结果非常清晰:TabPFN放射组学基线以平均AUROC 0.92(标准差0.03)的绝对优势碾压所有图像模型 。逻辑回归紧随其后(0.88)。在图像基础模型中,BiomedCLIP和BrainDINO表现接近(0.85和0.82),而脑专用模型BrainIA和MRI-CORE则垫底(0.75左右)。值得注意的是,BrainDINO在EGD数据集上甚至略超BiomedCLIP(0.889 vs 0.880),成为该数据上的图像模型冠军。
这说明一个扎心的事实:在数据量小、特征明确的任务上(IDH预测就是典型的纹理/形状模式),手工特征+强分类器依然是最优选择。而基础模型如果预训练策略不够强(比如早期BrainIA),甚至不如简单的逻辑回归。BrainDINO能追上,还得益于DINOv3的自蒸馏配方,证明了预训练目标比数据域更关键。
面对数据分布偏移,谁能笑到最后?
医学AI最头疼的不是训练集,而是部署时遇到的数据偏移。本论文特意设计了两个场景:一是跨不同医院/扫描仪的数据集迁移,二是外部术后治疗队列(包含手术腔、增强改变等)。
从图2的非对角线可以看到,AUROC普遍下降0.05~0.15,但TabPFN依然保持领先。然而在外部术后队列上,风向变了:BiomedCLIP的AUROC达到0.74,BrainDINO紧随其后0.743,超过了TabPFN的0.72。放射组学基线的下降幅度最大(从0.92掉到0.72左右),说明手工特征面对术后外观变化更脆弱。
这告诉我们:基础模型虽然域内略逊,但泛化性更强 ,尤其是BiomedCLIP这样在大量生物医学图像-文本对上学到的特征,对剧烈变换更鲁棒。而BrainDINO靠脑部自蒸馏也追了上来,说明域内最优不等于域外最优。
从排名到概率:谁才是临床最可靠的模型?
AUROC衡量的是排序能力,但临床医生真正需要的是可靠的概率输出 ——比如预测有80%概率为IDH突变,那么实际100个这样的病例里应该有80个真的是突变。这就是校准(Calibration)。论文用预期校准误差(ECE)来评估,越低越好。
结果如表3所示:TabPFN在所有设定下校准都最好 (域内ECE 0.03~0.10,外部0.073),而BiomedCLIP虽然AUROC高,但校准误差在外部高达0.13(TabPFN只有0.073)。BrainDINO在校准上更是暴跌(外部0.26)。这意味着,如果你需要一个可信的概率来做治疗决策(比如设定阈值决定是否手术),放射组学+TabPFN仍然是最佳选择。
未来之路:基础模型在医学影像中的应用前景
论文虽给出了当前结论,但也坦诚指出了若干局限:所有图像模型都只用线性探头估测性能,可能没有发挥端到端微调的全部潜力。而放射组学特征依赖于手工分割(不同数据集分割来源不一),可能引入了额外噪声。未来方向包括:联合使用放射组学与基础模型特征、加入临床变量(年龄、WHO分级)、扩展到更多分子标志物(1p/19q、MGMT等)。
此外,论文最后提到,由于放射组学特征和基础模型特征都缺乏直观的可解释性(一个是聚集统计,一个是黑盒嵌入),但校准性好的模型在做出决策时更值得信赖。因此,在追求新模型的同时,千万别丢掉传统方法的优秀品质。
龙迷三问
这篇论文解决什么问题? 系统比较了四种MRI基础模型与两种放射组学方法在胶质瘤IDH突变预测任务上的表现,包括域内、跨数据集和外部术后场景,重点关注分类性能和概率校准。
TabPFN是什么? TabPFN(Tabular Prior-Data Fitted Networks)是一种预训练的表格分类Transformer,由Hollmann等人提出([13])。它通过在一个庞大的合成表格分类任务集合上预训练,然后可以直接对新表格数据集进行上下文学习(in-context learning)——即给定少量标注样本后,直接对新样本输出概率,无需更新权重。在本文中,它接收放射组学特征作为输入。
什么是线性探头(linear probe)? 线性探头是一种评估预训练特征质量的常用方法:冻结预训练编码器的参数,只训练一个简单的线性分类层(没有隐藏层)。这样,模型性能的差异主要反映预训练特征本身的质量,而不是微调策略的影响。本文所有图像基础模型都采用线性探头评估。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
实验合理度:★★★★★ 设计严谨:5折分层采样、统一预分割、校准评估,外部术后队列具有临床代表性。
学术研究价值:★★★★☆ 对基础模型预训练域和任务适配提供了重要经验,尤其证明自蒸馏配方比数据域更关键。
稳定性:★★★☆☆ 域内性能稳定,但外部术后场景下AUROC下降0.15~0.30,概率校准变差,未达到可临床直接部署的程度。
适应性以及泛化能力:★★★★☆ 跨数据集迁移表现尚可,外部场景下BiomedCLIP泛化最好;但脑专用模型泛化反而最差,提示不能盲目迷信域。
硬件需求及成本:★★★★☆ 放射组学+TabPFN无需GPU即可运行,图像模型需要中等算力,但总体成本较低。
复现难度:★★★★☆ 代码将在论文接收后开源,方法标准化,但数据集分割细则需仔细参照。
产品化成熟度:★★☆☆☆ 仍处于benchmark阶段,外部性能不够稳定,距离临床落地还有一段距离。
可能的问题: 所有图像模型仅使用线性探头,未尝试端到端微调,可能低估了基础模型潜力;放射组学特征依赖的手工分割在不同数据集间不一致,可能影响跨域公平性。
主要参考文献
[1] Hollmann, N., Müller, S., Egensperger, K., Hütter, F.: TabPFN: A transformer that solves small tabular classification problems in a second. In: International Conference on Learning Representations (2023).
[2] Radford, A., et al.: Learning Transferable Visual Models From Natural Language Supervision. In: ICML (2021).
[3] Oquab, M., et al.: DINOv2: Learning robust visual features without supervision (2024). arXiv:2304.07193.
[4] Nakase, T., et al.: Integration of MRI radiomics and germline genetics to predict the IDH mutation status of gliomas. npj Precision Oncology 9, 187 (2025).
[5] Dong, H., et al.: MRI-CORE: A Foundation Model for Magnetic Resonance Imaging (2025). arXiv:2506.12186.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
什么?AI界的“顶流”基础模型,竟然输给了“朴实无华”的放射组学?
想第一时间 get 最新AI 论文趣闻,与同行一起吐槽讨论,那就快来加入龙哥读论文粉丝群吧!
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群