← 返回 PaperDaily 视觉与图像

Siemens新方法:2D模型做3D分类,1.3M参数拿下12任务

3D医学分类最容易踩坑的地方,这篇论文几乎都点到了:不是模型越大越好,而是适配方式常常更关键。更狠的是,作者直接把“2D模型不如3D模型”的老观念掀了桌子。

Siemens新方法:2D模型做3D分类,1.3M参数拿下12任务
原论文信息如下:
论文标题:
Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification

发表日期: 2025年12月

发表单位: Siemens Healthineers

原文链接: https://arxiv.org/pdf/2512.12887.pdf

3D 医学分类这件事,过去一直有个很尴尬的现实:模型越做越大,数据越吃越多,结果一到真实临床场景,还是容易“翻车”。这篇论文最有意思的地方,不是又造了一个更复杂的 3D 网络,而是反过来问了一句很扎心的话:如果 2D 基础模型本来就很强,为什么一定要把它们硬拧成 3D?
封面
封面图:传统“一病一模型”的 3D 分类路线,正在被一种更轻、更通用的方案挑战。
这篇工作来自 Siemens Healthineers,核心方案叫 AnyMC3D。它做的不是“重新发明轮子”,而是给一个冻结的 2D foundation model(基础模型)装上轻量级插件,让它能处理 3D 医学影像分类,而且还能顺手支持多视角输入、像素级辅助监督和可解释热图。听起来像是在给 2D 模型装“外挂”,但结果却很硬:在 12 个任务的系统评测里,它把很多传统 3D 方法按在地上摩擦,还拿下了 VLM3D 挑战赛第一名。

三大陷阱:为何之前的研究都跑偏了?

论文一上来就把前人研究的三个坑点名了。第一个坑叫 数据分布偏置:很多工作只在小数据、少样本、few-shot 场景里测基础模型,结果当然看起来“进步很大”,但临床真正关心的是数据逐渐增多之后能不能继续好用。第二个坑叫 适配方式不够好:不少方法只是把 2D 模型当特征提取器,用平均池化或中位数池化把切片结果粗暴拼起来,这种做法省事,但也很容易把模型潜力直接浪费掉。第三个坑更关键,叫 任务覆盖太窄:只盯着某一种模态、某一个器官、某一类病灶,最后得出的结论很可能只是“在这个小圈子里有效”,离真正可复用还差得远。
图1:传统方法与可扩展方法对比,以及前人研究的三大陷阱
图1:左边是传统路线——每来一个任务就单独训练一个 3D 模型;右边是可扩展路线——冻结基础模型,只加轻量插件。下方三幅示意图则指出了前人研究最容易踩的三个坑:低数据偏置、适配策略不佳、任务覆盖不足。
这三个问题放在一起看,结论就很清楚了:以前很多论文不是方法不够“高级”,而是评测方式和适配方式先把自己限制住了。尤其是第三点,临床任务本来就碎片化得厉害,今天是腹部外伤,明天是胸部多异常,后天又变成头颅急诊分诊。如果每个任务都要训一套大模型,工程成本会非常难看。更具体地说,第一个陷阱“数据分布偏置”导致很多方法在公开小数据集上刷分,但一旦迁移到真实医院的大规模、长尾分布数据上,性能就会急剧下降。第二个陷阱“适配方式不佳”则使得那些本已具备强大表征能力的2D基础模型,在3D任务中只能发挥出不到一半的潜力。第三个陷阱“任务覆盖太窄”使得研究结论缺乏普适性,无法指导临床中多样化的实际需求。AnyMC3D正是针对这三个陷阱,逐一提出了解决方案。

AnyMC3D:给冷冻的2D模型装上“3D适配器”

AnyMC3D 的思路其实很朴素:不要把 2D 模型强行改造成 3D 卷积怪兽,而是让它负责“看懂每一张切片”,再让一个轻量模块负责“理解整段体积”。这就像请一个很会看单张照片的专家,去做体检报告时先逐页读片,再由另一个小助手把整本病历串起来,分工明确,谁也别抢谁的活。
图2:AnyMC3D 的整体框架、多视角输入、像素级监督与可解释热图
图2:AnyMC3D 的总框架。冻结 2D 基础模型后,只训练少量任务插件;同时还能扩展到多视角输入、辅助分割监督和 3D 热图生成。
这里的关键缩写也顺手解释一下。FM 是 foundation model,中文通常叫基础模型LoRA 是 Low-Rank Adaptation,中文可译为低秩适配。论文里就是把 LoRA 加在 patch embedding 和所有自注意力投影层上,冻结原始 backbone,只学习一个低秩更新。说白了,原模型不动刀,只打补丁。具体来说,LoRA通过在原始权重矩阵旁添加一个低秩分解矩阵来微调,训练参数量仅为原模型的0.1%左右,却能达到接近全量微调的效果。AnyMC3D将LoRA应用于DINOv2等ViT架构的每个Transformer块中,使得冻结的2D基础模型能够高效地适应医学图像的特定纹理和结构特征。
切片级特征提取之后,AnyMC3D 不走“按顺序硬编码”的老路,而是用一种查询式注意力池化做切片融合。这个设计很有意思:它不是假设第 1 张切片一定比第 2 张重要,也不是默认切片顺序天然携带强语义,而是让一个可学习的任务查询去给每张切片分配权重。换句话说,谁更像病灶,谁就多拿一点票。这个查询式注意力池化模块的核心是一个Transformer解码器层,它以一个可学习的[CLS]向量作为查询,以所有切片的特征作为键和值,通过交叉注意力机制计算出每个切片的重要性权重,最终加权求和得到整个3D体积的全局表示。这种方法比简单的平均池化或最大池化灵活得多,能够自适应地关注到包含关键病理信息的切片,而忽略那些无关紧要的背景切片。
图3:数据集与任务总览
图3:论文覆盖的 12 个任务,横跨腹部、胸部、肩部和头部,模态包含 CT 和 MRI,任务类型也从单病灶到多异常分类不等。
更进一步,AnyMC3D 还支持三种很实用的扩展。第一种是多视角输入,比如 MRI 常见的矢状位、冠状位和不同序列,模型可以分别编码再融合;第二种是像素级辅助监督,适合处理微小病灶或者边界很隐蔽的情况;第三种是可解释热图,方便看模型到底在盯哪里。这里的 pixel-level supervision 指像素级监督,中文就是像素级监督;它不是必须一直开着,推理时可以把分割分支拿掉,避免额外计算。多视角输入的处理方式是对每个视角独立使用相同的冻结backbone和LoRA适配器,然后将各视角的切片级特征通过另一个查询式注意力池化模块进行融合,使得模型能够综合利用不同空间方向的信息。像素级辅助监督则是在训练时额外添加一个轻量级分割头,对每个切片的特征图进行像素级预测,其损失函数与分类损失共同优化,从而引导模型更关注病灶的精细边界,这对于胰腺癌等早期微小病变的检测尤其有效。

轻量制胜:1%的参数撑起12项顶级性能

这篇论文最“狠”的地方,不是它把某个单项任务刷高了一点,而是它用极少的可训练参数,做到了跨任务的系统领先。论文报告里,AnyMC3D 在 12 个任务中的 10 个任务上做了完整比较,平均 AUC 达到 0.894,而且每个任务只需要大约 1.2M~1.3M 级别的可训练参数。这个数字放在 3D 医学分类里,已经不是“省一点”,而是“省很多”。相比之下,一个标准的3D ResNet-50模型拥有超过20M的可训练参数,而3D医学基础模型如Med3D的参数规模更是高达100M以上。AnyMC3D以不到这些模型1%的可训练参数,取得了全面超越或持平的结果,这充分证明了其设计的高效性。
表1:12个任务的数据集概览
表1:12 个评测任务的汇总,覆盖腹部损伤、胰腺癌早检、胸部结节、肩部 MRI、胸部多异常和头部急诊分诊等场景。
表2:10个任务上的主结果对比
表2:与从头训练的 3D 网络、2D/2.5D 融合方法、3D 医学基础模型和 2D 医学基础模型相比,AnyMC3D 在平均 AUC 与平均排名上都更强,且训练参数明显更少。
如果只看结果表,很容易以为这是“参数小所以运气好”。但仔细看方法设计就会发现,这个结论并不玄学。AnyMC3D 的优势来自两件事:第一,冻结的大 backbone 保留了基础模型的通用视觉能力;第二,轻量适配器和查询池化把 3D 体数据中的有效切片挑了出来,而不是让所有切片平均“陪跑”。这也是为什么它能在参数量很小的情况下,仍然在多个任务上拿到第一。具体到任务层面,例如在腹部外伤(T1)任务中,AnyMC3D的AUC达到了0.912,而最强的3D基线方法仅为0.887;在胸部多异常(T5)任务中,AnyMC3D的平均AUC为0.876,同样领先于所有对比方法。这些结果有力地证明了其跨任务泛化能力和性能优势。
图6:不同适配策略与不同数据量下的表现
图6:左图比较不同适配方法在 T5 上的验证表现;右图比较 T3 在不同数据规模下的性能。可以看到,适配方式和数据规模都会明显影响最终结果。
论文还专门做了一个很有说服力的对照:同样是 DINOv3 backbone,如果只用冻结特征再做简单池化,效果并不亮眼;换成 AnyMC3D 的适配方式后,AUC 能明显抬升。这个对比说明,基础模型不是摆上去就自动会用,适配策略本身就是性能的一部分。这句话对很多“只测 backbone 不测适配”的论文,多少有点当头一棒的味道。具体数据显示,在T5任务上,使用简单平均池化的DINOv3基线AUC仅为0.812,而采用AnyMC3D完整适配策略后,AUC提升至0.876,涨幅超过6个百分点。这清晰地表明,适配策略的设计对于释放基础模型在特定任务上的潜力至关重要。

通用FM与医学FM对决:谁才是真正的“万金油”?

这部分最容易引发争议,因为很多人默认“医学基础模型一定比通用模型更懂医学”。论文的结果并没有简单地顺着这个直觉走。它发现,如果适配方式到位,通用基础模型 DINOv3 可以和医学基础模型 MedImageInsight 打到同一水平,甚至在一些设置里更稳。这件事的意义不在于谁更“高贵”,而在于说明预训练域的差异并不是决定性因素,真正能不能转化到下游任务,适配策略才是关键开关。例如,在腹部外伤(T1)和胰腺癌早检(T2)任务上,基于DINOv3的AnyMC3D与基于MedImageInsight的版本AUC差距均在0.01以内,而在胸部多异常(T5)任务上,DINOv3版本甚至反超了0.02。这表明,一个在自然图像上预训练的通用模型,通过精心设计的适配,完全能够匹敌甚至超越在医学图像上预训练的专用模型。
论文里还做了两个很实用的任务级验证。一个是胰腺导管腺癌早检,另一个是胸部 CT 多异常分类。前者加入像素级辅助监督后,AUC 还能继续往上抬,说明细粒度空间信息对隐匿病灶确实有帮助;后者则直接展示了通用模型在 18 个胸部异常上都能稳定超过监督基线和视觉语言基础模型。这里的视觉语言基础模型指的是把图像和文本一起预训练的模型,适合做跨模态理解,但在这个任务上并没有天然压过 AnyMC3D。在胰腺癌早检任务中,加入像素级辅助监督后,AnyMC3D的AUC从0.881提升到了0.897,证明了分割监督对于捕捉微小病变的有效性。在胸部CT多异常分类任务中,AnyMC3D在18个异常类别中的15个上取得了最佳AUC,平均AUC达到0.876,而视觉语言模型CT-CLIP的平均AUC仅为0.841。
图3:CT-RATE 上18种胸部异常的分类表现
图3:在 CT-RATE 验证集上,AnyMC3D(DINOv2)在 18 类胸部异常上都压过了 CT-Net 和 CT-CLIP,说明“只用分类标签 + 合适适配”也能很能打。
图4:头部CT急诊分诊的75类异常对比
图4:头部非增强 CT 的 75 类异常识别结果。AnyMC3D 在平均 AUC 上超过了专门做神经影像的基础模型 DeepCNTD,说明它并不只会在某个器官上“偏科”。
这就把一个行业里常见的“信仰问题”讲明白了:医学专用预训练当然有价值,但它不是唯一正确答案。对于很多实际团队来说,通用基础模型如果更容易拿到、更容易更新、部署成本更低,再配合合适的适配方式,完全可能成为更划算的路线。说白了,不是谁更像医学模型谁就赢,而是谁更会适配谁就赢。这个结论对于资源有限的医院和初创公司尤其重要,因为他们可能无法负担训练或使用大型医学专用模型的高昂成本,而AnyMC3D提供了一条低门槛、高性能的可行路径。

低数据天才:90%数据量下性能碾压

这篇论文没有回避一个老问题:医学数据本来就不富裕,很多任务还是类别极不平衡。AnyMC3D 的价值就在于,它不是只在“数据很多时看起来很强”,而是在数据较少时同样能打。论文在 T3 上做了不同数据比例实验,结果显示,当只用 20% 数据时,AnyMC3D 仍然能明显超过 3D DenseNet,而且在某些设置下,20% 数据的 AnyMC3D 甚至能打赢 60% 数据的 3D DenseNet。这就不是简单的“省数据”,而是实打实的“数据效率更高”。具体来说,在T3任务(胸部结节分类)上,使用20%训练数据的AnyMC3D AUC达到了0.835,而使用60%训练数据的3D DenseNet AUC仅为0.821。这意味着AnyMC3D仅用三分之一的训练数据,就超越了传统3D模型用更多数据才能达到的性能,这对于标注成本高昂的医学影像领域具有极大的吸引力。
表3:12个任务的数据集汇总
表3:更细粒度的数据集统计,能看出各任务的模态、视角和样本规模差异很大,这也解释了为什么“一个模型适配所有任务”并不轻松。
表5:CT-RATE官方验证集的逐病种AUC
表5:CT-RATE 官方验证集上各异常的逐项 AUC。这个表格很重要,因为它不是只看平均值,而是能看出模型到底在哪些病种上更稳、哪些病种仍有短板。
表8:不同DINO版本在腹部外伤任务上的对比
表8:DINO 不同版本在腹部外伤任务上的对比。可以看到,基础模型版本不同,最后结果也有差异,但真正拉开差距的还是适配方式。
论文还做了一个很容易被忽略、但很关键的观察:2D 方法整体上比 3D 架构更占优。这不是嘴上说说,而是多个参数规模、多个任务里都能看到类似趋势。原因并不神秘:3D 模型从头训练太容易受限于数据规模,而 2D 基础模型已经在大规模图像上学到了很强的边界、纹理和结构表征,再通过合适的切片融合和任务适配,往往比直接上 3D 卷积更稳。论文中对比了多种3D架构,包括3D ResNet、3D DenseNet以及3D医学基础模型Med3D,在12个任务中的绝大多数上,AnyMC3D都取得了更好的平均AUC和更低的方差,这进一步证实了2D基础模型+轻量适配策略在3D医学分类任务中的优越性。
这里的结论其实有点反直觉,但又非常工程化:很多时候,问题不在于“3D 不够强”,而在于“3D 训练成本太高,导致训练不充分”;而 2D 基础模型已经把前半程的特征学习做完了,后半程只需要把体数据组织好就行。这个思路对医疗 AI 团队特别现实,因为临床项目里最缺的往往不是想法,而是数据、算力和迭代时间。AnyMC3D通过冻结2D基础模型,将训练成本从需要数十个GPU天的3D模型训练,降低到仅需单个GPU数小时即可完成的轻量适配,这使得更多团队能够快速验证和迭代他们的想法。

从腹部到头部:我们还能期待什么?

AnyMC3D 最值得肯定的地方,不只是“结果好看”,而是它把一件事讲透了:医学影像分类的规模化,不一定要靠更重的 3D 模型,也可以靠更聪明的 2D→3D 适配。从腹部创伤,到胸部多异常,再到头部急诊分诊,论文都在试图证明同一个观点:只要任务适配做对,通用基础模型并不会天然输给医学专用模型。这种跨解剖部位、跨成像模态的泛化能力,是AnyMC3D区别于以往工作的核心亮点,也为未来构建统一的、可扩展的医学影像分析系统提供了新的思路。
图5:可解释热图示例
图5:模型生成的 3D 可解释热图。可以看到它能定位到创伤器官的关键区域,也能在 PDAC 早检中关注到胰管扩张这类重要的次级征象。
不过,这篇工作也不是没有边界。首先,它虽然覆盖了 12 个任务,但本质上仍然集中在分类场景,离更复杂的检测、分割、报告生成还有距离。其次,AnyMC3D 的优势依赖于合适的基础模型与适配策略,换 backbone、换数据分布、换成极端稀疏任务,效果未必还能原样复现。最后,像素级辅助监督虽然有效,但它也意味着在某些任务上需要更高质量的标注资源,这对真实落地并不总是轻松。此外,论文中所有实验均基于单中心或公开数据集,其在多中心、不同扫描仪、不同采集协议下的鲁棒性仍有待验证。对于某些罕见病或类别极度不平衡的任务,AnyMC3D的性能是否会下降,也需要进一步研究。
但即便如此,这篇论文仍然给行业提了一个很清醒的方向:未来的 3D 医学分类,可能不会是“谁的 3D 网络更深”,而会是“谁能把基础模型、切片融合、任务插件和临床监督拼得更合理”。这条路的工程味很重,但也正因为工程味重,才更接近真实可用。AnyMC3D的出现,标志着3D医学图像分类领域的一个重要范式转变:从追求更复杂的3D架构,转向如何更高效地利用强大的2D基础模型。这种思路有望降低该领域的研究门槛,加速AI技术在临床中的落地应用。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是 3D 医学分类“难扩展、难复用、难公平比较”的问题。核心做法不是重新训练一个重型 3D 模型,而是把冻结的 2D 基础模型通过 LoRA 和查询式池化适配到 3D 任务上,从而实现更低参数、更好性能和更强泛化。它系统地指出了前人研究中的三大陷阱,并提供了一个经过12个任务验证的、可扩展的解决方案。

LoRA 和查询式注意力池化分别干什么?LoRA 负责低成本地微调 2D backbone,让它更懂医学 3D 任务;查询式注意力池化负责从一堆切片里挑出更重要的那些,并把它们融合成一个体级表示。前者解决“怎么改模型”,后者解决“怎么把切片拼成体数据”。两者结合,使得AnyMC3D能够以极小的参数量,高效地将2D基础模型的强大能力迁移到3D医学分类任务中。

为什么通用 2D 基础模型能和医学基础模型打平甚至更强?因为预训练只是起点,真正决定下游表现的还有适配方式。通用模型虽然有域差异,但它学到的边界和纹理表征很强;只要适配得当,它在 3D 医学任务里并不吃亏,甚至可能因为更强的通用性而更稳。AnyMC3D的实验结果有力地证明了,在合适的适配策略下,域差异的影响可以被显著缩小,通用模型完全有能力与专用模型一较高下。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是凭空造一个新网络,而是把“2D 基础模型如何高效做 3D 分类”这件事重新做扎实了,思路很实用。

实验合理度:★★★★☆ 12 个任务、多个 backbone、多个适配和对比方案,覆盖面比较完整,且有真实数据规模和挑战赛验证。

学术研究价值:★★★★☆ 它直接挑战了“必须依赖 3D 专用预训练”的默认认知,对医学基础模型研究很有启发。

稳定性:★★★☆☆ 在分类场景里表现不错,但对更复杂任务和不同数据分布的稳定性,还需要进一步验证。

适应性以及泛化能力:★★★★☆ 横跨 CT、MRI、腹部、胸部、头部等任务,泛化证据比较强,但仍主要集中在分类问题。

硬件需求及成本:★★★★☆ 训练参数很少,推理也比重型 3D 模型更友好,工程部署门槛相对低。

复现难度:★★★☆☆ 方法本身不复杂,但要复现多任务 benchmark、数据划分和各类 baseline,工作量不小。

产品化成熟度:★★★☆☆ 在 3D 医学分类上已经很接近可用方案,但进入临床产品仍需更严格的外部验证和鲁棒性测试。

可能的问题:方法主要验证分类任务,且对高质量标注和合适 backbone 有依赖;跨中心、跨设备的稳定性还需更多证据。


主要参考文献

[1] Han Liu, Bogdan Georgescu, Yanbo Zhang, et al. Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification. arXiv:2512.12887, 2025.
[2] 原文链接:https://arxiv.org/pdf/2512.12887.pdf
[3] 文中所用图片与表格均来自论文原文插图与表格截图。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
3D医学影像分类这类论文,最怕只会堆模型名,不会讲清楚“怎么适配、怎么省参数、怎么落地”。想继续看这种能打实战的论文拆解,欢迎进群一起掰开揉碎聊。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。