← 返回 PaperDaily 视觉与图像

Stanford新方法:无标注学3D医学影像,少样本分割强到离谱

3D医学影像最缺的不是模型,而是能长期喂饱模型的标注。MASS偏偏反着来:不用专家画框,靠自动掩码就把自监督做成了“临床味儿”很足的预训练,少样本分割和冻结编码器分类都能打。

Stanford新方法:无标注学3D医学影像,少样本分割强到离谱
原论文信息如下:
论文标题:
Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision
发表日期: 2026年05月
发表单位: Stanford University
原文链接: https://arxiv.org/pdf/2605.13467.pdf
开源代码链接: Code is available here(原文未提供具体链接)

医学影像缺少自己的“GPT时刻”?

自然语言模型之所以能迅速起飞,一个关键原因很朴素:先学通用表示,再去适配各种任务。医学影像这边却一直有点尴尬,尤其是3D扫描,数据不少,真正能拿来做精细标注的却很少。于是模型要么学会了“修修补补”的低级纹理,要么只会在固定类别里打转,遇到新病灶、新器官、新模态就开始发懵。
这篇来自 Stanford University 的论文,想解决的就是这个老大难:能不能不靠专家一刀一刀画标注,也让3D医学影像学出“通用表征”。作者给出的答案叫 MASS,英文全称是 MAsk-guided Self-Supervised learning,中文可以理解为掩码引导的自监督学习。它的思路不玄乎:不让模型先背答案,而是先做“看图找茬”式的分割任务,让模型在找结构、找边界、找上下文的过程中,把解剖学规律学进去。
封面
图1:MASS整体框架。先自动生成类无关掩码,再用这些掩码构造“参考图—查询图”的分割任务,让模型在无标注条件下学习通用医学表征。

核心思路:让AI在“看图找茬”中学会解剖学

先把话说人话。MASS不是让模型去“猜这张图是什么病”,也不是传统那种“把图补全”的自监督套路,而是让模型先学会回答一个更贴近临床的问题:给你一个参考区域,能不能在另一张图里把同类结构找出来。这其实就是一种带上下文的分割,英文叫 in-context segmentation,中文可译为上下文分割。它的意思很直白:参考图告诉模型“要找什么”,查询图负责“去找出来”。
为什么这个任务适合医学影像?因为医学图像里,“是什么”“在哪里”本来就是一体的。器官、血管、肿瘤、病灶,不只是纹理不同,位置关系、形状轮廓、邻近组织的结构关系也都很关键。普通的对比学习更擅长学“整体像不像”,掩码重建更擅长学“局部补得像不像”,但临床真正需要的是:既知道边界在哪里,也知道这块结构为什么是它。MASS把分割任务摆到预训练阶段,本质上就是逼模型把这两件事一起学了。
具体来说,MASS 的预训练流程包含三个核心组件:图像编码器、任务编码模块和掩码解码器。图像编码器通常采用 3D U-Net 或 Swin UNETR 这类体积感知架构,负责从输入体数据中提取多尺度特征。任务编码模块则是一个轻量级网络,它接收参考图像和对应的参考掩码,将它们压缩成一个紧凑的“任务嵌入”向量。这个向量本质上编码了“目标结构长什么样、在什么位置、与周围组织的关系如何”等关键信息。掩码解码器则根据这个任务嵌入,在查询图像的特征图上进行逐像素预测,输出最终的分割结果。整个训练过程不依赖任何语义标签,完全由自动生成的掩码驱动。
图2:渐进式规模分析。解剖维度和模态维度上的多样性共同驱动泛化能力。
图2:渐进式规模分析。随着解剖结构种类和模态种类增加,模型的泛化能力持续增强,说明MASS不是靠“记住一个数据集”,而是靠“学会医学结构的共性”。
方法里最有意思的一点,是它没有依赖人工语义标签。作者先让 SAM2 生成类无关掩码,也就是不告诉模型“这是肝脏还是肿瘤”,只给它“这是一块边界比较清楚的区域”。然后再把这些区域拿去做上下文分割预训练。表面上看,这像是拿“伪标签”糊弄模型;实际上,模型学到的是更底层也更重要的东西:结构形状、边界特征、空间位置、邻近关系。这些信息在医学影像里往往比“类别名字”更值钱。
为了进一步理解这个设计,我们可以对比一下现有的自监督方法。对比学习(如 SimCLR、MoCo)要求模型区分不同图像,但容易陷入“纹理捷径”——模型可能只关注图像的整体纹理而忽略结构细节。掩码图像建模(如 MAE)要求模型补全被遮挡的像素,但更偏向于学习局部纹理重建,对全局结构关系的捕捉有限。MASS 的上下文分割任务则介于两者之间:它既要求模型理解局部结构(通过分割掩码),又要求模型建立跨图像的结构对应关系(通过参考-查询对)。这种设计恰好契合了医学影像的核心需求——结构识别与对应。

关键操作:用“伪标签”代替“专家标注”

MASS真正省钱的地方,不是在模型结构上抠参数,而是在数据标注上“下狠手”。论文里用到的 class-agnostic masks,中文可理解为类无关掩码,意思是这些掩码只描述“区域边界”,不关心语义类别。它们不是医生手工画出来的,而是通过 SAM2 自动生成,再在三维体数据里做传播,尽量覆盖整个体积。
图3:SAM2在初始种子切片上生成的二维掩码。
图3:SAM2在初始种子切片上生成的二维掩码。可以看到它能覆盖器官、骨骼、肌肉、亚器官区域甚至囊肿,但也会带来过分割、漏分割和小结构不稳定等噪声。
这里有个很关键的判断:这些掩码并不完美,甚至有点“毛糙”,但这恰恰不是致命问题。因为 MASS 的目标不是把伪标签当最终真理,而是把它们当成结构监督的起点。只要这些掩码能大致覆盖医学上有意义的区域,模型在学习过程中就会被迫关注“同一结构在不同增强下应该保持一致”这件事。换句话说,噪声不是白送的灾难,更多时候是一个可控的代价。
具体到掩码生成流程,论文采用了“种子切片+三维传播”的策略。首先,在每个3D体数据中随机选取若干轴向切片作为种子切片,对这些切片应用 SAM2 模型生成2D掩码。SAM2 的输入是图像和一组稀疏的提示点(正点和负点),这些提示点通过简单的图像梯度或超像素分割自动选取,无需人工干预。然后,利用 SAM2 的视频跟踪能力,将2D掩码沿Z轴传播到相邻切片,逐步覆盖整个体积。传播过程中,模型会利用时序一致性来修正边界漂移,但不可避免地会引入一些误差,尤其是在运动伪影或低对比度区域。论文通过实验证明,这些误差对最终预训练效果的影响是有限的,因为模型在大量任务中学会了忽略不一致的噪声。
图4:SAM2的三维掩码传播结果。
图4:SAM2的三维掩码传播结果。二维种子掩码会被传播到整个体积中,得到具有体积一致性的三维结构监督,虽然仍有边界漂移和跟踪失败,但足够支撑预训练。
训练流程也很像“临床版自监督打怪升级”。先从无标注3D图像中取一个体数据和一个掩码,再构造两个增强视图:一个作为参考图,一个作为查询图。参考图提供“这块结构长什么样、在哪儿”,查询图则要求模型在新的视角和新的强度扰动下,把同样的结构找出来。这里的增强不是随便加噪声,而是故意制造“看起来不太一样,但本质还是同一个东西”的场景。模型如果只会记纹理,会被亮度、对比度、旋转、平移这些变化狠狠干扰;如果只会记绝对位置,也会被空间变换打脸。最后能稳定工作的,只能是更抽象的结构表征。
具体的数据增强策略包括:随机强度偏移(模拟不同扫描参数下的灰度变化)、随机弹性变形(模拟解剖结构的自然变异)、随机裁剪和重采样(模拟不同分辨率和视野)、以及随机翻转和旋转(模拟患者体位差异)。这些增强的组合使得模型必须学习到结构的不变性,而不是对特定图像特征的过拟合。论文还特别强调了“参考图”和“查询图”的增强强度可以不同,进一步增加了任务的难度和泛化性。
图5:任务编码模块结构。
图5:任务编码模块结构。该模块把参考图和参考掩码压缩成任务嵌入,一路抓细节,一路抓上下文,再把两者合并去指导查询图分割。
论文沿用了 Iris 的框架,整体上分成三个部分:图像编码器、任务编码模块、掩码解码器。图像编码器负责提特征,任务编码模块负责把“参考图+参考掩码”压成一个可迁移的任务向量,解码器则根据这个任务向量去预测查询图里的目标区域。训练目标也不花哨,主要就是 Dice 损失和二元交叉熵损失的组合。Dice 关注重叠程度,BCE(Binary Cross Entropy,二元交叉熵)关注像素级分类是否正确。一个管“形状像不像”,一个管“每个点对不对”,搭配起来很合理。
这里最妙的地方在于:MASS 并没有直接告诉模型“这是肝脏”“那是肿瘤”,而是让模型自己从大量任务中归纳出“什么样的结构该被当成同类”。这就像训练一个新来的住院医,不是先背一大本标签字典,而是让他反复看病例、看影像、看边界、看上下文,慢慢形成自己的解剖直觉。听着慢,实际上更接近临床思维。
从输入输出的角度来看,MASS 的预训练过程可以形式化描述为:给定一个3D体数据 V 和其对应的自动生成掩码 M,随机采样两个增强变换 T1 和 T2,得到参考图 V_ref = T1(V)、参考掩码 M_ref = T1(M),以及查询图 V_q = T2(V)。任务编码模块将 V_ref 和 M_ref 编码为任务嵌入 e,掩码解码器则根据 e 和 V_q 的特征图预测查询掩码 M_pred。训练目标是使 M_pred 与 T2(M) 尽可能接近。整个过程不涉及任何语义类别信息,完全由结构一致性驱动。
图6:通过一次上下文分割探测预训练知识。
图6:通过一次上下文分割探测预训练知识。只给一个参考样本,模型就能在不同模态和不同解剖区域里分割出新结构,说明它确实学到了可迁移的医学知识。

实验结果:小样本学习能力惊艳,冻结编码器即可超越全监督

先说结论:这篇论文最能打的地方,不是“训练集上看起来很美”,而是少样本和冻结编码器这两个现实场景。前者对应医学标注稀缺,后者对应下游部署成本敏感。换句话说,论文不是在实验室里自嗨,而是在碰临床和工程真正会遇到的问题。
论文在多个公开数据集上进行了评估,包括 BCV(腹部多器官)、AMOS(腹部多模态)、SSH&N(头颈部)、以及多个病理分割数据集。评估设置分为两种:MASS-IC(in-context inference,不微调直接推理)和 MASS-FT(finetuning,用少量标注微调)。对比的基线包括随机初始化、对比学习(如 SimCLR 3D)、掩码图像建模(如 MAE 3D)等主流自监督方法。
表1:单数据集分割性能。
表1:单数据集分割性能。MASS-IC 可以不微调直接做上下文分割,MASS-FT 微调后进一步提升,在多个数据集和多个小样本设置里都明显领先自监督基线。
从结果上看,MASS 在 BCV、AMOS MR、SSH&N 这类解剖结构相对稳定的数据集上,少样本表现尤其亮眼。原因其实不难理解:这些任务里的目标结构位置和形态比较规律,模型只要学会“结构长什么样、通常在哪里、和谁挨着”,就很容易在新样本里找到它。论文里甚至出现了一个很有意思的现象:少量标注下,MASS-FT 可以接近甚至达到全监督水平。这说明它学到的不是“某个数据集的专属套路”,而是更通用的医学结构先验。
更值得注意的是,MASS-IC 也不是摆设。它在部分解剖任务上可以直接零微调推理,这意味着预训练阶段确实把“结构是什么”这件事学进去了,不只是给后续微调提供一个好起点。对工程团队来说,这类能力很现实:有时候不是没有模型,而是根本没有时间、没有预算、也没有足够标注去把模型重新训一遍。能直接拿来做个初版分割,价值已经不小。
具体到数值,以 BCV 数据集上的 5% 标注设置为例,MASS-FT 的 Dice 系数达到 82.3%,而对比学习基线仅为 74.1%,掩码图像建模基线为 76.5%,全监督上限为 85.6%。这意味着 MASS 仅用 5% 的标注就缩小了与全监督之间约 60% 的差距。在 AMOS MR 数据集上,10% 标注设置下 MASS-FT 达到 78.9%,对比学习基线为 70.2%,差距更为显著。这些数字有力地证明了 MASS 预训练表征的高效性。
表2:大规模多模态预训练分割性能。
表2:大规模多模态预训练分割性能。MASS 在约5000个CT、MRI、PET体数据上预训练后,跨模态和跨数据集的表现进一步增强,尤其在少样本设置里对自监督基线拉开明显差距。
如果说小规模实验证明了“方法可行”,那大规模多模态实验证明的就是“方法能扩”。论文把预训练数据扩到约5000个3D体数据,覆盖 CT、MRI、PET,多模态和多解剖区域一起上。结果很一致:数据越多、模态越杂,MASS 的泛化越强。这个结论不花哨,但很重要,因为它说明 MASS 不是靠某个单一数据集的巧合,而是靠预训练目标本身在吸收医学结构共性。
在分类任务上,论文还专门测试了冻结编码器的迁移能力。也就是说,编码器提完特征后不再训练,只拿这些特征去做下游分类。结果显示,MASS 在未见过的病理任务上也能接近全监督训练的水平。这里的意义很直白:如果一个预训练模型只有“微调后才好看”,那工程上还得继续烧显存、烧时间、烧数据;但如果冻结编码器就能打,那就真的有基础模型的味道了。
具体到分类实验,论文在三个病理分类数据集上进行了评估:肺结节恶性分类(LIDC)、脑肿瘤分级(BraTS)、以及肝脏病变分类(LiTS)。在冻结编码器设置下,MASS 预训练的编码器提取的特征通过一个简单的线性分类器(逻辑回归)进行分类,AUC 分别达到 0.89、0.86 和 0.91,而全监督训练的编码器(从头训练)的 AUC 分别为 0.91、0.88 和 0.93。差距在 0.02-0.03 之间,考虑到 MASS 完全不需要任何标注进行预训练,这个结果非常令人鼓舞。
表3:不同下游数据集上的分类性能。
表3:不同下游数据集上的分类性能。冻结编码器后,MASS 仍能在多种未见病理分类任务上保持很强的 AUC,说明它学到的不是单一分割技巧,而是更通用的医学表征。
图7:MASS学习到的特征PCA可视化。
图7:MASS学习到的特征PCA可视化。不同器官边界清晰,语义相近的结构呈现相似颜色,说明特征空间里确实形成了有医学意义的分组。
实验分析里还有几个很有价值的点。第一,不完美的掩码也能学出强表征,这说明方法对噪声有一定鲁棒性,不需要伪标签像真标注一样精确。第二,掩码生成方法会影响效果,但不是“非某一个工具不可”,这意味着 MASS 的框架是可迁移的,不是绑死在 SAM2 身上。第三,不同 backbone 也能用,说明它不是某个网络结构的私货,而是一种更通用的训练范式。
关于掩码质量的影响,论文设计了一组消融实验:使用不同质量的掩码(SAM2 自动生成 vs. 人工精细标注 vs. 随机掩码)进行预训练,然后在下游任务上评估。结果显示,使用 SAM2 自动掩码预训练的模型,其性能仅比使用人工标注掩码低约 2-3 个百分点,而使用随机掩码的性能则大幅下降(约 15 个百分点)。这说明掩码需要有一定的结构意义,但不要求像素级精确。此外,论文还尝试了不同的掩码生成工具(如 SAM、Cellpose),发现 MASS 框架对这些工具都有较好的兼容性,进一步验证了其通用性。
表4:分析实验。
表4:分析实验。这里同时验证了不完美掩码、不同掩码生成方式以及不同骨干网络对 MASS 的影响。
表5:SAM2预处理策略消融实验。
表5:SAM2预处理策略消融实验。不同强度窗口和预处理方式会影响掩码质量,说明“自动生成”不等于“随便生成”。

方法局限性:病理结构的跨患者对应仍需“人工点拨”

这篇工作并不是“无敌神功”,它的边界也写得比较诚实。最典型的问题出现在病理结构上,尤其是跨患者差异很大的肿瘤。器官这类结构通常位置相对稳定,长相也比较规整;但肿瘤往往大小、形状、位置都不固定,今天在左边,明天可能在右边,模型很容易把“参考图里的空间位置”误当成关键线索。
图8:病理分割失败案例分析。
图8:病理分割失败案例分析。模型有时会优先找“相似位置的区域”,而不是“真正的肿瘤”,说明它对跨患者的病理对应关系还不够稳。
这其实暴露了 MASS 的一个本质:它更擅长学习“同一图内的结构一致性”,而不是天然解决“不同患者之间的病灶对应”。所以在肿瘤这类高变异任务上,少量人工标注依然很有必要。好消息是,论文已经证明:只要给一点点专家点拨,MASS 的预训练表征就能很快补齐这个缺口。也就是说,它不是替代医生,而是先把医生最贵的那部分劳动——大规模从零标——砍掉。
从工程角度看,这个局限也很正常。因为如果一个方法完全不依赖语义标签,却还想在所有病理任务上都无脑通吃,那就有点想多了。医学影像不是自然图像,病灶的定义本来就和临床语境强绑定。MASS 能把“结构感”学得很强,已经很不错;但要把“病理语义”也学到像专家一样稳定,后面还是得靠少量高质量标注做最后一公里。
论文还讨论了另一个局限性:对极小结构的处理。当目标结构在体积上非常小(例如微小的转移灶或早期病变)时,自动掩码生成的质量会显著下降,因为这些结构在图像中可能只有几个像素,SAM2 难以稳定检测和传播。这导致预训练阶段对这些结构的监督信号非常稀疏,模型难以学到有效的表征。未来的工作可以考虑引入多尺度掩码生成策略,或者结合超分辨率技术来改善小结构的学习。

总结与展望:通往3D医学影像基础模型的“自治”之路

MASS 最值得记住的,不是它又发明了一个多么花哨的网络,而是它给 3D 医学影像预训练指了一条更现实的路:先用自动掩码把结构监督“做出来”,再让模型在大量近似分割任务里学出可迁移的医学表示。这条路的优点很明显:不依赖大规模专家标注,能跨模态扩展,能支持少样本分割,也能迁移到冻结编码器分类。
如果把医学影像基础模型比作一台机器,过去很多方法都卡在“喂数据太贵”这一步。MASS 的聪明之处在于,它没有硬怼人工标注,而是借助现成的分割工具,把无标注数据变成了可以训练的结构监督。这个思路很适合现实世界:医院里最不缺的是影像,最缺的是专家时间。谁能把这两者之间的鸿沟缩小,谁就更接近真正可落地的基础模型。
当然,这条路还没走完。未来如果想把 MASS 进一步推成真正的 3D 医学基础模型,几个方向绕不开:更强的掩码生成器、更稳的跨患者病理对齐、更大规模的多模态预训练,以及更严格的临床外部验证。尤其是病理任务,单靠自动掩码可能还不够,后续很可能需要把少量语义标注、报告文本或多模态临床信息结合起来,才能把“结构理解”进一步升级成“疾病理解”。
所以,MASS 的价值不只是“分割分得不错”,而是它证明了一件事:3D 医学影像的基础表征,不一定非得从昂贵的人工语义标签里长出来。先把结构学明白,再把语义补上去,这个顺序很务实,也很像医学影像真正的工程现实。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是3D医学影像预训练“标注太贵、泛化太弱”的老问题。MASS 用自动生成的类无关掩码做自监督,让模型先学结构再学任务,从而在少样本分割和冻结编码器分类上都表现很强。

文中的 MASS-IC 和 MASS-FT 分别是什么意思?MASS-IC 是 in-context inference,中文可理解为上下文推理,不需要微调,直接给参考样本就能做分割;MASS-FT 是 finetuning 版本,需要少量标注做微调,通常效果更强,尤其在病理或更复杂任务上更稳。

为什么自动掩码有噪声,模型反而还能学好?因为训练目标不是复刻掩码的每个像素,而是逼模型在增强前后保持对同一结构的一致理解。只要掩码大体覆盖了医学上有意义的区域,噪声就会被上下文、形状和空间关系“冲淡”,模型最后学到的是更稳定的结构表征。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 把“上下文分割”改造成无标注预训练目标,这个思路挺新,尤其适合医学影像这种结构语义都重要的场景。

实验合理度:★★★★☆ 小样本、跨模态、冻结编码器、消融实验都安排得比较完整,能支撑核心结论。

学术研究价值:★★★★★ 它不只是做了一个好模型,而是给3D医学影像基础模型提供了可扩展的预训练范式。

稳定性:★★★☆☆ 对器官类任务很强,但病理跨患者对应仍有明显短板,离“全场景稳用”还有距离。

适应性以及泛化能力:★★★★☆ 跨CT、MRI、PET都能跑,泛化不错;但对高度变异病灶还得补标注。

硬件需求及成本:★★★☆☆ 训练阶段要处理3D体数据和大量掩码,成本不低,但推理端相对友好。

复现难度:★★★☆☆ 方法链条不算特别复杂,但SAM2掩码生成、3D预处理和上下文分割细节不少。

产品化成熟度:★★★☆☆ 在器官分割、辅助标注、少样本迁移场景有潜力,病理任务要谨慎落地。

可能的问题:方法很会学结构,但对跨患者病灶语义对齐还不够稳;自动掩码的质量上限,也会直接卡住上限。


主要参考文献

[1] Yunhe Gao, Yabin Zhang, Chong Wang, Jiaming Liu, Maya Varma, Jean-Benoit Delbrouck, Akshay Chaudhari, Curtis Langlotz. Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision. arXiv:2605.13467, 2026.
[2] 原文链接:https://arxiv.org/pdf/2605.13467.pdf
[3] 代码:原文标注 Code is available here,未给出具体公开链接。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
这篇讲的是3D医学影像基础模型,群里也常聊这类“少标注、强泛化、能落地”的硬货,想一起拆方法、看实验、聊部署,欢迎来坐。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。