← 返回 PaperDaily 视觉与图像

华北电力大学最新综述:医学图像分割从U-Net到SAM的“三国杀”,谁才是王者?

医学图像分割从U-Net一路卷到SAM,中间经历了什么?这篇来自华北电力大学的综述,把U-Net、Transformer、SAM三大流派放在一个框架里对比,从数据集、评估指标到临床应用挑战,掰开揉碎给你看。如果你正被“该选哪个模型”困扰,这篇就是你的"地图"。

华北电力大学最新综述:医学图像分割从U-Net到SAM的“三国杀”,谁才是王者?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
医学图像分割从U-Net一路卷到SAM,中间经历了什么?这篇来自华北电力大学的综述,把U-Net、Transformer、SAM三大流派放在一个框架里对比,从数据集、评估指标到临床应用挑战,掰开揉碎给你看。如果你正被“该选哪个模型”困扰,这篇就是你的"地图"。


原论文信息如下:
论文标题:
A Comprehensive Survey of Medical Image Segmentation: Challenges, Benchmarks, and Beyond
发表日期:
2026年06月
发表单位:
华北电力大学(控制与计算机工程学院)、SPIC数字科技有限公司、中国科学院自动化研究所、中国人民解放军总医院第二医学中心保健六科
原文链接:
https://arxiv.org/pdf/2606.16153v1.pdf
开源代码链接:
GitHub仓库: Awsome_MedSeg (文中提及,但未提供具体链接)

引言:医学图像分割的“三国杀”时代

在医学AI中,图像分割是“顶流”。它像一位精准的“画师”,在CT、MRI中勾勒出肿瘤、器官和病变组织,为医生提供诊断依据。从脑瘤到肝脏病变,每一步都离不开算法在背后“画圈圈”。
早期全靠手工设计特征,费时费力。直到深度学习降临,U-Net、Transformer 和 SAM 三大流派先后登场,上演“三国杀”。这篇来自华北电力大学的综述,把三家的看家本领、用过的“兵器”(数据集)和“战绩”(评估指标)都扒了个底朝天。

主流数据集:一场“百花齐放”的盛会

任何模型成功都离不开高质量数据。本论文盘点了一大批主流数据集,涵盖从大脑到腹部的各个器官。这些数据集是各位大佬的“练武场”,决定了模型的“肌肉”强度。
下面这张表让你一睹它们的“芳容”,从模态、病例数到目标器官,一目了然。
*表格超出部分左右可以滑动
数据集 模态 病例数 目标器官/疾病
BraTS [32] MRI 259 脑肿瘤
LIDC-IDRI [1] CT 1018 肺结节
ACDC [3] cine-MRI 150 心脏结构
LA [55] GE-MRI 100 左心房
LiTS [4] CT 200 肝脏肿瘤
KiTS [16] CT 210 肾脏肿瘤
Pancreas-CT [2] CT 82 胰腺
PROMISE12 [33] MRI 50 前列腺
QUBIQ [24] MRI/CT 各异 多器官/任务
Synapse [59] CT 30 8个腹部器官

表1:公共医学图像分割数据集汇总

具体到每个数据集,各有各的“脾气”。BraTS是脑肿瘤分割的“黄金标准”,每年更新,数据多模态且标注精细;LIDC-IDRI是肺结节检测的“大户”,包含1018个病例,由四位资深放射科医生两轮独立标注,对模型处理不确定性提出更高要求。
图1:当前主流数据集及其对应的人体器官分布图。(a)和(b)分别展示了来自QUBIQ数据集的脑生长和脑肿瘤图像。(c)来自BraTS 2021数据集的脑肿瘤分割图像。(d)来自LiTS17数据集的肝脏分割图像。(e)来自QUBIQ数据集的肾脏分割图像。(j)和(h)分别来自Pancreas CT和QUBIQ数据集的胰腺图像。(f)和(i)分别展示了来自KiTS23数据集的左、右肾脏分割图像。(g)来自QUBIQ数据集的胰腺损伤图像。(k)和(l)展示了来自LIDC-IDRI数据集的肺结节分割图像。(m)来自PROMISE12数据集的前列腺分割图像。
图1:当前主流数据集及其对应的人体器官分布图。(a)和(b)分别展示了来自QUBIQ数据集的脑生长和脑肿瘤图像。(c)来自BraTS 2021数据集的脑肿瘤分割图像。(d)来自LiTS17数据集的肝脏分割图像。(e)来自QUBIQ数据集的肾脏分割图像。(j)和(h)分别来自Pancreas CT和QUBIQ数据集的胰腺图像。(f)和(i)分别展示了来自KiTS23数据集的左、右肾脏分割图像。(g)来自QUBIQ数据集的胰腺损伤图像。(k)和(l)展示了来自LIDC-IDRI数据集的肺结节分割图像。(m)来自PROMISE12数据集的前列腺分割图像。

方法概述:U-Net、Transformer 与 SAM 的“三足鼎立”

模型架构的演进是核心主轴。它勾勒出从U-Net到Transformer再到SAM的进化轨迹,下图直观展示了这三大家族的“家谱”和基础架构。
图2:对比方法树状图。近年来,基于U-Net、Transformer、SAM等方法的高级算法被用于评估和比较模型性能。
图2:对比方法树状图。近年来,基于U-Net、Transformer、SAM等方法的高级算法被用于评估和比较模型性能。
下图清晰展示了这三种黄金架构的核心区别,堪称“理论上的降维打击”:
图3:U-Net、Transformer和SAM模型架构对比。(a)展示了U-Net模型框架,(b)展示了Transformer模型架构,(c)展示了Segment Anything (SAM) 模型架构。
图3:U-Net、Transformer和SAM模型架构对比。(a)展示了U-Net模型框架,(b)展示了Transformer模型架构,(c)展示了Segment Anything (SAM) 模型架构。

U-Net:卷积时代的“老兵不死”

U-Net凭借编码器-解码器结构和跳跃连接,成为医学分割领域的“常青树”。它能在有限标注样本下高效工作,衍生出众多变体。本论文将其创新分为三类:

有监督学习:通过精心设计架构和损失函数提升精度。V-Net将U-Net扩展到三维,用基于Dice的损失函数解决类别不平衡。nnU-Net实现“自我配置”,能根据数据集自动调整架构和训练策略,是自动机器学习在分割领域的典范。

半监督学习:在标注数据稀缺时“榨干”未标注数据的价值。UA-MT采用教师-学生框架和不确定性感知的一致性学习,MC-Net通过双解码器不确定性学习,用循环伪标签“自给自足”。

无监督学习:当没有标注图时,RD4AD通过反向蒸馏和瓶颈特征学习,在没有像素级标签的情况下也能找到异常区域,为筛查和辅助诊断提供全新可能。


Transformer:用全局视角“盘活”全局

如果说U-Net是“见木不见林”的局部特征专家,Transformer就是“眼观六路”的全局关系建模大师。它天然具备捕捉长距离依赖的能力。本论文介绍了几个典型应用:TAB通过引入多元正态分布捕捉标注者之间的差异性,学习更平滑、连续的分割边界;MedCLIP通过视觉-文本对比学习框架,利用医学知识提升跨模态匹配,展现良好的数据效率和泛化能力。

SAM:无处不在的“万能钥匙”?

SAM的到来标志着医学图像分割进入“提示驱动、一切皆可分割”的基础模型范式。本论文总结了将SAM适配到医学领域的三个主要方向:

领域适配:MedSAM通过在多样化医学模态上微调,在多器官和模态上取得顶尖结果。SAM Adapter在SAM内部嵌入轻量级适配器,实现高效微调,尤其擅长处理“器官伪装”或“细微边界”等复杂任务。

减少对提示和微调的依赖:SAMed利用低秩适配(LoRA)大幅减少可训练参数,降低部署成本。AutoSAM集成自动提示生成器,实现全自动或低监督分割。

增强鲁棒性:SAMU通过引入不确定性估计,提升对噪声或低质量影像的鲁棒性。SegVol集成空间和语义提示,支持体数据中的细粒度交互式肿瘤分割。


其他方法:“黑科技”与“新思路”

除了三大主流,这篇综述还涵盖了不少“独门绝技”,如通过知识蒸馏进行可解释的异常检测(MKD),利用条件归一化流进行无标签的实时异常检测(CFlow-AD),以及通过耦合上下文学习和浅层任务编码器实现快速通用分割的Iris模型。这些方法为解决标签噪声、数据稀缺和开放集异常检测等特定问题提供了新思路。

关键评估指标:不仅仅是Dice

医学图像分割需要综合考虑区域重叠、分类质量和边界精度。最常用的是Dice相似系数(DSC),衡量预测区域与真实标注的像素级重叠比例。但Dice对边界误差不敏感,因此衍生出归一化表面距离(NSD),专门衡量边界区域的重叠精度。交并比(IoU)及其均值mIoU也是常用指标。95%豪斯多夫距离(95HD)测量轮廓的最大偏差,鲁棒性更好。此外还有分类性能指标(精确率、召回率、F1分数)和误差度量指标(如广义能量距离GED)。作者认为,未来应探索上下文感知的复合指标,更贴近临床相关性。

挑战重重:数据、模型和临床应用的“三座大山”

尽管方法不断进步,医学图像分割离大规模临床落地仍有距离。这篇综述从数据、算法和临床三个维度总结了当前的主要挑战。

数据层面的挑战:现有数据集规模有限、群体多样性不足、解剖覆盖不全,多数只针对单器官或单模态。标注质量不一致,导致模型泛化能力差。不同采集协议、设备、患者群体带来的域偏移问题突出。

模型层面的挑战:U-Net家族高效但在全局依赖任务上力不从心;Transformer擅长全局建模但计算量大且需大量数据;SAM零样本泛化到医学领域时性能下降,微调成本不低。模型的可解释性、不确定性估计、对罕见病变的处理都还不够成熟。

临床应用层面的挑战:技术落地需要工程师和医生更紧密的协作。目前缺少经过临床验证的基准测试和验证协议,模型在真实临床工作流中的集成、实时性能、用户交互等方面都存在大量未解决的问题。不同模态、不同维度、不同临床场景对模型的要求差异巨大。

未来展望:混合架构与临床落地的平衡

这篇综述对未来方向给出了明确判断:混合模型、多模态融合、文本提示交互、以及端到端的临床可行架构将是下一阶段的重点。未来工作应探索将先验解剖知识、多模态数据和文本提示结合到一个统一框架中,同时兼顾计算效率和临床鲁棒性。
此外,建立大规模、多模态、多器官的标准化高质量标注数据集是当务之急。在评估方面,需要开发上下文感知的复合指标或任务自适应方案,更好地与临床相关性对齐。不确定性估计和可解释性也是模型能否被临床接纳的关键。
可以预见,未来三到五年,医学图像分割将从“单一模型打天下”向“通用基础模型+领域适配”的范式转变,但真正走进手术室和诊断流程,还需要跨学科的持续努力。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

95HD和Dice有什么区别?Dice衡量区域重叠比例,对内部填充敏感但对边界微小偏移不敏感;95HD专门衡量边界轮廓的最大偏差,能更敏锐地捕捉分割边界的碎片或突出。两者结合使用才能全面评估分割质量。

为什么SAM在自然图像上效果很好,但在医学图像上需要那么多适配工作?SAM在SA-1B数据集(11M张自然图像)上训练,自然图像中的物体形状、纹理、背景与医学图像差异巨大。医学图像灰度单一、结构精细、解剖变异大,病灶与正常组织对比度低。直接使用SAM会导致严重的域漂移,需要微调或将医学知识嵌入适配器中。

这篇综述对实际选模型有什么建议?作者虽然没有直接给选型建议,但从分析中可以看出:如果标注数据充足且需要高精度,U-Net变体(如nnU-Net)依然是非常坚实的基线;如果需要处理长距离依赖或复杂解剖关系,Transformer或其与CNN的混合架构值得尝试;如果希望快速部署且可以接受微调成本,SAM系列提供了强大的零样本潜力。但任何模型在跨机构、跨模态迁移时都需谨慎验证。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性:★★★✰✰作为综述,核心贡献在于系统性整理和对比框架,而非提出新方法。但对研究领域而言,这种全局梳理有很高的信息价值。

实验合理度:★★★★✰作为综述没有新实验,但引用的实验设计大多来自顶会期刊,合理度可以信赖。

学术研究价值:★★★★★这种“地图式”综述对入门者和想快速了解领域全貌的研究者非常友好,框架统一,便于后续对照。尤其是对U-Net、Transformer、SAM三大流派在同一维度的对比,很有参考价值。

稳定性:★★★✰✰综述本身不涉及模型稳定性,但引用的方法中多数有公开代码和验证,稳定性中等偏上。

适应性以及泛化能力:★★★★✰综述覆盖的模态、器官、方法都很广泛,分析也指出了不同方法的适用边界,对读者选型有实际指导意义。

硬件需求及成本:★★✰✰✰综述本身不涉及计算,但分析的Transformer和SAM方法对硬件要求较高,这一点作者也指出了。

复现难度:★★★★✰作为综述不需要复现,但引用的方法大多有开源代码,且作者在GitHub仓库Awsome_MedSeg中整理了资源链接,便于复现。

产品化成熟度:★★✰✰✰综述主要提供研究视角,产品化落地需要工程验证,但其中分析的nnU-Net等方法已经有一定临床使用基础。

可能的问题:综述覆盖面很广,但每类方法只选取了代表性工作,深度略有不足。此外,对未来方向的讨论相对笼统,缺少具体的量化目标和时间线。


主要参考文献

[1] Armato S G, et al. The Lung Image Database Consortium (LIDC) and Image Database Resource Initiative (IDRI): a completed reference database of lung nodules on CT scans. Medical Physics, 2011.
[2] Roth H R, et al. DeepOrgan: Multi-level deep convolutional networks for automated pancreas segmentation. MICCAI, 2015.
[3] Bernard O, et al. Deep learning techniques for automatic MRI cardiac multi-structures segmentation and diagnosis: is the problem solved? IEEE TMI, 2018.
[4] Christ P F, et al. The Liver Tumor Segmentation Benchmark (LiTS). Medical Image Analysis, 2017.
[5] Chen T, et al. SAM Adapter: Adapting SAM for Medical Image Segmentation. MICCAI, 2024.
[6] Li Y, et al. APRIL-GAN: Anomaly detection via generative adversarial networks. CVPR, 2022.
[7] Zhu P, et al. A Comprehensive Survey of Medical Image Segmentation: Challenges, Benchmarks, and Beyond. arXiv:2606.16153, 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看完这篇从U-Net到SAM的“三国杀”全历程,是不是感觉思路瞬间清晰了?🧐 如果你的研究也卡在“数据集怎么选”、“模型怎么挑”、“指标怎么评”这些坑里,强烈建议进龙哥的群和星球一起聊聊!这里有上千同行陪你从CT到MRI,从调参到落地的每一个环节。

欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。

'龙哥读论文'微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。