← 返回 PaperDaily 视觉与图像

10%合成图像就够?nnU-Net心脏分割MRI提升0.27个百分点

全心脏分割( Whole-Heart Segmentation,WHS )是医学影像分析中的一项经典任务:给定一张心脏区域的CT或MRI扫描图,模型需要把七个关键结构完整勾画出来——左心室心肌( Myocardium,M。

10%合成图像就够?nnU-Net心脏分割MRI提升0.27个百分点
原论文信息如下:
论文标题:
LISynSeg: Data-Centric Label-to-Image Synthesis for Cross-Modality Whole-Heart Segmentation
发表日期:
2026年08月
发表单位:
Vanderbilt University, Mayo Clinic
原文链接:
https://arxiv.org/pdf/2608.31073v1.pdf

跨模态心脏分割的挑战:数据异质性从何而来?

全心脏分割(Whole-Heart Segmentation,WHS)是医学影像分析中的一项经典任务:给定一张心脏区域的CT或MRI扫描图,模型需要把七个关键结构完整勾画出来——左心室心肌(Myocardium,Myo)、左心房(LA)、左心室(LV)、右心房(RA)、右心室(RV)、升主动脉(Ascending Aorta,AO)和肺动脉(Pulmonary Artery,PA)。别看不起这七个结构,它们连在一起,形态复杂,边界还不总是清晰,可以说是分割任务里的"硬骨头"。💪
而CARE-WHS挑战赛把这根硬骨头的难度又往上抬了一截。这个挑战赛的核心主题就是"跨模态、多中心、设备异质"。什么意思呢?就是同一个心脏结构,在不同医院、不同扫描仪、不同协议下拍出来的片子,对比度不一样、体素间距不一样、扫描范围不一样,连图像方向都可能不一样。模型如果只见过一种风格的图像,换个设备可能就"翻车"。🚗
除了图像层面的差异,还有标注层面的差异。这一点容易被忽视,但其实非常致命。CARE挑战赛对AO和PA的标注范围有明确的协议定义,但由于血管远端(就是离心脏比较远的那一端)没有清晰可见的解剖学边界,不同医生标出来的结果差异很大:有的把肺动脉标到了分叉之后的两个分支,有的只标到主干;有的把升主动脉标到了主动脉弓,有的只标到近端升段。这类标注不一致如果在训练时不加处理,模型接收到的就是"互相打架"的监督信号——同一个位置,这个病例是目标,另一个病例又不是目标。
再加上心肌厚度的变化,在Myo和LV的边界处,不同个体、不同健康状态下的心肌厚度差异很明显,而普通的图像增广(比如旋转、缩放、弹性形变)对这类解剖结构的几何变化基本无能为力。图1展示了CARE-WHS中几种典型的异质性来源:可以看到PA和AO的标注范围差异、心肌厚度的差异,以及CT与MRI在扫描范围上的巨大区别。
图1:CARE-WHS CT和MRI中异质性的代表性来源。从左到右依次为:肺动脉(PA,黄色)标注仅限于近端主干,或者延伸至分叉后的两个分支;升主动脉(AO,粉色)标注仅限于升段,或者继续延伸经过主动脉弓;Myo-LV边界处较薄与较厚的心肌;以及心脏聚焦型CT与更宽的胸腹MRI扫描覆盖范围。
图1:CARE-WHS CT和MRI中异质性的代表性来源。从左到右依次为:肺动脉(PA,黄色)标注仅限于近端主干,或者延伸至分叉后的两个分支;升主动脉(AO,粉色)标注仅限于升段,或者继续延伸经过主动脉弓;Myo-LV边界处较薄与较厚的心肌;以及心脏聚焦型CT与更宽的胸腹MRI扫描覆盖范围。
正是这些"刁钻"的异质性,逼着研究者们不断升级模型架构和训练策略。

LISynSeg核心思路:用合成数据增强而非替代真实训练

在LISynSeg之前,主流的应对思路是"打不过就换模型"——上更强的网络、做迁移学习、加各种注意力模块。但本文的作者提出了一个有点"反直觉"的问题:如果分割架构完全不变,只改训练数据的构造方式,跨模态分割还能不能提升?
答案是:能,而且不需要换模型。
这就要说到一个叫SynthSeg的技术。SynthSeg的想法非常聪明:既然真实的医学图像足够稀缺和昂贵,那我们不如"画"一批出来。具体来说,先用已有的标签图做空间变形,得到不同的解剖形态;然后给每一个标签类别随机采样一个高斯强度分布(均值、方差都是随机的),再加上偏置场、伽马变换、噪声等来模仿扫描仪的成像效果,于是标签图就"渲染"成了看起来以假乱真的医学图像。因为合成图像是程序生成的,所以标签是完美精确的,一分钱标注费都不用花。
SynthSeg的这套思路最早在脑部MRI分割上取得了很好的效果。本文作者把它带到了CARE-WHS心脏分割上,但他们做得更细致,也更谨慎。一个重要的背景是:SynthSeg原作者在多模态全心脏分割挑战赛(Multi-Modality Whole Heart Segmentation,MMWHS)——也就是CARE-WHS的前身——上做过实验,用的是13个MRI标签图。那项实验已经初步验证了"随机生成的图像可以支持跨模态心脏分割"。但CARE-WHS引入了更多中心、更复杂的标注差异,问题也变得更棘手。
首先,他们没有完全依靠合成图像来训练模型。实验数据很诚实:只用合成图像训练,效果明显不如只用真实图像训练(MRI的DSC从0.8890掉到了0.8303,将近6个百分点)。原因也很简单——心脏的标签图只有七个结构,胸腔里大量的背景组织结构(比如肝脏、肺、肋骨、肌肉)在标签里完全不存在。合成图像生成的时候,这些结构就成了空白,模型失去的上下文信息太多了。
所以LISynSeg的策略是:合成图像作为补充,而不是替代。每一轮训练,以10%的概率选择一部分训练样本走合成分支,其余90%仍然使用真实图像。用公式表示就是这样的分支选择机制:
公式1:训练样本分支选择
其中(x_i^a, y_i^a)表示经过nnU-Net标准增广后的真实图像与标签对;S(y_i^g; θ_i)表示基于心肌边界交换后的标签y_i^g合成的图像;z_i是伯努利随机变量,以0.10的概率取1(走合成分支),0.90的概率取0(走真实分支);(x_i', y_i')就是最终进入分割网络的训练样本。
也就是说,每个batch里大约十分之一的样本是"画"出来的。而合成图像的参数——每个类别的强度均值、标准差、偏置场、伽马变换、噪声水平、分辨率——都是从当前训练折内的真实图像分布中采样校准的,并不是完全瞎调。每个类别的强度均值均匀采样自0到255,方差均匀采样自0到12;偏置场标准差采样自0到0.35,伽马对数服从均值为0、标准差为0.15的正态分布,噪声标准差采样自0到3;分辨率档位则按训练集中观察到的原生到目标体素间距比采样,上限限制为三倍。
图2:CT和MRI生成的图像示例。每一行展示真实图像、七类别标签图、用SynthSeg生成的图像以及用LISynSeg生成的图像。SynthSeg使用从真实图像中获得的生成区域,而LISynSeg使用七种心脏标签区域和从训练数据校准的参数。此对比中省略了空间变换。
图2:CT和MRI生成的图像示例。每一行展示真实图像、七类别标签图、用SynthSeg生成的图像以及用LISynSeg生成的图像。SynthSeg使用从真实图像中获得的生成区域,而LISynSeg使用七种心脏标签区域和从训练数据校准的参数。此对比中省略了空间变换。
图2的对比很有意思:SynthSeg风格生成的图像用到了从真实图像聚类得到的多区域信息,而LISynSeg只用七个心脏标签区域和校准参数,生成的图像看起来更"干净",也保留了心脏本体的强度特征。

两大心脏特异性操作:边界交换与损失掩码

只做合成图像增强还不够。CARE-WHS数据集里有两类结构特异性的问题,是单纯的图像渲染解决不了的。
第一类问题是心肌厚度的变化。普通弹性形变可以让标签图整体扭曲,但要让心肌厚度系统地变厚或变薄,就像"手动调整"一样精准控制,传统的变形很难做到。LISynSeg提出了一个"边界交换"策略:在心肌(Myo)和左心室(LV)的边界处,定义两条界面带——B_VM是心肌膨胀一个体素后与左心室重叠的体素集合,B_MV是左心室膨胀一个体素后与心肌重叠的体素集合。增厚时,把B_VM里的体素从LV划给Myo;变薄时,把B_MV里的体素从Myo划给LV。交换的体素数量由一个均匀分布λ ~ U(0.35, 0.85)控制,同时要求交换后的Myo和LV体积比保持在合理范围内(Myo保持在原来的0.72到1.35倍之间,LV保持在0.80到1.20倍之间)。这个操作只作用于被选中的合成样本(10%的那部分),并且保持Myo+LV的总体积不变。
第二类问题是升主动脉和肺动脉远端标注的不一致。CARE协议对AO和PA的终点有定义,但实际操作中,标注人员很难在远端找到一致的解剖边界。如果在所有体素上同等对待Dice损失和交叉熵损失,模型就会在远端区域收到自相矛盾的梯度。LISynSeg的解决办法是"部分监督":根据血管与心室的邻接关系(AO与LV相邻,PA与RV相邻),找到血管的近端参考点,然后计算每个血管体素到参考点的物理距离,只对最近的90%的血管体素计算损失,最远的10%被放入忽略集U_c。如果距离相同导致忽略比例超过40%,则跳过掩码。这个掩码对真实样本和合成样本都生效,但在验证和推理阶段不使用。
图3的左侧展示了Myo-LV边界交换的效果(白色轮廓标记被交换的体素),右侧展示了AO/PA损失掩码的示意:近端血管区域正常监督,而远端阴影区域被忽略且不参与分割损失。
图3:LISynSeg中的心脏特异性操作。左侧:Myo-LV边界交换通过移动心内膜界面使心肌增厚或变薄,同时保持Myo/LV合并范围不变;白色轮廓表示被交换的体素。右侧:AO/PA损失掩码保留近端血管监督,同时排除标注范围因病例而异的远端体素;阴影标记表示被分割损失忽略的体素。近端通过AO-LV和PA-RV邻接关系确定。CT和MRI两行展示了两种模态下的两个操作。
图3:LISynSeg中的心脏特异性操作。左侧:Myo-LV边界交换通过移动心内膜界面使心肌增厚或变薄,同时保持Myo/LV合并范围不变;白色轮廓表示被交换的体素。右侧:AO/PA损失掩码保留近端血管监督,同时排除标注范围因病例而异的远端体素;阴影标记表示被分割损失忽略的体素。近端通过AO-LV和PA-RV邻接关系确定。CT和MRI两行展示了两种模态下的两个操作。
引入掩码后的分割损失函数变为:
公式2:带掩码的分割损失
其中f_φ是待训练的分割网络,x_i'是当前样本的输入图像,y_i'是对应的分割标签;Ω_i表示样本中所有体素的集合,U_i是AO和PA远端被掩码掉的部分(即不参与损失计算的体素);Dice+CE表示Dice损失与交叉熵损失之和。这个操作改变的是"哪些体素贡献到损失"——它既不会生成更长的血管标签,也不会截断标签,属于一种"中立"的监督修正。

实验结果:小幅但一致的提升,MRI获益更大

先看整体方法的对比。表1列出了在开发集上的对比结果,开发集包含85个训练病例和21个验证病例,其中CT 12例、MRI 9例,所有模型联合训练在CT和MRI上,报告时再按模态分开。
表1:开发集上分割模型与训练策略的对比。所有模型均在CT和MRI上联合训练;CT和MRI列报告对应验证子集的结果,All列报告组合得分。加粗和下划线分别表示最高和次高的DSC。
表1:开发集上分割模型与训练策略的对比。所有模型均在CT和MRI上联合训练;CT和MRI列报告对应验证子集的结果,All列报告组合得分。加粗和下划线分别表示最高和次高的DSC。
几点值得关注。
第一,在只用真实图像训练的设置下,nnU-Net是四个模型中最强的(综合DSC达到0.9203),超过了3D U-Net、UNETR和SwinUNETR。这里需要强调,本文的对比只限于"这几个模型的具体实现在这个数据集上的表现",并不能说明架构类型之间的绝对优劣。
第二,只用合成图像训练效果显著下滑(综合DSC从0.9203降到0.8735),其中MRI下降5.87个百分点。再次印证了合成图像无法替代真实图像的判断。
第三,真实图像+合成图像混合训练,MRI提升了0.22个百分点(0.8890到0.8912),整体提升了0.05个百分点,但CT略降0.14个百分点(0.9517到0.9503)。
第四,完整版LISynSeg(混合训练+Myo-LV边界交换+AO/PA掩码)在CT、MRI、整体三个指标上都取得了最高分:CT达到0.9519,MRI达到0.8917,整体达到0.9219。虽然提升幅度谈不上"质变",但方向一致、全面为正,而且没有改模型结构和推理过程。
表2是消融实验,把两个心脏特异性操作逐一拆解开来。
表2:使用相同基础设置(真实和合成图像)对心脏标签操作的消融实验。所有模型均在CT和MRI上联合训练,使用相同的开发集划分、训练计划、合成概率和后处理。CT、MRI和All列报告所有七种结构的总体得分。加粗和下划线分别表示最高和次高的DSC。
表2:使用相同基础设置(真实和合成图像)对心脏标签操作的消融实验。所有模型均在CT和MRI上联合训练,使用相同的开发集划分、训练计划、合成概率和后处理。CT、MRI和All列报告所有七种结构的总体得分。加粗和下划线分别表示最高和次高的DSC。
有意思的来了:只加Myo-LV边界交换,CT微涨0.07个百分点,但MRI大跌2.40个百分点(从0.8912掉到0.8672)。这说明这个操作在MRI上产生了与期望相反的效果。作者分析,MRI的心肌边界通常比CT模糊,随机增厚或变薄后生成的样本可能偏离MRI的真实解剖形态,反而干扰了学习。不过,把AO/PA掩码也一起加上之后,两个操作形成了互补,不但把MRI拉了回来,还略微超过了基础设置。
AO/PA掩码单独使用时,三个指标都与基础设置基本持平(CT微涨0.10个百分点),说明这个操作本身不带来显著提升,但也没有负面影响。它最大的价值在于"消除变量"——当远端标注不一致时,避免模型在这些体素上过拟合。
再看定性结果。图4展示了三个代表性病例:上面一行是CT的Myo-LV边界,下面两行是MRI的AO和PA远端区域。
图4:代表性病例的定性比较。各列分别显示输入图像、Ground Truth、LISynSeg结果和真实图像nnU-Net基线结果。从上到下依次为:Myo-LV界面的CT示例,以及标注AO(中间行)和PA(底部行)范围的MRI示例。顶行放大面板展示了本方法产生的更准确的Myo-LV界面。底部两行的红色箭头标记远端血管差异。
图4:代表性病例的定性比较。各列分别显示输入图像、Ground Truth、LISynSeg结果和真实图像nnU-Net基线结果。从上到下依次为:Myo-LV界面的CT示例,以及标注AO(中间行)和PA(底部行)范围的MRI示例。顶行放大面板展示了本方法产生的更准确的Myo-LV界面。底部两行的红色箭头标记远端血管差异。
在CT这个病例里,LISynSeg明显更贴合心内膜边界,LV的分割更完整(该受试者LV的DSC从0.83涨到0.86,Myo从0.75涨到0.79)。在MRI的两个病例里,LISynSeg对AO和PA远端范围的处理与标注结果更一致——减少了对标注范围之外组织的过度分割,同时补上了之前漏掉的肺动脉分支部分(中间行AO的DSC从0.73涨到0.75,底部行PA的DSC从0.67涨到0.71)。
在官方验证阶段,作者提交了一个集成模型(包含纯真实图像训练、真实+合成混合训练,以及DA5数据增强设置),在验证集上拿到了CT 0.9360、MRI 0.8640、综合0.9072的成绩,综合排名前五(截至投稿时)。需要提醒的是,官方验证集与本文开发集的划分标准、评估协议不完全一致(官方对血管按标准化长度评估,而本文实验按释放标注直接计算DSC),所以两套分数的绝对数值不能直接横向比较。整体而言,LISynSeg的结果属于"小幅但一致的提升",其中MRI的获益更明显,这与作者关于合成对比度多样性对MRI更有帮助的假设相吻合。

局限与启示:数据中心方法的价值与边界

读完全文,一个最直观的感受是:这篇文章的方向很"朴素",但价值恰恰在于它的朴素。
整个LISynSeg的改动只发生在数据层面:合成图像、边界交换、损失掩码。模型架构是固定不变的nnU-Net,推理过程不做任何额外计算。这意味着已有的分割系统可以在不改动部署代码的前提下,通过调整训练数据的构造方式获得收益。对医疗AI团队来说,"只改数据策略、不动架构部署"是一个很有吸引力的低成本方案
但同时也要看到几个明显的边界。
第一,收益幅度有限。整体提升在0.1到0.2个百分点量级,远谈不上"质变"。不过值得注意的是,这个提升是在nnU-Net本身已经很强的基础上实现的——基线DSC已经超过0.92,往上爬的空间本来就小。
第二,两个特异性操作并不是无条件有效的。Myo-LV边界交换单独用在MRI上会造成明显退化,必须配合AO/PA掩码才能取到正效果。这说明在数据增强设计里,"好心办坏事"的情况确实存在,需要针对模态特点做仔细验证。
第三,方法依赖标签数据来生成合成图像,这与SynthSeg原本"完全无标注训练"的初衷已有偏离。LISynSeg的价值不在于"省标注",而在于"在有限标注下更好地利用数据"
第四,合成图像中缺少的背景上下文仍然是硬伤,这也是为什么混合比例不能太高的原因。未来如果想进一步提升合成图像的作用,可能需要引入外部解剖图谱或者背景先验,让"画"出来的图像更接近真实胸腔场景。
这篇文章给了我们一个很重要的提醒:在医学影像分割的战场上,数据集构造、标签质量、监督信号的合理设计,这些"数据层面"的细节,和模型架构本身的创新同等重要。当大家卷完Transformer、卷完大模型之后,数据策略可能才是下一个拉开差距的地方。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对CT/MRI跨模态全心分割数据异质性强的问题,范德堡大学提出LISynSeg,在固定nnU-Net架构前提下,将标签合成图像与真实样本混合训练,并配合心肌边界交换与血管远端损失掩码,在CARE基准上取得MRI和整体性能稳定提升
这篇工作最值得看的点是什么?完整LISynSeg设置在所有三个指标上均达到最高DSC(CT: 0.9519, MRI: 0.8917, All: 0.9219),相比仅真实图像训练的nnU-Net基线(CT: 0.9517, MRI: 0.8890, All: 0.9203)有提升,MRI提升更明显。官方验证集成排名前五。
这篇工作的边界或风险在哪里?优点:(1) 数据中心的思路新颖,在保持架构不变的情况下提升性能;(2) 针对心脏特异性变异设计了两种操作,具有明确的解剖学动机;(3) 实验设计系统,消融清晰。缺点:(1) 提升幅度较小(约0.1-0.2个百分点);(2) Myo-LV操作单独使用时在MRI上导致性能下降;(3) 合成概率仅0.10,对合成分支的贡献分析不够深入。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

数据中心视角不算新,但"Myo-LV边界交换+血管远端损失掩码"这两个针对心脏解剖变异设计的操作有独创性,组合方式也合理。整体思路是对SynthSeg范式的细致化、任务定制化改造,创新点在于"对症下药"的工程智慧,而非原理层面的突破。

实验合理度:★★★★☆

控制变量做得很干净:架构固定、训练日程一致、后处理一致、数据划分一致,对比了四个分割模型、四种训练设置,消融实验逐个拆解。唯一的小遗憾是整体提升幅度有限,且官方验证集与开发集评估协议不一致,很难直接对标。

学术研究价值:★★★☆☆

对"医学图像分割中数据策略的重要性"是一次有价值的实证,特别是对标注不一致问题的"部分监督"思路可以启发后续研究,但在方法深度和理论分析上仍有空间。

稳定性:★★★★☆

推理阶段完全复用nnU-Net,没有任何额外计算或不稳定因素,部署后与普通nnU-Net无异。但训练阶段Myo-LV操作单独在MRI上有明显掉点,说明训练策略的稳定性需要谨慎对待,最好配合掩码一起使用。

适应性以及泛化能力:★★★☆☆

方法框架可以迁移到其他多模态分割任务,但两个特异性操作(心肌边界交换、血管掩码)都是针对心脏结构设计的,换任务需要重新设计标签操作。合成参数的校准依赖训练数据分布,跨数据集需要重新拟合。

硬件需求及成本:★★★★☆

训练时增加了合成图像生成的CPU开销(每轮约10%样本),相对GPU训练来说占比很小;推理时零额外成本,无需改变硬件配置。整体对算力的额外需求可以接受。

复现难度:★★★★☆

代码和训练权重将开源,基于成熟的nnU-Net框架,合成图像生成逻辑也不复杂。主要工作集中在数据增强代码的编写和参数校准上,整体复现门槛较低。

产品化成熟度:★★★☆☆

更适合作为训练策略集成到已有心脏分割产品管线中,而不是独立产品。收益幅度有限(0.1~0.2个百分点),对于已经使用nnU-Net且数据量充足的生产系统,是否值得为这一点提升增加训练复杂度,需要团队自行权衡。

可能的问题:

提升幅度仅0.1~0.2个百分点,实际临床意义有待进一步验证;Myo-LV边界交换单独在MRI上导致2.40个百分点的显著退化,说明该操作对模态敏感、需要仔细调节;官方验证成绩来自集成模型,单模型对最终排名的贡献难以精确归因。

主要参考文献

[1] Billot B, Greve D N, Puonti O, et al. SynthSeg: Segmentation of brain MRI scans of any contrast and resolution without retraining[J]. Medical Image Analysis, 2023, 86: 102789.
[2] Isensee F, Jaeger P F, Kohl S A A, et al. nnU-Net: a self-configuring method for deep learning-based biomedical image segmentation[J]. Nature Methods, 2021, 18(2): 203-211.
[3] Çiçek Ö, Abdulkadir A, Lienkamp S S, et al. 3D U-Net: learning dense volumetric segmentation from sparse annotation[C]. MICCAI, 2016: 424-432.
[4] Hatamizadeh A, Tang Y, Nath V, et al. UNETR: Transformers for 3D medical image segmentation[C]. WACV, 2022: 574-584.
[5] Hatamizadeh A, Nath V, Tang Y, et al. Swin UNETR: Swin Transformers for semantic segmentation of brain tumors in MRI images[C]. BrainLes, 2022: 272-284.
[6] Zhuang X, Li L, Payer C, et al. Evaluation of algorithms for multi-modality whole heart segmentation: An open-access grand challenge[J]. Medical Image Analysis, 2019, 58: 101537.
[7] CARE 2026 Whole Heart Segmentation Track. https://www.zmic.org.cn/care_2026/track_wholeheart/


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球