龙
准妈妈躺在检查床上,医生拿着超声探头在肚皮上滑来滑去,屏幕上一团模糊的灰度影像。别小看这团灰度,它决定了整个孕期最重要的一次“过关”。产前超声检查是评估胎儿健康的主要手段,而人工智能想在里头帮忙,先得喂饱数据。问题来了:胎儿的超声图像数据,长期处于“又少又金贵”的状态——隐私保护卡得严,标注需要专家花大量精力,医院之间设备、探头、参数又各不相同。数据稀缺,成了胎儿超声AI前进路上最大的绊脚石。 有没有可能用AI“凭空造出”逼真的超声图像,把数据缺口补上?这事儿有不少人试过,但此前的生成分辨率一直卡在128×128或256×256,在临床上根本不够看。最近,来自南安普顿大学、清华大学、伦敦国王学院和伦敦大学学院的研究团队,把当前图像生成领域的“天花板模型”EDM2搬了过来,直接输出512×512的高分辨率胎儿超声图,在图像质量和下游任务上都把前人甩开了一截。这篇工作不仅方法漂亮,代码、数据、模型还全部开源,堪称“教科书级”的医工交叉示范。 ![]()
图1:真实胎儿超声图像与本文高分辨率(512×512)扩散合成图像的对比示例,图像类别包括胎儿股骨、胎儿大脑等。 胎儿超声AI为何难?数据稀缺与标注困难是核心痛点
先说说这事的背景。近年来,人工智能在产前超声领域没少发力:自动分类胎方位、检测异常结构、生成合成图像辅助教学……听起来很美,但一个致命前提是——数据。临床可用的AI模型需要足够多样化的数据集,去覆盖不同的胎儿状况、超声扫描仪型号、患者人群,以及从二维到三维四维的各种超声成像模式。光这一点,就劝退了不少团队。 更要命的是,胎儿超声数据不是你想拿就能拿。产检数据涉及孕妇和胎儿的隐私,伦理审批严格;超声图像的标注需要经验丰富的医生逐帧勾画,成本极高。就算有了数据,不同超声技师操作手法不同、探头角度不同,同一胎儿扫出来的图像也可能差异巨大。这些因素叠加,导致开放可用的胎儿超声数据集少得可怜。 目前在公开领域,研究者大多绕不开一个核心数据集:FETAL PLANES DB,共12,400张图像。这个数据集基本撑起了整个领域,但它真的不够大,模型训练时稍微使劲就容易过拟合。另有规模更小的数据集,比如US Fetus Phantom数据集(15,728张)、Fetal Head数据集(1,334张)、Fetal Abdomen数据集(4,668张)、Fetal Cardiac数据集(300张)等,分散且不成体系。 数据不够,生成模型来凑。这是近几年医学影像圈最流行的破局思路之一。无论是GAN、变分自编码器还是扩散模型,都被拿来试过。比如Tian等人(2025)用扩散模型做数据增强来改善胎方位分类,但分辨率只有128×128;也有混搭Diffusion-GAN的方法,勉强做到256×256。这些分辨率对计算机看倒是没什么,但对临床医生来说,细节丢失太多,解剖结构模糊,根本不敢用在诊断辅助上。所以,高分辨率合成,是临床应用绕不开的一道坎。 EDM2出手:用当前最强扩散模型合成512×512高保真超声图
说到扩散模型,很多人第一反应是Stable Diffusion。但真正在ImageNet上拿到当前最优生成效果(SOTA)的,是NVIDIA团队Karras等人提出的EDM2。EDM2的全称是“基于训练动态分析的改进扩散模型”,它通过深入分析扩散模型的训练动态,优化了网络结构、预处理方式和损失加权等细节,让扩散模型在同等算力下收敛更快、生成质量更高。简单说,这是目前扩散模型界的“天花板玩家”。 本文的思路很直接:把EDM2这个“大杀器”迁移到胎儿超声成像上,并训练了EDM2-S和EDM2-XL两种规格的网络。小模型和大模型配合,还能用上一种叫“autoguidance”的技术。所谓autoguidance,中文可以理解为“自身引导”,原理是让同一个模型用自己的低质量版本来“带路”,从而增强生成图像的细节和逼真度。这比外挂一个辅助网络轻量得多。 数据方面,研究团队没有死磕FETAL PLANES DB这1.2万张图。为什么?因为12,400张对扩散模型来说还是太少,模型很容易把训练样本“背”下来,生成出来的图全是记忆碎片。为了治这个毛病,他们把另外三个开放数据集也拉了进来:用于胎儿方位和结构评估的FPU23数据集(15,728张)、一个胎儿腹部结构分割数据集(1,588张),以及一个来自非洲低资源环境的超声数据集(451张)。这些数据集统一缩放到512×512,配合中心裁剪和随机水平翻转做增强。 这里有个小细节值得注意。FETAL PLANES DB包含六个类别:母体宫颈、胎儿腹部、胎儿大脑、胎儿股骨、胎儿胸腔和其他。其他数据集则没有细分类别,统一打一个标签就行。在损失函数上,他们用了加权MSE损失,对主数据集FETAL PLANES DB的权重设为2.0,其他数据集权重设为1.0。 ![]()
图2:UltrasoundEDM2扩散模型的验证损失曲线。更大规模的模型变体和更多训练数据都能持续改善优化性能和最终验证损失。 从图2的验证损失曲线能看出两个结论:第一,无论数据集怎么配,EDM2-XL的最终验证损失都比EDM2-S更低;第二,加了额外数据集之后,模型能多训练将近两倍的步数,验证损失从0.1427一路降到0.1371。这说明混入多样数据不只是“凑数”,是实打实地缓解了过拟合,让模型学到了更泛化的超声图像特征。 最终生成的图像,如图1所示,512×512分辨率下,胎儿股骨、大脑、腹部等结构比此前128×128的小图清晰得多。对于AI模型而言,这意味着更丰富的纹理信息和结构细节;对临床医生而言,这意味着合成图像不再只是“看着像”,而是真的可以用于观察解剖结构。 实战表现:FID全面碾压,分类准确率提升至93.36%
图像生成好不好看,不能光靠瞪眼。论文用了两个经典指标来验证。第一个是FID(Fréchet Inception Distance,弗雷歇初始距离),它衡量的是生成图像与真实图像在特征空间中的分布距离,数字越低代表两堆图像越“像”。第二个是下游任务验证——把生成的图像拿去做胎方位分类,看能不能训练出更准的分类器。 先看FID。为了保证和Tian等人的方法对比公平,团队对每个类别生成5000张图像,然后统一把图像缩到128×128再计算FID。表1给出的数据相当直观,所有类别的FID都大幅下降。例如胎儿胸腔从233.37降到135.99,母体宫颈从269.08降到155.30,总体FID从176.85直接干到104.25。这个降幅在生成任务的评测里算是非常可观的。 ![]()
表1:本文方法与Tian等的FID对比。FID数值越低代表生成图像质量越高,本文在各类别及总体均明显占优。 FID的压倒性优势说明两点:一是512×512的高分辨率训练让模型学到了更真实的解剖结构和纹理分布;二是融合多数据集后,模型不再受限于某个单一数据源的成像风格,合成的图像在统计特性上更接近真实世界。 图像质量是面子,分类效果才是里子。研究团队选取了Tian等人论文中性能最好的三种分类架构:ResNet50、DenseNet169和MedMamba,再用Soft Voting(软投票集成)把这三种模型的结果融合起来。这里顺便解释一下,MedMamba是一种基于Mamba架构的医学图像分类模型,Mamba是近期很火的状态空间模型,擅长长序列建模,在医学影像上表现不错。Soft Voting则是让多个模型对每个类别输出概率,再取平均后判断最终类别,比单一模型更稳。 ![]()
表2:本文合成图像与Tian等的合成图像在胎方位分类任务上的准确率对比。 分类实验设计了两种训练方式:一种是用合成数据从零开始训练分类器;另一种是先用合成数据预训练,再用真实数据进行微调。结果很有意思。从零训练时,本文合成图像把软投票集成准确率从Tian的87.35%拉到了89.51%。微调场景下,本文把准确率提升到93.36%,不仅超过了Tian的92.84%,还超过了只用真实数据训练的92.32%。 什么意思?合成数据不但能“以假乱真”帮分类器热身,它增加的多样性还能在微调阶段给真实数据“打辅助”,最终反超只吃真实数据的模型。这对医疗AI是个好消息:以后某些标注稀缺的领域,可以先让合成数据顶上,再让真实数据精修,效果可能比守着那点儿真实数据来回薅要好得多。 临床医生评分:真实感尚有差距,但潜力已经显现
生成图像除了要过算法关,还要过医生关。论文专门做了一个临床评估:请一位拥有十年以上经验的胎儿超声专家,从生成的30,000张图像中抽了100张,先判断“真还是假”,再给整体质量打分(1到5分,5分制)。整个评估过程只给图像,不给任何标签和提示。 结果需要冷静看待。合成图像的平均真实感得分只有2.07/5,真实图像是3.12/5,两者差距明显。专家反馈说,判断真假主要依赖三类痕迹:一是图像过度平滑,缺少真实超声那种颗粒状的斑点纹理;二是斑点噪声分布不规则,时而密集时而稀疏;三是某些解剖结构存在形态不一致的问题。 ![]()
图3:用于临床评估的GitHub Pages问卷界面。左侧为问卷首页,右侧为图像评估页面,参与者需判断图像真实或合成,并给出质量评分。 说实话,这组数字一点都不意外。超声成像的物理过程极其复杂,超声波的反射、散射、衰减,加上探头频率、增益、时间增益补偿这些参数,形成了特有的超声纹理。扩散模型能学到大致形态,但学不透这些成像机理。这也是为什么临床评分远没到“以假乱真”的程度。 但换个角度想,这一结果的意义在于“诚实”。很多生成医学图像的论文压根不做临床评估,因为一评估就露馅。这篇论文主动把短板亮出来,反而让读者对它的技术边界有了清晰判断。况且,下游分类任务已经证明了这些图像在语义层面的价值——哪怕纹理细节还欠火候,它们已经能教会分类器更准确地识别胎方位。换句话说,图像像不像和好不好用,虽然相关,但并不是一回事。 开源与展望:面向低资源医疗的下一代基础模型
这篇论文最让人眼前一亮的,其实是它的开源力度。项目仓库在GitHub上:xfetus/fetal-ultrasound-edm2,里面包含了完整训练代码、推理脚本、数据预处理流程和文档。预训练权重在Hugging Face上公开,包括EDM2-XL和EDM2-S两个版本:harveymannering/ultrasound-edm2。合成图像数据集也一并放出,总共30,000张,覆盖六个类别,托管在Hugging Face Datasets:harveymannering/ultrasound_images_diffusion。想复现实验,按照文档跑一遍就行。 图1和图3也都给出了在线访问地址,甚至连临床评估问卷本身都做成了GitHub Pages页面开源出来。这种“连评估工具都开源”的做法,在医学影像领域实属罕见,值得点赞。 展望未来,这个工作的方向很明确:一方面,继续扩大数据的规模和多样性,探索真正面向低资源医疗场景的可扩展基础模型;另一方面,系统地比较不同的扩散架构在超声图像上的表现,甚至向三维、四维超声成像迈进。当然,要让合成图像达到临床完全可用的水平,还需要在建模中更好地模拟超声的物理成像机理,比如引入更真实的斑点噪声模型和声影效应。 回看整篇工作,研究者把一个图像生成领域的最强模型成功迁移到产前超声这个具体且困难的任务上,用更大的分辨率、更丰富的数据和更细致的评估,把“AI合成胎儿超声图像”这件事从“能看出来”推进到了“能帮上忙”。虽然离“以假乱真”还有距离,但结合下游任务的大幅增益,这篇工作的实用价值已经非常扎实了。 龙迷三问
下面是龙哥对于大家可能的一些问题的解答: 这篇论文到底在解决什么问题?南安普顿大学等提出基于EDM2的胎儿超声合成框架,融合多公开数据集生成512×512高清图像,FID由176.85降至104.25,下游分类微调后准确率达93.36%,反超纯真实… 这篇工作最值得看的点是什么?FID大幅降低(整体从176.85降至104.25),分类准确率在微调后达到93.36%的集成准确率,超过仅用真实数据训练的92.32%及对比方法的92.84%;临床评分中真实图像3.12/5高于合成图像2.07/5。 这篇工作的边界或风险在哪里?优点:采用当前SOTA的EDM2扩散架构,实现了512×512高分辨率胎儿超声合成;整合多个开放数据集提升泛化性;合成图像在下游分类任务中表现优异,代码与资源全开放。缺点:临床评估显示合成图像真实感仍不足(均分2.67/5),存在平滑、斑… 如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~ 龙哥点评
论文创新性分数:★★★☆☆
应用位置选得准,将ImageNet上SOTA的EDM2扩散模型迁移到高分辨率胎儿超声合成,并配合多数据集融合策略,整体以工程创新和应用创新为主。实验合理度:★★★★☆
FID、下游分类、临床评估三条线相互印证,对比实验和Tian等严格对齐,排除分辨率干扰的方式也很妥当;美中不足是缺少与其他扩散架构的横向对比。学术研究价值:★★★★☆
为胎儿超声合成提供了一套高分辨率、完全开源的技术基线,尤其是512×512分辨率的设定,给后续研究立了一个新标杆。稳定性:★★★☆☆
代码、权重、数据全部开源,评估流程规范且可复现;但生成图像在解剖细节上仍有不稳定的伪影,离稳定产出临床级图像还有距离。适应性以及泛化能力:★★☆☆☆
当前只在六类胎儿平面上验证,未覆盖更复杂的异常胎儿、不同超声设备、3D/4D成像等场景,泛化能力有待进一步检验。硬件需求及成本:★★☆☆☆
EDM2-XL模型训练和推理开销较大,需要高端GPU资源,512×512分辨率生成速度也偏慢,离轻量部署还有差距。复现难度:★★★★★
训练脚本、评估指标、数据集、预训练权重一应俱全,照着GitHub仓库操作即可复现全部实验,几乎没有隐藏成本。产品化成熟度:★★☆☆☆
作为科研工具和数据增强手段已经可用,但临床诊断辅助场景要求严格,以当前合成图的真实感评分和伪影水平,尚不适合直接产品化。可能的问题:临床评估仅由一位医生完成100张图的评分,样本量和人员数量偏少;缺少对不同超声设备和多中心数据的泛化实验,使得结论的外推性受到一定限制;此外,不同数据集的标签策略(单标签统一标注)可能让模型在某些类别上混淆语义。
主要参考文献
主要参考文献
[1] Mannering H, Zhang Y, Liu Z, et al. A Foundational EDM2-Based Generative Model for High-Resolution Synthetic Fetal Ultrasound Imaging from Open Datasets. arXiv preprint arXiv:2608.05471, 2026. [2] Karras T, Aittala M, Lehtinen J, et al. Analyzing and improving the training dynamics of diffusion models. CVPR 2024. [3] Burgos-Artizzu X P, Coronado-Gutiérrez D, Valenzuela-Alcaraz B, et al. Evaluation of deep convolutional neural networks for automatic classification of common maternal fetal ultrasound planes. Scientific Reports, 2020. [4] Tian Y, Ucurum E, Han X, et al. Enhancing fetal plane classification accuracy with data augmentation using diffusion models. IET Image Processing, 2025. [5] Yue Y, Li Z. MedMamba: Vision Mamba for medical image classification. arXiv preprint arXiv:2403.03849, 2024. [6] Heusel M, Ramsauer H, Unterthiner T, et al. GANs trained by a two time-scale update rule converge to a local Nash equilibrium. NeurIPS 2017. [7] Rombach R, Blattmann A, Lorenz D, et al. High-resolution image synthesis with latent diffusion models. CVPR 2022.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
![]()
想亲手生成高清胎儿超声图?想解码扩散模型如何“造数据”实现反超?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 医学影像+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,AI医疗方向的同好们,赶紧入群开聊!
![]()
![]()
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!