← 返回 PaperDaily 视觉与图像

IEEE BigData 2025:CEMD跨域迁移,让胆囊分割暴涨27%还能提速3倍

在医学影像分割的同类探索里,这篇把手伸向了更硬核的跨手术域迁移:胆囊手术学到的东西,能不能直接帮直肠手术做分割?CEMD架构给出的答案是——不仅能用,胆囊类分割还暴涨27%,收敛还快3倍,值得一读。

IEEE BigData 2025:CEMD跨域迁移,让胆囊分割暴涨27%还能提速3倍
原论文信息如下:
论文标题:
利用类特定解码器与迁移学习进行腹腔镜图像分割(Leveraging Transfer Learning with Class-Specific Decoders for Laparoscopic Segmentation)
发表日期:
2026年07月(IEEE BigData 2025已录用)
发表单位:
德国弗朗霍夫智能分析与信息系统研究所(Fraunhofer IAIS)、德国波恩大学(University of Bonn)
原文链接:
https://arxiv.org/pdf/2607.29509v1.pdf
DOI:
10.1109/BigData62323.2025.11401034

引言

腹腔镜手术因创伤小、恢复快而日益普及,但医生视野受限,操作难度大。让AI自动分割肝脏、胆囊等关键结构,对手术导航与决策至关重要。然而,腹腔镜图像存在光照不均、器官外观差异大、器械遮挡等问题,且不同器官面积占比悬殊——腹壁、肝脏常占据大半画面,而胆囊、胰腺等小器官仅露一角。这种类别不平衡是医学图像分割的顽疾,在小器官上表现尤为严重。
以往缓解措施包括加权损失函数、注意力机制与数据增强。2025年MIDL上Tomar等人提出新思路:为每个器官配备专属解码器,而非共用,并在DSA数据集上验证了有效性。但一个关键问题悬而未决:类特定解码器的优势能否跨数据集、跨手术类型保持?现实中标注稀缺,若每来一个新手术类型就从头训练,实用价值将大打折扣。这正是本期论文的核心。
来自Fraunhofer IAIS波恩大学的团队,用胆囊切除手术(CholecSeg8K)和直肠手术(DSA)两个数据集做了“交叉实验”:将胆囊手术学到的知识迁移到直肠手术分割。结果令人惊喜——零微调即追平从零训练,全网络微调更将整体Dice推至62.4%,胆囊类分割从0暴涨27个百分点。

方法概述

论文对比两种框架。CECD(公共编码器-公共解码器)是主流做法:一个编码器提取特征,一个解码器输出所有器官掩码,参数少但小器官特征易被淹没。CEMD(公共编码器-多解码器)则共享编码器,为每个器官配备独立解码器,各学各的解剖特征。打个比方,CECD像全科医生看所有片子,CEMD则是给每个器官请专科医生,看得更细。
图1:<h2 style=腹腔镜分割的痛点:类别不平衡与跨域适应
腹腔镜图像分割是手术智能辅助的硬骨头。第一道坎是类别不平衡:DSA数据集中,腹壁和肝脏占据大半画面,而胰腺、输尿管等像素占比常不足3%,模型被大器官带偏,小器官学习效果极差,甚至不如随机猜测。第二道坎是跨手术域适应:胆囊与直肠手术视野、器械、组织暴露差异巨大,直接迁移性能断崖式下跌,而人工标注又贵又慢。
Fraunhofer IAIS和波恩大学的团队,将类特定解码器与跨域迁移学习结合,系统回答了这个问题。结论是:零微调即可追平从零训练,全网络微调将整体Dice推至62.4%,小器官胆囊从0分暴涨27个百分点。

类特定解码器:CEMD如何提升小器官分割?

在分割网络中,编码器压缩图像为高维特征,解码器还原为像素级分割图。传统共用解码器需同时兼顾所有器官,负担重,小器官特征易被淹没。CEMD则为每个器官配独立解码器,各学各的,互不干扰。
在DSA数据集上从零训练,CEMD在11个类别中9个取得更高Dice,平均提升约3.5%,肠系膜下动脉提升超10%。大器官本身分数高,提幅有限;小器官相对提升更明显。
图4:DSA数据集上CEMD与CECD的Dice分数差异,上方标注了各类别在训练集中的像素比例,类别按像素占比从高到低排列。
图4:DSA数据集上CEMD与CECD的Dice分数差异,上方标注了各类别在训练集中的像素比例,类别按像素占比从高到低排列。
在CholecSeg8K数据集上,CEMD表现更戏剧化。胆囊(像素占比仅2.67%)在CECD下Dice归零,完全无法分割;CEMD则将其拉至27.39%,从“完全失败”变为“有可用价值”。整体Dice从66.39%提升至70.38%,增益几乎全部来自胆囊类。
*表格超出部分左右可以滑动
器官 像素占比(%) CECD DS CECD IoU CEMD DS CEMD IoU
肝脏29.3181.2469.1982.1570.71
背景26.9596.9994.3795.3491.30
腹壁22.6488.8880.4686.3176.67
脂肪16.7792.1385.5392.2285.70
胆囊2.670.000.0027.3918.84
L-hook电钩1.6639.1032.6538.9032.24
总体-66.3960.3770.3862.58
表1:CholecSeg8K数据集上CECD和CEMD的Dice分数(DS)与IoU对比(%),器官按训练集像素占比从高到低排序。*表示该器官在CEMD中相比CECD取得超过5%的增益,主要反映在胆囊类。

跨手术域迁移:从胆囊到直肠,知识能否复用?

跨域迁移是论文重头戏。源域为胆囊切除手术(CholecSeg8K,8080张图,12类),目标域为直肠手术(DSA,13195张图,11类)。两域共享肝脏和腹壁两个标注类别,CholecSeg8K的“胃肠”类大致对应DSA的胃、小肠等,构成迁移的“共同语言”。
图2:DSA数据集训练集和评估集中各类别的像素分布,类别按训练集像素占比从高到低排序,测试集占比保持与训练集接近以在类别不平衡下获得可靠评估。
图2:DSA数据集训练集和评估集中各类别的像素分布,类别按训练集像素占比从高到低排序,测试集占比保持与训练集接近以在类别不平衡下获得可靠评估。
图3:CholecSeg8K数据集训练集和评估集中各类别的像素分布,类别按训练集像素占比从高到低排序。GT代表胆囊类。
图3:CholecSeg8K数据集训练集和评估集中各类别的像素分布,类别按训练集像素占比从高到低排序。GT代表胆囊类。
图2和图3显示,类别不平衡问题在两个数据集中都非常严重,但这反而让跨域研究更有价值。论文先做最简单的迁移实验——用CholecSeg8K训练好的模型直接测试DSA,不做微调。结果显示,CEMD总体Dice达60.0%,与从零训练完全持平;CECD也类似(59.3%对59.3%)。这意味着胆囊手术域学到的解剖特征,很大一部分可复用到直肠手术域。

微调策略大比拼:冻结编码器还是全网络更新?

直接迁移基线不差,但微调能进一步提升。论文设计三种策略:0FT(无微调)作为基线;DFT(解码器微调)冻结编码器,只更新解码器,直觉上既省算力又不丢通用知识;FFT(全网络微调)让整个网络彻底适应目标域。
*表格超出部分左右可以滑动
架构 50轮 100轮 150轮 最佳(%)
CECD_0FT39.752.456.559.3
CECD_DFT45.851.050.753.7
CECD_FFT33.453.057.359.4
CEMD_0FT58.060.460.760.0
CEMD_DFT54.454.454.755.1
CEMD_FFT59.961.862.462.4
表2:测试集性能对比(Dice分数,%)。CECD_0FT/CEMD_0FT表示在CholecSeg8K上训练后直接在DSA上评估(无微调),CECD_DFT/CEMD_DFT表示冻结编码器只微调解码器,CECD_FFT/CEMD_FFT表示对整个网络进行微调。
结果反直觉。DFT在两种架构上都带来明显性能下降——CECD从59.3%跌至53.7%,CEMD从60.0%跌至55.1%。这说明编码器在源域学到的特征不能凭空适用于目标域;胆囊与直肠图像在纹理、光照、器械阴影上的差异,需要编码器参与自适应调整。只靠解码器“补课”不仅补不齐,反而搞乱特征。
FFT则给出相反答案。CEMD_FFT将整体Dice从60.0%拉至62.4%,提升2.4个百分点;CECD_FFT维持在59.4%,与基线持平。图6显示,CEMD在DFT下几乎全线飘绿(性能下降),但FFT让输尿管、胰腺、小肠等类别Dice显著上升。且CEMD在DFT下的下降幅度更小(−4.9% vs −5.6%),说明类特定解码器对域偏移的“抵抗力”更强。
图6(a):CECD架构下,从零训练(0FT)、解码器微调(DFT)和全网络微调(FFT)相对于0FT基线的Dice分数变化。
图6(a):CECD架构下,从零训练(0FT)、解码器微调(DFT)和全网络微调(FFT)相对于0FT基线的Dice分数变化。
图6(b):CEMD架构下,从零训练(0FT)、解码器微调(DFT)和全网络微调(FFT)相对于0FT基线的Dice分数变化。FFT在多个类别上带来显著提升,DFT则普遍下降。
图6(b):CEMD架构下,从零训练(0FT)、解码器微调(DFT)和全网络微调(FFT)相对于0FT基线的Dice分数变化。FFT在多个类别上带来显著提升,DFT则普遍下降。

实验结果:CEMD+FFT的精准提升与收敛加速

综合所有实验,最佳配置是CEMD_FFT。表5显示,CECD的FFT相比从零训练几乎无提升(59.4% vs 59.3%,+0.1%),而CEMD的FFT带来2.4个百分点增益,说明类特定解码器和全网络微调是“黄金搭档”。原因在于:CEMD每个解码器只负责一个器官,微调时梯度信号更集中;FFT允许编码器在目标域重新调整特征提取,两者配合事半功倍。
*表格超出部分左右可以滑动
架构 从零训练 FFT Δ
CECD59.359.4+0.1
CEMD60.062.4+2.4
表5:DSA数据集上从零训练与最佳迁移学习配置(FFT)的整体Dice分数(%)对比,Δ为两者差值。
除了峰值性能,收敛速度是另一亮点。图7显示,CEMD_FFT在第50个epoch就达到59.9%的Dice,与CEMD_0FT训练完整周期的60.0%几乎一样。即通过迁移学习加全网络微调,只用不到三分之一时间就追平从零训练的最终成绩,在计算资源紧张的医疗AI场景非常实用。
图7(a):CECD架构下,DSA数据集验证集Dice分数随训练epoch的变化曲线,对比从零训练(0FT)、解码器微调(DFT)和全网络微调(FFT)。
图7(a):CECD架构下,DSA数据集验证集Dice分数随训练epoch的变化曲线,对比从零训练(0FT)、解码器微调(DFT)和全网络微调(FFT)。
图7(b):CEMD架构下,DSA数据集验证集Dice分数随训练epoch的变化曲线。CEMD_FFT仅50轮就达到59.9%的Dice,接近从零训练最终成绩。
图7(b):CEMD架构下,DSA数据集验证集Dice分数随训练epoch的变化曲线。CEMD_FFT仅50轮就达到59.9%的Dice,接近从零训练最终成绩。
在CholecSeg8K数据集上,CEMD的收敛优势同样清晰。图5学习曲线中,CEMD在训练早期就拉开与CECD的差距,验证集表现更稳定,印证了类特定解码器在特征学习效率上的优势。
图5:CholecSeg8K数据集验证集Dice分数随训练epoch的变化曲线,比较CECD和CEMD两种架构。CEMD不仅性能更优,收敛速度也更快。
图5:CholecSeg8K数据集验证集Dice分数随训练epoch的变化曲线,比较CECD和CEMD两种架构。CEMD不仅性能更优,收敛速度也更快。

局限与未来:类别不平衡仍是拦路虎

尽管CEMD+FFT带来稳健提升,论文在Limitations部分态度清醒——类别不平衡仍是“未能完全解决的深层问题”。以最佳配置CEMD_FFT为例,胰腺Dice仅41.2%,肠系膜下动脉51.8%,输尿管50.1%,与腹壁(84.5%)、小肠(83.9%)差距极大。迁移学习的收益主要集中在“本来就能学好”的类别,对像素占比极低的器官,收益十分有限。
另一个被指出的问题是,分割性能不仅取决于像素占比,还取决于器官的视觉特征。CholecSeg8K中,肝脏虽是占比最高的类别(29.31%),分数却低于像素占比仅16.77%的脂肪——边界清晰、纹理均一的器官更容易学,提醒我们单纯靠增大样本比例或调整网络结构,不能解决所有分类难题。
未来方向包括:在损失函数层面做更精细的类别不平衡处理,引入更强大的自监督预训练或生成式数据增强补充小器官样本,在更大手术数据集上验证CEMD泛化能力。若能将小器官分割精度再推一截,这套方法才更接近临床辅助决策。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

提问:Dice Score和IoU到底是什么?为什么论文里反复用它们衡量性能?Dice Score(Dice系数)和IoU(交并比)是医学图像分割最常用的评估指标。Dice系数是预测掩码与真实掩码交叠面积的两倍除以面积之和;IoU是交叠面积除以并集面积。两者都落在0到1之间(论文写成百分比),数值越高说明分割结果与医生标注重合度越高。Dice对中小目标敏感性更好,因此在器官分割中更常被当作主指标。

提问:为什么DFT(只微调解码器)反而会让性能下降?这不是更省资源吗?从“省资源”看,DFT确实只更新解码器参数,计算量更小。但实验显示DFT在CECD和CEMD上都明显掉点。原因在于:编码器虽在CholecSeg8K上学到通用腹腔特征,但胆囊与直肠手术图像在光照、器械阴影、组织外观上仍有系统性差异,若不调整编码器,解码器学到的目标域特征就是对不齐的。冻结编码器=固定源域“偏见”,解码器再怎么微调都是戴着镣铐跳舞。FFT虽训练成本更高,但让编码器和解码器协同适应目标域,才是正确姿势。

提问:CEMD给每个器官都配一个解码器,参数量会不会爆炸?训练时间是不是很长?参数量确实比单个共享解码器更多——11个器官就是11个解码器分支,存储和计算开销相应增加。但论文结果显示CEMD收敛速度反而更快,在CholecSeg8K和DSA上都能在更少epoch内达到更好分数,一定程度上对冲了额外计算成本。论文还引用之前工作指出,训练时可对当前图像中实际出现的器官解码器做梯度更新(不相交学习策略),其他解码器不参与反传,大幅降低训练开销。若上临床,还需模型剪枝和推理加速,但这属于工程优化范畴。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性:★★★★☆

将类特定解码器与跨手术域迁移学习系统性结合,给出“冻结编码器有害、全网络微调有效”的清晰结论,是对已有工作的有效延伸。

实验合理度:★★★★☆

在两个公开数据集上做了三种训练策略的全面对比,报告了不同epoch的中间结果,分析维度丰富。但缺少与最新SOTA分割方法的横向对比。

学术研究价值:★★★★☆

DFT与FFT的对比结论对跨域医学分割研究者具有直接参考意义,揭示了编码器在域适应中不可替代的作用。

稳定性:★★★☆☆

在小器官(胰腺、输尿管等)上性能仍不稳定,直接迁移时部分类别甚至无法正确分割,距离临床可用还有明显差距。

适应性以及泛化能力:★★★☆☆

仅在胆囊切除和直肠两种手术域上验证,跨更多手术类型(如肾脏、妇科)的泛化性尚不清楚。且两数据集都有大量弱标注,对强标注数据集的表现有待验证。

硬件需求及成本:★★★☆☆

多解码器设计增加了模型参数量和训练算力开销,但收敛速度快、早停策略在一定程度上抵消了成本,A100级别GPU可以接受。

复现难度:★★★★☆

两个数据集均公开,架构基于Attention U-Net改造,方法描述详细,复现门槛不高。但目前未提供官方代码,仍需自己实现。

产品化成熟度:★★☆☆☆

小器官分割仍不够可靠,推理速度未报告,能否实时辅助手术决策还是未知数。距离临床落地还有不少工程化工作要做。

可能的问题:缺少与最新SOTA方法(如基于Transformer或Mamba的分割模型)的对比,也没有报告模型参数量、推理速度等工程指标;在CholecSeg8K上只选了6类做分析,虽然理由合理,但削弱了结论的完整性。


主要参考文献

[1] Tomar P, Parikh A, Bauckhage C, et al. Leveraging Transfer Learning with Class-Specific Decoders for Laparoscopic Segmentation[C]//2025 IEEE International Conference on Big Data (BigData). IEEE, 2025.
[2] Carstens M, Rood T, Bodenstedt S, et al. Dresden Surgical Anatomy Dataset for laparoscopic segmentation[J]. Scientific Data, 2023.
[3] Hong W Y, Kao C L, Kuo C Y, et al. CholecSeg8K: A Semantic Segmentation Dataset for Laparoscopic Cholecystectomy[J]. IEEE Journal of Biomedical and Health Informatics, 2023.
[4] Oktay O, Schlemper J, Folgoc L L, et al. Attention U-Net: Learning Where to Look for the Pancreas[J]. arXiv preprint arXiv:1804.03999, 2018.
[5] Tomar P, Vaidya A, Bauckhage C, et al. Exploring the Efficacy of Organ-Specific Decoders for Laparoscopic Segmentation[C]//Medical Imaging with Deep Learning (MIDL), 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球