表2:测试集性能对比(Dice分数,%)。CECD_0FT/CEMD_0FT表示在CholecSeg8K上训练后直接在DSA上评估(无微调),CECD_DFT/CEMD_DFT表示冻结编码器只微调解码器,CECD_FFT/CEMD_FFT表示对整个网络进行微调。结果反直觉。DFT在两种架构上都带来明显性能下降——CECD从59.3%跌至53.7%,CEMD从60.0%跌至55.1%。这说明编码器在源域学到的特征不能凭空适用于目标域;胆囊与直肠图像在纹理、光照、器械阴影上的差异,需要编码器参与自适应调整。只靠解码器“补课”不仅补不齐,反而搞乱特征。FFT则给出相反答案。CEMD_FFT将整体Dice从60.0%拉至62.4%,提升2.4个百分点;CECD_FFT维持在59.4%,与基线持平。图6显示,CEMD在DFT下几乎全线飘绿(性能下降),但FFT让输尿管、胰腺、小肠等类别Dice显著上升。且CEMD在DFT下的下降幅度更小(−4.9% vs −5.6%),说明类特定解码器对域偏移的“抵抗力”更强。图6(a):CECD架构下,从零训练(0FT)、解码器微调(DFT)和全网络微调(FFT)相对于0FT基线的Dice分数变化。图6(b):CEMD架构下,从零训练(0FT)、解码器微调(DFT)和全网络微调(FFT)相对于0FT基线的Dice分数变化。FFT在多个类别上带来显著提升,DFT则普遍下降。
实验结果:CEMD+FFT的精准提升与收敛加速
综合所有实验,最佳配置是CEMD_FFT。表5显示,CECD的FFT相比从零训练几乎无提升(59.4% vs 59.3%,+0.1%),而CEMD的FFT带来2.4个百分点增益,说明类特定解码器和全网络微调是“黄金搭档”。原因在于:CEMD每个解码器只负责一个器官,微调时梯度信号更集中;FFT允许编码器在目标域重新调整特征提取,两者配合事半功倍。
[1] Tomar P, Parikh A, Bauckhage C, et al. Leveraging Transfer Learning with Class-Specific Decoders for Laparoscopic Segmentation[C]//2025 IEEE International Conference on Big Data (BigData). IEEE, 2025.[2] Carstens M, Rood T, Bodenstedt S, et al. Dresden Surgical Anatomy Dataset for laparoscopic segmentation[J]. Scientific Data, 2023.[3] Hong W Y, Kao C L, Kuo C Y, et al. CholecSeg8K: A Semantic Segmentation Dataset for Laparoscopic Cholecystectomy[J]. IEEE Journal of Biomedical and Health Informatics, 2023.[4] Oktay O, Schlemper J, Folgoc L L, et al. Attention U-Net: Learning Where to Look for the Pancreas[J]. arXiv preprint arXiv:1804.03999, 2018.[5] Tomar P, Vaidya A, Bauckhage C, et al. Exploring the Efficacy of Organ-Specific Decoders for Laparoscopic Segmentation[C]//Medical Imaging with Deep Learning (MIDL), 2025.