← 返回 PaperDaily
视觉与图像
把病灶“外形”和“纹理”拆开学,SAUF-Net把Dice拉到91.98%
标注数据稀缺是医学影像落地的头号绊脚石。SAUF-Net把视野从“预测结果的一致性”拉到“内部特征表示是否可靠”,用“结构-外观解耦”的思路直接回应伪标签误差累积这个老大难问题,在5%标注率下打出了超越不少10%标注方法的效果,值得所有做半监督分割的读者花几分钟看看。
龙哥读论文
发布于 2026-09-12 16:54:33
阅读 1
查看原文
原论文信息如下:
先讲一个半监督分割里很容易被忽略的事:大多数方法都在反复要求“输出要稳定”,却很少过问“特征到底可不可靠”。如果模型自己都没搞清楚它在看什么,那它生成的伪标签再自信,也只是在把错误越描越粗而已。SAUF-Net就是冲着这个痛点来的。
半监督医学分割的困境:预测级一致性为何不够?
医学图像分割是个典型的“高回报、高成本”任务。要训练一个能精准勾出病灶轮廓的模型,通常需要大量像素级标注,而每张医疗影像的标注都得由有经验的医生一像素一像素地描,费时费力还容易引入主观差异。半监督学习(Semi-Supervised Learning,SSL)因此被寄予厚望:既然专家标注太贵,那就只标注一小部分,剩下的无标注图像全靠模型自己“悟”。
目前主流SSL方法大致有三大门派:一致性正则(给输入加扰动,强制预测不变)、伪标签生成(把模型自己的高置信度预测当监督信号)、不确定性估计(用不确定性剔除靠不住的样本)。听起来都挺合理,但仔细一看——它们几乎全在“预测层”做文章 ,也就是盯着输出的概率图,告诉模型“你要稳定一点”。
问题在于,预测稳定≠特征可靠 。比如一个皮肤病灶,形状、位置、边界连续性这些“结构线索”,跟皮肤纹理、颜色变化、光线噪声这些“外观线索”是纠缠在一起的。标注数据少的时候,模型很容易抓到纹理这种表面特征作为捷径——只要看到某种纹理就输出“这里是病灶”。一旦模型在无标注图像的模糊区域给出了自信但错误的预测,这个错误又会被当作伪标签继续训练,越滚越大,最终形成误差累积。
这也是为什么有些半监督方法在低标注比例下,指标上到一定水平就“焊死”了——因为不管怎么调一致性损失的权重,模型内部特征表示仍然可能被外观信息带偏。要破局,就得从特征表征层面下手。
结构-外观解耦:让模型学会区分“是什么”与“长什么样”
SAUF-Net全称是Structure–Appearance Representation Learning with Uncertainty Feedback Network,核心思想非常直接:把病灶“是什么”和“长什么样”拆成两路特征。前者叫结构表征(structural representation),负责形状、边界、位置这类与分割决策直接相关的信息;后者叫外观表征(appearance representation),负责纹理、色彩、噪声等容易受成像条件影响的干扰项。
拆分的活儿由一个叫结构-外观分解模块 (Structure–Appearance Decomposition Module,SADM)来完成。SADM在SegFormer-B4编码器最深的瓶颈特征上挂两个参数独立的投影分支,每个分支都由两层3×3的Conv-BN-ReLU再加一层1×1卷积构成,分别输出结构表征F_s和外观表征F_a。
这里有个关键细节:光靠两套独立卷积,并不会天然让一路只学结构、另一路只学外观,网络完全可以偷懒。所以SAUF-Net在监督信号上做了强约束——结构分支预测F_s被拿去拟合病灶前景掩码,外观分支预测F_a则被拿去拟合互补的背景掩码 。
用标签“逼”两个分支分道扬镳:一个只管把病灶区域圈出来,另一个被迫去解释“非病灶长什么样”。这样一来,即使后面没有标注了,模型内部也已经形成了分工明确的两套表征,而不是一锅炖。
解耦出来的表征不能白拆,还得用起来。SAUF-Net设计了一个解耦引导模块 (Disentangled Guidance Module,DGM)把F_s和F_a注入多尺度解码过程。DGM的思路很巧妙:在每一层解码前,把F_s和F_a做双线性插值放大到当前特征图分辨率,然后用它们分别生成可变形卷积(Deformable Convolution)的偏移量与调制掩码,先后执行两次“采样-精修”。
用大白话解释可变形卷积:普通卷积在固定网格上采样,就像拿着一个固定尺子去量东西;可变形卷积则先学一组偏移量,告诉卷积核“你别死板地按原位置取点,往左偏一点、往右挪一点,去更关键的地方采样”。DGM在这里相当于让结构特征先引导解码器关注病灶区域,再由外观特征在该区域内做细节补充,实现“先定位、再精修”的两段式引导。整体流程见图1。
外观交换一致性:如何让结构表示对表观变化鲁棒?
SADM把特征拆开了,但拆完就完事了吗?并没有。一个容易被忽略的隐患是:即便结构分支被监督信号“推”着学结构,它的内部表征里可能仍然残留着外观信息的影子,只不过这种残留很隐蔽,单看分割结果不一定能发现。
怎么测试结构表征到底“纯不纯”?SAUF-Net用一个很聪明的办法:外观交换 。在一个mini-batch里随机取两张图A和B,把A的结构表征F_s^A和B的外观表征F_a^B“拼”在一起,得到混合表征F_mix,然后送给融合分支H生成预测:
如果模型真的在依靠结构做判断,那么把B的外观“穿”在A的结构上,分割结果应该依然指向A的病灶区域。但如果结构表征里还偷偷混着A的纹理、颜色之类的外观信息,一旦外观被换成B的,预测就会发飘。所以ASC分支会强制混合预测去匹配A的伪标签,从训练上倒逼结构表征在换外观后保持不变。
可以把这个过程类比成换装识别:给你看一张穿红衣服的人脸,再给你看一张穿蓝衣服的人脸,然后问你“第一张脸是谁”。如果模型只记住了红衣服,那换装后就认不出来了;如果它真正记住了五官轮廓,那换什么衣服都能认出来。ASC干的就是这个“换装测试”,只不过把衣服换成了皮肤纹理和颜色分布。通过这种对抗式的自我检验,结构特征被迫丢掉对外观变化的依赖,只保留跟病灶位置和形状强相关的信息。
可靠性引导的不确定性反馈:从特征层面抑制伪标签错误累积
拆好了结构、做好了换装测试,SAUF-Net还差最后一块拼图:如何处理那些结构不清、边界模糊的区域产生的不可靠伪标签?
传统做法通常看预测概率:模型输出0.9以上就认为是高置信度,可以做伪标签。但问题是,前面已经讲过,模型可能“自信地错”——在模糊纹理区域,模型对错误答案的概率照样可以打到0.9以上。因此SAUF-Net抛弃了单纯的“置信度”思路,改用可靠性图 (reliability map)来衡量每个像素适不适合当老师。可靠性图由主预测P、结构分支预测P_s、外观分支预测P_a三者共同计算:
这个公式的第一项很好理解:如果主预测和结构分支打架,说明这个区域的判断本身就不稳定。第二项则更有意思——它要求结构分支和外观分支给出差异足够大 的响应。为什么?如果一个像素被同时判定为“病灶前景”和“背景外观”,说明两套表征在这个位置上纠缠不清,这种像素的伪标签当然不可靠;反之,如果结构分支说“这是病灶”,外观分支也说“这确实不是背景纹理”,两者判断形成印证,可靠性就高。
有了可靠性图,SAUF-Net还从特征层再做一道保障:让一个带有有效性头 和不确定性头 的双头判别器直接去“盯着”无标注数据的特征。有效性头做对抗判别,把分割网络从真实图像里提的特征当“真”,把生成器从高斯噪声里伪造的特征当“假”,逼真特征跟假特征拉开距离;不确定性头则输出逐像素不确定性图,有标注数据用主预测和辅助预测的误差去回归,无标注数据用1-M_rel(可靠性越低代表越不确定)作为回归目标。
这种“特征级反馈”与常规伪标签过滤有一个本质区别:伪标签过滤是在样本选择时“把不好的样本扔掉”,而特征级不确定性反馈是“把不好的特征拉回来”。前者治标,后者治本。最终训练总损失可写为L_total = L_sup + λ_con(t)·L_con + λ_asc·L_asc + λ_uf(t)·L_uf,其中一致性损失和不确定性反馈损失的权重随训练轮次进行ramp-up(逐渐爬升),避免训练初期伪标签噪声过大。推理时,判别器和生成器全部丢掉,只保留分割网络本身,不会增加任何额外开销。
实验结果:低标注比例下的显著提升
实验部分,SAUF-Net选了两个公开的2D医学分割基准:ISIC-2016皮肤镜病灶分割数据集(900张训练图、379张测试图)和Kvasir-SEG息肉分割数据集(1000张图像,按8:2划分训练和测试)。评价指标采用Dice相似系数(Dice Similarity Coefficient,DSC)、交并比(Intersection over Union,IoU)和像素级准确率(Accuracy,Acc)。实现细节上,骨干网络采用ImageNet预训练的SegFormer-B4,输入统一resize到512×512,batch size为2,优化器使用AdamW。训练采用两阶段策略:先用有标签数据训练100个epoch,再引入无标签数据做50个epoch的半监督微调。增强方式包含颜色扰动与小波变换两类。
从表1可以看到,在10%标注比例下,SAUF-Net在ISIC-2016上达到91.88%的Dice和85.88%的IoU,比此前最强的AdaptFRCNet分别高0.51和0.58个百分点;在Kvasir-SEG上优势更明显,达到90.53%的Dice和84.94%的IoU,比AdaptFRCNet提升1.18和1.58个百分点。在20%标注比例下,SAUF-Net在两个数据集上继续保持领先,其中Kvasir-SEG的Dice达到91.98%,甚至超过了用100%标注训练的SegFormer-B4基线(91.79%)——只用了五分之一的数据,效果反而比全监督还高一点。
更值得关注的是5%标注比例的极端情况。SAUF-Net只用了5%的标注数据,就在ISIC-2016上拿到90.91%的Dice、在Kvasir-SEG上拿到89.71%的Dice,这个成绩已经超过了不少方法在10%标注下的表现。以Kvasir-SEG为例,BCP、CPS、CCT等在10%标注下的Dice都在82%到86%区间,而SAUF-Net砍掉一半标注后仍然能到89.71%,说明结构-外观解耦确实让模型用标注数据的效率变高了。论文还报告了对每张测试图像的Dice做了Wilcoxon符号秩检验,所有标注比例下p值均小于0.01,说明相对AdaptFRCNet的提升具有统计显著性。
从可视化的定性结果来看,SAUF-Net对轮廓细节的把控确实更稳:皮肤病灶分割中,边缘不规则的区域不再被“一刀切”;息肉分割中,和周围黏膜灰度接近的低对比度边界也被保存得更完整。这些恰恰是伪标签最容易出错、传统置信度过滤最防不住的地方。
消融实验在Kvasir-SEG上以20%标注比例进行,见表2。
先看(a)的组件消融。单纯使用SegFormer-B4做半监督基线只有82.16%的Dice;加上SADM后直接跳到89.91%的Dice,单这一个模块就带来7.75个百分点的提升,说明结构-外观分解带来的收益远超想象。加入可靠性图M_rel后Dice进一步涨到91.16%,再加ASC涨到91.38%。有趣的是,如果把不确定性反馈单独叠加在未加ASC的模型上,Dice反而从91.16%降到90.54%,但Acc提升到97.29%;只有ASC和不确定性反馈同时启用,才能达到91.98%的Dice和97.59%的Acc。
这个现象说明SAUF-Net的各模块不是简单的“叠加涨点”关系,而是存在明显的协同:ASC先把结构表征“洗干净”,不确定性反馈才能在干净的结构表征上有效发挥作用。如果结构表征还沾着外观噪声,过早地做特征级反馈反而可能放大噪声。超参数方面,ASC权重λ_asc取0.05、反馈系数α取0.10、置信度阈值τ取0.95时效果最优,论文对这些超参数都做了敏感性分析,结论比较扎实。
局限与展望:从2D到3D的扩展之路
SAUF-Net的论文自己也在局限部分写得很坦率:目前的实验只覆盖2D二值病灶分割,也就是皮肤病灶和肠道息肉这两类目标,尚未验证多类别分割和跨数据集泛化能力。这里值得展开讲讲:2D分割中,结构和外观可以相对容易地通过“前景/背景”约束拆开,因为病灶和背景在纹理上往往有较明显的差异;但到了3D医学影像(比如CT和MRI),器官与病灶的边界更依赖于三维空间连续性,切片间的结构关系比单张图像里的纹理信息复杂得多,SADM的解耦逻辑能不能平滑迁移到3D,还需要进一步验证。
另一个尚未解决的问题是跨域鲁棒性。ISIC-2016的皮肤镜图像和Kvasir-SEG的内窥镜图像都来自相对固定的成像设备,而真实临床中不同医院、不同设备、不同拍摄条件下的图像分布差异很大。论文尚未做“在一个数据集上训练、在另一个数据集上直接测试”的跨数据集实验,也是未来值得补上的一环。论文提出未来工作将把SAUF-Net扩展到3D和多类别任务,并评估跨数据集与跨成像域的鲁棒性。
龙迷三问
这篇论文到底在解决什么问题? 针对半监督医学图像分割中预测级一致性忽略内部特征可靠性的问题,南昌航空大学提出SAUF-Net,通过结构-外观解耦与不确定性反馈,仅用5%标注即在ISIC-2016达90.91% Dice,超越诸多10%标注方法。
这篇工作最值得看的点是什么? 在10%标注比例下,ISIC-2016上Dice达91.88%,Kvasir-SEG上Dice达90.53%,均优于所有对比方法;5%标注比例下仍具竞争力。
这篇工作的边界或风险在哪里? 优点:提出结构-外观解耦新视角,通过特征级反馈提升半监督分割性能,在低标注比例下效果显著;缺点:仅验证2D二分类病变分割,未扩展到3D和多类任务,跨数据集泛化性未评估。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“结构-外观解耦”引入半监督医学分割,并组合出“解耦→交换测试→特征级反馈”的完整训练范式。结构-外观解耦本身不是从零发明,但在半监督分割语境下做成这样完整的闭环,还是颇有新意的。
实验合理度: ★★★★☆
两个公开数据集、5%/10%/20%三档标注比、9种以上对比方法、补上了统计显著性检验和较完整的消融与超参数分析,实验设计算得上规范。扣一星因为测评基准仅涵盖2D二值分割任务,覆盖宽度有限。
学术研究价值: ★★★★☆
论文给半监督分割提供了一条从“预测层一致性”转向“特征层可靠性”的新思路,特别是“可靠性图+双头判别器”的反馈机制,对后续想解决伪标签噪声问题的研究者有很好的参考价值。
稳定性: ★★★☆☆
不确定性反馈在没有ASC配合时Dice不升反降,说明模块间协同依赖较强、超参较敏感;且引入对抗训练后训练稳定性需要仔细调控。好在推理时只保留主网络,推理侧稳定性尚可。
适应性以及泛化能力: ★★★☆☆
目前仅验证了皮肤镜和息肉两个2D场景,缺乏跨数据集、多类别和3D影像的验证。结构-外观解耦的思路有一定普适性,但没有更多实验支撑前不能给更高分。
硬件需求及成本: ★★★☆☆
训练阶段需同时维护多个模块和对抗分支,两阶段训练加SegFormer-B4骨干,单张RTX 4070 Ti SUPER可完成,说明绝对算力门槛并不算高,但相对纯一致性方法训练成本明显更高。
复现难度: ★★★☆☆
论文对模块和公式写得比较细,训练超参也有交代,但截止目前未看到官方开源代码。对抗训练的交替优化、ASC的shuffle策略、可靠性图与置信掩膜的配合等细节较多,复现时很可能需要花时间调参。
产品化成熟度: ★★☆☆☆
从算法到医疗产品之间还隔着数据合规、多中心验证、3D/多类支持、硬件适配等一大段路。目前更像是学术价值较高的方法论探索,离“即拿即用”还有相当距离。
可能的问题: 论文只覆盖两个2D二值分割数据集,缺乏3D、多类与跨域验证,说服力受限;ASC与不确定性反馈的强协同关系缺少更深层的归因实验;对抗训练使复现门槛升高,若代码不开源,他人跟进成本不低。
主要参考文献
[1] Lu Q, Jing Z, Yang Y, et al. SAUF-Net: Structure–Appearance Representation Learning with Uncertainty Feedback for Semi-Supervised Medical Image Segmentation. arXiv:2609.02247v1, 2026.
[2] Gutman D, Codella N C F, Celebi E, et al. Skin Lesion Analysis toward Melanoma Detection: A Challenge at ISBI 2016. ISBI, 2016.
[3] Jha D, Smedsrud P H, Riegler M A, et al. Kvasir-SEG: A Segmented Polyp Dataset. MMM, 2020.
[4] Xie E, Wang W, Yu Z, et al. SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers. NeurIPS, 2021.
[5] Tarvainen A, Valpola H. Mean Teachers are Better Role Models: Weight-Averaged Consistency Targets Improve Semi-Supervised Deep Learning Results. NeurIPS, 2017.
[6] Bai Y, Chen D, Li Q, et al. Bidirectional Copy-Paste for Semi-Supervised Medical Image Segmentation. CVPR, 2023.
[7] Zhu X, Hu H, Lin S, et al. Deformable ConvNets V2: More Deformable, Better Results. CVPR, 2019.
分割难,标注更难?让SAUF-Net帮你把「结构」和「纹理」拆开看,5%标注也能玩转精准分割!💪
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,AI医疗群里还有不少三甲医院和医疗AI公司的朋友,等你来聊!
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!