← 返回 PaperDaily 视觉与图像

Jaccard 0.8546:皮肤病灶分割的多级融合方案

这篇文章把扩散模型、双路径编码和跨层特征融合揉到一起,专门对付皮肤病灶那种“边界糊成一锅粥”的老难题。实验结果也挺硬,三个公开数据集上平均Jaccard和Dice都很能打,值得看看它到底怎么把病灶边缘抠细。

Jaccard 0.8546:皮肤病灶分割的多级融合方案
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇文章把扩散模型、双路径编码和跨层特征融合揉到一起,专门对付皮肤病灶那种“边界糊成一锅粥”的老难题。实验结果也挺硬,三个公开数据集上平均Jaccard和Dice都很能打,值得看看它到底怎么把病灶边缘抠细。


原论文信息如下:
论文标题:
MLFFM-SegDiff: A Multi-Level Feature Fusion Diffusion Model for Skin Lesion Segmentation
发表日期:
2026年06月
发表单位:
Keyi College of Zhejiang Sci-Tech University; Zhejiang Lanchen Digital Intelligence Technology Co., Ltd.; School of Software Technology, Zhejiang University; School of Medicine, Zhejiang University
原文链接:
https://arxiv.org/pdf/2606.26712v1.pdf
开源代码链接:
https://github.com/Qacket/MLFFM-SegDiff

1. 皮肤病变分割为何如此困难?

皮肤病变分割,说白了就是把皮肤镜图像里那块“可疑区域”从背景里抠出来。听起来像抠图,实际比抠图难多了:病灶边界常常不是刀切一样整齐,而是模糊、低对比、形状不规则,再加上毛发、阴影、反光这些“路人甲”乱入,模型很容易把边界看串。
传统的 U-Net 一类方法,靠编码器提语义、靠跳连补细节,已经是医学分割里的老熟人了。但问题也很现实:同层跳连像“对门送外卖”,信息能送到,但走得不远;浅层看边缘,深层看语义,二者之间若缺少更强的跨层互动,模型就容易出现两种经典翻车方式:要么边界抠不准,要么病灶覆盖不完整。
Transformer 虽然擅长全局建模,但在医学小数据集上往往训练成本更高,稳定性也更挑数据。扩散模型近几年进入分割任务后,思路倒是很有意思:把分割看成“从噪声里一点点把掩码擦出来”的过程,既能建模不确定性,又适合处理边界模糊这种脏活累活。MLFFM-SegDiff就是在这个思路上继续往前拱了一步。

方法整体架构图

图1:MLFFM-SegDiff整体架构
图1:MLFFM-SegDiff整体架构。噪声掩码和皮肤镜图像分别进入双路径编码器,经过多级特征融合模块 MLFFM 后,再送入解码器逐步还原分割结果。这里的“扩散”不是把图像往外炸,而是先加噪、再去噪,让模型学会从混乱中找回秩序。

2. 双路径编码器+MLFFM:如何打破特征融合瓶颈?

这篇论文最有意思的地方,不是“我也用了扩散模型”,而是它在扩散框架里动了三处关键手术:双路径编码器多级特征融合模块 MLFFM,以及一个可配置的边界敏感损失。这三个部件的目标很朴素:别让模型只会“看一眼就猜”,而是把浅层边缘信息和深层语义信息一起端上桌。
先看双路径编码器。普通扩散分割方法里,噪声掩码和图像条件有时只是简单拼接,像把两份材料硬塞进同一个搅拌机,能混,但不一定混得好。这里则把噪声掩码分支和图像引导分支分开编码,再通过残差块、反馈卷积和线性注意力做交互。这样做的好处是:掩码分支负责“当前猜到哪了”,图像分支负责“原图到底长啥样”,两边互相提醒,减少把背景误认成病灶的概率。
更关键的是,编码器不是只留下“同层跳连”这种老套路,而是同时保留两类特征:一类是直接送到解码器的直连跳连特征,另一类是交给 MLFFM 继续加工的增强跳连特征。这相当于一边保留原汁原味的“现成菜”,一边把“半成品”拿去二次烹饪,最后在解码器里一起上桌。
MLFFM 的核心任务,是把不同层级的跳连特征真正揉在一起,而不是只做形式上的“多尺度”。它先通过空间注意力和通道注意力筛一遍,把有用的区域和通道先拎出来;然后做尺度对齐,把不同分辨率的特征拉到同一个空间尺度上;最后再做跨层融合。这里的重点是,融合不是简单相加,而是让浅层的边界纹理、深层的语义轮廓、不同层级的上下文信息彼此补位。

核心设计:双路径编码与多级融合

如果把整个流程拆开看,大概是这么个逻辑:先把噪声掩码和原图分别投影到特征空间;再在每一层编码时让两路特征互相“串门”;接着把各层跳连特征送进 MLFFM 做注意力增强、尺度对齐和跨层融合;最后在解码器里同时使用直连跳连和融合跳连,逐步恢复出更完整的病灶区域。这个结构的妙处在于,它没有把“边界细节”和“全局语义”当成二选一,而是尽量让二者同时在线。
论文里还提到一个边界敏感损失。这里的边界敏感,英文全称是 boundary-sensitive loss,中文可理解为“边界敏感损失”。它的思路很简单:病灶边缘往往最难分,越靠近边界的像素越应该被重点照顾。于是模型不是平均用力,而是给边界附近更高权重,让它别在边缘处“手一抖就画歪”。论文中还引入了时间相关的权重衰减,用来控制这个边界约束在扩散过程中的强弱。

核心原理推导:从“去噪”到“抠边”

这套方法的底层逻辑,可以理解成“先把标准答案打乱,再逼模型把答案拼回来”。训练时,真实掩码 x0 会逐步加噪,得到 xt;模型输入噪声掩码、原图和时间步,去预测被加进去的噪声 ε。只要噪声预测得准,反向扩散就能一步步把病灶区域还原出来。
这里的关键不是“预测噪声”这四个字,而是网络结构怎么帮它预测得更准。双路径编码器负责把原图信息和噪声掩码信息分开理解,再交叉融合;MLFFM 负责把多层特征对齐后做更充分的跨层交流;边界敏感损失则把学习重点往最容易出错的边缘区域挪。三者合起来,等于给扩散模型装了一个“边界放大镜”。
论文中对扩散模型、U-Net、注意力模块这些概念没有故弄玄虚,而是把它们放回到一个很实际的问题里:边界模糊时,单层信息不够,单次融合也不够,必须让不同尺度的信息反复协商。这也是为什么它不是单纯堆模块,而是围绕“跨层交互”做系统性改造。

术语解读

Jaccard index中文常叫“交并比”,衡量预测区域和真实区域重叠得有多像。越接近 1,说明分得越准。

Dice coefficient中文常叫“Dice 系数”,也是衡量分割重叠质量的指标,和 Jaccard 类似,但在医学分割里更常见。

Recall召回率,通俗讲就是“该抓到的病灶有没有尽量抓全”。

MLFFMMulti-Level Feature Fusion Module,中文是“多级特征融合模块”。

D-U-Net是论文里对双路径 U-Net 编码器的简称,不是另起炉灶的全新网络名,而是方便描述该结构的写法。

3. Jaccard达0.8546:三个数据集全面领先

实验部分比较扎实,直接上了三个公开数据集:ISIC2018、PH2 和 HAM10000。这三个数据集一个比一个“皮肤科味儿”浓,既有边界模糊,也有尺度变化,还有各种背景干扰,挺适合检验模型到底是真会分割,还是只会在简单样本上刷存在感。
方法对比对象包括 DermoSegDiff、Generic U-Net、SwinUNETR 和 U-Net。这里的对比思路是合理的:既有传统卷积基线,也有 Transformer 风格模型,还有同类扩散分割方法。这样一来,MLFFM-SegDiff 的提升不是“挑软柿子捏”得来的,而是放在了多个有代表性的参照系里。

主要实验结果表格图

图2:三个数据集上的定量比较结果
图2:Table 1 的截图,展示了 ISIC2018、PH2 和 HAM10000 上的定量结果。可以看到,MLFFM-SegDiff 在三个数据集上整体表现都很稳,尤其是在 Jaccard、Recall 和 Dice 上更突出。对于皮肤病灶分割来说,这通常意味着模型不仅“看见了病灶”,还尽量把病灶边界和内部区域一起保住了。
从具体数字看,论文给出的三数据集平均结果里,MLFFM-SegDiff 的 Jaccard 达到 0.8546,Dice 达到 0.9207,在 Accuracy、F1、Recall、Dice 等指标上都拿到了最优或接近最优的平均表现。相比之下,U-Net 的 Precision 和 Specificity 略高,说明它更保守,宁可少报也不乱报;而 MLFFM-SegDiff 则更偏向“多抓一点、尽量别漏”,在医学分割场景里通常更符合临床需求。

实验结果分析

这些结果和方法设计是对得上的。双路径编码器让图像信息和噪声掩码信息不再“各说各话”,MLFFM 又把不同层级的跳连特征做了更强的协同,因此模型对边界和区域结构的把握更完整。尤其是 Recall 提升明显,说明它对病灶覆盖更积极,不容易把边缘漏掉;Jaccard 和 Dice 同时提升,则说明这种“更积极”不是瞎冲,而是有质量地冲。
五折交叉验证的设置也比较稳妥,能缓解医学数据集样本少、划分偶然性大的问题。再加上统一预处理和统一指标,实验公平性基本过关。值得注意的是,论文没有只盯着一个漂亮数字,而是同时看 Accuracy、F1、Jaccard、Recall、Specificity、Dice,这样更能反映模型在“少漏检”和“少误检”之间的平衡。

对比试验可视化对比图

图3:三个数据集上的分割可视化对比
图3:论文中的可视化结果对比。白色轮廓是模型预测,红色轮廓是真实边界。这个图最能说明问题:有些方法看起来像“差不多分到了”,但边界总会偏一截;而 MLFFM-SegDiff 在边缘贴合度上更好,说明它确实更擅长处理病灶轮廓这种细活。
可视化图往往比表格更诚实。因为表格里的 0.00 几提升看着像“挪了一小步”,但放到边界图上,可能就是少漏一圈、少错一块。对皮肤病灶分割而言,这种差异很实用:边界更准,后续面积估计、病灶分析、分类判断才更靠谱。

4. 消融实验揭秘:哪个模块贡献最大?

论文还做了消融实验,思路很清楚:把双路径编码器、MLFFM、边界敏感损失一个个拿掉,看模型会不会立刻“露馅”。这种实验的价值不在于凑热闹,而在于证明提升不是玄学,而是每个模块都在干活。
从论文文字描述来看,双路径编码器是基础盘,先把图像条件和噪声掩码的交互做起来;MLFFM进一步增强跨层信息流动;边界敏感损失则在训练目标上补一刀,让模型更在意边缘。三者不是替代关系,而是叠加关系。

消融实验表格图

图4:消融实验结果
图4:Table 3 的截图,展示了不同模块组合下的消融结果。虽然这里重点看的是 Dice 和 sensitivity,但结论并不绕:完整模型通常最好,说明这些模块确实是互相配合的,不是“装饰性零件”。
从消融逻辑上看,最值得肯定的是论文没有把提升全甩给某一个模块,而是承认这是一个“组合拳”问题。边界敏感损失更像是锦上添花,但在难样本上很可能是决定模型会不会漏边的关键;双路径编码器和 MLFFM 则更像地基,地基不稳,后面再花哨也容易塌。

5. 局限性:精度与效率的权衡

这篇论文的优点很明确,但局限性也不能装看不见。首先,扩散模型天生就有迭代去噪的成本,虽然论文通过结构优化提升了效果,但在实际部署时,速度和算力压力依然要认真算账。医学影像系统里,临床更关心“能不能稳定、快速、可重复地跑起来”,而不是只在论文图里跑得漂亮。
其次,这类方法对训练数据分布仍然比较敏感。论文用了三个公开数据集和五折交叉验证,说明作者已经尽量避免偶然性,但如果换到不同设备、不同医院、不同成像风格,泛化能力还需要更多验证。换句话说,它已经很像一位“成绩不错的优等生”,但离“到哪都能稳定发挥的全能选手”还有一步。
不过,从研究角度看,这篇工作还是挺有价值的:它说明扩散模型做医学分割,不一定只能靠“更大的模型、更长的采样”,也可以通过更聪明的特征交互更有针对性的边界约束来提升性能。这个思路对后续做病灶分割、器官分割,甚至其他边界敏感任务,都有借鉴意义。😊
插图

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决的是皮肤病灶分割里“边界糊、尺度乱、背景吵”的老问题。方法通过双路径编码器、MLFFM 和边界敏感损失,让扩散模型更会抠边、更会融合多层特征。

MLFFM 是什么意思?MLFFM 是 Multi-Level Feature Fusion Module,中文是“多级特征融合模块”。它的作用是把不同层级的跳连特征对齐、增强、再融合,避免解码器只看到单层信息。

为什么它的 Recall 和 Jaccard 更值得看?Recall 高,说明病灶覆盖更完整,不容易漏;Jaccard 高,说明预测区域和真实区域重叠更好。对医学分割来说,这两个指标比单看 Accuracy 更有意义,因为背景像素太多,Accuracy 很容易“虚高”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆。把扩散模型、双路径编码和多级特征融合结合起来,思路不算离经叛道,但在皮肤病灶分割这个具体问题上,组合得比较顺。

实验合理度:★★★★☆。三个公开数据集、五折交叉验证、多个强基线、再加消融实验,基本把该做的都做了,比较像一篇认真打磨过的工作。

学术研究价值:★★★★☆。它对医学图像分割里“如何更好融合跨层特征”给出了可复用思路,尤其适合边界敏感任务继续往下挖。

稳定性:★★★☆☆。结果不错,但扩散模型的迭代采样天然有成本,实际落地时还要看推理速度和不同数据源上的稳定性。

适应性以及泛化能力:★★★☆☆。在公开数据集上表现较稳,但跨医院、跨设备场景还需要更多验证,不能直接当万能药。

硬件需求及成本:★★★☆☆。训练和推理都比普通 U-Net 更重,扩散框架的采样开销不能忽略。

复现难度:★★★☆☆。作者给了代码仓库信息,方向清晰,但扩散模型训练细节和数据预处理还是会卡一部分人。

产品化成熟度:★★★☆☆。适合研究验证和辅助分析,若要进临床流程,还得补速度、鲁棒性和跨域泛化测试。

可能的问题:方法有效,但扩散采样成本和跨域泛化仍是硬门槛;如果后续能做轻量化和更强域适应,实用性会更上一层楼。


主要参考文献

[1] Gu J, Shen C, Cao Y, Zhang W, Li Y, Fan A. MLFFM-SegDiff: A Multi-Level Feature Fusion Diffusion Model for Skin Lesion Segmentation. arXiv:2606.26712v1, 2026.
[2] 代码仓库:https://github.com/Qacket/MLFFM-SegDiff
[3] ISIC2018 / PH2 / HAM10000 公开数据集相关说明见论文正文。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
想和一群爱啃论文的朋友边聊边卷,就来扫码集合吧 🤘
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。