← 返回 PaperDaily
视觉与图像
UFES新作:图像+表格Mamba做癌症分类
这篇工作最有意思的地方,不是单纯把Mamba搬进医疗场景,而是把图像和表格信息拆成两段来处理,既保留了诊断流程的直觉,又把解释性补了回来。PAD-UFES-20和NDB-UFES两套数据都跑了,结果不算“碾压”,但在召回率和可解释性上确实有看头。
龙哥读论文
发布于 2026-08-14 21:47:09
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇工作最有意思的地方,不是单纯把Mamba搬进医疗场景,而是把图像和表格信息拆成两段来处理,既保留了诊断流程的直觉,又把解释性补了回来。PAD-UFES-20和NDB-UFES两套数据都跑了,结果不算“碾压”,但在召回率和可解释性上确实有看头。
原论文信息如下:
这篇工作最有意思的地方,不是“又把一个新模型塞进医疗数据里”,而是把医疗诊断里最现实的那点事讲明白了:先看图,再看病史,最后再下结论 。听起来朴素,做起来却很难。因为一旦把图像和表格信息一股脑混在一起,模型往往分不清谁在说话,解释性也会跟着一起糊成一锅粥。
这正是这篇论文想解决的问题:多模态医学数据怎么融合,才能既有诊断效果,又不把解释性彻底牺牲掉 。它没有继续迷信“把所有特征堆进一个大网络就完事了”,而是把视觉信息和表格信息拆成两段处理,再用一种叫 Mixed Fusion 的方式接起来。这个思路很像医生的工作流:先看影像形成初步判断,再结合病史、年龄、行为习惯等信息修正结论。比起纯“黑箱式拼接”,这条路线明显更像临床现场。
Mamba来救场:多模态医学数据融合的新思路
先把背景说人话。医学多模态任务的难点,不只是“数据多”,而是“数据长得不一样”。图像负责呈现病灶外观,表格负责提供年龄、病史、生活习惯等补充线索。单看图像,容易漏掉临床上下文;单看表格,又容易把视觉证据放跑。传统做法通常在中间层把两类信息融合,但这样虽然方便,解释起来却像把几种菜倒进一个锅里,最后很难说清哪一口是辣的,哪一口是咸的。
这篇论文引入的主角是 Mamba 。Mamba 是一种基于状态空间模型的序列建模架构,英文全称是 Selective State Space Model ,中文可以理解为“选择性状态空间模型”。它火起来的原因很直接:它想保留 transformer 那种强表达能力,但把代价更高的注意力块换成了更省的序列建模方式 。简单说,就是少花点算力,别动不动就把显存烧成烟花。
在图像侧,论文没有直接把原版 Mamba 生搬硬套,而是用了两个面向视觉任务的变体:MambaVision 和 VMamba 。前者更像“注意力 + 状态空间”的混合路线,后者则强调二维视觉建模。它们的任务很明确:先把病灶图像变成类别概率,再把这些概率作为后续融合的输入之一。换句话说,图像分支先给出一个“初判”,后面的表格分支再来“复核”。
在表格侧,论文用了面向结构化数据的 Mamba 变体:Mambular 和 MambAttention 。这里的逻辑也很实用:结构化临床数据往往有类别型、数值型、缺失值、异构字段等问题,传统神经网络处理起来并不轻松。Mambular 先把类别变量编码、数值变量做周期性线性编码,再送进卷积和状态空间模块;MambAttention 则是在此基础上再叠加注意力结构。它们的目标不是“把表格变成图像”,而是让表格信息也能被序列建模吃进去。
这套组合拳的关键,不在于“用了多少新名词”,而在于它把多模态融合的时机改了。传统早融合容易把不同模态硬塞进同一个输入空间,晚融合又可能错过模态间的细粒度协同;这篇论文采用的 Mixed Fusion 更像是“先让图像分支做一次预判,再把预判概率和表格信息一起交给第二个分类器”。这样做有两个好处:第一,流程更接近医生思考;第二,解释性更容易落地,因为中间那一步概率本身就能被当成可解释信号来看。
混合融合(Mixed Fusion)如何让决策过程透明化
Mixed Fusion 的设计其实很“临床”。它不是把所有信息平铺直叙地扔给一个大模型,而是模拟了诊断中的两阶段决策:第一阶段看图像,第二阶段结合补充信息修正判断 。内部分类器先根据图像输出每个类别的概率,这些概率不只是中间产物,还会被当作一种“视觉证据摘要”传给外部分类器。外部分类器再把这些概率和临床/社交人口学变量拼接,生成最终结果。
这一步的妙处在于,模型不再只是“说结论”,而是能留下中间证据。比如某个病例最终被判成恶性,外部分类器不仅能利用年龄、病史、部位等信息,还能利用图像分支对各类别的初始概率。这样一来,后续用 SHAP(Shapley Additive Explanations,夏普利加性解释 )做解释时,就能更清楚地看到:到底是图像概率在起主导作用,还是临床变量把天平推过去了。
论文这里还有一个值得点出的工程细节:它没有把解释性当成“事后贴标签”,而是让架构本身就支持解释。很多医疗 AI 的问题都出在这里——模型跑得挺快,结果也挺像那么回事,但一问“为什么”,就开始装哑巴。Mixed Fusion 至少在结构上给了解释工具一个合理入口,这比单纯在黑箱末尾硬塞一个解释器要靠谱得多。
实验用了两个公开医学数据集。一个是 PAD-UFES-20 ,做的是皮肤病灶分类,图像来自移动设备,配套有 21 个临床和社会人口学特征;另一个是 NDB-UFES ,做的是口腔癌相关分类,图像是病理图像,外加 7 个临床/行为特征。前者样本量更大,类别更多;后者样本更少,但任务更偏“高风险筛查”,所以召回率尤其重要。
训练策略上,论文用了 holdout 划分,再在训练集上做 5 折交叉验证。内部视觉模型直接用预训练权重,外部表格模型则用 Optuna 做超参数搜索,目标是最大化 balanced accuracy,也就是 平衡准确率 。这个选择是合理的,因为医学数据常常类别不平衡,光看普通准确率很容易被“多数类幻觉”骗过去。损失函数采用加权交叉熵,优化器是 Adam,训练 150 个 epoch,早停策略也安排上了,整体算是比较标准、可复现的实验设置。
从工程角度看,这部分最值得认可的不是“调参很多”,而是它没有把外部分类器的配置写成玄学。表1把搜索空间交代得比较清楚,至少让复现者知道该往哪几个方向试。对医疗任务来说,这点很重要:如果实验设计都说不清,后面的结果再漂亮,也很难让人放心。
先说结论:这套 Mamba + Mixed Fusion 在两个数据集上的表现不算“全面碾压”,但在更符合医疗需求的指标上确实有亮点 。尤其是召回率,提升非常值得关注。原因也不难理解:Mixed Fusion 让图像分支先给出类别概率,再由表格分支修正,这种“先广撒网、再精筛查”的机制,天然更利于减少漏诊。
在 PAD-UFES-20 上,最好的 BACC 没有超过基线,说明这套方法并没有在所有指标上把老方案按在地上摩擦。这个结果其实挺真实,甚至有点“诚实得可爱”。因为 PAD-UFES-20 的基线本身就不弱,而 Mamba 在这个任务上更多体现为召回率和 AUC 的改善,而不是单点指标的绝对领先。对于皮肤病灶筛查来说,召回率往往比 BACC 更接近临床关切:漏掉恶性病变的代价,远比误报一次更高。
更关键的是,论文没有只盯着一个分数说故事,而是把 precision、recall、AUC 一起看。这里能看出 Mixed Fusion 的偏好:它更愿意把“可能有病”的样本先捞上来,代价是某些组合下 precision 未必最漂亮,但 recall 更稳。医疗场景里,这种取舍并不丢人,反而很务实。毕竟诊断系统不是刷排行榜,漏诊一次就可能出大事。
到了 NDB-UFES ,情况就更漂亮了。这里 MambaVision + MambAttention 在四项指标上都超过了基线,尤其是 BACC、Recall 和 AUC 的提升更明显。这个结果说明,Mamba 在更小、更敏感的医疗数据集上,至少没有因为“新架构不稳”而翻车,反而在多模态融合里展现出不错的适配性。对口腔癌这种高风险任务来说,召回率的提升尤其重要,因为宁可多提醒,也别把该查的人漏掉。
这组结果最值得认可的地方,在于它没有把“新模型”包装成万能钥匙。PAD-UFES-20 上并非全面胜出,NDB-UFES 上则更稳定地领先,说明 Mamba 的优势和数据规模、任务类型、模态互补性都有关系。换句话说,这不是一个“拿来就全场通吃”的方案,而是一个在合适任务上更有潜力的方案。这个判断比简单说“刷新 SOTA”要靠谱得多。
在 PAD-UFES-20 上,论文报告了多组内部视觉模型与外部表格模型的组合。最好的 BACC 来自 VMamba + Mambular,但仍略低于基线;不过 Recall、Precision 和 AUC 都有不错表现,尤其 Recall 达到 0.8110,明显高于基线的 0.7600。这个差距说明模型更倾向于把疑似病灶捞出来,符合筛查任务的实际需求。
在 NDB-UFES 上,MambaVision + MambAttention 的组合拿到了最好的综合表现,BACC 达到 0.8281,Recall 达到 0.8667,AUC 达到 0.9790,均优于基线。对小样本、多模态、强临床相关的任务来说,这种结果已经很有说服力了。至少能说明,Mamba 并不是只会在语言模型圈里刷存在感,放到医学图像+表格融合里,也能干点正事。
更重要的是,论文还给出了开源代码,项目结构也比较规整,包含数据目录、源码、结果目录、依赖文件和运行脚本。对想复现的人来说,这比“只给结论,不给路”友好得多。医疗 AI 研究里,能不能复现往往比“看起来多厉害”更重要,因为真正落地前,总得先让别人能把结果跑出来。
SHAP分析:模型到底看中了哪些特征?
如果说前面的实验回答的是“准不准”,那 SHAP 回答的就是“凭什么”。SHAP 的全称是 Shapley Additive Explanations ,中文叫“夏普利加性解释”。它的核心思想很朴素:把每个特征当成一个队友,看看它对最终预测到底贡献了多少。谁贡献大,谁就更该被写进解释里。
在 PAD-UFES-20 上,SHAP 结果显示,图像分支输出的类别概率本身就占了很重要的位置,尤其是与 SCC 容易混淆的类别概率,说明模型并不是只看表格字段,而是先对视觉证据做了内部整理。与此同时,年龄、病灶生长变化、直径、既往皮肤癌史等特征也很靠前,这和皮肤科常用的 7 点检查清单、ABCDE 规则是对得上的。也就是说,模型并没有乱学,它学到的东西大体还像个医生。
在 NDB-UFES 上,年龄分组、病灶位置、大小、性别、饮酒和吸烟等因素都排在前列。这个结果也挺符合常识:口腔癌和相关癌前病变的风险,本来就和年龄、行为习惯、病灶位置高度相关。更有意思的是,MambaVision 给出的图像概率与临床变量共同构成了更分散的解释结构,不像某些基线那样把解释压在少数几个变量上。这个“分散”,某种程度上反而更像真实诊疗:医生通常不会因为一个字段就拍板,而是把一堆线索一起拼起来。
不过也得说句实话:SHAP 能让模型“看起来更像人类”,但不等于模型真的理解了医学。它只是把模型决策里哪些输入更重要说清楚了,离“因果解释”还有距离。这个边界不能混淆。医疗场景里,解释性是加分项,不是免死金牌。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是多模态医学数据融合时“效果”和“解释性”很难同时兼顾的问题。论文用 Mamba 做图像和表格两段式处理,再用 Mixed Fusion 把两者接起来,让诊断流程更接近真实临床思路。
MambaVision、VMamba、Mambular、MambAttention 分别是什么? 前两个是面向视觉数据的 Mamba 变体,负责处理病灶图像;后两个是面向表格数据的 Mamba 变体,负责处理临床和社会人口学信息。前者输出类别概率,后者再结合这些概率做最终分类。
为什么召回率这么重要? 因为在癌症筛查里,漏诊通常比误报更危险。召回率高,意味着模型更愿意把“可能有问题”的样本先捞出来,哪怕后面还要人工复核,也比直接漏掉强得多。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
把 Mamba 引进医学多模态融合不算完全陌生,但把 Mixed Fusion 这条“先图像、后表格”的诊断流程和 Mamba 组合起来,思路是顺的,也有实际价值。
实验合理度: ★★★★☆
数据集选择、指标设置、交叉验证和超参搜索都比较规范,结果也没有硬吹全赢;PAD-UFES-20 不占优,NDB-UFES 更强,这种结论更可信。
学术研究价值: ★★★★☆
论文把“可解释的多模态医学诊断”这条线往前推了一步,尤其适合后续继续研究结构化数据与图像证据的协同建模。
稳定性: ★★★☆☆
在公开数据集上表现不错,但医学场景落地还要面对不同医院、设备和人群分布变化,稳定性不能只看单次实验。
适应性以及泛化能力: ★★★☆☆
两套数据集证明了方法有一定适应性,但仍主要集中在癌症筛查类任务,离“所有医学多模态任务通吃”还差得远。
硬件需求及成本: ★★★☆☆
Mamba 相比传统大注意力通常更省,但整体仍是深度学习训练流程,带超参搜索后成本并不低,尤其外部模型调参会吃资源。
复现难度: ★★★★☆
代码开源、数据公开、实验流程也写得比较完整,算是比较友好的复现型工作。
产品化成熟度: ★★★☆☆
作为临床辅助筛查原型是有潜力的,但要进真实产品,还需要跨中心验证、校准、鲁棒性测试和合规评估。
可能的问题: 方法思路顺,但提升并非全指标碾压;对外部数据分布变化的鲁棒性、以及解释结果的临床因果性,还需要更强验证。
主要参考文献
Matheus B. Rocha, Gustavo B. Dettogni, Renato A. Krohling. An approach with Visual and Tabular Mamba to multimodal medical data using Mixed Fusion. arXiv:2606.20738v1, 2026.
项目开源代码:https://github.com/MatheusBecali/mamba-mixed-fusion
原文链接:https://arxiv.org/pdf/2606.20738v1.pdf
Mamba不只会跑序列,还能给癌症诊断“搭桥”——图像看一眼,表格再补一刀,解释也能跟上。想继续看这种能落地、能复现、能讲人话 的AI医疗论文,欢迎来龙哥读论文星球和群里一起拆。