← 返回 PaperDaily 视觉与图像

把CT、胃镜、化验单喂给AI后,胃癌诊断AUC涨了6个点

胃镜、CT、化验单、报告,医生从来不是单看一样就下结论。Gastric-X把这个真实逻辑搬进了AI基准:四期CT+内镜+生化指标+报告全部对齐,还配了2.6万条VQA。想让医疗VLM真正学会"综合判断",这份基准值得一读。

把CT、胃镜、化验单喂给AI后,胃癌诊断AUC涨了6个点
原论文信息如下:
论文标题:
Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis
发表日期:
2025年(CVPR 2026录用)

发表单位:
上海交通大学医学院附属瑞金医院、深圳大学、剑桥大学、上海交通大学、南京市第一医院

原文链接:
https://arxiv.org/abs/2603.19516

开源数据集链接:
https://huggingface.co/datasets/HaoChen2/Gastric-X
平常我们去医院,医生看胃癌从来不是只盯一张片子:先看CT上肿瘤长在哪里、浸润多深,再看胃镜里黏膜的颜色和质地,还要翻化验单上的肿瘤标志物,最后结合报告综合下结论。多模态信息在大脑里对齐,这就是临床推理的日常。
但现在的医疗视觉语言模型(VLM)离这个日常还有不小的距离。大多数数据集只给一张X光片配一句报告,模型学到的往往只是"看图说词"的粗浅关联,根本没法模拟医生那种把多种证据链揉在一起做判断的推理过程。Gastric-X这篇工作,就是冲着这个缺口来的。

胃癌诊断的AI困境:为什么现有医疗VLM不够用?

图1
Gastric-X数据集的多模态信息总览。中间面板展示胃部示意和内镜图像,左侧是结构化实验室数据(血常规、血清生化、肿瘤标志物)和临床文本报告,右侧是四期三维CT扫描(平扫、动脉期、静脉期、平衡期)及多类别病灶标注(肿瘤、胃周癌、胃区域)。
胃癌在全球范围内每年导致超过76.9万人死亡,是消化系统最凶险的恶性肿瘤之一。它难诊断的原因在于:早期症状不明显,等到发现往往已经进展;而确诊又高度依赖多模态证据——多期相CT看浸润和转移,胃镜看黏膜细节,活检病理做最终确认,血液生化指标辅助判断全身状态。这些信息在医生脑子里被整合成一个完整的诊断决策链。
问题在于,现有的医疗视觉语言模型数据集远没有反映这种真实工作流。早期的MIMIC-CXR、CheXpert、PadChest等基准都聚焦于二维X光胸片配文本报告,模式相对单一。虽然MedVL-CT69K和3D-RAD已经开始探索三维CT体积理解,但仍然以图像-报告匹配为主,很少把生化检验、内镜图像、多期相动态扫描这些胃癌诊断的关键信息放在一起。
这就导致一个尴尬的局面:VLM在自然图像上表现出色,到了医学领域却变成了"偏科生"。它们看到的只是冰山一角,自然学不会那种"看完CT再看化验单、最后综合判断"的临床推理能力。Gastric-X要做的,就是把这块缺失的拼图补上。
表1
医疗视觉语言数据集综合对比。多期相指扫描/图像在不同阶段或条件下采集;生化数据指结构化实验室测量或电子健康记录(EHR);病灶标签指病灶标注(掩膜或边界框);文本模态指文本标签的提供形式;VQA对列标注数据集是否主要面向视觉问答设计;报告列标注是否提供原始诊断报告。

Gastric-X数据集:四大模态如何还原真实临床诊断流程?

Gastric-X共包含1740例胃癌病例,每一例都完整对齐了四大模态的信息,这正是它和此前所有医疗VLM数据集拉开差距的地方。
第一模态是四期三维CT扫描。平扫、动脉期、静脉期、平衡期四个阶段分别捕捉造影剂在胃壁血管中的动态通过过程,每一期都提供不同的增强特征。放射科医生正是通过对比这些阶段的信号差异来判断肿瘤的血供特征和组织浸润。Gastric-X共有7100份CT扫描,总计83480张切片,覆盖了完整的动态增强过程。
第二模态是内镜图像。1700张高分辨率胃镜图像提供了CT看不到的黏膜细节:细微的褶皱扭曲、颜色变化、微血管结构异常,这些往往是早期恶性病变的线索。
第三模态是结构化生化数据,包含11项血清生化指标和5项常用胃癌肿瘤标志物,外加134项覆盖手术、用药、治疗进程的电子健康记录(EHR)。这些化验单数据在胃癌分期和预后判断中不可或缺——肿瘤标志物水平直接反映肿瘤负荷和进展状态。
第四模态是临床文本报告。每个病例都配有三份互补的报告:CT报告描述病灶形态、强化模式和分期印象;内镜报告记录黏膜表现、颜色和活检发现;诊断报告汇总病理确认和临床结局。这还不够,研究者还在此基础上构建了26760条视觉问答(VQA)对,把叙述性的临床观察转化为结构化的推理任务。
除了四大模态,病灶标注同样做到了临床级别的精细。每个CT期相都提供三个层次的3D边界框:肿瘤核心、区域淋巴结、整个胃部区域。四期扫描、1740名患者、每个患者三期框,总计21408个边界框,支持多尺度的病灶分析。
数据集还提供详细的TNM分期标注。TNM系统通过评估原发肿瘤(T)、区域淋巴结(N)和远处转移(M)三个维度来刻画疾病进展程度,最终决定总的分期。这些标注与影像、生化和报告全部对齐,让模型可以学到真实的分期推理逻辑。
图2A
图2A:按性别统计的总分期分布(男性67.5%,女性32.5%)。
图2B
图2B:5种肿瘤标志物在对数尺度下的分布。
图2D
图2D:T、N、M分期向总分期转化的Sankey图。

五个核心任务:从视觉问答到病灶定位的全面评测

有了数据,怎么评测?Gastric-X设计了五个覆盖临床工作流关键环节的任务,从基础的视觉理解一直延伸到多层次决策支持。
第一个任务是视觉问答(VQA)。模型需要根据图像、表格和边界框等输入回答临床问题。VQA评测使用精确率(Precision)、准确率(Accuracy)、F1分数和ROC曲线下面积(AUC)四个指标综合衡量模型的推理能力。
第二个任务是报告生成。模型基于多模态输入自动生成结构化诊断报告,用ROUGE-L(评估生成文本与参考文本的n元语法重叠和最长公共子序列)、BLEU-4(基于4元语法的精确匹配)、METEOR(综合考虑同义词和词形变化的匹配)、BERTScore F1(基于语义嵌入的相似度)四个指标,从句法覆盖到语义保真度全面量化生成质量。
第三个任务是跨模态检索。包含图像到文本和文本到图像两个方向,评测模型是否真正建立了视觉特征和语言特征之间的语义桥梁——如果模型只是死记硬背了训练数据,在检索任务上会表现得非常糟糕。
第四个任务是疾病分期分类。这是临床决策中最关键的一环,使用Precision、Recall、F1和AUC四个指标评估模型对TNM分期和总分期的判别能力。
第五个任务是病灶定位。这是评测体系里最"硬核"的一项——模型必须给出病灶的精确位置,采用COCO评估协议下的AP(平均精度)和F1来度量。病灶定位直接检验VLM是否真正"看懂了"CT影像里的解剖结构和病变区域,而不仅仅是学会了相关文字。
图3
图3:VLM适配示意。视觉编码器接收多期相CT输入,化验表格、文本查询和病灶定位线索作为多模态补充输入引导模型的诊断推理。

多模态融合的威力:实验结果揭示了什么?

为了系统评估多模态融合的价值,研究者选择了六个有代表性的VLM:通用域的LLaVA-1.5-7B、BLIP-2、X²-VLM,以及医学域的LLaVA-Med v1.5、Med-Flamingo、Med-VInT。针对三维多期相CT输入,每一个模型都做了适配处理。例如,X²-VLM的视觉编码器被替换成3D Swin Transformer,文本编码器换成Med-BERT,适配后的模型称为X²-VLM-Med。不同CT扫描的体素分辨率被统一重采样到256×256×160或288×288×192,方便模型处理。
CT体积输入维度
CT体积输入的统一重采样维度示例:256×256×160和288×288×192,分别对应不同原始分辨率扫描的标准化处理结果。
实验设计了四种输入配置来模拟临床中从简到繁的信息获取过程:只给图像(Image Only)、图像加化验表格(Image+Table)、图像加边界框(Image+BBox)、全部模态组合(Image+Table+BBox)。所有模型都在同一张NVIDIA RTX 3090上微调,使用AdamW优化器,学习率5e-5,数据集按患者级别划分训练/验证/测试(70/15/15)。
如何在保持模型结构不变的前提下引入化验表格?答案出人意料地巧妙。研究者模仿临床医生的习惯:拿到化验单先看异常值。数值超过生理阈值的异常检验结果被提取出来,转成包含检验名称、测量值、超出正常限倍数的文本描述符,再作为额外文本输入喂给模型。这样既保留了关键生化信息,又避免了把几十项无关正常值全部塞给模型造成干扰。
在VQA任务上,X²-VLM-Med的AUC从图像单模态的85.3%一路提升到全模态配置的91.5%,提升超过6个百分点。Med-Flamingo稳居第二,展现出医学域预训练的优势。
表2a
表2(a):视觉问答任务在四种输入模态配置下的性能对比。Prec.:精确率,Acc.:准确率,AUC:ROC曲线下面积。每列最好和次好结果分别用加粗和下划线标注。
报告生成任务上,BERTScore F1从68.7提升到82.0。ROUGE-L、BLEU-4、METEOR三项指标同样一致上涨,说明输入模态的丰富化带来的不是单一指标的偶然上涨,而是生成质量全面的、可复现的提升。
表2b
表2(b):报告生成任务在四种输入配置下的性能对比。评测指标包括ROUGE-L(R-L)、BLEU-4(B-4)、METEOR(MTR)和BERTScore F1(BS-F1)。
跨模态检索任务更能说明问题:X²-VLM-Med在图像到文本方向R@1达到48.9%,文本到图像方向达到47.5%,大幅领先其他模型。排名第二的Med-Flamingo也展现了不错的跨模态对齐能力。反过来看,LLaVA-1.5-7B这类通用模型没有专门做检索适配,排名靠后,说明通用VLM直接迁移到医学检索场景还有不小差距。
表4
表4:跨模态检索结果。分别报告图像到文本和文本到图像两个方向的Recall@K(%,越高越好)、中位秩和平均秩(越低越好)以及平均精度均值(mAP)。
在疾病分期分类任务中,Transformer架构的优势非常明显。Swin Transformer大幅领先ResNet-50这类卷积网络,说明分层自注意力能更好地建模长距离依赖和空间尺度变化。而X²-VLM-Med在所有配置上都取得了最好的结果,在Image+Table+BBox配置下AUC比第二名Swin高出1.6个百分点。
表5
表5:疾病分期分类结果。评估每种配置下的精确率、召回率、F1分数和AUC。加粗和下划线数字分别表示每列最好和次好表现。
病灶定位任务上,Swin Transformer相比Faster R-CNN有明显提升,AP@0.5从64.1提升到68.9。经过医学多模态预训练的Med-VInT更进一步,AP@0.5达到72.1,mAP达到50.2,展现了跨模态预训练对空间推理能力的促进作用。X²-VLM-Med则是在大多数指标上稳定领先。
表6
表6:病灶检测结果。指标为平均精度(AP)和F1。mAP表示在IoU阈值0.50到0.95范围内(步长0.05)的平均AP,定位准确率(Loc. Acc.)在IoU=0.5下计算。
雷达图直观展示了三种输入配置的综合表现。Image+Table+BBox配置在所有评估指标上形成最外圈,说明多模态融合带来的提升是全方位的,不是靠牺牲某一项能力换来的。
图4
图4:三种医学视觉语言任务上多模态配置的雷达图对比。Image+Table+BBox配置在所有评估指标上表现最佳。
awesome and shock
一个有趣的现象是:在验证集上,X²-VLM-Med在图像单模态输入下的AUC已经达到85.3%,这个数字已经超过了很多只做单模态CT分析的专用模型。而加上异常化验指标文本描述符后,性能进一步提升到88.7%;再加上渲染到CT切片上的边界框彩色叠加层,最终达到91.5%。这说明化验指标和病灶先验位置信息之间确实存在互补关系,模型能学会在不同证据之间做交叉验证,而不是简单地把输入堆在一起。

数据集的构建细节:从VQA对生成到临床验证

26760条VQA对不是凭空自动生成的。研究者系统性地评估了不同提示策略对生成问答对质量的影响,并由两位临床医生独立验证生成的问答对是否有效。Table 7展示了这一验证结果:不同的提示策略生成的问题有效性差异显著,最高效的策略需要仔细设计才能保证临床层面的实用性。这个细节说明Gastric-X的标注不只是"量大",更强调"医生的认可"。
表7
表7:不同提示策略生成临床有效VQA问题的效果对比。Validity表示两位临床医生共同确认为有效的问答对占比。
134项结构化生化变量同样经过了严格筛选和脱敏处理(De-ID),覆盖手术记录、用药历史、治疗进程等维度。值得一提的是,Gastric-X的病例来自真实临床工作流,而非经过人工筛选的"干净"数据。这意味着模型在训练时就要面对真实世界中诊断信息不完整、模态质量参差不齐等挑战,训练出的模型也更具临床实用价值。
表8
表8:Gastric-X数据集中134项结构化生物医学变量的完整清单(De-ID表示已去标识化处理)。

未来展望:Gastric-X将如何推动医疗VLM发展?

Gastric-X最大的价值在于:它把医疗VLM的评测标准从"图像-文本匹配"拉高到了"多模态临床推理"的层级。以前我们问模型"这张CT有没有肿瘤",现在可以问"结合CT、胃镜和肿瘤标志物,这位患者的TNM分期是多少,推荐什么治疗方案"。这种推理能力恰恰是临床决策支持系统最需要的。
不过也要客观指出局限。目前Gastric-X聚焦于胃癌单一癌种,虽然病例量有1740例,但放到真实临床场景中,数据的多样性、地域覆盖和中心效应还需要进一步验证。另外,评测中的基线模型大多基于通用VLM做修改而来,专门的医学3D多期相VLM架构仍然是一个开放问题。
可以预见的是,Gastric-X会促使更多研究者关注"多模态信息如何真正参与临床推理"这个核心问题。当模型学会像医生一样,在CT的每一个期相、在内镜图像的每一处纹理局部、在化验单的每一个异常值之间建立证据链时,医疗AI距离"可用"又近了一步。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?面向胃癌分析的多模态视觉语言基准Gastric-X发布,整合多期CT、内镜、生化指标与诊断报告四大模态,覆盖1.7K病例;系统性评测六类主流VLM在五项临床任务上的表现,多模态融合驱动AUC升至91.5%。
这篇工作最值得看的点是什么?X2-VLM-Med在所有任务上均取得最优性能,且随着多模态信息增加(Image→Image+Table→Image+BBox→Image+Table+BBox),所有模型性能一致提升,验证了多模态融合的有效性。
这篇工作的边界或风险在哪里?优点:(1) 数据集设计紧密结合临床实践,多模态信息丰富;(2) 五个任务覆盖临床诊断全流程;(3) 提供了详细的VQA对构建流程和验证机制。缺点:(1) 数据集规模相对较小(1.7K病例);(2) 对多模态融合机制的分析不够深入;(3) 缺乏与临床医生诊断性能的直接对比。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

构建一个包含多期CT、内镜图像、生化指标和临床报告的多模态胃癌数据集Gastric-X,并设计五个临床任务(VQA、报告生成、跨模态检索、疾病分类、病灶定位)系统评估VLM性能。

实验合理度:★★★★☆

VQA任务:Precision、Accuracy、F1、AUC;报告生成:ROUGE-L、BLEU-4、METEOR、BERTScore F1;跨模态检索:Recall@K、MedR、MnR、mAP;

学术研究价值:★★★★☆

构建一个包含多期CT、内镜图像、生化指标和临床报告的多模态胃癌数据集Gastric-X,并设计五个临床任务(VQA、报告生成、跨模态检索、疾病分类、病灶定位)系统评估VLM性能;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确报告具体FLOPs,所有模型在单张NVIDIA RTX 3090 GPU上训练。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 数据集规模相对较小(1.7K病例);(2) 对多模态融合机制的分析不够深入;(3) 缺乏与临床医生诊断性能的直接对比。

主要参考文献

[1] Lu S, Ba J, Chen H, et al. Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis. CVPR 2026. https://arxiv.org/abs/2603.19516
[2] Gastric-X数据集(HuggingFace开源): https://huggingface.co/datasets/HaoChen2/Gastric-X
[3] Liu H, Li C, Wu Q, et al. LLaVA-1.5: Visual Instruction Tuning. NeurIPS 2024.
[4] Li J, Li D, Savarese S, et al. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. ICML 2023.
[5] Moor M, Huang Q, Wu S, et al. Med-Flamingo: a Multimodal Medical Few-shot Learner. NeurIPS 2023.
[6] Zhou H, et al. X²-VLM: All-in-one Pre-trained Model for Vision-Language Tasks. IEEE TPAMI 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看CT、读内镜、查指标、写报告——医生靠"多模态"下诊断,AI也该如此。刚发布的Gastric-X把这条临床路径铺成了基准,想让医疗VLM学会综合判断?欢迎进群和龙哥一起拆解医疗AI前沿!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 AI医疗+上海+瑞金医院+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。