← 返回 PaperDaily 视觉与图像

安徽大学SCDT:统一去噪框架,专治RGB-T跟踪模态缺失

医生看病是逐步问诊、看检查单、更新诊断假设的过程,但现有的AI评估全是单轮问答,完全不接地气。这篇论文搞了一个1089例真实病例的多轮诊断基准,把15个模型按真实临床流程从头考到尾。结果发现推理模式反而帮倒忙,医疗微调在小模型上有用、大模型反而没优势。想了解AI在临床诊断中到底几斤几两?这篇必须读。

原论文信息如下:
论文标题:
Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
发表日期:
2026年7月 (arXiv:2607.25933v1, 28 Jul 2026)
发表单位:
Duke-NUS Medical School, Singapore; Weill Cornell Medicine, New York, NY, USA; 等

多轮多模态诊断:现有评估框架的致命缺陷

你看过医生吗?
真实的诊断从来不是一锤子买卖。病人进门,医生先问症状,开检查单;拿到CT报告后,再结合化验结果,修正初步判断;遇到疑难杂症,可能还要请会诊、做病理、回头看病史……每一步都是新信息的涌入与假设的迭代。这种逐步推进、不断修正的认知过程,是临床诊断的核心,也是人类医生经过多年训练才掌握的技能。
但现在的多模态大语言模型(MLLMs)评估,是怎么做的呢?
绝大多数基准测试,扔给模型一段完整的病史、影像报告、实验室数据,然后问:“这是什么病?”——一次回答,盖棺定论。这种单轮问答模式完全忽略了诊断过程中信息逐步披露的动态特性,也测不出模型在信息不完整时做出合理假设、在获得新证据后修正错误的能力。
这根本不是看病,是开卷考试。
现实中的诊断是 多轮、多模态、渐进式 的信息融合过程。医生需要记住前面回合的信息,更新自己的假设,哪怕最初的猜测错了也要能回头。而传统的单轮问答评估,完全测不出模型在这方面的能力。一个模型可能在静态医学问答上拿高分,却在面对逐步披露的信息时彻底跑偏——先入为主的错误诊断、对前后矛盾的检查结果视而不见、或者把影像中的正常结构当成病灶。
更关键的是,绝大多数评估只看最终答案对不对,从不关心推理过程是否可靠。一个胡乱蒙对的诊断跟一个逻辑严密但答案不完美的诊断,在分数上毫无区别。这种“结果导向”的评估方式,无法区分模型是真的理解了病例,还是仅仅靠统计关联猜对了答案。在临床场景中,推理过程的可靠性往往比最终答案更重要——一个错误的推理过程即使偶然得出正确诊断,也无法在后续治疗中提供有价值的指导。
这就是现有评估框架的致命缺陷:它测的不是医生,是背书机器。
为了真正衡量MLLMs在临床场景下的诊断推理能力,来自杜克-新加坡国立大学医学院、康奈尔大学、卡内基梅隆大学等机构的研究团队,构建了一个大规模的、多轮多模态的诊断评估基准——ClinMM-Bench。这篇论文一出,直接补上了领域内一块关键拼图。

ClinMM-Bench:覆盖8个专科的最大规模基准

ClinMM-Bench这个名字,全称是 Clinical Multi-Modal Benchmark(临床多模态基准)。它从 PubMed Central Open Access (PMCOA) 病例报告中精心挑选了1089个极具挑战性的真实临床案例,附带了3760张医学影像,涵盖8个专科:放射科(679例,占比最高)、肿瘤科(114例)、神经科(98例)、皮肤科(63例)、眼科(60例)、肾内科(29例)、急诊科(23例)和内科(23例)。这个专科分布反映了真实临床中不同科室的病例报告数量差异,放射科占比最高是因为影像学检查在诊断中扮演核心角色,病例报告也最丰富。
每个病例都按照真实的诊断流程,拆解为平均5.45轮的多轮对话。在第一轮,只给出现有评估中常见的典型症状和基础检查;后续每轮逐步披露更多的影像、病理结果、实验室数据,要求模型必须动态更新诊断假设。并且,每个病例都提供了“金标准”诊断以及一份专家书写的参考诊断推理过程。这个参考推理过程由资深临床医生撰写,详细列出了从症状到最终诊断的完整逻辑链条,为后续的推理质量评估提供了黄金标准。
这个设计有两点特别值得龙哥提一下:
第一,所有案例都来自已发表的病例报告,本身就属于“疑难杂症”——在常规临床记录中很少见的、诊断价值极高的病例。这保证了基准的难度和区分度。如果使用常见病、多发病,所有模型都能轻松应对,基准就失去了评估意义。
第二,每轮的披露信息都是经过严格去标注化处理的——原始病例中的最终诊断、影像解读结论等绝对不能在早期对话中出现,只能通过病历描述(如“进行了CT扫描”但没有结果)和图片本身的视觉线索来推进推理。这模仿了医生只看片子、不看报告的场景。这种设计迫使模型必须依靠自身的视觉分析能力和临床知识来做出判断,而不是简单地复述报告中的结论。
为了保障数据质量,研究团队开发了一套基于大语言模型的质量控制流程(提示词见原文补充信息G),对每一个转化后的病例进行信息准确性评分(1-5分),只有评分合格的案例才纳入基准。具体来说,质量控制流程会检查:每轮披露的信息是否与原始病例一致、去标注化是否彻底(即早期轮次是否泄露了后续信息)、多轮对话的逻辑是否连贯。这种严谨的流程在同类工作中相当少见,确保了基准的可靠性和可重复性。
目前ClinMM-Bench是业界已知的最大规模的多轮多模态临床诊断评估基准。相比之下,之前一些尝试构建多轮诊断数据集的工作,要么规模太小(如只有几十个病例),要么没有公开代码或数据,无法被社区复现和使用。ClinMM-Bench的公开不仅填补了规模上的空白,也为后续研究提供了可复现的评估标准。

双层次评估:解锁诊断准确性与推理质量

光有一个好的基准还不够,还得有一套靠谱的评估方法。ClinMM-Bench提出了一个双层次评估框架,分别衡量模型的诊断准确性诊断推理质量。这两个层次相互补充,共同描绘出模型在临床诊断中的真实能力画像。
诊断准确性采用双大语言模型共识评分(dual-LLM consensus scoring):让两个不同的LLM(例如GPT-4和Claude)独立对模型的最终诊断打分(0-2分:0=完全错误/无关,1=部分正确,2=完全正确),只有两个大模型达成一致时才确认分数,否则由人工裁决。这比单一大模型自评要客观得多,因为不同模型有不同的训练数据和偏置,同时出错的可能性较低。人工裁决环节进一步保障了评分的准确性,特别是在一些边界案例上。
诊断推理质量则通过原子事实分解(atomic fact decomposition)来量化。具体来说,将模型生成的推理过程拆解成单个不可再分的临床事实声明(比如“患者有发热症状”、“影像显示右下肺结节”),然后对照参考诊断推理过程,统计三个互补指标:
事实召回率(Fact Recall):模型正确识别出的参考事实占所有参考事实的比例,衡量推理的完整性。高召回率意味着模型没有遗漏关键临床信息。
幻觉率(Hallucination):模型生成的、但参考推理中不存在的临床事实的比例,衡量推理的可靠性。低幻觉率意味着模型不会编造不存在的检查结果或症状。
事实密度(Fact Density):模型生成的原子事实总数除以推理文本长度,衡量推理的效率——同样一句话里包含了多少有用信息。高密度意味着模型能够简洁地表达关键信息,而不是用冗长的废话填充。
这个双层次设计非常巧妙:你可能最终诊断对了,但推理过程全是幻觉(比如明明没有提到某个检查结果,模型自己脑补出来了);也可能推理很完整但最后结论偏了——这两种情况在临床上都不可接受。ClinMM-Bench把它们分开量化,才能给出更全面的画像。例如,一个模型可能在诊断准确性上得分很高,但幻觉率也高,说明它虽然猜对了答案,但推理过程不可靠,这在临床上是危险的。另一个模型可能诊断准确性一般,但推理过程完整且幻觉率低,说明它虽然没能得出正确诊断,但至少没有编造信息,更适合作为辅助工具。
论文在评估15个代表性多模态大语言模型时,涵盖四类模型:闭源商业模型(Claude-4.5-Sonnet、Gemini 3 Pro、GPT-5系列)、开源通用模型(Gemma-3 4B/27B、LLaMA-4-Scout、Qwen3-VL 4B/8B/32B)、开源推理模型(Qwen3-VL 的 thinking 版本)、以及开源医学专用模型(MedGemma 4B/27B)。这种分类覆盖了当前主流的多模态模型生态,使得评估结果具有较好的代表性。

模型表现大比拼:谁在真实临床诊断中更胜一筹?

先说核心结论:没有一个模型能打
在诊断准确性方面(0-2分制),GPT-5-medium以1.140的平均分拔得头筹,Gemini 3 Pro(1.038)和GPT-5-minimal(1.031)紧随其后。但这三巨头的最佳水平也只是刚刚过1分——意味着平均下来每个病例只能拿到“部分正确”的评分。换句话说,即使是最先进的模型,在大多数病例中也只能给出一个大致方向正确的诊断,无法精确到具体疾病。
再看完全正确的比例:GPT-5-medium最高,也才33.88%。也就是说,三分之二的疑难病例,最强模型都搞不定。而开源模型更惨,唯一超过10%完全正确率的是Qwen3-VL-32B(11.20%)。LLaMA-4-Scout虽然部分正确率高达54.36%,但完全正确率仅8.82%——典型的“知道个大概,但讲不出细节”。这种“部分正确率高、完全正确率低”的模式说明,模型在区分相似疾病时存在困难,比如能够识别出是肺部感染,但无法区分是细菌性肺炎还是真菌性肺炎。
模型规模对性能的提升是确定的。在Gemma系列中,从4B到27B,诊断准确率从0.435提升到0.591;Qwen3-VL非推理系列从4B到32B,准确率从0.551提升到0.718。不过,这个提升远不如在NLP任务中那么显著,说明临床诊断推理的复杂性对模型规模有更高的“阈值”要求。可能的原因是,临床诊断不仅需要语言理解能力,还需要视觉感知、多模态融合和逻辑推理等多种能力的协同,单纯增加参数规模并不能线性提升这些能力。
不同专科的难度差异极大。神经科和眼科是模型的“强项”,平均得分接近0.95,而放射科和内科最难,分别只有0.646和0.665。龙哥猜测这可能是因为神经科和眼科的影像特征相对明确(如MRI病灶、视网膜病变),而放射科和内科的病例往往需要整合更多类型的检查结果(CT、病理、生化报告等),对跨模态推理的要求更高。此外,放射科病例数量最多(679例),其中包含的复杂病例也更多,拉低了平均分。
在推理质量方面,GPT-5-medium的事实召回率最高(0.599),但它的幻觉率也较高(0.111),仅次于Gemini 3 Pro的最佳幻觉率0.085。值得注意是,LLaMA-4-Scout虽然准确性不高,但事实密度最高(0.431),说明它在有限的文字里塞进了较多有用信息,只是没能正确整合出最终诊断。这种现象提示我们,模型的“信息提取能力”和“信息整合能力”可能是两个相对独立的能力维度,需要分别优化。
两个对比实验特别有意思:

通用模型 vs 医学微调模型

研究对比了Gemma-3系列和医学专用版MedGemma系列。在4B小模型上,MedGemma-4B在大多数专科中显著优于Gemma-3-4B,尤其在肾内科(+0.241)和急诊科(+0.174),并且完全错误率全面降低。这说明医学领域自适应对小型模型确实有效,能补上不少领域知识的短板。小模型由于参数有限,通用知识储备不足,医学微调可以针对性地补充临床知识,效果立竿见影。
但到了27B规模,情况反过来了:MedGemma-27B在肾内科、神经科和放射科反而落后于Gemma-3-27B,在其他科室的提升也趋近于零。这表明领域微调对大模型的边际收益递减,甚至可能因为微调数据集的偏差而损害泛化能力。大模型本身已经通过海量预训练积累了丰富的医学知识,额外的微调可能引入过拟合,导致模型在微调数据覆盖的领域表现更好,但在其他领域反而退步。

非推理模式 vs 推理模式

研究对比了Qwen3-VL系列在普通模式和“思维链”推理模式下的表现。结果出乎不少人的意料:推理模式并没有稳定提升诊断准确性。在4B规模,推理版甚至全面落后;在8B规模,提升只体现在急诊、肾内科、肿瘤科和眼科,在皮肤科、神经科和放射科反而下降;在32B规模,推理版在大多数专科都更差,尤其在肾内科下降了0.224分。
推理质量的指标同样不乐观:所有规模下,推理模式的事实召回率反而降低(-0.032~-0.060),幻觉率升高(+0.018~+0.034)。换句话说,链式思考让模型说了更多的话,但反而引入了更多错误信息。这个发现对当前“推理越多越聪明”的流行观点是一个有力的警示。在数学和代码等逻辑密集型任务中,思维链确实能提升性能,但在需要多模态信息整合的开放领域诊断中,不加约束的“长思考”可能导致模型在错误的方向上越走越远。
当然,这里需要指出:Qwen3-VL的推理模式是模型自带的功能,可能不如其他专用推理模型(如o1、o3)那样经过深度优化。但即便如此,这个结果也值得整个领域反思——在医学这类高风险领域,单纯的“想更多”不等于“想更准”。未来的研究需要探索如何让推理过程更加结构化、可控,而不是简单地让模型自由发挥。

错误模式分析:模型诊断困难的五个关键陷阱

论文对模型的错误进行了系统分类,归纳出五种典型的失败模式。龙哥觉得这部分对AI医疗落地的指导意义可能比分数本身更大:
1. 信息综合失败(Information Synthesis Failure):模型能够理解单个模态的信息(比如读懂CT报告、看懂病理图片),但无法将它们整合成一个连贯的诊断。例如,模型可能同时正确识别了影像上的肿瘤和实验室检查中的异常指标,但却推导出这两个发现彼此无关的错误结论。这种失败模式在需要跨模态推理的病例中尤为常见,比如同时涉及影像学和实验室检查的病例。
2. 知识映射错误(Knowledge Mapping Error):模型虽然掌握了足够的医学知识,但无法将观察到的事实映射到正确的疾病上。比如,知道“胸腔积液、淋巴结肿大、发热”这些表现,却没想到——或者想到了不敢确认——结核的可能性。这种错误类似于医学生的“书本知识无法联系临床”,说明模型缺乏将抽象知识与具体病例关联的能力。
3. 感知错误(Perception Error):模型对影像、病理切片的视觉解读出现偏差。这是多模态模型特有的问题——把正常结构识别为病灶,或者忽略了关键的微小病变。感知错误在放射科和皮肤科等依赖视觉判断的科室中尤为突出,说明当前模型的视觉感知能力还远未达到临床要求。
4. 过早闭合(Premature Closure):模型在信息尚不充分时就断定了一个诊断,后续出现矛盾证据也无法纠正。这是最接近人类“认知偏差”的一种失败模式——第一印象太强,后期无法推翻。在多轮对话中,这种错误尤其致命,因为模型需要在每一轮中根据新信息更新自己的判断,但过早闭合的模型会忽略或曲解后续信息以维持最初的诊断。
5. 视觉幻象(Visual Hallucination):模型在图像中“看到”并不存在的信息。例如,CT图像上根本没有钙化灶,但模型在推理中声称“可见钙化灶”。这种错误比感知错误更严重,因为模型不仅看错了,还编造了不存在的发现,可能导致完全错误的诊断方向。
这五种错误揭示了当前MLLMs在临床诊断中的核心短板:不是知识的匮乏,而是推理的整合与修正机制不足。特别是“过早闭合”和“视觉幻象”,几乎可以类比人类医生的常见误诊原因,这说明模型在模仿人类推理模式的同时,也继承了人类的缺陷。未来的研究需要针对这些错误模式设计专门的改进方案,比如引入“假设验证”机制来对抗过早闭合,或者使用外部视觉模型来减少幻觉。

未来方向:如何构建可信赖的AI诊断系统?

ClinMM-Bench给出了一面清晰的镜子,照出了当前MLLMs在临床诊断中的真实水平。龙哥认为,未来的发展方向应该聚焦在以下几个方面:
增强跨轮记忆与假设修正能力:当前模型“过早闭合”的普遍存在,说明它们缺乏主动质疑自己早期判断的机制。可以借鉴人类诊断中的“锚定与调整”启发式,显式地在模型训练或提示中引入假设验证模块。例如,可以设计一个“假设跟踪器”,记录模型在每一轮中提出的诊断假设及其置信度,并在后续轮次中根据新证据自动调整。
提升感知与推理的交互:视觉幻象和感知错误表明,模型对医学影像的理解与文字推理之间存在脱节。未来可能需要更紧密的跨模态注意力机制,或者引入专门的影像分析模块(如分类器、分割模型)作为“外部工具”来减少纯粹端到端带来的幻觉。例如,可以先用一个专门的影像分析模型提取关键特征,再将这些特征输入到语言模型中进行推理。
构建更丰富的多轮训练数据:ClinMM-Bench目前还只是评估基准,不是训练数据集。如果能够将类似的真实病历转化为大规模的多轮训练语料,并设计专门强化模型“信息逐步披露→假设更新”能力的训练目标,可能会带来显著提升。例如,可以设计一个“诊断推理强化学习”框架,让模型在多轮对话中通过试错学习如何更好地整合信息。
引入不确定性量化:在推理质量评估中,事实召回和幻觉率的矛盾说明模型缺乏自知之明——它不知道哪些信息是确定的、哪些是推测的。如果模型能在输出中显式给出置信度(比如“根据影像,80%可能是炎症”),将对临床决策更有参考价值。不确定性量化还可以帮助医生判断何时应该信任模型的输出,何时需要进一步检查。
最后,龙哥想强调:ClinMM-Bench的价值不在于给模型排名,而在于暴露了“性能天花板”和“失败模式”。它告诉我们——即便最先进的GPT-5-medium,在面对三分之二的高难度临床案例时也无法给出完全正确的诊断。这既是对AI能力的清醒认知,也是激励研究社区继续投入的信号。未来的AI诊断系统,需要从“单轮问答”走向“多轮对话”,从“结果导向”走向“过程可解释”,才能真正在临床中发挥作用。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:ClinMM-Bench的病例来自PubMed病例报告,这些病例本身是否就偏难?会不会导致模型分数普遍偏低?A:确实,从病例报告筛选的案例本身就属于“疑难杂症”,比日常门诊更能测试模型的深度推理能力。但这恰恰是基准存在的意义——如果所有模型都在简单病例上得高分,就无法区分优劣。ClinMM-Bench故意拉高难度,专门测试“极端条件下的诊断能力”,与真实临床中专家会诊的场景更接近。此外,论文也提供了每个病例的难度标签,方便研究者根据需求选择不同难度的子集进行评估。

Q2:论文中使用的“双大模型共识评分”会不会有偏差?比如两个LLM都同意一个错误结论?A:论文让两个不同厂家的大模型独立打分(例如GPT和Claude),只有在两者一致时才采信;不一致时由人类专家裁决。由于两个基础模型的训练数据和偏置不同,同时出错的可能性较低。但这仍然不是100%可靠——如果人类专家本身也犯了和模型同样的错误呢?这属于评估方法论中尚未完美解决的问题。目前的做法已经是医疗AI评估中最严谨的方案之一,而且论文还提供了人工抽查的结果,显示双LLM评分与人工评分的一致性达到了较高水平。

Q3:推理模式(thinking)反而表现更差,这个结论会不会仅限于Qwen3-VL系列?换成o1或者Claude的推理模式会不会不同?A:论文只评估了Qwen3-VL的thinking版本,没有测试o1、Claude-4.5-Sonnet的推理模式。所以目前结论应该限定在Qwen3-VL系列。但即便如此,这个发现也足够警示——推理模式不是万能药。它在数学、代码等逻辑密集型任务上有效,但在需要多模态信息整合的开放领域诊断中,不加约束的“长思考”反而可能带偏模型。未来的研究需要比较不同推理模式在医学诊断中的表现,探索哪些类型的推理策略更适合临床场景。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

首次系统性地构建了大规模多轮多模态诊断基准,提出了双层次评估框架(准确性+推理质量),并在15个模型上做了全面分析。创新点集中在“评估范式”层面,方法论本身虽非突破性创新,但填补了领域空白,有很高的工程价值。

实验合理度:★★★★✰

对比模型覆盖了闭源/开源、普通/推理、通用/医学四大类,规模够大。双LLM共识评分减少了评估偏差。不过,所有推理模型只用了Qwen3-VL系列,缺少其他推理模型的对比(如o1、Claude reasoning),结论的泛化性稍弱。

学术研究价值:★★★★★

这是目前最接近真实临床诊断场景的评估基准。它提供的错误模式分析对后续研究有直接的指导意义。未来任何想提升MLLMs临床诊断能力的团队,都必须参考ClinMM-Bench的结果。

稳定性:★★★✰✰

基准本身的数据构建过程严谨(质量控分高),稳定性好。但作为评估工具,它依赖的评分机制(双LLM共识)会对结果稳定性造成一定影响——更换评估LLM可能导致分数波动。不过论文已经开源了数据和方法,可复现性有保障。

适应性以及泛化能力:★★★★✰

覆盖了8个专科,涵盖影像、病理、检验等多种模态,适应面足够宽。但病例全部来源于英文病例报告,对非英语场景(如中文病历、不同国家的医疗惯例)的泛化性未知。

硬件需求及成本:★★★★✰

评估所调用的15个模型覆盖不同参数规模,成本差异较大。但基准本身的使用成本很低:只需要输入多轮对话文本和图片,调用现成的LLM API即可完成评估。对于研究团队来说,不需要额外硬件投入。不过,如果要对全部15个模型做一遍完整评测,API调用费可能不小。

复现难度:★★★★✰

论文已公开数据集和评估代码(见原文链接),复现难度较低。但注意:双LLM评分需要接入外部大模型API,并且评分的一致性可能受到API版本变化的影响。不过,只要按照说明运行,应该可以复现主要结果。

产品化成熟度:★★✰✰✰

这是一个评估基准,本身不是产品。但它的价值在于帮助开发者定位模型在临床诊断中的弱点,从而指导产品改进。直接作为产品使用不现实。未来可以将其嵌入模型训练流程作为训练时奖励信号,但需要大量工程适配。

可能的问题:推理模式对比只用了Qwen3-VL系列,结论缺乏对其他推理模型的验证;数据仅来自英文病例报告,不同国家和地区医疗实践的差异未覆盖;另外,双LLM共识评分虽然比单模型好,但两个LLM本身也可能存在共同偏置(例如都倾向于某种诊断风格),需要更多的人工抽查来保障。


主要参考文献

Yang, R., Xuan, W., Lin, Y., et al. Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases. arXiv:2607.25933v1, 2026.
PubMed Central Open Access (PMCOA) dataset. https://www.ncbi.nlm.nih.gov/pmc/tools/oa-service/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
对临床AI诊断评估感兴趣?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 医疗AI+上海+某某医院+医生),根据格式备注,可更快被通过且邀请进群。
本群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融等5个群,等你来聊!
wechat_helper
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。