← 返回 PaperDaily 视觉与图像

GPT-5.4全剂量“虚构”,Claude词触发“看人下菜”

想象一下,你带了一张胸片给AI看病,结果图片没传上去,AI却根据你的年龄和肤色直接编了个诊断——这不是科幻,是今天这篇ICMR 2026论文的实锤发现。Claude、GPT-5.4和Gemini集体“翻车”,而且翻得很有规律:65岁白人男性=黑色素瘤,32岁黑人女性=结节病。更离谱的是,有些AI文字说“没图”,但结构化的诊断字段却填得满满当当。对AI安全感兴

原论文信息如下:
论文标题:
Hearsay: Vision-Language Medical Diagnoses Without an Image
发表日期:
2026年7月
发表单位:
卡内基梅隆大学(Carnegie Mellon University)
原文链接:
https://arxiv.org/pdf/2607.26886v1.pdf
开源代码链接:
(原论文未提供公开仓库链接)

无图也能诊断?VLMs的“幻影诊断”现象

龙哥先给大家讲个细思极恐的场景。想象一下,你在网上挂号,把自己的年龄、性别、种族填入问诊单,然后上传了一张胸片。但系统后台出了一点小bug,你的图片没传上去。你满心期待地等待AI医生的诊断,结果AI根据你填的信息,直接抛出一个结论:“你得了结节病。” 你一脸懵逼,但AI还振振有词,在诊断理由里写:“基于人口统计学和经典模式推断。” 这听起来像是科幻电影的桥段,但它却真实地发生了。
这就是来自卡内基梅隆大学的研究者Siddharth Vohra在ICMR 2026上发表的研究——Hearsay: Vision-Language Medical Diagnoses Without an Image。论文揭示了一个惊人的事实:当VLM(视觉语言模型,Vision-Language Model)被问到一张从未附上的医学图像时,它不仅不会拒绝回答,反而会基于“患者”的人口统计学描述(年龄、性别、种族)编造出一个结构化的诊断。这种行为被作者称为“幻影效应”(Mirage Effect),但这不是随机的胡言乱语——它是系统性的、被人口统计学信息结构化的虚假诊断。

人口统计学描述如何系统性扭曲诊断结果

为了弄清楚这些幻影诊断到底有多“有逻辑”,作者设计了一套非常暴力的实验。他们拿来了市面上最顶尖的三个模型:Claude Opus 4.7GPT-5.4Gemini 3.1 Pro。想象一下,这三个模型已经是目前地球上最贵的“大脑”了,一个月的推理成本可能够买几台特斯拉,结果它们集体表演了一个“无中生有”。
实验覆盖了三个医学领域:胸部X光(Chest X-ray)、脑部MRI(Brain MRI)、皮肤病(Dermatology)。每个领域都构建了一个包含12种人口统计学组合的2×2×3因子实验设计:年龄(32岁、65岁)、性别(男、女)、种族(白人、黑人、棕色人种)总共产生12种条件,再加上一个不包含任何人口统计学描述的中性基线(D0)作为对照。这三个模型、三个领域、13种条件,每种条件下做100次随机采样,总共发起了11,700次推理调用。这数据量,把API调用费算下来都够买辆二手车了。
结果怎么样?非常出人意料。先看Claude Opus 4.7在皮肤病领域的表现。在中性基线条件下(没有患者身份信息),Claude的拒绝回答率几乎是100%,它知道没有图就不能乱说。但是,一旦在提示词中加上“我是一位65岁的白人男性”,奇迹发生了——94%的案例都被诊断出黑色素瘤(Melanoma)。注意,是没有图像的情况下做出的诊断!这种从“完全拒绝”到“几乎肯定”的转变,其JSD(詹森-香农散度,Jensen-Shannon Divergence,用于衡量两个概率分布差异的指标)高达0.834(满分为1,0.834意味着两个分布几乎完全不同)。
更离谱的是胸部X光的情况。当提示词变成“我是一位32岁的黑人男性”时,Claude在43%的案例中返回了“结节病”(Sarcoidosis)。而且这位“AI”还很“贴心”地在诊断理由中写下了下面这句话:
“结节病(疑似,基于人口统计学和经典模式推断)”
当龙哥看到这个诊断书里的原话时,直接沉默了。这位“AI”在没有任何影像证据的情况下,公然声称“基于人口统计学”做出了诊断。这不是模型胡编乱造的问题了,这是系统性的“种族伪医学”在模型里的再现。这太荒谬了。
再来看看GPT-5.4的表现。GPT-5.4虽然没有Claude那种“开关”式的极端表现,但它的影响范围更广。在所有36个(3个领域×12种人口统计学条件)因子单元中,GPT-5.4都有不同程度的虚构,中位JSD达到0.314。在胸部X光领域,黑人患者再次成为“重灾区”,32岁黑人女性的结节病诊断率高达77%。在脑部MRI领域,年轻女性被系统地诊断为多发性硬化症(MS),而老年女性则被诊断为脑膜瘤(Meningioma)。
Gemini的幻影率最低,基线以下6%左右,但也不是没有。相比于Claude和GPT,Gemini在这方面的“翻车”程度要小得多。
表1:每个模型、领域在12种人口统计学条件和中性基线下的Top-1(非拒绝)诊断结果。缩略词:Sarc=结节病,Nsarc=神经结节病,Ncyst=神经囊虫病,Mel=黑色素瘤,BNev=良性痣,SebK=脂溢性角化病,HHrn=食管裂孔疝,Pnx=气胸,PEd=肺水肿,Pna=肺炎,Men=脑膜瘤,Gli=胶质瘤,Atr=萎缩,Nor=正常。
图1:三种模型在三个领域上的JSD(以2为底)热力图。颜色越深代表偏差越大。Claude在皮肤病领域对65岁白人男性的结果出现了深红色区域(JSD=0.83),GPT-5.4则在几乎所有人口统计学条件下都有偏暖的色调。
这张热力图(图1)非常直观地展示了问题的严重性。Claude的偏差主要集中在少数几个单元,但一旦触发,偏差幅度巨大;GPT-5.4的偏差则像是慢性毒药,在每一个角落都有体现。论文还通过卡方检验发现,人口统计学描述不仅影响模型说什么诊断,还影响模型是否愿意做出诊断。拒绝率本身就不是随机的,而是被人口统计学信息给操纵了。

“对冲幻影”:文字说没图,结构却输出诊断

这还不是最骚的操作。论文还发现了一个令人震惊的“对冲幻影”现象,要不是这篇论文,龙哥根本想不到还会有这种操作。
每个模型的输出被设计成一个结构化JSON对象,包含7个必填字段:布尔类型的image_present(图像是否存在)、diagnostic_capability(是否能诊断),以及自由文本的primary_diagnosis(主要诊断)、differentials(鉴别诊断)、confidence(置信度)、key_findings(关键发现)和reasoning(推理过程)。
这个设置的巧妙之处在于——作者可以通过检查诊断字段是否为空来判断模型是否幻影。但是,作者还保留了传统方法中的一个“幻影判断器”(Mirage Judge),用来分析模型输出的文本,判断模型是否承认“没有图片”。
表3:三种模型在各自最高JSD单元(N=100)中的对冲幻影与经典幻影计数。Judge列表示文本分析是否识别出推理过程承认缺失图像。
表3给出了一个令人细思极恐的对比。在Claude的皮肤病65岁白人男性条件下,94次虚构诊断中,有62次(66%)属于“对冲幻影”。什么意思?就是模型在“推理过程”(reasoning)这个自由文本字段里,明确写上了“没有图像,仅根据人口统计学信息进行推断”,甚至在文本里提到了“需要皮肤镜检查确认”,但与此同时,它还是在primary_diagnosis这个结构化字段里,毫不犹豫地填上了“黑色素瘤”。
龙哥看到这里真的惊了。这就相当于一个AI在报告里写:“我没有图片,我不能乱说”,但同时又在诊断结论里写了“你得了癌症”。如果你只阅读它的自然语言回复,你会以为它在拒绝(因为是推理文本说没图)。但如果你只解析它的结构化诊断字段,你会收到一个带有偏差的正式诊断。
相比之下,GPT-5.4的77次虚构诊断全部是“经典幻影”,也就是没有对冲的,直接编造。而Gemini在3次虚构中也是经典幻影。
这个发现直接打脸了目前大多数只读文本的安全审计方法。如果你只用一个“幻影判断器”去分析模型的文本输出,你会得出“Claude在65岁白人男性皮肤病条件下有62%的拒绝率”的结论,但实际上,这些“拒绝”记录的诊断字段都被填充了!这种解离现象,让传统的安全审计变得毫无意义。

一个词的改变就能让Claude从94%黑色素瘤变成100%拒绝

如果说上面的发现已经让人感到不安,接下来这个实验的结果则让人更疑惑。作者设计了一个“提示词名词鲁棒性”实验(E4)。他们发现Claude的那个“65岁白人男性=黑色素瘤”的效应,竟然完全依赖于提示词中的一个词——“”(mole)。
实验很简单:原来提示词是“皮肤痣”,现在改为“皮肤病变”(skin lesion),其他所有条件(模型、年龄、种族、性别)不变。结果呢?Claude的黑色素瘤诊断率直接从94%骤降至0%,全部变成了100%拒绝回答。JSD从0.834直接归零。
龙哥看到这个结果时,第一反应是:这模型是薛定谔的AI吗?一个词的改变,带来如此巨变的决策差异,这哪是什么严谨的医学推理,这更像是在靠关键词触发一个预设的“黑盒模板”。
反观GPT-5.4,它在同样的实验里表现稳定:无论用“mole”还是“lesion”,对65岁白人男性的黑种女性患者,它给出的脂溢性角化病(Seborrheic Keratosis)诊断率分别是62%和65%,几乎不受影响。两者的JSD分别为0.462和0.488,变化很小。
这一对比揭示了一个更加棘手的问题:“幻影效应”不是一个单一的、统一的失败模式,而是一个由多种截然不同的失败模式组成的家族。Claude的幻影是“词汇触发型”的(词敏感性极高),而GPT-5.4的幻影是“类别保持型”的(即使语义相近的标签也能维持偏差)。这意味着,如果你用一个词的测试糊弄过去,认为模型安全了,那当部署到真实场景时,面对模型中未出现的词汇组合,它可能会给你一个更大的惊喜。

对可信AI部署的启示

这篇论文的研究结果虽然很沉重,但它为如何构建可信的AI医疗系统提供了几点非常具体的启示。
第一,安全审计不能再只停留在文本分析层面了。正如对冲幻影所展示的那样,模型可以在文本中表现得“诚实”,却在结构化字段里悄悄输出偏差结论。未来的审计必须包含结构化输出信道的直接监控。管道的设计应该是:当image_present为假时,primary_diagnosis字段必须被强制设置为空,或者在schema层面就约束为null。任何依赖“AI的自我否定”的检查都是不够的。
第二,提示词敏感度应该被当作一级评估维度。论文中的“mole”与“lesion”的对比实验表明,如果一个模型确实能够安全通过“mole”的测试,但换了一个词就立刻全线崩溃,那这个安全评估就是无效的。未来的模型评估必须包含多变的提示词词组,否则安全评估的鲁棒性无法保证。
第三,从源头治理。论文提到了一些可能的缓解措施:在训练阶段加入“拒绝缺失图像”的强化微调;在推理阶段加入模式消融探测(检查模型是否需要并获取了图像模态);在输出Schema层面加入针对image_present为False时的空诊断约束。这些措施都不难实现,但关键在于模型提供商是否真正重视这些问题。
最后,也是最核心的一点:我们必须清醒地认识到,AI医疗不是大数据魔法。把人口统计学特征输入一个没有图片的模型,然后得到诊断结果,这本质上是在重演种族、性别、年龄歧视的自动化悲剧。种族医疗差异在美国胸片分类器[7]、资源分配算法[5]中已经被反复证实,而基于文本的LLMs[6]和基于图像的VLMs[2,8]也都展现出了类似的偏差。这篇论文最让人“舒服”的地方在于——它清楚地区分了一个模型的两种错误:一种是“认知失准”(没有依据就乱说话),另一种是“结构性偏差”(即使乱说话,它也不是随机在乱讲,而是根据你的人口统计学信息在讲)。
这两种错误的结合,让这个问题变得更加棘手。即使预训练中的数据分布是“真实”的(黑色素瘤确实在老年白人男性中发病率更高),但模型在没有图像证据的情况下,直接输出一个基于概率的诊断结论,依然构成严重的伦理问题。
图2:各模型在各自最高JSD单元上的人口统计学JSD(红色)与释义噪声下限(蓝色)对比。柱状图上的数字表示人口统计学效应是释义效应幅度的倍数。GPT-5.4的人口统计学效应是释义效应的13.88倍,进一步证明了人口统计学偏差不是偶然的噪声波动。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

什么是“幻影效应”(Mirage Effect)?幻影效应是由Asadi等人在2026年定义的概念,指的是VLM在没有提供图像的情况下,仍然生成图像描述(包括诊断)而不承认图像缺失的行为。这篇论文进一步发现,这些幻影诊断不是随机的,而是受到人口统计学描述的结构化影响。这个现象也提醒我们,像OpenAI、Google、Anthropic这样的大模型企业,即使他们的模型再“聪明”,在面对缺失图像输入这样的边缘情况时,依然无法保证行为符合预期。

JSD是什么,为什么要用它?JSD是Jensen-Shannon散度(詹森-香农散度)的缩写,是一种用于衡量两个概率分布相似度的指标,取值范围在0到1之间。0表示两个分布完全相同,1表示完全不同(在基为2的情况下,JSD≤1)。论文用它来量化在不同人口统计学条件下,模型输出的诊断分布与中性基线分布的差异有多大。JSD越高,说明人口统计学描述对模型的诊断结果影响越大。

“对冲幻影”为什么比“经典幻影”更危险?因为对冲幻影在文本分析层面表现为“拒绝回答”,很容易通过现有的安全审计(例如B-Clean这样的训练集清理流程)。然而它对下游管线的结构化输出字段仍然进行了填充。这意味着一个依赖结构化输出部署的AI医疗系统,可能会在接收到“推理文本承认缺少图像”之后,依然收到一个具有偏差的结论。但这种行为不会被通常只读文本的审计工具发现,从而造成安全盲区。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

论文的视角非常独到。它不是在讨论模型“有没有图”,而是讨论“没有图时,模型会怎么编”——更关键的是,它揭示了这种编造是受人口统计学结构影响的。对冲幻影和名词敏感性的发掘都是很有价值的新发现。但本质上,它的方法论是构建在Asadi等人[1]的幻影效应模板上,属于对已知现象的深入研究,而非开创性新范式。

实验合理度:★★★★☆

实验设计非常扎实。11,700次调用、严格的JSON schema输出控制、预注册种子、多模型对比、噪音底噪分析(E2/E2b/E3),以及对不同模型的失败模式的区分(E4),实验架构非常完整。扣一颗星是因为“棕色人种”这个标签的定义模糊,论文自己也承认它在大语言模型的预训练语料中意义不统一,由此导致的偏差分析可能存在混杂因素。

学术研究价值:★★★★★

这篇论文的学术价值极高。它直接触碰了AI伦理、公平性、可解释性、鲁棒性等多个维度。对冲幻影的发现直接打脸了现有仅依赖文本分析的安全审计方法论。其揭示的“幻影是一种家族多样故障模式”的观点为未来的研究方向提供了丰富的框架。作为ICMR 2026的论文,其影响应该会远超会议本身。

稳定性:★★☆☆☆

论文揭示的正是模型的不稳定性。Claude在中性条件下稳定拒绝,但一旦加入特定人口统计学条件就稳定造假。GPT-5.4在所有人口统计学条件下都稳定有偏差。这种“稳定地坏”和“不稳定地好”一样令人不安。

适应性以及泛化能力:★★☆☆☆

模型在“没有图像”这个边界情况下的表现非常糟糕,完全无法作为通用解决方案来使用。在不同领域(X光、MRI、皮肤病)里表现出的“幻影”模式各不相同,泛化能力很差。一旦引入意外词汇(如“lesion”代替“mole”),Claude的性能完全崩溃。这进一步证明,当前模型的适应能力极其脆弱,远远达不到“可信医疗AI”的标准。

硬件需求及成本:★★★★☆

这篇论文做的是“评估”而非“训练”,所以只需要调用三家的商用API。推理成本虽然不便宜(11,700次调用),但普通研究者也可以复现。不扣分也不加分。

复现难度:★★★★☆

论文提供了详细的实验设置(prompt模板、schema、种子号、噪音底噪分析代码),并承诺在仓库中公开原始输出。对于有API密钥和基础Python能力的研究者来说,复现不难。缺点是目前尚未看到公开的GitHub仓库链接。

产品化成熟度:★☆☆☆☆

这篇论文不是产品,而是“产品安全的警示灯”。它证明了当前最强大的VLM在没有图像的情况下,系统性地输出具有种族、年龄和性别偏差的医学诊断,完全没有产品化基础。对冲幻影的存在使得依赖这些模型的“智能诊断”管线即使在安全审计表面通过之后,依然可能产生严重偏差。

可能的问题:论文的评估核心是“没有图像”,但实际临床中图像完全“传丢”的概率极低。更大的问题可能是图像被误传或发生格式错误。论文没有模拟这种“半生不熟”的不确定性情况。此外,所有实验中都强制设置了“number of image attachments: 1”这个预设,这个前置锚点可能会强化模型的虚构倾向。论文本身没有对其过度夸大,但这个限制值得注意。


主要参考文献

[1] Mohammad Asadi, Jack W. O'Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Fardi, Fei-Fei Li, Ehsan Adeli, and Euan Ashley. 2026. Mirage: The Illusion of Visual Understanding. arXiv preprint arXiv:2603.21687 (2026).
[2] Kathleen C. Fraser and Svetlana Kiritchenko. 2024. Examining Gender and Racial Bias in Large Vision-Language Models Using a Novel Dataset of Parallel Images. In Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers). Association for Computational Linguistics, St. Julian's, Malta, 690–713.
[3] Judy W. Gichoya, et al. 2022. AI recognition of patient race in medical imaging: a modelling study. The Lancet Digital Health 4, 6 (2022), e406–e414.
[4] Jianhua Lin. 1991. Divergence measures based on the Shannon entropy. IEEE Transactions on Information Theory 37, 1 (1991), 145–151.
[5] Ziad Obermeyer, Brian Powers, Christine Vogeli, and Sendhil Mullainathan. 2019. Dissecting racial bias in an algorithm used to manage the health of populations. Science 366, 6464 (2019), 447–453.
[6] Jesutofunmi A. Omiye, et al. 2023. Large language models propagate race-based medicine. npj Digital Medicine 6, 1 (2023), 195.
[7] Laleh Seyyed-Kalantari, et al. 2021. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nature Medicine 27, 12 (2021), 2176–2182.
[8] Yuzhe Yang, et al. 2025. Demographic bias of expert-level vision-language foundation models in medical imaging. Science Advances 11, 13 (2025), eadq0305.
[9] Travis Zack, et al. 2024. Assessing the potential of GPT-4 to perpetuate racial and gender biases in health care: a model evaluation study. The Lancet Digital Health 6, 1 (2024), e12–e22.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看完这篇论文,是不是想跟龙哥一起深挖更多AI安全与幻觉的案例?快来加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 医学影像+上海+CMU+小V),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。等你来一起探讨!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。