龙哥先给大家讲个细思极恐的场景。想象一下,你在网上挂号,把自己的年龄、性别、种族填入问诊单,然后上传了一张胸片。但系统后台出了一点小bug,你的图片没传上去。你满心期待地等待AI医生的诊断,结果AI根据你填的信息,直接抛出一个结论:“你得了结节病。” 你一脸懵逼,但AI还振振有词,在诊断理由里写:“基于人口统计学和经典模式推断。” 这听起来像是科幻电影的桥段,但它却真实地发生了。
这就是来自卡内基梅隆大学的研究者Siddharth Vohra在ICMR 2026上发表的研究——Hearsay: Vision-Language Medical Diagnoses Without an Image。论文揭示了一个惊人的事实:当VLM(视觉语言模型,Vision-Language Model)被问到一张从未附上的医学图像时,它不仅不会拒绝回答,反而会基于“患者”的人口统计学描述(年龄、性别、种族)编造出一个结构化的诊断。这种行为被作者称为“幻影效应”(Mirage Effect),但这不是随机的胡言乱语——它是系统性的、被人口统计学信息结构化的虚假诊断。
人口统计学描述如何系统性扭曲诊断结果
为了弄清楚这些幻影诊断到底有多“有逻辑”,作者设计了一套非常暴力的实验。他们拿来了市面上最顶尖的三个模型:Claude Opus 4.7、GPT-5.4和Gemini 3.1 Pro。想象一下,这三个模型已经是目前地球上最贵的“大脑”了,一个月的推理成本可能够买几台特斯拉,结果它们集体表演了一个“无中生有”。
实验覆盖了三个医学领域:胸部X光(Chest X-ray)、脑部MRI(Brain MRI)、皮肤病(Dermatology)。每个领域都构建了一个包含12种人口统计学组合的2×2×3因子实验设计:年龄(32岁、65岁)、性别(男、女)、种族(白人、黑人、棕色人种)总共产生12种条件,再加上一个不包含任何人口统计学描述的中性基线(D0)作为对照。这三个模型、三个领域、13种条件,每种条件下做100次随机采样,总共发起了11,700次推理调用。这数据量,把API调用费算下来都够买辆二手车了。
结果怎么样?非常出人意料。先看Claude Opus 4.7在皮肤病领域的表现。在中性基线条件下(没有患者身份信息),Claude的拒绝回答率几乎是100%,它知道没有图就不能乱说。但是,一旦在提示词中加上“我是一位65岁的白人男性”,奇迹发生了——94%的案例都被诊断出黑色素瘤(Melanoma)。注意,是没有图像的情况下做出的诊断!这种从“完全拒绝”到“几乎肯定”的转变,其JSD(詹森-香农散度,Jensen-Shannon Divergence,用于衡量两个概率分布差异的指标)高达0.834(满分为1,0.834意味着两个分布几乎完全不同)。
更离谱的是胸部X光的情况。当提示词变成“我是一位32岁的黑人男性”时,Claude在43%的案例中返回了“结节病”(Sarcoidosis)。而且这位“AI”还很“贴心”地在诊断理由中写下了下面这句话:
可能的问题:论文的评估核心是“没有图像”,但实际临床中图像完全“传丢”的概率极低。更大的问题可能是图像被误传或发生格式错误。论文没有模拟这种“半生不熟”的不确定性情况。此外,所有实验中都强制设置了“number of image attachments: 1”这个预设,这个前置锚点可能会强化模型的虚构倾向。论文本身没有对其过度夸大,但这个限制值得注意。
主要参考文献
[1] Mohammad Asadi, Jack W. O'Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Fardi, Fei-Fei Li, Ehsan Adeli, and Euan Ashley. 2026. Mirage: The Illusion of Visual Understanding. arXiv preprint arXiv:2603.21687 (2026).[2] Kathleen C. Fraser and Svetlana Kiritchenko. 2024. Examining Gender and Racial Bias in Large Vision-Language Models Using a Novel Dataset of Parallel Images. In Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers). Association for Computational Linguistics, St. Julian's, Malta, 690–713.[3] Judy W. Gichoya, et al. 2022. AI recognition of patient race in medical imaging: a modelling study. The Lancet Digital Health 4, 6 (2022), e406–e414.[4] Jianhua Lin. 1991. Divergence measures based on the Shannon entropy. IEEE Transactions on Information Theory 37, 1 (1991), 145–151.[5] Ziad Obermeyer, Brian Powers, Christine Vogeli, and Sendhil Mullainathan. 2019. Dissecting racial bias in an algorithm used to manage the health of populations. Science 366, 6464 (2019), 447–453.[6] Jesutofunmi A. Omiye, et al. 2023. Large language models propagate race-based medicine. npj Digital Medicine 6, 1 (2023), 195.[7] Laleh Seyyed-Kalantari, et al. 2021. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nature Medicine 27, 12 (2021), 2176–2182.[8] Yuzhe Yang, et al. 2025. Demographic bias of expert-level vision-language foundation models in medical imaging. Science Advances 11, 13 (2025), eadq0305.[9] Travis Zack, et al. 2024. Assessing the potential of GPT-4 to perpetuate racial and gender biases in health care: a model evaluation study. The Lancet Digital Health 6, 1 (2024), e12–e22.