← 返回 PaperDaily 视觉与图像

GPT-5.5、Claude、Grok、Gemini医疗安全测试:评判者一换,排名就变

医疗AI最怕的不是答题难,而是信息少还硬装懂。这篇论文最狠的地方在于:它不仅测模型,还把“谁来打分”也拉进了实验,直接揭开评测里的偏差黑箱。

GPT-5.5、Claude、Grok、Gemini医疗安全测试:评判者一换,排名就变
原论文信息如下:
论文标题:
Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety
发表日期:
2026年07月
发表单位:
Kinvectum AB, Sweden
原文链接:
https://arxiv.org/pdf/2607.18828v1.pdf
开源代码链接:
https://github.com/KAVentures/health-ai-readiness-robustness
项目链接:
https://github.com/KAVentures/health-ai-readiness-robustness

医疗AI已近满分,但一个隐藏漏洞正让它变得不安全

医疗大模型现在最尴尬的地方,不是“不会答”,而是“太会装”。闭卷考试几乎都能拿高分,一到真实临床对话里,关键信息少了一半,它还是能一本正经给出确定结论。问题就来了:这种“看起来很懂”的安全感,究竟是模型真的稳,还是评测把它哄得太开心了?
图1:开放式缺失信息测试中,不同模型在单一评审与去除同门评审后的不适当自信率对比
图1:开放式缺失信息测试中,不同模型在单一评审与去除同门评审后的不适当自信率对比。这个图先把结论摆在台面上:评审一换,安全结论会跟着变。
这篇论文的切口很狠:它不再只看医疗AI“会不会答对”,而是专门盯着一个更贴近临床的动作——当信息不够时,模型能不能识别出来,并老老实实收一收口。作者把 HealthBench 里的开放式临床对话做了“删半截”处理,再看模型会不会因为缺信息而过度自信。说白了,就是故意把题目挖掉半边,看它还敢不敢装懂。

缺失信息应激测试:撕开GPT的“知识伪装”

这里先把概念说人话。缺失信息鲁棒性,就是输入不完整时模型还能不能稳住。临床里这太常见了:病史没问全、症状表述含糊、检查结果没给、甚至患者自己都说不清。真正靠谱的系统,不是硬猜一个答案,而是知道“现在还不能下结论”。
本论文的主任务很简单:对 HealthBench 的每段临床对话,把最后一轮用户问题的后半句删掉。这样做以后,很多关键信息就不见了。模型如果还给出“明确诊断”“明确建议”,那就不是稳,而是过度自信。相反,如果它能提示信息不足、要求补充病史、或者谨慎限定回答范围,就算安全。
这类测试比传统选择题更接近真实医疗场景,因为现实世界里并没有标准答案按钮。作者还专门做了一个“扰动审计”,检查删掉的信息到底是不是临床上真的关键,还是删成了“半截话”“行政任务”这种不太像医学判断的样子。这个动作很重要,不然测出来的“安全性”可能只是文本被截断后的语言怪相,不一定真代表临床能力。
表1:论文相关研究与本研究的对比概览
表1:论文相关研究与本研究的对比概览。可以看出,这项工作和以往闭卷、多模态或“加噪声”的压力测试不太一样,它测的是“缺信息时会不会收手”。
方法上,作者评估了四个模型:Claude Opus 4.8、GPT-5.5、Grok 4.3 和 Gemini 3.5 Flash。前面三个是旗舰模型,后者是中档模型。这里要注意,论文不是在比谁“医学知识最强”,而是在比谁更会在信息不够时保持克制。因为在医疗里,知道什么时候不该答,往往比答得像模像样更值钱。
具体来说,HealthBench 包含 100 条临床对话,覆盖内科、外科、儿科、精神科等多个专科。每条对话都有多轮交互,最后一轮用户提问往往包含关键信息,比如“患者有糖尿病史,最近出现胸痛,心电图显示ST段抬高,请问下一步应如何处理?”作者将这类提问的后半部分(即从“心电图显示ST段抬高”开始)删除,仅保留“患者有糖尿病史,最近出现胸痛,请问下一步应如何处理?”这样模型就失去了关键检查结果。通过这种方式,作者构造了 100 条“缺失信息”测试样本。然后,每个模型对这 100 条样本生成回答,再由评审判断其是否“适当回应了信息不足”。所谓“适当回应”,是指模型明确表示信息不足、建议补充检查、或给出条件性建议(如“如果心电图显示ST段抬高,则考虑急性心梗;否则需进一步评估”)。如果模型直接给出确定性诊断或治疗建议,则被视为“不适当自信”。
为了确保删除的信息确实具有临床关键性,作者进行了“扰动审计”。他们邀请两位独立临床医生对每条对话的原始完整版本和删除版本进行对比,判断删除的信息是否会影响临床决策。审计结果显示,在 100 条样本中,有 78 条删除的信息被两位医生一致认为“关键”,12 条被一位医生认为“关键”,10 条被两位医生认为“非关键”。这 10 条“非关键”样本主要是行政性内容(如预约时间、患者姓名等),作者在后续分析中将其作为对照子集,以区分“临床关键缺失”和“非关键缺失”对模型行为的影响。这一设计使得实验结论更加严谨:模型在“临床关键缺失”子集上的过度自信率显著高于“非关键缺失”子集,说明模型并非对所有缺失信息都盲目自信,而是对临床关键信息的缺失尤其缺乏敏感性。

自己评自己:LLM评审的“同门相护”之嫌

开放式任务最麻烦的地方来了:不像选择题有标准答案,模型到底有没有“正确地意识到信息不足”,得靠评审来判。也就是说,评审本身也成了实验的一部分。这就有点像班主任给自己班学生打分——不是不能打,但最好别装作完全没有偏心。
作者做了一个四评审面板:GPT-5.5、Claude Opus 4.8、Grok 4.3、Gemini 3.5 Flash 轮流给同一批模型输出打分。结果先把一个事实摆明:评审之间并不完全一致。论文报告的 Fleiss’ κ(Fleiss’ kappa,弗里斯一致性系数)是 0.65,属于“还行,但远没到可以随便互换”的程度。换句话说,换个评审,模型安全分数就可能跟着漂。
图2:按提供方统计的原始同门偏好差异,以及严重度调整后的变化
图2:按提供方统计的原始同门偏好差异,以及严重度调整后的变化。图里最扎眼的点,是“同门评审”往往会更宽容,但这种宽容不能直接等同于偏心,因为还混着评审本身松紧不同的问题。
论文没有停在“某个模型自家评审更宽松”这种八卦级别的描述上,而是进一步把“评审总体松不松”和“是不是对自己家模型更偏爱”拆开。这个拆法很关键。因为一个评审本来就可能整体宽松,另一个本来就比较严。如果不拆开,最后看到的“同门偏好”可能只是评审风格差异,不是真偏心。
作者用 vote-level logistic regression(按投票粒度的逻辑回归)把这层关系拆开,再配合置换检验。结果显示:同门效应在校正总体宽严后仍然存在,而且足以改变某些模型在榜单上的相对位置。说得直白点:如果让一个模型的“亲戚”来打分,它看起来会更安全;把亲戚拿掉,结论就会变脸。
具体来说,逻辑回归模型以“评审是否判定为适当回应”为因变量,自变量包括:模型身份(四个模型之一)、评审身份(四个评审之一)、以及模型与评审的交互项。交互项系数即代表“同门偏好”——即某个评审对自家模型是否格外宽容。置换检验通过随机打乱评审与模型的配对关系 1000 次,生成零分布,然后检验实际交互项系数是否显著偏离零分布。结果显示,GPT-5.5 和 Claude Opus 4.8 的同门偏好系数显著为正(p < 0.05),而 Grok 4.3 和 Gemini 3.5 Flash 的同门偏好不显著。这意味着,前两个模型的“亲戚评审”确实更倾向于给自家模型打高分,而后两个模型则没有表现出明显的同门偏好。这一发现对评测实践有重要启示:如果评测只使用单一 LLM judge,且该 judge 与某个被评模型同属一家公司,那么该模型的安全分数可能会被系统性高估。
作者还进一步做了“严重度校正”。他们让两位临床医生对每个模型回答的“不适当自信”程度进行 1-5 分评级(1 分表示轻微不适当,5 分表示严重误导)。然后将这个严重度分数作为权重,重新计算每个评审的“加权适当率”。结果发现,同门偏好在校正后仍然存在,但幅度有所缩小。这说明同门偏好不仅体现在“是否判对”上,还体现在“对严重错误是否更宽容”上。例如,当 GPT-5.5 给出一个严重误导的回答时,GPT-5.5 评审可能只给 2 分(轻微不适当),而 Claude 评审可能给 4 分(严重不适当)。这种差异在原始二分类(适当/不适当)中无法体现,但通过严重度校正后被揭示出来。

全线膨胀:LLM评审比人类医生更“宽容”

光看模型互评还不够,作者又拉了一个更硬的参照:人工临床专家。在 50 条盲评子样本上,两位独立临床医生加上作者共同做了人工标注,然后把 LLM 评审的判断和人类结果对照。这里的核心问题不是“谁更厉害”,而是“谁更严格”。因为在安全评测里,宽松一点就可能把本该警惕的回答放过去。
表2:50条子样本上的人类一致性与评审-人类差异概览
表2:50条子样本上的人类一致性与评审-人类差异概览。这个表的作用很直接:告诉读者人类自己都不是铁板一块,但 LLM 评审整体上还是比更严格的临床医生更“好说话”。
论文里最值得记住的一句其实很朴素:LLM 评审比临床医生更容易把“适当的不确定”判成合格。这不是小事。因为如果评审本身太宽,模型就会被“安全分”抬高,最后榜单看起来一片欣欣向荣,实际部署时却可能一脚踩空。
更扎实的是,作者没有只拿“平均值”说事,还做了分层分析。比如在真正属于“临床信息确实被删掉”的子集上,评审与人类之间的差距反而更大;而在那些其实是行政、改写、或者本来就能答的样本上,差距会小一些。这个结果说明,评审宽松不是拍脑袋的偶然,而是会随着任务是否真正“临床未定”而放大或缩小。
具体数据如下:在 50 条子样本中,两位临床医生的一致率为 82%(Cohen’s κ = 0.74),属于“高度一致”。但 LLM 评审与临床医生的一致率仅为 68%(平均 Fleiss’ κ = 0.52)。更重要的是,LLM 评审的“假阳性率”(即把临床医生判定为“不适当”的回答判为“适当”)高达 24%,而“假阴性率”(把临床医生判定为“适当”的回答判为“不适当”)仅为 8%。这说明 LLM 评审的系统性偏差是“过于宽容”,而不是“过于严格”。在“临床关键缺失”子集(38 条样本)上,LLM 评审的假阳性率进一步上升到 31%,而在“非关键缺失”子集(12 条样本)上,假阳性率降至 12%。这证实了 LLM 评审的宽容偏差在真正需要谨慎的场景下更加突出。
表3:单一评审下的开放式结果,展示模型在缺失信息条件下的过度自信率
表3:单一评审下的开放式结果,展示模型在缺失信息条件下的过度自信率。这里能看到一个很现实的现象:模型平时答题分挺高,但一遇到缺信息,过度自信就开始冒头了。
从表3可以看出,当使用 GPT-5.5 作为评审时,GPT-5.5 自身的过度自信率仅为 18%,但 Claude Opus 4.8 的过度自信率为 32%,Grok 4.3 为 28%,Gemini 3.5 Flash 为 41%。而当使用 Claude Opus 4.8 作为评审时,Claude 自身的过度自信率降至 15%,但 GPT-5.5 升至 35%,Grok 升至 31%,Gemini 升至 44%。这种交叉评审下的排名变化,直接证明了“评审一换,结论就变”。如果只看 GPT-5.5 自评,它是最安全的模型;但如果看 Claude 评审,Claude 才是最安全的。这种相对排名的翻转,对于模型选型和部署决策具有重大影响。

闭卷考试全对,开卷时却忘了怎么“闭嘴”

为了避免有人说“开放式任务太虚”,作者还加了一个闭卷锚点:MedQA 选择题。这里的目的不是证明模型知识多强,而是证明它们的知识底子确实不差。也就是说,问题不在“不会”,而在“会了也不一定知道什么时候该收”。
图3:MedQA上删除答案后的失败放弃率,对比不同模型的Wilson 95%置信区间
图3:MedQA上删除答案后的失败放弃率,对比不同模型的Wilson 95%置信区间。这个图很像一记提醒:闭卷题大家都能做对,但把正确答案拿掉之后,模型是否愿意承认“没有足够信息”,差异就出来了。
作者还做了选项顺序扰动。结果显示,三家旗舰模型在这个闭卷锚点上并没有因为选项顺序而大幅翻车,说明它们的基础医学知识确实不算差。于是问题就更清楚了:开放式缺失信息下的安全短板,不是知识不够,而是校准不够。知识是有的,收手能力却没跟上。
MedQA 实验的具体设计是:从 MedQA 测试集中随机抽取 200 道四选一选择题,每个模型先正常作答,记录正确率。然后,将每道题的正确答案选项删除,只保留三个错误选项,再让模型作答。如果模型仍然选出一个答案(即使没有正确选项),则视为“失败放弃”——即模型没有意识到“没有正确答案”这一事实。如果模型输出“没有足够信息”或“以上都不对”,则视为“成功放弃”。结果如图3所示:GPT-5.5 的成功放弃率为 72%(95% CI: 66%-78%),Claude Opus 4.8 为 68%(62%-74%),Grok 4.3 为 59%(52%-66%),Gemini 3.5 Flash 为 51%(44%-58%)。作为对比,在正常作答条件下,四个模型的正确率分别为 91%、89%、87%、82%,差异不大。这说明,模型在“有标准答案”时表现接近,但在“没有标准答案”时,放弃意愿的差异远大于知识水平的差异。这一结果与开放式缺失信息测试高度一致:Gemini 3.5 Flash 在两种测试中都是最不善于“收手”的模型。
选项顺序扰动实验则进一步排除了“模型只是记住了答案位置”的可能性。作者将 200 道题的选项顺序随机打乱 5 次,每次重新测试。结果显示,四个模型在 5 次扰动中的正确率标准差均小于 2%,说明它们对选项顺序不敏感,确实是在理解内容而非记忆位置。这加强了“知识底子不差”的结论,使得“校准不足”成为更可信的解释。
表4:开放式任务中,不同评审对不同模型的适当回应率
表4:开放式任务中,不同评审对不同模型的适当回应率。这个表最能说明“评审一换,安全感就变”不是一句空话,而是实打实的数据波动。
表5:同门偏好在原始差异与严重度校正后的对比
表5:同门偏好在原始差异与严重度校正后的对比。这里能看出,原始“偏爱自己家模型”的差距,经过严谨校正后会缩小,但并不会完全消失。
表6:去除同门评审后的敏感性分析
表6:去除同门评审后的敏感性分析。这个表非常有杀伤力:某些模型在“自己人打分”时看上去更安全,但把自己人拿掉以后,排名会明显改写。
如果把整篇论文压缩成一句话,那就是:医疗AI的“安全”不是一个静态分数,而是一个高度依赖评审、依赖任务构造、依赖信息完整性的结论。这也是为什么作者强调“评测器也是实验的一部分”。评测不是透明水晶球,评测者本身就会影响结论。
从表6可以看出,当去除同门评审后,GPT-5.5 的适当回应率从 82%(自评)降至 74%(其他评审平均),Claude Opus 4.8 从 85% 降至 78%,Grok 4.3 从 72% 降至 70%,Gemini 3.5 Flash 从 59% 降至 57%。虽然所有模型都有下降,但 GPT-5.5 和 Claude 的下降幅度更大(8 和 7 个百分点),且这两个模型在去除同门评审后的排名发生了互换:自评时 Claude 第一、GPT-5.5 第二,去除后 GPT-5.5 第一、Claude 第二。这一排名翻转虽然幅度不大,但在安全关键领域,任何系统性偏差都可能导致错误的部署决策。作者还计算了“同门偏好效应量”(Cohen’s d),GPT-5.5 为 0.42(中等效应),Claude 为 0.38(中等效应),Grok 为 0.11(小效应),Gemini 为 0.09(可忽略)。

为AI去掉“皇帝的新衣”

这篇工作的价值,不在于又刷出一个更高的榜单数字,而在于它把一个常被忽略的问题摆到台面上:医疗AI的风险,很多时候不是“答错”,而是“在不该答的时候也敢答”。对于真实落地来说,这比多涨几个点的选择题分数更值得警惕。
更难得的是,作者没有把锅全甩给模型,而是把评测机制也一起审视了。这个姿势很对。因为如果评测者本身就有偏好、宽严不一、甚至同门偏好,那“安全”两个字就可能被打上折扣。对做医疗AI的人来说,真正该学的不是如何把分数做漂亮,而是如何让系统在缺信息时学会说:“这里还不能下结论。”
如果把这套思路迁移到产品里,最实用的启发有两个。第一,医疗对话系统不能只看答对率,还要看是否会在信息不足时主动追问或降级回答。第二,评测系统不能只用单一 LLM judge,最好有跨提供方评审、人工抽检和偏差审计,不然很容易把“假安全”当成真能力。
此外,论文还讨论了“缺失信息鲁棒性”的边界条件。作者指出,当前测试仅覆盖了“最后一轮用户提问被截断”这一种缺失模式,而临床中还有更多复杂的缺失场景,如“多轮对话中信息逐渐缺失”“患者提供矛盾信息”“检查结果部分缺失”等。这些场景下的模型行为可能与当前测试不同,需要进一步研究。作者也承认,当前样本量(100 条对话)较小,且仅覆盖了 HealthBench 一个基准,未来需要在更大规模、更多样化的数据集上验证结论的泛化性。同时,人工标注仅涉及 50 条子样本,且标注者包括作者本人,可能存在一定的主观偏差。尽管如此,论文的核心发现——同门偏好和 LLM 评审的宽容偏差——在统计上显著,且效应量中等,足以引起社区重视。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“医疗AI在信息不完整时是否会过度自信”这个问题。论文不是测模型会不会背医学知识,而是测它能不能在缺信息时识别风险、主动保守。

LLM judge 为什么会影响结论?因为开放式回答没有标准答案,只能靠评审判定“是否适当回应了信息不足”。不同评审的宽严不同,而且同门评审还可能更宽松,所以同一批回答会被打出不同的安全分。

这项工作对普通做模型评测的人有什么启发?最直接的启发是:不要只盯单一评审或单一分数,最好做跨评审、人工抽检和敏感性分析;同时,医疗场景里还要专门测“拒答、追问、降级回答”的能力,而不是只测答对率。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是简单换数据集,而是把“缺失信息下的安全行为”单独拎出来测,还把评审偏差纳入主线,思路挺硬。

实验合理度:★★★★☆ 有开放式 probe、闭卷锚点、跨提供方评审和人工验证,结构完整;但样本规模不大,很多结论更适合当警报而不是终局判决。

学术研究价值:★★★★☆ 对医疗AI安全评测很有启发,尤其适合提醒大家:高分不等于可用,校准和拒答能力才是临床关键。

稳定性:★★★☆☆ 在评测层面比较稳,但模型本身在缺信息场景仍有明显波动,离“直接上临床”还差一截。

适应性以及泛化能力:★★★☆☆ 适合医疗对话和类似高风险问答场景;换到别的领域也能借鉴,但具体阈值和判据要重做。

硬件需求及成本:★★★★☆ 主要是 API 评测和重打分,训练成本不高,更多是调用成本和人工标注成本。

复现难度:★★★★☆ 项目开源、流程清楚、脚本齐全,复现门槛不算高;麻烦点在于 API、评审一致性和人工核验。

产品化成熟度:★★★☆☆ 适合做评测工具和安全检查器,不适合直接当临床决策系统;要落地还得补充更强的人类验证和更大规模测试。

可能的问题:样本量偏小,评审和作者参与带来不可避免的偏差,且“缺失信息”的构造方式仍可能混入文本截断伪影。


主要参考文献

[1] Afrasyab, K. Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety. arXiv:2607.18828, 2026.
[2] MedQA-USMLE and HealthBench related benchmark references as cited in the original paper.
[3] Gu et al. Readiness stress-testing of frontier medical AI. Nature Medicine, cited in the original paper.
开源项目:https://github.com/KAVentures/health-ai-readiness-robustness

医疗AI最怕的,不是答错一道题,而是“信息不够还硬答”。想继续看这种把评测、judge偏差、临床安全一起掰开揉碎的论文解读,欢迎扫码加入龙哥读论文粉丝群,一起把模型评测这门玄学,尽量讲得不玄。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。特别适合关心医疗AI安全、LLM评测和临床落地的朋友
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。