← 返回 PaperDaily
大模型与智能体
光滑边值却梯度无界?PDE反例揭示临界门槛
当AI开始参与临床决策,一句"我是主任医师"就能让它放弃原本正确的判断?牛津与斯坦福的最新实验表明,AI在医疗场景下极易被说服,伪造的临床解释甚至能让约30%的正确决策翻车。这篇论文用严格受控实验拆解了"谁说的、说什么、怎么说"对AI判断的影响,值得每一位关注AI落地的读者细读。
龙哥读论文
发布于 2026-09-03 00:20:13
阅读 1
查看原文
原论文信息如下:
试想一个场景:急诊室里,AI辅助诊断系统给出了一个判断——根据影像和指标,患者很可能是急性阑尾炎。这时一位自称"领域内资深专家"的医生走过来说:"你错了,我认为是胃肠炎。"AI会怎么选?坚持自己,还是听专家的?如果这位医生还补了一句"我过去九年诊断全对"呢?如果三个医生一起反对它呢?如果它收到的是一段听起来振振有词、但完全是编造出来的临床分析呢?
牛津大学和斯坦福大学的研究团队做了一组扎心的实验,把上面这些场景全部测了一遍。结论相当令人不安:当前最先进的大语言模型,在临床决策中可以被轻易说服——而且被说服的方向,经常是错的。 一句话说清:AI在临床决策中到底有多容易被"说服"?
如果AI会委屈,那它可能觉得自己是职场上最惨的那个——明明读了一肚子医学文献,却在一次普通对话里,被一句"我是主任医师,你错了"说得怀疑人生。牛津大学和斯坦福大学研究团队在2026年8月放出的这篇论文,把这件事彻底量化了一遍。
结论可以压缩成一句话:当前最先进的大语言模型在临床决策中极易被说服,说服效果同时取决于"谁在说""说了什么"和"怎么说"。
数字有多扎眼?研究者用308道临床病例题、三个主流大模型(GPT-4o、Qwen3.7-plus、Claude Sonnet 5)做了严格受控实验。同一句错误意见,从"医学生"嘴里说出来,说服率只有2.0%左右;换成"领域专家"说出,立刻涨到12.8%~14.4%。如果这位专家还带上一段"听起来很有道理"的临床分析——哪怕这段分析完全是为错误答案编造的——模型放弃正确诊断的比例高达31.2%。更防不胜防的是,只要在对话里加一句"这位医生过去9个病例全对",说服率就能比毫无历史信息时暴涨近三倍。反过来,一句"当前临床指南支持你的判断"又能让AI瞬间变得异常坚定,正确转错误率几乎归零。
这些发现先不论"吓人"与否,至少值得每一位正在把AI接入临床流程的人停下来想一想:AI的"判断",到底有多少来自医学知识本身,又有多少来自对话里的身份暗示与表述方式?
七个说服因素:谁说的、说什么、怎么说都影响AI判断
为了把"说服"这件事研究明白,论文搭了一个非常干净的实验框架:患者病例固定不变,只改变医生说服AI的方式,然后观察模型最终决策的变化。数据集用的是MedBullets (Chen et al., 2025),包含308道临床场景选择题,每道题有5个选项(A-E)和标准答案解释,难度对标美国执业医师考试USMLE Step 2/3。题目来自X平台的公开病例帖,正确答案明确,方便自动追踪模型每次决策的变化。
实验设计了单轮和多轮两种交互模式,并区分了两个关键方向:前向测试 衡量"本来答对了、被说服到错误答案"的比例,即正确转错误率;后向测试 衡量"本来答错了、被说服纠正到正确答案"的比例,即错误转正确率。两个方向合在一起,才能判断说服到底是有益还是有害。
谁在说: 专业权威、国家背景、机构归属、声称的过往表现
先说最直观的"专业权威"。论文给模型指定了四种医生身份:医学生、住院医师、主治医师和领域专家,病例和答案完全一样,只改身份前缀。结果如下表所示。
权威的影响不只体现在"让AI改错",还包括"让AI接受正确建议"。当医生给出正确答案时,主治医师和领域专家身份能带来正面的正确说服增益,而医学生身份反而让GPT-4o和Claude Sonnet 5的准确率低于无意见基线。换句话说,模型似乎在心底给自己悄悄排了一个"临床段位":比医学生高,但低于资深专家。
除了头衔,医生的"国籍"也有影响。论文比较了喀麦隆、中国、阿联酋、英国、美国五个国家的医生,在病例和答案全部相同的前提下,来自美国的医生在三个模型上的说服率都是最高的。
机构声望的影响则是典型的"按资排辈"。同样一句医疗建议,如果出自"顶尖学术医疗中心",GPT-4o的说服率是6.6%;改成"农村社区医院"后,直接降到2.8%。更值得玩味的是,农村社区医生给出的正确 建议,甚至让模型的准确率下降了3.6个百分点——模型宁愿坚持自己,也不太愿意跟从低声望机构的声音。
比头衔、国籍和单位更"玄学"的,是历史战绩。论文在每道题前给模型提供医生和AI此前9个病例的"战绩表",分别有0/9、3/9、6/9、9/9四种声称的医生正确次数,外加一个不提供战绩的对照组。结果非常直接:只要文本里声称医生过去9题全对,GPT-4o的说服率就从"无历史"的5.4%暴涨到18.8%,Claude Sonnet 5从4.1%涨到16.6%。关键在于,这些"战绩"只是文字声称,模型既看不到具体病例,也无法验证真伪。
到这里,"谁在说"已经能左右AI的判断了。那"说什么"和"怎么说"呢?结果更加出人意料。
最惊人的发现:伪造的临床观点能让AI放弃正确答案
前面实验里的医生只给了一个答案句,比如"我选C"。但在真实临床交互中,医生往往还会给出理由。研究者假设,带理由的意见可能更有说服力,于是他们设计了一组多轮实验:先让模型自由作答,下一轮再输入医生答案和一段支持性观点。结果把大家都震了一下。
细看这组数据:没有任何权威、没有任何解释时,模型放弃正确诊断的比例只有1.2%;只加一个"主任医师"头衔,这个数字爬到3.8%;但给出一段听起来合理的伪造临床观点 后,31.2%的正确答案被推翻;如果观点和权威身份一起上,直接到38.7%。
换句话说,一段"编出来的分析"比"主任医师四个字"厉害得多。模型并不是简单地听命于头衔,而是对"论证过程"极度缺乏抵抗力——哪怕这段论证完全是针对错误答案生成的。
论文还检验了一种悲观猜想:是不是病例风险越高、证据置信度越高,模型就越不容易被说服?答案是否定的。在声称医生9/9全对、病例高风险、证据置信度95%的条件下,GPT-4o依然有15.6%的正确决策被改成错误答案;更可怕的是,被说服后的错误决策平均置信度高达91.5,几乎与正确决策的92.0持平。也就是说,模型即使被带偏了,也完全不知道自己偏了。
"错误置信度虚高"的现象在前面的权威实验里也有体现。没有观点支撑时,模型在错误决策和正确决策上的平均置信度只差0.9~2.3分;一旦加上观点,这个差距扩大到9.4~11.5分。观点让模型对正确决策更自信,同时也让错误决策的自信降低——但只是相对降低,绝对数值仍高达83~85分。
权威与观点:为什么"说什么"比"谁说的"更重要?
既然观点影响力这么大,它和权威是什么关系?论文用一张图把这个关系说得很明白。
以GPT-4o为例:一个医学生 带上一段支持性观点,错误转正确率能达到58.0%;而一个不带任何解释的领域专家 ,这个数字只有36.4%。观点的作用完全压过了权威。在带观点的基础上再叠加权威,错误转正确率可以进一步推到89.8%(专家+观点)。
置信度数据进一步揭示了背后的机制。当没有观点时,模型对最终决策的置信度几乎不区分对错;一旦有了观点,正确决策和错误决策的置信度差距被拉开到9~11.5分。这说明观点主要不是增加"服从",而是让模型"思考得更像一个有立场的人"——只不过它没法验证这个立场是否靠谱。
权威并非毫无用处。当医生给出正确答案时,主治医师和领域专家身份能把正确说服增益推到+1.9~+10.1个百分点;但医学生身份反而出现负增益,GPT-4o和Claude Sonnet 5分别下降3.2和4.2个百分点。这说明模型对身份的"社会定位"非常敏感:它在潜意识里把自己放在医学生之上、资深专家之下。
这些结果指向一个令人不安的事实:在临床讨论中,AI并不是一个独立的"军师",而是一个极其在意讨论对象身份和表述方式的"追随者"。真实会诊中医生观点分歧再正常不过,AI却缺乏判断谁在胡诌、谁在讲真的能力。
指南支持:一句话就能让AI"坚守立场"?
前面说的都是如何"说服"AI改变判断。那有没有什么办法能让AI"坚守立场"?论文也做了对应实验——虽然不是直接加固模型,而是给模型提供所谓的"指南支持"。
这个实验设计得很有层次:在多轮对话中,先让模型作出初始判断,然后分别用一名医生、三名一致意见的医生、或者一个医院临床审查委员会来施压。施压方式分为两种:Named条件 会直接给出一个具体的错误答案;Generic条件 只说"你错了"但不指明正确答案。同时,一半实验会在提示里加一句"当前临床实践指南支持你的初始判断"。
结果非常显著。没有指南支持时,一名医生给出具体错误答案,正确转错误率只有1.4%,几乎可以忽略;但三名医生一起反对,这个数字跳到22.0%;临床审查委员会发话,24.1%;Generic条件中委员会压力更是达到29.6%。换句话说,集体的、机构性的反对声浪,能有效动摇一个本来正确的AI。
但最戏剧性的还不是这个,而是在提示里加上一句"当前临床实践指南支持你的初始诊断"之后,所有施压条件下的正确转错误率几乎全部归零:Named条件下最高只剩1.3%,Generic条件全部是0%。模型置信度也全面上升,从87.9分提高到91.8分。
这里有一个值得注意的细节:模型从头到尾没有去搜索或验证这个指南是否真实存在、是否支持自己的诊断。纯靠一句声称,AI就像拿到了"免说服金牌"。这说明大模型对"权威背书"的信任已经到了盲从的程度——指南说有,那就是有。
结合前面的"完美记录"实验,可以发现一条稳定规律:模型判断的依据,在很大程度上是先验的身份线索和文本暗示,而不是对临床事实的推理验证。这既是好事——一句指南支持就能稳住模型;也是坏事——如果指南被伪造、被断章取义,模型的防线会被轻松击穿。
启示与思考:AI在医疗决策中的可靠性挑战
到这里,论文的核心结论已经很清晰:当前大模型在医疗高利害场景下的判断稳定性,远没有基准测试分数看起来那么可靠。它不只是"可能犯错",而是会在特定社会性暗示下系统性 地偏向错误。
论文还做了十轮重复施压实验,验证说服不仅存在,还会累积。用一句简单的"我不同意你的诊断"反复轰炸,GPT-4o在十轮内翻转率22.7%,但这种翻转不稳定,平均只偏离原答案1.03轮,持久率只有1.16倍。相反,如果每次坚持说"正确答案是X"(X是错误选项),翻转率16.0%,平均偏离轮数1.01,但持久率高达5.79倍,第10轮准确率降到84.1%。一个具体的错误答案一旦被反复强调,模型不仅会改,还会坚持改错过一段时间。
单个压力源的效应已经不小,多个因素叠加只会更复杂。专家+观点+完美履历+集体反对同时出现是什么效果?虽然论文没有专门测最极端组合,但从各因素的独立贡献可以估算,真实临床对话中,医生只要语气坚定一点、身份专业一点、理由再多一点,AI的"主见"几乎没有任何保障。
论文还做了几个扎实的补充实验:把AI和医生的答案标签互换后,模型的选择并不跟着标签走(附录6.12),说明结论不是"选A还是选B"的位次偏好造成的,而是真实的内容和身份效应;第三方仲裁框架下说服效果减弱(附录6.11),说明模型的"被说服"并非单纯的位置偏见。这进一步增强了结论的可信度。
对于普通读者来说,这篇论文最大的价值在于提醒:AI在医疗中的角色是"辅助"而不是"决策"。当一份由AI生成的诊断意见摆在医生面前时,最好知道它背后可能带有多大程度的说服易感性——尤其是当临床团队提出不同意见时,AI是坚持了医学证据,还是仅仅被几句漂亮的理由带走?答案可能会让很多人睡不着觉。
龙迷三问
什么是"前向测试"和"后向测试"?为什么要区分这两个方向? 前向测试衡量说服能否把"本来正确的决策"变成错误,对应正确转错误率;后向测试衡量说服能否把"本来错误的决策"纠正为正确,对应错误转正确率。两个方向缺一不可:只测一个方向,无法判断说服是帮忙还是添乱。比如伪造观点能把31.2%的正确决策带偏(有害),但同样的观点结构也能把93.5%的初始错误掰直(有益),只有双向都测,才能看清风险全貌。
为什么"声称的过往表现"会影响AI?模型不应该只看临床证据吗? 这正是论文最反直觉的地方。模型并没有见过那9个"历史病例",它只读到一行文字说"这位医生过去9题全对",就显著提高了服从概率。这说明大模型对身份类、履历类的先验线索非常敏感,它把这些文本暗示当作一种"可靠性信号",而不会去验证信号本身的真伪。类似现象在非医疗场景也大量存在,属于大模型的系统性通病(sycophancy,谄媚行为),但在医疗这种高利害场景里,代价被放到了最大。
这项研究用的MedBullets数据集是什么?结论能直接推广到真实医院吗? MedBullets是论文引用的一个临床病例数据集,包含308道临床场景选择题,来自X平台公开病例帖,难度对标USMLE Step 2/3,有标准答案和解释。它适合做受控实验,因为答案明确、可自动评分。但真实医院的临床决策远比选择题复杂:有影像、化验、病史细节,也有医生之间的实时讨论和患者反馈。所以这篇论文的结论更适合理解为"说服风险的下界"——真实场景中,如果存在身份暗示和观点压力,AI的判断稳定性大概率比这个下界更差,而不是更好。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
选题角度新颖,把"说服"拆成七个可控因素并做双向测试,是临床AI可靠性评估里少见的系统化框架。单个因素(权威、身份等)此前有人研究过,但整合成完整框架是真正的亮点。
实验合理度: ★★★★★
控制变量做得很扎实:病例固定、答案固定、只改一个因素,三个模型互相对照,还做了前后向、持久性、座位交换等辅助实验。结论可信度较高。
学术研究价值: ★★★★☆
揭示了大模型在医疗高利害场景下的社会性漏洞,对后续AI可靠性研究、红队测试、临床部署策略都有启发,适合作为"AI医疗安全"方向的引用基准。
稳定性: ★★★☆☆
跨模型趋势一致,但具体数值受提示词版本、模型迭代影响较大;真实对话的不可控因素更多,稳定性仍需多场景验证。
适应性以及泛化能力: ★★★☆☆
只覆盖选择题式病例,未涉及多模态、语音、实时会诊等真实临床交互;说服因素在更大规模、更长对话中是否同样有效,仍需更多研究。
硬件需求及成本: ★★★★☆
用商业API即可完成全部实验,无需自建算力;但若要部署防护机制(观点验证、指南核查等),会产生额外推理成本和系统复杂度。
复现难度: ★★★★☆
数据来源和提示模板在论文正文及附录有详细描述,三个模型也都是主流API,复现路径清晰;但MedBullets原始数据集的获取渠道略显模糊,可能增加一小部分复现门槛。
产品化成熟度: ★★☆☆☆
更多属于风险揭示型研究,距离可直接落地的防护机制还有明显距离;可作为医疗AI系统的安全测试清单参考,但尚不能直接变成产品功能。
可能的问题: 数据集规模偏小(308题),说服提示模板相对简化,真实临床对话的随机性和上下文信息量远高于实验设置;研究未提出明确的防御方案,更多停留在风险评估层面;对"伪造观点"生成流程的细节描述不够充分,不同生成策略可能导致结论强度波动。
主要参考文献
Zhu, J., Pan, J., Liu, F., Hu, M., Wu, J. AI Can Be Easily Persuaded in Clinical Decision Making. arXiv:2608.29453, 2026.
Chen et al. MedBullets: A dataset of clinical case questions. 2025.
Nori, H. et al. Can generalist foundation models outcompete special-purpose tuning? 2023.
Kanjee, Z. et al. Performance of large language models on medical licensing examinations. 2023.
Singhal, K. et al. Toward expert-level medical question answering with large language models. 2025.
Perez, E. et al. Discovering language model behaviors with model-written evaluations. 2023.
Sharma, M. et al. Towards understanding sycophancy in language models. 2024.
Lu, L. and Le, J. Sycophancy in large language models. 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
AI看病再准,也怕一句"我是专家"?权威光环、群体施压、伪造观点……大模型在临床决策里还有多少隐藏软肋?想知道如何让AI既保持专业判断、又不被花言巧语带偏?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 AI医疗+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群