← 返回 PaperDaily
大模型与智能体
清华协和新模型RaDaR:32B也能做罕见病诊断
罕见病最怕的不是治不了,而是来得太晚。RaDaR把自由文本、合成数据和推理增强揉成一套开源方案,还做了随机医生辅助试验,终于不是“纸上谈兵”的医疗大模型了。
龙哥读论文
发布于 2026-08-14 21:50:16
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 罕见病最怕的不是治不了,而是来得太晚。RaDaR把自由文本、合成数据和推理增强揉成一套开源方案,还做了随机医生辅助试验,终于不是“纸上谈兵”的医疗大模型了。
原论文信息如下:
🎯 罕见病诊断的“诊断奥德赛”,RaDaR 如何破局?
罕见病这事,最让人头大的不是“罕见”,而是“太晚才罕见”。患者往往要在不同科室之间来回折腾,检查做了一轮又一轮,最后才有人突然拍大腿:“哦,原来是这个病。” 这条漫长而曲折的求诊路径,常被称为“诊断奥德赛”。
本论文提出的 RaDaR ,全称是 Rare Disease navigatoR ,中文可以理解成“罕见病导航员”。它不是那种动辄上百亿参数、部署起来像请了台火箭发动机的大模型,而是一个 32B 参数 的开源推理模型,目标很明确:让医生在面对复杂、碎片化、信息不完整的罕见病病例时,能更早想到正确方向。
这篇工作最有意思的地方在于,它没有停留在“模型在榜单上跑分不错”这种舒适区,而是继续往前走了一步:做了 外部多中心验证 、回顾性诊断轨迹分析 ,甚至还做了 随机医生辅助试验 。换句话说,它不是只会“答题”,还试图证明自己能在真实医疗场景里帮上忙。
🔬 RaDaR 模型开发:从数据合成到推理增强
先把基础概念捋顺。这里的 大语言模型(LLM,Large Language Model) ,可以粗略理解为“会读会写会推理的超级文本处理器”。而医疗场景里的难点,不是让它会说话,而是让它说得像医生、想得像医生、还别乱说 。
RaDaR 的底座来自 DeepSeek-R1-Distill-Qwen-32B 。这里的“Distill”就是蒸馏,意思是把更强模型的推理风格和知识,压缩进一个更小、更容易部署的模型里。论文的思路很朴素:不追求巨无霸,追求能落地 。
模型训练分两步走。第一步是 监督微调(SFT,Supervised Fine-Tuning) ,第二步是 直接偏好优化(DPO,Direct Preference Optimization) 。SFT 可以理解成“先认真抄作业”,DPO 则像“再学会分辨哪种答案更像专家会给出的答案”。前者负责把模型拉进罕见病语境,后者负责把输出往更可信、更合逻辑的方向拧一拧。
训练数据也很有戏。论文用了 49,170 条公开真实病例文本,再加上 104,666 条合成病例。合成病例不是随便胡编,而是通过一种 以表型为锚点 的生成流程,把结构化知识转成更接近临床叙述的文本。简单说,就是先抓住“患者表现了什么”,再把这些表现组织成医生看得懂、模型也学得会的病例故事。
这里最关键的不是“数据多”,而是“数据长得像临床数据”。罕见病的真实病例本来就少,很多病甚至一辈子都难见几次。于是论文用合成病例去补长尾,让模型见识到更多罕见组合。这个思路听起来有点像给模型开了个“罕见病博物馆”,让它至少知道世界上还有这些奇怪但真实存在的病。
⚙️ 全面评估:静态基准、外部验证与临床轨迹分析
如果只看静态题库,模型很容易“考得好看”;但真正麻烦的是,医院里的病例不会按题库格式排队出现。论文因此设计了三层评估:公开基准、外部中心验证、以及沿着真实诊疗过程的回顾性分析。这个组合拳的意义在于,尽量把模型从“会做题”推进到“会看病”的门口。
在公开的 RareArena 留出测试集上,RaDaR 在 rare disease screening 和 rare disease confirmation 两项任务里都排到了开源模型前列。这里的 screening 可以理解为“线索还很模糊时,先猜个大方向”;confirmation 则是“证据已经比较明确时,看看能不能把病名锁定”。这种分工很合理,因为罕见病诊断并不是一步到位,更多时候是从一堆可能性里慢慢缩小范围。
更有意思的是,RaDaR 不只是“总分高”,还在 超罕见疾病 上优势更明显。论文的结果显示,病例越少、越稀有,RaDaR 的相对收益越突出。这个现象其实不难理解:传统方法高度依赖已知的结构化知识和稳定映射,而长尾疾病恰恰最缺这些东西;相反,RaDaR 通过自由文本推理和合成数据补课,反而更能抓住那些“教科书没写全,但病例里确实存在”的线索。
外部验证也很关键。论文在北京协和医院、北京宣武医院、西京医院、新加坡的儿童医院等多个中心做了测试。不同医院的病历写法、检查习惯、记录风格都不一样,这种分布偏移最容易把模型“考懵”。但 RaDaR 仍保持了较稳的表现,说明它不是只会背训练集,而是对真实临床文本有一定泛化能力。
论文还做了一件很“临床”的事:沿着患者真实就诊轨迹,看看模型能不能比医生更早想到正确诊断。这里用到一个指标叫 VNDAS ,全称是 visit-normalized diagnostic advancement score ,中文可译为 就诊归一化诊断提前度评分 。名字听着像学术界的绕口令,其实意思很直白:模型在整个诊断路上,能不能比医生更早把正确病名摆上桌。
结果是,RaDaR 在 61.06% 的病例里,能在医生正式写下怀疑之前就先把最终诊断提出来;平均能提前 1.87 个月 。这不是“神机妙算”,而是说明模型在某些病例里确实能把散落在病历里的线索串起来,提前给出一个值得关注的方向。
👨⚕️ 随机医生辅助试验:AI 辅助提升诊断准确率 21%
这部分是整篇论文最“像临床研究”的地方。作者没有停在模型分数,而是直接做了一个 随机医生辅助试验 :一组医生只能上网搜,另一组医生除了上网,还能得到 RaDaR 的帮助。这个设计很重要,因为它回答的不是“模型会不会答题”,而是“医生用了之后有没有真的更准”。
试验纳入了来自多个医院的 76 名完成者,覆盖神经内科、内科和儿科。结果很直接:有了 RaDaR 辅助,医生的诊断准确率从 28.00% 提升到 49.44% ,也就是 提升 21.44 个百分点 。而且诊断时间并没有明显变长,说明模型不是靠“让医生多想半小时”换来的分数,而是更像一个能把候选诊断列表提前整理出来的助手。
🔍 合成数据的魔力:缓解数据稀缺,实现性能扩展
罕见病训练数据少,是老生常谈,但老问题不代表没法处理。RaDaR 的另一个亮点在于,它系统性地验证了合成数据到底能不能“补课”。这不是简单地往训练集中塞一些假病例,而是通过以表型为锚点的叙述生成,让模型接触到更多长尾疾病的文本表达方式。
论文的消融结果显示,加入合成数据后,模型性能是稳定提升的,而且在极度稀缺的超罕见区间提升最明显。更有意思的是,只用合成数据训练 的模型,表现甚至能接近只用真实病例训练的模型。这个结论不等于“以后不用真实数据了”,而是说明:只要合成过程足够贴近临床叙述,合成数据确实能提供有效的学习信号。
论文还观察到一个很漂亮的现象:随着每个疾病的合成样本数增加,性能呈现近似单调上升,并符合幂律式增长趋势。这个结果的潜台词是,合成数据不是“加一点试试”,而是一个可以持续扩容、持续补强的训练杠杆。对于罕见病这种天然长尾任务来说,这点尤其重要,因为现实世界里,很多病根本不可能靠等真实样本慢慢攒齐。
💡 总结与展望:开源模型的临床落地挑战
RaDaR 这篇工作最值得肯定的,不只是它把分数做上去了,而是它认真回答了三个临床落地必须面对的问题:能不能训出来 、能不能用起来 、用了会不会翻车 。这三件事,往往比榜单上的几个百分点更接近真实世界。
它的优点也很明确:开源、参数适中、支持本地部署、能处理自由文本、还做了临床辅助试验。对于医院这种对隐私和算力都很敏感的环境来说,这种组合比“超大但只能云端跑”的方案更现实。再加上项目层面还有 RareDx 这样面向多语言用户的诊断信息平台,说明这条路线不只是论文里的演示,而是朝着实际服务患者的方向在延伸。
不过,冷静一点看,挑战也不少。第一,罕见病的真实临床场景极其复杂,模型即便能提前给出候选诊断,也不等于能自动完成下一步检查决策。第二,医生辅助试验虽然结果很好,但样本量和任务设置仍有边界,离真正嵌入日常门诊流程还有距离。第三,校准误差提示了一个老问题:AI 可以帮忙,但不能把“信心”伪装成“正确”。
更长远地看,罕见病 AI 的合理形态,大概率不是单个大模型包打天下,而是 自由文本推理 + 结构化表型工具 + 医生交互式确认 的混合系统。RaDaR 的价值就在于,它把“自由文本推理”这块拼图做得足够像样,而且还证明了这块拼图能和临床工作流对接。这个方向,值得继续往下挖。😊
龙迷三问
这篇论文到底解决了什么问题? 它解决的是罕见病诊断中“信息少、路径长、专家少”的老大难问题。RaDaR 试图用专门训练的推理大模型,把自由文本病历里的碎片线索提前串起来,帮助医生更早想到正确诊断。
VNDAS 是什么意思? 它是 visit-normalized diagnostic advancement score,中文可理解为“就诊归一化诊断提前度评分”。简单说,就是看模型能不能比医生更早在诊断轨迹上找到正确病名。
合成数据为什么有用? 因为罕见病真实样本太少,很多病天生就是长尾。论文证明,只要合成病例足够贴近真实临床叙述,它就能给模型提供有效训练信号,尤其对超罕见疾病帮助更明显。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是第一次有人拿大模型做医疗,但把自由文本罕见病诊断、合成数据、临床轨迹分析、随机医生试验 串成一套完整闭环,这个设计挺扎实。
实验合理度: ★★★★☆ 不只看静态榜单,还做了外部中心验证和临床辅助试验,比较能说明问题;不过医疗场景真实复杂度更高,仍有进一步验证空间。
学术研究价值: ★★★★★ 这篇论文不只是做模型,更是在探索数据稀缺医疗任务 下,如何建立可复现、可评估、可落地的开发框架,研究价值很高。
稳定性: ★★★☆☆ 在多中心和不同输入形式下表现不错,但医生辅助试验里出现校准误差上升,说明稳定性还不能完全放心交给临床一线。
适应性以及泛化能力: ★★★★☆ 对不同中心、不同疾病频次、不同输入格式都有一定适应性,尤其在长尾疾病上表现亮眼;但跨语言、跨国家流程还需要更多验证。
硬件需求及成本: ★★★☆☆ 32B 参数比超大模型友好很多,已经有较现实的本地部署可能;但医院落地仍需要算力、隐私合规和系统集成支持。
复现难度: ★★★★☆ 开源模型、开源数据和项目链接都给了,复现门槛不算离谱;真正难的是拿到同等质量的临床数据和完成严谨评估。
产品化成熟度: ★★★☆☆ 适合做临床辅助决策原型或研究平台,但离“直接上岗”还差最后一公里,尤其要补足校准、安全和流程嵌入。
可能的问题: 训练数据与真实临床分布仍有差距,模型可能在少数错误病例上显得过于自信;医疗场景里,这种自信最容易让人心里一紧。
主要参考文献
1. Chen H, Zhou S, Zhao Z, et al. A specialized reasoning large language model for accelerating rare disease diagnosis: a randomized AI physician-assistance trial. arXiv, 2026.
2. RaDaR 开源代码:https://github.com/sczzz3/RaDaR
3. RareDx 项目:https://raredx.datummed.com
4. RareArena 数据集:https://github.com/zhao-zy15/RareArena
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
罕见病、医疗大模型、AI诊断都在群里继续聊,别让好论文只停在标题上。