← 返回 PaperDaily
视觉与图像
少量样本就能补齐数据鸿沟?AstraZeneca这篇很硬
AstraZeneca这篇工作很实在:不搞端到端硬训练,而是用一个轻量对齐模块把病理图像和RNA嵌进同一空间,再把“基因集”变成可查询的开放词汇提示。结果不只是在检索上提升明显,还能在临床试验和跨队列迁移里站住脚,属于能落地的那种新思路。
龙哥读论文
发布于 2026-08-14 09:10:58
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: AstraZeneca这篇工作很实在:不搞端到端硬训练,而是用一个轻量对齐模块把病理图像和RNA嵌进同一空间,再把“基因集”变成可查询的开放词汇提示。结果不只是在检索上提升明显,还能在临床试验和跨队列迁移里站住脚,属于能落地的那种新思路。
原论文信息如下:
H&E图像如何预测分子信号?一项跨模态对齐新突破
病理科最熟悉的 H&E 染色切片,擅长讲“形态故事”;RNA-Seq 则更像分子层面的“体检报告”。难点也很直白:前者便宜、常见、覆盖广,后者信息密、但贵、而且很多历史队列根本没有。AstraZeneca 这篇工作想解决的,就是一个很现实的问题——能不能只看 H&E 图像,就把分子通路的大致活性猜出来 ,而且不是死盯几个固定标签,而是像“点名”一样随时查询任意基因集。
这类工作以前常见的套路是“端到端训练一个回归头”,输入病理图像,输出固定的一组 hallmark 基因集分数。问题在于:一旦换个新基因集,模型就得重训;一旦换个队列,性能还可能掉链子。本文的思路更像是“先把底座对齐,再让查询变灵活”。说人话就是:不把模型训练成死记硬背的背诵机器,而是训练成会查字典、会做比对的检索型选手 。🤨
方法揭秘:轻量级对齐模块实现开放词汇分子提示
这篇论文的关键词不复杂,但组合起来很妙。先解释两个缩写。H&E 是 hematoxylin and eosin,中文是苏木精-伊红染色;RNA-Seq 是 RNA sequencing,中文是 RNA 测序。前者看组织形态,后者看转录本丰度。论文的目标不是把两者混成一个糊糊,而是让它们在同一个空间里“对得上号”。
方法整体很克制。图像编码器和 RNA 编码器都先用冻结的基础模型,不端到端大改;真正训练的只是一个轻量级投影头,把两种模态映射到共享潜空间。这里的基础模型包括病理侧的 THREADS 图像编码器,以及 RNA 侧的 scGPT+THREADS RNA-head 或 BulkFormer。冻结主干、只训练小模块 ,好处是训练成本低,也更适合中等规模的配对数据。对真实业务来说,这种“少动底座,多调接口”的思路,通常比从头重训更靠谱。
论文一共比较了五种对齐策略。最朴素的是不训练,直接拿现成的 THREADS 表征做检索;其次是监督回归,把图像嵌入直接拟合到 RNA 嵌入;再往上是 Ridge Regression、CCA(Canonical Correlation Analysis,中文是典型相关分析)和 CLIP 风格的对比学习。这里的 CLIP 不是某个剪辑软件,而是 Contrastive Language-Image Pretraining 的缩写,中文常译作对比语言-图像预训练。论文借了它的思想,但把“语言”换成了 RNA。思路很顺:让配对的图像和 RNA 靠近,不配对的拉远,再额外加入同癌种亚型的监督式对比项,增强同类样本聚集。
真正有意思的是“开放词汇分子提示”。传统方法只能输出固定的 50 个 hallmark 基因集;本文先在训练阶段学到一个对齐空间,推理时再把任意基因集转成 ssGSEA 分数,去参考 RNA 库里做检索或软聚合。这里的 ssGSEA 是 single-sample Gene Set Enrichment Analysis,中文可以理解成“单样本基因集富集评分”。它衡量的是某个样本里,一组基因整体活跃不活跃。于是,模型不再被锁死在“固定标签输出”上,而是可以临时回答“这个切片里,IFN-γ 响应像不像高?”“这个样本的纤维化轴强不强?”这种更接近临床问题的查询。
论文里还专门给了一个公式化的查询逻辑:先把 H&E 图像嵌入和参考 RNA 嵌入算余弦距离,再取最近的 k 个邻居做聚合;Soft-kNN 则不是硬挑几个最近邻,而是对整个参考库做软注意力加权。kNN 是 k-nearest neighbors,中文是 k 近邻;Soft-kNN 可以理解成“别只看最近的那几个,给全库都留点发言权”。这个设计很适合生物数据,因为分子状态往往不是非黑即白,而是连续谱。
从工程角度看,这套方法最讨喜的地方有两个。第一,训练参数很少,只有一个轻量 MLP 投影头,约 130 万参数,算是把复杂问题尽量交给预训练底座。第二,推理方式很灵活:既能做跨模态检索,也能做开放词汇分子提示,还能用同一套对齐空间做领域自适应。不是那种“论文里很美,落地很累”的花活,而是有点像把病理 AI 的操作系统重新整理了一遍。
实验结果:基准测试与临床验证双重可靠
实验部分的设计很讲究:先看“对齐到底对没对上”,再看“基因集能不能被预测”,最后看“临床上有没有点用”。这种顺序是合理的,因为如果跨模态空间都没对齐,后面的分子提示再花哨也只是空中楼阁。
先看最基础的检索任务。BulkFormer + MLP-CLIP 在多癌种 5 折交叉验证中拿到了最好的检索表现,R@10 达到 71.9% ,比无训练基线高出非常明显。更关键的是,单纯监督回归并没有把事情做好,甚至接近“没学会怎么找人”的程度。这说明问题不是简单地“把图像映射到 RNA 向量”就行,而是需要一个更适合跨模态配对的对齐目标。对比学习在这里更像是训练“相互认脸”的能力,而不是训练“机械拟合”的能力。
从结果上看,BulkFormer 也比 scGPT 组合更稳。这个现象不奇怪:BulkFormer 本身就是面向 bulk RNA-Seq 设计的,和本文的任务更贴。也就是说,RNA 编码器不是随便挑的,编码器是否“懂 bulk RNA” ,直接影响跨模态对齐的质量。论文在这里没有偷懒,算是把底座选型这件事做对了。
再看基因集预测。这里有个很重要但容易被忽略的点:RidgeCV 虽然均值 R² 更高,但它不是开放词汇方法 。RidgeCV 是带交叉验证的岭回归,中文可以理解成“带正则的线性回归自动选参”。它能把固定的 50 个基因集拟合得更好一点,但一旦换一个新基因集,就得重训。Soft-kNN 的均值 R² 略低一些,却能在推理时直接查询任意基因集,不需要改模型。论文在这里没有被单一指标绑架,而是把“准确率”和“可查询性”一起放进了判断里,这就比较像做产品,而不是只做分数。
更有意思的是“生物学天花板”分析。论文发现,那些在 H&E 上有明显形态脚印的通路,更容易被预测 ,比如细胞周期、免疫相关程序、糖酵解和缺氧;而那些几乎不在组织结构上留下痕迹的代谢通路,就难得多。这个结论其实挺朴素:病理图像不是魔法水晶球,它能看见的是组织学信号,不是凭空读心。能预测到的,往往是“形态能反映分子变化”的程序;预测不到的,也符合常识,不必硬吹。
临床验证部分更像是给方法“上强度”。在 POSEIDON 临床试验队列上,模型没有再训练,只是用冻结的对齐空间和 Soft-kNN 去做推理。结果显示,H&E 预测的 squamous cell carcinoma 分数能把 LUAD 和 LUSC 区分开,说明模型并不是在胡乱拟合,而是真的抓到了一些与亚型相关的形态-分子耦合信号。IFN-γ 相关分数还能与 PD-L1 肿瘤细胞表达分组呈现方向一致的关系,虽然生存分层没有达到显著,但方向是对的。对临床工作来说,这类“方向一致但尚未完全定论”的结果,比夸张的满分故事更可信。
更进一步,论文还把免疫激活和纤维化这两条轴拿出来看。结果显示,H&E 预测的免疫/纤维化分数能较好复现 RNA-seq 计算出的分组趋势。这个部分的价值不在于“又多了一个分数”,而在于它把方法从单一通路预测推到了肿瘤微环境模式识别 。这就更接近临床真实需求:医生不一定关心某个基因单点,而更关心这个病灶整体像哪类微环境、会不会对免疫治疗更敏感。
领域自适应:少量样本即可弥合数据鸿沟
跨队列迁移是这类方法真正的试金石。论文把在多癌种队列上训练好的模型,直接扔到 TCGA-LUAD 和 TCGA-BRCA 上,结果出现了明显的 transfer gap。这个现象很正常:不同医院、不同扫描仪、不同癌种分布,都会让嵌入空间“变味”。但论文没有止步于此,而是测试了少量配对样本的领域自适应。
结果相当有说服力:只用很少的目标域配对样本,就能把检索性能拉回来不少。以 TCGA-LUAD 为例,8 个配对样本就能让 R@10 从接近“找不着北”的水平提升到明显可用的程度。这个细节很关键,因为它说明预训练对齐空间不是空白画布,而是已经学到了一种可迁移的结构先验 。目标域只需要少量校准,而不是推倒重来。对实际部署来说,这意味着新医院、新队列的接入门槛可以低很多。
不过,论文也没有把这件事说得太满。跨域后不同癌种恢复速度不一样,LUAD 比 BRCA 更快,说明数据异质性仍然会影响迁移效果。换句话说,这套方法不是“随便给点数据就全自动通吃”,而是“在合理的预训练基础上,用少量目标域数据做精调”。这个边界感是对的,不然就容易把工程问题包装成玄学奇迹。
总结与展望:数据效率与临床价值的平衡
这篇论文最值得记住的,不是某一个单项分数,而是它把病理分子预测从“固定标签回归”推进到了“开放词汇查询”。这一步很像把过去的封闭式问答,升级成可检索、可扩展的知识库。对于病理 AI 来说,这意味着模型不必为每个新通路重新训练一个头,只要对齐空间足够稳,新的基因集就能直接被拿来问。
当然,边界也很清楚。第一,训练集规模只有 1720 例,虽然对病理配对数据来说不算小,但离真正覆盖复杂临床异质性还有距离。第二,方法能预测的,主要还是那些在组织形态上有脚印的通路;对“看不见摸不着”的代谢程序,模型并不会凭空开天眼。第三,临床验证目前仍以推理为主,真正进入前瞻性流程,还需要更多多中心、更多癌种、更多设备条件下的稳定性验证。
但从研究方向上看,这条路线是很有价值的。它没有执着于“把病理图像直接变成分子真相”,而是承认图像和分子各有边界,再通过对齐和检索把两者接起来。这个思路更稳,也更接近临床现实:不是每个病例都能测 RNA,但几乎每个病例都有 H&E 。如果未来能把这种开放词汇分子提示做得更轻、更稳、更可解释,病理切片就不只是“看形态”,还可能成为一个低成本的分子入口。👍
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“病理图像如何在不重训大模型的情况下,查询任意分子通路活性”的问题。核心做法是把 H&E 和 RNA-Seq 对齐到同一空间,再用基因集当提示词去检索或预测。
Soft-kNN 和普通 kNN 有什么区别? 普通 kNN 只看最近的几个样本,Soft-kNN 会对整个 RNA 参考库做软加权,更平滑,也更适合连续型的生物信号。它的优势是开放词汇能力强,不需要为每个新基因集重训。
为什么有些通路能预测,有些通路不行? 因为 H&E 本质上只能看到组织形态。那些和细胞周期、免疫浸润、缺氧、糖酵解等有明显形态关联的程序更容易被预测;而缺少组织学脚印的代谢通路,天然就更难从图像里读出来。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是凭空造一个新模型,而是把“冻结基础模型 + 轻量对齐 + 开放词汇分子提示”串成了一个更实用的框架。创新点偏工程落地,但组合得很顺。
实验合理度: ★★★★☆ 先对齐、再预测、再临床验证、再做跨域适配,逻辑链是完整的。唯一要留意的是部分结论仍建立在回顾性数据上。
学术研究价值: ★★★★☆ 它把病理-分子关联从固定标签预测推进到可查询空间,这对后续做多模态病理研究很有启发。
稳定性: ★★★☆☆ 冻结主干让训练更稳,但跨队列仍有明显迁移差异,说明鲁棒性还需要更大规模验证。
适应性以及泛化能力: ★★★☆☆ 开放词汇查询很加分,但真正泛化到新癌种、新中心、新扫描条件,还得继续补数据和校准。
硬件需求及成本: ★★★★☆ 只训轻量投影头,成本不高;推理阶段依赖参考库检索,也比较友好。
复现难度: ★★★☆☆ 思路清楚,但涉及多模态配对数据、基础模型、参考库构建和临床队列,复现门槛不算低。
产品化成熟度: ★★★☆☆ 在回顾性分析和辅助研究场景已经很有潜力,但离稳定临床产品还差多中心前瞻性验证。
可能的问题: 方法对形态可见的通路更有效,对“看不见”的分子程序仍有限;跨域迁移和临床推广还需要更大样本与前瞻验证。
主要参考文献
Dominik Winter, Dominik Vonficht, Loïc Le Bescond, Christian Gebbe, Marco Rosati, Richard J. Chen, Markus Schick, Ross Stewart, Nicolas Brieu. Data-Efficient Multimodal Alignment for Histopathology-based Molecular Prediction. arXiv:2606.29949v1, 2026.
A. Radford et al. Learning transferable visual models from natural language supervision. ICML 2021.
A. Liberzon et al. The molecular signatures database (MSigDB) hallmark gene set collection. Cell Systems, 2015.
A. Vaidya et al. Molecular-driven foundation model for oncologic pathology. arXiv:2501.16652, 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群