← 返回 PaperDaily 前沿研究

药物代谢预测新突破:MEGA-CL前瞻验证误差仅2.5倍,代码全开源

药物研发早期,ADMET预测的准确性直接决定候选分子的命运。传统的QSAR模型在小数据和高噪声面前往往力不从心,而中国药科大学团队提出的MEGA-CL,用图外部注意力+对比学习,在1亿分子上预训练,不仅刷新了13个标准基准和21个ADMET任务的SOTA,更在前瞻性验证中表现出令人信服的泛化能力——肝清除预测误差仅2.5倍内,CYP450抑制分类准确率73.

原论文信息如下:
论文标题:
MEGA-CL: A Molecular Foundation Model for Generalizable ADMET Prediction through Graph External Attention and Contrastive Learning
发表日期: 2026年7月
发表单位: 中国药科大学、南京医科大学附属医院、江苏省致癌与干预重点实验室
原文链接: https://arxiv.org/pdf/2607.24314v1.pdf
开源代码链接: https://github.com/KeduJin/MEGA-CL
开源数据集链接: https://doi.org/10.5281/zenodo.20793660

1. 挑战与背景:ADMET预测为何艰难?

在药物研发的漫长马拉松中,ADMET(吸收、分布、代谢、排泄和毒性)性质的预测,可以说是决定一个化合物能否从实验室走向临床的“生死关口”。据统计,约有10-15%的临床试验失败,直接原因就是ADMET性质不佳。想象一下,一个花了数亿美金、经过层层筛选的候选药物,最后因为代谢太快或者有毒性而在人体试验中折戟沉沙,这背后的成本和时间的损失,简直不敢细算。
那么,为什么ADMET预测这么难呢?传统方法,比如实验动物模型,不仅成本高、通量低,而且动物和人之间的代谢差异还可能让你得出完全错误的结论。而早期的计算模型,比如QSAR(定量构效关系),虽然在理论上很漂亮,但实际应用中,它们总是被两个“拦路虎”卡住。
第一,数据又小又吵。高质量的ADMET实验数据获取成本极高,导致可用的标注数据集规模很小(很多只有几千个分子),且不同实验室、不同实验条件下得到的数据噪声很大。用这么点“破烂不堪”的数据去训练一个复杂的深度学习模型,结果往往是过拟合,模型只能死记硬背,根本学不会真正的化学规律。
第二,分子表示学习的“近视”问题。主流的图神经网络(GNN),比如GCN(Graph Convolutional Network,图卷积网络)或GIN(Graph Isomorphism Network,图同构网络),虽然能处理分子图结构,但它们本质上只会“看”一个分子的局部结构。就像管中窥豹一样,你很难指望一个模型只看一个分子的局部碎片,就能准确预测它在人体内这种复杂环境下的整体行为,比如清除率(CL)这样的系统级药代参数。现有方法大多忽略了分子与分子之间的高阶关联,而化学直觉告诉我们,结构相似的分子,其理化性质也应该相近。
传统的机器学习方法,如随机森林(RF)、支持向量机(SVM)和极限梯度提升(XGBoost),虽然在许多任务中仍是强有力的基线,但在面对数据量小、特征复杂的ADMET问题时,其泛化能力捉襟见肘。而深度学习方法,比如有向消息传递神经网络(Directed Message Passing Neural Networks, D-MPNNs),虽然能学习更丰富的分子表示,但同样受限于标注数据规模。

2. MEGA-CL框架:如何用图神经网络+外部注意力突破瓶颈?

面对这些难题,来自中国药科大学等机构的研究团队提出了一个名为MEGA-CL的分子基础模型。这个模型的名字很有深意,它代表“Molecular Foundation Model with Graph External Attention and Contrastive Learning”,也就是“结合图外部注意力和对比学习的分子基础模型”。
MEGA-CL的核心思路非常聪明:先用海量的无标注分子数据,学习一个通用的分子“语言”和“语法”,然后再用少量的任务数据“精调”,就能在特定ADMET预测中大展身手。这跟最近大火的大语言模型(LLM)的训练思路——预训练+微调——如出一辙,只不过它的研究对象是分子,而不是文字。
我们来拆解一下它的两大核心技术创新:
1. 对抗“过平滑”的GCN+骨干网络 传统的图神经网络(GNN)有一个“顽疾”:当你为了捕获更远距离的原子相互作用而堆叠更多层时,不同节点的特征会变得越来越相似,最终导致模型“失明”,这就是所谓的过平滑(Over-smoothing)现象。MEGA-CL则提出了一个增强版的图卷积网络(GCN+),它在标准GCN的基础上引入了残差连接(Residual Connection)和层标准化(Layer Normalization)。残差连接允许模型在加深网络的同时,保留原始的局部特征;层标准化则让训练过程更加稳定。这使得MEGA-CL可以构建更深、表达能力更强的网络,从而无惧过平滑的困扰,能够更精确地提取每个分子的“微观”结构特征。
2. 图全局的“外部注意力”(GEA)机制 这是MEGA-CL最令人拍案叫绝的设计。之前的模型往往只专注于分析单个分子的内部结构,忽视了分子与分子之间的联系。而MEGA-CL引入的多头图外部注意力(Graph External Attention, GEA)模块,就像是给模型配了一副全息眼镜。当模型处理一个分子时,GEA模块会去“回忆”和“对比”它在预训练阶段见过的所有分子,在广阔的化学空间中,寻找与当前分子结构相似的“同类”,并学习它们之间共有的、隐藏的理化性质模式(比如,某种特定的官能团组合,往往会降低药物的代谢稳定性)。这种对分子间高阶关联的显式建模,极大地提升了模型对未知分子的泛化能力。
图1:MEGA-CL框架概述。A. MEGA-CL的对比预训练流程。B. 分子图增强策略和MEGA-CL编码器架构。C. 用于下游ADMET预测的微调。
预训练阶段,MEGA-CL采用了一种名为对比学习(Contrastive Learning)的自我监督学习技术。简单来说,就是对同一个分子进行随机的“增广”(比如随机删除一些原子或化学键,得到一个分子的两个不同“视角”),然后让模型学习将一个分子自身的两个“视角”在表示空间中尽力拉近,同时将其与其他分子的表示推开。通过在一个包含大约1亿个未标注分子的超大数据集上进行这样的“自省”训练,模型学会了抓住一个分子最本质、最鲁棒的化学特征,这正是ADMET预测所需要的。
图1B详细展示了三种分子增广策略:原子掩码、键删除和子图移除。
当需要预测一个新化合物的ADMET性质时,我们只需要加载这个预训练好的MEGA-CL编码器,然后在具体的、少量标注的任务数据上,对模型进行微调(Fine-tuning)。由于模型已经通过预训练学会了通用的分子表示,因此只需要很少的“精调”就能在特定任务上达到极佳的效果。这就好比一个学过多种语言的翻译家,再去学一门新语言时,会非常轻松。

3. 全面实验验证:13个基准+21个ADMET任务,效果如何?

口说无凭,实验见真章。研究团队对MEGA-CL进行了极其全面的验证,覆盖了从经典基准到真实药物分子的多种场景。
首先是经典的MoleculeNet基准测试,包括7个分类和6个回归任务。结果非常亮眼:
表1:在MoleculeNet分类基准任务上的ROC-AUC结果。
表2:在MoleculeNet回归基准任务上的RMSE和MAE结果。
实验结果分析:从表1和表2看,MEGA-CL在7个分类任务上,有4个达到了最好或第二好的成绩;在6个回归任务中,更是拿下了5个最佳。这个优势在回归任务上尤其突出,因为回归任务(如预测水溶性、脂溶性等)需要模型对分子的理化性质有更精细的理解。值得注意的是,在数据量极小的FreeSolv数据集上(仅642个分子),MEGA-CL的预测误差相比排名第二的D-MPNN模型降低了约36%。这清楚地证明了MEGA-CL基於大规模预训练产生的强大泛化能力,在小样本场景下优势巨大。与同样采用对比学习的MolCLR系列模型相比,MEGA-CL在5/7的分类任务和5/6的回归任务中取得了更好或相当的指标,这清晰地验证了GEA机制和GCN+骨干网络带来的增益。
除了MoleculeNet,团队还自己构建了一个更贴近真实药物研发场景的、包含21个ADMET任务的综合基准。结果同样给力。
图2:MEGA-CL在代谢、转运、毒性和药代动力学ADMET端点上的表现。
实验结果分析:从图2可以直观地看到MEGA-CL(黄色的柱子)在大多数任务中都处于领先地位。特别值得一提的是对体内清除率(CL)和稳态分布容积(VDss)的预测。这两个参数是药代动力学的核心,也是最难预测的,因为它们涉及多个生理过程的综合效应。MEGA-CL在这两个任务上取得了最低的预测误差(RMSE),这意味着它有潜力帮助药化专家更早地筛选出具有优良药代特性的先导化合物。在连续的药代动力学回归任务上,MEGA-CL的表现更是全面占优,在包括血浆蛋白结合率(Fu)、人肝微粒体清除率(HLM)、平均滞留时间(MRT)等6个任务中,预测误差普遍低于其他对比方法。
对于回归任务,论文还进行了细致的“倍数误差”分析,如图3所示。
图3: 连续药代动力学和ADMET预测任务的倍数误差分析。
实验结果分析:这个分析非常实用。在药物研发中,一个预测值误差在2-3倍范围内,通常就被认为是可以接受且有价值的。图3显示,MEGA-CL在所有回归任务上,超过75%的预测值误差都在3倍以内。尤其对于血浆蛋白结合率(Fu)这种强结构依赖性的性质,超过75%的预测值误差仅在2倍以内。而对于像全身清除率(CL)这种极度复杂的系统级参数,预测误差虽然会大一些,但绝大多数预测仍在可控范围内。这种对预测可靠性的精细化分析,充分展示了MEGA-CL在实际应用中的潜力。

4. 真实药物验证:预测值与实验值误差仅2倍?

基准测试表现好是基础,但真正考验模型价值的,是前瞻性外部验证。团队做了两件让人信服的事:
验证一:前瞻性湿实验验证 他们选取了3个结构多样、尚未进入临床试验的候选化合物(两个天然产物和一个合成化合物),先用MEGA-CL进行预测,然后自己动手做体外实验来验证。结果展示在表3:
表3:MEGA-CL在Oroxylin A、Compound B和Icariin上的外部前瞻性验证。
实验结果分析:从表3可以看到,对于最难预测的HLMC(人肝微粒体清除率),MEGA-CL的预测值与实验值的倍数误差分别是1.48、1.66和2.25,全部在2.5倍以内!这个结果是极其惊艳的,因为在真实药物研发中,计算预测的HLMC能落在实验值的2-3倍范围内,就已经被认为是有实际指导意义的了。 此外,在15个CYP450抑制分类预测中,模型正确预测了11个,准确率高达73.3%。 这种将干实验(计算)与湿实验(实验)紧密结合的验证方式,极大地增强了MEGA-CL论文的可信度和说服力。
验证二:回顾性临床药物验证 他们还收集了18个近年来获批的FDA药物的体外代谢数据,用MEGA-CL与传统方法(RF、SVM、XGBoost)进行回溯性预测。结果如图7所示:
图7: 对21个独立药物的HLMC预测外部验证。灰色和蓝色阴影带分别代表2倍和5倍误差范围。
实验结果分析:图7非常直观。传统方法的预测点(蓝色圆点)大多数都比较分散,很多都跑到了5倍误差带之外(特别是RF,有5个点)。而MEGA-CL的预测点则紧密贴合在“完美预测线”(红色对角线)附近。定量数据显示,MEGA-CL将18个分子中的16个预测在2倍误差以内,其余两个也在3倍误差以内。这个结果几乎“吊打”了对比的传统方法,充分证明了它作为临床前筛选工具的可靠性和稳定性。

5. 可复现性与开源:代码、数据、预训练模型全公开

对于很多AI论文,研究结果的“可复现性”是一个大问题。数据、代码不放,实验结果就成了“都市传说”。这篇论文的团队在这方面做得非常优秀,真正做到了“完全开源,童叟无欺”
项目的架构清晰明了,包括以下关键文件:

mega_cl.py对比预训练主入口

finetune.py下游分类与回归微调

baseline.py传统机器学习基线

universal_predictor.py通用预测器,自动发现权重

config.yaml / config_finetune.yaml / baseline_config.yaml相应配置

dataset/数据集加载、分子图构建与增强

models/图神经网络模型定义

只要你有一台配置不算太差的服务器(官方推荐 Python 3.8+, RDKit, PyTorch 和相关库),就可以按照文档复现整个流程。团队甚至提供了通用预测脚本,可以直接用来批量预测外部分子,或者测试单个SMILES字符串。这种对社区友好的做法,无疑将极大地推动该方法的广泛应用和后续研究。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

MEGA-CL的“图外部注意力(GEA)”到底是个什么机制?和传统的注意力有啥区别?传统的GNN中的注意力机制(如Graph Attention Network, GAT)通常只在一个分子内部的原子(节点)之间进行,让模型关注当前分子中哪些原子更重要。而MEGA-CL的GEA机制,它的“注意力”是作用在多个分子之间的。具体来说,它会为预训练批次中的每个分子学习一个“全局”表示,这个表示是参考了批次内所有其他分子的信息后得出的。它通过计算当前分子与一个学习到的“外部记忆单元”(或表示为一系列可学习的基向量)之间的注意力权重,从而捕捉多个分子之间共享的、高层次的模式,这正是不同分子间特性关联的核心。

MEGA-CL的预训练数据集具体是什么?有多大?论文中提到的预训练数据量大约是1亿个未标注的分子。这个数据规模在分子预训练领域是相当巨大的。虽然论文没有明确说具体是哪个数据库,但通常这类大规模无标注分子数据会来源于ZINC、ChEMBL、PubChem等公共数据库的组合。这个庞大的数据集覆盖了极其广泛的化学空间,为模型学习通用、鲁棒的分子表示提供了坚实的基础,这也是其能在小样本任务上取得成功的关键。

这项研究的基线模型(RF, SVM, XGBoost等)是直接用了原始参数吗?这公平吗?这是一个很好的问题。在复合模型(如基于descriptor的机器学习模型)和深度图模型(如GNN)之间做公平对比是很有挑战性的。在“实验结果分析”部分,龙哥提到MCP辅助判断只是一个参考,不能直接断言绝对领先。但论文中的实验设计尽量保证了公平性:对于传统机器学习方法,他们很可能利用了分子指纹(如Morgan Fingerprint)等特征;对于深度学习方法,他们沿用了原作者推荐的设置,并统一了训练和测试划分。虽然不可避免会有一些偏差(例如,GNN的效果更大程度上依赖于超参数调试),但从多个任务、多个维度的测试结果来看,MEGA-CL的优势是普遍且一致的,这足以证明其方法的有效性,而不仅仅是“调参调赢了”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

该工作将对比学习、增强GCN和外部注意力机制有机结合起来,形成了1亿分子预训练-下游任务微调的范式。虽然单个组件(如分子图对比学习、外部注意力)已有研究,但将它们统一在一个框架内,并明确指出“建模分子间关联”这一核心思想,是对ADMET预测常见问题的精准回应,且设计了前瞻性湿实验验证,整体创新性处于顶尖水平。

实验合理度:★★★★★

实验设计非常全面且扎实。涵盖经典的MoleculeNet基准、自建的21任务ADMET基准、前瞻性湿实验验证、以及回顾性临床药物验证。对比方法既有传统机器学习(RF, SVM, XGBoost),也有先进的图模型(D-MPNN, MolCLR),并且给出了详细的统计分析(均值和标准差)。特别是在真实环境下的前瞻性验证,极大地增强了实验结果的说服力。

学术研究价值:★★★★☆

该工作为分子表示学习领域提供了一个极具参考价值的范式。它强调了高阶分子间关联的重要性,并实现了干湿结合的闭环验证。这种“大模型预训练+小样本微调”的思路,有望成为未来AI制药研究的标配,推动整个领域的进展。

稳定性:★★★★☆

在多个基准和外部验证中,MEGA-CL的结果均表现出良好的一致性和可靠性。但深度学习模型的稳定性始终是一个挑战,对于与训练集分布差异极大的全新骨架分子,其预测性能可能会下降。论文中的湿实验验证结果给了我们很强的信心,但更广泛的鲁棒性测试仍有必要。

适应性以及泛化能力:★★★★☆

模型在包含分类、回归,以及多种理化性质和ADMET终点的21个任务中取得了很好或最好的结果,证明了其强大的适应性。尤其是对小样本数据(如FreeSolv)和极具挑战的体内PK参数(CL和VDss)的有效预测,充分验证了其卓越的泛化能力。对于全新的分子骨架,其泛化能力仍需更多外部验证来确认。

硬件需求及成本:★★★☆☆

预训练阶段需要处理1亿个分子,对计算资源的要求很高(论文提到使用了多卡GPU进行数天的训练)。不过,对于只使用其预训练权重的用户来说,微调阶段的成本要低得多,通常在消费级GPU上几小时即可完成。因此,整体成本较高,但对于希望复现全部工作的研究者来说是个挑战。

复现难度:★★★★★

作者团队非常良心,公开了包括预训练代码、预训练模型权重、微调代码、基线模型代码以及数据集在内的所有资源。并且提供了清晰的文档和配置,这几乎最大程度地降低了复现的难度。任何一个有基本深度学习基础设施的团队或个人,都可以轻松复现其主要结果。

产品化成熟度:★★★☆☆

从实验结果看,MEGA-CL非常适合作为药物研发早期阶段的一项高通量筛选工具。它能够快速地对海量虚拟化合物库进行初筛,将最有希望的候选分子缩小到几十个甚至几个,再由实验科学家进行精确验证。目前它主要应用于临床前研发环节,要替代最终的临床前动物实验还为时过早,但它作为辅助决策工具的价值已经非常明显。

可能的问题:虽然模型在CL和VDss等复杂任务上表现优异,但预测误差依然存在(特别是对一个真实分子的HLMC预测。绝对的精准预测目前仍是一个尚未完全解决的难题。另外,当前验证主要基于体外和人体微粒体数据,对更复杂的体内和跨物种预测效果如何,尚需进一步评估。此外,GEA模块的有效性是否完全归因于其捕捉分子间关系的功能,还是部分由于模型参数量增加带来的效果,论文未做彻底的消融实验来完全剥离这两种影响。


主要参考文献

[1] Jin, T. et al. MEGA-CL: A Molecular Foundation Model for Generalizable ADMET Prediction through Graph External Attention and Contrastive Learning. arXiv:2607.24314.
[2] MEGA-CL GitHub 官方仓库: https://github.com/KeduJin/MEGA-CL
[3] MEGA-CL 数据集: https://doi.org/10.5281/zenodo.20793660

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
用AI预测药物代谢,MEGA-CL开源代码已上线!想和药物化学家、AI专家一起探讨分子性质预测的前沿进展?加入龙哥读论文粉丝群,扫码添加龙哥助手微信,备注:AI制药+城市+单位+昵称,即可快速入群。群内还有图像处理、大模型、自动驾驶等方向专区等你来聊!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球