← 返回 PaperDaily 前沿研究

ChEMBL 36上2-3倍早期富集:还带风险提示

预算只有一小撮,分子却多到看花眼?这篇论文不跟你玩“全都要”,而是先把库压缩成可审计的Top-k,再把不确定性、适用域和风险证据一起端上桌。它更像一个实验前的“筛子”,不是最终判决书。

ChEMBL 36上2-3倍早期富集:还带风险提示
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
预算只有一小撮,分子却多到看花眼?这篇论文不跟你玩“全都要”,而是先把库压缩成可审计的Top-k,再把不确定性、适用域和风险证据一起端上桌。它更像一个实验前的“筛子”,不是最终判决书。


原论文信息如下:
论文标题:
Budget-Constrained Compound Library Prioritization with Risk Awareness and Uncertainty Quantification
发表日期:
2026年06月
发表单位:
Independent Researcher
原文链接:
https://arxiv.org/pdf/2606.26624v1.pdf
项目链接:
https://github.com/ShengyaoLiang/risk-aware-compound-library-compression
开源代码链接:
https://github.com/ShengyaoLiang/risk-aware-compound-library-compression
开源数据集链接:
https://doi.org/10.5281/zenodo.20833014

预算有限,化合物库怎么选?一个自带风险评估的“先筛”方案

做化合物筛选的人大概都懂一个扎心现实:不是分子不够多,而是预算不够多。库里可能有几十万、几百万个候选,但真正能进实验台、进采购单、进合成排期的,往往只是很小一撮。于是问题就变了——不是“能不能给每个分子打分”,而是“先测哪些最划算”。
这篇论文干的事很像实验前的“智能安检”:先把大库压缩成一个更小的 Top-k 候选集,再把不确定性、适用域证据、结构风险提示一起摆出来。它不装神弄鬼说“我已经知道谁一定能成”,而是老老实实告诉人类:哪些值得优先看,哪些要先打个问号。
封面
图2:风险感知的化合物库压缩工作流总览。先排序,再压缩,最后把风险证据一并交给实验人员审阅。
项目本身也很实用:仓库里给出了可复现脚本、冻结结果、测试、数据清单,甚至还把公开存档做了记录。对做药筛、做计算化学、做项目优先级管理的人来说,这种“能复现、能审计、能解释”的路线,比那种只会报一个漂亮分数的模型更像能上工位的工具。

核心问题:不是每个分子都能测,而是先测哪些最划算

传统分子建模常见的思路是:给每个分子预测一个活性值,然后按分数排队。这个思路没错,但它默认了一个前提——大家都能被测。现实里往往不是这样,实验预算才是最硬的门槛。库再大,第一轮能上的也就那么点;而且第一轮最怕的不是“没找到最强的”,而是“把预算花在一堆看起来很美、实际上很坑的分子上”。
所以这篇论文把问题改写成了预算约束下的化合物库优先排序。说白了就是:给定一个库和一个预算 B,别追求把每个分子都照顾到,先把有限预算用在最值得“见实验”的分子上。这里的“值得”不是单看活性分数,还要看它到底有多确定、是否落在模型熟悉的分布里、有没有明显结构风险、有没有 ADMET(吸收、分布、代谢、排泄、毒性)方面的警报。
这里有个很关键的概念要先讲清:富集。在虚拟筛选里,富集常常用“前 k% 里活性分子占比”相对“全库活性分子占比”的提升来衡量。比如 EF@1%(Enrichment Factor at 1%,1% 富集因子)就是看最前面 1% 的候选里,活性分子比例比全库平均水平高多少。它特别适合预算受限场景,因为实验人员关心的不是全局平均分,而是前排有没有货。
表1:ChEMBL 36 活性数据集与 fold-0 切分
表1:ChEMBL 36 活性数据集与 fold-0 切分。论文用大规模公开数据训练和验证,强调的是可复现的冻结工件,而不是“拍脑袋选几个样本跑一跑”。
为了避免“训练集见过、测试集又撞脸”的假成绩,论文还做了两层泄露审计:一层是标准化结构去重,另一层是Bemis–Murcko 骨架去重。前者是把完全一样的标准化分子去掉,后者更狠一点,连核心骨架都不能和训练集撞。这样做的目的很朴素:别让模型因为“见过类似题”就被误以为真的会泛化。

方法设计:保守、透明、可审计的三大支柱

这套方法最有意思的地方,不是它用了什么花里胡哨的新骨架,而是它坚持了一个很“老派但靠谱”的原则:先把事情做对,再把事情做漂亮。论文把系统拆成三层:活性代理模型、风险与不确定性证据、可审计导出层。三层之间不是谁替代谁,而是层层叠加,最后给出一个“能交给人看”的优先级列表。
第一层是活性代理模型。它没有上来就堆图神经网络、超大 transformer 之类的重武器,而是选了一个2D 结构基线:Morgan 指纹加 RDKit 描述符,再接一个多层感知机。Morgan 指纹可以理解成分子的“局部结构指纹卡”,RDKit 描述符则像分子的基础体检报告,比如分子量、疏水性、极性表面积、氢键供受体数量等。英文里 Morgan fingerprints 就是“摩根指纹”,RDKit descriptors 就是“RDKit 描述符”。
为什么要选这种“看起来不够潮”的方案?因为上游筛选层最重要的不是炫技,而是快、稳、可解释、可批量跑。这层模型的任务不是直接宣布“谁一定成药”,而是先把库里的候选排个相对顺序。用太复杂的模型,可能分数看着更酷,但解释和审计就容易变成一团浆糊。
图1:风险感知的化合物库压缩工作流
图1:风险感知的化合物库压缩工作流。输入是分子库,输出不是单一分数,而是带风险标注的 Top-k 候选集。
第二层是不确定性量化。论文用了 split-conformal prediction(分裂保形预测)。这个词听起来像学术界的咒语,实际意思并不玄:先用一部分数据训练模型,再用另一部分数据校准误差分布,最后给每个预测值配一个区间,告诉你“这个分数大概在哪个范围里”。它的优势在于规则清楚、解释直接,比单纯报一个点估计更适合做决策参考。
第三层是适用域和风险证据。适用域(applicability domain)说白了就是:这个分子长得像不像模型见过的东西,离训练分布太远的分子,分数再高也要小心。风险证据则把 ADMET、结构警报、合成难度之类的信息一起纳入。论文特别强调,这些信号不是拿来做“绝对毒性判决”的,而是拿来做优先级审阅的——先提醒人类注意,再决定要不要继续往下走。
如果把整个流程浓缩成一句话,大概就是:先用轻量模型排队,再用不确定性和风险标签给队伍“贴条”,最后把最值得花预算的分子送去实验。这比“分数高就冲”更像一个真正能落地的决策层。

实验效果:2-3倍早期富集,风险证据同步展现

先说结论:这套方法不是那种“所有指标都碾压”的神话型结果,但它在早期富集上确实有实打实的表现,而且更重要的是,它把“为什么该信、为什么要谨慎”的证据一起端出来了。对于预算有限的筛选任务,这种组合比单纯提高一个分数更有价值。
图2:Top-1% 富集汇总
图2:冻结评估工件上的 Top-1% 富集汇总。内部验证、时间外推、BACE 和 EGFR replay 都显示出早期富集能力,其中 BACE 和 EGFR 还区分了严格去重后的子集。
在 ChEMBL 36 的内部验证上,模型的 Spearman 相关和 EF@1% 都不错;到了时间外推的 holdout 上,性能下降是正常的,毕竟时间会让分布偷偷变脸。但即便如此,早期富集仍然保持在可用区间,说明这个排序器不是只会在“熟悉题”上刷分。
表2:ChEMBL 36 holdout 上的活性模型表现
表2:ChEMBL 36 holdout 上的活性模型表现。内部验证和时间外推都保留了较好的早期排序能力,说明模型不仅会背题,也能在一定程度上应对时间漂移。
更值得关注的是 BACE 外部数据。论文先做了严格的训练重叠控制:把标准化结构重叠去掉,再把骨架重叠也去掉。这个步骤很重要,因为很多虚拟筛选“看起来很强”,其实是训练集和测试集结构太像,等于考试前偷偷看了半张卷子。
表4:BACE 外部源性能与去重控制
表4:BACE 外部源性能与去重控制。严格骨架去重后,性能有所下降,但仍保留了较好的 ROC AUC 和早期富集,说明不是纯粹靠“撞脸”取胜。
严格 BACE 决策层 replay 的结果也挺有意思。原始活性排序在 Hit@10 上更高,但风险感知排序并不是傻乎乎地追求“分数最高就往前冲”,而是把一些高分但风险不明、适用域不稳的分子往后挪。换句话说,它牺牲了一点“表面命中”,换来的是更像真实项目决策的排序方式。
表6:严格 BACE 决策层 replay
表6:严格 BACE 决策层 replay。风险感知顺序改变了列表前端的组成,而不是简单把所有指标都压到更高,这恰恰符合“先筛”层的定位。
更直白一点说,这篇论文的亮点不是“把活性预测做到了多天花板”,而是把实验前的优先级决策做得更像一个工程系统:有富集、有审计、有不确定性、有风险提示。对于化合物库压缩任务,这种“能解释的好结果”往往比“黑箱里冒出来的神奇高分”更值得信。

局限与思考:这不是“最终结论”,而是一个决策层

论文自己也很克制,没有把 retrospective replay 包装成“前瞻性验证”。这一点挺难得。因为历史标签回放真正未知活性库不是一回事。前者能证明排序器在冻结数据上的工作方式,后者才是实验室真正要面对的世界。
另外,论文用的是相对保守的 2D 基线,这既是优点也是限制。优点是快、稳、可解释;限制是它对复杂三维构象、蛋白口袋细节、构象变化的捕捉能力有限。也就是说,它更适合做上游筛子,不适合被误当成“最终裁判”。
表13:分裂保形区间覆盖率
表13:分裂保形区间覆盖率。它提供的是“这个预测有多稳”的信号,但在时间漂移下覆盖率会下降,所以不能把区间当成永远有效的护身符。
还有一点要注意:风险标签不是毒理学终审,适用域也不是绝对安全证书。它们更像“红黄灯提示”。分子可以因为活性高而进前排,也可以因为风险高而被后移,但最后是否推进实验,仍然需要项目背景、靶点机制、合成可行性和人类经验一起判断。机器负责把信息摆整齐,人负责做最后的拍板。
从工程角度看,这种方法最适合放在筛选流程的前半段:先把百万级库压成几千、几百,再交给更贵的 docking、实验和人工审阅。它解决的是“先谁后谁”的问题,而不是“谁一定赢”的问题。这个边界划得清楚,反而更像一个靠谱工具。

新思路启发:换个角度,用“不确定性”辅助推荐系统

这篇论文给人的一个小启发是:推荐系统不一定只看“喜欢不喜欢”,也可以看“稳不稳、靠不靠谱”。化合物优先级其实就很像推荐:在一堆候选里挑少数最值得点击、最值得试、最值得花钱的对象。
如果把这个思路迁移到别的场景,比如商品推荐、内容推荐、候选人排序,单纯的点击率预测也许不够,最好再加上不确定性、分布外风险、规则约束和审计信息。这样系统就不只是“猜一个分数”,而是“给一个能放心用的排序建议”。
对论文写作也有启发:很多工作总想着往模型结构上卷,结果最后只剩参数很多、故事很满、落地很虚。反过来,如果先把决策场景讲清楚,再把证据层、风险层、审计层分开设计,论文会更像一个能被别人拿去用的系统,而不是一个只适合在附录里发光的分数表。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“预算有限时,先测哪些分子更划算”的问题。不是给每个分子都下最终判决,而是先把库压缩成一个带风险标注、带不确定性说明的优先级列表。

EF@1% 是什么意思?EF@1% 是“前 1% 候选的活性富集倍数”,英文全称是 Enrichment Factor at 1%,中文可理解为“1% 富集因子”。它衡量的是前排候选是不是比全库平均更容易命中活性分子。

不确定性量化和适用域有什么区别?不确定性量化告诉你“这个预测有多稳”,适用域告诉你“这个分子像不像模型见过的东西”。前者偏预测可信度,后者偏输入是否离谱,两者一起用,才更适合做实验前筛选。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆ 不是在模型结构上硬卷新花样,而是在“预算受限筛选”这个真实问题上,把优先级、风险和不确定性绑在一起,思路实用。

实验合理度:★★★★☆ 有内部验证、时间外推、严格去重外部集和 label-hidden replay,审计意识很强;不过部分结论仍属于回放型验证,不能冒充前瞻实验。

学术研究价值:★★★☆☆ 对化合物筛选决策层有明确启发,尤其适合做上游压缩与审阅辅助,但理论上更偏系统工程而非新算法范式。

稳定性:★★★★☆ 采用 2D 基线、保形区间和风险标签,整体比较稳;但时间漂移下覆盖率会下降,说明还不能把它当“永不失手”的神器。

适应性以及泛化能力:★★★☆☆ 在 ChEMBL、BACE 这类公开任务上能工作,但跨项目、跨靶点的真实泛化仍需前瞻验证。

硬件需求及成本:★★★★☆ Morgan 指纹 + MLP 这套组合很省事,适合批量跑;比起大模型路线,训练和推理成本都友好。

复现难度:★★★★☆ 仓库、脚本、结果和数据清单都给得比较全,复现门槛不高,但要严格复现审计流程仍需认真对齐环境。

产品化成熟度:★★★☆☆ 适合做实验前的优先级过滤器,离“直接替代实验决策”还有距离;更像一个靠谱的前置筛选模块。

可能的问题:回放验证强于前瞻验证,风险信号偏辅助而非终审;若拿去直接做项目结论,容易把“排序工具”误当“答案机器”。


主要参考文献

1. Shengyao Liang. Budget-Constrained Compound Library Prioritization with Risk Awareness and Uncertainty Quantification. arXiv:2606.26624v1, 2026.
2. 项目开源代码:https://github.com/ShengyaoLiang/risk-aware-compound-library-compression
3. 开源数据集:https://doi.org/10.5281/zenodo.20833014
4. 项目说明与复现入口:仓库 README、scripts/、results/ 与 tests/ 目录。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
预算有限,先筛谁最值钱?来群里聊聊这种“少花钱、多办事”的分子优先级打法吧~
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。