← 返回 PaperDaily
视觉与图像
Yoshua Bengio团队提出S3-GFN:软约束GFlowNet让分子生成95%以上可合成!
Yoshua Bengio团队这次没走“硬核合成路线”的老路,而是搞了套软约束后训练,直接让AI生成的分子95%以上都能进实验室合成,还顺手把对接分数提到了新高度。分子设计终于要告别“纸上谈兵”了吗?来看看S3-GFN是怎么“软硬兼施”的!
龙哥读论文
发布于 2026-08-19 00:20:08
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: Yoshua Bengio团队这次没走“硬核合成路线”的老路,而是搞了套软约束后训练,直接让AI生成的分子95%以上都能进实验室合成,还顺手把对接分数提到了新高度。分子设计终于要告别“纸上谈兵”了吗?来看看S3-GFN是怎么“软硬兼施”的!
原论文信息如下:
龙哥今天要聊的这篇论文,给火热的AI分子设计泼了盆冷水,又递上一把新钥匙。很多AI模型生成的分子理论上打分高,但化学家一看就皱眉——这东西合成不出来。这篇由Yoshua Bengio团队联手Mila、KAIST等机构的最新工作,直接把这个痛点摆上台面,并用优雅的方式解决。
1. 可合成性,分子AI设计的阿喀琉斯之踵
在药物发现赛道上,AI生成小分子已不新鲜。但问题来了:这些AI“设计”的分子,真的能被合成吗?答案通常是“不能”。很多论文在模拟里分数漂亮,但一旦进入真实世界,分子要么不稳定,要么没有经济可行的合成路径。
为解决这个痛点,之前的学者想了反应型分子生成 :让AI像“乐高大师”一样,只从预定义的化学“砖块”和反应“模板”里拼接分子。但这种方法灵活性和扩展性极差 ,动作空间会组合爆炸,且完全依赖固定模板,无法利用海量SMILES数据中学到的化学“常识”。
SMILES 是一种用ASCII字符串表示分子结构的规范。大语言模型学习海量SMILES文本后能写出“通顺”的化学式,但学到的只是“语法”,不是“可合成性”。这篇论文的目标,就是教会模型生成的东西“不仅通顺,而且能造得出来”。
2. S3-GFN:用软约束“驯服”不可合成分子
Bengio团队提出了S3-GFN (Synthesizable SMILES via Soft-constrained GFlowNet),核心思想就四个字:软约束 。它不是用死板规则“框住”AI,而是通过“教育”和“引导”,让AI自觉往可合成区域走,同时保留创造力。它结合了三股力量:一个“无所不知”的化学语言模型作为先验,一个“目标明确”的奖励函数,和一个“软约束”机制。
图2:具有可行性约束的欺骗性2D网格世界。(a) 目标分布,黑色格子表示不可行状态。(b) 仅使用可行训练学到的采样分布。(c) 使用辅助对比损失Laux学到的采样分布。
GFlowNet 本质上是一种强化学习框架,但目标不是最大化单一奖励,而是学会采样出多样化、高质量的候选集合。具体到分子生成,GFlowNet把生成SMILES字符串看作逐步决策过程,通过轨迹平衡(Trajectory Balance, TB) 学习采样,保证高奖励分子被找到的概率更大。
第一阶段:正向引导(On-policy Training) 。模型像普通GFlowNet一样生成分子,但更新参数时只看“表现好”的分子——即可合成的分子。它使用相对轨迹平衡(RTB) 目标,从预训练的化学先验出发,平滑转向高奖励区域。但如果模型“误入歧途”生成不可合成分子,光靠这个阶段无法改正。
第二阶段:有错必纠(Replay Training with Contrastive Loss) 。模型维护两个“记忆库”:一个装“好孩子”(可合成分子,D+),一个装“坏孩子”(不可合成分子,D-)。回放训练时,同时从两个库抽取样本,应用对比辅助损失(Contrastive Auxiliary Loss) ,直接惩罚模型不要给“坏孩子”分配高概率。这个“软约束”从概率分布层面干预,避免了与奖励函数的冲突。
算法1展示了S3-GFN的完整流程:在策略更新时只奖励好孩子(正样本RTB),回放更新时通过对比损失惩罚坏孩子(辅助损失),从而软性地将概率质量引导至可合成区域。此外,论文还从记忆库中的好孩子“变异”出坏孩子,进一步强化对不可合成区域的“免疫”。
3. 从2D网格到真实药物:原理验证与实验效果
作者设计了一个2D网格世界来展示软约束的威力。图2显示:只用正样本训练(图b),模型在不可行区域依然分配概率;加入对比损失后(图c),模型干净利落地“绕开”了不可行区域。
在LIT-PCBA基准的五个蛋白靶点上,S3-GFN在分子对接得分上实现了对所有反应型方法的全面碾压。
反应型方法在其自身模板空间内保证100%可合成,但用外部工具AiZynthFinder 评估后,成功率暴跌到60%多。而S3-GFN通过软约束学到了更通用的可合成性知识,成功率接近100%。
4. 超越硬编码:灵活适应“千变万化”的约束
论文做了一个实验:将模型从标准的105个反应模板,切换到一个仅有32个反应、且施加了更多化学和毒性限制的约束集。结果S3-GFN仅用100步额外的后训练就能快速适应,在平均sEH得分、正样本比例和多样性指标上均优于使用了奖励塑形的基线方法。
5. 低预算下对抗“贫瘠”搜索空间
在样本受限的PMO基准上,S3-GFN在GSK3β和DRD2两个Oracle任务中取得了最高的AUC Top-10分值,超过了所有基线方法。S3-GFN得益于其离策略训练的特点,能借助外部搜索算子优化自己的“记忆库”,在有限的“投资次数”下获得最高回报。
6. 总结与展望
S3-GFN的核心贡献,是证明了“软约束” + “后训练” + “丰富化学先验” 这一策略的可行性和优越性。它没有建造通往化学合成的“高速公路”,而是在现有的SMILES“国道”上,通过“交通管制”和“导航”,高效地将车流引导到目的地。
当然,S3-GFN并非完美无缺。它对负样本质量 的依赖度很高,如果“坏孩子”样本不具代表性,模型依然可能犯错。此外,在全新合成路径的探索上,可能还比不上不设约束的“野生”生成模型。未来,这种“软约束”思想有望扩展到可降解塑料分子、新材料等领域。
龙迷三问
这篇论文解决了什么问题? 主要解决了基于SMILES的分子生成模型中,生成的分子虽然化学上合理但经常无法被合成的问题。S3-GFN在不依赖复杂硬编码反应模板的情况下,引导模型产生高比例(超过95%)且奖励得分更高的可合成分子。
GFlowNet 和普通的强化学习有什么区别? 普通RL目标是找到最大化累计奖励的策略,通常输出少数最优解。GFlowNet学习一个策略,从目标分布中采样出多样化的、与奖励成正比的样本,尤其适合药物发现任务,因为不仅需要最好的分子,还需要许多高质量候选分子。
“对比辅助损失”大概是如何起作用的? 对比损失训练一个评分员,给“可合成”卡片打出高关联度分数,给“不可合成”卡片打出低分,同时确保高相似度卡片不被搞混。公式L_aux = max(0, β + s(τ-) - s(τ+))确保模型给“好孩子”轨迹的得分至少比“坏孩子”高出一个margin β,否则产生损失,迫使模型区分。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
有效将软约束引入GFlowNet框架,对比辅助损失设计简洁有效,思路聪明。
实验合理度: ★★★★★
实验设计完整,从概念验证到标准任务、约束变化、样本限制,对比基线新且具有代表性。
学术研究价值: ★★★★☆
为将“可合成性”纳入生成模型提供了新范式,后训练阶段加入约束的思想值得借鉴。
稳定性: ★★★☆☆
受限于负样本回放缓冲区质量,若没有足够代表性负样本,性能可能波动。
适应性以及泛化能力: ★★★★☆
不同任务和约束变化下表现稳定,对约束变化的快速适应是重要亮点。
硬件需求及成本: ★★★★☆
基于SMILES的序列生成模型,计算复杂度可控,后训练只需少量额外步骤。
复现难度: ★★★★☆
代码已开源,提供详细环境配置和运行命令,复现门槛适中。
产品化成熟度: ★★★☆☆
处于研究探索阶段,要融入现有药物研发Pipeline还需更广泛验证和工程化集成。
可能的问题: 1. 对比损失系数α和margin β需手动调节。2. 对负样本回放缓冲区敏感度较高。3. 在探索全新化学空间的能力上可能不如硬约束或无约束模型。
主要参考文献
[1] Kim, H., et al. "Synthesizable Molecular Generation via Soft-constrained GFlowNets with Rich Chemical Priors." arXiv preprint arXiv:2602.04119v2 (2026).
[2] Yoshua Bengio, et al. "Generative Flow Networks." ICLR 2023.
[3] Cretu, M. et al. "SynFlowNet: Designing Molecules with Synthesis Pathways." 2025.
[4] Seo, S. et al. "RxnFlow: Integrating Synthesis Pathways into Molecular Design." 2025.
原文链接: https://arxiv.org/pdf/2602.04119v2.pdf
开源代码: https://github.com/hyeonahkimm/s3gfn
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨,理性发言~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
生成分子总是不合成?S3-GFN送你“软约束”黑科技!欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 强化学习+蒙特利尔+Mila+龙哥) ,根据格式备注,可更快被通过且邀请进群。