← 返回 PaperDaily 视觉与图像

Yoshua Bengio团队提出S3-GFN:软约束GFlowNet让分子生成95%以上可合成!

Yoshua Bengio团队这次没走“硬核合成路线”的老路,而是搞了套软约束后训练,直接让AI生成的分子95%以上都能进实验室合成,还顺手把对接分数提到了新高度。分子设计终于要告别“纸上谈兵”了吗?来看看S3-GFN是怎么“软硬兼施”的!

Yoshua Bengio团队提出S3-GFN:软约束GFlowNet让分子生成95%以上可合成!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
Yoshua Bengio团队这次没走“硬核合成路线”的老路,而是搞了套软约束后训练,直接让AI生成的分子95%以上都能进实验室合成,还顺手把对接分数提到了新高度。分子设计终于要告别“纸上谈兵”了吗?来看看S3-GFN是怎么“软硬兼施”的!


原论文信息如下:
论文标题:
Synthesizable Molecular Generation via Soft-constrained GFlowNets with Rich Chemical Priors
发表日期:
2026年02月
发表单位:
Mila - Quebec AI Institute, 蒙特利尔大学, KAIST, 印第安纳大学
原文链接:
https://arxiv.org/pdf/2602.04119v2.pdf
开源代码链接:
https://github.com/hyeonahkimm/s3gfn
龙哥今天要聊的这篇论文,给火热的AI分子设计泼了盆冷水,又递上一把新钥匙。很多AI模型生成的分子理论上打分高,但化学家一看就皱眉——这东西合成不出来。这篇由Yoshua Bengio团队联手Mila、KAIST等机构的最新工作,直接把这个痛点摆上台面,并用优雅的方式解决。

1. 可合成性,分子AI设计的阿喀琉斯之踵

在药物发现赛道上,AI生成小分子已不新鲜。但问题来了:这些AI“设计”的分子,真的能被合成吗?答案通常是“不能”。很多论文在模拟里分数漂亮,但一旦进入真实世界,分子要么不稳定,要么没有经济可行的合成路径。
为解决这个痛点,之前的学者想了反应型分子生成:让AI像“乐高大师”一样,只从预定义的化学“砖块”和反应“模板”里拼接分子。但这种方法灵活性和扩展性极差,动作空间会组合爆炸,且完全依赖固定模板,无法利用海量SMILES数据中学到的化学“常识”。
SMILES是一种用ASCII字符串表示分子结构的规范。大语言模型学习海量SMILES文本后能写出“通顺”的化学式,但学到的只是“语法”,不是“可合成性”。这篇论文的目标,就是教会模型生成的东西“不仅通顺,而且能造得出来”。

图1:S3-GFN方法概述
图1:通过软约束GFlowNet实现可合成SMILES生成(S3-GFN)概述。预训练的SMILES先验提供化学合理性,并通过相对轨迹平衡(RTB)持续参考。在策略更新仅对正样本使用RTB,而回放更新引入对比辅助损失,分离正负样本的同时保留共享子结构。

2. S3-GFN:用软约束“驯服”不可合成分子

Bengio团队提出了S3-GFN(Synthesizable SMILES via Soft-constrained GFlowNet),核心思想就四个字:软约束。它不是用死板规则“框住”AI,而是通过“教育”和“引导”,让AI自觉往可合成区域走,同时保留创造力。它结合了三股力量:一个“无所不知”的化学语言模型作为先验,一个“目标明确”的奖励函数,和一个“软约束”机制。
图2:具有可行性约束的欺骗性2D网格世界。(a) 目标分布,黑色格子表示不可行状态。(b) 仅使用可行训练学到的采样分布。(c) 使用辅助对比损失Laux学到的采样分布。

核心概念一:GFlowNets
GFlowNet本质上是一种强化学习框架,但目标不是最大化单一奖励,而是学会采样出多样化、高质量的候选集合。具体到分子生成,GFlowNet把生成SMILES字符串看作逐步决策过程,通过轨迹平衡(Trajectory Balance, TB)学习采样,保证高奖励分子被找到的概率更大。
S3-GFN的两阶段“驯服”过程
第一阶段:正向引导(On-policy Training)。模型像普通GFlowNet一样生成分子,但更新参数时只看“表现好”的分子——即可合成的分子。它使用相对轨迹平衡(RTB)目标,从预训练的化学先验出发,平滑转向高奖励区域。但如果模型“误入歧途”生成不可合成分子,光靠这个阶段无法改正。
第二阶段:有错必纠(Replay Training with Contrastive Loss)。模型维护两个“记忆库”:一个装“好孩子”(可合成分子,D+),一个装“坏孩子”(不可合成分子,D-)。回放训练时,同时从两个库抽取样本,应用对比辅助损失(Contrastive Auxiliary Loss),直接惩罚模型不要给“坏孩子”分配高概率。这个“软约束”从概率分布层面干预,避免了与奖励函数的冲突。
伪代码中的“驯服”逻辑
算法1展示了S3-GFN的完整流程:在策略更新时只奖励好孩子(正样本RTB),回放更新时通过对比损失惩罚坏孩子(辅助损失),从而软性地将概率质量引导至可合成区域。此外,论文还从记忆库中的好孩子“变异”出坏孩子,进一步强化对不可合成区域的“免疫”。

3. 从2D网格到真实药物:原理验证与实验效果

作者设计了一个2D网格世界来展示软约束的威力。图2显示:只用正样本训练(图b),模型在不可行区域依然分配概率;加入对比损失后(图c),模型干净利落地“绕开”了不可行区域。

实验结果一:sEH目标优化
图3:不同MDP在sEH任务上的比较
图3:不同MDP在sEH任务上的比较。S3-GFN在AiZynthFinder上取得了更高的成功率,并发现了持续具有更高sEH评分的候选分子。

表1:sEH任务结果
表1:S3-GFN在正样本比例高达0.945,前100个可合成分子的平均sEH得分和整体平均sEH得分上全面超越了基于反应的方法SynFlowNet (SFN)。

图4:前2名候选分子的合成路径示例
图4:在给定反应模板R和构件库M下,前2名候选分子的合成路径示例。

图9:对图4中前2名候选分子的AiZynthFinder结果
图9:对图4中前2名候选分子的AiZynthFinder结果,进一步验证了其可合成性。
表5:基于SMILES的模型在sEH任务上的结果
表5:S3-GFN与其他基于SMILES的方法相比,在正样本比例和Top-100得分上同样表现优异。

实验结果二:基于结构的药物发现(SBDD)
在LIT-PCBA基准的五个蛋白靶点上,S3-GFN在分子对接得分上实现了对所有反应型方法的全面碾压。
表2:LIT-PCBA五个受体上Top-100多样模式的Vina得分和可合成性
表2:S3-GFN在平均Vina得分和AiZynthFinder成功率上均取得最佳成绩,成功率接近100%,远超其他方法。

图5:ALDH1对接结果(Top-3)
图5:ALDH1对接结果(Top-3),分子与靶点空间显示出良好的形状互补性。

反应型方法在其自身模板空间内保证100%可合成,但用外部工具AiZynthFinder评估后,成功率暴跌到60%多。而S3-GFN通过软约束学到了更通用的可合成性知识,成功率接近100%。
插图

4. 超越硬编码:灵活适应“千变万化”的约束

论文做了一个实验:将模型从标准的105个反应模板,切换到一个仅有32个反应、且施加了更多化学和毒性限制的约束集。结果S3-GFN仅用100步额外的后训练就能快速适应,在平均sEH得分、正样本比例和多样性指标上均优于使用了奖励塑形的基线方法。
表3:约束变化下的性能表现
表3:约束条件改变后,S3-GFN仅用100步额外后训练就能快速适应,优于奖励塑形方法。

图6:约束变化下似然保留和分离能力的比较
图6:对比辅助损失能有效分离正负样本,同时保留Top-K正样本的log p(x)值。

表8:更严酷约束变化下的性能表现
表8:即使在更严酷的约束变化(只有15或10个可用反应)下,S3-GFN依然保持相对稳定的性能。

5. 低预算下对抗“贫瘠”搜索空间

在样本受限的PMO基准上,S3-GFN在GSK3β和DRD2两个Oracle任务中取得了最高的AUC Top-10分值,超过了所有基线方法。S3-GFN得益于其离策略训练的特点,能借助外部搜索算子优化自己的“记忆库”,在有限的“投资次数”下获得最高回报。
表4:AUC Top-10
表4:在样本受限的PMO基准上,S3-GFN在GSK3β和DRD2任务中取得最高AUC Top-10分值。

图11:GSK3β和DRD2的Top-10优化曲线
图11:S3-GFN在有限的样本量下,Top-10平均奖励持续攀升,显著优于其他方法。

表10:有/无变异负样本的S3-GFN对比
表10:引入变异负样本后,模型在GSK3β和DRD2上的表现进一步提升。

6. 总结与展望

S3-GFN的核心贡献,是证明了“软约束” + “后训练” + “丰富化学先验”这一策略的可行性和优越性。它没有建造通往化学合成的“高速公路”,而是在现有的SMILES“国道”上,通过“交通管制”和“导航”,高效地将车流引导到目的地。
当然,S3-GFN并非完美无缺。它对负样本质量的依赖度很高,如果“坏孩子”样本不具代表性,模型依然可能犯错。此外,在全新合成路径的探索上,可能还比不上不设约束的“野生”生成模型。未来,这种“软约束”思想有望扩展到可降解塑料分子、新材料等领域。

图10:S3-GFN生成的正样本分子示例
图10:S3-GFN生成的正样本分子示例。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决了什么问题?主要解决了基于SMILES的分子生成模型中,生成的分子虽然化学上合理但经常无法被合成的问题。S3-GFN在不依赖复杂硬编码反应模板的情况下,引导模型产生高比例(超过95%)且奖励得分更高的可合成分子。

GFlowNet 和普通的强化学习有什么区别?普通RL目标是找到最大化累计奖励的策略,通常输出少数最优解。GFlowNet学习一个策略,从目标分布中采样出多样化的、与奖励成正比的样本,尤其适合药物发现任务,因为不仅需要最好的分子,还需要许多高质量候选分子。

“对比辅助损失”大概是如何起作用的?对比损失训练一个评分员,给“可合成”卡片打出高关联度分数,给“不可合成”卡片打出低分,同时确保高相似度卡片不被搞混。公式L_aux = max(0, β + s(τ-) - s(τ+))确保模型给“好孩子”轨迹的得分至少比“坏孩子”高出一个margin β,否则产生损失,迫使模型区分。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

有效将软约束引入GFlowNet框架,对比辅助损失设计简洁有效,思路聪明。

实验合理度:★★★★★

实验设计完整,从概念验证到标准任务、约束变化、样本限制,对比基线新且具有代表性。

学术研究价值:★★★★☆

为将“可合成性”纳入生成模型提供了新范式,后训练阶段加入约束的思想值得借鉴。

稳定性:★★★☆☆

受限于负样本回放缓冲区质量,若没有足够代表性负样本,性能可能波动。

适应性以及泛化能力:★★★★☆

不同任务和约束变化下表现稳定,对约束变化的快速适应是重要亮点。

硬件需求及成本:★★★★☆

基于SMILES的序列生成模型,计算复杂度可控,后训练只需少量额外步骤。

复现难度:★★★★☆

代码已开源,提供详细环境配置和运行命令,复现门槛适中。

产品化成熟度:★★★☆☆

处于研究探索阶段,要融入现有药物研发Pipeline还需更广泛验证和工程化集成。

可能的问题:1. 对比损失系数α和margin β需手动调节。2. 对负样本回放缓冲区敏感度较高。3. 在探索全新化学空间的能力上可能不如硬约束或无约束模型。


主要参考文献

[1] Kim, H., et al. "Synthesizable Molecular Generation via Soft-constrained GFlowNets with Rich Chemical Priors." arXiv preprint arXiv:2602.04119v2 (2026).
[2] Yoshua Bengio, et al. "Generative Flow Networks." ICLR 2023.
[3] Cretu, M. et al. "SynFlowNet: Designing Molecules with Synthesis Pathways." 2025.
[4] Seo, S. et al. "RxnFlow: Integrating Synthesis Pathways into Molecular Design." 2025.

原文链接: https://arxiv.org/pdf/2602.04119v2.pdf
开源代码: https://github.com/hyeonahkimm/s3gfn

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨,理性发言~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

end
生成分子总是不合成?S3-GFN送你“软约束”黑科技!欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 强化学习+蒙特利尔+Mila+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。