← 返回 PaperDaily
前沿研究
抗体生成不再乱跑:ABOPD的后训练思路
抗体CDR设计最怕“训练时很乖,生成时乱跑”。这篇论文直接把在线策略蒸馏搬进扩散轨迹里,让教师盯着学生自己走出来的状态纠偏,RAbD上把CDR-H3 RMSD压到1.95Å,思路很硬,结果也很实在。
龙哥读论文
发布于 2026-08-14 09:11:22
阅读 3
查看原文
原论文信息如下:
抗体设计为何存在“训练-生成”状态不匹配?
抗体设计最麻烦的地方,不是“能不能生成一个看起来像样的序列”,而是“这个序列折出来以后,能不能真的站在抗原面前不塌、不歪、不撞车”。尤其是 CDR(complementarity-determining region,互补决定区) ,它就是抗体真正抓抗原的那几段“手指头”,其中 CDR-H3 最难搞:长度变化大、构象最灵活、还必须两头接在框架上,稍微一漂,后面就像多米诺骨牌一样连锁崩。在蛋白质设计领域,CDR-H3 的生成质量直接决定了抗体能否有效结合靶标,因此它一直是计算方法学研究的焦点。然而,现有的扩散模型虽然在许多生成任务上表现优异,但在处理这种具有严格几何约束的环状结构时,却暴露出了一个根本性的缺陷:训练和生成时的状态分布不一致。
这篇论文盯住的,就是一个很现实但经常被忽略的问题:训练时看到的“脏状态”,和生成时自己一步步走出来的状态,不是同一类东西 。标准扩散训练通常是把天然结构加噪,再让模型学会去噪;这类输入可以叫做 reference-derived states(参考派生状态) ,也就是从真实结构扰动出来的状态。问题在于,真正生成时并不是一直盯着真实结构加噪,而是模型自己前一步的输出接下一步,像一个人闭着眼睛走迷宫,走偏一次,后面就可能越走越歪。这种递归式的误差累积,在蛋白质结构生成中尤为致命,因为蛋白质的主链骨架是一个高度耦合的系统,一个二面角的微小偏差,经过几个残基的传递后,可能会被放大为整个环的显著位移。
这就带来了一个很朴素的工程问题:训练时模型学的是“理想考试卷”,生成时拿到的是“自己做出来的草稿” 。草稿越写越歪,后面的去噪就越难救。对抗体 CDR 来说,这个偏差尤其致命,因为它不是只影响一个点,而是会影响整个环的框架锚定、朝向、与抗原的接触面,最后表现成 RMSD 变大、碰撞变多、界面几何不对劲。更具体地说,当模型在生成过程中产生了一个略微偏离真实坐标的 Cα 位置时,后续的去噪步骤会基于这个错误的位置进行预测,从而产生一个更大的偏差。这种正反馈式的误差放大,是导致许多扩散模型在生成复杂环结构时性能不佳的根本原因。
论文把这个现象说得很直白:去噪轨迹是递归的,误差会积累 。标准监督只盯着参考派生状态,等于在“正确题库”上刷题;但生成时面对的是模型自己滚出来的状态,这些状态可能已经偏离参考分布。于是,后面的监督越来越像“对着已经歪掉的尺子继续量”,量得再准,也救不回前面那一截漂移。这种训练与生成之间的分布偏移,在强化学习中被称为“分布外”问题,而在扩散模型的语境下,它表现为模型在推理时遇到的中间状态,与训练时见过的任何状态都不同。ABOPD 的核心贡献,就是提出了一种系统性的方法来解决这个分布偏移问题,而不是简单地增加训练数据或模型容量。
ABOPD核心机制:在线策略蒸馏如何纠正骨干漂移?
ABOPD 的全称是 Antibody design framework built on On-Policy Distillation ,中文可以理解为“基于在线策略蒸馏的抗体设计框架”。这里的关键词是 On-Policy Distillation(在线策略蒸馏) :不是拿静态参考状态喂老师,而是让老师直接看学生自己在生成过程中走到的状态,再给出纠偏信号。这个思路有点像教练不只看标准答案,而是专门盯着学员“自己做题时最容易翻车的那几步”。在机器学习中,蒸馏通常是指用一个更大的教师模型来指导一个更小的学生模型。但 ABOPD 的创新之处在于,它不是在固定的数据集上进行蒸馏,而是在学生模型自己的生成轨迹上进行。这意味着教师模型提供的监督信号,是专门针对学生模型当前犯的错误而量身定制的。
整套方法其实分三层,逻辑很清楚。第一层是 混合预训练 ,把单 CDR、多 CDR、全六条 CDR 的掩码一起学掉,得到一个更通用的 H-DiffAb;第二层是 骨干感知教师适配 ,把原始天然几何里本来就存在、但生成时不可见的信息,作为“特权信息”塞给教师;第三层才是 ABOPD 的核心:在学生自己的 rollout 状态上做蒸馏 ,并且只蒸馏最能纠正几何漂移的 Cα 坐标分支。这种分层设计使得每一步的改进都建立在稳固的基础上。混合预训练确保了模型有一个强大的起点,骨干感知教师适配让教师能够提供更精准的指导,而最终的在线蒸馏则直接针对生成过程中的核心痛点。
这里的“骨干”不是乱说的骨气,而是抗体主链的 backbone。论文把教师做成 backbone-aware teacher(骨干感知教师) ,做法也不花哨:在原模型编码器里加两层轻量残差 MLP,用原生结构里能拿到的 Cα 中心坐标、原子有效性掩码、以及目标到复合物的距离特征去增强表示。这样教师在看同一个 noisy state 时,能更准确地知道“这个环本来应该往哪儿站”。特权信息的概念在机器学习中并不新鲜,但将其应用于蛋白质结构生成,特别是用于构建一个更强大的教师模型,是一个巧妙的设计。这些信息在训练时是已知的,但在推理时是未知的,因此教师可以学习到从噪声状态到真实结构的更精确的映射。
为什么只蒸馏 Cα 坐标转移 ,而不是把序列、方向一起全蒸了?论文的判断很务实:几何漂移最直接影响的是环的位置和框架锚定,而这些首先由坐标决定。序列当然重要,但序列本身不能直接把一个已经偏掉的环“拽回正确空间”;方向信息也只能描述局部框架,不能单独修正整体平移。换句话说,想纠正骨架,先抓坐标 ,这比一股脑把所有分支都拉进来更干净。这种“抓主要矛盾”的思路,体现了作者对问题本质的深刻理解。在蛋白质结构中,Cα 坐标构成了主链骨架的“脊椎”,决定了整个环的走向和位置。一旦 Cα 坐标被纠正,侧链的方向和序列的恢复就有了一个正确的几何基础。因此,将蒸馏的焦点集中在 Cα 坐标上,是一种高效且精准的纠偏策略。
ABOPD 还有一个很关键的设计:在线蒸馏不是单独上阵,外面还套着原始去噪损失当锚点 。如果只做 on-policy 坐标监督,模型可能会为了追教师而忘掉自己本来的序列、坐标、方向联合建模能力;所以论文保留了标准去噪项,让它继续在参考派生状态上训练,像一根安全绳,防止学生在追老师时把自己训练歪。这个设计体现了工程上的稳健性。在线蒸馏提供了强大的纠偏信号,但同时也可能引入噪声或导致模型过拟合到特定的 rollout 轨迹上。通过保留原始的离线去噪损失,模型能够保持其在标准任务上的泛化能力,从而在“纠正错误”和“保持能力”之间取得一个良好的平衡。
从优化目标上看,ABOPD 其实是一个混合状态分布的目标:一部分监督来自参考派生状态,负责保住原有能力;另一部分监督来自学生 rollout 状态,负责修正真实生成路径上的误差。这个组合拳很像“既练标准动作,又纠正实战姿势”,比只练标准动作更接近真实生成场景。这种混合训练策略,使得模型在训练时能够同时接触到两种不同的数据分布,从而学习到一个更加鲁棒和通用的去噪函数。它不再仅仅是一个在理想数据上表现良好的“考试型选手”,而是一个能够在充满挑战的真实生成环境中稳定发挥的“实战型选手”。
实验验证:CDR-H3 RMSD降低0.42Å,远超现有方法
实验设计很标准,也很能说明问题。数据来自 SAbDab,按 CDR-H3 序列 50% 相似度聚类后划分训练和测试;评测分成两个场景:一个是 同时重设计六条 CDR ,另一个是更难的 RAbD CDR-H3 生成 。前者看整体协同,后者看最难啃的 H3 环到底能不能稳住。这种双场景的评测设计非常全面。同时重设计六条 CDR 考验的是模型在复杂多任务环境下的协同优化能力,而 RAbD CDR-H3 生成则是一个被广泛认可的基准测试,专门用于评估模型在最具挑战性的 CDR-H3 环上的生成能力。在这两个场景上都取得优异表现,有力地证明了 ABOPD 方法的通用性和有效性。
先看多 CDR 场景。ABOPD 相比 H-DiffAb,把六条 CDR 的整体几何都往前推了一步,H3 的 RMSD 从 2.94 Å 降到 2.48 Å,碰撞率也同步下降。这个结果的含义不是“序列突然神了”,而是环的位置更准、界面更稳、骨架更少乱撞 。对抗体设计来说,少一点撞车,往往比多几个百分点的序列恢复更值钱。在蛋白质设计中,一个结构上合理但序列恢复率略低的候选分子,其后续通过实验进行优化的潜力,远大于一个序列看似完美但结构上存在严重冲突的分子。因此,ABOPD 在几何指标上的显著提升,具有更高的实际应用价值。
再看外部 RAbD 基准,这里更能说明方法是不是“只在自家数据上会演”。ABOPD 把 CDR-H3 RMSD 从 2.37 Å 压到 1.95 Å ,相当于减少了 0.42 Å。这个数看起来不大,但在蛋白结构里,0.4 Å 往往就是“看上去差不多”和“界面真能用”之间的分界线。更重要的是,AAR 只从 36.35% 小幅涨到 37.31%,说明它不是靠乱猜序列换来的,而是靠几何恢复带来的真实收益。在结构生物学中,通常认为 RMSD 低于 2.0 Å 的模型具有较高的可信度。ABOPD 将 CDR-H3 的 RMSD 压到 1.95 Å,意味着其生成的结构在骨架层面已经达到了可以与实验结构相媲美的精度。这对于后续的虚拟筛选和药物设计具有重要的指导意义。
论文还做了一个很有说服力的对比:ABOPD 不仅比原始 H-DiffAb 强,也比 SFT(supervised fine-tuning,监督微调) 和 offline distillation(离线蒸馏) 更稳。这个结论很关键,因为它说明提升不是“继续训练一下就行”,而是必须把监督放到学生自己走出来的轨迹上,状态分布对了,纠偏才有意义。这个对比实验是 ABOPD 方法有效性的“金标准”。SFT 和离线蒸馏代表了两种常见的后训练策略,但它们都没有解决训练和生成状态分布不一致的问题。ABOPD 在这两种方法之上取得的额外提升,无可辩驳地证明了其核心创新——在线策略蒸馏——的必要性和优越性。
图3 里有个很重要的判断:ABOPD 的结构提升并不是简单“记住训练集最近邻”的结果。序列分布虽然和训练集有重叠,但生成结构更接近天然目标,而不是更接近最近训练邻居。这说明它不是在做检索式拼接,而是在生成轨迹上真的把几何修正了。这个区别很重要,不然就容易把“像训练集”误当成“像真实抗体”。这个发现打消了人们对于模型可能只是“过拟合”或“记忆”训练数据的疑虑。它表明 ABOPD 确实学习到了蛋白质折叠的底层几何规律,并能够在生成过程中应用这些规律来纠正自身的误差,从而产生出超越训练数据分布的高质量结构。
为了避免“结果好只是因为训练更久”这种质疑,论文还把 SFT、离线蒸馏和 ABOPD 放在同一个初始化上比较。结果很直接:SFT 和离线蒸馏都离 H-DiffAb 不远,ABOPD 却持续往下走,RMSD 一步步压低。也就是说,真正起作用的不是继续学,而是换到了正确的监督状态分布 。这个控制实验的设计非常严谨。通过确保所有方法从相同的起点开始训练,并控制训练步数等变量,论文排除了其他干扰因素,将性能提升的唯一原因归结为 ABOPD 独特的在线蒸馏机制。这为方法的有效性提供了最坚实的证据。
从工程角度看,这类结果比“某个大模型在某个榜单上多了 0.3 分”更有意义,因为它说明方法改的是训练分布与生成分布的错位 ,这属于结构性问题,不是靠堆参数就能糊过去的。对蛋白生成来说,结构性问题往往才是真问题。在深度学习领域,许多改进是通过增加模型容量、训练数据或计算资源来实现的。而 ABOPD 的贡献在于,它从算法层面解决了一个根本性的结构性问题。这种类型的改进通常具有更好的泛化性和鲁棒性,并且能够为后续的研究提供更深刻的洞见。
这篇论文最有意思的地方,不只是“蒸馏有用”,而是它把时间维度也拆开了看。结果发现,教师的优势不是均匀分布在整个去噪过程里,而是在后期更明显 。这很符合直觉:前期状态太噪,模型还在粗定位;到了后期,结构开始成形,哪怕一点点坐标偏差,都可能把环推离正确锚点,这时候教师纠偏的价值就放大了。这个发现揭示了在线蒸馏发挥作用的具体机制。它并非在所有时间步上都提供同等的帮助,而是在最关键、最需要精细调整的后期阶段发挥最大效用。这为未来设计更高效的蒸馏策略提供了重要指导,例如可以只在后期时间步上进行蒸馏,从而节省计算资源。
图4 和图6 结合起来看,机制就很清楚了:rollout 状态上的误差会随着去噪推进而积累 ,而教师在这些状态上能给出更接近原生目标的修正方向。论文里还画了“教师校正向量”和“天然修正向量”的夹角,结果表明教师给出的方向更贴近原生几何,尤其在 rollout 状态上更明显。这说明教师不是在瞎补,而是在帮学生回到正确的几何轨道上。通过可视化校正向量的方向,论文提供了一种直观的方式来理解教师模型的工作原理。它不仅仅是告诉学生“你的坐标错了”,而是具体地指出“你应该往哪个方向移动才能回到正确的轨道上”。这种精细的指导,是 ABOPD 能够取得优异性能的关键。
这里还有一个很实在的结论:教师的校正不是越早越好,而是越接近结构定型越值钱 。前期噪声太大,教师也很难精确纠偏;后期结构已经半成型,教师给出的几何修正就更容易被学生吸收,最终变成更低的 RMSD 和更少的碰撞。这也是为什么 ABOPD 选取多个后期时间步做缓存蒸馏,而不是全程平均撒网。这个结论对于实际应用具有重要的指导意义。它意味着我们不需要在整个扩散轨迹上都进行昂贵的在线蒸馏,而可以将计算资源集中在最关键的后半段。这种“好钢用在刀刃上”的策略,可以显著提高训练效率,同时保持甚至提升最终的性能。
顺手再说一句,这类分析也解释了为什么简单 SFT 不够。SFT 只是在参考派生状态上继续训练,等于继续喂“标准草稿”;但真正出问题的是模型自己滚出来的状态。ABOPD 把监督放到这些状态上,相当于在“最容易歪的地方”加了刹车,这才是它的核心价值。这个类比非常形象。SFT 就像是在驾校的标准化赛道上反复练习,而 ABOPD 则是在真实的、充满不确定性的道路上进行实战训练。只有在实战中暴露问题并加以纠正,驾驶员(模型)才能真正掌握应对复杂路况(生成轨迹)的能力。
ABOPD 的价值,不在于它把一个指标“卷”高了多少,而在于它把抗体生成里一个很真实的工程痛点讲透了:训练分布和生成分布不一致,后期误差会被递归放大 。它的解决办法也很朴素但有效:让教师去看学生真正会走到的状态,再在最容易漂移的几何分支上施加监督,同时保留原始去噪目标避免跑偏。这篇工作的核心贡献,是提出并验证了一个解决生成模型分布偏移问题的通用框架。虽然它是在抗体 CDR 设计这个特定任务上实现的,但其背后的思想——通过在线策略蒸馏来对齐训练和生成时的状态分布——具有广泛的适用性。
这套思路的启发不只属于抗体设计。凡是“训练时看到的状态”和“生成时真正经历的状态”不一致的生成任务,都可能吃这一套:蛋白设计、分子生成、递归式结构细化,甚至一些多步规划任务,都会遇到类似的状态偏移问题。说白了,不是模型不会学,而是学的场景和上场的场景不一样 。这个观点点出了当前许多生成模型面临的共同挑战。无论是图像生成、文本生成还是蛋白质生成,模型在训练时看到的都是完美的数据,而在推理时却需要从随机噪声或部分信息中逐步构建出完整的结果。ABOPD 为解决这类问题提供了一个极具启发性的思路。
当然,这篇论文也不是没有边界。第一,它的提升主要集中在骨架几何恢复上,序列恢复并没有同幅度跃升;第二,方法仍然依赖较复杂的预训练、教师适配和 rollout 蒸馏流程,工程成本不算低;第三,目前核心蒸馏目标还是 Cα 坐标,离真正的全原子级抗体设计还有一段距离。换句话说,ABOPD 更像是把“骨架纠偏”这件事做扎实了,而不是一口气把抗体设计的所有难题都端了。作者在论文中也坦诚地讨论了这些局限性。序列恢复率提升有限,说明在侧链 packing 和序列优化方面还有很大的改进空间。复杂的训练流程也意味着该方法在落地应用时可能需要较高的计算资源。从 Cα 到全原子,更是需要跨越的一大步。
但它的方向是对的,而且很工程。比起空喊“更强的生成模型”,这篇工作至少回答了一个更难也更重要的问题:怎么让模型在自己走出来的路上别摔跤 。这类问题一旦想明白,后面很多蛋白生成任务就能顺着这个思路继续往下做。ABOPD 为蛋白质生成领域树立了一个新的标杆。它证明了通过精心设计的后训练策略,可以显著提升现有扩散模型的生成质量。未来的工作可以沿着这个方向继续深入,例如探索更高效的蒸馏策略、将蒸馏目标扩展到全原子级别、或者将在线策略蒸馏与其他生成模型架构相结合。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是抗体 CDR 生成里“训练时见到的状态”和“真正生成时走到的状态”不一致的问题。ABOPD 不是单纯继续去噪,而是让教师在学生自己的生成轨迹上纠正 Cα 骨架漂移,因此更适合修复后期几何误差。
为什么只蒸馏 Cα 坐标,不把序列和方向一起蒸? 因为 Cα 坐标最直接决定环的位置、框架锚定和抗原界面摆放,属于“先救骨架”的核心变量。序列和方向当然重要,但它们不能单独把一个已经漂移的环拉回正确空间,所以论文把它们留给原始去噪锚点继续监督。
ABOPD 的提升能直接理解成“更会背答案”吗? 不能。图3 已经说明,生成结构更接近天然目标,而不是更接近训练集最近邻,说明它不是简单检索或记忆,而是对生成轨迹上的几何误差做了真正纠偏。
如果还有哪些想继续追问的,欢迎在评论区继续留言,抗体设计这条线,后面还有不少坑值得慢慢拆。
龙哥点评
论文创新性分数: ★★★★☆
把 on-policy distillation 放进抗体 CDR 的扩散生成里,方向挺新,尤其是“只在学生 rollout 状态上蒸馏 Cα 坐标”这个切口很准,不是泛泛地做后训练。
实验合理度: ★★★★☆
对照组齐全,SFT、离线蒸馏、教师变体都做了,且同一起点比较,能比较干净地证明“状态分布”才是关键变量。
学术研究价值: ★★★★☆
它不只是抗体任务的小修小补,而是在说明生成模型后训练时,监督状态应该如何对齐生成轨迹,这个思路可迁移性不错。
稳定性: ★★★☆☆
在两个基准上都有效,但流程依赖教师适配、rollout 缓存和多阶段训练,离“拿来就用”还有距离。
适应性以及泛化能力: ★★★☆☆
对 CDR 这类递归几何生成问题很合适,但是否能稳迁移到全原子蛋白设计,还需要更多验证。
硬件需求及成本: ★★★☆☆
训练成本不算低,既有预训练又有教师适配和 rollout 蒸馏;好消息是推理端没有额外花里胡哨的重包袱。
复现难度: ★★★☆☆
代码和项目已开源,算加分;但多阶段训练、数据处理和 rollout 细节不少,复现仍需要较强工程能力。
产品化成熟度: ★★★☆☆
更像高质量研究原型,适合抗体候选生成与方法研究;要进真实药物设计流程,还得补稳定性、全原子精修和实验验证。
可能的问题: 提升主要集中在骨架几何,序列收益有限;流程偏复杂,且仍停留在 Cα 级别,离真正端到端可用还有一截路。
主要参考文献
1. Yang Z, He J, Xie J, et al. ABOPD: Antibody CDR Design via On-Policy Distillation. arXiv, 2026.
2. Luo et al. DiffAb: Antibody CDR generation with diffusion models. 相关工作引用于原文。
3. GitHub: https://github.com/little1d/ABOPD
4. 项目页: https://huggingface.co/collections/little1d/ABOPD
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群