← 返回 PaperDaily
大模型与智能体
告别EBM训练难!PTT沿训练轨迹搭天梯,成本追平PCD
能量模型(EBM)一直是个"难啃的硬骨头":理论优雅,却老困在采样慢、训练不稳的泥潭里。这篇论文提出的并行轨迹回火(PTT)算法,直接沿训练轨迹搭"副本天梯"保持平衡采样,计算成本还能追平PCD——在伊辛模型、基因组、蛋白质等多类科学数据上全面逆袭。对想用可解释生成模型做科学发现的朋友,这波操作值得关注。
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 3
查看原文
原论文信息如下:
好,龙哥今天要跟大家聊聊一篇很有意思的论文。这篇论文讲的是一个陈年老大难问题——能量模型,英文叫 Energy-Based Models,圈内人一般简称 EBM。乍一听这名字挺唬人,其实说白了,它就是想把数据的分布规律用一种"能量函数"的形式给刻画出来。学过物理的朋友会心一笑,这不就是玻尔兹曼分布嘛!没错,EBM 的核心思想就是借用了统计力学里那套"低能量状态出现概率高"的逻辑,把数据的分布写成配分函数归一化后的玻尔兹曼形式。
这一套理论框架相当优雅,而且自带可解释性光环。像计算生物学、神经科学、统计物理这些讲究"机理"的领域,对 EBM 那是寄予厚望。毕竟它能直接给你一个"能量景观",告诉你在哪个状态上数据最密集,状态之间怎么过渡,甚至能画出数据分布的"地形图"来。然而,理想很丰满,现实很骨感。EBM 有个让人头疼的毛病——非常难训练 。
能量模型训练的世纪难题:为什么MCMC总是"卡壳"?
要理解这个"难",得先搞清楚 EBM 是怎么训练的。最大似然估计是训练生成模型的老祖宗方法,EBM 也逃不过这个套路。核心公式长这样:
看到没?梯度的计算分两拨:一波是数据项,直接从训练集里算,这个好办;另一波是模型项,需要从模型分布里采样来估计。问题就出在这个"采样"上。EBM 的模型分布可不像高斯分布那样好伺候,它是那种高维的、多峰的、沟壑纵横的能量景观。
你想象一下,要在这样的地形上做马尔可夫链蒙特卡洛(MCMC)采样,就像在一个满是山洞的山区里开着一辆没有导航的越野车——爬坡费劲,下坡容易陷坑,最惨的是从一个山头跑到另一个山头,可能得绕上几千几万年的路。这种"翻山越岭"的困难,学名叫临界慢化 和模式坍缩 。采样器半天跑不出一个像样的样本,估计出的梯度自然就偏了,训练自然就不稳定,模型性能也就拉胯了。
为了对付这个难题,前人们想了不少招。最有名的当属 Hinton 老爷子提出的对比散度(Contrastive Divergence,简称 CD),它的精髓是"偷懒"——不追求模型完全平衡,跑几步吉布斯采样就把梯度凑合着算了。后来 Tieleman 又搞了个持续对比散度(Persistent Contrastive Divergence,简称 PCD),让马尔可夫链在训练更新之间一直保留着,算是 CD 的加强版。PCD 在不少场景下确实能干活,但一旦遇到强多模态分布或者数据量特别少的场景,这条"持久链"照样会掉链子,跑着跑着就陷在某一个模式里出不来了,梯度也就不准了。
还有并行回火(Parallel Tempering,简称 PT)方法,通过引入一堆不同温度的副本,让高温副本负责翻山越岭,低温副本负责精细采样。想法挺好,但实际操作起来,需要的温度副本数量有时候多到离谱,而且遇到一阶相变这种硬骨头,副本之间的交换效率会急剧下降,照样白搭。
PTT核心机制:沿着训练轨迹搭一座"副本天梯"
这篇论文提出的并行轨迹回火(Parallel Trajectory Tempering,简称 PTT),思路相当清奇。它把"回火"的对象从温度换成了训练时间。什么意思呢?传统的 PT 是拿不同温度的模型副本做"温度天梯",而 PTT 是拿训练过程中不同时刻的模型检查点(checkpoint)做"时间天梯"。
p_acc(x_t ↔ x_(t-1)) = min{1, exp(ΔE_t(x_t) − ΔE_t(x_(t-1)))}
因为相邻检查点对应的模型参数变化不大,它们的能量函数也比较接近,所以交换成功率会比较高。这样,副本就能像走钢丝一样,从一个检查点溜达到另一个检查点,整个系统的采样效率就大大提高了。这个思路之所以成立,是因为训练过程中的模型分布变化是平滑的,相邻检查点之间的"重叠"足够大。
细节设计:蓄水池采样与自适应优化
看到这儿,可能有细心的朋友要问了:检查点会越加越多,那计算量岂不是要爆炸?开头不是吹牛说计算成本跟 PCD 差不多吗?问得好!这就是 PTT 的第二个聪明之处——蓄水池采样 。
论文引入了一个蓄水池(reservoir),用来存放已经平衡好的样本。每次新检查点加入时,只需要让前一个检查点的副本多跑一阵子,把热化好的样本存进蓄水池。之后,新检查点的副本就不再需要跟更早的检查点直接打交道了,直接跟蓄水池里的样本做交换就行。这样,大部分训练时间里,只需要维护最后两个检查点的副本,计算开销自然就降下来了。
另外,PTT 还有个自适应学习率的小机关。它通过计算相邻两次梯度更新的余弦相似度来判断当前优化状态:如果梯度方向一致,说明路走得很顺,可以加大学习率;如果梯度方向相反,说明开始振荡了,得减小学习率;如果正交,那就维持现状。这个自适应机制跟 PTT 的副本交换形成了双保险,让训练过程既快又稳。
训练、采样、评估三位一体:免费获取对数似然与热化诊断
PTT 的第三个卖点,是"买一送二"式的福利。因为相邻检查点之间的配分函数比值可以通过重要性采样轻松算出来,所以训练过程中可以很自然地递归估计出每个检查点的配分函数,进而算出对数似然。公式简洁明了:
log Z_t = log Z_(t-1) + log ⟨exp(E_(t-1) − E_t)⟩_(t-1)
这一下子就解决了 EBM 评估难的老大难问题。以往,想算个对数似然,得跑一大堆额外的 MCMC 采样,或者用退火重要性采样(AIS)这种重型武器。现在好了,训练过程中顺便就把对数似然算出来了,模型选择、早停、超参调优都变得有据可依。
更妙的是,PTT 还自带"健康监测"功能。通过监测副本在梯子上的扩散行为,可以估算出指数自相关时间 τ_exp 和积分自相关时间 τ_int。这俩指标就像体温计和血压计,直接告诉你当前采样器是不是处于平衡状态。如果 τ_exp 突然飙升,那说明模型状态不对劲,该调参了。这种诊断能力在以往的 EBM 训练中是想都不敢想的。
科学数据大阅兵:从伊辛模型到基因组,PTT全面碾压现有方法
光说不练假把式。论文在五类科学数据集上对 PTT 进行了全方位检验,每一类都直击现有方法的痛点。
伊辛模型:一雪前耻
二维伊辛模型是统计物理的"标准玩具",也是 EBM 训练的老大难。以往很多研究都报道过,RBM 在低温相会学不会双峰分布,只会傻乎乎地缩在其中一个峰里。这篇论文直接给伊辛模型来了个"平反"——问题不在 RBM 的表达能力,而在采样方法。用 PTT 训练出来的 RBM,在低温相能够完美重现磁化强度的双峰分布,而 PCD 训练出来的模型则彻底坍缩到了单一峰。看图 2a,左半边 PCD 的结果只有一个峰,右半边 PTT 的结果两个峰都在,差别一目了然。
第二个数据集是人类基因组数据集(HGD),来源于1000 Genomes Project,编码了805个基因上相对于参考基因组的突变存在与否(二值数据)。这个数据集的显著特点是:样本在一阶主成分方向上呈现强烈的聚类结构(对应不同大陆人群),且样本量有限——这正是PCD最害怕的场景。
图3b的最近邻距离分布进一步量化了这种差异。PTT训练模型的最近邻距离分布与参考分布几乎完全重合,而BFN明显欠拟合,PCD则严重过拟合。更令人印象深刻的是图3c:对PTT训练出的模型,论文使用无监督层次聚类方法分析自由能景观,发现模型学到的能量景观能自动区分出非洲、美洲、东亚、欧洲和南亚等大陆人群,甚至能进一步区分ESN、GWD、YRI等亚群结构。要知道,训练过程中完全没有使用任何标签信息!这说明PTT训练的RBM确实学到了有生物学意义的遗传结构。
第三个数据集是β-内酰胺酶结构域的蛋白质多序列比对(MSA),家族ID为PF13354。这是一个比HGD更具挑战性的数据集:序列分布呈现极强的聚类结构,热化时间可能极长。在这个数据集上,论文不仅比较了生成样本的质量,还评估了模型推断残基间相互作用的能力。
最有说服力的结果是图4e:在接触图预测任务中,PTT训练RBM提取出的成对耦合在全部前排名范围内都优于edDCA——而edDCA本身就是专门为推断蛋白质接触而设计的模型。图4f还展示了一个诊断:PCD训练的模型τ_exp在训练后期急剧上升,说明采样器已经严重失衡;而PTT训练的模型τ_exp保持稳定,始终处于平衡状态。
第四个数据集来自艾伦研究所的一项Neuropixels实验,记录了小鼠在视觉变化检测任务中2028个神经元的同步放电活动。数据经过20毫秒时间窗分箱和二值化处理。这个数据集的挑战在于强时间相关性导致有效独立样本数极少,且放电模式高度多模态。
龙哥认为,这组实验最打动人的地方在于:PTT在全链路(训练、采样、评估)上都给出了远优于现有方法的表现,而且方法本身并不复杂,工程实现成本也不高。这让它具备了很强的实用潜力。
总结与展望:能量模型能否借PTT东山再起?
第一,将并行回火的思想从"温度维度"迁移到"训练时间维度",利用训练过程中模型演化的连续性构建副本天梯,从根本上缓解了EBM训练中的MCMC混合困难。
第二,利用蓄水池采样和自适应优化,把PTT的计算成本压缩到与PCD相当的水平,让"平衡训练"从理论可能变成了工程可行。
第三,免费附带对数似然估计和热化诊断两大功能,让EBM从"难训练、难评估、难解释"的三难困境中走了出来。
当然,PTT并非万能。它依赖于"训练轨迹的连续性"这一前提,如果学习率过大导致模型参数跳变剧烈,检查点之间的重叠度就会不足,副本交换效率也会下降。论文中的自适应学习率机制缓解了这个问题,但没有完全消除。此外,PTT目前主要基于RBM验证,对于更复杂的深度EBM(如卷积EBM或Transformer-based EBM)是否依然有效,还有待验证。
但龙哥认为,这篇论文的意义不仅在于提出了一个新的训练算法。它让我们重新审视了一个被忽视的事实:EBM真正的瓶颈不是表达能力,而是训练算法。一旦训练问题被解决,EBM在科学发现中的独特价值——可解释性、紧凑性、精确似然估计——就会重新凸显。在生成式AI狂卷参数量和算力的今天,这种"小而美"的模型反而可能成为科学家的香饽饽。
一句话总结:PTT让我们看到了EBM"东山再起"的可能性——只要训练算法给力,老树也能开新花。
龙迷三问
PTT与传统的并行回火PT到底有什么本质区别? PTT和PT都用了"梯子+副本交换"的框架,但梯子的维度不同。PT的梯子是温度维度,通过让高温副本更容易翻越能量壁垒来加速混合;PTT的梯子是训练时间维度,起源于随机初始化的平坦能量景观,终结于训练完成的复杂能量景观。因为相邻检查点之间的能量函数差距很小,副本交换接受率更高,且不需要手动设计温度序列。PT在一个温度范围内平均分配副本,而PTT的检查点是按需动态添加的。
蓄水池采样是怎么做到不破坏细致平衡条件的? 蓄水池中存储的是第t−1个检查点达到平衡后产生的样本。当第t个检查点的副本要与第t−1个检查点交换时,从蓄水池中随机抽取一个样本参与Metropolis判定。由于蓄水池中的样本服从第t−1个检查点的平衡分布,因此交换过程满足平衡条件,不会引入偏差。关键是蓄水池的样本必须来自平衡后的分布,论文要求先对第t−1个检查点运行超过20倍τ_exp的热化,再按2倍τ_int的间隔采样填充蓄水池,确保样本的独立性。
τ_exp和τ_int在论文中具体代表什么? τ_exp是自相关函数C(t)∼e^{−t/τexp}中的指数衰减时间常数,反映系统"忘记"初始状态需要多长时间;τ_int是积分自相关时间,用于估计有效独立样本数N_eff = N/(2τ_int)。在PTT中,这两个量可以通过副本在梯子上的游走轨迹直接估算。如果τ_exp过大,说明副本在梯子上扩散慢,系统可能处于非平衡状态。论文还用这个量作为诊断工具:PCD训练的模型τ_exp随训练急剧上升,PTT则保持稳定。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
PTT的核心思想——用训练轨迹替代温度阶梯——在概念上确实新颖,且执行细节(蓄水池、自适应学习率)打磨得很完整,但作者也承认其理论动机源于前人的分析工作,创新更偏向"工程化落地"而非"开天辟地"。
实验合理度: ★★★★☆
五个数据集覆盖物理、基因组、蛋白质、神经科学、医疗,非常全面。对比方法选择得当,既有经典基线(PCD)又有SOTA深度模型(BFN)。但论文没有直接给出与CD(而非PCD)的对比,且部分对比中BFN的超参数调优深度可能不及基线方法。
学术研究价值: ★★★★★
为EBM训练提供了一条全新的可行路径,对数似然免费估计和热化诊断两大副产品的价值极高,可能推动EBM在科学计算领域重新成为主流选择。
稳定性: ★★★★☆
在论文测试的五个数据集上都很稳定,尤其是小数据和强多模态场景。但跨数据集迁移时检查点添加策略、蓄水池大小等超参可能需要重新调整,普适性有待进一步验证。
适应性以及泛化能力: ★★★★☆
对离散数据和混合类型表格数据表现出色,但尚未在连续高维数据(如自然图像)上进行验证。RBM之外更复杂的EBM架构也缺乏实验支持。
硬件需求及成本: ★★★★☆
PTT训练的计算成本与PCD相当,比PT低得多。但训练时需要额外存储检查点和蓄水池样本,内存开销略高于PCD,不过仍在可控范围内。
复现难度: ★★★☆☆
算法描述详细,但论文暂未提供开源代码。检查点添加的阈值、蓄水池大小、自适应学习率的余弦相似度窗口等超参都需要自己摸索,复现需要一定的调参功力。
产品化成熟度: ★★★☆☆
在科学数据分析场景(如基因组、蛋白质、神经记录)已经展示了很强的实用价值,但在工业界通用的图像、文本等高维连续数据上还有待验证。若未来扩展到连续数据并开源代码,产品化潜力会显著提升。
可能的问题: PTT对检查点间隔和学习率的联动变化高度敏感,论文中"等待交换接受率低于阈值才冻结检查点"的策略可能导致梯子长度在训练后期增长过快,增加内存压力。此外,若模型参数更新幅度很大(如使用大学习率热身),轨迹连续性假设可能失效。建议补充PTT在连续数据上的训练行为分析,以及检查点数量和内存开销的定量报告。
主要参考文献
[1] G. Hinton, Nobel lecture: Boltzmann machines, Reviews of Modern Physics 97, 030502 (2025).
[2] N. Bulso and Y. Roudi, Restricted Boltzmann machines as models of interacting variables, Neural Computation 33, 2646 (2021).
[3] A. Decelle, A. d. J. Navas Gómez, and B. Seoane, Inferring higher-order couplings with neural networks, Physical Review Letters 135, 207301 (2025).
[4] G. E. Hinton, Training products of experts by minimizing contrastive divergence, Neural Computation 14, 1771 (2002).
[5] T. Tieleman, Training restricted Boltzmann machines using approximations to the likelihood gradient, in Proceedings of the 25th International Conference on Machine Learning, 2008.
[6] J. Tubiana, S. Cocco, and R. Monasson, Learning protein constitutive motifs from sequence data, Elife 8, e39397 (2019).
[7] R. H. Swendsen and J.-S. Wang, Nonuniversal critical dynamics in Monte Carlo simulations, Physical Review Letters 58, 86 (1987).
[8] E. Marinari and G. Parisi, Simulated tempering: A new Monte Carlo scheme, Europhysics Letters 19, 451 (1992).
[9] B. J. Graves et al., Bayesian flow networks, in The Thirteenth International Conference on Learning Representations (ICLR 2025).
[10] M. Ekezie et al., PRIVET: A protocol for evaluating generative models on private data, arXiv preprint (2025).
(注:本文基于 arXiv 2607.27077v1 撰写,所有实验数据与结论均来自论文原文。文中“龙哥点评”为公众号作者基于领域知识的独立判断,供读者参考。)
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
训练能量模型老卡壳?PCD跑偏、模式崩溃?来龙哥读论文粉丝群,和科研大佬们一起聊聊 PTT 副本天梯的"平衡之道"!
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 生成模型+北京+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群哦~