← 返回 PaperDaily 大模型与智能体

Bengio团队新作:用强化学习把贝叶斯符号回归做成后验采样器

先把镜头拉远一点。物理学家手里有一堆实验数据,然后想从里面挖出一条公式——比如爱因斯坦那个 E = mc²。放在过去,这得靠灵光一现。

Bengio团队新作:用强化学习把贝叶斯符号回归做成后验采样器
原论文信息如下:
论文标题:
Bayesian Symbolic Regression with Entropic Reinforcement Learning
发表日期:
2026年08月
发表单位:
Mila – Québec AI Institute, Université de Montréal, University of Oxford, University of Chicago, LawZero, CIFAR Fellow, University of Edinburgh
原文链接:
https://arxiv.org/pdf/2608.09617v1.pdf

先把镜头拉远一点。物理学家手里有一堆实验数据,然后想从里面挖出一条公式——比如爱因斯坦那个 E = mc²。放在过去,这得靠灵光一现。现在,越来越多研究者想用AI自动“发现”这种公式,这就是符号回归(Symbolic Regression)干的事。但这里头有个尴尬的问题。
数据又少又吵,你得从海量候选公式里找出那个能解释数据的。传统方法暴力搜,搜到最后给一个“最优”答案完事。可是数据这么少,你怎么知道这个答案就是对的?很可能是瞎猫撞上死耗子。真正靠谱的做法,是把所有可能的公式都考虑进来,算出一个后验分布,再看分布长啥样。但这件事计算量极大,过去基本做不动。
最近,一篇来自Mila实验室、蒙特利尔大学、牛津大学等多家机构合作的论文,直接把这个难题捅破了。论文第一作者为Oussama Boussif,Yoshua Bengio也参与其中。他们提出的方法叫ERRLESS(Entropy-Regularized Reinforcement Learning for Expression Structure Sampling),中文可以理解为“基于熵正则化强化学习的表达式结构采样”。看名字就知道,这是一种把最大熵强化学习和贝叶斯符号回归揉在一起的新路子,用来从表达式后验分布里高效采样。
图3:后验采样结果对比。ERRLESS和PySIPS在含噪数据上训练,真实函数为f(x)=x+sin(5.5x),训练区间为[−0.5, 0.5](米色区域)。后验均值(蓝色虚线)在训练区间内拟合效果接近,但ERRLESS在训练区间外的外推效果明显更好。紫色区域为95%置信区间。

从数据中"发现"物理定律:贝叶斯符号回归的挑战与机遇

先讲清楚符号回归是个啥问题。传统回归,比如线性回归,是先假设公式长什么样(比如 y = ax + b),然后去拟合参数 a 和 b。但符号回归更狠:它连公式结构都不给,跟空间里所有可能的表达式——从 y = x² 到 y = sin(x + 3) / cos(2x)——全都可能是候选。最终目标是从数据里直接“长出”一个代数表达式。
符号回归在自然科学里特别吃香,因为数据通常少、噪声大,而且科学家关心的是公式的可解释性。比如物理定律发现、生物学建模、化学动力学方程推导这些场景,都是符号回归的用武之地。
但问题来了。大多数符号回归方法(比如DSR、PySR、PhySO这些主流算法)都在做同一件事:找一条最优表达式。它们通过演化算法或强化学习,在公式空间里搜索,最后输出一个“最佳”表达式。这种思路在数据充足的时候没问题,但数据很少的时候,问题就很大了——你找到的那个“最佳”公式,可能只是因为运气好才在训练集上拟合得不错,实际上完全不对。这就像考试只有一道选择题,你蒙对了答案,不代表你真会这道题。
要解决这个问题,就得换个视角:不要只找一条公式,而是把“所有可能的公式”按照概率分布都列出来。这个分布就是后验分布 p(T, θ, σ | D),意思是给定数据 D 之后,每个表达式 T 及其参数 θ 和噪声水平 σ 的可能性有多大。有了这个分布,可以做很多事儿:比如取均值做预测,算出预测的不确定性,甚至判断哪些公式结构更靠谱。
这个思路被称为贝叶斯符号回归(Bayesian Symbolic Regression)。它不是什么新概念,此前已经有人用MCMC(马尔可夫链蒙特卡洛)或者SMC(序贯蒙特卡洛)来做贝叶斯符号回归。但这些方法很痛苦,需要手工设计提议分布,计算代价非常高,而且很难扩展到复杂一点的公式结构上。于是就有了本文的切入点:能不能用强化学习把采样过程“摊销”掉?训练好一个神经网络策略,之后每次只要跑一下网络就能获得后验样本,而不是每来一次新数据都重新跑一遍昂贵的采样。
图1:表达式 E = mc² 的生成过程。灰色为有效状态,粉色为无效状态,黑色箭头为有效转移,红色箭头为无效转移。叶节点为双圆圈,一元运算符为单框方形,二元运算符为双框方形。波浪箭头表示可终止并转移到终止状态。
上面这张图展示了ERRLESS生成表达式 E = mc² 的过程。灰色状态是合法的部分表达式,粉色状态是非法状态,箭头表示从一个部分表达式过渡到另一个。这里的关键是:生成过程是自底向上的——先有叶节点(变量或常量),再不断往上组合成更大的表达式。看完这张图,你大概能感受到,这个生成过程像搭积木一样,一块一块垒上去。

核心创新:自底向上生成+最大熵强化学习=后验采样新范式

如果你对符号回归有些了解,可能知道之前大多数方法(比如DSR)都是自顶向下生成表达式的:先生成根节点(一个运算符),再往下生成左右子树。这种方式有个毛病——中间状态是一棵“残缺”的树,带着一堆没填的坑(holes)。在没填完之前,表达式没法求值,也就没法做单位检查(dimensional analysis)。
ERRLESS的思路完全反过来:自底向上生成。先把变量和常量(叶节点)放好,然后每次加一个运算符,把已有的子表达式组合成一个更大的表达式。这样做有两个直接好处:第一,中间状态本身就是合法的表达式片段,可以提前判断能不能求值;第二,每次加运算符时,操作数的物理单位都是已知的,可以直接做量纲检查。比如“速度”和“时间”相加不合法,但相乘可以得到“距离”,这些约束在生成过程中就能实时判断,而不是等到最后。
论文把表达式表示为逆波兰表示法(reverse Polish notation),也就是后序遍历序列。比如 sin(ν₁ + c₁ × ν₂) 这个表达式,序列就是 (ν₁, c₁, ν₂, ×, +, sin)。这会生成一个分布:
公式:π(w₁…wₙ⊤) = (∏ᵢ₌₁ⁿ π(wᵢ│w₍ᵢ₎)) π(⊤│w₁…ₙ)
这个式子说明了如何通过自回归方式生成表达式序列:每一步在给定此前已生成符号的条件下,采样下一个符号。⊤是终止符,表示表达式构建完毕。整个表达式的概率是每一步条件概率的乘积。这意味着任何对表达式树的概率建模,都可以转化为对序列的建模——这就为后续用神经网络和强化学习铺平了道路。
有了生成过程,下一步就是怎么让这个生成分布往后验分布靠拢。这里引入了最大熵强化学习(maximum-entropy RL)。核心思想是把对数后验密度当作奖励函数:
公式:R(T,θ,σ) = log p(T,θ,σ) + Σᵢ₌₁ᴺ log N(yᵢ; f_{T,θ}(xᵢ), σ²)
这个奖励由两部分构成:先验 log p(T, θ, σ) 加上数据似然的对数之和。直观理解就是:如果一个表达式既符合先验(不过分复杂、不违反约束),又能很好地拟合数据,那它就拿到高奖励。然后ERRLESS训练一个策略网络,让采样出的表达式期望奖励最大化,同时加上一个熵正则项,用来保证策略不会坍缩到单一点。这里的关键理论保证是:在最大熵强化学习框架下,最优策略恰好按后验概率采样,而不是只找后验模式。
公式:max_φ [ E_{(T,θ,σ)~π_φ}[R(T,θ,σ)] + H[π_φ] ]
上面这个目标函数就是最大熵强化学习的核心。H[π_φ] 是策略的熵。最大化这个目标,等价于最小化策略和后验之间的KL散度。有意思的是,这个目标是可以通过GFlowNet的轨迹平衡目标来高效求解的,这就是ERRLESS能够稳定训练的关键原因。

技术深潜:ERRLESS如何实现高效且可解释的表达式采样

看完核心创新,来深挖一下ERRLESS的技术细节。整个方法可以拆成几个关键模块:生成环境、策略网络、训练目标、约束设计。
首先是生成环境。ERRLESS定义了一个token字母表,包含变量符号、常量符号、运算符符号和终止符⊤。生成过程每一步添加一个符号,必须遵守两条硬约束:数量约束(arity constraints,运算符的子节点数量必须匹配)和单位约束(dimensional constraints,操作数的物理单位必须兼容)。比如“速度”加上“时间”是非法的,而“速度”乘以“时间”得到“距离”是合法的。这些约束通过在生成过程中检查单位向量的匹配来实现。每个变量都关联一个7维的单位向量,例如速度的单位是 m·s⁻¹,表示为 (1, 0, -1, 0, 0, 0, 0)。
除了单位和数量约束,论文还加了几条结构约束来避免生成无意义或冗余的表达式:禁止函数与其反函数直接复合(比如 √(·)²),禁止三角函数嵌套(比如 sin(cos(·))),禁止指数嵌套(比如 e^(e^·)),禁止一元运算符直接作用于常量。说实话,看到“禁止三角嵌套”这条龙哥真是深有感触——在物理公式里,sin(cos(x)) 这种结构不但罕见,而且会让搜索空间爆炸式增长。这些规则把搜索空间大幅缩小,让探索效率直接提升了一个档次。下图给出了搜索空间大小的对比。
图2:搜索空间大小随最大节点数的增长(对数尺度)。
可以看到,在最大节点数增长到30的时候,无约束的搜索空间大约是10¹⁸量级,而加了单位约束和结构约束后,空间缩小到大约10¹²。这仍然是天文数字,但至少从“完全不可搜索”变成了“有可能搜索”。
接下来是策略网络。ERRLESS使用Transformer架构来编码当前的部分表达式序列。Transformer输出一个embedding,然后分给三个预测头:第一个头生成下一个token的logits;第二个头生成常量θ的分布(高斯混合模型),在序列终止时输出均值和协方差;第三个头生成噪声σ的分布(对数正态混合模型)。这种设计把表达式结构、常量参数和噪声水平三者统一在一个模型里端到端训练,避免了传统方法中“先搜结构、再拟合参数”的两阶段流程。
然后是训练目标。ERRLESS采用的损失函数是轨迹平衡(Trajectory Balance)损失:
公式:L_TB(T,θ,σ;φ) = [log Z_φ + log π_φ(T,θ,σ) − R(T,θ,σ)]²
这个公式的解释有点绕,但本质很简单:log Z_φ 是学习到的配分函数(归一化常数)的对数,log π_φ(T, θ, σ) 是当前策略给这个样本的概率的对数,R(T, θ, σ) 是之前定义的奖励。理想情况下,这两边应该相等,所以把它们相减然后平方。当这个损失为0时,策略生成的分布就恰好等于后验分布。轨迹平衡是GFlowNet(生成流网络)的一种目标函数,它的好处是支持离策略训练——训练样本不需要完全来自当前策略,可以用一个探索性的行为策略(比如 ε-greedy)来采样,配合优先级回放缓冲区来提高数据效率。
关于先验选择,论文使用unigram先验(一元语法先验)——对表达式中每个token(运算符、变量、常量)赋予一个独立的出现频率。这个先验听起来简单,但效果不错。论文在附录中对比了不同先验选择的影响(见消融实验表格)。此外,论文给常量施加了高斯先验(均值0、标准差10),并对常量数量做了惩罚——表达式中用的常量越多,先验分数越低。这样能天然地偏向简洁公式,减少过拟合风险。

实验结果:在Feynman基准上的全面验证与性能分析

光说不练假把式。先来看ERRLESS的核心评估结果。
表1:合成数据集上的后验预测指标。报告后验预测均值精度(R²_PP)和测试集负对数似然(NLL),两种方法用相同估计器打分:对最多1000次后验采样的点态混合NLL,权重均匀。ERRLESS每次采样的σ取采样值,PySIPS用每个粒子在训练集上的残差。测试R²为各方法找到的最佳表达式的测试集R²。10次独立运行的中位数。†:10次PySIPS运行中只有2次在该问题上给出有限的后验均值预测。
表1是合成数据集上的结果。重点看最后一行:在噪声最大的设置(γ=0.1)下,ERRLESS的后验预测均值R²_PP达到了0.96,而SMC基线方法PySIPS只有0.82。这意味着在数据极其嘈杂时,ERRLESS的贝叶斯后验均值依然能给出非常准确的预测,而PySIPS几乎“崩了”。注意表中还有个很残酷的细节:PySIPS在该问题上10次运行中只有2次能得到有限的后验均值预测(†标记),也就是说它经常直接发散。ERRLESS则显著更稳。
再来看Feynman基准上的表现。Feynman符号回归数据库(Feynman Symbolic Regression Database)是符号回归领域最经典的大规模benchmark,包含100条来自费曼物理学讲义中的公式和20条额外物理公式。ERRLESS在这个benchmark上跟PySR、DSR、PhySO等多个现代方法做了对比。
图4:Feynman基准上的性能分析。(a) 鲁棒性曲线:表示在三种噪声水平(γ∈{0.001, 0.01, 0.1})下经验成功率P[R²≥t]的AUC。算法按平均AUC排名,ERRLESS展现出更优的稳定性。(b) 帕累托前沿:中位AUC得分与模型参数数量的权衡。相比基线方法,ERRLESS在性能-复杂度比上具有竞争力。
图4(a)展示了ERRLESS在Feynman基准上的鲁棒性表现。横轴是噪声水平(从0.001到0.1),纵轴是AUC(成功率曲线下的面积)。ERRLESS在高噪声下排名靠前,比传统方法更具稳定性。图4(b)是准确率-复杂度帕累托前沿,横轴是模型参数数量,纵轴是AUC。ERRLESS的“性价比”——用很少的参数获得较高的准确率——相当亮眼。这里特别想提一句:图中对比的大多数算法都是“点估计”方法,只有ERRLESS和PySIPS是真正的贝叶斯方法。贝叶斯方法不只是“能算出不确定性”,还能在高噪声时靠后验均值大幅降低过拟合风险——这正是ERRLESS的最大卖点。
论文还评估了黑盒回归benchmark(来自PMLB数据库的一个子集),这部分数据集中的真公式未知,主要用于测试算法的泛化能力。ERRLESS在部分数据集上的AUC表现中规中矩,但依然保持了不错性能-参数比。
图6:Blackbox基准上的性能分析。(a) 经验成功率P[R²≥t]的AUC。算法按平均AUC排名。(b) 中位AUC与模型参数数量的帕累托前沿。相比基线,ERRLESS在性能-复杂度比上具有竞争力。
结合PaperDaily已收录论文可观察到,Blackbox基准上不同方法的AUC绝对数值容易受训练集大小、特征尺度等因素影响;本文特意没有把ERRLESS写成全面领先,因为在部分数据集上传统非贝叶斯方法的AUC也不弱。读者在跨论文比较时需要警惕split和setting差异。
图7:计算时间。Blackbox基准上所有方法在随机种子和表达式上的平均运行时间(秒)。
计算时间方面(图7),ERRLESS在Blackbox基准上的平均训练时间明显优于传统的MCMC/SMC类方法——SMC开销最大,ERRLESS作为一个需要训练Transformer的策略,其计算量主要集中在训练阶段,推理只需要一次前向传播。对于需要反复在新数据集上做后验推断的场景,这个摊销优势会变得更加明显。
在后验可视化上,前面图3展示了很直观的结果。ERRLESS和PySIPS在训练区间 [−0.5, 0.5] 内都能很好地拟合 f(x) = x + sin(5.5x),但在训练区间之外,ERRLESS的外推表现远好于PySIPS。这充分说明贝叶斯后验均值在分布外泛化上的优势:不是只抓住一个点估计,而是综合了多个高概率表达式的结果,从而得到更稳健的预测。

局限与展望:从符号回归到更广泛的科学发现

那ERRLESS有没有短板?当然有。
第一,训练代价不便宜。虽然推理很快,但训练一个Transformer策略网络需要不少GPU算力。对“一次性”的小规模科研分析而言,调用传统SMC也许更省事。第二,对先验的敏感度。ERRLESS的结果跟先验选择强相关,尤其是常量先验。先验设置差别过大时,后验分布也会明显移动。第三,对复杂非线性结构的表达还不够好——在Feynman基准上ERRLESS基本能胜任,但面对更复杂的、自带积分微分算子的科学方程,这个框架还搞不定。
从更广的视角看,ERRLESS代表了一条方法论趋势:把“科学发现”从单一公式输出的搜索问题,转变成“公式分布”的采样问题。这种从点估计到分布估计的转变,正是AI for Science的一个重要方向——毕竟真正的科学发现不只是找到一个公式,更要理解这个公式有多可靠、有哪些可能的替代形式。可以预料,未来会有更多基于GFlowNet/最大熵强化学习的贝叶斯推断方法进入其他科学发现领域,比如化学反应路径搜索、基因调控网络推断、甚至材料结构预测。路还长,但方向对了就不怕远。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?ERRLESS将贝叶斯符号回归建模为最大熵强化学习问题,训练策略从后验分布采样表达式。在Feynman基准上AUC达0.924,抗噪性优于DSR、PhySO等强化学习方法,且生成表达式更简短,为AI4Science提供新的不确定性
这篇工作最值得看的点是什么?在Feynman基准上AUC达0.924,优于DSR(0.873)、PhySO(0.893)和BSR(0.702);在合成数据上后验预测均值优于PySIPS;在Blackbox基准上AUC为0.350,优于BSR(0.19)和AIFeynman(0.004)。
这篇工作的边界或风险在哪里?优点:(1)将贝叶斯符号回归建模为最大熵RL问题,实现端到端的后验采样;(2)自底向上的生成过程有效融入物理单位约束和结构先验;(3)避免逐候选常数的显式拟合,显著提升效率;(4)在多个基准上取得竞争性结果。缺点:(1)在高度复杂的目标表达式上性能可能下降;(2)需要较大的训练预算才能充分逼近后验;(3)与直接优化拟合的方法相比,在单一最佳表达式的拟合精度上可能略逊。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将贝叶斯符号回归建模为最大熵强化学习问题,通过自底向上的表达式树生成策略和轨迹平衡目标,学习从后验分布中采样表达式及其参数。

实验合理度:★★★★☆

R²系数、AUC分数(成功率曲线下面积)、负对数似然(NLL)、后验预测均值R²_PP、模型复杂度(参数数量)。

学术研究价值:★★★★☆

将贝叶斯符号回归建模为最大熵强化学习问题,通过自底向上的表达式树生成策略和轨迹平衡目标,学习从后验分布中采样表达式及其参数;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练预算为100万次奖励函数评估,在L40S GPU上运行,比大多数基于学习的方法快一个数量级。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:,实现端到端的后验采样;(2)自底向上的生成过程有效融入物理单位约束和结构先验;(3)避免逐候选常数的显式拟合,显著提升效率;(4)在多个基准上取得竞争性结果。缺点:(1)在高度复杂的目标表达式上性能可能下降;(2)需要较大的训练预算才能充分逼近后验;

主要参考文献

[1] Boussif O., Mahfoud M., Kaddar Y., Jain M., Li S., Fornasiere D., Chen X., Bengio Y., Whitammer E. S. Bayesian Symbolic Regression with Entropic Reinforcement Learning. arXiv preprint, 2026.
[2] Udrescu S.-M., Tegmark M. AI Feynman: A physics-inspired method for symbolic regression. Science Advances, 2020.
[3] Petersen B. K., et al. Deep symbolic regression: Recovering mathematical expressions from data via risk-seeking policy gradients. ICLR, 2021.
[4] Tenachi W.-A., et al. PhySO: Physical symbolic optimization. arXiv preprint, 2023.
[5] Malkin N., et al. Trajectory balance: Improved credit assignment in GFlowNets. NeurIPS, 2022.
[6] Bengio Y., et al. Flow network based generative models for non-iterative diverse candidate generation. NeurIPS, 2021.
[7] Bomarito J., Leser P. PySIPS: Sequential Monte Carlo for Bayesian symbolic regression. 2026.

融会贯通

结合PaperDaily已收录的部分论文来看,符号回归领域正经历一场范式变化——从“单点最优”走向“后验分布”。传统方法如DSR和PySR把资源花在找一个好公式上,而ERRLESS把资源花在训练一个能生成大量好公式的采样器上。两者各有适用场景:如果只想要一个可解释的表达式,点估计方法更高效;如果想知道“哪些公式都合理”,贝叶斯后验明显信息量更大。
需要注意的是,Blackbox基准上的AUC等指标在不同论文中因训练集大小、噪声设置、特征处理方式不同,可能存在可比性偏差。想直接横向对比的读者,建议先检查设置再下结论。整体来看,ERRLESS在物理公式发现这个细分场景上确实走出了一条有价值的路,也给后续研究留足了扩展空间。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想从噪声数据里挖出物理定律?来跟龙哥一起读论文!扫下方二维码或添加龙哥助手微信号kangjinlonghelper,备注“研究方向+城市+单位+昵称”,加入图像处理、大模型、自动驾驶、AI医疗、AI金融五个群,和上万龙迷一起追踪AI4Science前沿!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。