论文标题:
Bayesian Symbolic Regression with Entropic Reinforcement Learning
发表日期:
2026年08月
发表单位:
Mila – Québec AI Institute, Université de Montréal, University of Oxford, University of Chicago, LawZero, CIFAR Fellow, University of Edinburgh
原文链接: https://arxiv.org/pdf/2608.09617v1.pdf
先把镜头拉远一点。物理学家手里有一堆实验数据,然后想从里面挖出一条公式——比如爱因斯坦那个 E = mc²。放在过去,这得靠灵光一现。现在,越来越多研究者想用AI自动“发现”这种公式,这就是符号回归(Symbolic Regression)干的事。但这里头有个尴尬的问题。数据又少又吵,你得从海量候选公式里找出那个能解释数据的。传统方法暴力搜,搜到最后给一个“最优”答案完事。可是数据这么少,你怎么知道这个答案就是对的?很可能是瞎猫撞上死耗子。真正靠谱的做法,是把所有可能的公式都考虑进来,算出一个后验分布,再看分布长啥样。但这件事计算量极大,过去基本做不动。最近,一篇来自Mila实验室、蒙特利尔大学、牛津大学等多家机构合作的论文,直接把这个难题捅破了。论文第一作者为Oussama Boussif,Yoshua Bengio也参与其中。他们提出的方法叫ERRLESS(Entropy-Regularized Reinforcement Learning for Expression Structure Sampling),中文可以理解为“基于熵正则化强化学习的表达式结构采样”。看名字就知道,这是一种把最大熵强化学习和贝叶斯符号回归揉在一起的新路子,用来从表达式后验分布里高效采样。
从数据中"发现"物理定律:贝叶斯符号回归的挑战与机遇
先讲清楚符号回归是个啥问题。传统回归,比如线性回归,是先假设公式长什么样(比如 y = ax + b),然后去拟合参数 a 和 b。但符号回归更狠:它连公式结构都不给,跟空间里所有可能的表达式——从 y = x² 到 y = sin(x + 3) / cos(2x)——全都可能是候选。最终目标是从数据里直接“长出”一个代数表达式。符号回归在自然科学里特别吃香,因为数据通常少、噪声大,而且科学家关心的是公式的可解释性。比如物理定律发现、生物学建模、化学动力学方程推导这些场景,都是符号回归的用武之地。但问题来了。大多数符号回归方法(比如DSR、PySR、PhySO这些主流算法)都在做同一件事:找一条最优表达式。它们通过演化算法或强化学习,在公式空间里搜索,最后输出一个“最佳”表达式。这种思路在数据充足的时候没问题,但数据很少的时候,问题就很大了——你找到的那个“最佳”公式,可能只是因为运气好才在训练集上拟合得不错,实际上完全不对。这就像考试只有一道选择题,你蒙对了答案,不代表你真会这道题。要解决这个问题,就得换个视角:不要只找一条公式,而是把“所有可能的公式”按照概率分布都列出来。这个分布就是后验分布 p(T, θ, σ | D),意思是给定数据 D 之后,每个表达式 T 及其参数 θ 和噪声水平 σ 的可能性有多大。有了这个分布,可以做很多事儿:比如取均值做预测,算出预测的不确定性,甚至判断哪些公式结构更靠谱。这个思路被称为贝叶斯符号回归(Bayesian Symbolic Regression)。它不是什么新概念,此前已经有人用MCMC(马尔可夫链蒙特卡洛)或者SMC(序贯蒙特卡洛)来做贝叶斯符号回归。但这些方法很痛苦,需要手工设计提议分布,计算代价非常高,而且很难扩展到复杂一点的公式结构上。于是就有了本文的切入点:能不能用强化学习把采样过程“摊销”掉?训练好一个神经网络策略,之后每次只要跑一下网络就能获得后验样本,而不是每来一次新数据都重新跑一遍昂贵的采样。上面这张图展示了ERRLESS生成表达式 E = mc² 的过程。灰色状态是合法的部分表达式,粉色状态是非法状态,箭头表示从一个部分表达式过渡到另一个。这里的关键是:生成过程是自底向上的——先有叶节点(变量或常量),再不断往上组合成更大的表达式。看完这张图,你大概能感受到,这个生成过程像搭积木一样,一块一块垒上去。
那ERRLESS有没有短板?当然有。第一,训练代价不便宜。虽然推理很快,但训练一个Transformer策略网络需要不少GPU算力。对“一次性”的小规模科研分析而言,调用传统SMC也许更省事。第二,对先验的敏感度。ERRLESS的结果跟先验选择强相关,尤其是常量先验。先验设置差别过大时,后验分布也会明显移动。第三,对复杂非线性结构的表达还不够好——在Feynman基准上ERRLESS基本能胜任,但面对更复杂的、自带积分微分算子的科学方程,这个框架还搞不定。从更广的视角看,ERRLESS代表了一条方法论趋势:把“科学发现”从单一公式输出的搜索问题,转变成“公式分布”的采样问题。这种从点估计到分布估计的转变,正是AI for Science的一个重要方向——毕竟真正的科学发现不只是找到一个公式,更要理解这个公式有多可靠、有哪些可能的替代形式。可以预料,未来会有更多基于GFlowNet/最大熵强化学习的贝叶斯推断方法进入其他科学发现领域,比如化学反应路径搜索、基因调控网络推断、甚至材料结构预测。路还长,但方向对了就不怕远。
[1] Boussif O., Mahfoud M., Kaddar Y., Jain M., Li S., Fornasiere D., Chen X., Bengio Y., Whitammer E. S. Bayesian Symbolic Regression with Entropic Reinforcement Learning. arXiv preprint, 2026.[2] Udrescu S.-M., Tegmark M. AI Feynman: A physics-inspired method for symbolic regression. Science Advances, 2020.[3] Petersen B. K., et al. Deep symbolic regression: Recovering mathematical expressions from data via risk-seeking policy gradients. ICLR, 2021.[4] Tenachi W.-A., et al. PhySO: Physical symbolic optimization. arXiv preprint, 2023.[5] Malkin N., et al. Trajectory balance: Improved credit assignment in GFlowNets. NeurIPS, 2022.[6] Bengio Y., et al. Flow network based generative models for non-iterative diverse candidate generation. NeurIPS, 2021.[7] Bomarito J., Leser P. PySIPS: Sequential Monte Carlo for Bayesian symbolic regression. 2026.