← 返回 PaperDaily 大模型与智能体

1B vs 70B? 非凸优化新范式告诉你:零误差不如有误差

为什么神经网络训练到零误差反而更难?这篇论文从统计物理的视角给出了深刻答案——"冻结"的平衡态并非算法友好,而允许训练误差的"宽区域"才是算法可达的关键。它将OGP理论首次延拓到有限温度,证明热噪声不仅能避免过拟合,还能突破计算硬阈值,对理解深度学习的优化困境有重要启示。

原论文信息如下:
论文标题:
On the robustness of noisy solutions in non-convex neural networks
发表日期:
2026年7月
发表单位:
Bocconi University, Milano, Italy
原文链接:
https://arxiv.org/pdf/2607.27000v1.pdf

热噪声如何帮助神经网络“变聪明”?

大家有没有想过一个问题:为什么在深度学习里,追求“完全拟合训练数据”往往不是最优解?很多大模型(比如那些火爆的大语言模型)在训练时,计算资源有限,通常还没收敛就停了,训练损失根本没归零。但我们发现,这些“学艺不精”的模型,泛化能力反而更好。这到底是为什么?难道说,允许模型犯错,反而能帮它“长记性”?
这个问题,从优化理论和统计物理的交叉领域来看,已经困扰了学界很多年。传统观点认为,如果问题是一个复杂的“约束满足问题”(CSP),比如让一个二值感知机(Binary Perceptron)完美记住所有训练样本,那么当问题密度(样本数相对于网络参数数量)超过某个阈值时,最优解(零误差解)会变成稀少的、孤立的小点,算法极难找到。这就像你要在无边的沙漠里找一颗特定的沙子,理论上存在,但实际操作基本是“不可能完成的任务”。
近期,来自意大利博科尼大学(Bocconi University)的Enrico M. Malatesta、Alessandra Passalacqua和Riccardo Zecchina在arXiv上提交了一篇名为《On the robustness of noisy solutions in non-convex neural networks》的论文。这篇工作从根本上解释了,为什么我们在训练中引入一点“热噪声”(也就是允许一点小误差),就能神奇地解锁那些原本难以触及的“宽区域”,从而让算法找到好的解。简单说,这篇论文告诉我们:别总想着当“强迫症”非要误差归零,留点余地,世界更美好。

冻结相:零温幽灵蔓延至一切有限温度

在物理领域,科学家们早就发现,当某个系统(比如这里的二值感知机)处于“零温”(零误差)时,其平衡态的解空间会“冻结”起来——也就是所谓的“一级复制对称破缺”(1RSB,one-step replica-symmetry-breaking)状态。在这种状态下,所有正确解都分布在指数级数量的、彼此分离的、点簇状的小岛上。这些小岛之间距离遥远(汉明距离很大),而每个小岛内部则紧密得几乎没有熵。
一个极其关键的问题是:如果稍微升高点温度,允许一些误差存在,这种“冻结”现象会消失吗?很多人的直觉是,有了噪声,系统就该“融化”了。但这篇论文给出了一个令人震惊的答案:不会!即便温度升高,只要损失函数是“误差计数”这种硬惩罚形式,冻结相依然支配着整个平衡态。
论文作者使用了一个称为“动力学温度”(dynamical temperature, Td)的概念来刻画这一点。所谓动力学温度,就是低于这个温度时,系统会进入一个非遍历的玻璃态(冻结相)。他们惊人地发现,对于标准的误差计数损失函数,如公式(7)和(10)所示,在热力学极限下,这个动力学温度Td是发散的。换句话说,在任何有限温度下(只要还是误差计数),系统在平衡态下都是“冻结”的。这就像说,你给一个冰封的湖面撒了点热水,但它本质上还是一个大冰坨子。
图1展示了不同形式的单模式吉布斯权重。左侧是Horner提出的软惩罚形式,右侧是对数势形式。红线(γ=0)对应低温度时即产生冻结的误差计数函数。从图中可以清晰地看到,误差计数函数在决策边界处有一个尖锐的不连续跳跃,而软惩罚形式则平滑地过渡。这个差异正是冻结现象能否出现的核心所在。
论文进一步指出,冻结与否的关键,不在于温度本身,而在于损失函数在决策边界(也就是分类面)附近的行为。如果损失函数在边界上有一个不连续的跳跃(比如“错了就惩罚,对了就无事”这种0-1损失),那么无论温度如何,都会导致冻结。这就像在冰面上刻了一道深深的沟渠,温度变化很难填平它。只有当我们把损失函数修改得更平滑(比如用连续的软惩罚),才能从根本上避免冻结的发生。
为了更深入地理解这个机制,作者在论文中详细推导了动力学温度Td的表达式。他们发现,对于误差计数损失,Td与系统规模N成正比,因此在热力学极限下发散。这意味着,无论你设置多高的温度,只要N足够大,系统都会处于冻结相。这个结论非常反直觉,因为它告诉我们,仅仅依靠升高温度是无法“融化”由硬损失函数导致的冻结的。必须从根本上改变损失函数的形式,才能改变解空间的几何结构。

重叠间隙(OGP)的“温度版”长什么样?

既然平衡态的冻结是难以避免的,那算法该怎么寻找好解呢?这就是“重叠间隙”(Overlap Gap Property, OGP)理论的用武之地。OGP描述的是解空间的一种几何阻碍:当你考虑两个解时,它们的重叠度(overlap,可以理解为相似度)要么很大(几乎相同),要么很小(完全不同),但中间某个范围的重叠度是“禁止”出现的。这种“间隙”的存在,使得很多局部搜索算法(比如梯度下降)无法在这两种状态之间平滑过渡,从而陷入困境。
过去的研究主要集中在零温度下。本文的另一个核心贡献,就是将OGP的概念成功地推广到了有限温度。为了做到这一点,他们不再只计数“完美的零误差解”,而是考虑那些“允许有一定能量(误差)的配置”。他们定义了克隆配分函数(Cloned Partition Function)来研究这个问题:他们创建m个系统副本(称为“克隆”),约束它们两两之间具有固定的重叠q1,然后看系统能否在有有限能量的情况下同时存在。
结果非常有意思:当你允许的误差越大(温度越高),OGP出现的密度阈值αOGP(ε)就越高。也就是说,原本在零温时因OGP而被锁死的区域,在有限温度下变成了平坦的、可访问的“宽区域”。这就像你原本只能走独木桥(狭窄的零误差解空间),现在允许你走宽敞的大马路(广阔的有误差解空间),当然更容易走通了。
具体来说,作者通过复制方法(replica method)计算了克隆系统的熵sm(q1; β)。当熵变为负值时,意味着在给定的重叠q1下,系统无法找到两个同时满足能量约束的解,即该重叠区间被禁止。图2清晰地展示了这个过程:随着约束密度α的增加,熵曲线逐渐下移,最终在某些重叠区间变为负值,这就是OGP的经典特征。而随着温度升高(β减小),熵曲线整体上移,OGP出现的阈值αOGP也随之增大。
图2是论文的核心图之一。左图清晰地展示了随着约束密度α的增加,熵曲线逐渐下移,最终在某些重叠区间变为负值,这就是OGP的经典特征。右图展示了不同温度下,OGP阈值αOGP随克隆数m的变化。可以看到,温度越高(β越小),αOGP越大,说明允许误差确实能扩大算法可访问的区域。
他们还绘制了一个非常关键的“相图”(图3),将其展示在“训练误差 – 约束密度”平面中。图上清晰地画出了不同m值下的OGP边界,这条曲线将空间划分为两个区域:一个是大误差/低密度区域(算法上容易的),另一个是小误差/高密度区域(算法上困难的)。值得注意的是,随着m增大,OGP边界逐渐收敛到一条极限曲线,这条曲线就是算法可达性的理论极限。
图3清晰地展示了论文的核心结论:那些宽泛的、有限能量的区域(红色区域)在以前被OGP封锁的区域(高密度)中依然存在。论文作者还在附录中讨论了非物理的、由于RS假设导致的αOGP对m的非单调依赖性,并指出随着温度升高,这个问题会得到改善。具体来说,在低温下,αOGP随m的变化会出现非物理的振荡,这是复制对称(RS)近似失效的表现。而在高温下,这种振荡消失,αOGP随m单调递增,使得理论预测更加可靠。

算法实战:有限温度rAMP突破零温障碍

光有理论分析还不够,必须要用算法实践来检验。本文使用了一种名为“强化近似消息传递”(reinforced Approximate Message Passing, rAMP)的算法。这个算法可以看作是标准AMP算法的一个升级版,它的灵感来自于统计物理中的自旋玻璃理论。
它的工作流程大致如下(论文中的算法1):

初始化,先设置一个不受欢迎的AMP状态(零场),和一个初始的“强化”系数ρ0 = 0。

然后进入一个迭代循环(1)执行一个rAMP更新步骤,根据当前状态计算新的一组场和磁化强度。(2)更新强化系数ρt(使其逐渐增大),这个系数会像磁铁一样,把AMP的解向±1两侧极化。(3)通过符号函数sign(at)得到一个候选的二进制权重wt,并计算其训练误差。(4)如果误差达到目标,则成功返回。
实验是在存储(storage)模式下进行的,即标签是随机生成的,目标就是单纯地记住数据。他们在N=8000个神经元上进行了测试,结果如图4所示。
图4是最具说服力的结果。从左侧的小图可以看到,当目标训练误差ϵtarg=0(即追求完美零误差)时,成功概率在α≈0.78附近急剧下降,这正好对应了零温下的OGP阈值。但如果允许一点点误差(比如0.5%或1%),算法的成功概率曲线就会显著向右移动,能处理更大密度的数据!右侧相图更是完美地展示了这一点:红色点(rAMP实际表现)与OGP理论曲线(m=2, 3, 4)高度吻合,而且可以清晰地看到,算法的可达边界随着目标误差的增大而扩展。
值得注意的是,rAMP算法在实现时涉及多个超参数,包括温度β和强化系数ρ的调度策略。作者在附录中详细讨论了这些参数的选择对算法性能的影响。他们发现,β的选择需要在探索(高温度)和利用(低温度)之间取得平衡:过高的温度会导致解过于分散,难以收敛到低误差解;而过低的温度则会使算法陷入零温的OGP陷阱。通过精心设计的退火策略,rAMP能够在保持算法稳定性的同时,有效突破零温障碍。

教师-学生场景:有误差反而泛化更好?

光能记住(存储)数据还不够,我们更关心模型有没有真正“理解”数据,也就是泛化能力。这篇论文还研究了“教师-学生”(teacher-student)场景:先随机生成一个“教师”网络,用它来产生有噪声的标签;然后让“学生”网络尝试去学习这些标签。泛化误差用来衡量学生和教师对新数据的预测一致性。
他们发现一个极其重要的结论:那些在“高密度、有误差”的宽区域里找到的解,不仅算法上可以访问,而且它们的泛化能力也很好。更具体地说,在零温下OGP已经阻止了算法找到任何零误差解的时代(比如α=1.3),有限温度的rAMP算法却能在有误差的宽区域中找到一个解,而这个解的泛化误差甚至比平衡态的典型解还要好!
图5展示了这一点。
图5左图清晰地展示了在相同的任务密度下,只要稍微引入一点温度(比如T=0.2),就能找到一个重叠度q1很大的解(即两个副本很相似),其泛化误差居然比完美的零温解还要低。右图则从另一个角度说明,对于特定的克隆约束,有限温度下的解(红线)其泛化误差显著低于平衡态下的典型解(蓝线),而且非常接近理论上的贝叶斯最优(绿线)。
这个结果非常有启发性。它告诉我们,在计算上难以逾越的优化障碍(OGP),可以通过放宽对零误差的苛求来绕过,而且这种“妥协”非但没有降低模型性能,反而提升了泛化能力。这就解释了为什么很多大规模模型在训练时,“有意”不收敛到零损失反而效果更好。
作者进一步分析了泛化性能提升的原因。他们认为,有限温度下的解之所以泛化更好,是因为这些解位于解空间中的“宽区域”,即那些对参数扰动不敏感的区域。这种平坦的最小值(flat minima)在深度学习文献中已被广泛证明与更好的泛化能力相关。而零温下的精确解往往位于尖锐的极小值点,对噪声和扰动非常敏感,因此泛化能力较差。这篇论文从统计物理的角度,为“平坦最小值泛化更好”这一经验观察提供了严格的理论基础。

总结与展望:当“允许犯错”成为优化新哲学

这篇论文到底想告诉我们什么?总的来说,它系统性地证明了:在非凸神经网络中,零误差的“精确解”和“有噪解”有着完全不同的几何结构和算法可达性。
它的核心创新点在于:

第一,它将“冻结相”(1RSB)从零温推广到了所有有限温度,并找到了导致冻结的关键机制——损失函数在决策边界是否光滑。

第二,它成功地将“重叠间隙(OGP)”的概念延拓到了有限温度,并严格证明了,允许误差(有限能量)的解可以突破零温OGP强加的算法障碍。

第三,通过一个教师-学生模型,它展示了这种允许误差的“宽区域”并不是菜鸟的避风港,反而具有极好的泛化能力,甚至能超越平衡态下的典型解。

未来展望:虽然这项研究基于高度简化的二进制感知机模型,但其思想无疑是具有启发性的。后续的研究或许可以:(1)将这套理论推广到更复杂的现代深度神经网络(比如多层感知机,甚至CNN、Transformer);(2)设计出能够自然引导优化器去搜索“宽区域”而非“精确极值点”的实用训练算法(例如:基于局部熵最大化或平坦最小化);(3)从统计物理角度进一步研究“平滑损失函数”如何帮助大模型获得更好的泛化。
这篇论文为“为什么允许犯错的模型更好”提供了严谨的数学物理支撑。它给我们的启发是:在优化领域,有时候,放弃对一个目标的执念,反而能让你找到通往另一个更大目标的捷径。下次再有人指着你的模型说“你训练误差还没降到零”,你可以理直气壮地告诉他:我这是在故意留点“热噪声”,为了突破重叠间隙,为了更好的泛化!

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问题1:这篇论文提到的“冻结相”(Frozen Phase)到底是什么意思?和我们常说的“过拟合”有什么关系吗?

“冻结相”是一个物理术语,在论文中指代的是解空间的一种特殊结构:所有真正的最优解(完美符合训练数据的解)都像雪花一样,孤零零地散落在广阔的沙漠里,彼此相距甚远(汉明距离大)。这种稀疏性导致任何梯度下降或局部搜索算法都极其难以找到它们,因为你的搜索过程大概率会落在两个解之间的“无解区”。这和过拟合不同。过拟合是模型记住了噪音,导致泛化差。而“冻结相”问题指的是,你连记住噪音、达到零误差的“过拟合”状态都做不到。这是比过拟合更底层的计算硬障碍。
问题2:文章中提到的rAMP算法具体是什么?与传统AMP有何不同?
rAMP(reinforced Approximate Message Passing,强化近似消息传递)是传统AMP算法的一个巧妙的演变。传统AMP在给定温度下会计算出一个概率分布(磁化强度),但它的输出常常是模糊的(比如a_i≈0),没法直接给出一个确定的二进制解。rAMP做了一件事:在迭代过程中逐步引入一个“强化”项ρt。这个项就像是给你的推断过程加了一个“倾向于相信自己决策”的偏置。随着迭代次数增加,强化效应会越来越强,最终“迫使”每个变量的磁化强度极化到+1或-1,从而得到明确的二进制分类边界。简单说,就是把AMP的“模棱两可”变成了“坚定不移”。
问题3:论文说“热噪声能突破零温障碍”,这在实际训练中怎么理解?是不是意味着我们在训练时要故意让模型多出错?
这是一个很好的理解点。论文的核心结论是:在算法层面上,在一个包含有限误差的“平坦盆地”里找到一个解,比在无数个孤立的“尖峰”(零误差解)里探险要容易得多。在实际训练中,这并不等于要故意犯错,而是指我们应该避免一味追求“百分百拟合”。更好的策略是:在训练的早期和中后期,使用合适的学习率和正则化(比如权重衰减、Dropout、标签平滑),这些技术本质上就是在向损失函数中引入“热噪声”,促使模型停留在那些泛化能力强的宽区域中,而不是掉入一个伤害泛化的过拟合尖峰。这与论文的理论完美契合。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

首次将“冻结相”理论明确推广到有限温度,并用一个简洁的边界层判据揭示了冻结的根本原因。同时,将OGP从零温延拓到有限温度,构建了全新的相图。这个理论框架非常漂亮,是对传统认知的一次重要升华。

实验合理度:★★★★☆

论文设计了从存储到教师-学生的完整实验链条。rAMP算法的表现与理论的OGP边界高度一致,验证效果强。扣一星是因为算法的分析和调优(β和ρ的参数选择)在正文中稍微简略,但附录里有补充,总体是满意的。

学术研究价值:★★★★★

极高。它为理解非凸优化中“噪声”的作用提供了一个全新且严格的数学物理视角。这套分析框架可能会启发一系列后续工作,比如探索更复杂的损失函数(如光滑的交叉熵)如何改变解空间的几何结构,甚至在深度学习中验证这些发现。

稳定性:★★★☆☆

这是理论物理学论文,推导和解空间分析是严格的。但其对实际深度学习模型的稳定性(比如对学习率、初始化敏感度)没有直接覆盖。作者展示的rAMP算法虽然有效,但这是一个高度特化的消息传递算法,其稳定性依赖于调参,不适合直接当作通用优化器。

适应性以及泛化能力:★★☆☆☆

虽然论文的“教师-学生”实验讨论了泛化,但模型本身是极其简单的二值感知机。其结论对真实世界中的深度网络(ReLU激活、连续权重)的普适性和适应性还是未知。这篇论文更像是探讨了基本原理的“理想实验”,而不是为了直接解决实际数据库。

硬件需求及成本:★★★★☆

对于rAMP算法,虽然N=8000对于现代AI不算大,但它在每次迭代中都需要处理P×N规模的矩阵操作,而且要达到高精度需要许多迭代。对于其目标(理解理论)来说是够用的,但计算成本相对其模型复杂度并不友好。不过如果只看理论推导,没有硬件限制。

复现难度:★★☆☆☆

复现这篇论文的核心结果需要较强的数学物理背景(尤其是复制方法、随机矩阵论、大偏差理论)。虽然推导过程在附录中有详细说明,但对于大多数AI工程师来说,这是一道很高的门槛。算法的实现(rAMP)也相对复杂,不易直接复现。

产品化成熟度:★★☆☆☆

现阶段成熟度很低。它是一项纯基础理论探索。虽然其思想对理解现代深度学习有很大启发,但它并没有提供一个即插即用的、可替代Adam或SGD的通用产品。产品化需要设计出能引导大模型走向宽区域的新算法,这取决于未来几代的研究。

可能的问题:

论文的数学推导非常扎实,但主要依赖复制对称(RS)近似,虽然作者指出了非物理的m依赖性,但未进行更高级的复制对称破缺(full RSB)计算来精确确定阈值,这可能影响对更精细OGP边界的判定。此外,研究完全基于离散权重模型,和持续权重神经网络的直接联系有待建立。

主要参考文献

[1] E. M. Malatesta, A. Passalacqua, R. Zecchina. On the robustness of noisy solutions in non-convex neural networks. arXiv:2607.27000v1, 2026.
[2] 文章内引用的经典文献,如[1] A. Baldassi et al., “Subdominant Dense Clusters Allow for Simple Learning and High Computational Performance in Neural Networks”, 2015; [4] S. K. Gamarnik, “The overlap gap property: a topological barrier to optimization”, 2021等,请直接参考原文。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
热噪声不是敌人,而是优化盟友!想跟龙哥一起探讨统计物理与机器学习的交叉前沿?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器学习理论+上海+交大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。