← 返回 PaperDaily 大模型与智能体

俄高校最新证明:逆强化学习内层Hessian天生等于Fisher矩阵

逆强化学习难在双层优化里的逆Hessian-向量积,又贵又不稳。这篇来自俄罗斯HSE大学的工作证明了一个漂亮结论:内层最优时Hessian就是Fisher信息矩阵的常数倍,再用流式素描去近似,存储从O(d²)直接降到O(md)。方法在CartPole和LQR上都跑出了不错效果,思路清爽,值得一读。

俄高校最新证明:逆强化学习内层Hessian天生等于Fisher矩阵
原论文信息如下:
论文标题:
Efficient Hypergradient Descent for Inverse Reinforcement Learning
发表日期:
2026年8月

发表单位:
俄罗斯高等经济大学(HSE University)

原文链接:
https://arxiv.org/pdf/2608.11052v1.pdf
先从问题本身说起。逆强化学习(IRL)要做的事情很纯粹:给定专家的演示轨迹,反推出专家背后的奖励函数。为什么有了行为克隆(直接模仿专家动作)还不够?因为行为克隆学到的只是“在见过的状态下怎么做”,一旦环境动力学改变、或者下游约束变化,模仿出来的策略就抓瞎了。而奖励函数是一种更本质的抽象——知道了奖励,就能在新环境下重新做策略优化,这才是“学到精髓”。
但逆强化学习有一个让人头疼的数学结构:它天然是个双层优化问题。上层(外层)要找一个奖励函数参数,使得在这个奖励下训练出的最优策略能够匹配专家演示;下层(内层)则是给定奖励函数后,去做一次完整的策略优化。换句话说,外层每走一步,都要“想象”内层已经收敛到了一个最优策略,然后根据这个策略与专家的差距来更新奖励。这个“想象”的成本极高。

引言:逆强化学习为何需要双层优化

在最大似然逆强化学习(ML-IRL)框架下,双层优化问题可以写成如下形式:外层最小化专家轨迹分布与内层最优策略诱导的轨迹分布之间的KL散度;内层则是在给定奖励函数下,最小化策略分布与奖励诱导分布之间的KL散度。由于内层嵌套在外层求解过程中,外层梯度需要穿透内层优化过程,这就引出了所谓的“超梯度”(hypergradient)。
超梯度的标准形式为:外层梯度 ∇θL_outer 乘以内层Hessian的逆、再乘以内层混合二阶导。这里的核心难点就落到了 逆内层Hessian-向量积 上。直接显式构造Hessian矩阵需要O(d²)内存,这在策略参数维度稍高时就捉襟见肘;而用迭代法近似求逆又需要多次Hessian-向量积,且对矩阵条件数敏感。这就是双层IRL在实际中“听起来很美、跑起来要命”的根本原因。

方法概述:ML-IRL双层优化与隐式超梯度

论文沿用Zeng等人2022年提出的ML-IRL框架,并将其与隐式微分(implicit differentiation)结合。整体流程是:外层奖励参数φ通过隐式超梯度更新,内层策略参数θ则在每个外层迭代中先求解到接近最优。关键设计在于——不直接处理内层Hessian,而是利用最大似然IRL的结构特性,把Hessian替换成策略的Fisher信息矩阵。这样就把“复杂的二阶优化”转化为“带几何意义的自然梯度类更新”。
这里有个值得注意的细节:一般的自然超梯度下降(NHGD)假设内层是固定数据分布下的负对数似然或前向KL,而ML-IRL的内层是反向KL,且采样分布本身依赖于策略参数。也就是说,Hessian-Fisher等价关系并不是一眼就能看出来的。论文的贡献恰恰在于证明了:在内层精确最优且策略类足够丰富(可实现性)的条件下,内层Hessian等于温度系数α乘以折扣轨迹Fisher信息矩阵。

图:超梯度的隐式微分形式。它由三部分构成:内层混合二阶导、内层Hessian的逆、以及外层梯度。其中求逆操作是主要计算瓶颈。 这个公式里的 逆内层Hessian-向量积 就是那个"跑起来要命"的元凶。直接显式构造Hessian矩阵需要O(d²)内存,d是策略参数维度——策略网络稍微大一点,内存就爆炸。用迭代法(比如共轭梯度)近似求逆,又需要多次Hessian-向量积,而且对矩阵条件数非常敏感。这就是双层IRL"听起来很美、跑起来想哭"的根本症结。 那么,有没有可能绕开这个昂贵的求逆操作?这正是本论文的出发点。 核心理论突破:内层Hessian与Fisher信息矩阵的等价关系 在一般的双层优化问题中,内层Hessian没有特别的结构可以利用。但在ML-IRL这个具体问题里,内层目标函数有一个值得深挖的性质:它是策略诱导轨迹分布与奖励诱导轨迹分布之间的反向KL散度。 这里出现了一个微妙的差异。此前的工作——比如自然超梯度下降(Natural Hypergradient Descent,NHGD)——通常假设内层是固定数据分布下的负对数似然或前向KL目标。在这种设定下,Hessian和Fisher信息矩阵的等价关系是直接成立的。但ML-IRL的内层是反向KL,而且采样分布本身依赖于策略参数,这就让等价关系不再"一眼可见"。 本论文的关键理论贡献,恰恰是在这个"看起来不成立"的地方找到了成立的路径。论文证明了:在内层问题被精确求解、且策略类足够丰富(即可实现性条件)的前提下,内层Hessian恰好等于温度系数α乘以折扣轨迹Fisher信息矩阵。用公式写出来就是: Hessian-Fisher等价公式 图:内层Hessian与Fisher信息矩阵的等价关系。α是固定温度参数,F是折扣轨迹Fisher信息矩阵。 这里的Fisher信息矩阵定义为: Fisher信息矩阵定义 图:折扣轨迹Fisher信息矩阵。它衡量的是策略对数似然对参数θ的敏感程度,是自然梯度方法的核心几何对象。 为什么这个等价关系能成立?直观来看,当内层达到最优时,策略分布与奖励诱导分布完全对齐——也就是KL散度为零。在这个"完美对齐"的点上,内层损失函数对策略参数的二阶变化,不再受到奖励函数形状的干扰,只留下策略本身分布曲率的信息。而这个曲率,恰恰就是Fisher信息矩阵。整个过程有点像一个复杂的函数在极值点处突然"卸下伪装",露出了底下最简单的几何结构。 这个结果的工程意义相当直接:原本需要二阶导数的Hessian,现在可以用一阶导数(策略得分向量)的外积来估计。这意味着我们可以通过采样子轨迹,用蒙特卡洛方法来近似Fisher信息矩阵: Fisher估计公式 图:Fisher信息矩阵的蒙特卡洛估计。N_agent是智能体采样的轨迹数量,γ是折扣因子。 这样一来,求逆Hessian-向量积的问题,就转化成了求逆Fisher-向量积的问题。但新的麻烦也随之而来:Fisher矩阵是稠密的,直接存下来仍然是O(d²)的代价。对于现代深度强化学习中的策略网络,d可能高达数百万,O(d²)完全不可行。 计算瓶颈破解:流式谱素描如何避免构造稠密Fisher矩阵 要理解本论文的第二个核心贡献,先要明白一个关键的线性代数事实。带阻尼的Fisher系统可以写成: 阻尼Fisher系统 图:阻尼Fisher系统。其中λ是正则化参数,v是待求的逆Fisher-向量积,g是外层梯度。 注意到αF可以分解为XᵀX的形式。这里X的"行"正是每条轨迹上每个时间步的加权策略得分向量: 加权策略得分向量 图:由策略得分向量构造加权行向量。这些行向量按顺序流式生成,不需要一次性全部存储。 有了这个分解,求解系统就变成: X^TX系统 图:用XᵀX表示Fisher矩阵后的线性系统。 这个形式带来了一个关键的可能性:我们不需要先构造出X矩阵再算XᵀX,而是可以让X的行向量一条一条地"流过"一个紧凑的数据结构,在这个流式过程中逐步累积Fisher矩阵的谱信息。这个数据结构就是论文采用的 SCFD(Spectral Compensation Frequent Directions,谱补偿频繁方向) 素描。 SCFD的底层直觉其实很朴素。想象你需要记住一大堆高维向量所张成的"主要方向",但又不想把它们全部存下来。SCFD维护一个固定大小(m行)的素描矩阵,每次来一个新向量,就把它拼接上去,然后对拼接后的矩阵做一次压缩,丢弃那些谱能量最小的方向,同时用一种谱补偿机制保留被丢弃方向的残余信息。这样,无论流过多少条数据,素描矩阵始终只有m行,存储开销被牢牢控制在O(md)。 论文在算法层面则分两条路走:Explicit Fisher(显式Fisher) 直接构造并求解稠密Fisher系统;Fisher with Sketching(素描Fisher) 则用SCFD素描替代显式构造。素描方法还带来一个额外的"惊喜":由于素描在压缩过程中天然带有正则化效果,它比显式求解在更小的λ下也能保持稳定。也就是说,素描不仅在内存上省钱,还可能让优化过程更稳。 实验验证:素描方法在CartPole与LQR上的性能与效率权衡 论文在两类环境中验证了所提方法:CartPole(离散动作的低维经典控制)和 LQR(线性二次型调节器的连续控制,参数维度更高)。对比基线是Zeng等人2022年提出的单循环ML-IRL方法。所有方法使用相同的策略与奖励网络结构、相同的专家数据和计算预算。 先看阻尼参数λ的影响。论文用显式Fisher方法隔离λ的作用,做了网格搜索: 图1:Fisher阻尼参数λ对优化的影响 图1:Fisher阻尼参数λ对优化的影响。左图为训练过程中验证集上的外层损失,右图为最后五次外层迭代的平均外层损失。 结果非常有意思:λ既不能太大也不能太小,存在一个明显的"甜点区"。λ太小(比如10⁻³),Fisher系统病态,优化过程剧烈震荡;λ太大,系统被正则化主导,Fisher信息起不到作用,外层损失同样不理想。λ=1时效果最好,外层损失降到185.27±4.38。这是一个 稳定性-保真度权衡:阻尼既要抑制数值振荡,又不能淹没Fisher的几何信息。 接下来看素描大小m的影响: 图2:SCFD素描大小对优化的影响 图2:固定λ=10⁻³时,SCFD素描大小m对优化的影响。左图为验证外层损失曲线,右图为最后五次迭代的平均外层损失和相对Explicit Fisher的加速比。 结果同样是耐人寻味的:m=64时效果最好(181.70±2.60),甚至超过显式方法;m增大到256,性能反而下降,速度也变慢(只有0.78×加速比)。这说明素描并非越大越好——中等大小的素描既能捕捉Fisher的主要谱结构,又因为压缩过程中引入的隐式正则化,反而让优化更稳定。而太大的素描增加了计算开销,却没有带来额外的质量提升。 计算效率方面的数据进一步印证了素描方法的优势: 表1:素描方法的计算效率 表1:Fisher with Sketching相对Explicit Fisher的计算效率。内存增幅为峰值内存比,时间加速比为每次外层迭代的墙钟时间比,大于1×表示提升。 在LQR这种参数维度更高的环境中,素描的内存优势充分体现,峰值内存最高降低1.31倍;在CartPole上内存虽然基本不变,但时间加速比达到1.29倍。素描方法的收益随Fisher表示成本的增加而扩大。 最终,在匹配24小时计算预算的条件下,论文比较了三种方法的奖励学习质量: 表2:匹配计算预算下的最终IRL性能 表2:匹配计算预算下的最终IRL性能。PolicyNLL是学到的奖励重新训练策略后,其动作与专家动作的负对数似然(越低越好);EnvReturn是该策略在真实奖励下的回报(越高越好);RankCorr是学习奖励与真实奖励之间的秩相关(越高越好)。 从结果看,Fisher-based方法在PolicyNLL上具有一定优势,与基线ML-IRL相当或更好;RankCorr指标上,素描Fisher表现出不错的奖励排序质量。在LQR上,论文给出了随墙钟时间变化的详细曲线: 图3:LQR验证集上各项指标随墙钟时间的变化 图3:LQR验证集上PolicyNLL、EnvReturn和RankCorr随墙钟时间的变化(截取前20000秒)。可以看到,Fisher with Sketching用更少的外层迭代就达到了与ML-IRL相当的性能。 值得注意的是,在相同墙钟时间下,素描Fisher完成的迭代次数比ML-IRL少一个数量级——但性能却追平甚至超越了基线。这说明素描方法每一步的"信息效率"更高:ML-IRL用大量廉价但粗略的更新,而素描Fisher用少量但更精准的更新。 方法局限与未来展望:可扩展性与理论假设的边界 这篇论文在理论推导和方法设计上都相当精巧,但作为读者,也需要清醒地看到它的边界。 首先是理论假设的严格性。论文的核心定理(Hessian等于Fisher矩阵)依赖两个前提:一是内层问题被精确求解到最优,二是策略类足够丰富,能够完全表达奖励诱导的轨迹分布(可实现性)。在实际深度强化学习中,这两个条件都只能近似满足。内层通常是用PPO、SAC等算法迭代若干步得到的近似解,策略网络也未必能完美覆盖奖励诱导分布。不过论文指出,只要内层解足够接近最优,Hessian-Fisher等价关系就近似成立——这为方法在实际使用中的效果提供了合理解释。 其次是λ的敏感性。实验结果清楚表明,λ的选择对优化稳定性影响很大。虽然素描方法在更小的λ下也能保持稳定,但λ本质上是一个需要额外调参的超参数。对于不同环境、不同奖励参数化方式,最优λ可能不同,这给实际应用增加了调参成本。 第三是验证规模的局限。CartPole和LQR都是相对简单的控制问题,策略参数维度并不高。论文声称素描方法在高维场景下收益更大——这在理论上合理(维度越高,O(d²)与O(md)的差距越悬殊),但尚缺乏大规模深度RL环境的实证。此外,论文没有给出24小时训练后的完整迭代次数、PolicyNLL具体数值等原始数据,读者难以进行精确的复现对比。 未来值得探索的方向包括:将素描Fisher方法扩展到更复杂的连续控制任务和视觉输入环境;引入自适应正则化策略来减轻λ调参负担;以及将这种方法推广到其他形式的奖励设计问题,而不仅限于ML-IRL。 龙迷三问
下面是龙哥对于大家可能的一些问题的解答:

问题一:SCFD素描到底是什么?和常见的PCA降维有什么区别?SCFD(Spectral Compensation Frequent Directions,谱补偿频繁方向)是一种流式矩阵素描算法。它维护一个固定大小的矩阵(m行),逐行"吸收"新数据,在每次吸收后做一次确定性压缩,丢弃最不重要的奇异方向,并用谱补偿保留被丢弃方向的能量痕迹。与PCA需要一次性看到全部数据不同,SCFD可以逐条处理数据流,非常契合强化学习中轨迹逐条生成、逐条消费的场景。它存储的"素描"不是一个随机投影,而是一个确定性的、保留了矩阵Top奇异子空间信息的小矩阵。

问题二:为什么Fisher信息矩阵的逆可以代替Hessian的逆?这样做有什么理论依据吗?这来源于自然梯度方法的核心思想。在ML-IRL的内层最优处,策略分布与奖励诱导分布之间的KL散度为零,此时内层损失对策略参数的二阶导数恰好等于策略分布本身的Fisher信息矩阵。Fisher矩阵描述的是策略分布对参数变化的敏感程度,它天然带有参数空间的几何信息。用Fisher矩阵的逆来预条件外层梯度,等效于把梯度更新从欧几里得空间"搬运"到分布流形上的自然空间。这比普通梯度更新更稳定、更高效。

问题三:实际使用中sketch大小m应该怎么选?有经验法则吗?论文实验表明,m=64在CartPole和LQR上已经足够好,再增大m反而可能带来性能回退和速度下降。一个合理的经验法则是:m应略大于策略参数有效维度的"主要奇异值数量"。建议从较小的m(如32或64)开始,观察外层损失曲线是否稳定下降;如果优化不稳定,可以适当增大m或增加阻尼λ。由于素描方法比显式方法对λ更不敏感,实际使用中可以相对放心。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评

论文创新性分数:★★★★☆

将Hessian-Fisher等价关系首次引入ML-IRL的隐式超梯度计算,并用SCFD解决可扩展性问题,理论创新和方法组合都很新颖,但核心数学工具并非原创发明。

实验合理度:★★★☆☆

在CartPole和LQR上做了对比并匹配了计算预算,但任务规模偏简单,缺乏高维策略下的素描优势实证;部分表格没有给出原始数值,使读者难以独立判断提升幅度。

学术研究价值:★★★★☆

证明了反向KL内层最优处Hessian-Fisher等价的成立条件,为后续在更广泛的反向KL双层优化问题中使用Fisher几何铺平了道路,理论意义扎实。

稳定性:★★★☆☆

λ的选择对外层优化的稳定性有显著影响;素描方法在弱阻尼下比显式方法更稳,但整体仍需要调参,离"开箱即用"还有距离。

适应性以及泛化能力:★★★☆☆

方法在低维控制问题上表现良好,但高维、视觉输入、真实机器人等场景尚未验证,泛化能力有待证明。

硬件需求及成本:★★★★☆

素描方法的存储复杂度O(md)显著优于显式O(d²),在中等维度问题上有实测加速;训练仍需内层RL求解器,总成本不低,但相对已有超梯度方法已有明显改善。

复现难度:★★★☆☆

算法流程描述清晰,但论文未明确提供代码开源信息,且部分实验表格缺少原始数值;SCFD的工程实现有一定门槛。

产品化成熟度:★★☆☆☆

目前更适合作为学术算法参考,短期内在产品中落地还需解决调参成本、大规模环境验证和代码工程化等问题。

可能的问题:实验规模偏小,缺少高维策略下素描的实效验证;λ敏感性限制了实用便利性;部分关键数值未完整报告,期待后续工作补全。

主要参考文献
[1] Zeng S., Li C., Garcia A., et al. Maximum-Likelihood Inverse Reinforcement Learning with Finite-Time Convergence Guarantees. NeurIPS 2022.
[2] Kong L., et al. Natural Hypergradient Descent. 2026.
[3] Chen Z., et al. Spectral Compensation for Frequent Directions. 2020.
[4] Levine S. Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review. 2018.
[5] Ghadimi S., Wang M. Approximation Methods for Bilevel Programming. 2018.
融会贯通
结合PaperDaily已收录论文可观察到,将Fisher信息矩阵用于加速双层优化的思路,在奖励设计和策略对齐问题中正变得越来越常见。例如PARL方法用隐式超梯度做策略对齐,而一些迭代RLHF的工作则指出忽略策略对奖励模型更新的影响会丢失重要的"转向项"。本论文的独特之处在于,它专门针对ML-IRL的反向KL内层结构,给出了Hessian-Fisher等价的严格条件,这让Fisher几何的应用不再只是经验性的工程技巧,而是有了理论基础。
不过需要提醒读者的是,PaperDaily目前收录的同基准对比中,未能找到本论文在LQR/PolicyNLL等指标上的明确数值参照。也就是说,我们无法独立验证它在这些指标上是否显著优于其他已收录方法。论文展示的结果是在其自身设定的实验条件下获得的,读者在与其他工作比较时,需要注意split、setting和baseline可能存在差异。建议将本文的定性结论(如"素描方法在中等规模问题上有内存和速度优势""Hessian-Fisher等价在IRL中有效")作为主要参考,而非追求精确的数值排名。
总体来看,这是一篇理论驱动、工程意识在线的工作。它把一个看似"劝退"的逆Hessian问题,通过几何洞察转化成了可扩展的流式素描问题,给IRL社区提供了一个值得尝试的新工具。后续如果能在高维环境、真实机器人任务上进一步验证,并开源代码,这篇工作的影响力还会再上一个台阶。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
从专家演示里“读懂”奖励函数,让AI学会举一反三,这正是逆强化学习的魅力。想第一时间跟进强化学习、奖励建模与双层优化的前沿解读?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 RL+上海+复旦+小张),根据格式备注,可更快被通过且邀请进群。 『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?逆强化学习可视为双层优化,但超梯度中的逆Hessian-向量积计算昂贵。
这篇工作最值得看的点是什么?在LQR环境中,Fisher with Sketching达到最高RankCorr(0.972),ML-IRL在PolicyNLL和EnvReturn上略优;在CartPole上所有方法均达到专家级EnvReturn,Fisher with Sketching显著改善PolicyNLL(183.35 vs ML-IRL的331.20)
这篇工作的边界或风险在哪里?优点:(1) 理论上证明了内层Hessian与Fisher信息矩阵的比例关系,为超梯度计算提供了理论基础;(2) 采用SCFD素描方法有效降低存储复杂度;(3) 在奖励排序质量上表现优异。缺点:(1) 理论结果依赖"可实现性"假设(内层完全最优且策略类足够丰富),实际中难以严格满足;(2) 素描大小m的选择对性能影响较大,且最优m不随维度单调增加;(3) 在LQR上PolicyNLL和EnvReturn不如ML-IRL基线。

龙哥点评

论文创新性分数:★★★★☆

利用内层最优处Hessian与Fisher信息矩阵的比例关系,提出基于Fisher的超梯度计算方法,并采用流式谱素描(SCFD)近似逆Fisher-向量积,避免显式构造Fisher矩阵。

实验合理度:★★★★☆

PolicyNLL(策略负对数似然,越低越好)、EnvReturn(环境回报,越高越好)、RankCorr(学习奖励与真实奖励的秩相关性,越高越好)

学术研究价值:★★★★☆

利用内层最优处Hessian与Fisher信息矩阵的比例关系,提出基于Fisher的超梯度计算方法,并采用流式谱素描(SCFD)近似逆Fisher-向量积,避免显式构造Fisher矩阵;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

显式Fisher方法存储复杂度O(d_θ²),素描方法降至O(md_θ);在LQR环境中素描方法峰值内存降低最多1.31倍,CartPole上获得1.29倍加速

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 理论结果依赖"可实现性"假设(内层完全最优且策略类足够丰富),实际中难以严格满足;(2) 素描大小m的选择对性能影响较大,且最优m不随维度单调增加;


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。