← 返回 PaperDaily
大模型与智能体
最新SOTA!多目标强化学习不用改算法,只换网络结构就能让HV暴涨132%?
单目标强化学习靠“换网络结构”就能白捡一大截性能,多目标强化学习却还在算法泥潭里打转?马萨里克大学和阿托大学的最新研究直接把SimbaV2架构搬进MORL,HV暴涨132%,证明“算法不够,架构来凑”这条路在多目标领域同样走得通。对正纠结算法创新还是架构升级的读者来说,这篇论文给出了一个极具性价比的新方向。
龙哥读论文
发布于 2026-08-14 08:31:05
阅读 5
查看原文
原论文信息如下:
多目标强化学习(MORL)这几年有点尴尬。算法轮番上阵,今天来个偏好选择,明天来个更新规则,大家挤破头想在帕累托前沿上多占几个点。可回头一看,价值函数和策略网络还老老实实用着最朴素的“全连接+条件输入”组合。单目标那边早就靠换网络结构“白嫖”了一大截性能,多目标这边却没人想过:会不会问题根本不在算法,而在那一堆老掉牙的MLP?
马萨里克大学和阿托大学的研究者决定不做“算法内卷”的旁观者。他们干了件看起来有点“偷懒”的事:把单目标强化学习里已经被验证过的SimbaV2架构,整体搬到多目标场景,并针对多目标回报分布的特点做了个简单到让人意外的适配。结果?在多目标连续控制基准上,超体积(HV)直接比基线算法CAPQL提升132%,比第二名的PGMORL也高出35%。
引言:多目标强化学习为何停滞不前?
多目标强化学习想要解决的问题很实在:现实世界里几乎没有哪个任务只关心单一指标。药物设计要同时考虑药效和毒性,机器人控制要兼顾速度和能耗,医疗方案要平衡疗效和副作用。MORL的终极目标不是找一条最优策略,而是找出一整组策略,覆盖不同偏好下的帕累托前沿,让用户事后根据需求挑选。
思路没问题,但进展有点慢。主流方法分三派:单策略方法只管一个偏好,遇到新偏好就得重训;多策略方法为每个偏好训一个策略,样本效率惨不忍睹;通用策略方法学一个以偏好为条件的万能策略,听着美好,实际训练时却面临严重的泛化挑战——不同偏好对应的最优行为可能天差地别,简单的条件注入根本学不过来。
更微妙的问题是,这些方法在算法层面花式创新,价值函数和策略网络却清一色用最朴素的MLP。反观单目标强化学习,近年来一系列研究(SimBa、SimbaV2、XQC等)证明了一个反直觉的事实:在不改动算法任何逻辑的前提下,仅仅把网络做得更“现代”——加上归一化、改用分布批评者——就能让性能和样本效率显著提升。这种“架构红利”在多目标领域几乎没人碰过。
本论文的核心问题因此非常直接:多目标强化学习能否从深强化学习的最新网络设计进展中获益?答案是肯定的,而且收益远超预期。
方法概述:架构现代化迁移
Momba的构建思路可以用一句话概括:找个靠谱的单目标架构,原封不动搬到多目标场景,再解决一个多目标独有的问题——怎么处理多维回报的分布。
论文选的基础算法是CAPQL,一个带熵正则化的多目标SAC变体。选择理由很务实:第一,CAPQL的熵奖励能保证诱导出的解集严格凸,在线性标量化下数值优化更稳定;第二,SAC本身就是单目标架构研究的常用试验台,血缘关系近,迁移起来名正言顺。
架构方面直接采用SimbaV2,其三大核心组件分别是:
观察与特征归一化: 对观测的每一维计算运行均值和方差进行标准化,再映射到单位超球面。为了不丢失原始幅度信息,在映射前拼接一个正的偏移常数。这一招能防止网络对高方差特征过拟合,缓解强化学习特有的“可塑性损失”问题。
权重归一化: 每层线性层被分解为单位超球面约束的权重和一个可学习的逐元素缩放向量,每次梯度更新后对权重执行L2归一化。同时用可学习的插值层(LERP)替代传统残差连接,让网络自己决定“继承多少、改造多少”。
分布批评者: 这是本论文真正的创新点所在。后面详细展开。
一个值得注意的细节是偏好采样策略。CAPQL原本每个时间步都重新采样偏好,Momba改为每个回合(episode)采样一次。这个改动并非拍脑袋:多目标领域的主流工作(如PGMORL、GPI-LS等)都采用回合级采样,这样能让策略在单个回合内“专心”优化一个目标,也更贴近真实部署场景。
核心设计:标量化分布批评者
把C51式的类别分布批评者搬到多目标领域,绕不开一个问题:多目标返回是向量,分布批评者怎么建模多维分布?
已有工作要么局限于表格型场景(Wiltzer等),要么需要指定核函数来度量分布间距离(Zhang等),落地都很麻烦。本论文观察到一个关键事实:在策略优化过程中,批评者的预测只通过标量化后的Q值影响策略更新。既然如此,干嘛非得建模完整的多维联合分布?直接学习标量化返回的一维分布不就完了?
这个洞察的价值在于:它把一个看似复杂无比的多维多目标分布学习问题,巧妙地化简为单目标场景已经成熟的分布学习问题。公式推演如下:
在CAPQL中,Q网络通过最小化均方误差来学习向量化返回:
L_Q(θ) = E( s,a,r,s′,ω )∼D ‖ Q̂ − Q_θ(s,a,ω) ‖²
其中 Q̂ 是使用目标网络计算得到的TD目标,策略π_φ则最大化标量化后的Q值加上熵正则项。而Momba将Q网络替换为分布批评者 Z_θ(s,a,ω),通过最小化交叉熵损失来学习标量化返回的分布:
L_Z(θ) = E( s,a,r,s′,ω )∼D H( Ẑ(ωᵀr, s′), Z_θ(s,a,ω) )
其中 Ẑ 是使用标量化奖励 ωᵀr 计算的TD(0)自举估计。策略优化时则取分布批评者的期望值:
E_{a∼π_φ} [ E[ Z_θ(s,a,ω) ] ] + αH(π_φ(·|s,ω))
为了让回报落在分布批评者的有限支撑集内,论文采用了一种按分量归一化的做法:每个奖励分量除以其训练中观测到的最大返回值,再乘以一个缩放常数。与单目标场景按运行标准差归一化不同,多目标场景中返回的幅度会随偏好显著变化,因此采用“按最大返回归一化”更合适。实验表明,这种处理能提供稳定梯度,同时保证各奖励分量在标量化前具有可比量级。
数据准备及实验设计
实验设计相当全面。基准方面选用了MORL领域标准的7个连续控制任务,覆盖6个MuJoCo环境:Ant、Swimmer、HalfCheetah、Humanoid、Walker2D和Hopper,其中Hopper有双目标和三目标两个变体。对照方法包括4个:CAPQL(基础算法,无任何架构改进)、PGMORL(多策略进化方法)、DPMORL(多策略分布方法)、GPI-LS(当前样本效率最优的通用策略方法)。
评价指标采用两个MORL标准度量:超体积(HV)和期望效用指标(EUM)。HV衡量解集在目标空间包围的体积,能同时反映收敛性、均匀性和延展性;EUM衡量解集对用户期望效用的覆盖程度。聚合结果时遵循Agarwal等推荐的IQM和分层自助置信区间(SBCI)。
先说个有点扎心的事实:单目标强化学习这几年靠着“换网络结构”白捡了一大截性能,多目标强化学习却还在算法的泥潭里卷生卷死。各路学者今天提出偏好选择策略,明天设计专用更新规则,后天整个超网络,结果一看价值网络——还是那个朴素到不行的MLP。这种“算法军备竞赛,架构原地踏步”的错位,正是本论文想要打破的僵局。
马萨里克大学和阿托大学的研究者们给出的方案看起来甚至有点“偷懒”:把单目标强化学习里已经被验证过的SimbaV2架构整体搬到多目标场景,再针对多目标回报分布的特殊性做一个简单但关键的适配。结果HV直接暴涨132%。更妙的是,他们没改动底层算法的任何逻辑,纯粹靠网络现代化就实现了对多个SOTA基线的全面压制。
多目标强化学习为何停滞不前?
要理解这篇论文的价值,先得看清多目标强化学习(MORL)卡在哪。MORL的目标不是找一条最优策略,而是找出一组策略,覆盖不同偏好下的帕累托前沿。药物设计要同时权衡药效与毒性,机器人控制要兼顾速度与能耗,医疗方案要平衡疗效与副作用——这些都需要算法输出一整条“折中曲线”,让用户事后按需选择。
主流方法大致分三派:单策略方法只优化一个固定偏好,碰到新偏好就得重训;多策略方法为每个偏好单独训一个策略,样本效率惨不忍睹;通用策略方法学一个以偏好为条件的万能策略,理论上最优雅,实际上却面临严重的泛化难题——不同偏好对应的最优行为可能南辕北辙,简单的条件向量注入根本驾驭不了。
更微妙的问题藏在网络结构里。几乎所有MORL算法都在算法层面花式创新,但价值函数和策略网络始终清一色用最基础的MLP,只是在输入层把偏好向量和状态拼在一起。反观单目标强化学习,SimBa、SimbaV2、XQC等一系列研究已经证明了一个反直觉的事实:不改算法任何逻辑,仅仅把网络做得更“现代”——加上归一化、换成分布批评者——就能让性能和样本效率大幅提升。这种“架构红利”在多目标领域几乎是空白。
架构现代化:从单目标到多目标的迁移
Momba的构建思路可以浓缩成一句话:找一个靠谱的单目标架构,原封不动地搬到多目标场景,再解决一个多目标独有的问题——如何建模多维回报的分布。
论文选定的基础算法是CAPQL,一个带熵正则化的多目标Soft Actor-Critic(SAC)变体。这个选择有双重考量:第一,CAPQL的熵奖励能保证诱导出的解集严格凸,在线性标量化目标下数值优化更稳定;第二,SAC本身就是单目标架构研究的常用试验台,SimbaV2等架构都是在SAC上验证的,血缘关系近,迁移起来名正言顺。
架构层面直接采用SimbaV2,其三大核心组件分别是:
观察与特征归一化: 对观测的每一维维护运行均值和方差,用类似Running Standard Normalization(运行标准归一化)的公式在线更新统计量,把观测归一化到标准范围。再通过L2归一化将隐藏特征映射到单位超球面,同时拼接一个正的偏移常数c_shift以保留原始幅度信息。这一套操作能有效防止网络对高方差特征过拟合,缓解强化学习特有的“可塑性损失”问题——即网络在训练后期逐渐丧失学习新知识能力的问题。
权重归一化: 每层线性层被分解为单位超球面约束的权重和一个可学习的逐元素缩放向量,每次梯度更新后对权重执行L2归一化。同时,用可学习的线性插值层(LERP)替代传统残差连接,让网络自己决定“继承多少、改造多少”。这种设计在不增加参数量的前提下有效改善了损失曲面的条件数,让优化过程更稳定。
分布批评者: 这是本论文真正的创新所在。后面单独展开。
一个容易被忽略的细节是偏好采样策略的调整。CAPQL原本每个时间步都重新采样偏好,Momba改为每个回合(episode)采样一次。这个改动不是拍脑袋:多目标领域的主流工作(PGMORL、GPI-LS等)都采用回合级采样,这样能让策略在单个回合内集中精力优化一个目标,也避免了时间步级采样带来的策略振荡。这一改动也保证了Momba与其他基线方法在评估协议上的一致性。
标量化分布批评者:简单而有效的核心创新
把C51式的类别分布批评者搬到多目标领域,绕不开一个核心障碍:多目标返回是向量,分布批评者该怎么建模多维分布?
已有工作要么局限于表格型场景(Wiltzer等),要么需要指定核函数来度量分布间距离(Zhang等),实现复杂且难以扩展到连续控制。本论文观察到一个被忽略的关键事实:在策略优化过程中,批评者的预测只通过标量化后的Q值 影响策略更新。既然如此,何必建模完整的多维联合分布?直接学习标量化返回的一维分布不就完了?
这个洞察的精妙之处在于:它把一个看似复杂无比的多维多目标分布学习问题,巧妙地化简为单目标场景已经成熟的分布学习问题。具体做法如下:
在CAPQL中,Q网络通过最小化均方误差(MSE)来学习向量化返回:
Momba将Q网络替换为分布批评者 Z_θ(s,a,ω),通过最小化交叉熵(CE)损失来学习标量化返回的分布:
策略优化时则取分布批评者的期望值,再叠加熵正则项:
为了让回报落在分布批评者的有限支撑集内,论文还设计了一种按分量归一化的奖励缩放策略:每个奖励分量除以其训练中观测到的最大返回值,再乘以一个缩放常数v_max。与单目标场景按运行标准差归一化的做法不同,多目标场景中返回的幅度会随偏好显著变化,因此采用“按最大返回归一化”更合适:
此外,论文还提出了两种可选的分布建模变体:一种是对每个奖励分量分别建模分布(独立分布批评者),另一种是保留非标量化期望返回的版本。实验表明,直接学习标量化返回的分布与分别学习各分量分布的效果相当,但前者的实现更简单,这也是Momba的默认选择。
实验验证:全面超越现有方法
实验设计覆盖了MORL领域标准的7个连续控制任务,包括Ant、Swimmer、HalfCheetah、Humanoid、Walker2D和Hopper(Hopper有双目标和三目标两个变体),全部基于MuJoCo物理引擎实现。对照方法包括4个基线:CAPQL(基础算法,无架构改进)、PGMORL(多策略进化方法)、DPMORL(多策略分布方法)和GPI-LS(当前样本效率最优的通用策略方法,通过广义策略改进机制选择偏好)。
评价指标采用超体积(HV)和期望效用指标(EUM)。HV衡量解集在目标空间包围的体积,能同时反映收敛性、均匀性和延展性;EUM衡量解集对用户期望效用的覆盖程度。聚合结果时遵循Agarwal等推荐的IQM(四分位均值)和分层自助置信区间(SBCI),比传统均值更抗异常值。
先看总体结果。图2展示了Momba与CAPQL在三个代表性环境上的训练曲线对比。
在Ant和Humanoid中,Momba仅训练10万步和20万步就达到了PGMORL最终的性能水平,而PGMORL为此花费了4800万步和1.2亿步。CAPQL在三个环境中都没能匹配PGMORL的最终表现,Momba则在三个环境中的两个超越了PGMORL,并在高难度的三目标Hopper环境中与之持平。这种样本效率上的数量级差距,正是架构现代化带来的直接红利。
再与当前样本效率最优的GPI-LS正面交锋。图3对比了两者在相同UTD比率下的表现。
当UTD比率为1时,Momba在前20万步的HV和EUM均稳定超越GPI-LS;即使GPI-LS将UTD比率提高到20(其默认配置),Momba在UTD=8时也能与之匹敌。值得注意的是,Momba使用的是静态均匀采样的偏好选择策略,而GPI-LS使用了复杂的广义策略改进(GPI)机制来动态选择偏好。在一个朴素架构的衬托下,GPI-LS引以为傲的偏好选择策略反而显得性价比不高。
整体来看,Momba的聚合HV比第二名PGMORL高出约35%,比基础算法CAPQL高出约132%;聚合EUM比PGMORL高16%,比CAPQL高35%。值得注意的是,论文承认DPMORL的复现结果低于原论文报告值,这一差异已在附录中讨论,读者在解读时需要留意。
从解集可视化来看,图8展示了全部环境的HV和EUM训练曲线,Momba的收敛速度和最终性能优势在不同环境中保持了一致性。
消融研究:观测归一化是关键
论文对三大核心组件——分布批评者、特征与观察归一化、权重归一化——进行了系统的消融实验,其中两个发现颇具启发性。
第一个发现:分布批评者的有效性远超预期。为了排除Simba架构中归一化等组件的影响,论文做了一组交叉对比——将分布批评者(CE损失)和标准MSE损失分别搭配在MLP和Simba两种网络上,同时调整隐藏维度使参数量大致匹配。结果如图5所示。
几个关键结论:Momba(Simba+CE)在所有规模下都优于Simba+MSE;更令人惊讶的是,标准MLP搭配CE损失(MLP+CE)竟然也能匹配甚至超越Simba+MSE。这直接说明,标量化分布批评者的贡献是压倒性的,甚至比一整套架构现代化改造带来的收益还大。
第二个发现:观察归一化才是真正的幕后功臣。论文采用Shapley值来量化每个组件对最终性能的边际贡献,结果如图6所示。
观察归一化的Shapley值远超其他两个组件,这背后的逻辑很清晰:多目标场景下,不同偏好对应的奖励分量量级差异可能很大,观察归一化能将各维特征拉回到可比尺度,显著提升策略网络对不同偏好的适应能力。权重归一化和特征归一化则扮演辅助角色,共同稳定训练动态。
龙迷三问
这篇论文到底在解决什么问题? Momba算法将单目标强化学习中的SimbaV2架构迁移至多目标场景,仅改变网络结构和分布批评者损失,就让HV指标提升132%、EUM提升35%,证明“算法不变、架构先行”在多目标领域同样成立。
这篇工作最值得看的点是什么? Momba在HV上比亚军PGMORL提升约35%,比底层算法CAPQL提升约132%;在EUM上分别提升约16%和35%。在样本效率方面,Momba在Ant和Humanoid环境中仅需100k和200k步即可达到PGMORL的最终性能。
这篇工作的边界或风险在哪里? 优点:(1) 方法简单有效,仅通过架构改进即可显著提升MORL性能;(2) 提出了标量化分布批评者的简单适应方案;(3) 实验全面,包含7个任务、多种基线和详细消融。缺点:(1) 仅考虑线性标量化;(2) 基准限于连续控制任务,且多为2目标;(3) 更复杂的函数逼近器可能增加墙钟时间。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~ 龙哥点评
论文创新性分数: ★★★★☆
将单目标深度强化学习中的先进网络架构设计(观测与特征归一化、权重归一化、分布批评者)集成到基于熵正则化的多目标强化学习算法CAPQL中,并通过直接学习标量化回报分布来适应多目标场景。
实验合理度: ★★★★☆
超体积(HV)和期望效用指标(EUM),使用IQM和95% SBCIs。
学术研究价值: ★★★★☆
将单目标深度强化学习中的先进网络架构设计(观测与特征归一化、权重归一化、分布批评者)集成到基于熵正则化的多目标强化学习算法CAPQL中,并通过直接学习标量化回报分布来适应多目标场景;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
训练1M步,UTD=1,使用Adam优化器,学习率1e-4。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 仅考虑线性标量化;(2) 基准限于连续控制任务,且多为2目标;(3) 更复杂的函数逼近器可能增加墙钟时间。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!