← 返回 PaperDaily 视觉与图像

多目标决策太难?这只"狐猴"从人类偏好中学会平衡的艺术

现实世界的决策总在多个目标之间为难:既要跑得快,又要省电;既要安全,又要高效。当奖励函数难以定义时,多目标强化学习该何去何从?LEMUR给出了一个优雅的答案,在多个连续控制任务上全面超越既有方法,逼近全知Oracle的性能表现。

原论文信息如下:
论文标题:
LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
发表日期:
2026年07月
发表单位:
曼彻斯特大学(University of Manchester)、谢菲尔德大学(University of Sheffield)、谢菲尔德哈勒姆大学(Sheffield Hallam University)
原文链接:
https://arxiv.org/pdf/2607.29559v1.pdf
现实世界里的决策,从来不是“单目标”的独角戏。
想象一下,你买一辆车:要动力强,还要省油;要空间大,还要好停车;要配置高,还要价格美丽。每一项单独拎出来都容易搞定,组合在一起就是让销售头疼的世纪难题。如果让一个强化学习智能体来做这个决策,传统做法是给它一个加权求和后的“综合分数”,让它在单一标量奖励上做优化。但问题是,这个“综合分数”的函数该怎么设计?动力和油耗的权重比应该是多少?这背后本质上是一个令人头秃的奖励工程设计(Reward Engineering)问题。
工作得更贴切一点。想象在训练一个机器人:让它拿起一个杯子。普通用户只能判断“拿起来了没有”,而专家能评估“拿得稳不稳”“动作会不会损伤机械臂”“长时间运行的磨损如何”。用户和专家的关注点完全不同,把它们揉进一个标量奖励里,专家的精细判断就被“平均”掉了。这就是这篇论文要解决的核心痛点——当多个目标相互冲突、且奖励函数未知时,智能体如何从人类偏好中学会权衡?

从单一奖励到多目标对齐:LEMUR要解决什么问题

传统强化学习的核心假设是:目标可以被表示为一个标量奖励函数,且这个函数是良好定义的。在游戏打砖块(Atari Breakout)或围棋对弈中,这个假设成立——得分就是一切。但在真实世界里,几乎不存在这样的“单维”目标。自动驾驶要在速度与安全之间找平衡:开太快容易出事,开太慢乘客着急。工业机器人要在吞吐量与能耗之间做取舍:马力全开产能高,电费账单也飙得快。
多目标强化学习(MORL)把奖励表示成向量,要找到一组帕累托最优策略的集合——也就是在不动任何一个目标的前提下,无法变得更好的策略集合。这个思路是对的,但它有一个重要前提:每个目标都必须有一个清晰、可计算的奖励函数。一旦这个函数写不出来——比如“抓握稳定性”“长期磨损风险”这种模糊概念——MORL就无米下锅了。
另一边,基于偏好的强化学习(PbRL)提供了一个思路:与其费力设计奖励函数,不如直接问人类“这两段轨迹,你更喜欢哪一段?”。然后从这些二元比较中学习一个奖励模型。这个方法不需要精确的奖励函数,但大部分相关工作都局限于单一目标场景。当多个目标同时出现、且不同的人对“好”的定义各不相同的时候,简单的偏好汇总就会变成一场灾难。
举个极端例子:如果一位老师只关心“完成任务快不快”,另一位只关心“动作稳不稳”,把两位的偏好数据全倒进一个奖励模型里训练,模型学到的就是一个“四不像”的均值——快也快不起来,稳也稳不住。论文把这种粗暴的偏好聚合称为“Naive data pooling”,并证明它在多目标场景下效果不佳。
LEMUR(Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback)要同时解决这两大问题:不知道奖励函数、又有多目标冲突。它提出的方案是在训练过程中为每位“教师”(即一个目标)学习一个独立的奖励模型,然后在这个多目标奖励向量之上做策略优化,从而恢复出一组覆盖不同权衡偏好的策略集合。
图1:LEMUR框架总览。三个核心阶段:(1) 无监督预训练——通过最大化状态熵让智能体充分探索环境;(2) 基于偏好反馈的奖励学习——为每位教师独立学习一个奖励模型;(3) 基于学习到的奖励模型进行多目标策略优化。

三层架构:无监督探索、分教师奖励建模、多目标策略优化

LEMUR的训练流程分为三个阶段,像一条流水线一样环环相扣。整体流程可以理解为:先让智能体“到处逛一逛”收集丰富的经验数据,然后请“老师们”(不同目标的评判者)对轨迹片段打分,最后在这些打分指导下学习策略。这个流程会反复进行,奖励模型和策略在迭代中共同进化。

第一阶段:无监督预训练——先把地图逛熟

标准的基于偏好的强化学习有一个老大难问题:如果随机初始化策略就开始采样,前期的轨迹大多毫无信息量——不是原地打转就是一头撞墙。让人类老师去比较两段“都挺烂”的轨迹,纯属浪费感情。
LEMUR的第一个锦囊是内在动机驱动的无监督预训练。具体来说,用一个基于k近邻的状态熵估计器作为内在奖励,鼓励智能体去探索那些“还没怎么去过”的状态区域。这个熵奖励设计得很直接:状态越新颖,奖励越高。
说白了就是让智能体先“逛地图”。比如在HalfCheetah环境里,让机器人先乱跑一通,跑出各种姿势、各种速度的轨迹数据,把Replay Buffer填满。这样当老师们开始打分时,智能体已经有了一定的“阅历基础”——它见识过各种各样的行为模式,而不是只会几种“菜鸡互啄”的动作。这些多样化经验进入共享缓存后,后续的奖励学习和策略优化都能从中受益。

第二阶段:分教师奖励建模——各回各家,各找各妈

这是LEMUR区别于之前工作(下文中的PbMORL等)的核心差异点:不为所有教师训练一个统一的奖励模型,而是为每一位教师(即每一个目标)训练一个独立的奖励模型。每位教师的偏好数据只用于训练属于它自己的奖励模型。
技术上还有一个精巧的设计:每个奖励模型并不是完全独立的MLP,而是一个预测完整目标向量、再通过教师偏好权重做投影的权重条件奖励模型(Weight-Conditioned Reward Model)。用公式来表达更好理解:第i位教师的奖励 = 教师偏好权重向量 ^T× 共享的目标向量预测器。这样所有的奖励模型共享同一个底层表示结构,权重不同则偏好不同。好处显而易见:当目标数量增多时,模型之间仍然可比,训练也更加高效,不会出现一位教师配一个孤岛式网络、彼此之间完全无法对齐的窘境。
此外,为了增强模型的泛化能力,训练时并没有让模型只看到教师的固定锚点权重,而是从以该锚点为中心的狄利克雷分布中采样权重——相当于让模型见多识广,在权重空间的一个邻域内都能给出合理的奖励估计,而不是仅仅记住一个点。这个细节很妙:它让奖励模型在策略优化的“权重探索”阶段不会因为一个没见过的新权重而直接“死机”。
奖励模型的训练采用标准的布拉德利-特里模型(Bradley-Terry model)配合交叉熵损失。给模型看两段轨迹片段,告诉它“第一段比第二段好”或“第二段比第一段好”,模型从中学习一个能解释人类偏好的奖励函数。这个思路和经典的从人类偏好中学习奖励(Preference-based RL)是一脉相承的。

第三阶段:多目标策略优化——平衡的艺术

有了每个目标的奖励模型,LEMUR在策略优化阶段采用的是一套基于分解的多目标强化学习算法MORL/D(Multi-Objective Soft Actor-Critic的种群化变体)。这个算法的核心思想是训练一个策略种群,每个策略对应一个不同的权重偏好向量,权重向量之和为1。这样整个种群可以覆盖帕累托前沿的不同区域——有的策略偏向目标A,有的偏向目标B,有的居中调停。
要支撑这样一个种群协同进化,LEMUR有几个关键设计:

共享缓存池:所有策略的经验都存入一个公共的Replay Buffer,每个策略从中采样来更新自己。这大大提升了样本效率——一个策略探索到的“大胆操作”,另一个策略也能从中学习,相当于种群内互相“抄作业”。

向量奖励重标注(Vector Reward Relabeling):奖励模型会随着在线反馈不断更新,缓存池中旧状态-动作对应的奖励值会过时。LEMUR不在缓存里存奖励,而是存状态-动作轨迹,在采样时用最新的奖励模型重新计算奖励。这个“随取随算”的做法让策略始终基于最新、最准确的奖励信号来学习,避免因奖励滞后而导致的策略动荡。

帕累托模拟退火(Pareto Simulated Annealing):用于在策略种群中动态调整每个策略的权重向量。算法会根据当前种群中各个策略的表现和多样性,自动调节权重分配——如果某些权重区域策略太密集,就往外推一点;如果某些区域出现空缺,就往里补一些。这保证最终学习到的策略集合能尽量均匀且广泛地覆盖帕累托前沿,而不是全部挤在一起。

整个流程是一个迭代闭环:策略在环境中交互生成新数据 → 新数据被查询为偏好标签 → 奖励模型在线更新 → 缓存被重标注 → 策略继续优化。奖励学习和策略优化同步推进、互相促进,而不是“先学完奖励再学策略”这种一次性的两阶段流程。

实验结果:全面领先基线,逼近Oracle上界

实验部分,论文在多个高维连续控制基准任务上对LEMUR进行了全面评估,例如基于MuJoCo的HalfCheetah和Walker2d环境,每个环境都由两个或多个互相对抗的目标组成,如“跑得快”“保持高度”“降低控制成本”等。评价指标采用多目标强化学习领域最常用的超体积指标(Hypervolume,HV),用于衡量策略集合在目标空间中对帕累托前沿的覆盖程度。HV越大,说明策略集合越接近真实前沿。
对比的基线有两类:一类是无真实奖励的PBMORL(Preference-based Multi-Objective RL,基于偏好的多目标强化学习,将全部教师偏好混合训练单一奖励模型)和Naive data pooling(简单数据混合方法);另一类是“Oracle”——即使用环境真实奖励函数执行MORL/D的完美上界。论文的实验结果可以概括为三点:在双目标和三目标场景下,LEMUR的HV指标均全面超越两个无奖励基线,且差距显著;LEMUR甚至在某些环境中逼近甚至超过了Oracle——这意味着从人类偏好中学到的向量奖励模型,已经能够支撑起高质量的多目标权衡策略,逼近真实奖励的效果;在多个随机种子的重复实验下,LEMUR的方差也更小,说明其训练过程相对稳定。
论文还专门测试了标签噪声(label noise,即教师给出错误偏好的概率)、受限反馈预算(feedback budget,即人类标注次数的上限)和扩展到更多目标(scaling to more objectives)这三种实际场景下的鲁棒性。结果均表明LEMUR的性能下降更为平缓,其中“分教师奖励建模”的贡献功不可没——独立的奖励模型能够在嘈杂反馈中仍保持各自目标的一致性,避免互相污染。

消融深度剖析:查询策略、冲突程度与模型结构如何影响性能

好方法不仅要看主实验,还要看它到底“为什么能work”。论文设计了多组消融实验,重点回答了三个问题。
第一个问题是查询策略。LEMUR采样轨迹对采用的是均匀随机采样,而不是像很多PbRL工作那样用集成分歧来挑选“最模糊”的轨迹。为什么?论文发现,在训练早期,均匀采样能让查询覆盖整个状态-动作空间,避免过早偏向某个目标;而基于分歧的采样策略反而会因奖励模型尚不成熟而陷入局部。这个“返璞归真”的结论,其实和PbRL领域不少实证观察是一致的。
第二个是目标冲突程度的影响。实验中通过调整教师偏好权重之间的距离来调节冲突强度。结果很直观:目标冲突越激烈,Naive pooling方法退化得越厉害,而LEMUR的优势越明显。这很好理解——当各目标的标准差异巨大时,统一奖励模型根本没法兼顾多方,而独立的奖励模型天然就能保留每个目标的特性。
第三个是模型结构的消融。对比了三种结构:完全独立的奖励模型(每位教师一个MLP,互不共享)、完全共享(所有教师共用一个参数)、以及LEMUR提出的权重条件化共享结构。结果验证了“部分共享、部分解耦”的设计哲学——完全共享无法区分不同偏好,完全独立则参数量随教师数量线性膨胀且训练不稳定,权重条件化在二者之间取得了最佳平衡。
值得注意的是,论文给出的三种结构实质上对应了多任务学习中一个经典命题:什么时候该共享表征、什么时候该保留任务独有参数。LEMUR用“预测向量+权重投影”的方式给出了一个简洁优雅的答案。

总结与展望:多目标偏好学习的边界与前路

LEMUR把多目标强化学习和偏好学习两个方向接上了轨。它既不需要写出任何目标的奖励函数,也不需要把所有人类偏好都揉成一团。通过分教师奖励建模,它让智能体能够从不同评判角度的反馈中学到真正有区分度的目标信号;通过迭代闭环,它让奖励模型的改进直接转化为策略质量的提升。这个框架的价值,在于为“看不见的奖励”下的多目标决策问题提供了一条可落地的技术路线。
同时也要清醒看到局限。奖励模型的质量高度依赖偏好数据的覆盖度和标注质量;当目标数量继续增加时,策略种群的规模、奖励模型的容量都会带来新的工程挑战。论文中采用的是线性标量化的MORL框架,这意味着它只能恢复凸覆盖集(Convex Coverage Set, CCS)上的策略,对于非凸帕累托前沿的目标,需要引入非线性标量化函数来扩展。另外,目前实验环境还是模拟器中的连续控制任务,距离真实机器人上多样化的人类反馈还有一段路要走。未来有望与LLM对齐、具身智能等场景结合,值得持续关注。

龙迷三问

下面是龙哥对读者可能关心的问题的统一解答:

LEMUR和最接近的PbMORL基线,本质区别到底在哪?PbMORL同样是从偏好中学习多目标策略,但它倾向于把所有教师偏好混合进一个统一的奖励模型里,本质上还是“单奖励模型+多目标策略优化”的拼盘。LEMUR的关键是分教师建模,每位教师一个奖励模型,并用权重条件化结构共享底层表征。这个差异在学习信号上非常本质:前者强制所有目标共享一套价值判断,后者允许每个目标保留独立的评判逻辑。

权重条件奖励模型和直接学多个独立MLP相比,优势体现在哪?直接学多个独立MLP的问题在于每个模型各自为政,优化过程中容易出现发散,而且在目标数量增加时参数量线性膨胀。LEMUR的权重条件化让所有模型共享同一个向量奖励预测器,只是投影权重不同。这实际上是一种软参数共享,既保留了每个目标的独立偏好,又让模型之间能够互相“借力”。消融实验也证明,这种结构在训练稳定性和扩展性上都是最优的。

为什么向量奖励重标注对LEMUR这么重要?因为奖励模型在每次迭代后都会更新,而回放缓冲区里旧的轨迹数据是之前奖励模型打分的结果。如果继续用旧奖励值更新策略,会产生严重的非平稳性问题,导致策略优化方向错乱。LEMUR在缓冲区里存的是原始状态-动作轨迹,采样时才用最新的奖励模型现场打分。这保证了策略每时每刻都在面对“最新鲜”的奖励信号,也让离线经验能够持续复用到在线训练中。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

分教师奖励建模与多目标策略优化的结合思路新颖,权重条件化设计简洁有效,但整体仍建立在现有PbRL和MORL方法之上,属于“巧妙集成”级别。

实验合理度:★★★★☆

基线选择、评估指标和三种鲁棒性测试都较全面,消融实验覆盖了查询策略、冲突程度和模型结构,缺失的主要是与更新近的MORL无奖励方法的横向对比。

学术研究价值:★★★★☆

打通了PbRL与MORL两个方向,为“未知奖励+多目标”提供了可复现的研究范式,对后续多目标偏好学习、多智能体奖励建模等方向有启发意义。

稳定性:★★★★☆

在标签噪声和有限反馈预算下表现出较好的稳健性,多种子实验方差小,但尚未在真实机器人或更高维环境验证,稳定性结论仍局限在模拟器中。

适应性以及泛化能力:★★★★☆

在两个连续控制环境和最多三个目标的设定下都有效,但环境类型和目标维度仍偏少;对非凸帕累托前沿的适应性受线性标量化限制,泛化能力有待扩展。

硬件需求及成本:★★★★☆

基于SAC和MLP奖励模型,计算开销在可接受范围内。无监督预训练和策略种群会增加一些训练时间,但远未到“不可承受”的量级。

复现难度:★★★★☆

方法结构清晰,基于SAC和MORL/D组件都有公开实现可参考,但论文未提供官方开源代码,细节如狄利克雷分布参数等仍需自行调参。

产品化成熟度:★★★☆☆

更适合作为学术原型,离产品落地还有距离。真实场景中偏好数据获取成本高、奖励模型校准困难,且在真实物理系统中需要额外的安全约束。当前最合适应用场景是模拟器中的人机偏好对齐训练。

可能的问题:实验环境相对单一,只覆盖了两类连续控制任务;与最新MORL SOTA方法的横向对比不足;线性标量化框架的局限性未被充分讨论;未开源代码则对可复现性打了折扣。


主要参考文献

[1] Christiano P, Leike J, Brown T B, et al. Deep reinforcement learning from human preferences[C]. NeurIPS 2017.
[2] Roijers D M, Vamplew P, Whiteson S, et al. A survey of multi-objective sequential decision-making[J]. JAIR, 2013, 48: 67-113.
[3] Haarnoja T, Zhou A, Abbeel P, et al. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor[C]. ICML 2018.
[4] Felten F, Talbi E G, Danoy G. Multi-objective reinforcement learning based on decomposition: A comprehensive analysis[J]. 2024.
[5] Lee K, Smith L, Abbeel P. PEBBLE: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training[C]. ICML 2021.
[6] Adikari M, Peng B, Vinanzi S, et al. LEMUR: Learning to align with multi-objective reinforcement learning from preference feedback[J]. arXiv preprint arXiv:2607.29559, 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
像LEMUR一样学会平衡科研与生活,既要深度也要广度。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 强化学习+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。