传统强化学习的核心假设是:目标可以被表示为一个标量奖励函数,且这个函数是良好定义的。在游戏打砖块(Atari Breakout)或围棋对弈中,这个假设成立——得分就是一切。但在真实世界里,几乎不存在这样的“单维”目标。自动驾驶要在速度与安全之间找平衡:开太快容易出事,开太慢乘客着急。工业机器人要在吞吐量与能耗之间做取舍:马力全开产能高,电费账单也飙得快。多目标强化学习(MORL)把奖励表示成向量,要找到一组帕累托最优策略的集合——也就是在不动任何一个目标的前提下,无法变得更好的策略集合。这个思路是对的,但它有一个重要前提:每个目标都必须有一个清晰、可计算的奖励函数。一旦这个函数写不出来——比如“抓握稳定性”“长期磨损风险”这种模糊概念——MORL就无米下锅了。另一边,基于偏好的强化学习(PbRL)提供了一个思路:与其费力设计奖励函数,不如直接问人类“这两段轨迹,你更喜欢哪一段?”。然后从这些二元比较中学习一个奖励模型。这个方法不需要精确的奖励函数,但大部分相关工作都局限于单一目标场景。当多个目标同时出现、且不同的人对“好”的定义各不相同的时候,简单的偏好汇总就会变成一场灾难。举个极端例子:如果一位老师只关心“完成任务快不快”,另一位只关心“动作稳不稳”,把两位的偏好数据全倒进一个奖励模型里训练,模型学到的就是一个“四不像”的均值——快也快不起来,稳也稳不住。论文把这种粗暴的偏好聚合称为“Naive data pooling”,并证明它在多目标场景下效果不佳。LEMUR(Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback)要同时解决这两大问题:不知道奖励函数、又有多目标冲突。它提出的方案是在训练过程中为每位“教师”(即一个目标)学习一个独立的奖励模型,然后在这个多目标奖励向量之上做策略优化,从而恢复出一组覆盖不同权衡偏好的策略集合。图1:LEMUR框架总览。三个核心阶段:(1) 无监督预训练——通过最大化状态熵让智能体充分探索环境;(2) 基于偏好反馈的奖励学习——为每位教师独立学习一个奖励模型;(3) 基于学习到的奖励模型进行多目标策略优化。
实验部分,论文在多个高维连续控制基准任务上对LEMUR进行了全面评估,例如基于MuJoCo的HalfCheetah和Walker2d环境,每个环境都由两个或多个互相对抗的目标组成,如“跑得快”“保持高度”“降低控制成本”等。评价指标采用多目标强化学习领域最常用的超体积指标(Hypervolume,HV),用于衡量策略集合在目标空间中对帕累托前沿的覆盖程度。HV越大,说明策略集合越接近真实前沿。对比的基线有两类:一类是无真实奖励的PBMORL(Preference-based Multi-Objective RL,基于偏好的多目标强化学习,将全部教师偏好混合训练单一奖励模型)和Naive data pooling(简单数据混合方法);另一类是“Oracle”——即使用环境真实奖励函数执行MORL/D的完美上界。论文的实验结果可以概括为三点:在双目标和三目标场景下,LEMUR的HV指标均全面超越两个无奖励基线,且差距显著;LEMUR甚至在某些环境中逼近甚至超过了Oracle——这意味着从人类偏好中学到的向量奖励模型,已经能够支撑起高质量的多目标权衡策略,逼近真实奖励的效果;在多个随机种子的重复实验下,LEMUR的方差也更小,说明其训练过程相对稳定。论文还专门测试了标签噪声(label noise,即教师给出错误偏好的概率)、受限反馈预算(feedback budget,即人类标注次数的上限)和扩展到更多目标(scaling to more objectives)这三种实际场景下的鲁棒性。结果均表明LEMUR的性能下降更为平缓,其中“分教师奖励建模”的贡献功不可没——独立的奖励模型能够在嘈杂反馈中仍保持各自目标的一致性,避免互相污染。
[1] Christiano P, Leike J, Brown T B, et al. Deep reinforcement learning from human preferences[C]. NeurIPS 2017.[2] Roijers D M, Vamplew P, Whiteson S, et al. A survey of multi-objective sequential decision-making[J]. JAIR, 2013, 48: 67-113.[3] Haarnoja T, Zhou A, Abbeel P, et al. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor[C]. ICML 2018.[4] Felten F, Talbi E G, Danoy G. Multi-objective reinforcement learning based on decomposition: A comprehensive analysis[J]. 2024.[5] Lee K, Smith L, Abbeel P. PEBBLE: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training[C]. ICML 2021.[6] Adikari M, Peng B, Vinanzi S, et al. LEMUR: Learning to align with multi-objective reinforcement learning from preference feedback[J]. arXiv preprint arXiv:2607.29559, 2026.