← 返回 PaperDaily 视觉与图像

Stanford新方法:机器人偏好学习告别“总分制”

机器人偏好学习最烦的不是“没数据”,而是“数据看起来很多,实际全在讲废话”。这篇 FPL 直接把偏好拆成速度、安全、质量等自然语言轴,监督更细,策略也更会“看脸色”了。

Stanford新方法:机器人偏好学习告别“总分制”
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
机器人偏好学习最烦的不是“没数据”,而是“数据看起来很多,实际全在讲废话”。这篇 FPL 直接把偏好拆成速度、安全、质量等自然语言轴,监督更细,策略也更会“看脸色”了。


原论文信息如下:
论文标题:
Freeform Preference Learning for Robotic Manipulation
发表日期:
2026年06月
发表单位:
Stanford University
原文链接:
https://arxiv.org/pdf/2606.32027v1.pdf
项目链接:
freeform-pl.github.io/fpl.website/

机器人学习的新范式:告别“好坏”二元判断

封面
机器人偏好学习最容易踩的坑,不是“没人标”,而是“标了也没用”。长任务里,机器人一边要完成动作,一边还要顾及速度、安全、摆放质量、是否粗暴、是否卫生。把这些复杂标准压成一句“哪个好”,最后很容易变成一句废话。
斯坦福这篇 Freeform Preference Learning,FPL(自由形式偏好学习)干的事很直接:别再逼标注者做“总决赛裁判”了,改成让他们按自然语言自己定义比较维度,比如“更快”“更安全”“放得更整齐”“动作更谨慎”。然后再让模型学会这些维度各自对应的奖励,最后把这些奖励喂给策略,让机器人学会按人类真正关心的标准做事。
这篇论文最有意思的地方,不是“又做了一个奖励模型”,而是把“人类评价本来就多维”这件事正大光明地搬进了机器人学习流程里。以前是把人类意见硬拧成一根绳,现在是让它保持原样,反而更好用。
图1:二元偏好学习与自由形式偏好学习的对比
图1:二元偏好学习与自由形式偏好学习的对比。前者只问“哪个整体更好”,后者允许标注者按自然语言给出多个判断轴,再分别比较。

让机器人听懂你的“潜台词”:自由形式多轴偏好

先把背景讲人话:传统机器人奖励设计,最常见的是两种。一种是稀疏成功信号,做成了给1分,没做成给0分;另一种是二元偏好,让人类在两段轨迹里选一个“整体更好”的。问题在于,长时序操作里“更好”这词太虚了:快但粗暴,稳但慢,整齐但没完成,谁更好?很多时候连人都说不清。
FPL 的思路就像把“评价表”从一张总分卷,改成多栏明细表。标注者不再只给一个总判断,而是可以直接写出判断轴:速度安全摆放质量谨慎程度卫生,甚至是任务里临时冒出来的新标准。也就是说,偏好不是固定菜单,而是可以“现点现写”。
图9:数据标注界面与标注成本
图9:数据标注界面与标注成本。(a)标注者并排看两段机器人轨迹视频,并按每个轴判断偏好;开放式任务中,标注者还可以先自己提出评价轴。(b)多轴标注把同一段视频的多个判断一起收了,所以平均到每个标签上的时间更低。
这里有个很关键的缩写要说明一下:FPLFreeform Preference Learning,中文就是“自由形式偏好学习”。它的核心不是“偏好”这两个字,而是“自由形式”——评价维度由人类自然语言来定义,而不是预先锁死在几个类别里。
这种做法的好处很现实。第一,减少歧义。第二,保留多维信息。第三,后面训练策略时,不必把“快、稳、准、轻柔”粗暴压成一个分数再硬学,机器人能看到更细的监督信号。说白了,以前是“你给我一句话,我猜你想要什么”;现在是“你把要求拆开说,我分别学”。

解码“自由形式偏好学习”:从多轴标注到行为塑形

FPL 的方法链条其实很清楚:先收集多轴偏好,再学奖励模型,最后用奖励去训练策略。难点不在流程本身,而在每一步都要解决“长任务里信息太模糊”的老毛病。
奖励模型这一步,论文没有沿用“每个轴训练一个独立模型”的老办法,而是让一个模型直接吃自然语言轴描述。这里的关键是语言条件化:同一个轨迹,输入“速度”时和输入“安全”时,模型输出的奖励可以完全不同。这样做的好处是,语义相近的写法能自动共享表示,比如“快”“速度快”“高效率”不至于被当成三个陌生概念。
图2:FPL的多维奖励与可控策略
图2:FPL 学习一个多维奖励函数,对完整轨迹进行打分,并用文本形式的奖励轴来驱动行为复现;测试时还能通过改变目标奖励去引导不同行为。
奖励模型的形式也值得说一下。论文把轨迹 τ 看成一串观察历史,奖励不是只看某一帧,而是按前缀累加。对应地,模型 会根据“到目前为止发生了什么”以及“当前评价轴是什么”来打分。这里的 ϕ 代表奖励模型参数。这个设计很像给机器人装了一个“看上下文再下结论”的脑子,而不是只盯着最后一帧瞎猜。
更妙的一点在策略训练。很多偏好学习方法最后都会把多维奖励压成一个标量再优化,图省事,但容易把问题压扁。FPL 没这么干,而是训练一个奖励条件化策略:策略输入不是单一分数,而是多个偏好轴及其奖励信号。这样一来,策略可以学到不同维度之间的组合关系,而不是只会追一个总分。
论文还提到一个很实用的工程点:测试时奖励值需要标准化。因为奖励模型输出没有天然固定尺度,直接拿去问策略,容易一会儿太猛、一会儿太怂。标准化之后,提示不同目标行为时更稳,也更容易控制。
这套流程的本质,是把“人类想要什么”拆成多个可学习的坐标轴,再把机器人行为投影到这些坐标轴上。它不是在追求一个神秘的“完美奖励”,而是在追求更少歧义、更密的监督、更可控的策略。这个方向很朴素,但很对路。

不只是性能提升,更是行为的“乐高积木”

这篇论文真正让人眼前一亮的,不是“分数涨了多少”,而是它把机器人行为做成了可拼装的模块。论文在模拟环境里展示了两个很重要的现象:组合性可导向性
组合性,说白了就是“数据里没见过的搭配,模型自己能拼出来”。比如在 Bimodal Square 任务里,数据里只有左边 peg 的快轨迹,右边 peg 只有慢轨迹。结果 FPL 训练后,居然能把“右边 peg + 快速”这种训练集里没直接出现过的行为组合出来。这个结果很像会搭积木:单块不新,但拼法新。
图4:Bimodal Square中的组合性
图4:Bimodal Square 中的时间到成功对比。FPL 虽然没见过“右边 peg 的快轨迹”这种组合,却仍然能学出来,说明多维奖励和奖励条件化策略确实把行为拆开又拼回去了。
可导向性则更像“同一套策略,换个口令就换个风格”。在 Bimodal Square inverted 任务里,同一个策略通过测试时改变奖励条件,就能把球放到相反方向的 peg 上。也就是说,模型不是死记某一个固定行为,而是能根据提示切换目标。对机器人来说,这种能力比单纯刷高分更值钱,因为真实场景里经常不是“会不会”,而是“能不能按场景切换”。
图5:测试时可导向性
图5:每个点代表方块最终位置,颜色对应目标碗的颜色。FPL 可以在测试时通过提示不同奖励来导向不同结果,而基线方法做不到这么灵活。
更重要的是,这种“拼装感”不是拍脑袋说出来的。论文还展示了奖励曲线的可解释性:在长时序任务里,FPL 学到的奖励会围绕对应子任务事件出现局部峰值,而不是像二元偏好那样把整条轨迹揉成一个末端大峰值。这个差别非常关键,因为它说明奖励更像在给每个动作阶段单独记账,而不是最后拍个总账糊弄过去。
图6:长时序任务中的奖励分析
图6:在 set up table 任务中,FPL 学到的各轴奖励会贴着对应的子任务事件出现;二元偏好奖励则容易在末尾突然冒一大截,信用分配明显更糟。
这就解释了为什么这篇工作不只是“性能更高”,而是“行为更可控”。如果奖励是一个黑箱总分,策略学到的往往也是黑箱行为;如果奖励本身是多维、可解释、可切换的,那么策略就更像一套可编程的行为系统。这个方向对机器人落地很重要,因为工程上最怕的不是不聪明,而是聪明但不可控

真实世界评测:四重考验,全线告捷

论文没有只在仿真里转圈,而是做了四个真实机器人任务:把立方体放进目标碗折短裤摆放吐司布置餐桌。这四个任务有一个共同点:都不是单步动作,而是长时序、细节多、容错低的操作。换句话说,特别适合检验“偏好学习到底是不是在装样子”。
图7:真实世界任务集
图7:真实世界任务集。每一行展示一个任务的关键阶段,覆盖了从简单定位到复杂摆放、折叠和多物体布置的不同难度。
结果上,FPL 在四个真实任务上都明显优于稀疏奖励和二元偏好方法,平均提升了 38 个百分点。这不是小修小补,而是能把原本“差不多能动”的策略,拉到“真的能干活”的水平。尤其在长任务里,二元偏好经常因为“整体更好”太模糊而学歪,稀疏成功信号又因为成功太少而几乎没法训练,FPL 刚好卡在中间:比稀疏信号更密,比整体偏好更清楚。
图3:真实世界任务上的基线表现
图3:真实世界任务上的基线表现。FPL 在所有任务上都更强,平均比次优基线高 38 个百分点;二元偏好的信号太模糊,稀疏成功信号又太少。
这里还值得看一个很实际的细节:在摆放吐司这类任务里,单看“放没放上去”远远不够。抓得太粗鲁会不卫生,放得太慢又不实用。FPL 能把“是否完成”“是否轻柔”“是否整洁”拆开学,所以更容易同时兼顾这些要求。相比之下,二元偏好和稀疏奖励更像拿一把大锤敲精密钟表,能响,但不一定准。
图8:仿真任务集
图8:仿真任务集。仿真里包括物体重排和双峰方块任务,用来验证多维偏好是否真的带来更好的监督和更强的泛化。
仿真结果也支持同样的结论。表1里,FPL 在物体重排和双峰方块任务上都拿到了最好的结果,而且在反向方向上依然能靠测试时奖励条件切换维持高表现。这个结果说明它不是只会记住某条轨迹,而是真的学到了“按偏好维度组织行为”的能力。
表1:仿真结果对比
表1:仿真环境中的结果对比。FPL 利用多维偏好提供了更好的监督;通过改变测试时的奖励条件,同一策略还能同时适应原方向和反方向任务。
论文还给了数据集统计、奖励模型超参数等表格,说明实验不是靠一把梭,而是有完整采样、标注和训练流程支撑。对机器人论文来说,这一点挺重要:真正有价值的工作,往往不是“某张图特别漂亮”,而是“整套流程能跑通”。

总结与展望:机器人的“个人说明书”时代

FPL 这篇工作最值得记住的一句话,可能是:不要把人类偏好压成一个总分,而要把它保留成可解释、可组合、可切换的多维约束。这听起来不花哨,但很接近真实世界。现实里的机器人任务,本来就不是“成功/失败”两个格子能装下的。
它的局限也很明确。第一,仍然需要人类偏好标注,成本比纯自动方法高。第二,测试时要选合适的奖励值,虽然标准化了,但离“完全自动选参数”还有距离。第三,当前策略依赖一组相对固定的偏好轴,未来要支持更灵活的轴集合,系统还得继续进化。
但从工程视角看,这个方向很有潜力。因为它把“人怎么描述任务”直接变成了“机器人怎么学任务”的接口。以后如果机器人越来越像通用助手,那它就不能只会听“做成没”,还得听懂“做得快不快、稳不稳、轻不轻、整不整齐”。FPL 做的事,像是在给机器人发一份更像人话的个人说明书

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“机器人长任务里,奖励信号太稀疏、偏好标签太含糊”的问题。FPL 不再让人类只给一个总判断,而是按速度、安全、质量等多个自然语言轴分别比较,从而得到更密、更清楚的监督。

文中的“多轴偏好”是什么意思?可以把它理解成“评价维度不止一个”。比如同一段机器人轨迹,既可以从快慢来评,也可以从安全性来评,还可以从摆放是否整齐来评。每个轴都有自己的偏好标签,模型分别学习这些轴的奖励,而不是把它们混成一个总分。

为什么它能同时做到组合性和可导向性?因为奖励模型保留了多维结构,策略训练时也按这些维度来学。这样一来,训练集中没直接出现的行为组合,可以靠不同轴的拼接学出来;测试时只要换一下奖励条件,同一策略就能朝不同目标行为移动。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把“自由形式自然语言偏好”引入机器人偏好学习,思路不算玄,但切中长任务的真实痛点,创新点是实用型的,不是噱头型的。

实验合理度:★★★★☆。真实世界四任务加两个仿真任务,既看性能也看组合性和可导向性,比较完整;不过仍主要依赖离线数据和人工偏好,边界条件还没全打透。

学术研究价值:★★★★☆。这篇工作对“人类反馈如何保留结构”很有启发,尤其适合机器人这种多目标、多约束场景,研究价值明显。

稳定性:★★★☆☆。方法比纯稀疏奖励更稳,但本质上还是奖励学习,标注质量、轴定义和测试时奖励选择都会影响表现,离强鲁棒落地还有距离。

适应性以及泛化能力:★★★★☆。自然语言轴让它比固定多目标方法更灵活,能处理新的评价维度;但当前仍假设轴集合可被较好地抽取和标准化。

硬件需求及成本:★★★☆☆。训练的是机器人策略和奖励模型,真实机器人采集成本不低,算力本身不是最大问题,数据和实验代价才是大头。

复现难度:★★★☆☆。论文流程清楚,但真实机器人实验门槛高,数据采集、标注和设备都不便宜,复现不算轻松。

产品化成熟度:★★★☆☆。适合需要人类偏好介入的机器人任务,尤其是长时序精细操作;但要进产品,还得解决自动选奖励、降低标注成本和提升鲁棒性。

可能的问题:偏好轴仍依赖人工表达,标注一致性和测试时奖励设定会影响上限;长任务里一旦轴定义不稳,模型也会跟着“理解偏了”。


主要参考文献

[7] P. Christiano, J. Leike, T. B. Brown, M. 等. Human preferences from trajectories for reward learning. 相关工作奠定了机器人偏好学习的基础。
[20] Intelligence et al. 通过成功信号和 time-to-go 训练 value function,并据此进行策略条件化,是本文比较的重要基线。
[29] Filtered BC. 将成功轨迹与离线数据结合进行行为克隆,是本文使用的稀疏奖励策略提取基线。
[49] BC. 行为克隆基线。
原论文链接:https://arxiv.org/pdf/2606.32027v1.pdf
项目链接:freeform-pl.github.io/fpl.website/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!  

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。