← 返回 PaperDaily 前沿研究

人类反馈太贵?PreferenceEKF只问最值钱的问题

论文基本信息 原文标题: Subspace Inference Enables Efficient Active Reward Learning from Preferences 作者: Yutai Zhou、Erdem Bıyık 作者单位: University of Southern California(南加州大学) 首次公开: 2026年9月3日(

论文基本信息

原文标题:Subspace Inference Enables Efficient Active Reward Learning from Preferences
作者:Yutai Zhou、Erdem Bıyık
作者单位:University of Southern California(南加州大学)
首次公开:2026年9月3日(arXiv v1)
发表信息:Transactions on Machine Learning Research(TMLR)
原论文链接:https://arxiv.org/abs/2609.04066
开源代码:https://github.com/yutaizhou/bnn_pref
项目页面:未单独公开
数据集:D4RL、V-D4RL及仓库内SOAR处理数据
官方Demo:未公开独立Demo视频
代码许可证:仓库根目录未提供LICENSE文件

龙哥导读:
在许多RLHF任务中,高质量偏好标注可能成为主要成本之一:需要不断请人比较“A好还是B好”。南加州大学团队提出PreferenceEKF:把奖励模型参数压进低维子空间,用扩展卡尔曼滤波逐条更新不确定性,再优先询问最能减少不确定性的问题。论文在D4RL与V-D4RL上报告了更好的样本效率和校准表现,训练速度约为深度集成的5倍、最后一层MCMC的40倍以上。但它也有一条清晰边界:单峰高斯适合追踪相对一致的偏好,面对多人、多价值观的分歧时并不够。

假设要教一个机器人学会“更符合人类期待”的动作。系统每次给标注者看两段轨迹:左边抓杯子更快,右边动作更稳,请选一个。问题是,动作组合可以成千上万,而人的时间有限。随机询问会浪费大量标签;只挑模型最纠结的问题,又可能反复追逐噪声。

主动偏好学习真正需要回答的不是“哪个样本最难”,而是:问完哪一个问题,奖励模型对人的偏好会理解得更多?这要求模型不只给分,还要知道自己对哪些参数、哪些比较不确定。对深度网络而言,可靠维护整个参数后验通常贵得难以落地。

一、PreferenceEKF解决的不是“怎么对齐”,而是“该问什么”

很多人看到RLHF,会直接想到PPO、DPO或奖励模型训练。PreferenceEKF处在更靠前的位置:在已有一批候选轨迹时,它决定下一对应该拿给标注者看。目标是在固定的人类反馈预算下,更快学到可用的奖励函数。

论文把这个过程改写成序贯贝叶斯滤波。奖励模型参数被视为隐藏状态,每收到一个“轨迹A优于轨迹B”的标签,就像传感器收到一次新观测:先预测当前信念,再根据新证据修正均值和协方差。这样不必把所有历史标签重新训练多轮,也不必维护多个完整神经网络来模拟不确定性。

依据论文Algorithm 1与方法章节整理:暖启动构造低维子空间,EKF递推更新后验,InfoGain选择下一条最有价值的偏好问题。

图中六个步骤构成闭环。左上角的暖启动只需少量标签,用SGD留下参数轨迹;中上方用SVD提取主要变化方向;右上方不再维护全部参数的巨大协方差,而只追踪低维坐标的概率分布。右下方从这个分布采样多个“可能的奖励模型”,中下方计算每个候选问题的信息增益,最后只把最值得问的一对轨迹交给人。

图中回环箭头从第6步返回第3步,不会重新执行暖启动。新标签触发一次递推更新,然后基于新后验继续采样与选题。这个差别决定了它能否用于持续到来的反馈流:旧数据已经被压进当前后验,不需要每来一个标签就把历史数据全部重放。

二、第一条公式:把“喜欢A”变成可计算概率

公式1:Bradley-Terry模型把两条轨迹的累计奖励差,转换为标注者选择A的概率。

逐项看,τa与τb是两段待比较轨迹;Rθ(τ)是参数为θ的奖励模型给整段轨迹计算的累计回报;β是温度参数,描述标注者有多稳定。β越大,奖励稍高的一边就越容易被坚定选中;β较小时,即使两边分数有差距,选择仍可能摇摆。

这个公式的直觉类似二分类Softmax:不是要求人给轨迹打绝对分,而是只做成对选择。它降低了标注难度,却没有消除主观性。若同一个人今天偏爱速度、明天偏爱安全,或者多人价值观本来就不同,单一θ未必能解释所有标签。

三、真正的降本点:不在百万参数里直接跑EKF

标准EKF若直接追踪神经网络参数θ,需要维护一个大小为|θ|×|θ|的协方差矩阵,空间复杂度按参数量平方增长。奖励模型只有几十万参数时都很吃力,更不用说更大的视觉编码器或语言模型。

公式2:只在低维坐标z中维护高斯后验,再通过固定映射A投影回完整神经网络参数。

θ*是少量暖启动数据上SGD得到的参数锚点;A是由SGD参数轨迹做SVD得到的投影方向;z是低维坐标。论文主实验中,两个隐藏层各64单元的MLP使用200维子空间。模型真正参与前向计算时,将z代回θ(z)=Az+θ*,得到完整参数。

这里的核心假设是:神经网络虽然参数很多,但与当前任务相关的有效解主要沿少数方向变化。若这个假设成立,Σ'只需描述z之间的不确定性,计算量从“全参数平方”降到“子空间维度平方”。官方代码中的projection_matrix.py确实实现了密集与稀疏随机基,agent_ekf.py则将子空间样本投影回全参数模型做前向预测。

代价同样明确:A固定后,后续更新只能在这个子空间里移动。如果真正重要的偏好方向没有被暖启动轨迹捕获,EKF再精确也只能在错误的地图里定位。论文用随机投影和不同子空间维度做了消融,但“压缩是否丢掉少数人偏好”仍是应用时必须审计的问题。

四、一个新标签,究竟怎样改变模型信念

扩展卡尔曼滤波分成预测和更新两步。预测阶段假设奖励模型参数不会凭空跳变,因此均值沿用上一步;协方差可以加入过程噪声U,表示模型允许偏好随时间缓慢漂移。更新阶段先用当前均值预测标注结果ŷ,再比较真实标签y与预测之间的“创新量”。

公式3:卡尔曼增益决定这次反馈应把参数均值推多远;真实标签与预测的差值越大,修正方向越明显。

Hi是偏好预测函数在当前均值附近的雅可比,描述每个子空间方向会怎样改变A/B概率;Σi|i-1是看到新标签前的不确定性;Vi是观测噪声,表示人的选择并非绝对稳定;Ki是卡尔曼增益,它在“相信旧模型”和“相信新反馈”之间自动权衡。

如果某个方向原本就很不确定,而新标签对该方向又很敏感,K会放大这次修正;如果标注噪声V很大,系统会更保守。更新后的协方差还会收缩,表示这次询问已经排除一部分可能解释。下一轮选题时,InfoGain正是利用这份新的不确定性地图。

“扩展”二字来自非线性:神经奖励模型和Bradley-Terry概率都不是线性函数,EKF只能在当前均值附近做一阶展开。局部近似带来效率,也意味着后验若高度弯曲、多峰或突然漂移,单次线性化可能不够。官方实现支持迭代EKF次数参数,但迭代更多仍不能把单峰高斯变成多峰分布。

五、第四条公式:为什么不该只问“最纠结”的问题

公式4:选择让偏好标签y与模型参数θ之间互信息最大的查询Q,而不是简单选择预测概率最接近50%的样本。

Q是一对候选轨迹,y是标注者最终选择,bi-1是问第i个问题前的参数后验。第一项H(y|Q,b)衡量模型整体对答案有多不确定;第二项EθH(y|θ,Q)衡量每个具体参数样本自身有多犹豫。两者相减,留下的是“不同可能模型之间真正存在分歧”的部分。

举个直观例子:如果所有可能模型都认为A、B几乎一样,50:50只是样本本身含糊,问人也未必能区分模型;如果一半模型坚定选A、另一半坚定选B,那么一个标签就能排除大量错误解释。InfoGain更偏爱后者。

PreferenceEKF从低维高斯后验中采样多组z,再投影成多组神经网络参数,近似这个期望。后验更新本身是确定性的,随机采样主要服务于“下一题选什么”。论文还比较了disagreement与entropy,结果只有InfoGain能让五类方法的主动版本普遍不差于随机询问。

六、实验结果:快,不等于只靠多抽样作弊

依据论文图1、实验章节与局限性说明重绘。论文主张建立在12个D4RL任务、每任务12个随机种子的汇总结果上。

主实验比较PreferenceEKF、DeepEnsemble、MC Dropout、Laplace近似和Last-layer MCMC。主动与随机版本都被评测。汇总结果显示,PreferenceEKF在样本效率和最终测试对数似然上总体持平或优于基线;训练速度约为DeepEnsemble的5倍,比Last-layer MCMC快40倍以上。

一个容易被忽略的公平性问题是采样数量:DeepEnsemble通常只训练5个完整模型,而PreferenceEKF可从低维后验便宜地抽100个模型。论文因此补做了统一M=5的比较,PreferenceEKF仍保持最好的样本效率和最终对数似然。这说明收益不只是“抽得更多”,低维后验本身也提供了有效的不确定性结构。

怎样读论文图1也很重要。左图纵轴是测试偏好标签的对数似然,越高表示奖励模型越能解释标注者的选择;实线代表主动询问,虚线代表随机询问。它衡量的是“偏好分布拟合得好不好”,不是机器人已经完成多少真实任务。右图比较训练时长,证明递推更新省计算,但不能单独证明最终策略更安全。

论文没有只看最终一个点,而是观察随着查询预算增加,模型学习曲线如何变化。主动学习真正有价值的区域通常在预算早期:如果必须收集到全部标签才拉开差距,就不能叫样本高效。PreferenceEKF在多数任务上更早达到较高对数似然,符合“少问一些也能学到”的目标。

校准实验检查的是概率能不能被相信。一个总是给出0.99置信度、却经常选错的奖励模型,会让主动学习把错误确信当成可靠知识。论文报告PreferenceEKF相较其他贝叶斯深度学习近似具有更好的校准表现,这对InfoGain尤其关键:采集函数依赖的不是硬标签,而是整个预测分布。

论文还把学到的奖励模型送入离线强化学习,报告了有竞争力的策略表现,并在V-D4RL图像任务和稀疏偏好反馈中验证扩展性。但实验基础设施并不轻:附录说明大多数实验使用单节点8张RTX A6000,并通过SLURM分片。方法减少的是序贯奖励学习的重复计算,不应被误读成“普通电脑即可复现整套RLHF”。

七、与几条相似路线放在一起看

DeepEnsemble:训练多个完整奖励模型,用模型间分歧表示不确定性。直观、稳健,但每来一批标签都要重复训练多个网络。

MC Dropout / Laplace / MCMC:分别用随机失活、局部曲率或采样近似后验。它们都在回答“模型有多不确定”,但计算成本和近似偏差不同。

DPO:直接用偏好对更新策略,绕开显式奖励模型;它解决“拿到标签后怎样调模型”,并不自动解决“有限预算先标哪一对”。

PreferenceEKF:专注“如何用较低成本维护奖励模型后验并选下一题”,可作为数据收集层,而不是PPO/DPO的简单替代品。

PaperDaily里的两篇相关工作能补上边界。Aalto大学的自适应提示引导同样用信息论选择最值得问的问题,但目标是通过视觉选项帮助用户表达作图意图;PreferenceEKF则把信息增益扩展到神经网络奖励模型的参数后验。Kitware的多元化对齐强调不同用户可以有不同偏好,正好对应PreferenceEKF的短板:一个单峰高斯不擅长表达多个互相冲突的价值中心。

另一条工程路线是把“裁判”做小:利用较小模型的内部状态提取评分信号,降低单次评价成本。它优化“每个标签算得多贵”;PreferenceEKF优化“需要询问多少次、每次后验怎样更新”。二者若组合,可能同时减少单次标签计算成本与标签总量,但这只是方法层面的合理推论,不是本文已经验证的系统。

八、放进RLHF全链路,它到底替换了哪一步

一条完整偏好学习流水线至少有五层:先产生候选回答或轨迹,再组成比较题交给人,随后训练奖励模型,用奖励优化策略,最后在独立任务上评价真实效果。PreferenceEKF主要改造第二、三层之间的循环:它一边维护奖励模型后验,一边决定下一道比较题。

它没有解决候选如何生成。如果当前策略只会产生两种几乎相同的失败动作,再聪明的采集函数也只能在失败里挑一个更有信息量的失败。工程上需要持续扩充轨迹池,让新策略、红队案例、真实事故和边界场景进入候选空间。

它也没有替代标注协议。两段轨迹的展示顺序、播放速度、说明文字和评价维度都会影响y。如果把“安全、效率、舒适”混成一个模糊问题,后验学到的可能只是标注者临场猜测。更合理的做法是按维度拆题,并为每个维度分别检查一致性。

它更没有保证策略优化不会钻奖励漏洞。奖励模型即使准确拟合已见偏好,策略也可能主动寻找后验薄弱区域,生成标注池从未覆盖的极端行为。因而策略训练后还需要真实任务成功率、安全约束、对抗测试和人工抽检,不能只报告奖励上升。

PreferenceEKF带来的新能力,是让这条流水线拥有一份可更新的“不确定性账本”。团队可以看到哪些问题已经问得足够,哪些参数方向仍缺证据,新增一个标签究竟减少了多少不确定性。相比只保存最终奖励模型权重,这份账本更适合做预算管理和采集审计。

九、三个容易踩中的统计陷阱

陷阱一:主动学习只在同一个池里赢。如果训练与测试轨迹来自相近环境,采集函数很容易找到局部高价值问题;换到新机器人、新用户或新场景后,优势是否保留要重新验证。论文跨D4RL、V-D4RL和不同任务做了扩展,但这仍不等于任意分布迁移都稳健。

陷阱二:校准好不等于价值观正确。概率校准只说明“说70%时大约七成会对”,前提是评价标签本身代表目标。如果标注协议偏向速度、忽略安全,模型可以非常校准地学到一个错误目标。

陷阱三:平均曲线会隐藏失败任务。论文图1汇总12个任务并给出置信区间,适合看总体趋势,却可能掩盖某些环境中主动方法不占优。采用前必须查看逐任务结果,尤其关注与自身业务最接近、标签最稀疏或偏好最不稳定的任务。

这三点共同说明:主动学习不是免费午餐。它把预算集中到模型认为重要的区域,因此模型的初始表示、候选池覆盖和不确定性质量会直接决定“重要”是否判断正确。越主动的系统,越需要独立留出集和随机采样基线来防止自我强化。

十、代码开源了,复现门槛藏在哪里

官方仓库公开了PreferenceEKF、DeepEnsemble、Dropout、Laplace和MCMC五类实现,以及D4RL、V-D4RL、SOAR与UniRLHF任务配置。核心实现与论文一致:EKF信念状态保存低维均值、协方差、投影矩阵和参数锚点;查询阶段从多元高斯采样z,投影回完整模型,然后为候选轨迹计算InfoGain。

不过,仓库不是“pip install后立即复现论文”的轻量项目。依赖固定到JAX 0.4.38与CUDA 12,D4RL仍依赖旧版Gym和MuJoCo栈,EKF还需要作者修改过的Dynamax分支;完整扫参脚本默认使用SLURM。代码结构和关键实现已核验,但没有把安装依赖或读取README冒充完整复现实验。

如果团队要评估是否值得采用,可先做一个小规模闭环,而不是直接复现全部论文:固定同一批候选轨迹和同一位标注者,比较随机查询、熵查询和InfoGain查询在20、40、60个标签预算下的留出集对数似然;同时记录每轮更新时间与峰值显存。只有“少标签、更准、总成本更低”同时成立,主动学习才有工程收益。

复现时还应固定四组关键变量。第一组是子空间:记录暖启动标签数、SGD轨迹长度、SVD维度和解释方差;第二组是后验:记录先验协方差、过程噪声U、观测噪声V和迭代EKF次数;第三组是采集:固定候选池、模型采样数M和每轮预算;第四组是评测:除平均对数似然外,同时报告逐任务曲线、校准误差、更新时间和策略回报。否则只调出一条更漂亮的总体曲线,很难知道收益来自方法还是额外预算。

上线后则要额外监控“被问到的数据”和“没被问到的数据”。主动学习会改变训练样本分布,频繁被选中的边界案例不能代表真实流量。保留一条固定比例的随机抽样通道,既能估计总体偏差,也能发现采集函数长期忽略的新模式。没有这条对照线,系统可能越来越擅长回答自己反复提出的问题,却离真实用户越来越远。

最后,节省标签应按总成本核算。一次专家反馈可能很贵,但维护候选池、计算所有问题的采集值、生成多组模型前向结果同样有成本。PreferenceEKF降低了后验采样与递推训练开销,却没有让大候选池搜索自动变成常数时间。工程团队需要把标注费、GPU时、等待时延和错误决策代价放进同一张账。

十一、哪些场景适合,哪些场景应该绕开

适合场景一:专家反馈很贵。例如手术机器人、工业操作或专业设计中,标注者不是随时可调用的众包用户。系统若能把问题集中到真正改变模型判断的边界案例,每节省一次询问都有现实价值。

适合场景二:反馈按时间连续到达。产品上线后每天只收到少量人工复核,重新训练完整集成代价太大。递推后验能把上一时刻的知识带到下一时刻,并通过过程噪声容纳有限漂移。

不适合场景一:人群偏好天然分裂。例如政治价值、文化规范或高度个性化推荐。把多个群体硬压成一个高斯中心,可能得到“谁都不满意的平均人”,甚至因为主动查询集中在主流边界而进一步忽视少数意见。

不适合场景二:候选池本身覆盖不足。池式主动学习只能从已有轨迹对中选题。如果危险动作、罕见失败或新用户需求根本不在池里,InfoGain无法凭空发现。查询策略再聪明,也不能替代数据覆盖和红队设计。

不适合场景三:标签噪声随上下文系统变化。公式中的V把噪声概括成协方差,但真实人类可能因疲劳、呈现顺序、措辞和群体压力改变选择。生产系统需要随机交换A/B位置、插入重复题和金标准质检题,并单独监控标注者一致性,不能把所有异常都交给滤波器吸收。

十二、龙哥点评:省标签之前,先问“谁的偏好”

PreferenceEKF最值得肯定的地方,是它把RLHF的数据效率问题落到一个具体系统瓶颈:不是所有人类反馈都同样值钱,而不确定性也不能靠昂贵集成无限堆算力。低维子空间加递推滤波,让“下一条该标什么”从经验策略变成可计算问题。

但漂亮的效率数字不能掩盖建模假设。论文明确承认,EKF的单峰高斯后验主要面向单一标注者;在众包多人标签上,各方法的对数似然都不理想。现实中的内容安全、价值判断和个性化推荐,往往不是“存在一个正确偏好,只是还没估准”,而是不同人真的想要不同东西。

因此更稳妥的落地方式,是把它用于相对一致、反馈昂贵、查询池明确的场景,例如单个专家训练机器人、单个客户定制推荐策略,或某套组织规范下的奖励建模。若面对多群体价值冲突,应先显式建模偏好群体、置信度和少数意见,再谈主动查询效率。问得更聪明很重要,但先确认“在学谁的偏好”更重要。

真正值得带走的判断标准是:只有当后验可信、候选覆盖充分、随机对照持续存在时,“少问几次”才等于真实降本;否则它也可能只是更快地收敛到一套未经检验的偏好假设。

龙迷三问

1. PreferenceEKF能直接训练聊天大模型吗?
论文验证的是奖励模型学习与离线强化学习,不是直接在超大语言模型全参数上跑EKF。它更适合作为偏好数据选择与奖励建模组件,不能把D4RL结果直接外推到大模型对齐。

2. 低维子空间会不会限制模型能力?
会有风险。它换来可计算后验,也可能漏掉暖启动未覆盖的重要方向。论文的SVD、随机投影和维度消融降低了担忧,但无法证明所有任务都存在同样稳定的低维结构。

3. 最值得工程团队复用的是什么?
不是机械照搬EKF,而是把反馈管线拆成“后验表示、问题选择、标签更新、偏差审计”四层。只有能量化不确定性,主动学习才不只是挑最难样本。

参考资料

论文:Subspace Inference Enables Efficient Active Reward Learning from Preferences
https://arxiv.org/abs/2609.04066

官方代码:
https://github.com/yutaizhou/bnn_pref

TMLR论文页面:
https://openreview.net/forum?id=ckWRSrY8i4

本文依据论文、OpenReview页面及官方开源代码整理;相似工作对比来自公开论文资料。实验数字以论文公开材料为准;官方代码关键实现已核验,但未完成依赖整套D4RL、MuJoCo与多GPU扫参的独立复现实验,因此不把源码核验表述为完整复现。正文技术示意图与公式卡均依据论文方法章节重绘,不是论文原图。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球