← 返回 PaperDaily 大模型与智能体

2026新作REAR:奖励分解后,偏好对齐更稳了

这篇论文最有意思的地方,是它没有继续给模型“加班训练”,而是把问题搬到了测试时:先拆奖励,再重排输出。对偏好对齐、推理加速、树搜索都很友好,属于那种工程味很浓、落地门槛也不高的工作。

2026新作REAR:奖励分解后,偏好对齐更稳了
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,是它没有继续给模型“加班训练”,而是把问题搬到了测试时:先拆奖励,再重排输出。对偏好对齐、推理加速、树搜索都很友好,属于那种工程味很浓、落地门槛也不高的工作。


原论文信息如下:
论文标题:
REAR: Test-time Preference Realignment through Reward Decomposition
发表日期:
2026年06月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2606.31059v1.pdf

为何要做测试时偏好重对齐?

大模型现在最尴尬的地方,不是“不会答”,而是“答得挺像样,但不合口味”。同一个问题,有人要简洁,有人要详细;有人喜欢严谨,有人喜欢活泼;还有人会加一句“别用游戏化比喻”。模型如果只顾把题答对,却没把偏好照顾好,最后就会出现一种很熟悉的场面:内容没错,体验很差。
这篇论文盯上的就是这个痛点。它不再把“偏好对齐”理解成训练阶段的专属任务,而是把问题搬到测试时:既然模型已经会生成,那能不能在生成时多花一点算力,重新挑出更符合偏好的答案?这就是所谓的 测试时偏好重对齐
图1:REAR 的动机示意图
图1:REAR 的动机示意图。它把“问题本身”和“偏好信息”拆开看,再给多个候选回答打分,最后把原本更像“游戏化建议”的回答,重排成更符合用户偏好的版本。
这事的妙处在于,它没有要求模型重新训练,也没逼人重新做一套偏好数据集,更没有让工程团队再加一层复杂的奖励模型服务。论文的核心思路很直接:模型本来就隐含着“问题相关奖励”和“偏好相关奖励”,只要把这两个部分拆开,再在测试时重新调比例,就能实现更灵活的对齐。这个方法被命名为 REAR,全称是 REAlignment Reward,中文可以理解为“重对齐奖励”。

核心方法论:将奖励分解为“问题相关”与“偏好相关”

先把话说人话:模型回答一条问题时,脑子里其实同时在干两件事。第一件事是“这题该怎么答”,第二件事是“按用户要求答成什么样”。前者是任务本身,后者是偏好约束。以前很多方法默认这两件事绑在一起处理;REAR 的态度则更像“先拆开,再调参”。
论文先回到一个标准的强化学习视角,把文本生成看成 token 级别的马尔可夫决策过程。这里的 MDPMarkov Decision Process,中文叫“马尔可夫决策过程”;RLHFReinforcement Learning from Human Feedback,中文是“基于人类反馈的强化学习”。这两个缩写不是为了装专业,而是为了说明:大模型对齐,本质上是在优化一个奖励目标。
公式1:带 KL 约束的 RLHF 目标
公式1:带 KL 约束的 RLHF 目标。它的意思很朴素:模型要尽量拿高奖励,但又不能和参考模型偏得太离谱。这里的 KLKullback-Leibler divergence,中文叫“KL 散度”,作用是约束新策略别乱跑。
接着论文把这个目标改写成最大熵强化学习形式。最大熵的直觉也不复杂:除了追求高奖励,还保留一定随机性,避免模型一条路走到黑。这样做的好处是,后面可以把“奖励”和“策略概率”建立起明确关系,方便在测试时反推一个可计算的打分函数。
公式2:最大熵强化学习形式
公式2:最大熵强化学习形式。这里的 H 表示熵,中文可以理解成“随机性”或“多样性”。熵越大,模型越不容易只盯着一个答案模板。
有了这个框架,论文开始做关键的一刀:把奖励拆成两部分。第一部分是 问题相关奖励,只负责回答“题目本身”;第二部分是 偏好相关奖励,负责回答“按用户口味怎么答”。如果把用户偏好写成额外文本 xp,那么原始训练时的 composite reward 可以写成:
公式3:奖励分解
公式3:奖励分解。这里的 α 是训练时隐含的权衡系数,表示模型原本有多重视偏好。论文认为,这个系数在测试时不一定合适,所以才需要“重对齐”。
于是,REAR 不是去重新发明奖励,而是把原来的偏好项按测试时需求重新缩放,写成:
公式4:REAR 重对齐奖励
公式4:REAR 重对齐奖励。这里的 α̂ 是测试时可以调的系数。说白了,就是训练时模型怎么学的不重要,测试时可以按场景“重新拧螺丝”。如果用户更强调偏好,就把偏好权重调高;如果更强调任务本身,就把权重调低。

计算精确:如何用模型概率高效算出 REAR 评分

真正让这个方法能落地的,不是“奖励分解”四个字,而是它最后能变成一个可计算的打分函数。否则理论再漂亮,到了推理阶段还是只能看天吃饭。
论文利用最大熵强化学习中的性质,把奖励写成 token 级别的策略对数概率组合。换成大白话,就是:不用额外训练一个奖励模型,也不用单独搞一个“偏好判官”,直接拿基础模型自己的概率就能算分。这个设计很工程化,优点是计算便宜,接入也简单。
公式5:奖励与策略对数概率的关系
公式5:奖励与策略对数概率的关系。它说明奖励并不是神秘黑盒,而是可以拆成“当前策略概率”和“参考策略概率”的差。随后,论文进一步把这个关系推广到偏好文本条件下,得到可用于重对齐的 REAR 形式。
最后真正用于排序候选答案的,是一个更简洁的序列级分数:
公式6:序列级 REAR 分数
公式6:序列级 REAR 分数。这里的核心信息只有一句:候选回答的排序,只依赖基础模型在“无偏好输入”和“带偏好输入”两种条件下的 logprob 组合。也就是说,它不需要额外的奖励网络,甚至可以直接嵌进现成的采样和搜索框架里。
这一步的价值很实在。因为很多测试时方法的问题,不是效果差,而是算力一上来就炸。REAR 的做法相当于把“评价”这件事压缩成了概率运算,既可以配合 Best-of-N,也可以塞进树搜索。论文用到的 DVTSDiverse Verifier Tree Search,中文可理解为“多样性验证树搜索”。
换句话说,REAR 的厉害不在于“又造了一个更玄学的分数”,而在于它把偏好对齐变成了一个可复用、可扩展、可插拔的推理模块。对于工程团队来说,这种东西通常比“再训一个大模型”更有吸引力。

效果拔群:REAR 在多项基准测试中全面领先

论文的实验设计很清楚:先看偏好对齐任务,再看长上下文鲁棒性,最后看能不能跨任务泛化。这个顺序是合理的,因为如果一个方法连偏好对齐都做不好,后面的泛化就多半是“碰巧蒙对”。
表1:REAR 与基线方法在多个偏好对齐基准上的表现
表1:REAR 与基线方法在多个偏好对齐基准上的表现。这里能看到一个很直接的结论:无论是 BoN 还是 DVTS,REAR 都比 greedy、Amulet、LA 和 GenRM 更稳,尤其在 PrefEval 的显式偏好和隐式选择上提升明显。
更值得注意的是,GenRM 这种“用模型自己当裁判”的思路,增益并不稳定。原因也不难猜:如果基础模型本身对偏好理解不够准,让它再给自己打分,多少有点“自己给自己判卷子”的味道。REAR 的优势则在于,它不是再造一个外部判官,而是直接利用模型隐含的概率结构,减少了额外的误差来源。
在长上下文场景里,REAR 的表现也更稳。这个结果很有意思,因为长上下文通常是测试时方法的“照妖镜”:输入一变长,很多额外模块就开始掉链子,尤其是需要单独跑判别器或额外奖励模型的方案。REAR 因为只依赖基础模型 logprob,所以在这种分布变化下更抗折腾。论文还提到,Amulet 和 LA 在长上下文上甚至会遇到显存问题,这就很现实了——算法再优雅,显存一爆,优雅就只剩下表情包。
看到这里,基本可以确认这不是“只在小数据上抖机灵”的方法,而是能在真实推理流程里站得住脚的方案。尤其是它在不同基准上的提升并不只靠某一个任务吃红利,而是呈现出比较一致的趋势,这一点比单点爆表更值得重视。
表2:长上下文 PrefEval 上的表现
表2:长上下文 PrefEval 上的表现。随着对话轮数和上下文长度增加,REAR 仍然保持领先,说明它不是靠短上下文里的“运气分”,而是确实抓住了偏好与回答之间的概率结构。

泛化能力:REAR 不只是用于偏好对齐,还可用于数学和视觉任务

这部分最容易让人误会:REAR 既然是偏好对齐方法,是不是只能用在聊天场景?论文给出的答案是:不止。只要任务能被写成一个额外的偏好或约束文本,REAR 就能拿来做测试时重排序。
先看数学题。数学任务本身有一个天然好处:答案对不对比较容易验证。论文在 MATH500、AIME24、AIME25 和 AMC23 上,把 REAR 和多数投票做比较。结果显示,REAR 选出来的答案整体更强。这里的逻辑也很顺:多数投票只看“哪个答案出现次数最多”,而 REAR 还会考虑“哪个答案更符合任务偏好”。当偏好写得足够贴任务时,它就不只是票数统计,而是带了方向感的筛选。
图2:数学任务上的 REAR 选择与多数投票对比,以及 MMHal-Bench 示例
图2:数学任务上的 REAR 选择与多数投票对比,以及 MMHal-Bench 示例。上半部分说明 REAR 在多个数学基准上可以优于多数投票;下半部分则展示了如何把文本偏好注入到多模态任务输入中。
再看视觉任务。论文在 MMHal-Bench 上引入文本偏好信息,评估幻觉和回答质量。这里的 hallucination 可以理解成“模型一本正经地胡说八道”。结果显示,REAR 不仅分数更高,幻觉率也更低。这个结果挺关键,因为它说明 REAR 不只是会“挑更顺眼的答案”,还真能帮模型少说离谱话。
表3:MMHal-Bench 上的分数与幻觉率
表3:MMHal-Bench 上的分数与幻觉率。REAR 的分数更高、幻觉率更低,说明它在多模态场景里也能发挥作用,而不是只会在纯文本聊天里“刷存在感”。
论文还做了跨模型家族实验,把方法放到 Llama-3.1-8B-Instruct 上测试。结果依然成立,说明 REAR 不是“Qwen 专属外挂”,而是更通用的奖励分解思路。这一点很重要,因为很多方法一换底座就哑火,最后只能停留在某个模型家族的 demo 里;REAR 至少在论文给出的实验里没有这个毛病。
表4:跨模型家族的泛化结果
表4:跨模型家族的泛化结果。REAR 在 Llama-3.1-8B-Instruct 上同样优于 greedy 和 GenRM,说明奖励分解的思路并不依赖某个特定模型家族。

总结与展望

REAR 这篇工作的价值,不在于它把偏好对齐“做得更玄”,而在于它把一件原本需要再训练、再标注、再部署的事,改写成了测试时就能完成的概率重排序。这个转变很实用:省训练成本,省数据成本,也省工程迭代成本。
当然,它也不是万能钥匙。REAR 的前提是:偏好文本要写得足够清楚,且和任务确实有关;如果偏好本身很模糊,或者和任务目标冲突太大,重对齐也救不了。再往工程上看,虽然它比额外训练轻,但在大样本采样或树搜索下,推理成本还是会上升,只是这个成本比重新训练通常更可控。
如果把这篇论文放到更大的趋势里看,它其实是在提醒一个很现实的方向:未来很多对齐问题,未必都要靠“更大模型 + 更多训练”解决,测试时计算也许会越来越像一个独立杠杆。谁能把这个杠杆用得更省、更稳、更可解释,谁就更接近真正可落地的对齐方案。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?解决的是“模型会答,但不一定答得符合当前用户偏好”的问题。它把偏好对齐从训练阶段挪到测试阶段,用 REAR 在生成时重新挑选更合适的回答。

REAR 和普通打分有什么区别?普通打分往往只看一个整体分数,或者依赖额外奖励模型;REAR 则把奖励拆成“问题相关”和“偏好相关”两部分,并直接用基础模型的概率来算,既轻量又更容易接入现有推理框架。

它为什么还能用于数学和视觉任务?因为它本质上是“带条件约束的测试时重排序”。只要任务能写成一个额外偏好或约束文本,REAR 就能用同样的概率打分逻辑去选候选答案,所以数学题和多模态幻觉任务也能受益。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把偏好对齐从训练搬到测试时,再用奖励分解做成可计算的重排序,这个思路不算花哨,但很实用,也确实有新意。

实验合理度:★★★★☆。对比了偏好对齐、长上下文、数学、视觉和跨模型家族,覆盖面比较完整;不过仍然主要依赖基准集,真实用户场景还需要更多验证。

学术研究价值:★★★★☆。它给“测试时对齐”提供了一个清晰的理论桥梁,尤其把隐含奖励和策略概率连起来,后续很容易被别的工作接着用。

稳定性:★★★★☆。不需要额外训练,稳定性比很多带额外判别器的方法更好;但它仍然依赖采样和偏好文本质量,偏好写歪了,效果也会歪。

适应性以及泛化能力:★★★★☆。从纯偏好到数学、视觉都能跑,说明思路不窄;但前提是任务能被表达成可操作的偏好约束。

硬件需求及成本:★★★★☆。比重新训练省得多,但 BoN 和树搜索都要额外推理预算,属于“花算力买对齐”,不是零成本白嫖。

复现难度:★★★☆☆。方法本身不复杂,但要复现出论文里的效果,还是得处理好采样策略、偏好文本和搜索预算。

产品化成熟度:★★★☆☆。在有清晰偏好模板、可接受额外推理成本的场景里可用;如果要求超低延迟或偏好极不稳定,落地会受限。

可能的问题:偏好文本质量决定上限,且采样/搜索带来额外推理开销;对模糊偏好和强冲突偏好,效果未必稳定。


主要参考文献

Zhang, F., Wang, P., Li, C., Li, Y.-C., Chen, Y., Feng, L., Xu, C., Tomizuka, M., & An, B. REAR: Test-time Preference Realignment through Reward Decomposition. arXiv, 2026.
Ouyang, L. et al. Training language models to follow instructions with human feedback. 2022.
Haarnoja, T. et al. Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor. 2018.
Ng, A. Y., Harada, D., & Russell, S. J. Policy invariance under reward transformations: Theory and application to reward shaping. 1999.

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,方便更快通过。一起聊大模型对齐、推理、奖励建模,少走弯路,多看干货。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。