← 返回 PaperDaily 大模型与智能体

REAR来了:测试时重排偏好,Qwen上直接打赢基线

这篇论文最实用的地方,不是又造了一个更复杂的对齐模型,而是把“测试时怎么选更符合偏好的回答”这件事讲清楚了。REAR 直接用 base model 自己的概率做奖励分解,省掉额外训练,工程味很足。

REAR来了:测试时重排偏好,Qwen上直接打赢基线
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最实用的地方,不是又造了一个更复杂的对齐模型,而是把“测试时怎么选更符合偏好的回答”这件事讲清楚了。REAR 直接用 base model 自己的概率做奖励分解,省掉额外训练,工程味很足。


原论文信息如下:
论文标题:
REAR: Test-time Preference Realignment through Reward Decomposition
发表日期:
2026年06月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2606.30339v1.pdf

引言

大模型现在最不缺的,就是“会说话”。最缺的,反而是“会顺着用户脾气说话”。同一个问题,用户想要的是认真解答,模型却可能给出一段自嗨式发挥;用户明确说了不想要某种风格,模型还是像没听见一样继续往前冲。
这篇 REAR 的思路很直接:既然训练阶段已经把模型训成了“有点偏差的好学生”,那测试时就别再折腾重训了,直接把回答重新排序,让更符合偏好的那个上位。它把偏好对齐拆成奖励分解,再把这个分解结果塞进测试时扩展里,工程上相当干净。

方法概述

REAR 的核心不是“再训练一个更懂偏好的模型”,而是把已有模型的隐式奖励拆开看。论文认为,基础模型在预训练时已经学到了两类东西:一类是回答问题本身的能力,另一类是对偏好文本的响应能力。测试时真正要做的,不是推翻前者,而是重新调节两者的比例。
图1:REAR 的动机示例
图1:REAR 的动机示例。模型先根据“问题相关奖励”和“偏好相关奖励”给多个候选回答打分,再把原本不合偏好的回答挤下去,把更符合用户偏好的回答顶上来。
论文把这个过程写成奖励分解:基础模型对应的问题奖励记为 r0,偏好条件下多出来的那部分记为 rp。于是,测试时就能把原本内生的偏好系数 α 换成可调的 λ。说人话就是:训练时模型学会了“默认怎么答”,测试时再告诉它“这次偏好要多重一点,或者少重一点”。
更关键的是,REAR 并不依赖一个额外训练出来的奖励模型,而是可以直接写成 token 级别的 logprob 线性组合。这个设计很讨巧:一方面保留了奖励打分的直觉,另一方面又能直接接到 best-of-N 和树搜索这类测试时扩展算法里,少了很多“再加一个模型”的部署负担。
图2:REAR 的整体方法标题图
图2:REAR 的整体方法标题图。论文的主线很清楚:通过奖励分解,在测试时把偏好强度重新校准,而不是重新训练模型参数。

分解潜在奖励:REAR 的核心原理

这部分最值得抓住的点,是论文把偏好对齐从“黑箱调参”变成了“奖励重标定”。基础模型本身就隐含了一个奖励结构:回答问题的质量是一部分,偏好匹配是另一部分。REAR 不是去猜模型脑子里在想什么,而是直接利用这种结构,把偏好那部分在测试时放大或缩小。
从推导上看,论文借助最大熵强化学习框架,把 RLHF 目标和策略概率联系起来,再通过奖励分解得到 REAR。由于原始奖励不可直接观测,最终可计算的是基于 base model 自身 logprob 的打分函数。这个打分函数既能评估完整回答,也能评估部分生成片段,所以它比那种只能看最终答案的外部奖励模型更灵活。
图7:不同 λ 下问题与偏好得分的变化
图7:不同 λ 下问题与偏好得分的变化。随着 λ 增大,偏好相关分数会上升,但问题本身的帮助性会下降,说明这不是越大越好,而是典型的“偏好和有用性要找平衡”的问题。

无需重新训练:将REAR无缝集成到测试时扩展

REAR 真正的工程价值,在于它不是一个孤零零的打分器,而是能直接嵌进测试时扩展流程。论文给了两种接法:一种是 best-of-N,先采样多个回答,再用 REAR 选分最高的;另一种是 DVTS 树搜索,在每一步扩展时都用 REAR 指导分支选择。前者简单粗暴,后者更像“边想边筛”。
图6:不同采样数下的扩展性能
图6:不同采样数下的扩展性能。随着采样数增加,REAR 的效果继续提升,但边际收益会递减,这也很符合现实:多采样能帮忙,但不是无限白嫖。
这种设计的好处很直接。第一,不需要额外训练奖励模型;第二,不需要改动 base model 权重;第三,部署时只要能拿到 logprob,就能跑。对工程团队来说,这意味着它更像一个“推理侧插件”,而不是一整套要重新搭的训练管线。

全面超越基线:在多个基准上的实验验证

实验部分基本是在回答一个很现实的问题:这套东西到底是“讲得通”,还是“真能赢”?论文在偏好对齐、角色扮演、长上下文等任务上做了系统测试,基座模型主要用 Qwen2.5-7B-Instruct。结果显示,REAR 指导的 best-of-N 和 DVTS 大多优于 greedy、Linear Alignment、Amulet,以及基于生成式奖励模型的采样方法。
图4:REAR 与外部奖励模型基线对比
图4:REAR 与外部奖励模型基线对比。一个很扎实的结论是:REAR 不只是省了一个外部奖励模型,效果还经常更好,说明“用自己内部概率给自己打分”这条路并不只是省钱,是真的有竞争力。
图3:数学任务与视觉幻觉示例
图3:数学任务与视觉幻觉示例。论文把 REAR 也试到了数学题和多模态视觉任务上,说明它并不只是在偏好对齐场景里“会说漂亮话”。
更有意思的是长上下文实验。随着对话越来越长,很多方法会开始发飘,REAR 仍然保持相对稳定。原因也不难理解:它直接基于 base model 的 logprob 打分,不太依赖一个容易被长输入搞乱的外部判别器。这个特性对真实产品很重要,因为用户对话一长,系统就容易开始“失忆”。

超越文本偏好:REAR在数学与视觉任务中的泛化潜力

论文最加分的一点,是它没有把自己锁死在“偏好对齐”这个小盒子里。只要任务能写成一个带约束的偏好文本,REAR 就能把它当成测试时重排序问题来处理。于是它在数学题、视觉幻觉检测上也能用,说明这套奖励分解思路并不只适用于聊天机器人。
图5:不同 λ 下的稳定趋势
图5:不同 λ 下的稳定趋势。论文给出的结论很务实:λ 不是越大越好,通常存在一个比较稳的默认值,实验里 λ=20 往往表现不错,但具体任务仍可能有差异。
这也提醒了一件事:REAR 不是“万能偏好旋钮”。如果偏好文本和任务关系不大,效果不会凭空变好;如果 λ 设得太激进,回答可能越来越像“偏好奴隶”,把有用性挤没了。论文在这里没有装神弄鬼,反而把边界讲得挺诚实。

总结与展望

REAR 这篇工作的价值,不在于又提出了一个更复杂的对齐大招,而在于它把“测试时偏好重排”这件事做成了一个能落地的框架。它告诉人们:有些对齐问题,不一定非要靠重训解决,推理阶段也能动手术。
如果后续能进一步降低树搜索带来的计算开销,并把偏好文本的自动构造做得更稳,这条路线会更实用。毕竟现实世界里,用户偏好不等人,模型也没必要每次都从头学一遍。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

REAR 和外部奖励模型比,优势到底是什么?最直接的优势是省掉额外奖励模型的部署和推理成本,而且打分信号来自 base model 自己的概率,和生成过程天然一致。论文里还显示,它在不少任务上不只是更省,而是效果也更好。

λ 这个参数是不是越大越好?不是。λ 本质上是在调“偏好”与“回答质量”之间的权重,太小会不够听话,太大又可能把有用性挤掉。实验里通常存在一个比较稳的区间,不能无脑拉满。

这类方法能不能直接用到业务里?有一定落地潜力,尤其适合已经能拿到模型 logprob、又不想再训练一套奖励模型的场景。不过树搜索会带来额外算力开销,真正上线时还得看延迟预算和任务复杂度。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。奖励分解不是新词,但把它明确落到测试时偏好重排,并且和 BoN、DVTS 结合起来,这个组合是有实用新意的。

实验合理度:★★★★☆。任务覆盖偏好对齐、角色扮演、长上下文、数学和视觉,比较全面;不过很多结论仍然依赖基座模型和提示设计,边界条件要看清。

学术研究价值:★★★★☆。它补上了 TTS 往开放式偏好对齐延伸的一块短板,理论上也把“隐式奖励”与推理时选择机制连起来了。

稳定性:★★★★☆。论文对 λ 做了不少分析,默认值相对稳,但不同任务和搜索策略下仍有波动,不算一招通吃。

适应性以及泛化能力:★★★★☆。能迁移到数学和视觉任务,跨模型族也能跑,说明不是 Qwen 专属小把戏。

硬件需求及成本:★★★☆☆。比外部奖励模型省,但 DVTS 这类搜索仍然吃算力,便宜不是白给的。

复现难度:★★★☆☆。思路清楚,工程上主要是 logprob 提取和搜索接入,难度中等;但不同推理引擎的实现细节会影响结果。

产品化成熟度:★★★☆☆。适合做推理侧增强模块,离“直接替换现有对齐方案”还有距离。

可能的问题:偏好文本依赖仍然存在,且 λ 需要在任务上保持合理;如果偏好写得不对,REAR 也不会凭空变聪明。

主要参考文献

Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P. F., Leike, J., and Lowe, R. Training language models to follow instructions with human feedback. In Advances in Neural Information Processing Systems, 2022.
Rafailov, R., Sharma, A., Mitchell, E., Manning, C. D., Ermon, S., and Finn, C. Direct preference optimization: Your language model is secretly a reward model. In Advances in Neural Information Processing Systems, 2023.
Gao, S., Ge, Q., Shen, W., Dou, S., Ye, J., Wang, X., Zheng, R., Zou, Y., Chen, Z., Yan, H., Zhang, Q., and Lin, D. Linear alignment: A closed-form solution for aligning human preferences without tuning and feedback. In International Conference on Machine Learning, 2024.
Zhang, Z., Bai, F., Chen, Q., Ma, C., Wang, M., Sun, H., Zheng, Z., and Yang, Y. Amulet: ReAlignment during test time for personalized preference adaptation of LLMs. In International Conference on Learning Representations, 2025c.
Liu, C. Y., Zeng, L., Liu, J., Yan, R., He, J., Wang, C., Yan, S., Liu, Y., and Zhou, Y. Skywork-reward: Bag of tricks for reward modeling in LLMs. CoRR, abs/2410.18451, 2024a.
Beeching, E., Tunstall, L., and Rush, S. Scaling test-time compute with open models, 2025. URL https://huggingface.co/spaces/HuggingFaceH4/blogpost-scaling-test-time-compute.
Zhao, S., Hong, M., Liu, Y., Hazarika, D., and Lin, K. Do LLMs recognize your preferences? evaluating personalized preference following in LLMs. In International Conference on Learning Representations, 2025.

从预训练到推理时,LLM偏好对齐的新挑战

大模型对齐这件事,最尴尬的地方在于:训练时看起来挺听话,一到真实用户面前就开始“自由发挥”。有的回答不够贴合偏好,有的明明看懂了上下文,却还是偏向默认口味。REAR 这篇论文盯住的,就是这个很现实的问题:偏好对齐不一定非要靠重新训练,推理时也能把回答重新排一遍
这事之所以重要,是因为传统对齐方法成本不低。无论是强化学习类方法,还是后续的偏好微调,都要数据、算力、流程一起上。对很多业务场景来说,最缺的不是“再训一个模型”的勇气,而是预算和时间。于是,测试时扩展(Test-Time Scaling, TTS)就成了一个很有吸引力的方向:不改权重,只在生成时多花一点计算,看看能不能把更好的回答挑出来。
但问题也随之来了。TTS 在数学、代码这类“有标准答案”的任务上很好使,因为对错容易判;可一旦换到偏好对齐,情况就变复杂了。回答不是“对/错”两格按钮,而是“更符合谁的口味、更符合什么场景、更像不像人话”的综合判断。REAR 的思路,就是把这团乱麻拆开:既然模型本来就同时学了“回答问题”和“响应偏好”两部分,那测试时就重新调一调它们的比例。
图1:REAR 的动机示例
图1:REAR 的动机示例。模型会同时看到问题和偏好信息,再对多个候选回答进行重打分,最后把原本“不合口味”的回答换成更符合偏好的那个。
先把几个缩写说清楚。RLHFReinforcement Learning from Human Feedback,中文是“基于人类反馈的强化学习”;TTSTest-Time Scaling,中文是“测试时扩展”。REAR 则是 REAlignment Reward,中文可理解为“重对齐奖励”。

分解潜在奖励:REAR 的核心原理

REAR 最巧的地方,不是它又发明了一个新奖励,而是它把“模型为什么会这么答”这件事拆成了两层:一层是问题相关奖励,另一层是偏好相关奖励。前者管回答有没有把问题讲明白,后者管有没有照顾用户写在前面的口味约束。
论文的出发点很朴素:预训练后的模型,通常已经学会了“默认怎么答”,也学会了“看到偏好提示后怎么调整”。只不过这两部分在训练时是绑在一起的,外部很难直接看见。REAR 的做法是借助最大熵强化学习的视角,把隐式奖励写成可计算的形式,再把偏好那部分的权重在测试时重新缩放。说白了,就是把模型脑子里的“默认分配比例”改成“这次任务需要的比例”。
图2:REAR 方法总览
图2:REAR 方法总览。核心流程可以概括成一句话:把基础模型的隐式奖励拆成两项,再用可调系数在测试时重标定偏好强度。
具体推导里,论文先把文本生成写成 token 级别的马尔可夫决策过程(MDP, Markov Decision Process,马尔可夫决策过程)。这样做不是为了装深奥,而是为了让文本生成能和强化学习那套数学语言对上。随后,论文从 RLHF 的目标函数出发,证明基础模型对应的策略其实隐含着一种“问题奖励 + 偏好奖励”的组合结构。这里的关键量是一个可调系数 λ:λ 越大,测试时越偏向偏好;λ 越小,越接近原始模型的默认输出
图7:不同 λ 下问题与偏好得分的变化
图7:不同 λ 下问题与偏好得分的变化。这个图很直白地告诉人们,偏好强度不是越大越好,太猛了会把回答本身的有用性挤掉,属于典型的“用力过猛反而翻车”。
更工程友好的一点在于,REAR 最终能写成 token 级 logprob 的线性组合。也就是说,它不需要额外训练一个奖励模型,也不需要在推理流程里再塞一个新网络。只要拿得到 base model 的概率输出,就能给候选回答打分。这个设计很像把“玄学偏好判断”变成了“可计算的排序规则”,对部署来说相当省心。

无需重新训练:将REAR无缝集成到测试时扩展

REAR 的第二个亮点,是它不是“单点打分器”,而是能直接嵌进测试时扩展流程。论文给了两种最实用的接法:best-of-N 采样DVTS 树搜索。前者很简单,先采样多个候选回答,再挑 REAR 分数最高的;后者更像边生成边筛选,在树搜索过程中让高分分支继续长大。
这意味着 REAR 不是只能在“最终答案”上发挥作用,它还能给中间生成片段打分。这个能力很关键,因为很多测试时搜索方法如果只能看完整回答,灵活性就会差一截。REAR 的分段可评分特性,让它天然适合更复杂的搜索策略,也更适合做推理侧插件。
图4:REAR 与外部奖励模型基线对比
图4:REAR 与外部奖励模型基线对比。REAR 不仅省掉了额外奖励模型,还经常能拿到更好的结果,这就很难不让人多看两眼。
论文还专门分析了时间开销。结论并不意外:best-of-N 需要多采样,DVTS 需要更多搜索步骤,所以计算成本会高于 greedy decoding,但比起再跑一个外部奖励模型,整体仍然更轻。换句话说,REAR 不是“零成本魔法”,而是“把钱花在更值的地方”。
图9:不同方法的端到端时延与吞吐量
图9:不同方法的端到端时延与吞吐量。这里能明显看出,REAR 相关方法会带来额外延迟,但仍比一些复杂的外部奖励方案更轻,属于“多花算力,少踩工程坑”的路线。

全面超越基线:在多个基准上的实验验证

实验部分回答的是最现实的问题:这套东西到底是“讲得通”,还是“真能赢”?论文选了三个偏好对齐基准和一个角色扮演基准,基座模型主要是 Qwen2.5-7B-Instruct。比较对象包括 greedy decoding、Amulet、Linear Alignment(LA)以及基于生成式奖励模型的 best-of-N。结果显示,REAR 指导的 best-of-N 和 DVTS 在大多数指标上都能压过这些基线。
表1:多个偏好对齐基准上的性能对比
表1:多个偏好对齐基准上的性能对比。整体看下来,REAR 不是只在某一个任务上“碰巧赢了”,而是在多项偏好对齐任务里都保持了比较稳定的优势。
更值得注意的是,REAR 对长上下文也比较稳。论文把对话中间插入更多轮次,让偏好信息和问题之间隔得更远,看看方法会不会“失忆”。结果表明,REAR 在长上下文下依然能保持领先,而一些基于外部奖励模型的方法则掉得比较明显。这个结论很实在,因为真实产品里的对话往往不会只有一句半句,模型最怕的就是前面说了半天,后面自己忘了。
表2:长上下文 PrefEval 表现
表2:长上下文 PrefEval 表现。随着上下文越来越长,REAR 仍然能维持相对优势,说明它对输入扰动的耐受性比不少基线更好。
论文还有一个很有意思的观察:基于生成式奖励模型的 best-of-N 提升有限,说明 base model 自己当裁判并不总是靠谱;而 REAR 直接利用生成概率结构,反而更稳定。这其实挺符合直觉——让模型“自我评审”容易偏科,让它按自己的概率结构重排,反而更像顺着天性做优化。
看到这里,方法的气质已经很明确了:不是靠花哨结构取胜,而是靠一个能解释、能接入、能扩展的打分规则把测试时选择做对。这个路线不惊天动地,但很像真正能落地的东西。

超越文本偏好:REAR 在数学与视觉任务中的泛化潜力

论文最加分的一点,是它没有把自己锁死在“聊天偏好”这个小盒子里。只要任务能被写成一个额外偏好约束,REAR 就能把它当成测试时重排序问题来处理。于是,数学题和视觉幻觉检测也被拉进了实验范围。
图3:数学任务与视觉幻觉示例
图3:数学任务与视觉幻觉示例。论文把“带偏好的重排序”思路迁移到了数学和多模态场景里,说明它不是只会在文本聊天里打转。
在数学任务上,REAR 和多数投票相比,整体表现更好。这个结果并不奇怪,因为数学题本身有唯一答案,测试时扩展最怕的就是“多数人都错得很一致”。REAR 的优势在于,它不是单纯看谁出现次数多,而是看哪个候选在模型自己的概率结构里更合理。换句话说,它不是盲从“票数”,而是更像在做“带偏好的概率裁判”。
表4:跨模型族泛化结果
表4:跨模型族泛化结果。REAR 在 Llama-3.1-8B-Instruct 上也能稳定发挥,说明这套分解逻辑不是 Qwen 家族专属的小把戏。
视觉任务上,论文使用了 MMHal-Bench 来看模型是否会“瞎编图像内容”。REAR 在这里的用法也很自然:把“事实
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。