← 返回 PaperDaily
大模型与智能体
2026新作REAR:奖励分解后,偏好对齐更稳了
这篇论文最有意思的地方,是它没有继续给模型“加班训练”,而是把问题搬到了测试时:先拆奖励,再重排输出。对偏好对齐、推理加速、树搜索都很友好,属于那种工程味很浓、落地门槛也不高的工作。
龙哥读论文
发布于 2026-08-16 00:20:04
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最有意思的地方,是它没有继续给模型“加班训练”,而是把问题搬到了测试时:先拆奖励,再重排输出。对偏好对齐、推理加速、树搜索都很友好,属于那种工程味很浓、落地门槛也不高的工作。
原论文信息如下:
为何要做测试时偏好重对齐?
大模型现在最尴尬的地方,不是“不会答”,而是“答得挺像样,但不合口味”。同一个问题,有人要简洁,有人要详细;有人喜欢严谨,有人喜欢活泼;还有人会加一句“别用游戏化比喻”。模型如果只顾把题答对,却没把偏好照顾好,最后就会出现一种很熟悉的场面:内容没错,体验很差。
这篇论文盯上的就是这个痛点。它不再把“偏好对齐”理解成训练阶段的专属任务,而是把问题搬到测试时 :既然模型已经会生成,那能不能在生成时多花一点算力,重新挑出更符合偏好的答案?这就是所谓的 测试时偏好重对齐 。
这事的妙处在于,它没有要求模型重新训练,也没逼人重新做一套偏好数据集,更没有让工程团队再加一层复杂的奖励模型服务。论文的核心思路很直接:模型本来就隐含着“问题相关奖励”和“偏好相关奖励”,只要把这两个部分拆开,再在测试时重新调比例,就能实现更灵活的对齐。这个方法被命名为 REAR ,全称是 REAlignment Reward ,中文可以理解为“重对齐奖励”。
核心方法论:将奖励分解为“问题相关”与“偏好相关”
先把话说人话:模型回答一条问题时,脑子里其实同时在干两件事。第一件事是“这题该怎么答”,第二件事是“按用户要求答成什么样”。前者是任务本身,后者是偏好约束。以前很多方法默认这两件事绑在一起处理;REAR 的态度则更像“先拆开,再调参”。
论文先回到一个标准的强化学习视角,把文本生成看成 token 级别的马尔可夫决策过程。这里的 MDP 是 Markov Decision Process ,中文叫“马尔可夫决策过程”;RLHF 是 Reinforcement Learning from Human Feedback ,中文是“基于人类反馈的强化学习”。这两个缩写不是为了装专业,而是为了说明:大模型对齐,本质上是在优化一个奖励目标。
接着论文把这个目标改写成最大熵强化学习形式。最大熵的直觉也不复杂:除了追求高奖励,还保留一定随机性,避免模型一条路走到黑。这样做的好处是,后面可以把“奖励”和“策略概率”建立起明确关系,方便在测试时反推一个可计算的打分函数。
有了这个框架,论文开始做关键的一刀:把奖励拆成两部分。第一部分是 问题相关奖励 ,只负责回答“题目本身”;第二部分是 偏好相关奖励 ,负责回答“按用户口味怎么答”。如果把用户偏好写成额外文本 xp ,那么原始训练时的 composite reward 可以写成:
于是,REAR 不是去重新发明奖励,而是把原来的偏好项按测试时需求重新缩放,写成:
计算精确:如何用模型概率高效算出 REAR 评分
真正让这个方法能落地的,不是“奖励分解”四个字,而是它最后能变成一个可计算的打分函数 。否则理论再漂亮,到了推理阶段还是只能看天吃饭。
论文利用最大熵强化学习中的性质,把奖励写成 token 级别的策略对数概率组合。换成大白话,就是:不用额外训练一个奖励模型,也不用单独搞一个“偏好判官”,直接拿基础模型自己的概率就能算分。这个设计很工程化,优点是计算便宜,接入也简单。
最后真正用于排序候选答案的,是一个更简洁的序列级分数:
这一步的价值很实在。因为很多测试时方法的问题,不是效果差,而是算力一上来就炸。REAR 的做法相当于把“评价”这件事压缩成了概率运算,既可以配合 Best-of-N ,也可以塞进树搜索。论文用到的 DVTS 是 Diverse Verifier Tree Search ,中文可理解为“多样性验证树搜索”。
换句话说,REAR 的厉害不在于“又造了一个更玄学的分数”,而在于它把偏好对齐变成了一个可复用、可扩展、可插拔 的推理模块。对于工程团队来说,这种东西通常比“再训一个大模型”更有吸引力。
效果拔群:REAR 在多项基准测试中全面领先
论文的实验设计很清楚:先看偏好对齐任务,再看长上下文鲁棒性,最后看能不能跨任务泛化。这个顺序是合理的,因为如果一个方法连偏好对齐都做不好,后面的泛化就多半是“碰巧蒙对”。
更值得注意的是,GenRM 这种“用模型自己当裁判”的思路,增益并不稳定。原因也不难猜:如果基础模型本身对偏好理解不够准,让它再给自己打分,多少有点“自己给自己判卷子”的味道。REAR 的优势则在于,它不是再造一个外部判官,而是直接利用模型隐含的概率结构,减少了额外的误差来源。
在长上下文场景里,REAR 的表现也更稳。这个结果很有意思,因为长上下文通常是测试时方法的“照妖镜”:输入一变长,很多额外模块就开始掉链子,尤其是需要单独跑判别器或额外奖励模型的方案。REAR 因为只依赖基础模型 logprob,所以在这种分布变化下更抗折腾。论文还提到,Amulet 和 LA 在长上下文上甚至会遇到显存问题,这就很现实了——算法再优雅,显存一爆,优雅就只剩下表情包。
看到这里,基本可以确认这不是“只在小数据上抖机灵”的方法,而是能在真实推理流程里站得住脚的方案。尤其是它在不同基准上的提升并不只靠某一个任务吃红利,而是呈现出比较一致的趋势,这一点比单点爆表更值得重视。
泛化能力:REAR 不只是用于偏好对齐,还可用于数学和视觉任务
这部分最容易让人误会:REAR 既然是偏好对齐方法,是不是只能用在聊天场景?论文给出的答案是:不止 。只要任务能被写成一个额外的偏好或约束文本,REAR 就能拿来做测试时重排序。
先看数学题。数学任务本身有一个天然好处:答案对不对比较容易验证。论文在 MATH500、AIME24、AIME25 和 AMC23 上,把 REAR 和多数投票做比较。结果显示,REAR 选出来的答案整体更强。这里的逻辑也很顺:多数投票只看“哪个答案出现次数最多”,而 REAR 还会考虑“哪个答案更符合任务偏好”。当偏好写得足够贴任务时,它就不只是票数统计,而是带了方向感的筛选。
再看视觉任务。论文在 MMHal-Bench 上引入文本偏好信息,评估幻觉和回答质量。这里的 hallucination 可以理解成“模型一本正经地胡说八道”。结果显示,REAR 不仅分数更高,幻觉率也更低。这个结果挺关键,因为它说明 REAR 不只是会“挑更顺眼的答案”,还真能帮模型少说离谱话。
论文还做了跨模型家族实验,把方法放到 Llama-3.1-8B-Instruct 上测试。结果依然成立,说明 REAR 不是“Qwen 专属外挂”,而是更通用的奖励分解思路。这一点很重要,因为很多方法一换底座就哑火,最后只能停留在某个模型家族的 demo 里;REAR 至少在论文给出的实验里没有这个毛病。
总结与展望
REAR 这篇工作的价值,不在于它把偏好对齐“做得更玄”,而在于它把一件原本需要再训练、再标注、再部署的事,改写成了测试时就能完成的概率重排序。这个转变很实用:省训练成本,省数据成本,也省工程迭代成本。
当然,它也不是万能钥匙。REAR 的前提是:偏好文本要写得足够清楚,且和任务确实有关;如果偏好本身很模糊,或者和任务目标冲突太大,重对齐也救不了。再往工程上看,虽然它比额外训练轻,但在大样本采样或树搜索下,推理成本还是会上升,只是这个成本比重新训练通常更可控。
如果把这篇论文放到更大的趋势里看,它其实是在提醒一个很现实的方向:未来很多对齐问题,未必都要靠“更大模型 + 更多训练”解决,测试时计算也许会越来越像一个独立杠杆。谁能把这个杠杆用得更省、更稳、更可解释,谁就更接近真正可落地的对齐方案。
龙迷三问
这篇论文到底解决什么问题? 解决的是“模型会答,但不一定答得符合当前用户偏好”的问题。它把偏好对齐从训练阶段挪到测试阶段,用 REAR 在生成时重新挑选更合适的回答。
REAR 和普通打分有什么区别? 普通打分往往只看一个整体分数,或者依赖额外奖励模型;REAR 则把奖励拆成“问题相关”和“偏好相关”两部分,并直接用基础模型的概率来算,既轻量又更容易接入现有推理框架。
它为什么还能用于数学和视觉任务? 因为它本质上是“带条件约束的测试时重排序”。只要任务能写成一个额外偏好或约束文本,REAR 就能用同样的概率打分逻辑去选候选答案,所以数学题和多模态幻觉任务也能受益。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把偏好对齐从训练搬到测试时,再用奖励分解做成可计算的重排序,这个思路不算花哨,但很实用,也确实有新意。
实验合理度: ★★★★☆。对比了偏好对齐、长上下文、数学、视觉和跨模型家族,覆盖面比较完整;不过仍然主要依赖基准集,真实用户场景还需要更多验证。
学术研究价值: ★★★★☆。它给“测试时对齐”提供了一个清晰的理论桥梁,尤其把隐含奖励和策略概率连起来,后续很容易被别的工作接着用。
稳定性: ★★★★☆。不需要额外训练,稳定性比很多带额外判别器的方法更好;但它仍然依赖采样和偏好文本质量,偏好写歪了,效果也会歪。
适应性以及泛化能力: ★★★★☆。从纯偏好到数学、视觉都能跑,说明思路不窄;但前提是任务能被表达成可操作的偏好约束。
硬件需求及成本: ★★★★☆。比重新训练省得多,但 BoN 和树搜索都要额外推理预算,属于“花算力买对齐”,不是零成本白嫖。
复现难度: ★★★☆☆。方法本身不复杂,但要复现出论文里的效果,还是得处理好采样策略、偏好文本和搜索预算。
产品化成熟度: ★★★☆☆。在有清晰偏好模板、可接受额外推理成本的场景里可用;如果要求超低延迟或偏好极不稳定,落地会受限。
可能的问题: 偏好文本质量决定上限,且采样/搜索带来额外推理开销;对模糊偏好和强冲突偏好,效果未必稳定。
主要参考文献
Zhang, F., Wang, P., Li, C., Li, Y.-C., Chen, Y., Feng, L., Xu, C., Tomizuka, M., & An, B. REAR: Test-time Preference Realignment through Reward Decomposition. arXiv, 2026.
Ouyang, L. et al. Training language models to follow instructions with human feedback. 2022.
Haarnoja, T. et al. Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor. 2018.
Ng, A. Y., Harada, D., & Russell, S. J. Policy invariance under reward transformations: Theory and application to reward shaping. 1999.
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称 ,方便更快通过。一起聊大模型对齐、推理、奖励建模,少走弯路,多看干货。