← 返回 PaperDaily 大模型与智能体

GPT-4o当裁判,Qwen2.5答得更靠谱,背后其实是一张评分表

奖励信号怎么给,才能让大模型在开放域问答里真正学会“有理有据、条理清晰”?苹果这篇最新论文把笼统的偏好打分换成了多维评分细则,效果直接涨了6.5%。路子够巧,值得一读。

GPT-4o当裁判,Qwen2.5答得更靠谱,背后其实是一张评分表
原论文信息如下:
论文标题:
From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers
发表日期:
2026年08月
发表单位:
Apple
原文链接:
https://arxiv.org/pdf/2608.23812

引言

如果让龙哥用一个词形容大模型开放域问答的奖励设计,那必须是“纠结”。你看,数学题和代码有标准答案,验证器一跑,对错分明;可开放域问答呢?“什么是最好学的语言”“FastAPI和Django到底选哪个”——这种问题根本不存在唯一正确解。一个回答好不好,得看它是否准确、是否完整、是否结构清晰、是否安全、是否忠实于检索到的资料……这么多维度揉成一个标量分数,模型训练时很容易顾此失彼,甚至钻空子,搞出“又长又空”的废话答案来刷分。
苹果这次放出的新论文,思路非常清晰:与其让模型瞎猜偏好,不如直接把“好答案应该满足哪些原则”写成一份可判定的评分细则,也就是Rubric。而且这份细则不是随便写的——它会根据用户查询、检索到的证据段落和参考回答,动态生成一套“专属试卷”,再拆成准确度、构成、安全、通用四个维度,让奖励信号既有依据、又能分项控制。
结果也相当能打:在多轮检索增强生成(RAG)场景下,这套多维规则化奖励比指令微调基线平均涨了6.5%,比扁平规则变体涨了4%。其中,检索条件化让忠实度明显提升,多维分解则让回答的组织性和指令遵循能力上了一层楼。

方法概述

整个框架分两大部分:离线规则生成,以及在线强化学习训练。
离线阶段,系统拿到用户查询、检索到的若干段落和一个由GPT-4o生成的参考回答,交给规则生成器,产出一组查询专属的评分细则。这些细则按准确度、构成、安全、通用四个桶组织,每个细则条目还有类别(Essential还是Optional)和1到5的权重。
在线阶段,策略模型根据查询和检索段落采样多个候选回答,一个外部的LLM裁判按规则逐项给出“满足/不满足”的二值判断,再聚合成标量奖励,用GRPO更新策略。这里有个很讲究的设计

从偏好到原则:规则化对齐如何重塑开放域问答

强化学习之所以能在代码和数学领域混得风生水起,核心就一句话:标准答案摆在那里,验证成本极低,模型练完就知道对错。可一旦把场景换成开放域问答,事情立刻变得棘手。一个问题通常不存在唯一正确解,好答案的标准是多维的——既要回答准确,又不能漏掉关键点;既要结构清爽易读,还得每一步都有证据支撑,最好还能避开潜在的安全风险。
如果所有这些维度最后都被揉成一个标量奖励,模型很容易被抓瞎:最典型的就是开始堆字数。反正回答越长越可能涵盖更多要点,哪怕里面掺杂一堆废话,整体打分往往也不会太难看。论文里还给这些现象起了名:reward hacking(奖励作弊)、verbosity inflation(冗长膨胀)、以及向表面模式优化而忽视真实质量的倾向。这些问题的根源是一致的——奖励信号太模糊,模型的“小聪明”就有机可乘。
苹果这篇工作的核心主张其实很朴素:既然“好答案”是多个原则的集合,那就别用模糊的整体偏好打分,直接把这些原则写成显式的、可逐项判定的评分细则(Rubric)。这些规则还不能是一刀切的通用模板,而是要针对每个查询动态生成,并且要结合检索到的证据段落——也就是论文反复强调的“检索条件化”和“多维分解”。
整个流程如图 1 所示,分为两个阶段:离线阶段用查询、检索段落和参考回答生成一套查询专属的评分细则;在线阶段再让外部裁判模型(论文里是 GPT-4o)按这套细则对候选回答逐项打分,并聚合成一个奖励信号来更新策略模型。
图1:论文提出的评分细则生成与训练流程概览
图 1:所提出的评分细则生成与训练流程概览。左侧为离线规则生成,右侧为在线强化学习训练。
这套思路的落点,是把“奖励”从黑盒打分变成一套透明的“答题评分表”。每个评分表都针对当前问题量身定制,理论上比任何固定的通用指标都要更贴合用户的真实需求。

检索条件化规则:让奖励信号扎根于证据

所谓检索条件化,说白了就是:奖励规则不该脱离证据凭空产生。每个查询都会配上检索到的若干段落,规则生成器要读着这些段落才能写出有事实锚点的评分条目。
具体来说,规则生成阶段有三个输入:用户查询 q、检索段落集合 D、以及一个参考回答 ŷ。参考回答在这里不是 ground truth,它的定位是“优秀范例”——帮系统理解用户对好答案的预期,以及哪些方面是作答的关键。论文明确说了:参考回答只是指南,不会被当成标准答案拿来硬套。
生成的每条规则都要求满足几个特性:查询特指、原子化、可测试、基于证据、有判别力。什么叫原子化?就是一条规则只负责一个可判定的点,比如“回答是否准确说明了两种方案在碳排放上的百分比差异”。一条规则塞进太多要求,裁判模型就不容易给出一致的二值判断。
在结构上,规则被拆进四个固定桶(bucket):accuracy(准确度)负责回答是否在回应问题、是否包含构成完整答案的必要信息;composition(构成)负责回答的结构、清晰度与呈现方式;safety(安全)负责内容是否有害或误导;general(通用)则兜底事实一致性、证据支撑以及其他未归类的质量属性。
每条规则还挂着类别(Essential 或 Optional)和 1 到 5 的权重。Essential 规则一旦不满足,整个回答基本可以被判“不及格”;Optional 规则则是评判“中规中矩”和“出彩”的加分项。
这个设计直接带来的效果是:只要规则生成时参考了检索证据,训练时模型就会收到“每个事实陈述必须有依据”的反馈,Grounding(事实支撑)指标自然就涨上去了。论文的定量结果也支持这一判断——所有带检索条件化的配置在三个数据集上的 Grounding 分数都全面领先于不带检索条件的配置。

多维分解:细粒度监督的威力

只有检索条件化还不够。如果所有规则条目都堆在一个大桶里,最终还是一个分数,模型还是分不清自己到底是“内容不全”还是“结构太乱”。
于是论文引入多维分解:先把规则按桶分组,再对每个桶单独算分,最后加权合并成标量奖励。设桶集合为 B = {accuracy, composition, safety, general},每个桶 b 有规则集合 R_b,每条规则 r 的权重为 w_r。裁判会对每条规则输出一个二值判断 I_r(y)(满足为 1,不满足为 0),于是桶 b 的得分可以写成:
公式1:桶级评分公式
公式 1:桶 b 的评分等于该桶内所有满足条目的加权和。
接着,用桶系数 α_b 表示各桶的相对重要性,把桶级分数线性组合起来:
公式2:桶聚合公式
公式 2:各桶加权求和得到中间分数,α_b 反映桶 b 在整体奖励中的相对重要性。
由于不同查询的规则条数和权重各不相同,还需要按理论上限做归一化,让奖励落在 0 到 1 之间:
公式3:归一化奖励公式
公式 3:最终奖励 R(y) 为归一化到 [0,1] 的加权满足率,其中分母表示该查询下理论可获得的最高加权分数。
这套公式真正有价值的地方在于可操控性:想重点优化哪方面,直接调 α_b 就行,不需要改奖励架构。论文的实验中,composition 系数设成 0.50,accuracy 是 0.30,safety 和 general 各 0.10——也就是说,实验视角里“结构清晰”和“答得准”是训练的重头戏。
从结果看,多维分解带来的优势非常明显。相比把规则塞进单一 general 桶的做法,多维版本在 Composition 和 Instruction-Following(指令遵循)两项指标上提升最大。这其实不难理解:分散的奖励信号就像给模型提供了多个“分科目教师”,每个教师各管一项,比一个老师全科监考能给出更有针对性的反馈。

实验验证:全面超越基线的关键设计

实验设计上,论文用 Qwen2.5-14B-Instruct 作为基础模型,训练算法是 Group Relative Policy Optimization(GRPO,组相对策略优化),每组样本采样 4 个候选回答,训练 1 个 epoch,使用 8 张 NVIDIA B200 GPU,单次实验耗时约 24 GPU 小时。为了公平起见,所有超参数跨实验固定不变,改的只有规则设计本身。
训练数据是 4.7k 条合成查询,覆盖多角度推理、对比分析、歧义处理、权衡分析、决策判断以及时间地点相关需求。每一条都用 Brave Search API 检索 top-10 段落,再由 GPT-4o 基于这些段落生成参考回答。
评估用三个公开基准,各管一个侧面:Search Arena 是真实用户查询,多角度综合难度高;RAGBench 由 MS MARCO、HotpotQA、HAGRID 和 ExpertQA 的测试子集拼成,测跨基准泛化;FACTS Grounding 要求模型基于长文档合成信息,对证据支撑的要求极高。
评估指标有三项,分别对着质量的不同侧面:Composition(构成质量)、Grounding(事实支撑)和 Instruction-Following(指令遵循)。为了跟训练裁判模型隔离,评估阶段用的是 Gemini-2.5-Pro,防止同一模型家族既当选手又当裁判带来的偏差。
表1:三个评估数据集上的主要实验结果
表 1:三个评估数据集上的主要结果。Comp. 指构成质量(Composition),按 1–5 分报告;IF 指指令遵循(Instruction-Following)。Grounding 和 IF 均以百分比报告。关键结论:使用有根据且结构化分解的规则训练出的模型取得了最佳整体表现。
表 1 的信息量不小。首先,所有规则训练变体都稳压指令微调基线一大截。其次,检索条件化普遍提升了 Grounding;最终的多维有根据版在 Search Arena 上把 Composition 从 3.65 拉到了 4.15,IF 从 73.8% 拉到 82.3%,涨幅相当可观。RAGBench 因为基线本身已经很高,绝对涨幅没那么夸张,但多维有根据版依然在几乎所有指标上拔得头筹。
论文还专门对比了 Essential 和 Essential + Optional 两组规则设计,见表 2。
表2:Essential与Essential+Optional消融
表 2:Essential 与 Essential + Optional 两组规则设计的消融对比。可看到加入 Optional 后各数据集指标全面上行。
加入 Optional 规则之后,三个数据集上的所有指标都在涨。这说明模型不能只学“最低要求”,还得被逐条教着“怎么把回答写得再精细一点”。直观来看,Essential 规则负责兜底,Optional 规则负责拉高上限,两者一配合,模型对答案质量的建模就立体多了。
论文在附录中还给出了不少生成案例作对比。比如“素食和纯素饮食在健康和环境影响上怎么比”这类问题,多维有根据的模型回答不仅引用了证据,还会把对比数据整理清楚;而基础模型往往只能给出一个笼统的倾向性意见。另一个典型案例是“我现在该买电动车还是再等几年”,有根据多维模型会结合检索到的政策、电池成本等段落做分点论证,而不是泛泛而谈。这些定性观察与定量结果相互印证,增强了结论的可信度。
定性示例:素食与纯素饮食对比
图 2:定性生成示例——查询“素食饮食与纯素饮食在健康和环境影响方面相比如何?”所展示的模型回答对比。
定性示例:电动车购买时机
图 3:定性生成示例——查询“我现在应该买电动汽车还是再等几年?”所展示的模型回答对比。

规则质量分析:可判别性与对齐度的双重提升

端到端的训练结果固然重要,但它毕竟把“规则设计好不好”和“强化学习跑得好不好”混在了一起。为了把这两件事拆开,作者在 OpenGenAlign 数据集的 QA 子集上做了一个独立的规则质量实验:用不同配置生成的规则去给候选回答对打分,再看打分结果与 LLM 偏好标签的对齐程度。
评价指标有三个:Ties(平局率,越低越好,说明规则能分辨好坏)、Agreement(一致率,越高越好)和 Egregious Errors(严重反向选择率,越低越好)。
表3:OpenGenAlign上的规则偏好对齐结果
表 3:OpenGenAlign 上的偏好对齐结果。Agreement 越高越好,Ties 与 Egregious Errors 越低越好。
数据读起来很有信息量。Checklist-Style 规则的一致率只有 43.4%,平局率高达 34%,这说明不基于证据、不分解的规则基本上是在“凭感觉打分”。加入检索条件化后,一致率猛跳到 54.0%,严重反向错误率从 22.6% 降到 18.2%。再加多维分解后,平局率从 27.8% 进一步降到 23.8%,说明分解后的规则能更敏锐地挑出好坏答案。
这里有个细节值得注意:GRPO 这类算法在候选分数相同时是没有梯度信号的,平局率越低,意味着每轮训练的有效更新越多。也就是说,规则可判别性的提升不仅在“标准答案”意义上更合理,还会直接影响强化学习的优化效率。这也从侧面解释了为什么多维有根据版本在端到端训练中表现最猛。

局限与展望:规则化奖励设计的边界

泼冷水时间。这套方法目前只在开放域问答上完成了验证,多语言、多轮对话、摘要生成等任务的效果都还“悬而未决”。论文自己也承认,答案质量本质上带有主观性,rubric 再好,也得靠外部 LLM 裁判来执行,裁判本身的偏差会不会在训练中被放大,这个问题还远没有回答完。
第一个现实问题是裁判依赖。训练期间每一条规则都需要外部 LLM(论文里是 GPT-4o)逐项打分,裁判的噪声和偏差会直接进入奖励信号。虽然最终效果不错,但裁判模型的稳定性并没有被系统研究过——换一个裁判、换一套 prompt 风格,结果会不会变,都是未知数。
第二个问题是合成数据分布。4.7k 条查询虽然是精心设计的,但它与真实用户查询分布之间是否存在系统性偏差,论文里没有展开讨论。合成数据覆盖了“歧义、多意图、时间地点相关”这些现象,但真实世界的信息需求显然更混沌。
第三个问题是成本。按论文里的配置,单次训练约 24 GPU 小时,多次实验总共约 240 GPU 小时,这在学术实验室里算“可以接受”;但训练过程中大量调用 GPT-4o 做裁判,API 开销和排队时间都不能当空气。真要产品化,得先想想怎么把裁判步骤做轻。
go I am not angry
不过换个角度看,这也许正是这篇论文最大的贡献:它把“奖励设计”从一个玄学问题变成了一个可分析、可消融、可迭代的工程问题。后续完全可以在更轻量、更稳定的方向上探索规则化奖励,比如用更小的裁判模型、自蒸馏的规则生成器,或者把规则本身变成可学习的对象。对于 RAG 类产品的团队来说,这套“先写评分表、再按表训练”的思路,很可能会成为对齐模块的下一站必经之路。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?苹果提出基于规则的奖励框架:依据检索证据生成查询专属、多维度的评分细则,为开放域问答提供细粒度监督。在构成、忠实度、指令遵循三个评估轴上,较指令微调基线平均提升6.5%,较扁平规则变体提升4%。
这篇工作最值得看的点是什么?所提出的Multi-Dimensional Grounded rubrics方法在所有三个数据集和三个评估轴上均取得最佳性能,相比指令微调基线平均提升6.5%,相比扁平规则变体平均提升4%。
这篇工作的边界或风险在哪里?优点:1)提出检索条件化的多维规则生成框架,为开放域问答提供细粒度、可解释的奖励信号;2)通过消融实验清晰展示了检索条件和多维分解各自的贡献;3)发布了规则生成和评估提示以及训练查询集,支持可复现性。缺点:1)仅在开放域问答任务上验证,泛化性有限;2)依赖LLM生成规则和评估,可能引入模型偏见;3)每个查询仅使用单一参考答案,可能引入风格或内容偏差;4)计算资源限制导致单次运行结果,缺乏多次运行的方差分析。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种基于多维规则(rubric)的奖励框架,通过检索条件化的规则生成和结构化分解,为开放域问答提供细粒度的强化学习监督信号。

实验合理度:★★★★☆

Composition(1-5分制)、Grounding(句子级支持率百分比)、Instruction-Following(无MajorIssue百分比)。

学术研究价值:★★★★☆

提出一种基于多维规则(rubric)的奖励框架,通过检索条件化的规则生成和结构化分解,为开放域问答提供细粒度的强化学习监督信号;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

每个训练运行约需24 GPU小时,所有实验总计约240 GPU小时,使用8块NVIDIA B200 GPU。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)仅在开放域问答任务上验证,泛化性有限;2)依赖LLM生成规则和评估,可能引入模型偏见;3)每个查询仅使用单一参考答案,可能引入风格或内容偏差;

主要参考文献

[1] Saini A, Kumar P, Peng E, et al. From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers. arXiv:2608.23812, 2026.
[2] Gunjal A, et al. Rubrics as Rewards. 2025.
[3] Viswanathan V, et al. RLCF: Checklist-Based Feedback for Reinforcement Learning from AI Feedback. 2025.
[4] Zhang et al. Rubric-Based Rewards Mitigate Reward Overoptimization. 2026.
[5] Shao Z, et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (GRPO). 2024.
[6] Lewis P, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS, 2020.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
奖励信号怎么设计?与其让模型猜偏好,不如直接告诉它原则!🍎 苹果这篇论文说:评分细则比笼统打分更管用。加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。群内已有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个方向等你来聊!
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。