← 返回 PaperDaily 大模型与智能体

Qwen3最新研究:高分rollout也会带偏训练?

在线强化学习最怕什么?不是不会学,而是学着学着突然跑偏。GEOALIGN抓住“高分但方向不对”的rollout,直接在潜空间里做体检,数学推理和对齐任务都更稳了。

Qwen3最新研究:高分rollout也会带偏训练?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
在线强化学习最怕什么?不是不会学,而是学着学着突然跑偏。GEOALIGN抓住“高分但方向不对”的rollout,直接在潜空间里做体检,数学推理和对齐任务都更稳了。


原论文信息如下:
论文标题:
GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning
发表日期:
2026年06月
发表单位:
中山大学,阿里巴巴集团
原文链接:
https://arxiv.org/pdf/2606.26917v1.pdf
开源代码链接:
https://github.com/SYSUzhouting/Trinity-RFT
项目链接:
https://github.com/SYSUzhouting/Trinity-RFT

RL训练像开盲盒?GEOALIGN教你“管住”不听话的rollout

在线强化学习做大模型对齐,表面上看是“谁分高谁上”,实际上经常像开盲盒:这一轮还挺稳,下一轮突然就开始抽风。更扎心的是,抽风的未必是低分样本,反而可能是那些看起来分高、方向却很歪的rollout。GEOALIGN盯上的,正是这种“高分叛逆分子”。
Figure 2. GEOALIGN overview.
图2:GEOALIGN整体流程。先在同一prompt内部构造偏好对,再把“从低分到高分”的位移方向投到一个更干净的表示空间里,接着找出和批次共识方向差得最离谱的rollout,最后用同prompt里更稳的样本替换它们,避免它们把训练带偏。
如果把传统在线RL想成“给模型打分再更新”,那这篇论文的思路更像“先做体检,再决定谁能上手术台”。它不去死磕奖励值本身,而是追问:这些高分样本,到底是不是在朝同一个正确方向前进。这个问题一旦成立,很多训练不稳定的谜团就能解释通了。

方向不一致:RL训练不稳定的“隐形杀手”

先把背景捋顺。在线强化学习里,模型会针对同一个prompt生成一批回答,每个回答都拿到一个奖励分数。很多方法默认:分高就好,分低就差,照着分数更新总没错吧?但问题在于,奖励是标量,更新却是方向。标量只告诉你“多大力”,却没告诉你“往哪儿推”。
论文把这个隐形坑命名为 directional inconsistency,中文可以理解为“方向不一致”或“方向冲突”。意思很直白:在同一批rollout里,大多数样本指向一个共同的改进方向,但少数高分样本却在表示空间里朝着完全不同的角度猛冲。分数看着挺体面,方向却像在和团队唱反调,结果就是更新方差变大,训练曲线开始抖成电风扇。
Figure 1. Geometric turbulence in preference latent space.
图1:偏好潜空间中的几何“湍流”。一次更新里,大多数偏好方向彼此对齐,但少数角度离群点会把训练节奏搅乱,最后让模型的学习过程变得不稳定。
这件事为什么危险?因为在线RL的更新是批量聚合的。只要少数“方向叛徒”在高奖励的伪装下混进来,它们就可能和大多数样本的梯度方向相互打架,导致一会儿往东一会儿往西。论文的观察很关键:真正麻烦的不是低分样本,而是高分但不可靠的样本。这就像班里成绩不错的同学突然开始带节奏,老师最头疼的往往不是学渣,而是“学霸型捣乱分子”。
为了把这个现象说清楚,论文引入了几个基础概念。rollout就是模型对同一prompt采样出来的一条回答;hidden state可以理解为模型在生成过程中“脑子里”的中间表征;within-prompt preference pair则是同一prompt下,拿高分回答和低分回答配对比较。这样一来,研究者不用盯着复杂的整套梯度,先看“高低分回答之间的方向差异”,就能抓到不少训练不稳的线索。
公式:优势函数由相对奖励决定
这里的核心直觉是:优势值并不是绝对高分,而是“比同组平均高多少”。公式里的 r(y) 表示某条回答的奖励,E[r(y′)] 表示同prompt下其他回答的平均奖励。也就是说,模型不是单独看“你考了几分”,而是看“你在班里排第几”。
公式:潜空间位移向量
这条公式更像“方向证据”。h(yw) - h(yl) 表示高分回答和低分回答在隐藏表示上的差异,论文把它当作“从差到好”的方向箭头。只要这个箭头在一批样本里大体一致,训练就相对稳;如果箭头乱飘,训练就容易翻车。

GEOALIGN:实时揪出“叛逆”的rollout

GEOALIGN的思路不是把所有样本一刀切地删掉,而是做精确打击:只处理最严重的方向离群点,尽量保住批次规模和训练密度。这个设计很聪明,因为在线RL最怕“为了稳而把数据删没了”,最后稳定是稳定了,模型也学不动了。
公式:同prompt偏好对构造
论文先在同一prompt内部构造偏好对。Pi 表示第 i 个prompt下所有“高分比低分高”的配对集合。这样做的好处是:同一prompt的回答共享输入条件,比较起来更公平,也更容易从中抽出“改进方向”而不是“题目差异”。
接着,GEOALIGN会训练一个轻量投影器,把这些位移方向从原始隐藏空间里“提纯”出来。原始表示里混着词汇、风格、长度等各种噪声,直接拿来算角度,往往像在菜市场里听交响乐——热闹是热闹,主旋律不一定清楚。投影器的作用,就是把“杂音”尽量压下去,让真正的奖励方向更集中。
公式:共识原型
投影之后,论文会构造一个batch-wise consensus prototype,也就是“这一批样本总体想往哪儿走”的共识方向。公式里按奖励差做加权,意思是:分差越大,说明这个偏好对提供的方向信号越强,就该在共识里多说几句。
公式:方向偏离度
随后每个样本都会得到一个方向偏离分数。这里的 cos 其实就是余弦相似度,越接近1说明方向越一致,越接近0或负数说明越像“南辕北辙”。GEOALIGN用 1 - cos 来表示偏离程度,数值越大,越像那个不合群的家伙。
公式:GDI定义
把一个rollout在所有相关偏好对上的偏离度累加起来,就得到 GDI,即 Geometric Deviation Index,中文可译为“几何偏离指数”。这个分数不是看单次失误,而是看它是不是在多次比较里都持续“跑偏”。持续跑偏的,才是真正值得处理的异常点。
为了把异常点挑出来,论文还用了核密度估计(KDE,Kernel Density Estimation,核密度估计,来源于统计学习常用方法)去看GDI的分布。简单说,就是看哪些样本挤在“高偏离尾部”,而且局部密度明显低。这样筛出来的,不是普通波动,而是那种“离群得很有个性”的样本。
Figure 3. Anomaly score–rank distribution.
图3:异常分数与排序的分布。几何不一致性呈现明显长尾,说明真正需要干预的rollout只占一小部分,没必要把整批数据都“按最严标准处理”。
找到异常后,GEOALIGN不是粗暴删除,而是在同一个prompt里找一个更稳的替代回答,把异常rollout在经验缓冲区里“换掉”或者等价地把它的贡献压到很低。这个做法很像班主任处理课堂纪律:不是把全班都罚站,而是把最爱起哄的几个先请出去冷静一下。这样既保住了每个prompt的rollout数量,也避免了有效批次被削薄。
认真模式上线。这个方法最讨喜的地方,是它只在前向传播上做文章,不需要额外的反向传播开销。对于在线RL这种本来就很烧算力的场景,这点很重要:你可以多做一点“判断”,但别把训练成本炸穿。

实验见真章:数学与对话对齐任务双丰收

这篇论文的实验设计很对路:既看数学推理这种离散、可验证的任务,也看对话对齐这种连续奖励任务。一个看“答得对不对”,一个看“说得合不合适”,两类任务都能提升,说明GEOALIGN不是只会在某一种奖励设置里耍小聪明。
Figure 4. Training dynamics on evaluation benchmarks.
图4:评测曲线的训练动态。GEOALIGN在数学任务和HH-RLHF任务上都表现出更平滑的学习过程,最终分数也更高,说明它不仅能涨分,还能让训练少折腾。
在数学任务上,GEOALIGN基于Qwen3-1.7B和Qwen3-4B都拿到了最佳平均分。别看提升幅度不是那种“原地起飞”的夸张级别,但在强基线已经很能打的情况下,继续稳定往上抬,意义不小。尤其是训练曲线更平,说明它不是靠偶尔爆一下,而是靠持续减少方向冲突来积累收益。
Table 1. Comparison of different baselines on Math.
表1:数学任务上的主结果对比。GEOALIGN在Qwen3-1.7B和Qwen3-4B上都排在最前面,说明它对可验证奖励下的在线RL确实有帮助,不只是“图看起来很美”。
在HH-RLHF任务上,GEOALIGN同样保持领先。这里更有意思的是,连续奖励场景本来就更容易受噪声影响,因为奖励模型并不总是百分百可靠。GEOALIGN能在这种场景里继续稳住,说明它抓住的不是“奖励值本身”,而是更底层的几何一致性信号。这就像判断一个人靠不靠谱,不只看他说了什么,还看他说话前后是不是自相矛盾。
Table 2. Comparison of different baselines on HH-RLHF.
表2:HH-RLHF上的结果。GEOALIGN在两种模型规模上都拿到最高平均分,说明这个“方向体检”机制对对话对齐也成立。
更能说明问题的是鲁棒性实验。论文故意往奖励里掺噪声,模拟“奖励模型说胡话”或者“验证奖励被污染”的情况。结果很直观:只要奖励一被污染,很多方法都开始掉链子,而GEOALIGN仍然能保持更高水平。这个现象和它的设计高度一致,因为它不是盯着单个奖励点,而是看整批样本的方向共识。噪声可以骗过分数,但不太容易骗过一群样本的几何结构。
Figure 5. Injected reward errors concentrate among high-GDI rollouts.
图5:被注入错误的奖励,往往集中在高GDI样本里。黑色叉号就是被污染的rollout,蓝线是GDI排序。这个图几乎把论文的主张写在脸上了:高GDI确实更像“问题儿童”。
实验里还有一个很关键的信号:GEOALIGN并没有靠“少采样”或者“少更新”来换稳定,而是在保留更新密度的同时,把最危险的样本替换掉了。这个区别很重要。很多稳定化方法最后会把训练搞得太保守,像给模型穿上厚棉袄,虽然不容易摔,但也跑不快。GEOALIGN更像给模型戴上护目镜:该跑还跑,只是别被脏东西迷了眼。

消融与分析:投影器是核心,异常评分有讲究

论文的消融分析基本把“为什么能work”讲明白了。首先是投影器 。如果没有这个投影器,原始隐藏向量里的方向会非常散,prototype很难稳定地代表批次共识;加了投影器之后,方向会明显更集中,说明它确实把“改善信号”从噪声里捞出来了。
Figure 6. Visualization of latent vectors before and after projection.
图6:投影前后潜向量的可视化。原始向量很散,和质心的余弦相似度也很分散;投影后,向量明显对齐,接近90%的样本余弦相似度都超过0.8,说明投影器确实把共识方向“拧”出来了。
另一个值得注意的点,是异常分数的聚合方式。论文比较了归一化聚合和累积聚合,结论偏向后者。原因不难理解:如果一个样本在很多偏好对里都持续偏离,那它就是“反复犯错”;单次偏离可能只是偶然,但多次偏离就更像结构性问题。累积评分能把这种持续性放大出来,因此更适合抓真正的离群点。
Figure 8. Distribution of normalized vs cumulative anomaly scores.
图8:归一化与累积异常分数的分布对比。累积分数动态范围更大,更容易把严重离群点和普通波动区分开。
Table 4. Comparison of accumulation and normalized aggregation schemes.
表4:累积聚合和归一化聚合的比较。结果支持论文的判断:累积方式更能稳定识别高风险rollout。
论文还分析了密度阈值 α 的影响。这个参数本质上是在控制“有多严格”。α越小,只会处理最离谱的样本;α越大,处理范围更宽。实验显示,在不同任务上都能找到比较稳的区间,说明方法不是靠某个神秘参数撑起来的,而是整体逻辑比较合理。
Table 8. Performance under different GEOALIGN density sensitivities on HH-RLHF.
表8:HH-RLHF上不同密度敏感度的结果。可以看到,方法对α并不是特别脆,说明它的异常检测有一定容错空间。
Table 9. Performance under different GEOALIGN density sensitivities on Math.
表9:数学任务上的α敏感度分析。整体趋势同样说明,GEOALIGN不是靠“精调到毫米级”才能工作,参数区间还算友好。
还有一个容易被忽略但很实用的点:GEOALIGN是forward-pass only,也就是只用前向隐藏状态做判断,不需要额外的梯度级别开销。对大模型在线RL来说,这几乎等于给工程实现留了一条活路。既能插到现有框架里,又不会把训练吞吐拖得太惨,这也是它“轻量插件”定位成立的关键。
Table 11. PPO trust-region diagnostics.
表11:PPO信赖域诊断。GEOALIGN降低了KL散度和裁剪比例,说明更新更克制,训练更像“稳扎稳打”,而不是“猛冲猛撞”。
Table 12. Ablation on rectification strategy.
表12:不同修正策略的消融。替换、置零、直接丢弃之间的比较,进一步说明“保留密度但修正异常”比简单粗暴地删样本更划算。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是在线RL训练中“奖励看着不错,但更新方向互相打架”的问题。GEOALIGN不是单纯压低奖励,而是识别那些与批次共识方向严重冲突的高分rollout,再把它们替换成同prompt里更稳的样本。

GDI是什么意思,为什么它有用?GDI是Geometric Deviation Index,中文可理解为“几何偏离指数”。它把一个rollout在所有相关偏好对上的方向偏离累加起来,数值越高,说明它越不像批次里大多数样本想去的方向,因此更值得被当成异常点处理。

为什么一定要先投影,再算共识方向?因为原始hidden state里混着太多和任务无关的噪声,直接算方向容易“看谁都像嫌疑人”。先用轻量投影器把奖励相关的方向提纯,再构造prototype,才能更稳地识别真正的方向冲突。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 这篇论文的亮点不在“又发明了一个更猛的RL公式”,而在于把方向一致性这个几何视角引入在线RL稳定性分析,切口新,而且实用。

实验合理度:★★★★☆ 任务覆盖了离散奖励和连续奖励,基线也选得比较强,外加奖励污染实验,能比较有力地支撑主张。

学术研究价值:★★★★☆ 它给“奖励不靠谱时怎么办”提供了一个新的可靠性信号,后续很可能被迁移到更多在线优化场景里。

稳定性:★★★★☆ 方法本身比重型稳定化手段轻很多,且对训练曲线有实打实的平滑作用,稳定性评价不错。

适应性以及泛化能力:★★★★☆ 数学推理和对话对齐都能用,说明不是只对某个特定奖励模型有效,但在更复杂多模态场景里还需要继续验证。

硬件需求及成本:★★★★☆ 只做前向统计和轻量投影,额外成本不大,工程上友好。

复现难度:★★★☆☆ 代码开源是加分项,但依赖隐藏状态提取和在线RL框架,复现门槛仍然高于普通分类任务。

产品化成熟度:★★★☆☆ 作为训练期插件很有潜力,但要进生产,仍需验证不同奖励模型、不同prompt分布下的稳健性。

可能的问题:方法依赖“同prompt内偏好对”和隐藏表示质量,若奖励信号极弱或样本太少,GDI可能不够稳,异常检测效果会打折。


主要参考文献

Zhou, T., Ling, Z., Zhao, Y., Shen, Y., & Chen, D. GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning. arXiv:2606.26917v1, 2026.
Shao, et al. GRPO: Group Relative Policy Optimization. 2024.
Bai, et al. HH-RLHF. 2022.
Wang, et al. ArmoRM reward model. 2024.

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。大模型、强化学习、Agent 这些方向都能找到同频伙伴,边聊边进步。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。