← 返回 PaperDaily
大模型与智能体
GEOALIGN来了:让LLM在线RL少走弯路,Qwen3稳定提分
这篇论文抓住了在线RL最烦人的毛病:明明奖励不低,训练却像坐过山车。GEOALIGN不跟奖励硬刚,而是从“方向”下手,专门揪出那些高分但带偏全局更新的rollout,思路相当清爽。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
这篇论文抓住了在线RL最烦人的毛病:明明奖励不低,训练却像坐过山车。GEOALIGN不跟奖励硬刚,而是从“方向”下手,专门揪出那些高分但带偏全局更新的rollout,思路相当清爽。
原论文信息如下:
在线RL训练大模型,为何如此“脆弱”?
在线强化学习用来对齐大模型,听起来像是“边学边改,越改越乖”。但现实往往更像一辆装了弹簧的购物车:看着往前走,实际上一路抖。奖励信号只要稍微有点噪声,训练曲线就可能忽上忽下,明明某一步评测涨了,下一步又掉回去,像在和优化器玩捉迷藏。
这篇论文盯上的,正是这种“表面高分、实际带偏”的问题。它不满足于问“哪个样本分高”,而是追问得更狠一点:这些高分样本,推着模型往哪个方向走?如果方向本身乱了,分数再高也可能是个假象。
先把背景捋顺。在线RL里,模型对同一个提示会采样出一组回复,每个回复都会拿到一个奖励。奖励高,通常说明这个回复更好;奖励低,则相对差一些。问题在于,RL更新不是只看“谁分高”,还会把这些样本变成参数更新方向。于是就出现一个很尴尬的局面:高奖励不等于高可靠性,尤其当奖励模型有偏差、可被利用,或者验证奖励本身存在偶然命中时,少数“高分但方向歪”的样本就可能把整批更新带偏。
所以,这篇论文的核心直觉很朴素:与其只盯着奖励值,不如看看样本之间的“几何关系”。如果大多数样本都在往同一个方向改进,少数样本却像拧着方向盘乱打,那就该警惕了。GEOALIGN要做的,就是把这种“方向乱套”的样本揪出来。
“方向不一致性”:一个被忽视的几何视角下的不稳定因素
论文把这种现象命名为directional inconsistency,中文可以理解为“方向不一致性”。它指的是:在同一个训练批次里,少数高奖励回复形成的更新方向,和大多数样本的共识方向明显相冲突。注意,这里冲突的不是分数,而是“指向”。
为了把这个概念讲清楚,论文引入了几个关键量。先看优势函数。Advantage就是“这个回复比同组其他回复好多少”的相对分数。在很多在线RL方法里,优势值会根据同一提示下的奖励做归一化。论文也给出了这个基础形式:
但论文强调,标量奖励只告诉你“力度”,却没告诉你“方向”。于是作者把每个回复的隐藏状态拿出来,记作 h(y)。对于同一提示下“高分回复”和“低分回复”,它们的差向量
论文进一步把同一提示下的所有偏好对整理成集合 P,也就是“谁比谁更好”的配对列表:
这套思路听起来有点“玄”,但其实很工程。它不是要证明大模型突然学会了宇宙真理,而是想回答一个更实际的问题:哪些经验值得被信任,哪些经验该被温柔地请出训练现场?
GEOALIGN:轻量级“排雷”插件,精准剔除“问题”样本
GEOALIGN 的名字其实已经把思路说透了:GEO 表示几何,ALIGN 表示对齐。它不是重写整个RL框架,而是一个可插拔的rollout整理模块,插在“采样经验”和“更新策略”之间,负责做一件事:把明显方向不一致的样本先处理掉,再让主训练继续。
它的流程可以拆成四步。第一步,仍然是同一提示下的回复比较,得到偏好对;第二步,基于隐藏状态差向量训练一个很小的投影器,把原本散乱的方向压到更容易看出共识的空间里;第三步,构造一个“批次共识原型”,也就是这一批样本大体往哪边走;第四步,给每条回复打一个几何偏离分数,专门找出那些偏离太大的离群样本。
这里最妙的地方在于,投影器不是拿来做花活的。原始隐藏表示里混着太多语言噪声、风格差异、词汇偏好,直接算方向容易“看花眼”。投影器相当于把杂音先滤一遍,让真正和奖励顺序相关的几何结构浮出来。论文里还专门用一个很小的多层感知机来做这件事,训练步数也不多,属于那种“干活快、脾气还不大”的模块。
当 GDI 算出来以后,GEOALIGN 再通过核密度估计找出高偏离尾部的样本,只动那一小撮最离谱的经验。这个设计很克制:它不砍提示、不大幅缩小 batch,也不需要额外反向传播。换句话说,它想做的是“少动刀,动要害”。
论文还给了一个很实用的替换策略:不是把异常样本直接丢掉,而是在同一提示内,用一个更稳定的回复替换它,或者等价地把它的贡献中和掉。这样做的好处很现实——每个提示保留的样本数量不变,RL 训练的“密度”不会被破坏。对于像 GRPO 这种组内归一化的方法,这种替换尤其顺手。
实验验证:数学推理与对话对齐,效果与稳定性双提升
实验部分分成两条线:一条是数学推理,使用二值验证奖励;另一条是对话对齐,使用连续奖励模型。这样的设计挺合理,因为两类任务的奖励形态差异很大,能更好检验 GEOALIGN 到底是在“某个特定场景里灵光一现”,还是确实能跨任务稳定工作。
论文把方法放在 Qwen3-1.7B 和 Qwen3-4B 上测试,并和多个稳健RL基线比较,包括 PF-PPO、PAR、PODS、SEED-GRPO 等。这个对比组合不算随便挑的“陪跑”,而是都属于当前比较能打的稳定化方案,所以结果更有说服力。
先看数学推理。GEOALIGN 在两个模型上都取得了最好的平均分,而且训练曲线更平滑。这个现象和方法设计完全对得上:如果异常样本真的会把更新方向拽歪,那么把它们识别并中和后,模型的优化路径就应该更稳,最终分数也更容易抬上去。实验结果基本验证了这一点。
对话对齐任务也类似。GEOALIGN 不仅最终分数更高,训练过程里的波动也更小。这里尤其值得注意的是,论文用的是连续奖励模型,而不是只有“对/错”的离散信号。也就是说,GEOALIGN 并不是只对二值验证奖励有效,它对更复杂、更现实的奖励噪声也有帮助。
为了验证 GDI 真的抓到了“问题样本”,论文还做了奖励污染实验。做法很直接:人为往训练里塞噪声,看哪些方法更扛造。结果显示,噪声一上来,所有方法都会受影响,但 GEOALIGN 下降更慢,优势也更稳。更关键的是,黑色标记的被污染样本,确实大多集中在高 GDI 区域。这就很像在说:GDI 不是瞎猜,它真能把“危险分子”圈出来。
投影器的作用也被单独验证了。原始向量空间里,方向很散,像一群临时组队但谁也不服谁的路人;投影之后,方向明显聚拢,接近原型的比例也大幅提高。这个结果非常关键,因为它说明 GEOALIGN 的“方向共识”不是凭空捏出来的,而是确实需要一个轻量投影器把几何结构先理顺。
论文还做了几个很有用的细节分析。比如,累加式 GDI 比简单归一化更容易区分严重离群点;密度阈值 α 的选择也有稳定区间,不是那种一调就崩的参数;另外,GEOALIGN 还能降低 PPO 里的 KL 散度和 clipping 比例,说明它确实让更新更保守、更像“稳稳往前走”,而不是一路猛踩油门。
如果把这些实验合在一起看,GEOALIGN 的优势其实很清楚:它没有去和奖励模型硬拼“谁更准”,而是承认奖励会有噪声,然后利用几何一致性去做鲁棒筛选。这个思路的妙处在于,它不要求每个样本都绝对可信,只要求大多数样本的方向共识足够稳定。对于在线RL这种天然带噪的场景,这种假设比“奖励必须完美”现实得多。
总结与启发:几何一致性,在线RL的新信标
GEOALIGN 最值得记住的一点,不是它用了什么多复杂的公式,而是它把在线RL里一个常被忽略的问题讲明白了:训练不稳定,未必是奖励分数不够高,也可能是更新方向不够齐。这个视角很朴素,但也很有力量。
对实际系统来说,这类方法的价值在于“轻”。它不改主训练框架,不需要额外反向传播,也不强依赖某一种奖励形式。只要能拿到同一提示下的多条回复和隐藏状态,就能做方向筛选。换句话说,它更像是给现有在线RL流程加了一个“几何安检口”——不拦所有人,只拦最可疑的那几个。
当然,这个方法也不是万能钥匙。它依赖隐藏表示能反映出可靠的改进方向;如果模型内部表征本身很混乱,或者奖励信号和任务真正目标偏得太远,几何一致性也会受到影响。此外,当前实验主要集中在对话对齐和数学推理,未来还需要看看在更复杂的长程规划、工具调用、智能体工作流里是否同样稳。
不过从研究思路上看,这篇论文已经给了一个很漂亮的启发:当“分数”不够可信时,可以试着让“方向”替你把门。这对后续做稳健RL、数据筛选、甚至训练过程监控,都是一个值得继续挖的方向。
龙迷三问
这篇论文到底解决了什么问题?它解决的是在线RL训练里“奖励看着不错,训练却老抖”的问题。GEOALIGN不去纠结某个样本分数高不高,而是判断它在几何方向上是不是和大多数样本一致,从而把最容易带偏更新的异常样本筛出来。
GDI 和“几何原型”是什么意思?GDI 是 Geometric Deviation Index,中文可理解为“几何偏离指数”,用来衡量某条回复有多偏离批次共识方向;几何原型则是把同一批偏好方向按奖励差值加权后得到的共识箭头,代表这一批样本大体想把模型往哪边推。
为什么它不直接删掉异常样本,而是替换或中和?因为在线RL很怕把 batch 砍得太薄,样本密度一掉,更新反而更不稳。替换成同提示下更稳定的回复,或者把贡献中和掉,能在保留训练密度的同时降低异常样本的破坏力。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 不是在奖励函数上打补丁,而是从“更新方向”入手,角度挺新,且和在线RL的不稳定问题贴得很紧。
实验合理度:★★★★☆ 两类任务、两种奖励形态、多个强基线,再加噪声注入和消融,链条比较完整。
学术研究价值:★★★★☆ 把几何一致性引入稳健RL,给后续做样本筛选、训练诊断提供了新信号。
稳定性:★★★★☆ 从结果看确实更稳,但仍依赖隐藏表示质量和批次统计,极端噪声场景下还要继续验证。
适应性以及泛化能力:★★★★☆ 对连续奖励和二值奖励都有效,说明适应性不错;但更复杂智能体任务还需进一步测试。
硬件需求及成本:★★★★☆ 只加一个轻量投影器,前向开销很小,成本友好。
复现难度:★★★☆☆ 代码公开,思路不算难,但在线RL本身训练成本不低,复现实验仍需要一定算力和调参耐心。
产品化成熟度:★★★☆☆ 适合作为训练阶段的稳健插件,离大规模通用落地还差更多场景验证。
可能的问题:方法依赖“多数方向是对的”这一前提,若奖励系统整体偏航,几何共识也可能跟着跑偏。
主要参考文献
GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning. arXiv, 2026. https://arxiv.org/pdf/2606.25519v1.pdf
Trinity-RFT 项目主页:https://github.com/agentscope-ai/Trinity-RFT
开源代码:https://github.com/SYSUzhouting/Trinity-RFT
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!