GEOALIGN的思路不是把所有样本一刀切地删掉,而是做精确打击:只处理最严重的方向离群点,尽量保住批次规模和训练密度。这个设计很聪明,因为在线RL最怕“为了稳而把数据删没了”,最后稳定是稳定了,模型也学不动了。论文先在同一prompt内部构造偏好对。Pi 表示第 i 个prompt下所有“高分比低分高”的配对集合。这样做的好处是:同一prompt的回答共享输入条件,比较起来更公平,也更容易从中抽出“改进方向”而不是“题目差异”。接着,GEOALIGN会训练一个轻量投影器,把这些位移方向从原始隐藏空间里“提纯”出来。原始表示里混着词汇、风格、长度等各种噪声,直接拿来算角度,往往像在菜市场里听交响乐——热闹是热闹,主旋律不一定清楚。投影器的作用,就是把“杂音”尽量压下去,让真正的奖励方向更集中。投影之后,论文会构造一个batch-wise consensus prototype,也就是“这一批样本总体想往哪儿走”的共识方向。公式里按奖励差做加权,意思是:分差越大,说明这个偏好对提供的方向信号越强,就该在共识里多说几句。随后每个样本都会得到一个方向偏离分数。这里的 cos 其实就是余弦相似度,越接近1说明方向越一致,越接近0或负数说明越像“南辕北辙”。GEOALIGN用 1 - cos 来表示偏离程度,数值越大,越像那个不合群的家伙。把一个rollout在所有相关偏好对上的偏离度累加起来,就得到 GDI,即 Geometric Deviation Index,中文可译为“几何偏离指数”。这个分数不是看单次失误,而是看它是不是在多次比较里都持续“跑偏”。持续跑偏的,才是真正值得处理的异常点。为了把异常点挑出来,论文还用了核密度估计(KDE,Kernel Density Estimation,核密度估计,来源于统计学习常用方法)去看GDI的分布。简单说,就是看哪些样本挤在“高偏离尾部”,而且局部密度明显低。这样筛出来的,不是普通波动,而是那种“离群得很有个性”的样本。图3:异常分数与排序的分布。几何不一致性呈现明显长尾,说明真正需要干预的rollout只占一小部分,没必要把整批数据都“按最严标准处理”。找到异常后,GEOALIGN不是粗暴删除,而是在同一个prompt里找一个更稳的替代回答,把异常rollout在经验缓冲区里“换掉”或者等价地把它的贡献压到很低。这个做法很像班主任处理课堂纪律:不是把全班都罚站,而是把最爱起哄的几个先请出去冷静一下。这样既保住了每个prompt的rollout数量,也避免了有效批次被削薄。认真模式上线。这个方法最讨喜的地方,是它只在前向传播上做文章,不需要额外的反向传播开销。对于在线RL这种本来就很烧算力的场景,这点很重要:你可以多做一点“判断”,但别把训练成本炸穿。