← 返回 PaperDaily 大模型与智能体

RiVER来了:无标准答案也能训大模型,ALE提分9.4%

这篇论文最有意思的地方,不是又把一个榜单刷高了,而是把“没有标准答案”的优化题,硬生生改造成了可训练的强化学习环境。原始分数不靠谱、频繁样本会抢戏,RiVER都给它摁住了。

RiVER来了:无标准答案也能训大模型,ALE提分9.4%
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是又把一个榜单刷高了,而是把“没有标准答案”的优化题,硬生生改造成了可训练的强化学习环境。原始分数不靠谱、频繁样本会抢戏,RiVER都给它摁住了。


原论文信息如下:
论文标题:
Reinforcement Learning without Ground-Truth Solutions via Rank-induced Verifiable Rewards
发表日期:
2026年06月
发表单位:
University of California, San Diego; Snowflake AI Research
原文链接:
https://arxiv.org/pdf/2606.27369v1.pdf

强化学习新范式:没有标准答案,AI也能“自学成才”?

过去大家聊强化学习,最常见的设定是“有标准答案”:答对了给奖励,答错了不给或者少给。这个套路在数学题、代码题里很好使,但一旦碰到优化类问题,事情就开始变味了。因为很多优化任务根本没有“唯一正确答案”,只有“谁更好一点”。这篇论文干的事,恰恰就是把这种没有标准答案的任务,改造成了可以训练大模型的强化学习环境。
论文提出的框架叫 RiVER,全称是 Ranking-induced VERifiable rewards,中文可以理解为“由排序诱导的可验证奖励”。它的核心想法很朴素:既然没有标准答案,那就别死盯着“对不对”,而是看“在同一批候选方案里,谁更强”。
图1:传统答案匹配验证与分组排序式可验证环境的对比
图1:传统答案匹配验证与分组排序式可验证环境的对比。左边是“有标准答案”的老路子,右边是 RiVER 的思路:不需要金标准解,只要能执行、能检查约束、能算分,就能比较候选方案的好坏。
这件事重要在哪?因为很多真实世界问题本来就不是“答题卡”模式。算法设计、调度规划、路径优化、组合搜索,往往只有一个目标函数,没有标准答案。以前这类任务更多是“拿来做评测”,现在 RiVER 想把它们变成“拿来训练”。这一步一旦成立,模型学到的就不只是做题技巧,而是更通用的优化和编程能力。

从“对错判断”到“好坏比较”,RiVER如何引导模型?

先把背景说人话。强化学习里,模型会先生成一堆候选答案,然后环境给奖励,模型再根据奖励调整策略。传统的 RLVR,即 Reinforcement Learning with Verifiable Rewards,中文是“带可验证奖励的强化学习”,通常奖励是二值的:对了给 1,错了给 0。这个方法在有标准答案时很直接,但在优化任务里就不够用了,因为很多可行解都不止一个,差别也不是“有/没有”这么粗暴。
RiVER 的做法更像“考场里不看标准答案,改看同场考生排名”。模型对同一个问题一次采样出一组程序,程序会被执行到同一批隐藏测试实例上。只要程序能跑、输出合法,评测器就给出一个客观分数;如果程序崩了、超时了、格式错了,就直接判失败。然后 RiVER 不直接拿原始分数做训练,而是先在同一个实例内部排序,再把排序结果变成奖励信号。
这里的关键点是:奖励不是“像不像标准答案”,而是“在同一题上比别的候选解强不强”。这就把优化题从“找唯一正确解”改造成了“学会挑更优解”。对强化学习来说,这种信号更细,也更适合让模型慢慢学出稳定的优化偏好。
图2:RiVER的整体训练流程示意图
图2:RiVER的整体训练流程示意图。模型先生成一组可执行程序,再在相同隐藏实例上执行、打分、排序,最后把排序后的奖励送进 GRPO 更新策略。整个流程的重点不是“找标准答案”,而是“比较候选程序的相对质量”。

两大痛点:原始分数“不靠谱”,策略更新“被带偏”

论文之所以要单独设计 RiVER,是因为作者发现:直接拿执行分数训练,表面上在涨,实际上容易学歪。而且这个“学歪”还不是小问题,是会把模型往错误方向推。
第一个坑叫 scale dominance,中文可以叫“尺度支配”。意思是,不同测试实例的分数尺度不一样,有的题分数范围很大,有的很小。你如果把原始分数直接平均,最后梯度会被数值大的实例牵着走,模型优化的不是“谁更好”,而是“谁数字更大”。这就像把 100 米短跑和马拉松放在一个表里,最后只看公里数,不看成绩,多少有点离谱。
第二个坑叫 frequency dominance,中文可理解为“频率支配”。在一组采样里,某些平庸但常见的解会被反复采出来;而真正更强的解可能只出现一次。若奖励设计不够聪明,模型更新时,反而是这些“重复出现的平庸解”拿走了更多梯度。说白了就是:常见不等于优秀,刷屏不等于有用
所以,RiVER 不是简单“换个奖励函数”这么轻巧,而是针对这两个坑做了定向处理:先把不同实例的分数拉到同一比较框架里,再把最强候选从一堆普通候选里拎出来。这个思路像极了比赛评奖:不是看谁嗓门大,而是看谁真拿了第一。

实例内排序+胜者优先:RiVER的“双保险”奖励机制

RiVER 的设计看上去不复杂,但很讲究。它不是拍脑袋把分数改一改,而是分成两步:实例内排序,再加上胜者优先的奖励塑形
先说实例内排序。对同一个隐藏测试实例,RiVER 把一组候选程序按分数排个名次。这个排名只在同一个实例里比较,因此不会被不同题目的分数尺度干扰。换句话说,只要是同一题、同一批测试数据,谁更强就排前面;别的题分数再大,也不来抢戏。
排序之后,RiVER 还做了一个很关键的动作:让最强的候选更“值钱”。也就是 winner-heavy shaping,中文可以理解为“胜者优先的奖励塑形”。最好的候选拿到最明确的正奖励,其他合法候选也不是一刀切成零,而是给有限、可区分的反馈。这样做的好处是,模型不会只学会“赢者通吃”,也不会让一堆平庸解平均分走注意力。
论文里还提到一个细节:平均名次(average-tie ranking)。如果多个候选分数一样,就不要强行装作它们有严格先后,而是把它们放在同一个区间里平均处理。这个小动作很实在,能避免“重复生成的同质解”被过度奖励,减少模型在同一类模板上来回打转。
如果把整个机制压缩成一句话,那就是:先把分数的“绝对大小”放一边,只看相对排名;再把最强候选单独拎出来,避免频繁出现的平庸解抢走训练信号。这就是 RiVER 的“双保险”。
从工程角度看,这种设计还有一个优点:奖励是有界的,训练更稳。相比直接把原始执行分数扔进策略优化,RiVER 至少先把“数值爆炸”和“尺度混乱”这两个老毛病按住了。对强化学习来说,稳定性往往比“看起来很猛”更重要。

实验结果:不仅优化能力提升,解题能力也“附赠”增长

这篇论文最值得看的地方,不是“训练集上分数涨了”,而是它真的把能力传到了别的地方。作者只用 12 个没有标准答案的优化任务 训练,却在两类评测上都拿到了提升:一类是同样偏优化的 ALE-Bench,另一类是标准的代码题基准 LiveCodeBench 和 USACO。
图3:主要实验结果表格
图3:主要实验结果表格。可以看到,RiVER 在两个基础模型上都提升了 ALE-Bench 的评分,同时也带动了 LiveCodeBench 和 USACO 的通过率提升。更关键的是,单纯用原始分数训练的方法,往往只能提升优化类任务,对标准代码题的迁移效果并不稳定。
先看优化类任务。RiVER 在 Qwen3-8B 上把 ALE 评分提高了 142 分,在 GLM-Z1-9B-0414 上提高了 157 分,排名百分位也明显改善。这个幅度说明,它不是“抠一点点分”的小修小补,而是确实把模型在开放式优化环境里的策略学顺了。
更有意思的是迁移结果。RiVER 不只是让模型在 AHC 这类优化题上更会“算分”,还让它在 LiveCodeBench 和 USACO 这些需要精确正确答案的任务上也涨了。论文报告的平均提升分别约为 2.4% 和 3.5%。这说明模型学到的不是某个题库的投机技巧,而更像是“写程序、找结构、做优化”的底层能力。
对比基线就更能说明问题。Raw-GRPO、RS-GRPO、Raw-Binary 这类直接吃原始执行分数的方法,虽然能把 ALE 的分数往上拉,但到了标准代码题上,提升就不稳定,甚至会掉。这个现象很像“在训练题上刷得挺好,一换考试就露馅”。也就是说,原始分数并没有自动变成可迁移的能力
图4:12个AHC任务上的最佳历史表现
图4:12个 AHC 任务上的最佳历史表现。RiVER 在多个任务上都能更早或更稳定地找到更强解,说明它不是单点爆发,而是跨任务都能提供比较扎实的训练信号。
论文还做了难度分层分析。LiveCodeBench 里,RiVER 在中等和困难题上提升更明显,简单题变化不大,因为基础模型本来就已经很高了。这其实挺合理:如果一个方法真学到了更强的搜索、规划和优化能力,它最先体现出来的地方,通常就是那些需要多想一步的题,而不是小学计算题。
还有一个案例分析也很有说服力。作者观察训练过程中“历史最佳解”的增长曲线,发现 RiVER 在 12 个训练任务里有 8 个都能更快或更稳地找到更强解。再结合代码审查例子,能看出它确实在推动模型往更合理的启发式结构上走,而不是在原地重复某种模板。

总结与展望:代码优化的“牛刀小试”,通用能力的“练兵场”

RiVER 的意义,不只是把一篇强化学习论文做漂亮了,而是给“没有标准答案的任务能不能训练大模型”这个问题,交出了一份相当硬的答案。它证明了一件很现实的事:只要环境能执行、能比较、能排序,优化题就不只是评测题,也可以是训练题
不过,这个方法也不是万能钥匙。它依赖确定性的执行反馈,适合那些能写出可执行程序、能算出客观分数的任务;如果任务本身没有稳定评测器,或者评测成本太高,RiVER 的玩法就不一定好复制。换句话说,它更像是“把一类可验证优化任务变成训练场”,而不是把所有开放式问题都一锅端。
但它给行业的启发很明确:以后做大模型后训练,别总盯着“有没有标准答案”。很多时候,真正值钱的是“能不能比较优劣”“能不能形成稳定的相对信号”。如果这个方向继续往前走,优化、规划、调度、搜索这类任务,可能会从“专门的业务问题”变成“通用能力的训练燃料”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“没有标准答案时,强化学习怎么训练大模型”的问题。RiVER 不依赖金标准解,而是利用程序执行后的客观分数,在同一实例内比较候选方案,从而把优化任务变成可训练的监督信号。

RiVER 里的“实例内排序”和“胜者优先”是什么意思?实例内排序就是只在同一个隐藏测试实例里比较候选解,不受不同题目分数尺度影响;胜者优先则是让最好的候选得到更强奖励,同时不给其他合法解完全归零,避免频繁出现的平庸解把训练信号冲淡。

这类方法能不能直接用到别的任务上?前提是任务要能执行、能验证、能比较。对于有明确评测器的优化、规划、搜索、调度类任务,这种思路很有潜力;但如果任务没有稳定的客观反馈,或者评测成本太高,就不能照搬,需要重新设计环境和奖励。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“没有标准答案”的优化任务改造成可验证强化学习环境,这个切口很漂亮,不是换皮式改进,是真在改奖励范式。

实验合理度:★★★★☆

训练任务、评测任务、对照基线分得比较清楚,而且还做了跨基准迁移验证,能看出不是只在训练分布上自嗨。

学术研究价值:★★★★☆

它把 RLVR 的边界往外推了一步,说明“可验证”不一定等于“有标准答案”,这个观点很有研究延展性。

稳定性:★★★☆☆

奖励做了排序和有界化,训练稳定性比直接吃原始分数更好,但依然依赖高质量执行器和任务环境,离“随便一类任务都能上”还有距离。

适应性以及泛化能力:★★★★☆

从优化题迁移到标准代码题,说明它学到了一些通用程序能力;但对非可执行、非客观评分任务,泛化还不能乱吹。

硬件需求及成本:★★★☆☆

训练用的是 8B、9B 级别模型和分组采样,成本不算轻,但也不是离谱大模型级别;真正的成本大头在评测执行和环境构建。

复现难度:★★★☆☆

方法本身不复杂,难点在于任务环境、隐藏实例和执行评测的搭建;如果没有同类数据与评测器,复现门槛会明显上升。

产品化成熟度:★★★☆☆

适合有明确执行器和评分函数的优化场景,尤其是代码优化、调度搜索、启发式求解;但要进真实产品,还得补上稳定性、成本和异常处理。

可能的问题:思路漂亮,但强依赖可验证环境;一旦评测器噪声大、实例分布变了,排序奖励是否还稳,需要更多验证。


主要参考文献

[1] Reinforcement Learning without Ground-Truth Solutions via Rank-induced Verifiable Rewards. arXiv:2606.27369v1, 2026.
[2] Schulman et al. Proximal Policy Optimization Algorithms, 2017.
[3] Shao et al. Group Relative Policy Optimization, 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。想继续追更AI前沿拆解、开源代码和招聘信息,欢迎扫码加入龙哥读论文星球与微信群,少走弯路,多看干货~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。