← 返回 PaperDaily 大模型与智能体

Qwen3.5-4B实证:RLVR界不再是空话

这篇论文最狠的地方,不是把RLVR讲明白了,而是第一次把“训练得不错”推进到“理论上也站得住”。更有意思的是,它不是空谈定理,而是拿出一条Progressive RLVR流水线,把压缩、蒸馏、量化一起拧上,真把泛化界做到了能看、能算、还能落地。

Qwen3.5-4B实证:RLVR界不再是空话
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最狠的地方,不是把RLVR讲明白了,而是第一次把“训练得不错”推进到“理论上也站得住”。更有意思的是,它不是空谈定理,而是拿出一条Progressive RLVR流水线,把压缩、蒸馏、量化一起拧上,真把泛化界做到了能看、能算、还能落地。


原论文信息如下:
论文标题:
Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards
发表日期:
2026年07月
发表单位:
UIUC;MIT;Bridgewater AIA Labs
原文链接:
https://arxiv.org/pdf/2607.14506v1.pdf
开源代码链接:
没有

强化学习(RLVR)如何让大模型“学会推理”却无法保证“泛化”?

这篇论文先把一个很现实的问题摆到台面上:RLVRReinforcement Learning with Verifiable Rewards,带可验证奖励的强化学习)确实能把大模型往“会做题、会写代码、会查表”方向推,但这不等于它真的学会了可泛化的推理。训练集上答得漂亮,换个没见过的题型就开始露馅,这种“会背答案,不会举一反三”的老毛病,RLVR 也没法自动免疫。
论文的切入点很硬核:不是继续争论“RLVR到底有没有用”,而是直接问——能不能给它一个不空洞的泛化界。所谓“空洞”,就是理论上写得很热闹,最后给出的上界比模型自己还差,等于没说。本文要解决的,就是把这种“看起来像证明,实际上像安慰奖”的局面掀翻。
封面
图1:论文展示的四大场景非空洞泛化界结果。最关键的不是“有个界”,而是这个界真的能压住基座模型,并且离微调后模型的真实精度不算太远。
先把背景说人话一点。大模型训练里常见的“泛化”意思很简单:在见过的数据上表现好,不代表在没见过的数据上也行。学习理论里常用的 VC 维、Rademacher 复杂度这些工具,放到今天动辄几十亿参数的大模型上,往往会直接算出一个“没法用”的上界。PAC-Bayes 则更像一条务实路线:不去盯着参数个数,而是看模型有多好压缩,压得越狠,理论上越容易得到靠谱的泛化保证。
但 RLVR 比普通预训练更麻烦。预训练里给定输入序列,损失基本是确定的;RLVR 里,模型自己还要“采样生成”,奖励是对生成结果打分。也就是说,随机性不止来自数据分布,还来自模型自己的出词过程。论文的厉害之处就在于:它把这两层随机性拆开了处理。

首度破解!万亿参数LLM的RLVR泛化界限居然不再是“空洞承诺”

这篇工作的第一层贡献,是把“RLVR泛化界”从概念变成了可计算的东西。更准确地说,它给出了参数高效 RLVR 微调的首个非空洞泛化上界,而且还是在十亿参数级别的大模型上做出来的。这里的“非空洞”不是修辞,是指这个上界真的比基座模型强,且离微调后的真实精度只有几个百分点的差距。
论文的理论主线是 PAC-Bayes 压缩界。它的直觉很朴素:如果一个模型能被压得很小,同时表现还不错,那么这个模型“碰巧记住训练集”的嫌疑就会变低,泛化更可信。问题在于,RLVR 微调后的模型更新量往往并不够小,尤其是标准 LoRA 也还是太“胖”了,压缩不狠,理论界就容易继续飘。
所以本文没有停在“证明一下”这一步,而是顺手设计了一条能把界做紧的工程流水线:Progressive RLVR。这条流水线的思路很像先让一个“大师傅”把路走通,再把本事一点点塞进一个“瘦身版学生”里,最后再把参数做量化,尽量把信息长度压到最低。理论和工程在这里不是两张皮,而是互相配合。
表1:符号总览
表1:论文符号总览。做理论推导时,这张表很重要,里面把提示分布、噪声变量、奖励函数、压缩长度等核心符号统一了,不然公式一多,读者会被符号海淹没。

Gumbel-max重参数化:让随机采样变身为可分析的确定性函数

RLVR 里最难搞的地方之一,是模型生成答案这件事本身是随机的。今天采样到 A,明天采样到 B,奖励也跟着变。若不先把这层随机性处理掉,后面的泛化分析就会像拿着抖动的尺子量头发丝,根本没法下手。
论文这里用了一个经典但很巧的技巧:Gumbel-max 重参数化。它的作用可以理解成:把“随机采样一个词”改写成“给定输入和噪声后,确定性地算出这个词”。表面上还是随机,实际上随机性被挪到了一个独立噪声变量里。这样一来,模型生成序列就能被写成一个关于提示、噪声和参数的确定函数,PAC-Bayes 的压缩分析也就能接上了。
论文还把总泛化误差拆成了两块:一块是外在误差,对应提示分布上的泛化;另一块是内在误差,对应同一个提示下多次采样估计奖励时的波动。这个拆法很关键,因为它解释了为什么只要每个样本采够足够多次,内在误差会变得很小,真正决定界紧不紧的,还是训练集规模和压缩长度。
从工程角度看,这一步的意义很直接:如果不做重参数化,奖励函数对采样序列的依赖太强,理论上就很难写成可操作的压缩界;做了之后,随机生成这件事虽然没消失,但至少变成了“可分析的噪声输入”。这就像把一团乱麻摊平,虽然线还在,但终于能数清楚了。

压缩、蒸馏、量化三板斧:Progressive RLVR如何实现14796倍压缩而性能不减

要让 PAC-Bayes 界不空洞,光有理论不够,还得把模型压得足够小。于是论文提出了 Progressive RLVR:先训练一个高容量的教师模型,再把能力蒸馏进一个参数极小的学生模型,最后再做量化,进一步减少描述长度。这个流程很像“先打样、再瘦身、最后打包”,目标非常明确:保住性能,压扁参数
图2:Progressive RLVR整体流程
图2:Progressive RLVR 总体流程。先用标准 RLVR 训练教师模型,再通过 on-policy distillation 把能力迁移到 TinyLoRA 学生模型,最后对学生适配器做量化,尽量把可压缩性拉满。
这里最值得说的是on-policy distillation(基于当前策略的蒸馏)。普通蒸馏往往是老师吐答案,学生照抄;而 on-policy 蒸馏更像是让学生在自己的生成轨迹上接受密集监督,token 级别的信号更细,能更有效地学到老师的推理习惯。论文数据显示,这一步比直接做 RLVR 更稳,训练奖励平均高出约 10%。
图3:蒸馏阶段训练奖励
图3:蒸馏阶段训练奖励对比。可以看到,on-policy distillation 并不是“锦上添花”,而是对超小参数学生模型非常关键的信号补给。
第二板斧是TinyLoRA。LoRA 大家都熟,核心是把大矩阵更新拆成两个小矩阵,参数量大幅下降。TinyLoRA 更激进,它把可训练部分进一步压缩到极低维,甚至可以缩到一个标量级别的训练空间。说白了,就是把“微调”再微调一遍。它的好处不是只省显存,而是直接把 PAC-Bayes 里的“描述长度”压下去,这对理论界特别友好。
第三板斧是量化。这里不是为了“看起来更省”,而是真的把学生适配器的存储位宽继续压缩。论文给出的描述长度分解表明,量化后学生适配器的编码成本非常低,最终平均可压缩性达到标准 LoRA 微调模型的 14796 倍。这个数字不是随口喊出来的,而是来自具体编码长度计算。
表2:学生适配器描述长度分解
表2:学生适配器的描述长度分解。论文把编码开销拆得很细,说明“压缩”不是一句口号,而是能逐项算账的。
这套组合拳的妙处在于:教师模型负责“探索”,学生模型负责“被证明”。PAC-Bayes 关心的是最终 hypothesis 的压缩代价,不关心中间过程有多豪华。所以先把老师训练得强一点,再把能力尽量塞进一个极小学生里,反而更容易得到既强又能证明的结果。这个思路很像先让大厨试菜,再把菜谱缩成一张便签,但最后端上桌的菜不能太差。

四大真实场景验证:非空洞泛化界限距离实际精度仅差6-11%!

理论如果不能落到真实任务上,最后很容易变成“写得漂亮,跑不动”。这篇论文最让人舒服的一点,就是它没有只在玩具问题上打转,而是直接上了四个真实场景:数学、编程、通识推理、Text-to-SQL。场景一多,很多理论方法就开始现原形;而这篇工作恰恰是在这些场景里把界做出来了。
图4:跨域泛化界
图4:跨域泛化界结果。论文进一步展示了不同任务之间的泛化边界,说明这套分析不只是针对单一数据集“特调”的。
在数学任务上,奖励来自可验证的答案正确性;在编程任务上,奖励来自单元测试;在通识任务上,答案是否与标准答案完全一致;在 Text-to-SQL 任务上,则看生成的 SQL 是否返回与真值相同的结果。换句话说,这四个任务都属于“可验证奖励”场景,特别适合 RLVR,也特别适合做理论分析,因为奖励判定相对客观,不容易被主观偏好模型搅局。
图5:教师准确率分解
图5:教师准确率的分解图。总准确率被拆成泛化界和若干惩罚项,能一眼看出到底是数据规模、蒸馏损失,还是量化损失在拖后腿。
结果上最核心的结论有两个。第一,四个领域里得到的界都不是空的,且都超过了基座模型的准确率,提升幅度大约在 9% 到 51% 之间。第二,这些界和学生模型的真实精度只差 6% 到 11%,已经不是“理论上能说通”,而是“数值上挺像那么回事”。对学习理论来说,这个紧度很重要,因为它决定了这个界是论文里挂墙上的,还是能真的拿来评估模型的。
从实验拆解看,内在误差几乎可以忽略,说明每个提示采样 64 次已经足够把生成噪声压住;真正主导界紧度的是外在误差,也就是训练提示数量和压缩程度。这个结论挺实在,因为它告诉后续工作:想继续把界压紧,别光盯着采样次数,更多训练样本和更聪明的压缩设计才是正经路子。
图6:Progressive RLVR消融实验
图6:Progressive RLVR 的消融实验。去掉 on-policy distillation 或 TinyLoRA 之后,界都会明显变差,说明这两步不是装饰品,而是整个框架能成立的关键组件。
消融实验也很有说服力。去掉 on-policy distillation,界平均会差 15%;如果只用普通 LoRA 或把学生做得不够极致压缩,界就会迅速变得不漂亮,甚至直接空洞。这个结果其实一点都不意外:PAC-Bayes 本来就对压缩长度敏感,压缩不够,理论就会立刻翻脸。
图7:Text-to-SQL非空洞准确率界
图7:Text-to-SQL 任务上的非空洞准确率界。这个场景尤其能说明问题,因为它既有多轮交互,又有严格可验证奖励,理论和工程都不轻松。
还有一个细节值得注意:Text-to-SQL 里模型可以多轮查询数据库,论文也讨论了多轮 RLVR 的情形。若环境是确定性的,分析可以直接延伸;若环境本身有随机性,只要能重参数化,也还能继续做。这说明论文的理论框架不是只盯着单步问答,而是对多轮交互也留了口子,虽然对真正线上 API 那种非平稳环境,作者也坦诚地说了暂时不覆盖。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是 RLVR 训练后“模型看起来会推理,但到底能不能泛化”这个老大难问题。论文第一次给出了十亿参数级别 RLVR 的非空洞泛化界,而且还配套了一条能把界做紧的压缩训练流水线。

Gumbel-max 重参数化到底在干嘛?它把“随机采样 token”改写成“给定输入和噪声后确定性生成 token”。这样随机性被外置成独立噪声,原本难分析的生成过程就能接入 PAC-Bayes 的压缩界。

Progressive RLVR 为什么要先教师、再学生、最后量化?因为界是否紧,最终取决于模型更新的描述长度。先用高容量教师探索能力,再把能力蒸馏进 TinyLoRA 学生,最后量化压缩,才能在尽量不掉性能的前提下,把压缩代价压到足够低。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是“又一个 RL 微调技巧”,而是把 RLVR 的泛化问题真正拉进了可证明、可计算的框架里,还顺手补了一条压缩流水线,理论和工程都站得住。

实验合理度:★★★★☆ 四个真实任务、统一的可验证奖励定义、再加上消融实验,整体设计比较扎实;唯一要注意的是,结论主要建立在可验证任务和特定压缩预算上。

学术研究价值:★★★★★ 这篇工作把 RLVR 的理论空白补上了一块,尤其对“训练后到底有没有泛化”这个问题,给出了少见的正式答案,研究价值很高。

稳定性:★★★☆☆ 方法依赖高压缩学生模型和较强的蒸馏流程,demo 级和研究级都不错,但离“随便拿去就能稳跑所有场景”还有距离。

适应性以及泛化能力:★★★☆☆ 在数学、代码、知识、Text-to-SQL 这类可验证场景里适用性不错,但对开放式、主观性强或环境非平稳的任务,理论覆盖还不够。

硬件需求及成本:★★★☆☆ 训练教师和蒸馏学生都不是轻活,尤其还要做多次采样和压缩评估;不过最终学生模型很小,部署端成本反而友好。

复现难度:★★★☆☆ 论文给了较多配置细节,但整体链路涉及 RLVR、蒸馏、TinyLoRA、量化和理论估计,复现门槛不算低。

产品化成熟度:★★★☆☆ 适合高价值、可验证、分布稳定的任务场景;若要上生产,还需要更大规模验证、更多任务覆盖和更强的鲁棒性测试。

可能的问题:理论边界目前主要覆盖同分布可验证任务,且压缩预算和模型规模仍有限;要从“能证明”走到“普遍可用”,中间还有不少工程坑要填。


主要参考文献

Yuxuan Zhu, Rohan Alur, Daniel Kang. Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards. arXiv:2607.14506v1, 2026.
原文链接:https://arxiv.org/pdf/2607.14506v1.pdf
代码:论文页面标注为 Code / Datasets / Models,但当前公开内容中未给出可直接访问的开源链接。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
RLVR、泛化界、蒸馏、量化,想看更硬核的拆解和同领域对比,进群一起抠细节。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。