← 返回 PaperDaily 大模型与智能体

多伦多大学EPFL新方法:TRL让推理更像人话

这篇论文最有意思的地方,不是把推理分数再往上拱一拱,而是盯住了一个更现实的问题:模型变强了,弱模型和人却未必跟得上。TRL用“接力式” rollout 把单挑能力和协作可读性尽量绑在一起,思路很工程,也很像真业务会遇到的坑。

多伦多大学EPFL新方法:TRL让推理更像人话
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是把推理分数再往上拱一拱,而是盯住了一个更现实的问题:模型变强了,弱模型和人却未必跟得上。TRL用“接力式” rollout 把单挑能力和协作可读性尽量绑在一起,思路很工程,也很像真业务会遇到的坑。


原论文信息如下:
论文标题:
Tandem Reinforcement Learning with Verifiable Rewards
发表日期: 2026年06月
发表单位: University of Toronto, EPFL
原文链接: https://arxiv.org/pdf/2606.28166v1.pdf

突破AI推理黑箱:大模型团队联手,让强模型学会“相亲相爱”

大模型推理这几年有个很有意思的矛盾:分数越来越高,解释却越来越像“天书”。模型在竞赛数学里能拿高分,但一旦换成弱一点的伙伴,或者换成人类去接力,常常就开始“说人话困难”。
这篇来自多伦多大学和 EPFL 的论文,盯住的不是“再刷一点分”这种老套路,而是一个更现实的问题:强模型能不能在变强的同时,别把弱模型和人类甩下车。它提出的 Tandem Reinforcement Learning,简称 TRL(Tandem Reinforcement Learning,接力式强化学习),就是试图把“会做题”和“好接力”绑在一起。
Figure 1
图1:TRL 总览。核心不是换奖励函数,而是改变 rollout 的生成方式:强模型 senior 和冻结的弱模型 junior 交替生成同一条推理链,最后仍然用标准的可验证奖励去训练 senior。
这类工作真正值钱的地方,不是“又造了一个新名词”,而是它碰到了 RLVR 的老毛病:Reinforcement Learning with Verifiable Rewards,基于可验证奖励的强化学习。这套方法很擅长把模型数学题做强,但也容易把模型推向一些奇怪的表达习惯,比如可读性下降、语言混杂、推理风格越来越像“只有自己懂”。TRL 想做的事情很朴素:让强模型继续拿高分,但别把推理写成只有自己能看懂的密电码

什么是Tandem RL (TRL)?——一次让两个模型“边聊天、边学习”的新型训练范式

先把概念说人话。传统 RLVR 的流程很简单:模型自己答题,外部验证器判定对错,对了就奖励,错了就惩罚。问题在于,这个过程只关心“最后答案对不对”,并不关心中间推理是不是还能被别的模型接上
TRL 的做法像是把“独奏”改成“接力赛”。一个可训练的 senior 负责变强,另一个冻结的 junior 负责当接力对象。两者从同一个基础模型初始化,然后在生成一条推理链时按词边界随机交替出手。谁在当前位置负责输出,谁就吐出下一个词;另一个模型虽然不输出,但也看着同一段上下文。最终这条联合生成的答案,仍然交给数学验证器打分。
这套设计的关键点有两个。第一,奖励没变,还是标准的可验证奖励;第二,损失函数也没变成花里胡哨的新玩意,依旧是 GRPO 风格的策略优化,只不过只更新 senior 生成的位置。换句话说,TRL 不是在奖励函数上做手脚,而是在“谁来写这段推理”上动了刀。
TRL损失函数
公式1:TRL 的更新目标。意思很直接:只对 senior 写出来的 token 计算策略梯度,junior 写的部分不反向传播梯度,但它们会影响整条轨迹的成败。这里的 At 是 GRPO 的组相对优势,πsen 是 senior 的策略分布。
这里的一个小心机是“按词边界交替”,而不是按句子或者按 token。句子级太容易被模型耍滑头:它可以故意不吐句号,让你没法切换;token 级又太碎,容易把自然语言切得七零八落。词边界是一个比较现实的折中,既不容易被轻易绕过,也不至于把推理切成乱码。
从工程角度看,这个设计也不算轻。因为每一步要跑两个模型前向,算力开销天然上升。论文没有假装这事“零成本”,而是明确承认:TRL 的代价是真实存在的,只是作者把系统实现做了优化,尽量把每步延迟压到接近单模型的两倍,而不是更离谱的倍数。这个态度很工程,没拿“理念正确”当遮羞布。

强强对比:TRL模型在“单挑”和“合作”上表现如何?

论文最核心的实验问题其实很朴素:这样改 rollout 结构,会不会把单模型能力搞废? 如果答案是“会”,那 TRL 就只是一个漂亮但不实用的训练花活;如果答案是“不会”,那它才算真正摸到了一个有价值的新方向。
Figure 2
图2:单模型推理能力对比。TRL 和 vanilla GRPO 都显著超过未强化学习的基础模型,而且两条曲线整体贴得很近,说明TRL 没有明显牺牲单挑能力
这点很关键。因为很多“兼容性”方法最后都会偷偷拿能力换稳定,结果是模型更听话了,但题也不会做了。TRL 在 AMC、AIME、Minerva Math 上的单模型表现与 GRPO 基本同级,说明它不是靠阉割推理能力来换可读性,而是尽量把两者同时保住。
Figure 3
图3:合作场景下的接力鲁棒性。把训练好的 senior 和 frozen junior 在推理时重新配对后,TRL 在三个数学基准上都更强,尤其在 AIME 上优势更明显,最高能到 +6.6 pass@8
这才是 TRL 真正的“主菜”。单模型能做题,不稀奇;能让弱模型接着做、还不掉链子,才说明训练出来的推理过程更像一种可协作的结构,而不是一串只有顶配模型看得懂的私有暗号。对多模型系统、模型接力推理、乃至人机协作,这个指标都比单纯的 pass@k 更接近真实需求。
Figure 4
图4:分布漂移对比。左图看的是 token 级偏离 base model 的程度,右图看的是 GRPO 最“偏”的 500 个 token 在 TRL 下是否被拉回。结果很清楚:TRL 更像是在把模型往 base 分布附近拽回去
论文还专门测了一个挺有意思的现象:junior 读 senior 的推理,会不会更顺?答案是会。作者用两个指标衡量“junior 可读性”:一个是 cross-entropy,越低越好;一个是分布重叠度,越高越好。前者相当于 junior 看到 senior 下一词时有多惊讶,后者相当于两者在每一步上想选的词是不是更接近。
Table 1
表1:junior 对 senior 推理链的可读性。TRL 在总体上把 cross-entropy 压低了,同时把 distribution overlap 拉高了,说明推理不只是更强,也更容易被弱模型跟上
如果把这件事翻译成人话,就是 senior 不再总是突然蹦出一些 junior 预料之外的词,推理轨迹更像一条“可接续的路”,而不是一段临时起意的跳楼机。

不只是会解题:TRL如何抑制分布漂移,让推理更像“人话”?

RLVR 的一个老问题是:模型越练越会“走偏”。不是说它不会做题,而是它会慢慢形成一些很怪的 token 偏好,甚至出现语言混杂、句式怪异、推理像在写暗号。这个现象在大模型安全、可解释性、多人协作里都很麻烦,因为强模型如果越来越不像原来的自己,弱模型和人就更难接住它
TRL 之所以能缓解这个问题,原因不神秘:因为 junior 是冻结的基础模型,而每次成功的 tandem rollout 都要求 junior 在接力时能继续往下写。换句话说,训练信号天然会惩罚那些“只有 senior 自己爽”的 token 选择,逼着 senior 往 junior 也更容易预测的区域靠。
这不等于把模型完全锁死在 base 附近。论文的结果很克制:TRL 不是全面消灭漂移,而是把最有害、最离谱的偏移压下去,同时保留 RLVR 带来的推理增益。这个平衡点很重要,因为真正可用的方法往往不是“最保守”,而是“该稳的时候稳,该强的时候强”。
Figure 7
图7:与 KL-Reg 的对比。单纯加 KL 惩罚确实会让分布往回收一点,但 TRL 的回收更系统,尤其是在 GRPO 最容易“跑飞”的 token 上,TRL 的拉回更明显。
这里就引出一个很关键的问题:为什么不直接对 junior 加 KL 惩罚就完事了? 听起来很合理,做法也很朴素,像是在说“别跑太远”。但论文的结论是:不够。
KL-Reg公式
公式2:KL-Reg 的思路。它在普通策略梯度损失后面再加一项 KL 惩罚,强行把当前策略往 junior 拉。这里的 β 控制约束强度,ht 是当前上下文。
问题在于,KL 只是“平均意义上别太离谱”,它不保证某个具体接力点上 junior 真的能接住。一个模型可以整体分布离 junior 不算远,但在关键位置突然冒出一个 junior 完全猜不到的 token;这种情况下,平均 KL 看着还行,实际协作已经翻车了。
Table 2
表2:消融实验。KL-Reg 能把分布拉近一点,但在接力鲁棒性上基本没追上 TRL;TRL 反而在保持单挑能力的同时,把合作表现抬起来了。这说明“结构性协作”不是一个 KL 惩罚就能替代的
更直白一点说,KL-Reg 像是给 senior 戴了个“别乱跑”的手环,但 TRL 是直接把 senior 放进一个必须和 junior 协同完成任务的环境里。前者管的是“平均距离”,后者管的是“接力成功”。这俩听上去像亲戚,实际上不是一回事。
TRL训练目标
公式3:TRL 的训练目标。它不是先算 senior 自己的完整轨迹再额外罚一下 junior,而是从 rollout 生成方式上就让 junior 参与进来。奖励、验证器、损失形式都尽量保持不变,所以效果更像是“结构改变带来的涌现结果”,而不是“多加一个正则项”的机械修补。

未来展望与思考:让AI的推理不再“曲高和寡”

这篇论文最值得记住的,不是“TRL 比 GRPO 多了几分”,而是它把一个很少被认真讨论的问题摆到了台面上:推理模型不只要会答,还要能被别的模型、甚至人,接着答下去。这对多模型协作、可解释推理、以及未来的人机混合工作流,都很重要。
当然,这套方法也有边界。第一,它依赖可验证奖励,最适合数学、代码、结构化任务;第二,它需要双模型前向,推理成本不低;第三,论文主要验证的是 Qwen3-4B-Instruct 这一条线上,跨模型、跨任务、跨规模的稳定性还需要更多证据。TRL 不是万能钥匙,更像一把很有针对性的扳手
但它给后续研究开了个很实用的口子:以后做 RLVR,不一定只盯着奖励函数和优化器,rollout 的结构本身也可能是一个可调的大旋钮。谁生成、怎么切换、切换到什么粒度、是否允许弱模型参与接力,这些都可能影响模型最后变成“高手”还是“高分但难沟通的怪才”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的不是“模型会不会做题”,而是“模型做题时能不能被弱模型或人类继续接住”。TRL 通过让 senior 和 frozen junior 交替生成推理链,尽量把高分能力和可协作性绑在一起。

TRL 里的 senior、junior、handoff 分别是什么意思?senior 是可训练的主模型,junior 是冻结的辅助模型;handoff 指的是两者在生成过程中切换控制权。论文里用词边界随机切换,模拟“接力式”推理。

为什么单纯加 KL 惩罚不够?因为 KL 只能约束平均分布别离得太远,不能保证某个具体接力点 junior 一定接得住。TRL 的优势在于它把“能不能接着生成”直接写进 rollout 结构里,而不是只靠一个软约束去猜。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是在奖励函数上小修小补,而是把 rollout 结构变成研究对象,这个切口挺新,且问题真实。

实验合理度:★★★★☆ 单挑、接力、分布漂移、可读性、KL 消融都测了,逻辑完整;不过主要还是围绕数学任务展开,外推还需更多验证。

学术研究价值:★★★★☆ 这篇论文把“兼容性”从口号变成可测量目标,对多模型协作和可解释推理都有启发。

稳定性:★★★☆☆ 结果看起来不脆,但双模型 rollout 天然更复杂,训练后期还出现性能回落,说明稳定性还没到可以随便上生产的程度。

适应性以及泛化能力:★★★☆☆ 对可验证奖励任务很合适,但离开放式对话、复杂工具调用还有距离。

硬件需求及成本:★★★☆☆ 训练时要双前向,成本不低;好在作者做了系统优化,但这仍不是低成本方案。

复现难度:★★★☆☆ 思路清楚,但涉及 tandem rollout、vLLM 改造和长链路训练,工程复现门槛不算低。

产品化成熟度:★★★☆☆ 在数学推理、多人接力、模型协作监控等场景有潜力,但还需要更大规模与更多任务验证。

可能的问题:方法依赖可验证奖励,且双模型推理成本较高;对开放域任务是否同样有效,还没有足够证据。


主要参考文献

Difan Jiao, Raghav Singhal, Robert West, Ashton Anderson. Tandem Reinforcement Learning with Verifiable Rewards. arXiv:2606.28166v1, 2026.
Shao et al. Group Relative Policy Optimization (GRPO).
Hamade et al. Tandem training.
West et al. Tandem training in language modeling.

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,方便更快通过~
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。