← 返回 PaperDaily 大模型与智能体

母语推理只掉3个点?Apple最新多语言GRPO实证

Apple Research出品,一份覆盖9个模型、11种训练语言、最多23种训练变体的大规模 GRPO 多语言实验。它用数据回答了「非英语推理训练到底行不行」这个老问题,还挖出了跨语言迁移背后的隐藏退化风险。做多语言强化学习或推理模型训练的同学,这份图谱值得收藏。

母语推理只掉3个点?Apple最新多语言GRPO实证
原论文信息如下:
论文标题:
GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
发表日期:
2026年8月
发表单位:
Hasso Plattner Institute & ELLIS Unit Potsdam(部分工作完成于Apple实习期间)
原文链接:
https://arxiv.org/pdf/2608.13698

最近开源模型的推理能力大战打得火热,但绝大多数 GRPO 实验都围着英语打转。英语之外的推理训练效果如何?用斯瓦希里语、泰卢固语这种低资源语言训练,模型会不会直接摆烂?Apple Research 这篇大规模实证研究,直接拉了一张 9 模型 × 11 语言 × 双奖励设置的超大实验矩阵,把这些此前没人系统回答的问题一次问了个透。
结论相当有嚼头:母语推理训练的准确率损失并没有之前小规模研究说的那么吓人,平均只有几个百分点;跨语言迁移强得离谱,训练孟加拉语居然能给中文推理带来巨大提升;但与此同时,某些模型与语言的组合会在你没留意的任务上突然崩盘,比如 Qwen3-4B 用泰卢固语训练后,英语内容任务出现 13 个百分点以上的倒退。这种「按下葫芦浮起瓢」的现象,正是多语言 RLVR 训练里最需要警惕的暗坑。

多语言推理训练:英语之外的新 frontier

先交代背景。长思维链推理已成为大语言模型的核心能力,而 GRPO 这种基于可验证奖励的强化学习方法是背后的主要推手。模型在训练中不断探索解题路径,系统只根据最终答案对不对给奖励,模型自己慢慢摸索出长链推理的套路。
问题在于,这套流程几乎完全在英语世界自嗨。虽然很多开源模型都做了多语言预训练,但后训练阶段几乎全是英语的天下。业界一直流传:如果用非英语提问,模型的推理链会不自觉地漂移到英语,即使强行要求用母语推理,准确率也会明显下降。早前的一些研究确实观察到这个现象,但这些实验的规模都太小,往往只测了一两个模型、覆盖几种语言,得出的结论参考价值有限。
这篇论文要做的,就是把这个悬而未决的问题彻底摊开:大规模 GRPO 训练到底能不能脱离英语?母语奖励和英语奖励的差距有多大?跨语言迁移是普遍现象还是个别模型的运气?有没有隐藏的语言相关性能退化?下面咱们一个一个拆。
论文核心实验设计概览(训练数据多语言推理健身房 + 多模型多语言 GRPO 训练流程图)

大规模实验设计:9模型×11语言×2奖励的全面覆盖

要做大规模多语言 GRPO 实验,第一步得有海量多语言训练数据。论文用的是 Multilingual Reasoning Gym(多语言推理健身房),这个数据集可以程序化生成 14 种语言的无限难度可调样本,覆盖代数、算法、逻辑、几何、游戏等多种任务类型,特别适合 RLVR 训练。
实验设置相当硬核:训练覆盖 Qwen3-Base 系列(1.7B/4B/8B)、Qwen3 后训练系列(1.7B/4B/8B)、SmolLM3-3B 和 gemma-3-1b-it/4b-it,横跨三个模型家族,既有 Base 模型也有指令微调版本,参数量从 1B 到 8B 不等。训练语言选了 11 种:英语、中文、德语、法语、西班牙语、俄语、日语、泰语、孟加拉语、泰卢固语和斯瓦希里语,另留了意大利语、韩语、葡萄牙语三种完全未见的语言做 heldout 评估。
更有意思的是推理语言奖励的设置。论文区分了两种奖励:英语推理奖励和母语推理奖励。前者要求模型在推理时使用英语,后者则要求推理语言跟提示词语言保持一致。每个训练语言都跑英语奖励变体,凡是初始模型有 2.5% 以上概率使用目标语言的组合再额外跑母语变体,每个模型最多训练 23 个变体,总共跑了 500 步,batch size 512。
评估方面同样不含糊:每个 checkpoint 都要在所有可用语言上跑一遍,用 avg@8 指标,评估集除了多语言推理健身房的已见/未见任务,还包含 MGSM 和 PolyMath 两个外部数学基准。如此庞大的实验矩阵,论文还专门做了难度课程控制,避免任务太难导致小模型直接摆烂。
图1:评估期间检测到的推理语言分布。论文将推理语言划分为四个互斥类别:(1)奖励语言;(2)提示词语言(若与奖励语言不同);(3)英语(若与前两者均不同);(4)所有其他语言。结果在所有评估基准和训练语言上取平均。

关键发现:母语推理的代价比想象中小

先看最核心的问题:母语推理到底比英语推理差多少?之前 Qi et al. (2025) 的研究报告了双位数百分点的准确率下降,而 Huang et al. (2026a) 也观察到在中文或德语上使用母语奖励会掉 10 个百分点。如果这个结论成真,那所有非英语推理落地场景都得掂量掂量。
这篇论文的结论要温和得多。在已见语言上,英语奖励的平均优势只有 1.3 到 4.1 个百分点,具体取决于模型。翻译成人话就是:用母语训练,模型确实会差一点,但远没有之前说的那么夸张。而且这种差距在不同语言上分布不均——孟加拉语、泰卢固语、斯瓦希里语这些低资源语言,英语奖励的优势明显更大,说明模型在这些语言上的推理能力本身较弱,用英语推理可以部分弥补。
更有趣的是语言一致性表现。母语奖励在已见语言上几乎完美控制推理语言:94.9% 的 rollout 使用目标语言。但在未见语言上,单语训练的母语奖励模型会分裂成三股:51% 用训练语言,35% 用提示词语言,9% 用英语。而多语训练(均匀采样 11 种语言)的母语奖励模型在已见和未见语言上都能稳定匹配提示词语言,说明多语言混合训练对语言一致性的泛化非常有帮助。
不过论文也留了个心眼:英语奖励模型在未见语言上依然有 89.7%(单语)和 99.1%(多语)的 rollout 用英语推理,说明英语作为「默认推理语言」的地位相当稳固。母语奖励模型在未见语言上的表现下滑,部分原因可能是「训练-评估语言不匹配」——模型在未见语言上会随机切换推理语言,导致奖励机制未能完全发挥。
图2:每个模型英语推理奖励相对母语推理奖励的平均优势(avg@8),在所有基准和单语训练语言上取平均。已见和未见评估语言分别报告。†模型平均排除了部分训练语言,详见第4.1节。
图3:按训练语言划分的英语相对母语推理奖励优势(avg@8),针对已见评估语言,在图2的模型上取平均。多语言柱状图覆盖了多语言训练期间所见的所有11种评估语言。

跨语言迁移:训练一种语言,提升多种语言

如果说母语奖励的温和表现已经够让人惊喜,那跨语言迁移的结果简直可以用「恐怖如斯」来形容。论文把所有单语 checkpoint 放到了一个 11×14 的训练语言×评估语言矩阵里,结果发现绝大多数同语言提升都能转移到其他语言上。
看表1a的具体数据:英文训练在英文上提升 25.9 个百分点,这个提升几乎原封不动地转移到了法语(21.8)、日语(21.5)、泰语(22.6)等语言上。更夸张的是,训练法语任务时,西班牙语单语训练几乎追平了目标语言训练——西班牙语训练在法语上提升了 24.6 个百分点,而法语训练自己的提升是 25.6 个百分点,差距只有 1 个百分点。
这一发现对低资源语言意义重大。如果训练斯瓦希里语效果不好,也许可以试试用同语系的高资源语言做跳板。论文还揭示了一个反直觉的现象:英语并不总是最好的迁移源。在某些模型上,训练孟加拉语反而给中文带来了最佳迁移效果(Qwen3-4B-Base 和 Qwen3-8B),这说明不同语言之间的共享推理机制远比「英语中心论」假设的复杂得多。
多语言训练的表现也值得关注。对 Qwen3-Base 系列来说,一个多语言模型几乎追平了为每种语言分别挑选最佳迁移源的 oracle 效果,只低 0.3 个百分点,而且只需要训练一个模型就能覆盖所有语言。对 Qwen3(非 Base)系列,这个差距略大(1.3 个百分点),但依然远好于随机选择一个源语言。
表1:在已见和未见多语言推理健身房任务上相对基线的avg@8提升(百分点)。结果在英语推理奖励下的全部9个基础模型上取平均。每个评估语言列内从浅蓝到深蓝着色。多语言训练时,意大利语(it)、韩语(ko)和巴西葡萄牙语(pt)为未见语言。
跨语言迁移在未见任务(OOD)上也表现出色。表1b显示,未见任务的整体迁移提升依然为正,而且同语言训练不再稳居第一,某些情况下其他语言的训练反而更好。表2进一步展示了 MGSM 和 PolyMath 的表现:在 Qwen3-Base 系列上,同语言训练和跨语言迁移的提升几乎一致;但 Qwen3(非 Base)系列的 Hard Math 出现了显著退化,这个现象下一节细讲。

警惕!语言相关的性能退化现象

龙哥最想提醒大家注意的就是这一部分。
论文发现,某些模型与语言的组合,训练后会在你没留意的任务上出现断崖式退化。最典型的案例是 Qwen3(非 Base)家族:用斯瓦希里语或泰卢固语训练后,英语内容任务直接崩盘。
看表3。Qwen3-1.7B 用泰卢固语训练后,英语任务上掉了8.1个百分点;Qwen3-4B 更惨,用泰卢固语训练后英语任务掉了13.6个百分点,用斯瓦希里语训练直接掉19.2个百分点;连 8B 版本也逃不掉,斯瓦希里语训练导致英语任务退化5.4个百分点。
表3:英语推理奖励下,英语内容的多语言推理健身房任务(训练时未见)上的语言相关退化。行是训练语言,列是评估语言,单元格报告相对原始模型的avg@8变化(百分点)。
这就很让人血压升高了。明明训练的是数学推理,模型做数学题的能力确实涨了,但英语语料上的综合能力反而大倒退。这种「按下葫芦浮起瓢」的剧情,正是多语言 RLVR 训练里最隐蔽的坑。
这些语言相关的退化现象在 Hard Math 任务上同样存在。图5 展示了 Hard Math 上的表现:Qwen3-8B 用孟加拉语训练后,Hard Math 平均下降超过13个百分点;Qwen3-4B 更夸张,用泰卢固语或斯瓦希里语训练后 Hard Math 掉得惨不忍睹。而英语训练虽然也不是万能灵药,但至少能稳住阵脚。
图5:英语推理奖励下的Hard Math语言相关退化。柱状图报告相对原始模型的avg@8变化(百分点),在所有评估语言上取平均。
更值得注意的是任务类型差异。Easy Math(MGSM + PolyMath low)上,几乎所有训练语言都能带来正提升;但 Hard Math 上,低资源语言训练带来的负效果就藏不住了。论文分析认为,这可能与模型在低资源语言上的预训练基础较弱有关——当推理复杂度上升时,模型被迫在「更陌生的语言通道」里做更烧脑的计算,此前被掩盖的缺陷就全部暴露了。
奖励类型也会影响退化方向。图6 展示了一个有趣的对比:gemma-3-1b-it 和 gemma-3-4b-it 使用英语推理奖励时,Easy Math 上表现良好;但 SmolLM3-3B 在 Hard Math 上,母语奖励变体反而比英语奖励变体退化更严重。这说明奖励设计的选择不仅影响平均水平,有时甚至会改变退化的分布。
图6:奖励相关退化示例。柱状图报告相对原始模型的avg@8变化(百分点),在所有评估语言上取平均。
龙哥看到这里默默感叹一句:多语言训练真不是「跑通就行」的活儿啊。

对多语言RLVR训练的启示与展望

这篇论文给行业提了一个相当务实的醒。
第一,母语推理训练的代价比以往研究显示的小得多。如果你的产品需要用户用母语提问、用母语输出,那么大规模 RLVR 训练完全可以承担推理语言控制的任务,准确率损失通常只有一两个到四五个百分点,对可读性和用户体验的提升来说,这笔账是划算的。
第二,跨语言迁移是真实且普遍存在的。这意味着对低资源语言,不必一开始就砸大量预算去单独训练,可以先观察高资源语言训练的迁移效果。论文甚至给出了一些具体线索:对某些模型,孟加拉语训练比英语训练更有利于中文推理,这为「借道迁移」提供了思路。
第三,也是最重要的,多语言训练必须配套多语言评测。单看同语言提升效果,几乎所有训练语言都「一片向好」;但一旦把评测范围扩大到其他语言、其他任务难度、英语内容任务,隐藏的退化立即现出原形。论文建议在部署多语言 RLVR 模型时,至少覆盖以下三类评测:已见语言数学任务、未见语言数学任务、英文内容综合任务。
论文的局限也很明显。所有实验都限制在8B以下模型,更大的模型是否会出现不同的迁移规律,还是未知数。推理语言奖励的初始门槛也限制了部分模型语言组合的训练(比如某些模型一开始就不怎么说泰语,那泰语推理奖励就没有意义)。此外,论文没有提供针对退化的「解药」——它更像是画了一张精确的危险地图,救人的方案还得后续研究来补。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?Apple Research最新大规模研究,覆盖9个模型、11种训练语言的GRPO强化学习实验,发现非英语奖励与英语奖励差距极小,跨语言迁移显著,但特定语言组合存在严重性能退化,为多语言RLVR训练提供重要参考。
这篇工作最值得看的点是什么?母语推理奖励与英语推理奖励差距较小(1.3-4.1pp),跨语言迁移显著,但存在语言相关的性能退化现象。
这篇工作的边界或风险在哪里?优点:大规模系统研究(9模型×11语言×2奖励),发现跨语言迁移和语言相关退化现象,对多语言RLVR训练有重要指导意义。缺点:使用模板化数据而非真实场景数据,单种子实验,未对每个配置单独调参,未研究KL惩罚的影响。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

大规模实证研究GRPO在非英语和多语言环境下的训练效果,系统比较不同基础模型、训练语言和推理语言奖励对推理性能及跨语言迁移的影响。

实验合理度:★★★★☆

avg@8准确率(每个提示8个rollout的平均正确率)。

学术研究价值:★★★★☆

大规模实证研究GRPO在非英语和多语言环境下的训练效果,系统比较不同基础模型、训练语言和推理语言奖励对推理性能及跨语言迁移的影响;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

每个语言配置训练500步,每步64个提示、8个rollout/提示(batch size 512),在Nvidia A100 80GB GPU节点上使用HSDP模型分片和vllm数据并行rollout生成。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:使用模板化数据而非真实场景数据,单种子实验,未对每个配置单独调参,未研究KL惩罚的影响。

主要参考文献

[1] Shao Z, Wang P, Zhu Q, et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models[J]. 2024.(提出GRPO的原始论文)
[2] Qi Y, et al. Reasoning language effects in multilingual LLMs[J]. 2025.(母语推理损失研究)
[3] Huang Y, et al. Crosslingual transfer under GRPO training[J]. 2026a.(跨语言迁移GRPO研究)
[4] Dobler K, et al. Multilingual Reasoning Gym: Procedural generation of multilingual reasoning tasks[J]. 2026.(多语言推理训练数据集)
[5] Yu Q, et al. DAPO: An Open-Source LLM Reinforcement Learning System at Scale[J]. 2025.(DAPO训练损失)
[6] Park J, et al. Reasoning drift toward dominant pretraining languages under RLVR[J]. 2025.(推理语言漂移研究)
[7] Shi F, et al. Multilingual Grade School Math Benchmark (MGSM)[J]. 2022.(MGSM基准)
[8] An K, et al. Difficulty matching in GRPO training[J]. 2025.(难度匹配研究)
原文链接:https://arxiv.org/pdf/2608.13698

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
英语、中文、斯瓦希里,训练一种语言却能点亮一片语言星空?😏 想 Get 这份「跨语言推理强化学习」的独家地图,和龙哥一起追踪 Apple 最新研究?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。