龙哥最想提醒大家注意的就是这一部分。论文发现,某些模型与语言的组合,训练后会在你没留意的任务上出现断崖式退化。最典型的案例是 Qwen3(非 Base)家族:用斯瓦希里语或泰卢固语训练后,英语内容任务直接崩盘。看表3。Qwen3-1.7B 用泰卢固语训练后,英语任务上掉了8.1个百分点;Qwen3-4B 更惨,用泰卢固语训练后英语任务掉了13.6个百分点,用斯瓦希里语训练直接掉19.2个百分点;连 8B 版本也逃不掉,斯瓦希里语训练导致英语任务退化5.4个百分点。表3:英语推理奖励下,英语内容的多语言推理健身房任务(训练时未见)上的语言相关退化。行是训练语言,列是评估语言,单元格报告相对原始模型的avg@8变化(百分点)。这就很让人血压升高了。明明训练的是数学推理,模型做数学题的能力确实涨了,但英语语料上的综合能力反而大倒退。这种「按下葫芦浮起瓢」的剧情,正是多语言 RLVR 训练里最隐蔽的坑。这些语言相关的退化现象在 Hard Math 任务上同样存在。图5 展示了 Hard Math 上的表现:Qwen3-8B 用孟加拉语训练后,Hard Math 平均下降超过13个百分点;Qwen3-4B 更夸张,用泰卢固语或斯瓦希里语训练后 Hard Math 掉得惨不忍睹。而英语训练虽然也不是万能灵药,但至少能稳住阵脚。图5:英语推理奖励下的Hard Math语言相关退化。柱状图报告相对原始模型的avg@8变化(百分点),在所有评估语言上取平均。更值得注意的是任务类型差异。Easy Math(MGSM + PolyMath low)上,几乎所有训练语言都能带来正提升;但 Hard Math 上,低资源语言训练带来的负效果就藏不住了。论文分析认为,这可能与模型在低资源语言上的预训练基础较弱有关——当推理复杂度上升时,模型被迫在「更陌生的语言通道」里做更烧脑的计算,此前被掩盖的缺陷就全部暴露了。奖励类型也会影响退化方向。图6 展示了一个有趣的对比:gemma-3-1b-it 和 gemma-3-4b-it 使用英语推理奖励时,Easy Math 上表现良好;但 SmolLM3-3B 在 Hard Math 上,母语奖励变体反而比英语奖励变体退化更严重。这说明奖励设计的选择不仅影响平均水平,有时甚至会改变退化的分布。图6:奖励相关退化示例。柱状图报告相对原始模型的avg@8变化(百分点),在所有评估语言上取平均。龙哥看到这里默默感叹一句:多语言训练真不是「跑通就行」的活儿啊。
[1] Shao Z, Wang P, Zhu Q, et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models[J]. 2024.(提出GRPO的原始论文)[2] Qi Y, et al. Reasoning language effects in multilingual LLMs[J]. 2025.(母语推理损失研究)[3] Huang Y, et al. Crosslingual transfer under GRPO training[J]. 2026a.(跨语言迁移GRPO研究)[4] Dobler K, et al. Multilingual Reasoning Gym: Procedural generation of multilingual reasoning tasks[J]. 2026.(多语言推理训练数据集)[5] Yu Q, et al. DAPO: An Open-Source LLM Reinforcement Learning System at Scale[J]. 2025.(DAPO训练损失)[6] Park J, et al. Reasoning drift toward dominant pretraining languages under RLVR[J]. 2025.(推理语言漂移研究)[7] Shi F, et al. Multilingual Grade School Math Benchmark (MGSM)[J]. 2022.(MGSM基准)[8] An K, et al. Difficulty matching in GRPO training[J]. 2025.(难度匹配研究)原文链接:https://arxiv.org/pdf/2608.13698
英语、中文、斯瓦希里,训练一种语言却能点亮一片语言星空?😏 想 Get 这份「跨语言推理强化学习」的独家地图,和龙哥一起追踪 Apple 最新研究?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群