母语推理只掉3个点?Apple最新多语言GRPO实证
Apple Research出品,一份覆盖9个模型、11种训练语言、最多23种训练变体的大规模 GRPO 多语言实验。它用数据回答了「非英语推理训练到底行不行」这个老问题,还挖出了跨语言迁移背后的隐藏退化风险。做多语言强化学习或推理模型训练的同学,这份图谱值得收藏。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
Apple Research出品,一份覆盖9个模型、11种训练语言、最多23种训练变体的大规模 GRPO 多语言实验。它用数据回答了「非英语推理训练到底行不行」这个老问题,还挖出了跨语言迁移背后的隐藏退化风险。做多语言强化学习或推理模型训练的同学,这份图谱值得收藏。
斯坦福Chelsea Finn团队的新作。机器人操作策略学会了但跑得慢,这工作直接给模仿学习加装一个强化学习训练的速度策略,不采新数据、不动原策略,在倒水、投掷等动态任务上提速超2.4倍,思路轻巧、实验扎实,值得一读。
你有没有被电商AI导购气得牙痒痒过?明明说了“今天就要”,它偏给你推明天才发货的。京东和人大这篇新研究,就是让购物Agent学会从真实用户的吐槽和购买行为中自己进化,不用人工标注,推荐效果直接起飞。
逆强化学习难在双层优化里的逆Hessian-向量积,又贵又不稳。这篇来自俄罗斯HSE大学的工作证明了一个漂亮结论:内层最优时Hessian就是Fisher信息矩阵的常数倍,再用流式素描去近似,存储从O(d²)直接降到O(md)。方法在CartPole和LQR上都跑出了不错效果,思路清爽,值得一读。
这可能是目前“无参考后训练”最扎实的一篇落地研究:小米直接用GRPO把46语言翻译模型的无参考质量分数推过了谷歌翻译和GPT-5,还顺手开源了模型和代码。想搞懂“不依赖参考译文怎么训翻译模型”,这篇值得精读。
潜在世界模型越来越火,可学界一直缺一把能解释“为什么这个模型规划成功、那个却失败”的尺子。本文从SIGReg与VISReg的受控对比入手,把诊断对象从单一编码器扩展到编码器+预测器+规划器三件套,提出VIScore;相关度冲到0.75以上,校准误差还能低于常量拟合,属于世界模型方向稀缺的工具型工作。
搜索智能体总是"检索到答案却答不出来"?问题很可能出在上下文干扰。港中大等机构这篇研究系统地定位了干扰源——最新检索回来的文档,并设计了蒸馏式上下文精炼器,让智能体在"生成"之前先"精炼",可靠性和效率双双提升。看完这篇,对多轮搜索智能体的调优思路会有新的启发。
看长视频最怕"看多少、看哪里"的选择困难。商汤这篇EVA直接用强化学习把"先规划再看片"的训练出来,多个长视频基准提升6-12%,视觉token还省得惊人。让AI学会"聪明地看",这个方向值得重点关注。
同样一个因果语言模型,不加回归头、不加策略头,只靠输出token就把三步收益预测和五ETF动态配置全干了;池化净夏普从1.394提到1.494,2025年多模态优势最猛。想看看语言模型怎么绕过"换任务就换头"的套路直接当金融决策接口?这篇值得一读。
先把镜头拉远一点。物理学家手里有一堆实验数据,然后想从里面挖出一条公式——比如爱因斯坦那个 E = mc²。放在过去,这得靠灵光一现。
为什么值得读?CVPR 2026最佳论文荣誉提名作品,把“攻击-防御”对抗博弈引入SAM提示词优化——用攻击者主动制造干扰,逼出能抗干扰的提示词优化器,全程无需下游任务标注,即插即用,医学图像上最多涨超15个百分点。思路清奇,值得一看。
视频生成模型在自动驾驶里一直是“吃钱大户”,训练花钱推理更花钱。华中科大这波操作骚气:让视频大模型只在训练时当“免费家教”,推理时直接扔了它,结果单目摄像头91.5 PDMS登顶NAVSIM,延迟还比别人低一大截😏 这便宜占得,值得好好看看。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球