母语推理只掉3个点?Apple最新多语言GRPO实证
Apple Research出品,一份覆盖9个模型、11种训练语言、最多23种训练变体的大规模 GRPO 多语言实验。它用数据回答了「非英语推理训练到底行不行」这个老问题,还挖出了跨语言迁移背后的隐藏退化风险。做多语言强化学习或推理模型训练的同学,这份图谱值得收藏。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
Apple Research出品,一份覆盖9个模型、11种训练语言、最多23种训练变体的大规模 GRPO 多语言实验。它用数据回答了「非英语推理训练到底行不行」这个老问题,还挖出了跨语言迁移背后的隐藏退化风险。做多语言强化学习或推理模型训练的同学,这份图谱值得收藏。
这年头能见到一篇"把大模型跑不起来的原因逐条列清楚"的论文,真不容易。研究者把Nanbeige4.2-3B在Apple Silicon上五个独立bug连根拔起,还顺手给出分块预填充方案让上下文扩展2.7倍,干货密度极高。想在Mac上玩agent模型的同学,这份排雷报告必须收藏。
AI科研智能体缺的不是想法,而是算力。本文提出研究偏好模型(RPM),相当于给智能体装了个“预算管家”:在花GPU之前,先让LLM当评委挑选最有潜力的候选方案。AIRS-Bench上,用不到三分之二的算力就能追上无引导基线24小时的成绩,思路清晰,落地性强。
AI编程智能体越跑越远,需求漂移、过程黑盒、发布甩锅怎么办?港科大(广州)提出的AppLooper,用多智能体协作+版本绑定证据链把整个开发流程钉死,让每一次变更都有据可查、有人负责。值得所有关心AI编程落地与可问责性的读者一读。
表格处理向来是大模型的"老大难":好好的二维表格,硬被拍扁成Markdown字符串,跨表联动全靠蒙。中科大这篇最新研究提出SheetCompass,用层次关系图还原表格的空间结构,配合多智能体协作推理,三大基准全面超车——这波操作,属实有点东西。
PET(正电子发射断层成像)是肿瘤、神经和心脏疾病诊断中重要的分子影像手段,能无创显示体内代谢活动。但PET天生有痛点:光子符合计数有限,图像信噪比低。
AI生成的代码,你敢直接上生产吗?单元测试过了不代表没bug,仓库级形式化验证才是终极保险丝。UC Berkeley等机构提出Vero,要求智能体在一个多模块Lean 4代码仓库里同时写实现和证明,结果最强配置只通关27/43——答案藏在仓库级一致性和共享引理库的组织能力里。
AI精神病这个风险,大多数安全评测根本发现不了——单轮测试看每条回答都"正常",30天连续对话却可能亲手养大一套妄想。这篇论文首次用15款主流模型×30天×4位评估员的纵向设计,把幻觉式共谋拆成了四种可量化的轨迹,值得每个做大模型安全的人细品。
本文是NeurIPS 2023的经典工作,也是大模型推理研究绕不开的一座里程碑:它把树搜索、自我评估、回溯这些经典AI思想,重新装回了大语言模型身上,让模型面对复杂任务时真正学会“多想几步”。24点游戏4%到74%的跨越,至今仍被反复引用与对比。
大模型推理集群的GPU浪费有多严重?这篇来自微软研究院、莱斯大学的系统论文,把扩缩容的“最小颗粒度”从整个模型打碎到单个算子,用毫秒级弹性换回最高36.3%的GPU节省,在A100和GB200集群上都验证了效果。做LLM infra的读者值得细读。
一个统一框架同时接管监控、鱼眼和行车记录仪三类交通视频,在AI City 2026出战三个赛道,FETV与第一名只差0.0007。这套「观察-推理-行动-验证」的智能体工作流拆解起来很有嚼头,适合所有对多模态视频理解与跨域泛化感兴趣的读者。
临床叙述时间线重建一直被当成“关系分类”来做,单篇报告缺时间锚点就抓瞎。本文用生成器-验证器迭代精炼的思路,配合新基准MedTempo,让大模型把症状先后顺序逐步“捋”清楚,GPT-4.1上EM最高提升9.3个点,思路干净、验证扎实。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球