LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大语言模型

共 319 篇
母语推理只掉3个点?Apple最新多语言GRPO实证
大模型与智能体

母语推理只掉3个点?Apple最新多语言GRPO实证

Apple Research出品,一份覆盖9个模型、11种训练语言、最多23种训练变体的大规模 GRPO 多语言实验。它用数据回答了「非英语推理训练到底行不行」这个老问题,还挖出了跨语言迁移背后的隐藏退化风险。做多语言强化学习或推理模型训练的同学,这份图谱值得收藏。

Meta FAIR新作:AI科研智能体装上"预算管家",2/3算力追平24小时成绩
大模型与智能体

Meta FAIR新作:AI科研智能体装上"预算管家",2/3算力追平24小时成绩

AI科研智能体缺的不是想法,而是算力。本文提出研究偏好模型(RPM),相当于给智能体装了个“预算管家”:在花GPU之前,先让LLM当评委挑选最有潜力的候选方案。AIRS-Bench上,用不到三分之二的算力就能追上无引导基线24小时的成绩,思路清晰,落地性强。

UC Berkeley新基准Vero:最强AI写证明,43个代码仓库只通关27个
大模型与智能体

UC Berkeley新基准Vero:最强AI写证明,43个代码仓库只通关27个

AI生成的代码,你敢直接上生产吗?单元测试过了不代表没bug,仓库级形式化验证才是终极保险丝。UC Berkeley等机构提出Vero,要求智能体在一个多模块Lean 4代码仓库里同时写实现和证明,结果最强配置只通关27/43——答案藏在仓库级一致性和共享引理库的组织能力里。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球