LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12809 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:强化学习

共 130 篇
母语推理只掉3个点?Apple最新多语言GRPO实证
大模型与智能体

母语推理只掉3个点?Apple最新多语言GRPO实证

Apple Research出品,一份覆盖9个模型、11种训练语言、最多23种训练变体的大规模 GRPO 多语言实验。它用数据回答了「非英语推理训练到底行不行」这个老问题,还挖出了跨语言迁移背后的隐藏退化风险。做多语言强化学习或推理模型训练的同学,这份图谱值得收藏。

俄高校最新证明:逆强化学习内层Hessian天生等于Fisher矩阵
大模型与智能体

俄高校最新证明:逆强化学习内层Hessian天生等于Fisher矩阵

逆强化学习难在双层优化里的逆Hessian-向量积,又贵又不稳。这篇来自俄罗斯HSE大学的工作证明了一个漂亮结论:内层最优时Hessian就是Fisher信息矩阵的常数倍,再用流式素描去近似,存储从O(d²)直接降到O(md)。方法在CartPole和LQR上都跑出了不错效果,思路清爽,值得一读。

世界模型规划总翻车?VIScore三个维度直接定位病根
视觉与图像

世界模型规划总翻车?VIScore三个维度直接定位病根

潜在世界模型越来越火,可学界一直缺一把能解释“为什么这个模型规划成功、那个却失败”的尺子。本文从SIGReg与VISReg的受控对比入手,把诊断对象从单一编码器扩展到编码器+预测器+规划器三件套,提出VIScore;相关度冲到0.75以上,校准误差还能低于常量拟合,属于世界模型方向稀缺的工具型工作。

多轮搜索Agent新范式:小模型蒸馏精炼上下文,性能逼近GPT-4
大模型与智能体

多轮搜索Agent新范式:小模型蒸馏精炼上下文,性能逼近GPT-4

搜索智能体总是"检索到答案却答不出来"?问题很可能出在上下文干扰。港中大等机构这篇研究系统地定位了干扰源——最新检索回来的文档,并设计了蒸馏式上下文精炼器,让智能体在"生成"之前先"精炼",可靠性和效率双双提升。看完这篇,对多轮搜索智能体的调优思路会有新的启发。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球