LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:强化学习

共 130 篇
阿里USB基准发布:5274条真实购物轨迹,支持多轮强化学习
大模型与智能体

阿里USB基准发布:5274条真实购物轨迹,支持多轮强化学习

电商推荐系统想离线做策略评估,最缺的就是一个“真实买家”。阿里和人大等团队提出的RecVerse,让模型真的去看截图“逛街”,还配了套三层记忆和轨迹级奖励,模拟出来的购物行为既像真人一样会犹豫比较,又能买到用户真想买的东西,顺手开源了5千多条真实轨迹的交互式基准。做推荐、做用户增长的同学值得一读。

LG Chem最新实测:AI充电让续航估算准18.8%,快充提速1.5倍
大模型与智能体

LG Chem最新实测:AI充电让续航估算准18.8%,快充提速1.5倍

电动汽车的"充电焦虑"终于等来了AI解法。Lucid与通用汽车的工程师用强化学习、LSTM和模糊逻辑组合拳,在LG Chem下一代BMS上实测:SOC估算精度提升18.8%,电池寿命延长28.5%,充电成本下降21.6%。既有产业数据又有落地细节,值得所有关注新能源车电池管理的人一读。

加州真实数据实测:电网调度告别负荷预测,强化学习闭式解稳了
大模型与智能体

加州真实数据实测:电网调度告别负荷预测,强化学习闭式解稳了

新能源越装越多,电网调度的老套路——靠预测吃饭——越来越不好使。预测一错,调度全乱。这篇论文干脆把预测模块整个丢掉,让强化学习直接从运行数据里学调度策略,还是闭式解!又稳又能解释。想在电力系统里玩RL的、搞控制优化的,这篇值得一读。

让AI学会货比三家?普林斯顿这个基准至今无人超越
大模型与智能体

让AI学会货比三家?普林斯顿这个基准至今无人超越

这篇被引1300+次的开创性工作,来自普林斯顿大学。WebShop用118万件真实商品和1.2万条人工指令,把“语言智能体”的评测从玩具级任务搬进接近真实的电商场景——AI要自己读懂需求、搜索商品、挑选项、下单。更难得的是,训练好的智能体能零样本迁移到真实Amazon和eBay,是语言grounding方向绕不开的经典基准。

单次采样效果优于PPO/GRPO厦大&南洋理工新方法大涨15个点
大模型与智能体

单次采样效果优于PPO/GRPO厦大&南洋理工新方法大涨15个点

智能体强化学习正处在大模型后训练的核心位置,但PPO太贵、GRPO又存在信用分配短板。本文提出SAPO,用一条自回归流同时搞定策略与价值估计,在ALFWorld和WebShop上比PPO/GRPO平均涨15.1/12.1个百分点,还省掉独立critic、提速33.2%。一句话:值估计的便宜和单采样的高效,这次全都要。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球