LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:Agent

共 137 篇
阿里USB基准发布:5274条真实购物轨迹,支持多轮强化学习
大模型与智能体

阿里USB基准发布:5274条真实购物轨迹,支持多轮强化学习

电商推荐系统想离线做策略评估,最缺的就是一个“真实买家”。阿里和人大等团队提出的RecVerse,让模型真的去看截图“逛街”,还配了套三层记忆和轨迹级奖励,模拟出来的购物行为既像真人一样会犹豫比较,又能买到用户真想买的东西,顺手开源了5千多条真实轨迹的交互式基准。做推荐、做用户增长的同学值得一读。

让AI学会货比三家?普林斯顿这个基准至今无人超越
大模型与智能体

让AI学会货比三家?普林斯顿这个基准至今无人超越

这篇被引1300+次的开创性工作,来自普林斯顿大学。WebShop用118万件真实商品和1.2万条人工指令,把“语言智能体”的评测从玩具级任务搬进接近真实的电商场景——AI要自己读懂需求、搜索商品、挑选项、下单。更难得的是,训练好的智能体能零样本迁移到真实Amazon和eBay,是语言grounding方向绕不开的经典基准。

单次采样效果优于PPO/GRPO厦大&南洋理工新方法大涨15个点
大模型与智能体

单次采样效果优于PPO/GRPO厦大&南洋理工新方法大涨15个点

智能体强化学习正处在大模型后训练的核心位置,但PPO太贵、GRPO又存在信用分配短板。本文提出SAPO,用一条自回归流同时搞定策略与价值估计,在ALFWorld和WebShop上比PPO/GRPO平均涨15.1/12.1个百分点,还省掉独立critic、提速33.2%。一句话:值估计的便宜和单采样的高效,这次全都要。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球