LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12809 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:强化学习

共 130 篇
最新SOTA!多目标强化学习不用改算法,只换网络结构就能让HV暴涨132%?
大模型与智能体

最新SOTA!多目标强化学习不用改算法,只换网络结构就能让HV暴涨132%?

单目标强化学习靠“换网络结构”就能白捡一大截性能,多目标强化学习却还在算法泥潭里打转?马萨里克大学和阿托大学的最新研究直接把SimbaV2架构搬进MORL,HV暴涨132%,证明“算法不够,架构来凑”这条路在多目标领域同样走得通。对正纠结算法创新还是架构升级的读者来说,这篇论文给出了一个极具性价比的新方向。

GPT-4.1给推荐系统暖启动:线上180万用户实测CTR涨9.51%
大模型与智能体

GPT-4.1给推荐系统暖启动:线上180万用户实测CTR涨9.51%

这篇来自NAVER WEBTOON的工业界论文,把大语言模型从“在线排序器”降级成了“离线先验估计器”,用GPT-4.1从评论文本里提炼贝叶斯先验给Thompson采样暖启动。真实线上A/B/C测试近180万用户,冷启动10-49印象桶CTR涨了9.51%,还顺手揭示了一个反直觉现象:内容先验降CTR却升CVR。想抄作业的做推荐的都该看看。

AI · PAPER
视觉与图像

清华自进化新框架:让机器人学会自己找“坑”,失败率狂降67%!

机器人训练有个“鬼打墙”现象:数据越采越多,失败率却纹丝不动。清华这篇工作直接告诉机器人“哪里不行补哪里”——用一个轻量关键性模型引导数据采集,失败率最高降67%,还顺手解决了VLA微调的平台期问题。思路极简,效果很硬,值得一读。

AI · PAPER
大模型与智能体

测试时计算还能这么省?中山大学SVR只需一半token精度反超oracle

数学考试里有个经典场面:学霸写完就交卷,学渣越改越错。大模型推理也有这毛病——简单题算力浪费,难题越修越歪。中山大学这篇新论文,教模型“自我检查”:有把握才交卷,没底就再改一轮。结果平均2.99轮推理,精度反而超过固定10轮,还省了一大半token。这招龙哥看了直呼内行!

AI · PAPER
视觉与图像

机器人规划新范式:自动学习有向时间成本,14点提升不是梦

还在发愁机器人规划里怎么设计奖励函数?来自香港浸会大学的这篇论文直接告诉你:不用愁!它从无奖励的演示日志里“挖”出时间距离,让世界模型规划得又快又准,导航成功率直接拉满,操作任务也大幅提升。这正是龙哥一直在说的:比起花里胡哨的模型结构,搞清楚“规划目标从哪来”往往更重要。

真人实验提升28.7%!RL2让机器人学会“该出手时才出手”
视觉与图像

真人实验提升28.7%!RL2让机器人学会“该出手时才出手”

当机器人VLA模型在域外任务中频频翻车,RL²给出了一个既聪明又高效的解法:只在预测到即将失败时,才调用离线强化学习产生的多样化动作来“组合引导”,否则就安心跟着原始VLA走。这项研究不仅揭示了“成功/失败状态缩放定律冰火两重天”的反直觉结论,还在真实机器人上带来了接近30%的成功率提升——关键是,所有模块都是轻量+离线,部署成本极低。值得所有做机器人泛化操

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球