LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:强化学习

共 130 篇
AI · PAPER
大模型与智能体

浙大美团联合提出SkillRise:任务越做越聪明,智能体学会举一反三

让AI智能体学会“举一反三”,而不是每次都从零开始。美团、浙大、上交大、新国立联合提出的SkillRise,通过端到端强化学习,让单一策略在执行任务中不断提炼技能文档,并在后续任务中复用。在三大Agent基准上,它用更少的资源,实现了更高的性能和明显的测试时扩展趋势。

AI · PAPER
大模型与智能体

潜世界模型“耳朵聋了”?ActSWM一招修复,Minecraft规划成功率飙升90%

潜世界模型能预测未来帧,却可能对动作指令“假装没听见”——这不是开玩笑,论文首次定义了这个叫“上下文坍塌”的致命缺陷。ActSWM只用两个干净约束(动作对比铰链损失+冻结读取器)就让Minecraft石料挖掘成功率从50%飙到95%,还能从GTA视频里反向恢复按键。问题实在、方案漂亮、实验扎实,值得所有做模型预测控制的朋友认真读一读。

AI · PAPER
视觉与图像

自动驾驶告别特权信息!Valeo.ai 500亿步开创新范式

继6月聊过Mila的Gigapixel自博弈训练之后,Valeo这篇Pictura直接更进一步:把强化学习的观察空间从特权矢量换成了摄像头第一视角的渲染图,彻底消除了部署时的表征鸿沟。500亿步训练后,效果居然还能跟特权基线掰手腕,零样本迁移到Waymo场景甚至反超——这才是自博弈该有的样子。

AI · PAPER
视觉与图像

复旦+字节跳动ISSTA'26:一招让LLM学会API测试常识

API测试最头疼的“冷启动”问题——没有OpenAPI规范、没有历史日志,只有一个请求样本,能自动写出靠谱断言吗?Restor告诉你,用强化学习(GRPO)微调一个轻量LLM,这事儿能成,而且字节跳动已经在生产环境跑起来了,采纳率直接干到96%以上。一篇来自复旦和字节跳动的ISSTA'26工作,实打实的工业级神器。

AI · PAPER
大模型与智能体

5条命令1秒验证,60年数学难题有了机器裁判

数学家们苦苦追寻了60年的Andrews-Curtis猜想,在长度-14的边界上,有一位独立研究者甩出了一套机器可验证的JSON证书——只需5条命令,1秒内就能让电脑成为定理的裁判。这像不像给数学猜想装上了“代码解释器”?想看看数学+代码如何联手攻克前沿难题?这篇论文值得你花一刻钟感受。

NVIDIA新作Agentic RL框架Molt:代码量锐减至9K,吞吐量持平Megatron
大模型与智能体

NVIDIA新作Agentic RL框架Molt:代码量锐减至9K,吞吐量持平Megatron

NVIDIA开源了Molt,一个专为智能体强化学习(Agentic RL)设计的PyTorch原生训练框架。代码量仅约8600行,却能在吞吐量上与业界顶级的Megatron堆栈掰手腕。对于天天改算法的研究者来说,这简直是福音,终于不用在层层抽象和复杂配置里找东西南北了。

新方法NSMA:把规则“钉”进神经网络,零样本称霸8大网络!
视觉与图像

新方法NSMA:把规则“钉”进神经网络,零样本称霸8大网络!

继2026年6月推过一篇强化学习搞定视频压缩之后,这回ABR领域又来了一个狠角色。电通大团队不仅一针见血地指出:多年来用来测试强化学习ABR策略泛化性的工具(只看平均带宽等统计量)是错的!还顺手把“规则”和“学习”的边界给消融了。 方法是真硬核:把经典码率选择的规则,直接以几何锚点的形式嵌进神经网络的潜在空间里,让网络“想跑偏都难”。训练只用3G数据,零微调

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球