LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:强化学习

共 130 篇
西安交大新作TempoGround:流式目标不再“跟丢”,3D指标均提升7.5
视觉与图像

西安交大新作TempoGround:流式目标不再“跟丢”,3D指标均提升7.5

视频流一帧一帧地来,模型能不能不串号、不手抖、不跟丢?西安交大联合EngineAI提出TempoGround,让视觉语言模型在流式输入下连续输出稳定的2D/3D框,3D精度平均提升7.5。这套“状态感知课程预测+强化学习”的组合拳,值得做具身智能和多模态感知的同学认真看一眼。

EMNLP 2026最新:对话推荐总翻车?DREAMS用双蒙特卡洛树让大模型记住偏好,成功率最高+56%
大模型与智能体

EMNLP 2026最新:对话推荐总翻车?DREAMS用双蒙特卡洛树让大模型记住偏好,成功率最高+56%

当大模型碰上对话推荐,最怕的不是模型笨,而是它“聊完就忘”。这篇EMNLP 2026主会论文直接抛弃了把上下文堆进Prompt的粗暴玩法,提出双节点蒙特卡洛树搜索框架DREAMS,一边主动问偏好,一边把对话状态变成精准检索查询,成功率平均提升7.43%,Redial上R@1高达0.507,还开源了代码,值得一读!

新范式!大模型自主设计质量多样性算法,机器人零干预学技能
视觉与图像

新范式!大模型自主设计质量多样性算法,机器人零干预学技能

想让机器人掌握一项新技能,传统做法是让专家手动设计各种评估函数和多样性指标,费时费力还经常翻车。这篇论文的思路很野:直接把自然语言任务描述丢给大模型,让大模型自己设计整套质量多样性算法的参数。结果如何?4个操作任务上生成的可用技能数量是专家方案的近70倍。

少花10倍算力!ASIL让开源小模型操作软件涨14个点
大模型与智能体

少花10倍算力!ASIL让开源小模型操作软件涨14个点

当Claude Code、Codex在代码世界里大杀四方时,GUI软件依然是智能体的"最后屏障"。上海交大与BIGAI提出ASIL,用结构化JSON观测+语义化代码动作替代截图点击,让GPT-5.4在380个任务上拿下81.6%的成功率,而同样的任务截图控制只有6.6%。一句话操作就能完成截图控制15次点击都完不成的活,这可能是智能体交互的一次范式革命。

卢森堡大学新研究:太空机器人没奖励信号也能自学修复,60分钟见效果
视觉与图像

卢森堡大学新研究:太空机器人没奖励信号也能自学修复,60分钟见效果

太空机器人一旦硬件故障,传统强化学习就抓瞎——因为真空中根本算不出奖励信号。卢森堡大学这篇工作把世界模型玩出了新高度:预训练阶段把奖励函数"记住"在隐空间里,部署后冻结奖励预测器、只更新转移动力学,60分钟无监督数据就能让机器人自我修复。三大任务、代码开源、效果诚实不吹牛,值得一读。

强化学习|攻击也嫌贵?理性DY攻击者模型让协议安全首次可判定
大模型与智能体

强化学习|攻击也嫌贵?理性DY攻击者模型让协议安全首次可判定

这可能是今年最值得安全协议研究人员读的一篇理论文:把干了四十年的Dolev-Yao攻击者从“能力模型”升级成“激励模型”,让攻击者学会算账,收益小于成本就不攻击。论文证明理性安全可判定,还给出了可计算的阈值,并在支付协议和ThreeBallot投票两个用例中展示了如何“用钱说话”。建议所有做安全协议验证、密码学形式化、投票方案的朋友都读一下。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球