LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12823 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:强化学习

共 130 篇
告别“似是而非”,StyleDoctor一招提升风格一致性50%
视觉与图像

告别“似是而非”,StyleDoctor一招提升风格一致性50%

AI画画火了这么久,但你有没有发现,让它“精准复刻”某种画风,比如水墨、印象派、卡通,结果总有点“似是而非”? 核心问题在于,现有的“人类偏好奖励模型”能判断美丑,却根本不懂“风格”这回事。CVPR 2026的这篇StyleDoctor,就像给AI配上了一位严格的“美术史教授”,专门用来评估和引导风格生成。这项工作还配套了一个涵盖1000种风格、40万对样本

EA联合大作:强化学习如何让游戏NPC告别“脚本味”?
大模型与智能体

EA联合大作:强化学习如何让游戏NPC告别“脚本味”?

玩过3A大作的朋友都知道,一个“蠢”NPC有多毁沉浸感。EA这次没有跟你聊概念,而是直接把强化学习塞进了EA SPORTS FC 25和Battlefield 6的AI系统里,并总结了一套极具价值的实战方法论,告诉你如何让NPC从“脚本”进化到“有灵魂”。这是游戏AI从学术走向工业的关键一步。

32.7%提升背后:VLM+规则工具箱混合评估新范式
视觉与图像

32.7%提升背后:VLM+规则工具箱混合评估新范式

自动驾驶评估就像考试打分。传统规则死板,遇到避让、绕行等“合理违章”就给负分;纯VLM评估虽有上下文理解,却难胜任精细安全判断。英伟达团队这次祭出杀手锏—— DriveJudge ,让VLM当“考官”,根据场景决定哪些规则该用、哪些该放一马,既保住了规则的物理严谨,又拿捏了上下文的柔性。看完绝对拍大腿:这才是评估该有的样子!

通用智能体必备?CMU用数学告诉你:没记忆不行
大模型与智能体

通用智能体必备?CMU用数学告诉你:没记忆不行

继2026年6月推过“世界模型新范式”那篇之后,这又来了一个理论硬核到不行的好货。CMU的这篇论文,用数学证明了“好记性”对于通用智能体是刚需,而不是可选项。它就像一个AI界的“记忆法证明”,告诉所有人:别再做无头苍蝇了,想变强,先学学怎么记笔记吧!

让AI画图"指哪打哪"!STAR新方法:让奖励信号精准导航,GenEval得分飙至0.9759
视觉与图像

让AI画图"指哪打哪"!STAR新方法:让奖励信号精准导航,GenEval得分飙至0.9759

以前给AI发“大锅饭”奖励,生成区域无论主次都一个待遇,难怪画出来的图总在细节上翻车。这次STAR的方法挺巧妙——直接把模型里的注意力图拿来当导航,给“画什么”和“画在哪里”的区域多发奖励。效果是真不错,GenEval飙到0.97,而且计算量几乎没增加,属于花小钱办大事的典范。

CVPR 2026夺冠!商汤&清华让VLM学会“边想边搜边裁剪”,开源7B模型碾压GPT-4o-mini
视觉与图像

CVPR 2026夺冠!商汤&清华让VLM学会“边想边搜边裁剪”,开源7B模型碾压GPT-4o-mini

当VLM面对一张4K图片里的微小文字或长尾知识时,现有模型不是“看瞎了”就是“知识库不够用”。SenseSearch巧妙地把“搜索”和“裁剪”两个看似不相关的能力,通过强化学习捏合成了一个统一的推理智能体。更关键的是,它开源了所有代码和数据集,让社区可以直接复现并续写。这项工作的完成度和效果都相当扎实,值得细细品味。

UC Berkeley等四校联名Mana:让机器人学会用钳子、打针,零样本迁移!
视觉与图像

UC Berkeley等四校联名Mana:让机器人学会用钳子、打针,零样本迁移!

继2026年6月聊过AI看视频学抓瓶子后,这篇Mana又来了!UC Berkeley、CMU、斯坦福、亚马逊四家联手,把灵巧操作关节工具的难题,变成一串“动画关键帧”来解决。一分钟标注,零样本迁移,成功率高达70%!这操作,值得每个机器人从业者了解。

中科院发CVPR 2026:专攻风格一致性的奖励模型,效果吊打ImageReward
视觉与图像

中科院发CVPR 2026:专攻风格一致性的奖励模型,效果吊打ImageReward

继之前我们聊过阿里"统一思考者"给AI画图装大脑、字节跳动"先想后画"解决图像编辑难题后,龙哥发现,AI图像生成领域对风格的控制越来越精细了。但一个核心瓶颈一直没解决: AI作画好不好看,谁来打分? 通用奖励模型(比如ImageReward)根本不懂「风格」,只知道「像不像」或者「喜不喜欢」。今天这篇CVPR 2026的新作StyleDoctor,就是给风格

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球