2026新作REAR:奖励分解后,偏好对齐更稳了
这篇论文最有意思的地方,是它没有继续给模型“加班训练”,而是把问题搬到了测试时:先拆奖励,再重排输出。对偏好对齐、推理加速、树搜索都很友好,属于那种工程味很浓、落地门槛也不高的工作。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,是它没有继续给模型“加班训练”,而是把问题搬到了测试时:先拆奖励,再重排输出。对偏好对齐、推理加速、树搜索都很友好,属于那种工程味很浓、落地门槛也不高的工作。
这篇论文把 CAD 代码生成从“会画个大概”往“能执行、能编辑、能落地”推了一大步。更有意思的是,它不是单模型硬扛,而是让多个异构专家协作,再用强化学习把这些专家的长板拼起来。
自动驾驶最难的不是“会开”,而是“开错了怎么补课”。R2LPL把闭环里的错误当成教材,再用终身学习把知识存住,思路很务实,尤其适合关心落地和长期迭代的人。
自回归视频最怕的不是慢,而是“顺序一乱就全乱”。TempAct 把规划和执行拆开,再用分层强化学习去训,专治复杂时间指令下的语义混淆、提示切换失灵和误差传染,思路很像给视频模型配了个会排兵布阵的总指挥。
这篇论文最有意思的地方,不是把推理分数再往上拱一拱,而是盯住了一个更现实的问题:模型变强了,弱模型和人却未必跟得上。TRL用“接力式” rollout 把单挑能力和协作可读性尽量绑在一起,思路很工程,也很像真业务会遇到的坑。
LLM Agent 的记忆最怕什么?不是“装不下”,而是“记错了还会一直记”。TRUSTMEM盯住每一次记忆更新的覆盖、保留和忠实度,把训练信号从终点前移到每个过渡步,专治长期记忆里的“慢性病”。
这篇论文最有意思的地方,不是又堆了多少控制论黑话,而是把“资源怎么分”这件看似运维味十足的事,硬生生做成了一个带稳定性、尾部风险和公平性的闭环问题。黑天鹅一来,静态策略直接原地发呆,AURORA-AI却能快速回收预算,值得看它到底怎么把理论和工程拧在一起。
实时强化学习最狠的矛盾,不是“会不会算”,而是“算的时候世界还在往前跑”。这篇牛津论文干脆把“思考时长”也变成可学习策略,5个环境里直接干过固定预算和启发式基线,还能迁移到双GPU部署,工程味很足。
这篇论文把“人群导航”从简单避障,直接拉到了“高保真仿真+并行训练+真实机器人验证”的完整链路。更关键的是,它不只会搭场景,还把行人的轨迹和全身动作都做得更像真的,适合做 benchmark,也适合拿来练策略。
桌面智能体最烦的不是“不会做”,而是“做完了也不知道算不算对”。这篇论文把 VLM 变成自动考官,再把考官的口误做噪声校正,思路很实用,结果也挺扎实,适合想看 Agent 怎么真正学会干活的读者。
这篇论文把“看视频”拆成了三件事:先粗看定位,再重看细节,最后重答修正。最妙的是,它不用冷启动的长串 CoT 标注,直接靠强化学习把重看能力练出来,省事还挺能打。
这篇论文把“老师盯着学”这件事,做成了一个能自适应收放的安全迁移框架。换道这种高风险任务里,它不只管少撞车,还尽量别把效率一起按进地板里,思路挺顺手。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球