最新SOTA!多目标强化学习不用改算法,只换网络结构就能让HV暴涨132%?
单目标强化学习靠“换网络结构”就能白捡一大截性能,多目标强化学习却还在算法泥潭里打转?马萨里克大学和阿托大学的最新研究直接把SimbaV2架构搬进MORL,HV暴涨132%,证明“算法不够,架构来凑”这条路在多目标领域同样走得通。对正纠结算法创新还是架构升级的读者来说,这篇论文给出了一个极具性价比的新方向。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
单目标强化学习靠“换网络结构”就能白捡一大截性能,多目标强化学习却还在算法泥潭里打转?马萨里克大学和阿托大学的最新研究直接把SimbaV2架构搬进MORL,HV暴涨132%,证明“算法不够,架构来凑”这条路在多目标领域同样走得通。对正纠结算法创新还是架构升级的读者来说,这篇论文给出了一个极具性价比的新方向。
这篇来自NAVER WEBTOON的工业界论文,把大语言模型从“在线排序器”降级成了“离线先验估计器”,用GPT-4.1从评论文本里提炼贝叶斯先验给Thompson采样暖启动。真实线上A/B/C测试近180万用户,冷启动10-49印象桶CTR涨了9.51%,还顺手揭示了一个反直觉现象:内容先验降CTR却升CVR。想抄作业的做推荐的都该看看。
ToolLIFT把“具体工具”抽象成“功能角色”,让LLM在没有见过的新工具集上也能规划出像样的工作流。OOD基准上最高涨近9个点,泛化能力肉眼可见,工具规划方向的小伙伴值得一读。
图1:固定系数融合与SAF的对比。SAF分别针对OPD优势的幅度失配与时间失配设计独立控制机制,避免熵塌缩、保留探索能力,最终提升任务表现。
机器人训练有个“鬼打墙”现象:数据越采越多,失败率却纹丝不动。清华这篇工作直接告诉机器人“哪里不行补哪里”——用一个轻量关键性模型引导数据采集,失败率最高降67%,还顺手解决了VLA微调的平台期问题。思路极简,效果很硬,值得一读。
现实世界的决策总在多个目标之间为难:既要跑得快,又要省电;既要安全,又要高效。当奖励函数难以定义时,多目标强化学习该何去何从?LEMUR给出了一个优雅的答案,在多个连续控制任务上全面超越既有方法,逼近全知Oracle的性能表现。
大模型推理烧算力烧得肉疼,这篇中山大学的新工作偏要教模型“见好就收”。SVR让模型每轮输出答案时顺带自证对错+报置信度,自己决定要不要继续想下去,七大数学基准平均2.99轮就超过了固定10轮预算的效果,token直接省一半还多。
回放缓冲区是强化学习的核心组件,但何时该采用非均匀回放一直是个谜。本文通过三个关键因素给出了答案,并带来一种简单高效的截断几何采样方法,值得每位强化学习研究者关注。
数学考试里有个经典场面:学霸写完就交卷,学渣越改越错。大模型推理也有这毛病——简单题算力浪费,难题越修越歪。中山大学这篇新论文,教模型“自我检查”:有把握才交卷,没底就再改一轮。结果平均2.99轮推理,精度反而超过固定10轮,还省了一大半token。这招龙哥看了直呼内行!
还在发愁机器人规划里怎么设计奖励函数?来自香港浸会大学的这篇论文直接告诉你:不用愁!它从无奖励的演示日志里“挖”出时间距离,让世界模型规划得又快又准,导航成功率直接拉满,操作任务也大幅提升。这正是龙哥一直在说的:比起花里胡哨的模型结构,搞清楚“规划目标从哪来”往往更重要。
RoPE、2D-RoPE这些位置编码从哪来?这篇论文用一个“构成操作”统一了它们,还理论证明了路径无关的充要条件。基于此设计的JoFormer在值侧也做旋转,ImageNet提了0.4%,长度外推比降到1.02×——对于想理解位置编码本质的读者,这篇是不可错过的代数教科书。
当机器人VLA模型在域外任务中频频翻车,RL²给出了一个既聪明又高效的解法:只在预测到即将失败时,才调用离线强化学习产生的多样化动作来“组合引导”,否则就安心跟着原始VLA走。这项研究不仅揭示了“成功/失败状态缩放定律冰火两重天”的反直觉结论,还在真实机器人上带来了接近30%的成功率提升——关键是,所有模块都是轻量+离线,部署成本极低。值得所有做机器人泛化操
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球