MuJoCo三族机器人参数全变,看清华如何让世界模型不发懵
换根连杆、改个质量,世界模型就“失忆”?清华这项研究把机器人形态参数和可复用动力学分开建模,让世界模型在没见过的新参数下也能零样本预测和规划。想搞机器人泛化的,这篇值得一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
换根连杆、改个质量,世界模型就“失忆”?清华这项研究把机器人形态参数和可复用动力学分开建模,让世界模型在没见过的新参数下也能零样本预测和规划。想搞机器人泛化的,这篇值得一读。
史上最亮伽马暴GRB 221009A飞过天际时,IXPE用了三天才转过头,偏振只能给出一个上限;而规划中的EXPO能在约50秒内自主重指向,把"上限"变成"精度"。这篇文章讲的就是这台把X射线偏振能段拓宽4倍、重指向快8000倍的下一代空间天文台。
电商推荐系统想离线做策略评估,最缺的就是一个“真实买家”。阿里和人大等团队提出的RecVerse,让模型真的去看截图“逛街”,还配了套三层记忆和轨迹级奖励,模拟出来的购物行为既像真人一样会犹豫比较,又能买到用户真想买的东西,顺手开源了5千多条真实轨迹的交互式基准。做推荐、做用户增长的同学值得一读。
电动汽车的"充电焦虑"终于等来了AI解法。Lucid与通用汽车的工程师用强化学习、LSTM和模糊逻辑组合拳,在LG Chem下一代BMS上实测:SOC估算精度提升18.8%,电池寿命延长28.5%,充电成本下降21.6%。既有产业数据又有落地细节,值得所有关注新能源车电池管理的人一读。
继8月推过单次采样SAPO之后,强化学习训练多轮智能体又有新活。这次厦大和南洋理工的合作工作,只靠“成功轨迹的长度”这一个几乎零成本的信号,就把GRPO平均拔高27.2%,还顺带解决了成功轨迹之间的“优势坍缩”难题,值得一读。
新能源越装越多,电网调度的老套路——靠预测吃饭——越来越不好使。预测一错,调度全乱。这篇论文干脆把预测模块整个丢掉,让强化学习直接从运行数据里学调度策略,还是闭式解!又稳又能解释。想在电力系统里玩RL的、搞控制优化的,这篇值得一读。
这篇被引1300+次的开创性工作,来自普林斯顿大学。WebShop用118万件真实商品和1.2万条人工指令,把“语言智能体”的评测从玩具级任务搬进接近真实的电商场景——AI要自己读懂需求、搜索商品、挑选项、下单。更难得的是,训练好的智能体能零样本迁移到真实Amazon和eBay,是语言grounding方向绕不开的经典基准。
智能体强化学习正处在大模型后训练的核心位置,但PPO太贵、GRPO又存在信用分配短板。本文提出SAPO,用一条自回归流同时搞定策略与价值估计,在ALFWorld和WebShop上比PPO/GRPO平均涨15.1/12.1个百分点,还省掉独立critic、提速33.2%。一句话:值估计的便宜和单采样的高效,这次全都要。
人类觉得"闭着眼都能做"的插拔动作,对机器人来说,却是灵巧操作领域最硬的骨头之一。尤其是当机器人换上一只仿人五指手,光是"让五根手指协调起来把东西捏稳、转正、再对准插进去"这一套动作,就足够让无数强化学习训练曲线原地去世。
世界模型和Q学习还能这么玩?斯坦福北大团队提出的QWM,把世界模型当成“预言家”,只做测试时搜索,不让模型误差污染训练,操作成功率全面飙升。继7月末聊过ActSWM这类JEPA世界模型的规划玩法后,本期这篇把Q学习和世界模型的结合推到了一个新高度。
这篇论文干了一件很“较真”的事:当大家都在用LLM给强化学习当“教练”时,它用数学证明了只要奖励塑形方式得当,教练再怎么“瞎指挥”,也改变不了最终的最优策略。不管是做LLM Agent还是RL的读者,都值得看看这份理论保障。
人人都说AI要像人一样干活,可它连“等锅汤开要多久”都没概念。根特大学等机构推出Chronocooked强化学习基准,把时间藏在炒菜场景里,逼着智能体靠内在计时做决策。想看AI到底会不会“看表”,这篇论文值得一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球