浙大美团联合提出SkillRise:任务越做越聪明,智能体学会举一反三
让AI智能体学会“举一反三”,而不是每次都从零开始。美团、浙大、上交大、新国立联合提出的SkillRise,通过端到端强化学习,让单一策略在执行任务中不断提炼技能文档,并在后续任务中复用。在三大Agent基准上,它用更少的资源,实现了更高的性能和明显的测试时扩展趋势。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
让AI智能体学会“举一反三”,而不是每次都从零开始。美团、浙大、上交大、新国立联合提出的SkillRise,通过端到端强化学习,让单一策略在执行任务中不断提炼技能文档,并在后续任务中复用。在三大Agent基准上,它用更少的资源,实现了更高的性能和明显的测试时扩展趋势。
潜世界模型能预测未来帧,却可能对动作指令“假装没听见”——这不是开玩笑,论文首次定义了这个叫“上下文坍塌”的致命缺陷。ActSWM只用两个干净约束(动作对比铰链损失+冻结读取器)就让Minecraft石料挖掘成功率从50%飙到95%,还能从GTA视频里反向恢复按键。问题实在、方案漂亮、实验扎实,值得所有做模型预测控制的朋友认真读一读。
继6月聊过Mila的Gigapixel自博弈训练之后,Valeo这篇Pictura直接更进一步:把强化学习的观察空间从特权矢量换成了摄像头第一视角的渲染图,彻底消除了部署时的表征鸿沟。500亿步训练后,效果居然还能跟特权基线掰手腕,零样本迁移到Waymo场景甚至反超——这才是自博弈该有的样子。
API测试最头疼的“冷启动”问题——没有OpenAPI规范、没有历史日志,只有一个请求样本,能自动写出靠谱断言吗?Restor告诉你,用强化学习(GRPO)微调一个轻量LLM,这事儿能成,而且字节跳动已经在生产环境跑起来了,采纳率直接干到96%以上。一篇来自复旦和字节跳动的ISSTA'26工作,实打实的工业级神器。
数学家们苦苦追寻了60年的Andrews-Curtis猜想,在长度-14的边界上,有一位独立研究者甩出了一套机器可验证的JSON证书——只需5条命令,1秒内就能让电脑成为定理的裁判。这像不像给数学猜想装上了“代码解释器”?想看看数学+代码如何联手攻克前沿难题?这篇论文值得你花一刻钟感受。
NVIDIA开源了Molt,一个专为智能体强化学习(Agentic RL)设计的PyTorch原生训练框架。代码量仅约8600行,却能在吞吐量上与业界顶级的Megatron堆栈掰手腕。对于天天改算法的研究者来说,这简直是福音,终于不用在层层抽象和复杂配置里找东西南北了。
给大模型训练强化学习,框架代码动辄数万行,改个奖励函数得绕三天。NVIDIA最新开源Molt,核心RL代码仅8.6K行,但能流畅训练700B规模的MoE模型,性能还跟Megatron-based框架平起平坐。这框架到底有啥魔力?值不值得你的团队迁移?咱们今天就来扒一扒。
验证是AI的隐藏瓶颈!斯坦福伯克利这篇最新论文,提出LLM-as-a-Verifier,用连续评分取代离散判分,并沿三个维度缩放验证能力。无需训练就在代码、机器人、医学四基准拿下SOTA,GitHub已获近600星。想了解如何让Agent更可靠?这篇值得细读。
继2026年6月推过一篇强化学习搞定视频压缩之后,这回ABR领域又来了一个狠角色。电通大团队不仅一针见血地指出:多年来用来测试强化学习ABR策略泛化性的工具(只看平均带宽等统计量)是错的!还顺手把“规则”和“学习”的边界给消融了。 方法是真硬核:把经典码率选择的规则,直接以几何锚点的形式嵌进神经网络的潜在空间里,让网络“想跑偏都难”。训练只用3G数据,零微调
机器人装配里最容易翻车的,不是“不会做”,而是“太用力”。这篇工作把LLM从“嘴强王者”变成了会给力控设预算、会看力信号选恢复动作的监督器,思路非常工程化。
长上下文推理最怕什么?不是算不出来,而是模型一边思考一边疯狂复读输入。北大和阿里这篇论文把“复读”拆成可优化的奖励信号,思路很朴素,效果却很能打。
多智能体强化学习最怕两件事:一是智能体一多就“全局爆炸”,二是连续状态动作一上来,离散表格那套直接失效。CDCPG把这两个坑一起填了,靠局部策略、局部评论家和随机特征,把理论和工程代价都压到了可讨论的范围里。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球