← 返回 PaperDaily
大模型与智能体
浙大美团联合提出SkillRise:任务越做越聪明,智能体学会举一反三
让AI智能体学会“举一反三”,而不是每次都从零开始。美团、浙大、上交大、新国立联合提出的SkillRise,通过端到端强化学习,让单一策略在执行任务中不断提炼技能文档,并在后续任务中复用。在三大Agent基准上,它用更少的资源,实现了更高的性能和明显的测试时扩展趋势。
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 3
查看原文
原论文信息如下:
不知道你有没有想过,为什么现在的 AI 智能体,明明能搞定复杂的任务,但碰到一个类似的新活,往往还是要从头开始,吭哧吭哧摸索半天?
比如你今天让助手帮你订酒店,学会了筛选“带泳池、评分4.8以上”的房源;明天你要订机票,它又得重新学怎么比价、怎么看退改签规则。感觉就像每次考试前才突击复习,考完就忘了个精光。
这种“做一题、丢一题”的学习方式,在学术界被称为“独立尝试困境”(Independent Episode Problem)。
它的问题在于,标准强化学习(RL)算法把每个任务都看作一锤子买卖,上一轮积累的宝贵经验,在下一轮开始时,基本等于白干。这就像让一个经验丰富的工匠,每换一个工地,都得从学徒做起,想想就挺亏的。
那么,有没有什么办法,能让智能体像人一样,把一个任务中学到的“技能”或“套路”,顺滑地迁移到下一个类似任务中?
今天龙哥要介绍的这篇论文,来自浙江大学、新加坡国立大学、上海交通大学和美团联合团队,给出了一个非常优雅的答案。他们提出的框架,简单直接,效果却很惊人,让智能体在执行任务的过程中,自然地提炼、积累和复用技能,从而实现真正的“持续进化”。
跨任务技能学习:从独立尝试到持续进化
当下,以LLM(Large Language Model,大语言模型)为基础的智能体框架层出不穷。从ReAct(小步快跑的思维推理与行动结合范式)到Reflexion(自我反思的学习范式),再到各种基于PPO(Proximal Policy Optimization,近端策略优化)的RL算法,它们确实让智能体越来越能打。
但现有方法的盲点也很明显:大部分工作要么聚焦于“怎么把一个任务做得更好”(如通过反复尝试、自我反思),要么构建一个复杂的技能库Pipeline,包含提取、存储、检索、执行等多个独立模块。
后者的思路就像给智能体配了一个又大又重的“工具箱”,里面各种工具胡乱堆在一起。但问题是,一旦后续任务表现不佳,你很难说清楚到底是工具(技能)提取得不好,还是工具没找对(检索不行),亦或是工具用错了(执行不力)。这种模糊的归因,让整个学习过程变得低效且难以优化。
而本文提出的SkillRise ,则完全抛弃了这种复杂的“重量级工具箱”思路。它只维护一个简单、动态更新的“小抄”——也就是一个技能文档(Skill Document)。这个文档不依赖外部记忆,没有花哨的检索模块,就是纯粹的、可以被LLM理解和修改的文本。它的目标只有一个:把从过去任务中提炼出的、可迁移的“干货”,传递给下一个任务。
整个框架的逻辑异常清晰,龙哥可以先用一句话概括它的流程:它将一系列相似但不同的任务排好队,让智能体依次去解决,在解决完一个任务后,它会马上把刚才的经验总结成一份“技能文档”,然后直接带着这份“小抄”去执行下一个任务。
SkillRise核心机制:任务序列构建与技能文档
要理解SkillRise,先得明白它的两个核心组件:
第一,有意义的任务序列。 想让技能迁移得有价值,任务之间必须得“沾亲带故”。SkillRise 利用了环境提供的任务家族元数据(比如在 WebShop 中,任务被分为“电子产品”、“家居用品”等类别),同属一个类别的任务,它们背后的交互逻辑往往是一致的。然后,算法会根据任务复杂度(比如需要满足的属性数量和选项数量),把它们从简单到麻烦排个序。这样一来,前面的任务就会给后面的任务提供最直接、最有用的经验支持。
第二,不断演化的技能文档。 这是整篇论文的点睛之笔。智能体只有一个统一的策略,它在这个序列中交替扮演两个角色:
执行者(Solver): 接收当前任务描述和当前的“技能文档” Si-1 ,然后与环境互动完成任务,同时记录下整个交互轨迹 τi。任务完成后,会得到一个任务奖励 ri。
策展人(Curator): 在任务 i 结束后(除了最后一个),策略会转换角色,基于任务 i 的轨迹 τi 和奖励 ri,对技能文档 Si-1 进行重写,生成新的文档 Si 。它需要决定保留哪些有用的技能、整合哪些新发现的成功/失败模式、以及删除哪些过于具体(不通用)的细节。
这个设计非常巧妙。整个过程中,技能文档是跨任务的唯一信息通道。从任务 1 到任务 2,任务 1 的轨迹并不会传递给任务 2 的执行者,只有浓缩后的技能文档 S1 会传递进去。这迫使智能体必须学会从原始轨迹中提取“可迁移的规律”,而不是简单地记忆或复读。
来看看论文中的整体方法流程图(图1),可以更直观地理解这个精妙的设计。
可以看到,图1(b)清晰地展示了“执行-策展-再执行”的循环。这个机制的精髓在于,它把技能学习这个高阶能力,内化为了策略的一部分,而不是依赖一个外部系统。
解耦信用分配:让技能策展学会长远收益
上面的流程看下来很流畅,但RL训练时一个核心难题出现了:信用分配(Credit Assignment) 。
“执行者”完成当前任务,成功与否立竿见影,立马就能拿到奖励。但“策展人”的产出(也就是更新后的文档),只有用来指导后续任务时,才能看出好不好。如果你用同一个标准(比如“整个序列的总得分”)去同时奖励“执行者”和“策展人”,就会混淆视听。就好比你让一个厨子(执行者)和一个写菜谱的人(策展人)共享同一份营业额分成,那营业额不好,到底是菜炒得不行,还是菜谱写得有毛病?根本分不清。
为了一劳永逸地解决这个问题,SkillRise 提出了一个非常聪明的办法——解耦信用分配(Decoupled Credit Assignment) 。
对于第 i 个任务的“执行者”行为,它的回报 G(i, solve) 就直接等于当前任务的即期奖励 ri 。干得好就拿奖,干得差就扣钱,简单粗暴。
对于第 i 个任务的“策展人”行为(它产生文档 Si ),它的回报 G(i, curate) 则来自于“未来”它将会指导的任务的奖励,用一个折现因子 γ 计算出的折现和:
1. 目标纯净。 “执行者”只关心眼下这一哆嗦,这迫使它专注于当前任务;“策展人”只关心长远收益,这迫使它提炼出能反复奏效的通用“干货”。两者的优化目标完全解耦,互不干扰。
2. 角色感知分组优化(Role-aware Group-relative Optimization)。 在计算优势函数时(即个体表现相对于平均水平的差距),他们不是将所有实验混在一起算,而是将同一任务位置上、同一角色(执行者/策展人)的N个尝试归为一组,分别计算。这进一步确保了不同角色的学习信号不会相互“污染”。
实验全面领先:Pass@1最高提升8.5%
理论再漂亮,最终还得看疗效。SkillRise 在三个极具代表性的智能体基准测试上进行了全面验证:ALFWorld (家庭交互任务)、WebShop (网络购物任务)和ScienceWorld (科学实验推理任务)。
他们不仅对比了 ReAct 这样的经典提示词方法,还对比了 PPO、GRPO(Group Relative Policy Optimization,组相对策略优化)等主流 RL 算法,以及专门针对单任务重复学习设计的 LaMer 方法。
在 ALFWorld 上 ,SkillRise 取得了 85.9% 的平均成功率,比当时最强的基线 GiGPO(Feng et al., 2025)高出 2.3 个百分点。在六项任务分解指标中,它占据了五项第一或第二,稳定性极高。
在 WebShop 上 ,优势更加明显,达到 84.4%,比 GiGPO 高了 7.1 个百分点。
在 ScienceWorld 上 ,SkillRise 以 54.6% 的成绩,将优势进一步拉大到 8.5 个百分点。考虑到这个任务本身的复杂性和推理难度,8.5 个点的提升是一个非常可观的优势。
更重要的是,SkillRise 还展示了强大的任务内泛化能力 。在 Pass@3(即给三次尝试机会)的测试中,它甚至比专门针对重复学习设计的 LaMer 还要高(如 ScienceWorld 高出14.2个百分点)。这说明它学到的不是死板的模板,而是一种通用的“复盘与总结”的策略,这种策略在遇到同一类任务的不同变体时,同样可以有效工作。
测试时扩展:更长的任务序列带来更好的性能
最让龙哥感到兴奋的,不是SkillRise在训练集上的表现,而是它展现出的跨任务测试时间扩展(Cross-task Test-time Scaling) 能力。
一般来说,Scaling Law 通常指的是模型参数规模或者训练数据量变大,性能会提升。但 SkillRise 发现的是另一个维度的扩展:在测试时,任务序列越长,性能越好。
他们把同样的128个测试用例,分成K=2、4、6个任务组成的序列,让智能体在每个序列内部,严格按顺序执行,每个任务只尝试一次。结果如图4所示:
SkillRise 的性能随着 K 值的增大,从 83.6% 稳步提高到了 87.5%,而其他所有对比方法的曲线要么持平,要么随机波动。
这个现象说明了一个非常深刻的问题:SkillRise 的策略真的学会了“如何学习”。它面对的任务可能是全新的,但它积累、提炼、并利用技能文档的能力,让它在面对更多相关任务时,能越战越勇。这已经不是简单的“记住答案”,而是真正意义上的“触类旁通”。
此外,论文还对比了模型大小带来的影响。SkillRise 从 Qwen3-1.7B 升级到 4B,性能提升了 +7.8 个百分点,远高于 LaMer 的 +3.3 和 GRPO 的 +4.7。这说明额外的模型容量,特别有利于这种“任务求解+跨任务抽象”的综合能力,模型越大,SkillRise 的优势就越明显。
简洁高效的端到端范式
在前面我们提到,现有的技能学习管道往往非常复杂。论文专门与两个多阶段技能学习基线进行了对比:RetroAgent(张等人,2026b)和 SkillRL(夏等人,2026)。
来看看论文中的图4对比结果,直观感受一下什么叫“光喝水不干活”和“少喝水多干活”的差距。
同样在 ALFWorld 上,RetroAgent 和 SkillRL 需要 SkillRise 的 6.0 倍和 4.3 倍运行时间 ,最终取得的平均成功率却 仅仅是打平甚至落后 。RetroAgent 勉强追平了 85.9%,而 SkillRL 只有 73.4%,差了 12.5 个百分点。
这生动地说明了一个道理:在人工智能领域,堆砌复杂架构并不总是带来更好的结果。有时候,一个设计精良的简单系统,远比一个臃肿的复杂系统更有效。
SkillRise 的成功,也为后续的智能体研究提供了一个非常有价值的思路:即如何通过强化学习,端到端地训练智能体“学会学习”,而不是依赖工程师预先定义好所有的知识传递规则。这种“元学习”能力,可能才是通用人工智能(AGI)正确的进化方向。
龙迷三问
Q1:论文中使用的“跨任务折扣因子 γ” 具体是如何工作的?我看到原文设置的是0.6,为什么不是更高或更低? A:γ就像一个“耐心值”。它控制了策展人Curation行为的回报权重。γ=0.6意味着,对下一个任务的奖励打个6折计算回报,对下下个任务则打0.6²=0.36折。γ越高(如0.9),说明我们越看重非常长远的收益,这会鼓励策展人提炼非常通用、但可能对眼前任务帮助不大的策略;γ越低(如0.3),则越“短视”,策展人会重点关注解决下一个紧邻任务。论文通过消融实验(图3左)证明,在{0.3, 0.4, 0.6, 0.7}范围内,性能差别很小,说明这个方法对这个参数不敏感,很鲁棒。
Q2:SkillRise虽然效果不错,但其“解耦信用分配”和“角色感知分组”的设计,看起来增加了计算的复杂度,训练成本高吗? A:这是个好问题。虽然设计上看起来复杂,但其训练成本并不高。论文指出,一次训练更新处理的总任务数是固定的(384次任务尝试),与对比方法一致。计算开销主要来自于多了一个“Curation”阶段,但这个阶段只由一个简单的文本改写任务组成(消耗token数远小于任务执行过程)。因此,它的训练效率远高于那些有多个外部模块(如外部记忆、检索、排序等)的复杂管线方法,运行时间仅为后者的1/6到1/4。
Q3:这项工作在现实世界中有什么具体的应用场景? A:非常广泛。一旦一个智能体被训练成“拥有提炼和复用技能的能力”,几乎任何涉及“流程化”的交互任务都能受益。例子包括:让客服机器人从处理简单的退换货到复杂的保险理赔,它能够自动总结不同情况下的处理策略;让机器人从一项简单的“拾取”任务到复杂的“装配”任务,它可以提炼出对不同形状物体的夹取方法。这项研究为“从做中学”的智能体开辟了更广阔的前景,有望降低部署AI应用的维护成本。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
SkillRise的“单一策略双角色+解耦信用分配”设计在思想上很巧妙,将技能学习从复杂的管线式工程简化为一个优雅的RL问题。虽然不是完全推翻重来的原创,但对现有框架的突破很大,在跨任务学习方向上给出了一个非常干净且有说服力的答案。
实验合理度: ★★★★★
实验设计非常扎实和全面。对比了多种类型的基线(提示词、标准RL、重复学习、复杂Pipeline方法),在各种任务难度和模型规模上都做了充分验证。特别是“测试时扩展”和“消融实验”的设计,一步到位地解释了方法为何有效。文中明确指出对比实验基于PaperDaily收录范围内,实验结果可信度高。
学术研究价值: ★★★★★
这项研究为“元学习”在智能体中的实际应用提供了一条非常清晰的路径。它不仅展示了“学会学习”是可能的,而且证明了通过RL端到端训练就可以完成,无需复杂的辅助模块。提出的“测试时扩展”新范式,对未来在智能体领域探索Scaling Law提供了全新的视角,价值很高。
稳定性: ★★★★☆
实验结果在多个任务、多种配置下表现稳定,主要优点是其跨任务学习机制被训练得很充分。但稳定性仍受限于底层的LLM,如果模型遇到超出训练分布的、更复杂的任务,其Curation能力可能会退化。此外,当前只在3-4B模型上验证,对更大模型(如70B、几百B参数)的稳定性表现未知。
适应性以及泛化能力: ★★★★☆
在ALFWorld、WebShop、ScienceWorld这三个风格迥异的任务上都表现出色,展示了良好的跨领域适应性。从训练集的跨任务泛化到测试集的任务内重复尝试(Pass@3),其泛化能力非常强的。局限在于,论文假设能获取任务家族的元数据来构建序列,如果任务之间缺乏清晰的关联性,技能迁移的效果可能会打折扣。
硬件需求及成本: ★★★★☆
训练和推理过程相对高效,远低于复杂的SkillRL等管线,且能跑在8块H800上。但要求单卡至少有足够的显存放下一个4B模型及其上下文,对于消费级显卡来说仍然有一些门槛。其Curation阶段的文本生成也会增加推理延迟,不过相较于其性能提升,这点成本可以接受。
复现难度: ★★★★★
论文代码已开源,且基于主流的verl框架进行修改,有详细的安装指南和requirements.txt文件。环境(ALFWorld, WebShop, ScienceWorld)也都是标准基准。复现门槛非常低,对研究社区非常友好。依赖组件非常清晰,没有黑盒模块。
产品化成熟度: ★★★☆☆
目前还处于研究阶段。离直接产品化还有一些距离。主要障碍包括:1) 对无法获取任务家族分类(即任务之间关系不明)的场景,当前框架不适用;2) 技能文档是纯文本,对于需要非文本交互(如点击按钮、拖动滑块)的GUI智能体,如何将文字描述转化为具体的执行指令还是一个工程挑战。但作为核心算法组件,其潜力巨大。
可能的问题: 虽然实验非常全面,但论文主要在模型的相对较小版本(4B)上进行,对更大模型(如70B+)的可扩展性还需要更多验证。另外,任务序列的构建依然依赖人工先验知识(任务家族标签和难度排序)。如果将来能利用LLM自身的能力自动构建这样的“成长序列”,那就彻底无敌了。此外,Curation阶段带来的额外文本处理时间,在毫秒级的实时交互场景下可能会增加用户的等待感。
主要参考文献
[1] Yao, Z., Chen, Y., Lu, Z., et al. "SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution." arXiv preprint arXiv:2607.26784 (2026).
[2] Shao, Z., Wang, P., Zhu, Q., et al. "DeepSeekMath: Pushing the Limits of Mathematical Reasoning with Open-Source Language Models." (GRPO baseline) (2024).
[3] Feng, L., Xue, Z., Liu, T., & An, B. "Group-in-Group Policy Optimization for LLM Agent Training." (GiGPO baseline) (2025).
[4] Jiang, Y., Jiang, L., Teney, D., et al. "Meta-RL Induces Exploration in Language Agents." (LaMer baseline) (2025).
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
如何将零散的经验炼成一脉相通的技能?加群聊聊你的实战体会~
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 Agent强化学习+上海+美团+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群