← 返回 PaperDaily 视觉与图像

Qwen3-VL上新方法:技能库让多模态推理更稳更省

多模态Agent最尴尬的不是不会做题,而是做对一次后,下一次还得从头学一遍。SPyCE直接把成功轨迹蒸馏成可复用技能,并让技能和策略在训练中一起进化,思路很顺,实验也够硬。

Qwen3-VL上新方法:技能库让多模态推理更稳更省
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
多模态Agent最尴尬的不是不会做题,而是做对一次后,下一次还得从头学一遍。SPyCE直接把成功轨迹蒸馏成可复用技能,并让技能和策略在训练中一起进化,思路很顺,实验也够硬。


原论文信息如下:
论文标题:
SPyCE: Skill-Policy Co-evolution for Multimodal Agents
发表日期:
2026年07月
发表单位:
Zhejiang University, Hangzhou, China; Beijing University of Posts and Telecommunications, Beijing, China
原文链接:
https://arxiv.org/pdf/2607.13854v1.pdf

多模态Agent的瓶颈:轨迹仅被当作标量奖励

多模态Agent现在最尴尬的地方,不是“看不懂图”,而是“明明做对过,下一次还得重新摸索”。很多方法把一整条推理轨迹压成一个分数,最后只剩下“这次成了还是没成”,却把中间那些真正有价值的工具调用顺序、局部视觉操作、规划套路,全都当成了背景噪音。
这篇论文盯住的就是这个问题:成功轨迹不该只是奖励的原材料,而应该被蒸馏成可复用的技能。一旦技能能跟策略一起训练、一起进化,Agent就不必每次从零开始“重新发明轮子”,而是可以站在自己过去的成功经验上继续往前走。
封面
图1:SPyCE闭环示意图。策略在层次化技能库的指导下进行多模态推理,轨迹再反哺技能库,形成“技能变强→策略变强→轨迹更强→技能再变强”的闭环。
这套思路听起来很朴素,但工程上挺狠:它不是简单做记忆检索,也不是把轨迹硬塞进奖励函数里,而是把“经验”变成了训练过程中的一等公民。说得直白点,就是不给成功经历当一次性纸巾,而是把它做成随用随取、还能继续升级的工具箱。🤚

破局之道:技能-策略共同进化

SPyCE 的核心不是“多加一个记忆模块”这么简单,而是提出了一个技能-策略共同进化的训练框架。这里的关键点是:策略负责探索,技能库负责沉淀;策略越强,产出的轨迹质量越高,技能库越好;技能库越好,又会反过来给策略更强的先验。这个闭环一旦转起来,训练就不再是单向的“刷分”,而更像“边做题边整理错题本,而且错题本还能自动升级”。
论文把强化学习的基本设定写成了部分可观测马尔可夫决策过程(POMDP,Partially Observable Markov Decision Process,部分可观测马尔可夫决策过程)。人话翻译一下:Agent每一步都看不全世界,只能基于当前图像、历史观察和工具反馈做决定,所以它不是“看一眼就答”的题库模型,而是一个要持续行动、持续修正的决策体。
公式:GRPO中的组内优势归一化
上面这个公式是组策略优化里常见的优势归一化写法。Ai 表示第 i 条轨迹的相对优势,Ri 是轨迹奖励,mean 和 std 分别是同组轨迹的均值和标准差,ε 用来避免除零。它的作用很朴素:别只看某一次轨迹绝对分数高不高,要看它在同组里是不是“更像那个做得对的”。
公式:GRPO目标函数
这个目标函数就是 GRPO(Group Relative Policy Optimization,组相对策略优化)的标准味道:既鼓励高奖励轨迹被更多采样,也用 KL 正则限制策略别跑飞。论文并没有推翻这套优化,而是在它外面加了一层更重要的东西——把轨迹变成技能,再让技能反过来服务策略
公式:带工具调用惩罚的奖励设计
奖励函数里还加了一个工具调用惩罚项:只有任务成功时,才按工具调用次数扣分。这个设计挺讲道理,避免模型在失败样本上被过度压制探索空间;真做对了,再去管它是不是“工具开得太勤快”。这比一上来就拿“少调用工具”当金科玉律要靠谱得多。
真正的创新点从这里开始:SPyCE 把技能库拆成了两层。执行技能管局部操作,工作流技能管全局规划。一个负责“怎么做”,一个负责“先做什么、后做什么”,这就比单层记忆聪明不少。
图2:技能-策略共同进化框架总览
图2:方法总览。先把交互轨迹蒸馏成层次化技能库,再让策略在检索到的技能指导下做推理和工具调用,最后把高质量轨迹继续回灌到技能库中,形成闭环。

层次化技能库:执行与规划的协同

先说执行技能。它不是“某条轨迹的复制粘贴”,而是被整理成一个三元组:条件-动作-效果。条件说明什么时候该用,动作说明怎么用工具,效果说明预期能把视觉证据变成什么样。这样的表示法很实用,因为它把原本散落在长轨迹里的经验,压缩成了可以被检索和复用的局部套路。
公式:执行技能蒸馏
这里的 MLLMdk 可以理解成一个“技能整理员”,它读取任务、图像和成功轨迹,然后总结出若干条可复用的执行技能。论文里强调的不是“生成更多文字”,而是“把真正有用的局部操作抽出来”。
这种设计适合处理那类特别烦人的局部瓶颈:图像要旋转一下才看得清、目标太小得先裁剪、边缘信息太弱得先放大。以前这些步骤往往散在轨迹里,模型下次遇到类似情况还得重新试;现在它直接能检索到“这个局部问题通常该怎么解”。
工作流技能则更像“做题路线图”。它记录的是更粗粒度的瓶颈描述和解决流程,比如“先定位证据,再增强局部,再做一致性验证”。这类技能不直接给出动作,但能为多步推理提供全局先验,避免 Agent 一上来就乱翻工具箱。
公式:工作流技能蒸馏
工作流技能同样由 MLLMdk 从成功轨迹中蒸馏出来。这里的重点是把长链路经验压成“高层流程模板”,而不是把整条历史原封不动塞进记忆库。
技能库不是无限长的。论文还设计了合并与裁剪机制:相似技能先合并,避免一堆近似模板把检索空间搞得又大又脏;库太大时就删掉那些匹配少、价值低的条目。这个细节很工程化,也很必要,不然“技能库”很容易退化成“技能垃圾场”。
公式:策略生成局部瓶颈描述
策略会先结合检索到的工作流技能,生成若干个局部瓶颈描述 B。可以把它理解为:先问自己“眼下卡在哪儿”,再去技能库里找对症方案,而不是盲目乱试。
公式:执行技能检索
随后系统会把这些局部瓶颈和执行技能的条件做相似度匹配,找出最合适的执行技能。这里用的是嵌入空间里的余弦相似度,本质上就是看“当前问题像不像以前见过的那类局部麻烦”。
公式:筛选后的执行技能集合
只有相似度过阈值的执行技能才会被保留下来。这个阈值很重要,太低会把噪音也捞进来,太高又会把真正有用的经验过滤掉。论文在这里选择了“宁缺毋滥”的思路,避免技能检索变成胡乱联想。
公式:技能条件下的动作采样
最后,策略在“当前观察 + 问题 + 图像 + 工作流技能 + 执行技能”的联合条件下采样动作。也就是说,策略不是裸奔,而是带着一整套经验包去做工具调用。这个时候的轨迹,已经不是原始试错,而是被技能先验塑形过的轨迹
图3:层次化技能库的结构示意
图3:层次化技能库结构图。执行技能负责局部操作,工作流技能负责全局流程,两者分别对应“怎么动手”和“先后顺序怎么排”。

实验验证:8大基准全面领先

实验部分最值得看的,不是某个单点分数,而是它验证了一个很关键的判断:光有 RL 不够,光有记忆也不够,必须把“可复用技能”真正纳入训练闭环。否则模型可能会在某些任务上偶尔开窍,但很难把这种开窍变成稳定能力。
论文在八个基准上评估,包括面向多模态推理的 MathVerse、MathVision、WeMath、ChartQAPro,以及面向工具型智能体和视觉搜索的 TIR-Bench、V* Bench、HRBench-4K、HRBench-8K。模型骨干用的是 Qwen3-VL-4B-Instruct 和 Qwen3-VL-8B-Instruct,属于当前很现实的一类选择:不是玩概念,而是看方法能不能在主流多模态底座上真跑起来。
表1:多模态推理与视觉搜索总体结果
表1:多模态推理与视觉搜索总体准确率。SPyCE 在两个骨干模型上都拿到了最优结果,说明它不是“只对某个尺寸模型有效”的小聪明,而是有一定方法稳定性。
从结果看,SPyCE 相比纯提示方法提升很明显,尤其在需要反复工具调用的任务上,优势更大。更有意思的是,它不仅超过了 GRPO、RLOO 这类 RL 基线,也超过了 MemP、Dynamic Cheatsheet、Agent-KB 这类记忆方法。这说明问题不只是“要不要记忆”,而是“记忆的内容是什么、怎么进入训练过程”。
在 TIR-Bench 上,论文还报告了类别级结果和平均工具调用次数。这里的看点不只是准确率更高,而是做对的同时还更省工具。这点很重要,因为多模态 Agent 不是越会点工具越好,乱点工具只会把成本、延迟和错误概率一起抬上去。
表2:TIR-Bench类别级准确率与工具调用次数
表2:TIR-Bench 类别级准确率与平均工具调用次数。SPyCE 在多个需要顺序变换、局部修正和工具编排的类别上表现更好,同时调用次数更少,说明它不是靠“多试几次”硬堆出来的。
尤其在 OCR、Maze、Math、IR、SD、JG、VS 这类任务上,提升更能说明问题:这些任务往往不是单步判断,而是“先看懂、再定位、再操作、再验证”的连续过程。SPyCE 的层次化技能设计,刚好对上了这种长链路需求。
图5:与GRPO的收敛和工具调用动态对比
图5:与 GRPO 的训练动态对比。左边是奖励收敛,右边是平均工具调用次数。SPyCE 不只是最后分数更高,训练过程也更稳,工具调用还更克制。
这类结果通常比“最终提升几个点”更有说服力,因为它说明方法不是靠运气抽到几个好样本,而是在训练过程中真的改善了搜索路径和决策质量。说白了,模型不是只会在终点冲线,而是跑姿也变顺了。😊

案例分析与消融实验,揭示成功关键

论文还给了一个很直观的案例:在多模态仪器读数任务里,没有检索技能时,Agent 容易乱用工具,局部读数也会偏;一旦检索到合适的工作流和执行技能,它就能先想清楚该看哪里、该怎么放大、该怎么验证。这个例子很能说明问题:技能不是装饰品,而是直接决定推理路径的“导航系统”。
图3和图4:无技能与有技能的轨迹对比,以及技能库演化过程
图3和图4:左侧展示了有无检索技能时的推理轨迹对比,右侧展示了技能库在训练中的演化。前者说明技能能显著改善工具链路,后者说明技能库不是静态仓库,而是在训练中持续更新的活体系统。
表3:消融实验结果
表3:消融实验结果。去掉执行技能、工作流技能或者在线演化后,性能都会下降,说明三者不是“可有可无的配菜”,而是共同构成了 SPyCE 的有效性来源。
消融实验最关键的结论有两个。第一,层次化设计是必要的:工作流技能负责全局规划,执行技能负责局部落地,少了任何一个都不完整。第二,在线共同进化是必要的:如果技能库只是静态记忆,早期弱轨迹蒸馏出来的经验很可能跟不上后续更强策略的水平,最后就会出现“旧经验拖后腿”的问题。
这也解释了为什么 SPyCE 比很多 memory-based 方法更强:后者更像“查字典”,前者更像“边学边写教材”。字典可以帮忙,但教材如果还能根据最新考试不断更新,效果自然更稳。
从工程角度看,这篇工作也有边界。它依赖较强的技能蒸馏模型 MLLMdk,还要做检索、合并、裁剪和周期性更新,系统复杂度比纯 RL 高一些;但换来的,是更稳定的长链路能力和更好的工具效率。对真正需要多步视觉操作的场景,这个代价是能理解的。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是多模态 Agent “做对一次不等于学会一次”的问题。以前很多方法只把轨迹当奖励,SPyCE 则把轨迹蒸馏成可复用技能,并让技能和策略在训练中一起变强。

执行技能和工作流技能有什么区别?执行技能更像局部操作手册,管旋转、裁剪、放大这类具体动作;工作流技能更像总流程图,管先定位、再增强、再验证这类高层规划。一个管手上功夫,一个管脑子顺序。

为什么它比普通记忆方法更有效?因为它不是只在测试时“查资料”,而是在训练时就让技能和策略相互影响。记忆方法往往是静态检索,SPyCE 则会把新产生的高质量轨迹继续蒸馏进技能库,形成持续进化。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是凭空造新词,而是把“轨迹→技能→策略”的闭环真正做实了,思路完整,且和现有 RL / memory 路线拉开了区别。

实验合理度:★★★★☆ 八个基准、两种骨干、RL 与记忆方法都做了对比,消融也比较到位,整体比较能服人。

学术研究价值:★★★★★ 它提出了一个很有延展性的方向:多模态 Agent 的能力积累,不该只靠参数更新,也可以靠技能沉淀与复用。

稳定性:★★★☆☆ 方法逻辑很顺,但依赖技能蒸馏和检索链路,系统复杂度比普通 RL 高,落地时还要看库维护质量。

适应性以及泛化能力:★★★★☆ 对多步视觉推理、工具编排、视觉搜索这类任务很合适,但对纯单步问答场景,收益可能没这么大。

硬件需求及成本:★★★☆☆ 训练链路不轻,尤其还要做技能蒸馏和周期更新;不过推理阶段如果只保留检索,成本会比想象中可控。

复现难度:★★★☆☆ 组件比较多,涉及 SFT、RL、技能蒸馏、检索和库维护,复现门槛中等偏上。

产品化成熟度:★★★☆☆ 适合多模态工具型 Agent 原型,但要进产品,还需要更强的稳定性评估和更低成本的技能更新机制。

可能的问题:技能蒸馏质量高度依赖强模型和高质量轨迹,若轨迹噪声大,技能库可能会“学歪”;此外,检索与更新链路较复杂,工程实现不算轻松。


主要参考文献

[1] Ru Zhang, Weijie Qiu. SPyCE: Skill-Policy Co-evolution for Multimodal Agents. arXiv, 2026.
[2] GRPO: Group Relative Policy Optimization. 论文中作为强化学习优化基线引用。
[3] Qwen3-VL-4B-Instruct / Qwen3-VL-8B-Instruct / Qwen3-VL-235B-A22B-Instruct. 论文实验与技能蒸馏所用模型。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!  

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。