← 返回 PaperDaily
视觉与图像
Qwen3-VL上新方法:技能库让多模态推理更稳更省
多模态Agent最尴尬的不是不会做题,而是做对一次后,下一次还得从头学一遍。SPyCE直接把成功轨迹蒸馏成可复用技能,并让技能和策略在训练中一起进化,思路很顺,实验也够硬。
龙哥读论文
发布于 2026-08-14 09:11:15
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 多模态Agent最尴尬的不是不会做题,而是做对一次后,下一次还得从头学一遍。SPyCE直接把成功轨迹蒸馏成可复用技能,并让技能和策略在训练中一起进化,思路很顺,实验也够硬。
原论文信息如下:
多模态Agent的瓶颈:轨迹仅被当作标量奖励
多模态Agent现在最尴尬的地方,不是“看不懂图”,而是“明明做对过,下一次还得重新摸索”。很多方法把一整条推理轨迹压成一个分数,最后只剩下“这次成了还是没成”,却把中间那些真正有价值的工具调用顺序、局部视觉操作、规划套路,全都当成了背景噪音。
这篇论文盯住的就是这个问题:成功轨迹不该只是奖励的原材料,而应该被蒸馏成可复用的技能 。一旦技能能跟策略一起训练、一起进化,Agent就不必每次从零开始“重新发明轮子”,而是可以站在自己过去的成功经验上继续往前走。
这套思路听起来很朴素,但工程上挺狠:它不是简单做记忆检索,也不是把轨迹硬塞进奖励函数里,而是把“经验”变成了训练过程中的一等公民。说得直白点,就是不给成功经历当一次性纸巾,而是把它做成随用随取、还能继续升级的工具箱。🤚
破局之道:技能-策略共同进化
SPyCE 的核心不是“多加一个记忆模块”这么简单,而是提出了一个技能-策略共同进化 的训练框架。这里的关键点是:策略负责探索,技能库负责沉淀;策略越强,产出的轨迹质量越高,技能库越好;技能库越好,又会反过来给策略更强的先验。这个闭环一旦转起来,训练就不再是单向的“刷分”,而更像“边做题边整理错题本,而且错题本还能自动升级”。
论文把强化学习的基本设定写成了部分可观测马尔可夫决策过程(POMDP,Partially Observable Markov Decision Process,部分可观测马尔可夫决策过程)。人话翻译一下:Agent每一步都看不全世界,只能基于当前图像、历史观察和工具反馈做决定,所以它不是“看一眼就答”的题库模型,而是一个要持续行动、持续修正的决策体。
真正的创新点从这里开始:SPyCE 把技能库拆成了两层。执行技能 管局部操作,工作流技能 管全局规划。一个负责“怎么做”,一个负责“先做什么、后做什么”,这就比单层记忆聪明不少。
层次化技能库:执行与规划的协同
先说执行技能。它不是“某条轨迹的复制粘贴”,而是被整理成一个三元组:条件-动作-效果 。条件说明什么时候该用,动作说明怎么用工具,效果说明预期能把视觉证据变成什么样。这样的表示法很实用,因为它把原本散落在长轨迹里的经验,压缩成了可以被检索和复用的局部套路。
这种设计适合处理那类特别烦人的局部瓶颈:图像要旋转一下才看得清、目标太小得先裁剪、边缘信息太弱得先放大。以前这些步骤往往散在轨迹里,模型下次遇到类似情况还得重新试;现在它直接能检索到“这个局部问题通常该怎么解”。
工作流技能则更像“做题路线图”。它记录的是更粗粒度的瓶颈描述和解决流程,比如“先定位证据,再增强局部,再做一致性验证”。这类技能不直接给出动作,但能为多步推理提供全局先验,避免 Agent 一上来就乱翻工具箱。
技能库不是无限长的。论文还设计了合并与裁剪机制:相似技能先合并,避免一堆近似模板把检索空间搞得又大又脏;库太大时就删掉那些匹配少、价值低的条目。这个细节很工程化,也很必要,不然“技能库”很容易退化成“技能垃圾场”。
实验验证:8大基准全面领先
实验部分最值得看的,不是某个单点分数,而是它验证了一个很关键的判断:光有 RL 不够,光有记忆也不够,必须把“可复用技能”真正纳入训练闭环 。否则模型可能会在某些任务上偶尔开窍,但很难把这种开窍变成稳定能力。
论文在八个基准上评估,包括面向多模态推理的 MathVerse、MathVision、WeMath、ChartQAPro,以及面向工具型智能体和视觉搜索的 TIR-Bench、V* Bench、HRBench-4K、HRBench-8K。模型骨干用的是 Qwen3-VL-4B-Instruct 和 Qwen3-VL-8B-Instruct,属于当前很现实的一类选择:不是玩概念,而是看方法能不能在主流多模态底座上真跑起来。
从结果看,SPyCE 相比纯提示方法提升很明显,尤其在需要反复工具调用的任务上,优势更大。更有意思的是,它不仅超过了 GRPO、RLOO 这类 RL 基线,也超过了 MemP、Dynamic Cheatsheet、Agent-KB 这类记忆方法。这说明问题不只是“要不要记忆”,而是“记忆的内容是什么、怎么进入训练过程”。
在 TIR-Bench 上,论文还报告了类别级结果和平均工具调用次数。这里的看点不只是准确率更高,而是做对的同时还更省工具 。这点很重要,因为多模态 Agent 不是越会点工具越好,乱点工具只会把成本、延迟和错误概率一起抬上去。
尤其在 OCR、Maze、Math、IR、SD、JG、VS 这类任务上,提升更能说明问题:这些任务往往不是单步判断,而是“先看懂、再定位、再操作、再验证”的连续过程。SPyCE 的层次化技能设计,刚好对上了这种长链路需求。
这类结果通常比“最终提升几个点”更有说服力,因为它说明方法不是靠运气抽到几个好样本,而是在训练过程中真的改善了搜索路径和决策质量。说白了,模型不是只会在终点冲线,而是跑姿也变顺了。😊
案例分析与消融实验,揭示成功关键
论文还给了一个很直观的案例:在多模态仪器读数任务里,没有检索技能时,Agent 容易乱用工具,局部读数也会偏;一旦检索到合适的工作流和执行技能,它就能先想清楚该看哪里、该怎么放大、该怎么验证。这个例子很能说明问题:技能不是装饰品,而是直接决定推理路径的“导航系统”。
消融实验最关键的结论有两个。第一,层次化设计是必要的 :工作流技能负责全局规划,执行技能负责局部落地,少了任何一个都不完整。第二,在线共同进化是必要的 :如果技能库只是静态记忆,早期弱轨迹蒸馏出来的经验很可能跟不上后续更强策略的水平,最后就会出现“旧经验拖后腿”的问题。
这也解释了为什么 SPyCE 比很多 memory-based 方法更强:后者更像“查字典”,前者更像“边学边写教材”。字典可以帮忙,但教材如果还能根据最新考试不断更新,效果自然更稳。
从工程角度看,这篇工作也有边界。它依赖较强的技能蒸馏模型 MLLMdk,还要做检索、合并、裁剪和周期性更新,系统复杂度比纯 RL 高一些;但换来的,是更稳定的长链路能力和更好的工具效率。对真正需要多步视觉操作的场景,这个代价是能理解的。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是多模态 Agent “做对一次不等于学会一次”的问题。以前很多方法只把轨迹当奖励,SPyCE 则把轨迹蒸馏成可复用技能,并让技能和策略在训练中一起变强。
执行技能和工作流技能有什么区别? 执行技能更像局部操作手册,管旋转、裁剪、放大这类具体动作;工作流技能更像总流程图,管先定位、再增强、再验证这类高层规划。一个管手上功夫,一个管脑子顺序。
为什么它比普通记忆方法更有效? 因为它不是只在测试时“查资料”,而是在训练时就让技能和策略相互影响。记忆方法往往是静态检索,SPyCE 则会把新产生的高质量轨迹继续蒸馏进技能库,形成持续进化。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是凭空造新词,而是把“轨迹→技能→策略”的闭环真正做实了,思路完整,且和现有 RL / memory 路线拉开了区别。
实验合理度: ★★★★☆ 八个基准、两种骨干、RL 与记忆方法都做了对比,消融也比较到位,整体比较能服人。
学术研究价值: ★★★★★ 它提出了一个很有延展性的方向:多模态 Agent 的能力积累,不该只靠参数更新,也可以靠技能沉淀与复用。
稳定性: ★★★☆☆ 方法逻辑很顺,但依赖技能蒸馏和检索链路,系统复杂度比普通 RL 高,落地时还要看库维护质量。
适应性以及泛化能力: ★★★★☆ 对多步视觉推理、工具编排、视觉搜索这类任务很合适,但对纯单步问答场景,收益可能没这么大。
硬件需求及成本: ★★★☆☆ 训练链路不轻,尤其还要做技能蒸馏和周期更新;不过推理阶段如果只保留检索,成本会比想象中可控。
复现难度: ★★★☆☆ 组件比较多,涉及 SFT、RL、技能蒸馏、检索和库维护,复现门槛中等偏上。
产品化成熟度: ★★★☆☆ 适合多模态工具型 Agent 原型,但要进产品,还需要更强的稳定性评估和更低成本的技能更新机制。
可能的问题: 技能蒸馏质量高度依赖强模型和高质量轨迹,若轨迹噪声大,技能库可能会“学歪”;此外,检索与更新链路较复杂,工程实现不算轻松。
主要参考文献
[1] Ru Zhang, Weijie Qiu. SPyCE: Skill-Policy Co-evolution for Multimodal Agents. arXiv, 2026.
[2] GRPO: Group Relative Policy Optimization. 论文中作为强化学习优化基线引用。
[3] Qwen3-VL-4B-Instruct / Qwen3-VL-8B-Instruct / Qwen3-VL-235B-A22B-Instruct. 论文实验与技能蒸馏所用模型。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群