← 返回 PaperDaily 视觉与图像

新范式!大模型自主设计质量多样性算法,机器人零干预学技能

想让机器人掌握一项新技能,传统做法是让专家手动设计各种评估函数和多样性指标,费时费力还经常翻车。这篇论文的思路很野:直接把自然语言任务描述丢给大模型,让大模型自己设计整套质量多样性算法的参数。结果如何?4个操作任务上生成的可用技能数量是专家方案的近70倍。

新范式!大模型自主设计质量多样性算法,机器人零干预学技能
原论文信息如下:
论文标题:
Autonomously Acquiring Robot Manipulation Skills with Language-Driven Quality-Diversity
发表日期:
2026年08月
发表单位:
未明确
原文链接:
https://arxiv.org/pdf/2608.30983v1.pdf
开源代码链接:
论文中提及代码将公开发布(详见原文Github说明)

从自然语言到机器人技能:LLM驱动的质量多样性算法

想让机器人学会抓取杯子,传统操作是什么路子?找专家写一堆评估函数:判断夹爪有没有碰到物体、物体有没有脱离桌面、运动轨迹是否平滑……写完还得反复调参,换个任务全部重来。这感觉就像每次换一道菜都要重新雇一个大厨——太费劲了。
近几年流行的质量多样性算法(Quality-Diversity,QD)是个好工具。它不像传统进化算法那样只盯着一个最优解猛卷,而是同时追求“质量”和“多样性”——不仅解要好,还要五花八门:有的技能从正上方抓,有的从侧面抄过去,有的带着旋转轨迹绕一下。这样一个技能库在部署时就有了零样本适应能力,遇到没见过的障碍物或新约束,直接从库里边挑一个能用的方案顶上,不需要重新规划。
但QD算法有个让人头疼的前提:必须由专家手动设计三个核心组件——成功条件(success condition)用于判断任务有没有完成,适应度函数(fitness)用于度量个体优劣,行为描述符(Behavior Descriptor,BD)用于刻画“这个技能是怎么做的”。这三样东西设计得好不好,直接决定技能库的质量,而它们恰恰又需要大量专业知识和试错。
与此同时,大语言模型已经展现出作为“奖励函数设计器”的能力——给定一句自然语言任务描述,LLM能写出对应的奖励函数代码。但这类方法输出的是单一的高性能策略,机器人面对新环境时缺乏应变空间。一个是“多样性拉满但参数全靠人工”,一个是“全自动但只会一个招式”——能不能把两者的优势结合起来?
这篇论文的答案是:能。本文提出了一套完全由LLM驱动的QD自主参数化方案。用户只需输入一句自然语言任务描述,LLM自动推断出成功条件、多个适应度函数和多组行为描述符候选,再利用一个多行为描述符的MAP-Elites Success算法(Multi-BD MES)生成一个包含大量多样化运动原语的技能档案库。整个过程不需要专家干预,也不需要针对特定任务设计提示词或微调模型。
图1:本文方法的整体流程概览
图1:本文方法的整体架构。(左)用户输入任务描述后,LLM分别推断行为描述符(BD)、适应度(f)和成功条件(SC)空间的函数样本,组合生成三个多BD档案库。(中)保留训练中表现最好的适应度函数对应的档案库,使用多BD MAP-Elites Success算法继续训练。(右)最终得到包含多样化机器人运动方案的档案库,能够在部署时零样本适配未见过的任务实例。
简单说,这套流水线把“专家敲代码”变成了“LLM写代码”,然后让进化算法自己去跑。实验结果显示,在4项机器人操作任务上,本文方法生成的可用技能数量相比专家手写方案提升了近70倍——比如抓取任务,手写方案只能产出一个不到6条成功技能的小档案库,本文方法直接干到403条。

突破传统QD算法的瓶颈:自主参数化设计

先看本文如何形式化“设计技能档案库”这件事。给定一个已知任务(比如“抓取杯子”),实际部署时可能遇到各种任务实例——杯子带把手、杯子在桌角、杯子里有水不能倾斜……用数学语言表达,目标就是找到一个技能档案库A,使得它尽可能完成任意一个未知的任务实例,核心优化目标如下:
公式1:技能档案库优化目标
公式1:技能档案库设计问题的优化目标。其中A表示一个运动原语集合(档案库),T是未知的任务实例分布,1(A achieves tᵢ)是一个指示函数——如果档案库A中存在至少一条技能能够完成实例tᵢ则取1,否则取0。直观理解:在所有可能的档案库中找到那个“成功率期望最大”的档案库。
形式化很清晰,难点在于怎么找到这个档案库。传统QD算法需要人工设计三个核心函数,本文的思路是把LLM的代码生成能力和一个“采样探索”机制结合起来,自动完成参数化设计。
第一个是成功条件。这个相对好办,LLM根据任务描述和仿真API写一个返回布尔值的函数即可。论文只推断一个成功条件,降低计算负担。第二个是适应度函数。论文做了个关键假设:适应度可以表示为每仿真步一个数值的均值,这样就可以把“找适应度函数”简化为“找一个从仿真状态到数值的映射”。为了覆盖适应度空间的多种可能性,LLM在一次推理中不重复地采样3个不同的适应度函数,分别训练3个档案库,短跑后留下表现最好的那个,其余淘汰。
最棘手的是行为描述符(BD)的设计。BD直接决定“多样性”的含义——是区分抓取位置,还是区分物体的运动方向?LLM不像领域专家,让它零样本猜一个完美BD确实有点强人所难。论文的做法是:不要求LLM一步到位,而是把BD空间拆成两个低维子空间分别探索。
具体来说,BD函数被分解为两个部分的组合:信息提取函数g和时戳函数h。g负责从仿真状态中提取关键信息(比如“夹爪x坐标”“物体角速度”),h负责决定在哪个时间点测量这些信息(比如“首次接触时”“最终时刻”)。“什么信息”和“何时测”这两个空间都比完整的BD空间简单得多,LLM分别采样更靠谱,也能确保持续覆盖而不重复。
图2:BD空间采样过程
图2:BD空间采样方法。(左)把BD探索拆成两阶段:先找“何时测量”,再找“提取什么信息”。(中)LLM分别对两个空间进行不重复采样,保证候选函数覆盖广泛。(右)将采样结果组合成BD候选集合,用作后续多BD算法的行为描述符。
所有g和h的组合就组成了一个“BD网格”(BD mesh)。注意这些BD不一定每个都“合理”,但它们的多样性本身就是一种财富——因为实验发现,LLM推断出的BD往往和专家手写的不一样,但它们在驱动搜索方面往往更高效。

多BD MAP-Elites:如何利用异构行为描述符

先补个背景知识。MAP-Elites(精英映射)是QD算法里的经典代表,它的核心思想是把行为空间离散成一个个网格(niches),每个网格保存该区域内适应度最高的那个个体。这样进化过程就是一个“点亮地图”的过程:不同行为方式的精英个体被保留下来,最终形成一张覆盖整个行为空间的“点亮地图”。
本文使用的是MAP-Elites的一个变体——MAP-Elites Success(MES)。它引入了一个成功条件:在进化过程中,成功个体优先参与变异和选择。这么做的好处是,在稀疏奖励的场景下,能有效引导搜索方向,快速积累成功样本。
标准的MES只用一个BD维护单一网格。但本文拿到的是一堆LLM推断出的BD候选——每个BD刻画行为的不同侧面,只挑一个显然浪费,全用又不知道怎么用。论文的解法很直接:在同一个进化过程中维护多个BD网格。每个个体被评估后,同时插入所有BD网格中对应的格子,通过局部竞争更新每个网格的精英。选择阶段,从每个网格独立选出一批精英,合并后统一变异、评估。
图3:标准MES与多BD MES算法对比
图3:(左)标准MES算法:从单一档案库中选精英,变异、评估,再通过局部竞争插回档案库。(右)多BD MES算法:从每个BD网格中分别选出精英,拼接合并后统一变异、评估,评估结果再插入所有BD网格参与局部竞争。
整个算法流程可以用伪代码概括。输入只有任务描述和仿真API,LLM分别推断成功条件、适应度函数集合、时戳集合和信息提取函数集合,然后组合成BD网格。接着对每个候选适应度函数跑一轮短期的多BD MES训练,选出表现最好的适应度函数,最后用这个胜出的组合正式生成档案库。
    Algorithm 1 自主QD技能获取流程
    输入: 任务描述 T, 仿真API e
    步骤1: 推断
      成功条件 sc ← LLM₁(T, e)
      适应度函数 {fᵢ} ← LLM₂(T, e)     # 不重复采样
      时戳样本 {hⱼ} ← LLM₃(T, e)       # 不重复采样
      信息提取函数 {gₖ} ← LLM₄(T, e)   # 不重复采样
      BD网格 φ = {gₖ ∘ hⱼ}
    步骤2: 适应度探索
      for 每个适应度函数 fᵢ:
        档案库 Sᵢ = 多BD_MES_短训(fᵢ, φ)
    步骤3: 适应度选择
      统计各档案库成功个体数 {sᵢ}
      选出最优适应度函数 fᵢₘₐₓ
    步骤4: 正式生成
      档案库 S = 多BD_MES_长训(fᵢₘₐₓ, φ)
    返回 S
    为什么多BD方案效果这么好?论文给出了一个有意思的解释:专家手写的BD通常是“描述型”的——它忠实刻画行为的功能差异,但很稀疏,导致网格很难被填满,早期成功个体稀少。而LLM推断出的BD往往是“驱动型”的——虽然不一定有清晰的语义,但数值上更密集,更容易快速积累成功个体。多BD同时维护多种BD,等于“既有人类视角的多样性,又有机器视角的高效探索”,两全其美。

    实验验证:4项操作任务的全面评估

    实验在Genesis仿真器中进行,LLM采用GPT-4o且温度设为0。候选解模板是一个6自由度的初始位姿加3自由度的运动向量——机器人先运动到初始位置,闭合夹爪,然后沿笛卡尔空间直线运动。任务选了4个典型的操作场景:抓取杯子、打开抽屉至少10厘米、打开热水水龙头、在桌面上推动杯子至少5厘米。
    图4a:Genesis仿真器中的任务环境示例 图4b:各任务环境全景示意
    图4:Genesis仿真器中各任务的环境示例。按阅读顺序依次为:抓取任务、抽屉任务、水龙头任务、推物任务(桌面尺寸通过亮线标示)。
    对比基线有3个:Naive inference(标准MES配上LLM直接推断的三要素,但不用本文的探索机制)、Hand-crafted MES(专家手写成功条件、适应度和BD,BD使用真值BD)、以及遗传算法(GA)(LLM只推断适应度,无多样性保持机制)。所有方法计算量对齐——同样的种群规模和评估次数。评价指标有两个:成功档案大小(用专家编写的成功条件来判断个体是否真正的成功)和GT BD覆盖率(把产出个体投影到专家定义的真值BD空间,衡量行为多样性)。
    图5a:各任务执行示例 图5b:各任务执行过程截图
    图5:每个任务的一次完整执行示例(rollout)。可以看到机器人从初始位姿出发,经历夹爪闭合、直线运动和接触交互,最终完成对应任务。
    先看最难的抓取任务。
    表1:抓取任务实验结果
    表1:抓取任务实验结果。在这个困难的探索问题上,本文方法找出的抓取方案数量是直接推断基线的2倍以上,并且大幅超越手写MES方案。手写基线平均只有5.8个成功技能,遗传算法则是0个——完全失效。
    抓取任务的恐怖之处在于“稀疏交互”:机器人只有真正碰到物体才能获得有效反馈,绝大多数随机尝试都是空挥。手写BD虽然语义清晰,但网格太稀疏,几十代进化很难填出足够多样性的种子。本文方法用3个候选适应度函数和多组BD同时跑,相当于多个搜索视角并行探索,成功率自然上去了。
    第二个任务是打开抽屉至少10厘米,结果如下表。
    表2:抽屉任务实验结果
    表2:抽屉任务实验结果。本文方法找到了约2720条成功轨迹,超过直接推断(110条)和手写基线(113条)一个数量级。GT BD覆盖上,本文方法达到334.4格,而手写基线只能覆盖113格。
    第三个任务是打开热水水龙头。这个任务相对容易,所有方法都能填满GT BD空间,重点看绝对数量。
    表3:水龙头任务实验结果
    表3:水龙头任务实验结果。在这个容易探索的问题上,所有方法都能填满GT BD空间。但本文方法找到13492条成功轨迹,远高于直接推断的7932条和手写的85条。即使GA也能找到526条轨迹,但它的GT BD覆盖只有84.6格——多样性很差。
    最后一个任务是推杯子至少5厘米,结果最夸张。
    表4:推物任务实验结果
    表4:推物任务实验结果。本文方法找到85518条成功轨迹,比直接推断基线(4028条)多出20倍。虽然普通遗传算法也能找到455条轨迹,但其GT BD覆盖仅8.6格——几乎所有的解都挤在同一类行为上,多样性差得离谱。
    整体来看,实验结果呈现三个清晰信号。第一,手写专家方案并不一定比LLM推断方案强——尤其在探索困难的任务上,精心设计的稀疏BD反而拖了后腿。第二,多BD策略是本文成功的关键,它让不同类型的BD并行工作,驱动型BD快速累积成功样本,描述型BD保持行为空间的语义覆盖。第三,没有多样性机制的传统进化算法在这种场景下基本不可用,GA虽然能产出成功个体,但行为模式极其单一。
    需要说明的是,论文作者也坦诚指出了当前方法的方差问题:同一任务多次试验,成功档案数量的标准差相当大(比如抓取任务403.3±218.0)。部分原因在于LLM采样本身存在随机性,加上进化算法的随机种子影响。未来可以通过向档案库注入随机解等方法提升稳定性。

    局限与展望:从仿真到现实

    先说局限。本文的所有实验都在Genesis仿真器中完成,运动模板是固定的“单段直线运动”——机器人从初始位姿出发,闭合夹爪,沿直线推过去。这种模板适合抓取、推、开水龙头这类简单的操作,但对多阶段复杂任务(比如插线、装配、倒水)就力不从心了。夹爪的开合时机、运动轨迹的曲率、多段运动的衔接都是未来的改进空间。
    再有就是高方差问题。同一任务跑5次,结果波动巨大。论文作者也指出,通过注入随机解、调整选择压力等手段可以缓解,但本文没有做更细致的调优。
    展望方面,论文提出两个方向。一是课程学习:把复杂的技能分解成简单技能的拼接,QD生成的多样化技能库天然适合做这种技能链(skill chaining)。二是自动化生成任务自适应的运动模板——比如根据任务自动调整路径点数量、插值方式、夹爪开关时机等。加上域随机化技术,这套方法有望从仿真走向真实机器人。
    这篇论文更大的想象空间在于:它打通了“自然语言 → 多样化技能库”的自动化链路,而这条链路正是训练视觉-语言-动作模型(VLA)所需的大规模轨迹数据的关键瓶颈。传统VLA训练依赖人类遥操作采集数据,成本高昂;如果QD算法能自主生成大量多样化轨迹,再配合筛选和蒸馏,或许能大幅降低具身智能的数据获取成本。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:
    这篇论文到底在解决什么问题?本论文提出一种语言驱动的质量多样性(QD)技能获取框架,仅需自然语言任务描述,大模型即可自动推断成功条件、适应度与行为描述符,驱动多BD MAP-Elites算法生成多样化机器人运动档案,在4项仿真操作任务中大幅超越人工设计与直接
    这篇工作最值得看的点是什么?在所有4个任务中,所提方法在成功档案大小和真实BD覆盖率方面均优于所有基线方法,特别是在困难探索任务中优势明显。
    这篇工作的边界或风险在哪里?优点:(1) 实现了完全自主的机器人技能获取,仅需自然语言任务描述;(2) 通过多BD策略有效结合了驱动型BD和描述型BD的优势;(3) 在困难探索问题上表现优异。缺点:(1) 结果方差较大,稳定性有待提高;(2) 运动模板较为简单,限制了可处理任务的复杂度;(3) 未进行sim2real迁移验证。
    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆

    把LLM从“奖励函数设计”推进到“QD算法全套参数自主设计”,并提出了BD空间分解采样+多BD MES的完整方案。这个组合思路是新的,实验也证明了其有效性。

    实验合理度:★★★★☆

    对比设置比较全面:包含手写专家基线、直接推断基线和遗传算法基线,且计算量对齐。不过多次实验的标准差较大,结论的稳定性有待增强。

    学术研究价值:★★★★☆

    为“自主技能获取”提供了新范式,让自然语言直接驱动技能多样化成为可能。对机器人学习、QD算法和具身智能数据生成三个方向都有启发。

    稳定性:★★★☆☆

    实验方差较高(如抓取任务403.3±218.0),不同随机种子结果波动明显。虽然趋势一致,但直接用于产品化仍需更多稳定性优化。

    适应性以及泛化能力:★★★☆☆

    目前仅在仿真环境的4类操作任务上验证,运动模板较为单一。对多阶段、长时程的复杂操作任务,适应性仍需检验。

    硬件需求及成本:★★★★★

    使用Genesis的GPU并行评估,50代进化不需要大规模集群;LLM推理只调用API。运行成本非常友好。

    复现难度:★★★★☆

    论文给出了详细的实现细节(候选解模板、变异参数、LLM提示模板),但代码尚未完全开源,提示模板也只放在附录。如果能开源,复现会很顺畅。

    产品化成熟度:★★☆☆☆

    仍然是研究原型。仿真到现实的迁移尚未验证,运动模板覆盖面有限。但作为“自然语言自动生成技能库”的底层能力,未来有潜力整合进机器人数据流水线。

    可能的问题:基线设定对本文较有利。手写基线用的是“描述型”BD,这类BD在短训练内的确处于劣势;如果给专家更多调参空间,胜负未可知。另外,多BD训练的时间开销和方差问题需要更深入的消融分析。


    主要参考文献

    [1] 本文论文: Autonomously Acquiring Robot Manipulation Skills with Language-Driven Quality-Diversity. arXiv:2608.30983, 2026. https://arxiv.org/pdf/2608.30983v1.pdf
    [2] Mouret J-B, Clune J. Illuminating search spaces by mapping elites. arXiv:1504.04909, 2015.
    [3] Cully A, Clune J, Tarapore D, et al. Robots that can adapt like animals. Nature, 2015, 521(7553): 503-507.
    [4] Yu W, Gileadi N, Fu C, et al. Language to rewards for robotic skill synthesis. arXiv:2306.08647, 2023.
    [5] Ma Y J, Liang W, Wang G, et al. Eureka: Human-level reward design via coding large language models. arXiv:2310.12931, 2023.
    [6] Appius A X, Garrabe E, Helenon F, et al. Task-aware robotic grasping by evaluating quality diversity solutions through foundation models. arXiv:2411.14917, 2024.

    end
    想让机器人真正“听懂人话”去干活?欢迎加入龙哥读论文粉丝群,和数千名AI同好一起拆解LLM+机器人交叉方向的最新前沿!扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器人+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
    wechat_helper dianzan

    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。