← 返回 PaperDaily 视觉与图像

清华自进化新框架:让机器人学会自己找“坑”,失败率狂降67%!

机器人训练有个“鬼打墙”现象:数据越采越多,失败率却纹丝不动。清华这篇工作直接告诉机器人“哪里不行补哪里”——用一个轻量关键性模型引导数据采集,失败率最高降67%,还顺手解决了VLA微调的平台期问题。思路极简,效果很硬,值得一读。

原论文信息如下:
论文标题:
用于具身智能的自进化学习与关键性模型(Self-Evolving Learning for Embodied AI with Criticality Model)
发表日期:
2026年7月
发表单位:
清华大学、Dense-AI
原文链接:
https://arxiv.org/pdf/2607.28251v1.pdf

机器人的成长路上,总是充满了“我以为它会了”的错觉。预训练策略在仿真里跑得虎虎生风,一到具体任务微调就原地踏步,失败率像被焊死了一样横盘不动。是模型不够聪明吗?也许不是,更可能是喂给它的数据太“太平”了。
想想看,一个已经有点本事的机器人,在绝大多数“正常”场景里都能轻松完成任务,你往死里给它灌这些顺风顺水的数据,它除了越来越熟练地重复“我已经会的事”,还能学到什么呢?真正能让它进步的,是那些把它绊倒的“坑”——那些稀有、刁钻、一碰就翻车的失败场景。但默认的数据采集方式是随机撒网,能捞到这些“宝藏失败”的概率低得可怜。
清华大学和Dense-AI的研究者们显然也看不下去了。他们提出了一套名为“自进化学习”的框架,核心思路非常朴素且暴力:既然随机采样捞不到失败,那就干脆训练一个“关键性模型”来预测哪里会失败,然后照着地图去精准采集“高失败风险”的数据。这样循环迭代几轮,机器人就像开了窍一样,专挑自己的薄弱环节死磕,失败率自然就下来了。

引言

具身智能领域的预训练策略最近几年进展神速,尤其是视觉-语言-动作(VLA)模型和各类基础模型,已经展现出相当惊艳的跨任务泛化能力。但当这些预训练策略真正进入具体任务微调阶段时,问题就来了:成功率往往卡在一个上不去的阈值上,继续训练也几乎看不到收益。策略在常规场景下表现良好,但再往后训练,边际收益微乎其微。
这种“平台期”现象,表面上看是模型容量或优化算法的问题,但论文犀利地指出,这本质上是个数据问题。大多数现有微调方法,都默认数据是等价的,采集时使用均匀扰动,训练时随机抽取批次,完全不顾每条样本的信息量有多大。这种思路在失败率还很高的时候确实管用,但随着策略逐渐变好,问题就暴露了——这就是论文里提到的“稀有性诅咒”:当失败率趋近于零时,要遇到剩余的失败样本,所需的采样预算会随相关变量数量指数级增长。具身智能系统的状态-动作空间维度极高,扰动来源又包括动作噪声、外力、物体位姿、视觉条件等等,导致这个问题愈发尖锐。
这篇工作的核心观点非常干脆:别再均匀采样去碰运气找失败了,让模型自己判断哪些数据值得收集。具体来说,训练一个轻量级的关键性模型Cϕ,用策略自身的执行结果来预测P(失败|状态),然后把它嵌入到一个自进化的训练循环中。这个关键性模型定义了一个重要性采样分布,把数据收集的重点集中在容易失败的场景上,同时用重要性权重来校正采样偏差,保证学习目标的无偏性。本质上,就是用多样化、易失败的场景去替换掉冗余的常规场景,提高训练池的“信息密度”。
图1:自进化框架总览
图1:自进化框架总览。阶段一:预训练策略进行推演,成功/失败结果用于训练关键性模型Cϕ以预测P(失败|状态)。阶段二:关键性模型引导重要性采样,聚焦高关键性区域。阶段三:策略在精选数据上进行微调。阶段二和三迭代进行直至收敛。

方法概述

整套框架遵循一个统一的配方:训练一个关键性模型,用它的输出指导数据选择,然后重新训练策略。具体的数据来源、扰动类型和重训练目标会根据不同任务范式(强化学习还是模仿学习)有所调整,但“关键性引导采样”这个闭环循环是跟具体范式无关的。
整个流程清晰明了,论文里也给了非常直观的图。整个循环可以拆解为三个紧密咬合的齿轮:
第一个齿轮是“关键性模型训练”。用预训练策略在任务合适的扰动下做推演,收集大量的状态-结果配对数据,然后训练一个模型去预测当前状态下失败发生的概率。这些扰动对于强化学习策略来说可以是每一步的动作噪声或环境噪声,对于模仿学习策略则可以是各种各样的初始条件变化。
第二个齿轮是“关键性引导采样”。有了这个能预测失败概率的模型后,数据收集就变得有方向了。在每一步,对所有候选状态(比如外力网格、地形参数网格)打分,然后根据这个分数构建一个偏置的采样分布,把采样资源集中在高分区域。同时,为了保证后续训练不产生偏差,还要用重要性权重(即自然分布与偏置分布的比值)来校正。
第三个齿轮是“策略微调”。在这个关键性引导采样的数据池上,依据任务原本的学习范式进行微调。对于强化学习策略,论文采用离线方式,从带重要性权重的经验池里采样,用带优势加权和BC正则的Actor-Critic方法优化;对于模仿学习策略,则按照关键性分布去采样专家演示,然后做标准的行为克隆。
整个循环迭代进行,每一轮微调好的策略成为下一轮推演的基线,直到失败率下降趋于饱和。训练结束后,这个关键性模型还能在部署时继续发光发热,作为风险监控器,对每个状态打分,当风险超过阈值时就切换到微调后的策略,否则继续使用原始的预训练策略。这种“路由”机制非常实用,因为微调后的策略虽然在困难场景下表现更好,但在常规场景下可能会略有退步。

问题背景及相关工作

这篇工作其实踩在好几条研究线的交汇点上。要想理解它的巧妙之处,得先看看它从哪些地方获得了养分。

稀有事件重要性采样

重要性采样(Importance Sampling, IS)是一个估算稀有事件概率的标准武器。基本思路很简洁:既然稀有事件在自然分布下很难碰到,那就用一个偏向于稀有事件的偏置分布q(x)去采样本,然后用似然比P(x)/q(x)把偏差校正回来。在自动驾驶领域,Feng等人提出的NADE框架就是典型代表,他们训练一个关键性模型P(撞车|状态),然后按关键性加权的分布采样,把评估所需的里程数降低了几个数量级。在机器人领域,APE方法用高斯过程和归一化流来做零方差重要性采样;也有工作专门发展状态相关的提议分布来做失败概率估计。
但这些方法都有一个共同的局限:它们是用来做评估的,不是用来做训练的。也就是说,它们能告诉你“策略在某个场景下会失败”,但并不会告诉你“怎么用这些失败信息去改进策略”。最近Feng等人把NADE框架扩展成了一种稠密学习的训练范式,用关键性引导的数据选择在自动驾驶里实现了安全性的数量级提升,但他们的方法假设了单一的扰动模态和特定领域的状态表示。这篇论文做的,就是把从“评估”到“训练”的转变推广到具身智能,用一个统一框架处理各种类型的扰动。

从失败中学习

另一条研究线专注于如何从失败数据里榨取更稠密的奖励信号。有工作训练一个判别器放在失败轨迹上,给MuJoCo任务提供稠密奖励;也有工作从任务无关的先验数据里合成动力学感知的奖励。SERL和HIL-SERL提供了真实世界机器人学习的样本高效RL框架,并且引入了人工修正。针对VLA模型,SAFE用共形预测从VLA内部特征学习轻量级失败检测器;另外有工作学习(状态, 动作)判别器来生成稠密的进程奖励。π⋆0.6把价值函数集成进了VLA的自我改进。ADC则在数据收集时注入对抗扰动,其直觉与这篇论文一致:信息密度比数据量更重要。RADIUM通过在可微分仿真中的梯度加速采样来预测和修复机器人失败。
论文明确指出了自己与众不同的机制:关键性模型决定收集什么数据以及部署哪个策略,而不是去塑造训练损失函数。而且,同一个P(失败|状态)信号还能以零额外成本作为稠密奖励信号,直接惠及其他方法。

自进化具身智能体

越来越多的研究把策略改进看作一个迭代的闭环过程。自改进具身基础模型提出了自主在线RL练习;SEEA-R1在蒙特卡洛树搜索的数据进化和模型更新间交替;ROSKA通过大模型驱动的优化来协同进化奖励函数和策略;LiReN展示了开放世界部署中的终身导航改进;PLD则通过残差RL专家来探测VLA的失败区域,并把恢复的轨迹蒸馏回基础模型。
论文的框架也共享这种闭环哲学,但实现手段极其轻量:仅仅依赖一个训练在策略自身执行结果上的关键性模型,就能同时处理数据采样和部署路由两个环节,完全不需要大模型生成奖励、树搜索或辅助专家策略这些重装备。

研究目标

这篇论文的目标非常聚焦:打破具身智能策略在任务特定微调阶段普遍遭遇的“平台期”。作者认为平台期的根源在于微调数据的收集方式有缺陷——默认的随机采集管线把每条样本都当作是有信息量的,结果数据集被常规场景主导,而那些最稀有、最有价值的失败案例却被错过了。
图2:部署时路由机制
图2:部署时路由机制。关键性模型会为每个候选扰动产生的状态打分;如果任何分数超过阈值τ,就由微调策略处理决策;否则使用原始基线策略。
为了验证这套方法的通用性,论文在五个截然不同的领域进行了评估:宇树Go2四足机器人在MuJoCo中的运动控制、ManiSkill3多任务操作、LIBERO和RoboTwin两个VLA平台,以及一个真实世界的操作任务(把香蕉放到盘子里)。这五个领域覆盖了强化学习策略和模仿学习策略,从状态输入到

关键性模型:让机器人自己判断哪里会翻车

要理解这套框架,得先理解一个词:关键性模型(Criticality Model)。这个名字听起来高端,其实干的事情非常朴素——它就是一个裁判,坐在旁边盯着机器人的每一个状态,然后给出一个分数:这个状态下面,机器人翻车的概率有多大?
用学术一点的话说,关键性模型Cϕ是训练来预测P(失败|状态)的,也就是在给定状态下策略执行失败的概率。这个模型本身是个轻量级的多层感知机(MLP),输入是状态表示,输出的就是一个0到1之间的概率值。论文中对这个模型的训练采用的是标准的二分类交叉熵损失,公式如下:
公式1:关键性模型训练损失
公式1:关键性模型训练损失。其中y表示任务结果(0为成功,1为失败),s为策略执行过程中的状态,Cϕ(s)为关键性模型预测的失败概率。
这个公式看着平平无奇,但它的巧妙之处在于数据从哪里来。关键性模型的训练数据不是人工标注的,也不是外部专家给的,而是来自策略自身的执行结果。把预训练策略放出去跑一圈,每到一个状态就记一笔,最后这个状态对应的是成功还是失败,这些天然标注的数据就成了训练关键性模型的燃料。所谓“自进化”,第一层意思就在这里:模型用自己的经历来学习自己的弱点。
关键性模型需要多“重”呢?论文给出的答案是:非常轻。在Go2四足机器人任务中,关键性模型是一个三层MLP,两个256单元的隐藏层;在ManiSkill任务中是5层残差MLP,512单元隐藏层。这个体量的模型在GPU上的单步推理耗时不到1毫秒,对整个微调管线几乎没有任何额外负担。
为了让读者更好地理解关键性模型在整个框架中的位置和作用,可以先看看它的整体架构。下面的图1展示了完整的自进化框架:
图1:自进化框架总览
图1:自进化式训练的总览。阶段一:预训练策略进行推演,通过成功/失败的结果训练关键性模型Cϕ。阶段二:关键性模型引导重要性采样,将数据收集聚焦于高风险区域。阶段三:策略在筛选后的数据上进行微调。阶段二和阶段三迭代进行直至收敛。

三步闭环:从失败预测到数据重采再到策略进化

整个自进化框架可以拆成三个不断循环的阶段,每一步都踩在上一步的输出上,形成一套完整的闭环,跟手动挡汽车换挡一样有节奏。
阶段一是关键性模型的训练。用预训练策略在任务相关的扰动下做推演,收集大量的(状态,结果)配对数据。这里有个细节值得注意:对于强化学习(RL)训练的策略,扰动通常是逐步骤的动作噪声或环境噪声;而对于模仿学习(IL)训练的策略,扰动则更多体现在初始条件的变化上,比如物体位姿、光照条件等。模仿学习策略的失败滚动数据只用于训练关键性模型,绝不用来作为动作监督,这个边界划得很清楚。
阶段二是关键性引导的数据重采样。这一步是整个框架的引擎,核心是重要性采样(Importance Sampling, IS)。重要性采样是统计学中的经典方法:当目标分布中的稀有事件难以自然采样到时,就用一个偏置的提议分布去采,再用权重把偏差校正回来。论文中把关键性模型的输出转换成采样分布的方式如下:
公式2:关键性引导采样分布
公式2:关键性引导的采样分布。其中ε为混合系数,保证任何自然分布下概率为正的状态都有机会被采样到;κ(s)为关键性分数,最简形式直接取Cϕ(s),也可以用温度缩放的指数形式exp(β·Cϕ(s))来放大高/低关键性状态之间的区分度。
这个公式的精髓在于ε这个混合系数——它保证了提议分布q(s)在所有自然分布P(s)概率为正的地方都为正,这一点对于重要性采样的无偏性至关重要,后面会再讲。
阶段三是策略微调。在关键性引导采样的数据池上,按照任务原本的学习范式进行训练。对于RL策略,论文采用离线方式,从带重要性权重的经验池里采样,用优势加权Actor-Critic(AWAC)加行为克隆(BC)正则项的方式优化。对于IL策略,则按照关键性分布去采样专家演示,做标准的行为克隆。
三个阶段的循环会一直迭代,每一轮微调好的策略成为下一轮推演的基线,直到失败率下降幅度低于任务特定的阈值。论文中的实验显示,Go2任务迭代了7轮,每一轮失败率都在稳步下降,说明这种迭代不是原地踏步,而是渐进的累积过程。

五个战场:从仿真到真实世界的全面验证

一套方法值不值得信,最终要看它在多少种不同的场景下经得起折腾。这篇论文在五个完全不同的领域上做了验证,从仿真到真实世界,从强化学习到模仿学习,从状态输入到视觉输入,覆盖面相当广。下表给出了五个实验领域的概览。
表1:五个实验领域概览
表1:实验领域概览。涵盖Go2四足运动(MLP策略,地形扰动)、ManiSkill多任务操作(混合专家策略,外力扰动)、LIBERO和RoboTwin(VLA大模型策略,初始状态扰动)以及真实机器人任务(Pi0.5策略,物体位姿扰动)。
先看第一个战场:宇树Go2四足机器人在MuJoCo模拟器中的运动控制。任务设定是让机器人在不同地形上稳定行走,扰动空间是一个4维地形参数网格,离散成10⁴个候选。失败的标准包括摔倒、躯干或腿部碰撞力超过80牛、或者卡住不动。基线策略失败率约为3.58×10⁻⁴,经过7轮自进化迭代和路由机制,最终降到1.47×10⁻⁴,相对降低58.9%。
这个任务最有说服力的细节是控制实验:用随机收集的数据做同样轮数的微调,失败率几乎没有变化(3.57×10⁻⁴对比基线的3.58×10⁻⁴)。这说明多出来的训练量并不是提升的原因,关键性引导的采样才是。
表2:Go2运动实验结果
表2:Go2运动控制结果。在120,000次重要性采样推演中评估。基线失败率3.58×10⁻⁴,本方法降至1.47×10⁻⁴,相对降低58.9%。
第二个战场是ManiSkill3多任务操作,包含StackCube(叠方块)和PegInsertionSide(侧面插桩)两个任务。使用的策略是一个统一的混合专家(Mixture-of-Experts, MoE)模型,扰动形式是每一步施加一个随机的三维外力,网格为11³=1331个候选。基线平均失败率5.84%,7轮迭代后降至2.88%,相对降低50.8%。
表3:ManiSkill多任务操作结果
表3:ManiSkill多任务操作结果。失败率(%)。StackCube从5.01%降至2.56%,PegInsertionSide从6.67%降至3.19%,平均相对降低50.8%。
第三个和第四个战场是VLA(视觉-语言-动作)模型,这也是当前具身智能领域最受关注的赛道。LIBERO基准测试使用SimVLA模型(约8亿参数),涵盖40个任务、4个套件。RoboTwin双臂操作基准则使用StarVLA模型(约51亿参数,基于Qwen3-VL-4B骨干网络),50个任务共1000个评估回合。在这两个任务上,论文的方法分别实现了失败率25.1%和7.6%的相对降低。
表4:LIBERO失败率结果
表4:LIBERO各套件失败率(%)。基线1.87%,随机数据微调1.82%(几乎无提升),仅微调不路由2.13%(反而退步),本方法通过阈值路由降至1.40%(相对降低25.1%)。
表5:RoboTwin失败率结果
表5:RoboTwin失败率(%)。严格共同评估50个任务×20个回合=1000个回合。基线14.40%,随机数据微调反而恶化到20.70%,本方法通过路由降至13.30%(相对降低7.6%)。
第五个战场最硬核——真实世界机器人任务:在AgileX Piper双臂平台上做香蕉抓取放置。基线策略是Pi0.5(OpenPI),这个任务从240个随机采集的回合开始,然后用两个100回合的数据集微调,一个随机收集,一个关键性引导采样。关键性模型仅用8维几何坐标(盘子位置和香蕉位置)作为输入,以两层MLP就达到了AUC 0.918和F1分数0.821。最终,本方法将失败率从11.15%降至3.72%,相对降低66.6%。
表6:真实世界香蕉放置任务结果
表6:真实世界香蕉放置任务结果。失败率(%)。基线11.15%,随机数据微调恶化到18.05%,仅微调不路由6.05%(相对降低45.7%),本方法通过路由降至3.72%(相对降低66.6%)。
从Go2的58.9%,到ManiSkill的50.8%,再到真实机器人的66.6%,在自研基线的三个领域,失败率相对降低51%到67%;在VLA大模型基线的两个领域,也有8%到25%的相对降低。这些数字放在一起,基本可以确认这套方法的有效性不是运气。
看到五个领域全部有效,确实让人有点小兴奋。

为什么随机数据不行?信息密度才是关键

读到这里,读者可能心里会冒出一个疑问:用重要性权重校正了采样偏差,训练分布不是跟原始分布一样吗?那多采那些失败样本到底有什么用?论文专门回应了这个疑问,答案藏在“信息密度”这个概念里。
一个关键场景蕴含一种特定的失败模式。打个比方,机器人第一次在湿滑地面上滑倒,这个“滑倒”的失败案例被吸收后,再给它看100遍同样的湿滑场景,它能学到的东西就非常有限了。关键性引导采样的真正价值,在于扩大了不同失败模式的覆盖范围——把冗余的常规场景替换成多样化的高风险场景。在无偏训练的过程中,每个关键场景虽然被采样的概率降低了,但模型接触到的失败模式更丰富。常规场景很快就被学会,模型的能力就被解放出来,去吸收那些多样化的关键信息。
图3:多轮失败率趋势
图3:多轮迭代失败率趋势。左图Go2运动控制,右图ManiSkill多任务操作。蓝色为本方法,橙色为随机数据控制组;阴影带为95%置信区间。可以看到随机数据组几乎原地踏步,而本方法每轮都在稳步下降。
论文在每个领域都设置了一个极为严格的控制实验:完全相同的训练步数,完全相同的超参数,唯一区别是数据用随机方式采集而不是关键性引导。结果非常一致:随机数据在所有领域都几乎没有带来提升,在RoboTwin和真实机器人任务中甚至显著恶化了性能(分别从14.40%恶化到20.70%、从11.15%恶化到18.05%)。
表7:消融实验汇总
表7:消融实验结果汇总。随机数据在所有领域中要么没有提升要么显著恶化,而关键性引导采样始终带来显著改进。
这种趋势说明了一个经常被忽视的事实:数据量不等于信息量,训练步数不等于学习效率。当策略已经比较 competent 的时候,随机采样的数据里绝大多数都是“我已经会了”的常规场景,模型在这些数据上反复训练,无非是在巩固已有能力,对突破瓶颈几乎没有帮助。这也解释了为什么那么多预训练策略在微调时会遇到平台期——不是模型不想学了,而是喂给它的数据实在没啥可学的。
论文在RoboTwin上的一个细节更能说明问题:随机变体使用了与关键性引导完全相同的5000个回合数据量,再加上10%的全量回放,结果失败率从14.40%恶化到了20.70%。为什么同样数量的数据,随机选取反而有害?因为当数据量有限时,随机采样可能会漏掉那些真正需要学习的高价值场景,同时引入了大量与策略已知能力重叠的冗余场景,稀释了训练信号的浓度。这个结果从反面印证了信息密度的价值。

部署时的“红绿灯”:风险路由机制

自进化循环收敛之后,关键性模型并没有退休,它在部署阶段还要继续值班,扮演一个“红绿灯”的角色。
这里涉及到一个非常容易被忽略的实验发现:微调后的策略πft并不是在所有场景下都比基线πbase强。恰恰相反,由于微调数据主要集中在高关键性区域,πft在困难场景下表现优异,但在常规场景下反而可能略有退步。这在表4和表5中体现得非常清楚——LIBERO的Finetune-only失败率2.13%,比基线的1.87%还高;RoboTwin的Finetune-only失败率16.30%,也比基线的14.40%差。论文把这种现象称为“专业化权衡”(specialization trade-off)。
解决方案就是路由。关键性模型在部署时持续监控每个状态,给出失败概率打分。部署时的路由策略可以表示如下:
公式3:阈值路由策略
公式3:部署时的阈值路由策略。当关键性模型对状态的打分超过阈值τ时,由微调策略πft接管决策;否则继续使用原始基线πbase。阈值τ在留出验证集上通过扫描最小化路由后的失败率来确定。
直观来说,这就是给机器人装了一个风险探测雷达:雷达一响,说明前方高能,切换给“困难模式专家”πft去处理;雷达不响,就保持原来的常规模式。论文里的图2给出了这个机制的示意。
图4:部署时路由机制示意图
图4:部署时路由机制。关键性模型为每个候选扰动对应的状态打分;如果分数超过阈值τ,则由微调后的策略处理该决策,否则使用原始预训练策略。
正是这个路由机制,把LIBERO上的表现从“不如基线”翻转成了“显著优于基线”,把RoboTwin上的净增益变成了11个回合。在ManiSkill上则出现了另一个有趣的现象:微调后的策略在全关键性区间都优于基线,所以阈值扫到τ=0就是最优——说白了就是“你全绿也行,直接全程用新策略”。这个特例反过来证明了路由逻辑的正确性:它不是硬编码规则,而是根据数据自动找到最优分工。
从工程角度看,这种部署方案非常务实。预训练大模型作为主力保障常规场景的稳定输出,轻量级微调模型作为特种兵应对困难场景,关键性模型作为调度中枢决定何时切换。三个组件各司其职,没有引入任何额外的大模型或者重推理负担。

总结与未来展望

这篇论文的核心贡献可以浓缩成一句话:用一个轻量级的关键性模型,同时解决了“该采什么数据”和“该用哪个策略”两个问题。前者通过自进化的数据闭环突破了微调平台期,后者通过部署时的阈值路由实现了最优策略分工。整条链路不需要额外的标注
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球