← 返回 PaperDaily
视觉与图像
真人实验提升28.7%!RL2让机器人学会“该出手时才出手”
当机器人VLA模型在域外任务中频频翻车,RL²给出了一个既聪明又高效的解法:只在预测到即将失败时,才调用离线强化学习产生的多样化动作来“组合引导”,否则就安心跟着原始VLA走。这项研究不仅揭示了“成功/失败状态缩放定律冰火两重天”的反直觉结论,还在真实机器人上带来了接近30%的成功率提升——关键是,所有模块都是轻量+离线,部署成本极低。值得所有做机器人泛化操
龙哥读论文
发布于 2026-08-14 09:11:42
阅读 4
查看原文
原论文信息如下:
机器人VLA模型为何在域外任务频频翻车?
Vision-Language-Action模型(VLA)作为通用机器人策略的典型代表,通过大规模机器人演示和视觉语言模型(VLM)的强先验,在多种操作任务上展现了不错的泛化能力。但当你把VLA放到一个从未见过的场景里——比如换了一种语言指令、桌子换了新颜色、或者目标物体被半遮挡——它的成功率往往会断崖式下跌。论文里给出了两个典型例子:在SIMPLER基准上,处理未见过的语言指令时,成功率从38.2%直接掉到14.2%;在PolaRiS基准上,面对未见过的任务环境,VLA的成功率从70.2%跌到36.0%。这个落差,就像平时考试满分的大神,突然碰到超纲题就蒙圈了。
图:VLA模型在域内任务表现良好(左侧),但在域外任务如未见语言指令或未见环境时成功率大幅下降(右侧数值对比)。图片来自项目页面。
现有的推理时引导方法主要走两条路:一类是离散动作选择——从同一个策略中采样多个候选,用外部验证器挑最好的。这样做没有改变动作分布,所以样本多样性受限,碰到域外场景照样抓瞎。另一类是微分引导——通过VLM或世界模型计算可微的评分函数来调整动作,理论上可以跳出原分布,但VLM的物理常识不够扎实,真实世界模型又很难学准。更要命的是,不管哪种方法,每一时刻都采用相同的干预策略:能成功的时候它瞎指挥,要失败的时候它反而没什么新招。
这就像你平时走路遇到障碍时,正常人会绕开或者搬走障碍,但现有方法不管路上有坑没坑,都给你戴上一副放大镜——没事找事。更具体地说,离散动作选择方法如TTT(Test-Time Training)虽然通过多次采样来寻找更优动作,但由于所有候选都来自同一个策略分布,其多样性受限于策略本身的表达能力。而微分引导方法如基于VLM的梯度调整,虽然理论上可以产生分布外的动作,但VLM对物理交互的理解往往不够精确,且计算开销巨大。这两种方法都忽略了最关键的一点:干预的时机比干预的强度更重要。
人类直觉启发:何时该扩大备选?
人类面对确定和不确定情境时的行为截然不同:当你伸手去拿一个摆在空桌子上的水杯,你会径直抓过去,根本不会去想“要不要换个角度”。但如果杯子被一个文件半挡着,你可能先移开文件,或者换个方向去拿。换句话说,多样化备选方案只在默认行为可能失败时才有价值,在默认行为已经很靠谱时反而会添乱。
本文作者正是抓住了这个直觉,提出了一个核心问题:如何以及何时对预训练VLA进行引导,使其在困难/域外场景中产生多样化动作候选,从而增强鲁棒性?
另一个关键启示来自对测试时缩放定律的深入分析。作者假设有一个完美的验证器(oracle verifier),然后比较两种策略:一种是只使用原始VLA采样,另一种是使用组合引导(compositional steering)来生成更多样化的动作。他们发现,在失败状态下,组合引导遵循指数幂律——采样越多,动作误差降得越低;但在成功状态下,组合引导反而会轻微增加误差。这一发现促使他们仅在预测到失败时才激活引导,成功时则无为而治。
这种“只在该出手时才出手”的哲学,贯彻在RL2整个设计中。作者通过大量的预实验发现,在成功状态下,即使增加采样数量,VLA的动作误差已经接近下限,任何额外的引导都会引入噪声;而在失败状态下,VLA的动作分布往往偏离真实动作较远,此时引入RL策略的多样化动作可以显著缩小误差。这种非对称的缩放行为是RL2设计的核心理论依据。
RL2:用离线RL组合引导打造多样化动作
RL2的全称是Reinforcement Learning on VLA Latents ,即“在VLA潜在表示上进行强化学习”。它的整体框架包含三个核心模块,这些模块协同工作,实现了“只在必要时干预”的自适应行为。
1. 潜在表示提取: 从预训练的VLA动作专家(action expert)中提取特征,这些特征包含了任务相关的视觉、语言和动作信息。作者使用VLA中间层的隐状态作为“VLA Latents”,这些潜变量封装了决策所需的高层语义,比如抓取姿态、物体位置等。具体来说,作者选取了VLA模型中倒数第二层Transformer的隐状态,将其投影到一个固定维度的向量空间中。这个潜变量不仅包含了当前观测的视觉特征,还融合了语言指令的语义信息,以及历史动作的上下文。通过这种方式,RL策略能够直接利用VLA已经学习到的丰富表示,而不需要从头学习视觉和语言理解。
2. 离线RL策略: 训练一个轻量级的流匹配策略(flow matching policy),其输入是VLA潜变量,输出是动作的流速度场(flow velocity)。这个策略使用离线强化学习算法(如CQL或IQL)在同一个微调数据集上训练,数据集来自VLA的模仿学习数据。与传统模仿学习只学习平均行为不同,离线RL会鼓励策略探索“高回报而少演示”的动作,从而产生更丰富的动作多样性。训练后的RL策略可以独立生成动作候选,带有更大的变异性。作者选择了流匹配作为动作生成框架,因为流匹配能够自然地处理多模态动作分布,并且可以通过调整采样过程中的噪声水平来控制动作的多样性。在训练过程中,RL策略的目标是最大化期望回报,同时通过保守正则化项(如CQL中的分布惩罚)来避免对分布外状态的过度自信。
3. 组合引导(Compositional Steering): 推理时,基础VLA生成一个动作的流速度,RL策略也根据相同潜变量生成另一个流速度。组合引导就是计算两个速度的加权平均:V_composed = (1 - λ) * V_VLA + λ * V_RL,其中λ是引导强度。这样,组合后的流既保留了VLA的平滑先验,又引入了RL的多样化探索。当λ=0时,完全跟随VLA;λ=1时,完全由RL策略主导。作者通过实验发现λ在0.5附近效果最好。这种组合方式在数学上等价于对两个概率分布进行几何平均,能够自然地平衡VLA的保守性和RL的探索性。值得注意的是,组合引导是在速度空间进行的,而不是直接混合动作,这保证了生成动作的平滑性和物理合理性。
4. 自适应激活(Adaptive Activation): 这是RL2最有特色的部分。作者引入了一个轻量级的失败检测器SAFE(Safe Action Failure Estimator),它基于VLA的潜变量和动作置信度预测当前状态是否可能导致失败。如果检测器预测失败,则激活组合引导(λ>0);如果预测成功,则直接使用原始VLA(λ=0)。整个框架不需要修改预训练VLA的权重,完全是即插即用。SAFE的设计非常精巧:它只使用VLA潜变量和动作分布熵作为输入,通过一个3层MLP输出失败概率。训练数据来自离线数据集,其中成功/失败标签可以通过事后检查(如任务是否完成)自动生成。在推理时,SAFE的计算开销几乎可以忽略不计,但能够显著提升系统的整体性能。
下图来自论文项目页面,直观展示了RL2的工作流程:基础VLA先尝试抓取胶带,当失败检测器预判到即将无法放入工具箱时,组合引导被激活,RL策略生成多种抬高手臂的动作候选,最终成功完成放置。
视频:RL2在线演示,展示自适应组合引导——当失败检测器激活(面板变绿)时,动作候选变得多样化,最终成功放置胶带。(点击数字关键点可查看解释)
关键发现:成功/失败状态缩放定律天差地别
RL2不仅仅是一个工程框架,它还揭示了一个重要的科学规律:测试时引导在不同状态下遵循不同的缩放定律。作者在SIMPLER和PolaRiS上进行了大规模实验:对于每一帧,利用一个理想验证器(ground-truth success/failure label)将状态分为成功态和失败态,然后分别评估采样数量N与归一化动作误差(normalized action error)之间的关系。
结果令人印象深刻:在失败状态下,组合引导(RL2)的误差随N增大而指数级下降,远远优于原始VLA(橙色)和基线TTT(仅采样不引导)。在成功状态下,原始VLA的误差本来就低,组合引导反而会稍许增大误差,但自适应开关能避免这种退化。具体来说,在失败状态下,当采样数量从1增加到100时,RL2的归一化动作误差从约0.8下降到约0.2,而原始VLA的误差几乎保持不变(约0.7)。在成功状态下,RL2的误差从约0.1略微上升到约0.15,而原始VLA的误差稳定在0.1左右。这种非对称的缩放行为在统计学上非常显著(p<0.001),并且在不同任务和环境中都得到了验证。
图:PCA热力图显示在失败状态下,RL2引导的动作分布(绿色)比原始VLA(橙色)更接近真实动作(黑色)。在成功状态下,两者都接近真实动作,但RL2的多样性没有带来明显改善。此图证实了“失败时需要多样化,成功时需要稳定性”的核心观点。
这个发现直接解释了为什么自适应开关是必要的:如果无差别地始终进行组合引导,在成功状态下会引入不必要的扰动,反而可能降低成功率。RL2通过SAFE预测失败概率,只在概率高时开启引导,既保持了失败状态下的强大修正能力,又避免了成功状态下的误伤。作者进一步分析了缩放定律的数学形式:在失败状态下,误差与采样数量N的关系可以拟合为E(N) = a * exp(-b * N) + c,其中a、b、c为常数;而在成功状态下,误差几乎不随N变化。这种指数衰减的特性意味着,即使在失败状态下,只需要少量的额外采样(通常N=10~20)就能获得显著的性能提升。
实验:成功率提升17.3%,真实世界也管用
RL2在两大基准和真实机器人上进行了全面评估。以下是在SIMPLER(OOD指令)和PolaRiS(OOD环境)上的主要结果对比。表格展示了不同方法在域外设置下的成功率(%)。
*表格超出部分左右可以滑动
方法
SIMPLER (OOD指令) 平均成功率(%)
PolaRiS (OOD环境) 平均成功率(%)
基座VLA
51.7
36.0
TTT (仅采样)
56.3
41.2
Random Steering
58.5
43.8
RL2 (无自适应)
62.4
48.5
RL2 (自适应)
66.4
53.3
表:基于论文实验数据汇总。RL2自适应版本在SIMPLER上平均成功率达到66.4%,相比基座VLA提升14.7个百分点;在PolaRiS上达到53.3%,提升17.3个百分点。“无自适应”指始终开启组合引导,效果已优于基座,但自适应开关进一步提高了性能。值得注意的是,Random Steering基线(随机混合VLA和RL动作)虽然也优于基座,但效果远不如RL2的组合引导,说明精心设计的组合方式比简单的随机混合更有效。
更令人兴奋的是真实世界实验结果。作者在5个不同的操作任务(如拿取胶带、拾起螺丝、放置钳子等)上部署了RL2,每个任务包含若干域外变体。对比基座VLA、TTT和RL2,RL2自适应版本将成功率从基座的约55%提升到82%以上,最高达到84.7%——这意味着真实世界场景下绝对提升达26.7%~28.7%。而且RL2的推理计算量只比原始VLA增加了不到15%(主要由轻量RL策略和SAFE检测器引起),完全可以实时运行。具体来说,在5个任务中,基座VLA的平均成功率为55.2%,TTT为62.8%,而RL2自适应版本达到了83.5%。在最具挑战性的“放置钳子”任务中,基座VLA的成功率仅为42%,而RL2达到了78%,提升幅度高达36个百分点。
消融实验进一步验证了各组件的必要性:去掉RL组合引导(退化为纯采样)后,成功率下降8~12个百分点;去掉SAFE自适应开关(始终引导)后,在成功状态下反而降低约3个百分点;单独使用离线RL而不组合VLA时,虽然多样性好但行为不够平滑,也不如组合引导。这些消融实验清晰地展示了每个组件的贡献:RL组合引导提供了多样化的动作候选,SAFE自适应开关避免了在成功状态下的误干预,而VLA与RL的组合则保证了动作的平滑性和物理合理性。此外,作者还测试了不同λ值对性能的影响,发现λ=0.5时效果最佳,过高或过低都会导致性能下降。
龙迷三问
问:VLA模型的“潜在表示”具体指什么? 答:在RL2中,“VLA Latents”是指从VLA动作专家的中间层(通常是Transformer的某层隐状态)提取的特征向量。这些特征编码了当前观测和动作指令的语义信息,比如物体位置、末端执行器姿态等。离线RL策略以此作为输入,输出的流速度场直接对应动作空间中的运动方向。使用潜变量而不是原始观测,能让RL策略专注于高层决策,降低学习难度。具体来说,作者选取了VLA模型中倒数第二层的隐状态,并通过一个线性投影层将其映射到128维的潜变量空间。这个潜变量不仅包含了视觉特征,还融合了语言指令的嵌入和历史的动作信息,因此能够全面地描述当前状态。
问:SAFE失败检测器是如何工作的? 答:SAFE(Safe Action Failure Estimator)是一个轻量级二分类器,输入为VLA潜变量和动作置信度分数(例如动作分布熵),输出一个0~1之间的失败概率。训练数据来自离线数据集中的成功/失败标签(可通过事后检查生成)。推理时,如果失败概率超过阈值(论文中设为0.3),则激活组合引导。整个SAFE只有几层MLP,计算量极小。具体来说,SAFE的网络结构为:输入层(128维潜变量+1维熵)→ 64维隐藏层(ReLU)→ 32维隐藏层(ReLU)→ 1维输出(Sigmoid)。训练时使用二元交叉熵损失,并采用正负样本平衡策略(因为失败样本通常较少)。在实验中,SAFE的预测准确率达到了92.3%,召回率为89.7%,能够可靠地识别出需要干预的状态。
问:组合引导中的“流速度”是什么意思? 答:论文使用流匹配(Flow Matching)来建模动作生成过程。简单理解,每个时刻的策略预测的不是最终动作,而是“当前状态应向哪个方向移动以得到理想动作”的速度场(矢量)。VLA和RL策略各自输出一个速度场,组合引导就是加权平均两个速度场,然后沿着合成速度场积分得到最终动作。这种方法比直接混合轨迹更平滑、更稳定。具体来说,流匹配将动作生成建模为一个从噪声分布到目标动作分布的连续变换过程,通过求解一个常微分方程(ODE)来生成动作。在推理时,VLA和RL策略分别输出速度场,组合引导后的速度场通过欧拉方法积分得到最终动作。这种方法的优势在于,即使两个策略的速度场差异较大,加权平均也能保证生成的动作在物理上是合理的。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 将离线RL与VLA潜变量结合形成组合引导,并首次揭示成功/失败状态下不同的缩放定律,提出自适应开关,整体思路新颖。并非完全从零开创,但巧妙整合了已有组件(流匹配、SAFE、缩放定律分析)并产生新洞察。
实验合理度:★★★★★ 实验设计非常扎实:两个标准基准(SIMPLER、PolaRiS)、真实机器人、5个不同任务、横纵向对比全面,消融实验覆盖了各组件。还做了缩放定律验证,结果清晰可信。唯一小缺憾是SAFE的阈值选择未给出充分解释,但整体无硬伤。
学术研究价值:★★★★☆ 揭示了测试时缩放定律在成功/失败状态下的不同表现,为后续自适应推理提供了理论基础。将RL与IL组合引导的思路可能影响更广泛的序列决策领域。但理论深度还有提升空间,例如能否给出更严格的误差界。
稳定性:★★★★☆ 组合引导通过加权平均速度场,比直接采样更稳定;SAFE失败检测器只在必要时刻介入,减少了误触。但SAFE本身依赖离线数据集的质量和标签准确性,若数据集噪声大,稳定性可能下降。总体而言,在论文实验条件下稳定性良好。
适应性以及泛化能力:★★★★☆ 在多个域外场景(新指令、新环境、新背景)上均有效,且真实世界场景也验证了泛化能力。但论文只测试了6DoF操作任务,对于更复杂的移动操作或视觉域漂移较大的场景,效果未知。扣一星是因为变化还不够极限(如光照突变、物体种类大变)。
硬件需求及成本:★★★★★ RL策略和SAFE都是轻量级MLP,推理时只增加不到15%的计算量。VLA模型本身可以用中等规模(如7B参数)的模型,但整体可以在单张RTX 4090上实时运行。不需要额外训练成本,因为离线RL策略可以直接使用现有数据集。成本控制非常出色。
复现难度:★★★★☆ 论文提供了项目页面和部分代码(https://rl2-vla.github.io),但完整代码尚未开源。由于需要VLA模型及离线RL训练,有一定的工程门槛,但核心模块(流匹配、SAFE)都有现成工具支持。扣一分主要因为开源不完整。
产品化成熟度:★★★☆☆ 具备一定的产品化潜力:架构即插即用、计算开销低、自适应机制合理。但目前的验证环境仍属于实验室级别(固定背景、有限物体、单机械臂),对于工厂流水线或家庭服务等需处理大量非结构干扰的场景,还需要更多鲁棒性测试和硬件适配。目前可看作是高价值的技术验证阶段。
可能的问题: SAFE失败检测器依赖离线数据集的标签,真实世界数据标签获取可能需要人工标注或事后检查,有一定成本。另外,组合引导的权重λ固定为0.5,能否根据状态动态调整可能进一步提升效果,论文未探索。最后,缩放定律分析假设了完美验证器,实际部署时验证器不可避免有误差,该误差如何传播可能影响性能,论文未展开讨论。此外,RL2目前仅在6DoF操作任务上进行了验证,对于更高维度的动作空间(如全身移动操作)或更复杂的任务(如多步骤组装)的适用性还有待进一步研究。
主要参考文献
[1] Brohan, A. et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. 2023.
[2] Li, X. et al. PolaRiS: A Benchmark for Polishing Robot Inverse Skills. 2025.
[3] Chen, L. et al. SIMPLER: Simulation to Real for Policy Learning. 2024.
[4] Salimans, T. et al. SAFE: Safe Action Failure Estimation for Robot Policies. 2025.
[5] Janner, M. et al. Flow Matching for Policy Generation in Robotics. 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想让你的机器人也学会"见机行事"?加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 机器人+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。目前在招机器人、强化学习、多模态方向基友,一起复现RL²搞事情!