← 返回 PaperDaily 视觉与图像

离散扩散VLA上RL终于跑通了?99.7%与30.6%提升

这篇论文专门盯上了离散扩散VLA的“RL卡脖子点”:最终动作的边缘概率算不出来,那就直接优化去噪轨迹本身。思路很硬,结果也很硬,LIBERO和RoboTwin 2.0都打出了能拿出来讲的成绩。

离散扩散VLA上RL终于跑通了?99.7%与30.6%提升
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文专门盯上了离散扩散VLA的“RL卡脖子点”:最终动作的边缘概率算不出来,那就直接优化去噪轨迹本身。思路很硬,结果也很硬,LIBERO和RoboTwin 2.0都打出了能拿出来讲的成绩。


原论文信息如下:
论文标题:
dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

发表日期:2026年06月

发表单位:上海交通大学、清华大学深圳国际研究生院、百度 AI 云、D-Robotics、上海人工智能实验室

原文链接:https://arxiv.org/pdf/2606.23623v1.pdf

强化学习遇阻:离散扩散VLA策略的“边缘似然困境”

先把话说直白一点:VLA,也就是 Vision-Language-Action,中文可以理解成“看图、听话、再动手”的机器人模型。它把视觉信息、语言指令和动作控制揉成一锅,目标不是答题,而是把夹子伸过去、把杯子拿起来、把零件装回去。听上去很酷,但真要上 RL(Reinforcement Learning,强化学习),麻烦就来了:模型最后真正执行的动作概率,算不出来。
问题出在这类离散扩散 VLA上。这里的离散扩散,不是像自回归那样一个 token 一个 token 从左到右往外吐,而是从一串 [MASK] 开始,经过多步去噪,逐渐把动作 token 补出来。这个过程很像“先打草稿,再反复涂改,最后交卷”。但政策梯度类强化学习,比如 PPO(Proximal Policy Optimization,近端策略优化),偏偏需要的是最终动作的精确概率。而离散扩散的最终动作不是一步生成的,是一条去噪轨迹绕出来的,边缘概率要把所有中间路径都加起来,路径一多,计算直接原地发疯。
Figure 1
图1:方法总览。左边展示了统一的去噪轨迹概率建模,右边给出 LIBERO 和 RoboTwin 2.0 上的整体效果,下面还顺手说明了混合去噪步数在效率上的优势。
本论文的核心意思其实很朴素:既然最终动作的边缘概率难算,那就别死磕它,直接把整条去噪路径当成优化对象。这样一来,强化学习不再对着“最后交卷的答案”抓耳挠腮,而是对“这份答案是怎么一步步写出来的”进行打分。这个转弯看似绕,实际上非常符合离散扩散模型的生成方式:动作不是凭空掉下来的,而是一步步从噪声里抠出来的。

巧解难题:轨迹级概率建模,将去噪路径变成可优化对象

这篇论文最关键的创新点,叫轨迹级概率建模。论文把离散扩散过程看成一个马尔可夫决策过程(MDP,Markov Decision Process,马尔可夫决策过程):每一步去噪都像一次小决策,整条路径则是一连串状态转移。这样,原本难以直接求解的边缘概率,就被改写成了每一步转移概率的连乘。说人话就是:别问“这道题最终答案的总概率是多少”,先把“每一笔是怎么写出来的”算清楚。
Figure 2
图2:dVLA-RL 的整体流程。上半部分是交互时的多步迭代去噪生成动作;下半部分是把去噪轨迹的联合概率拿来做 PPO 优化。
这里有个很妙的点。离散扩散每一步其实都包含两个动作:一个是选择哪些 token 继续更新,另一个是把这些 token 具体生成成什么。前者由调度器决定,后者由模型输出。论文发现,如果把“选哪些 token 更新”也硬塞进梯度里,训练会很不稳定,因为这个过程本身带有离散排序和采样,梯度像踩在香蕉皮上,容易滑倒。于是作者干脆把这部分当成系统动态处理,训练时只对真正从 [MASK] 变成具体 token 的部分计算损失。这个处理非常工程化:不跟离散选择死磕,专心让模型学会更准地补 token。
为了让这套东西能接上 PPO,论文把策略比率也改写成了轨迹级别。也就是说,更新时比较的是“当前策略生成这条去噪路径的概率”和“旧策略生成同一路径的概率”。这样 PPO 还是那个 PPO,但对象从“最终动作”变成了“生成最终动作的全过程”。这一步很关键,因为它把原来不可用的 RL 目标,变成了可直接跑起来的版本。
Figure 3
图3:轨迹级对数概率目标与“只看最后一步”的近似在 LIBERO 上的对比。蓝色曲线是原始结果,平滑曲线是 EMA,阴影表示波动范围。
从方法论上说,这里最值得点头的是:作者没有把离散扩散硬拧成自回归,也没有把 RL 变成“看最后一帧猜过程”的玄学游戏,而是尊重离散扩散自己的生成逻辑。模型怎么生成,优化就怎么对齐。这个思路不花哨,但很硬。

性能暴涨:LIBERO上达到99.7%成功率,RoboTwin提升30.6%

实验结果这块,论文给出的信号很明确:轨迹级 RL 确实能把离散扩散 VLA 往上拽一大截。在 LIBERO 上,dVLA-RL 的平均成功率达到 99.7%,四个子任务都超过 99%。这已经不是“略有提升”,而是把任务做成了近乎满分答卷。对于机器人操作这种容易被细节绊倒的任务来说,能把成功率推到这个水平,说明方法不是只会纸上谈兵。
Table 1
表1:LIBERO 仿真基准上的主要结果。可以看到,dVLA-RL 在四个子套件上都保持了非常高的成功率,平均值达到 99.7%。
更有意思的是 RoboTwin 2.0。这个基准更难,还是双臂操作,场景变化也更复杂。论文里把 dVLA-RL 和 SFT 基线 MM-ACT* 做了对比,平均成功率从 61.4% 提到 92.0%,绝对提升 30.6 个百分点。这个数字很扎实,不是“涨了两个点,宣传稿写成起飞”,而是真有一大截改善。
Table 2
表2:RoboTwin 2.0 八个任务上的逐任务结果。dVLA-RL 在大多数任务上都明显优于 SFT 基线,尤其在双臂协作和长时序控制任务上更明显。
这也解释了为什么论文要把 LIBERO 和 RoboTwin 2.0 放在一起看:前者更像“单臂精细操作的标准考场”,后者更像“多任务双臂实战现场”。如果一个方法只在简单环境里好看,那意义有限;而 dVLA-RL 在两类任务上都能打,说明轨迹级建模不是只对某个小场景有效。

一步到四步:混合去噪步数策略如何兼顾性能与效率

如果只看性能,很多人会下意识觉得:去噪步数越多越好,毕竟多磨几遍总能更稳。但机器人不是写作文,去噪步数一多,训练和推理成本也会跟着往上蹿。论文在这里做了一个很实用的折中:不同任务用不同去噪步数。简单任务可以少步数,复杂任务可以多步数,统一在同一个 RL 框架里训练。
Figure 4
图4:不同去噪步数对 RoboTwin 2.0 上 RL 优化行为的影响。1 步、2 步、4 步和混合策略的曲线对比很直观:多步和混合策略通常更稳。
这个“混合步数”设计有点像给不同难度的题配不同的草稿纸。简单题两张纸就够了,复杂题就得多写几轮。论文在 RoboTwin 上给出的结果表明,混合策略不仅能保持较高成功率,还能减少不必要的环境交互和推理开销。也就是说,它不是单纯追求“更大更慢”,而是尽量让模型在性能、样本效率、推理成本之间找到平衡点。
Table 3
表3:不同去噪步数设置的效率对比。训练时间、推理延迟和推理 FLOPs 都被纳入考量,说明混合策略不是“只会刷分”,还考虑了部署成本。
从工程角度看,这一块很重要。很多方法在 benchmark 上分数漂亮,但一到实际系统里就开始“CPU 先哭”。而 dVLA-RL 的混合步数策略至少说明作者没有把效率当空气,反而把它作为设计的一部分去优化,这对机器人落地是加分项。

实验深度剖析:轨迹级建模为何优于最后一步近似?

论文后面的分析部分,最有说服力的其实不是“分数高”,而是“为什么高”。作者专门比较了轨迹级对数概率只看最后一步的近似。结果很清楚:后者虽然看起来省事,但它忽略了中间去噪状态对最终动作的真实贡献,等于只盯着交卷那一秒,不看整道题是怎么写的。对离散扩散这种多步生成过程来说,这种近似本身就不太对味。
Figure 3
图3 再看一眼就很有意思:轨迹级目标下,训练曲线通常更稳,成功率上升也更连贯;最后一步近似则更容易出现波动。
原因并不复杂。第一,轨迹级目标和实际 rollout 完全一致,训练时优化的是“模型真正在执行的那条路径”,不是某个脱离过程的局部代理量。第二,去掉 token 选择项上的梯度后,优化目标更干净,减少了离散调度带来的高方差噪声。第三,混合步数让不同任务在不同复杂度上找到合适的去噪长度,既保留了多步细化的优势,又避免了所有任务都用同一种步数的“一刀切”。
Figure 6
图6:RoboTwin 上 Beat Block Hammer、Place Phone Stand、Place Empty Cup 和 Lift Pot 的训练曲线。1 步、2 步与 Hybrid 的差异很直观,混合策略整体更稳。
Figure 7
图7:RoboTwin 上 Move Can Pot、Place A2B Left、Handover Mic 和 Pick Dual Bottles 的训练曲线。可以看到,Hybrid 在多个任务上都维持了更好的优化趋势。
再往细里说,这篇论文其实把离散扩散 VLA 的一个老问题掰开揉碎了:如果生成过程本身就是多步的,那 RL 的优化对象就不该假装成一步。这个结论不玄学,反而很朴素,但正因为朴素,才显得有效。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是离散扩散 VLA 做强化学习时“最终动作概率算不出来”的问题。论文没有硬算边缘似然,而是改成优化去噪轨迹的联合概率,这样 PPO 就能直接跑起来。

文中的 MDP 和 PPO 分别是什么意思?MDP 是马尔可夫决策过程,简单说就是“状态—动作—奖励”的循环;PPO 是近端策略优化,是一种常见的强化学习算法,擅长在不把策略更新搞崩的前提下慢慢提分。

为什么混合去噪步数会有用?因为不同任务难度不一样。简单任务不需要很多步反复修正,复杂任务则需要更长的去噪链条来细化动作。混合策略相当于“按题目难度发草稿纸”,更省算力,也更容易保持高成功率。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆
把强化学习直接做在离散扩散的去噪轨迹上,这个切口挺准,属于“不是把旧工具硬套新问题,而是顺着新问题的脾气改工具”。

实验合理度:★★★★☆
LIBERO 和 RoboTwin 2.0 都做了,既有单臂也有双臂;再加上和 SFT 基线、VLA 基线、WAM 基线的对比,整体比较有说服力。

学术研究价值:★★★★☆
它补上了“离散扩散 VLA 怎么做 RL”这块空白,对后续研究很有启发,尤其适合继续探索更复杂的生成策略和信用分配方式。

稳定性:★★★☆☆
去掉了部分高方差梯度后,训练更稳,但本质上还是在线强化学习,样本和环境交互成本并不低,离“随便一台机器就能稳跑”还有距离。

适应性以及泛化能力:★★★★☆
在两个风格差异很大的基准上都能起作用,说明方法不太挑场景;但对超长时序、超复杂真实机器人环境,仍需要进一步验证。

硬件需求及成本:★★★☆☆
训练要在线 RL,成本不算低;不过混合去噪步数至少在推理侧给了一个更务实的平衡方案,不是纯堆算力。

复现难度:★★★☆☆
方法逻辑清楚,但依赖仿真环境、RL 训练框架和较完整的工程链路,复现门槛不算低。

产品化成熟度:★★★☆☆
在仿真里表现很强,但真实机器人落地还要面对传感噪声、执行偏差和安全约束,属于“很有希望”,还不是“开箱即用”。

可能的问题:思路漂亮,但仍依赖在线 RL 和仿真奖励,真实场景的稳定性、样本效率和安全性还需要进一步证明。


主要参考文献

Yuhao Wu, Yitian Liu, Weijie Shen, et al. dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models. arXiv:2606.23623, 2026.
Schulman et al. Proximal Policy Optimization Algorithms. 2017.
Liu et al. LIBERO benchmark. 2023.
Chen et al. RoboTwin 2.0 benchmark. 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
机器人强化学习这条赛道,最近越来越像“卷王考试现场”。想一起追前沿、看懂方法、少踩坑,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,方便更快通过并拉进对应群聊 🤖
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。