← 返回 PaperDaily
视觉与图像
离散扩散VLA上RL终于跑通了?99.7%与30.6%提升
这篇论文专门盯上了离散扩散VLA的“RL卡脖子点”:最终动作的边缘概率算不出来,那就直接优化去噪轨迹本身。思路很硬,结果也很硬,LIBERO和RoboTwin 2.0都打出了能拿出来讲的成绩。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
这篇论文专门盯上了离散扩散VLA的“RL卡脖子点”:最终动作的边缘概率算不出来,那就直接优化去噪轨迹本身。思路很硬,结果也很硬,LIBERO和RoboTwin 2.0都打出了能拿出来讲的成绩。
原论文信息如下:
强化学习遇阻:离散扩散VLA策略的“边缘似然困境”
先把话说直白一点:VLA,也就是 Vision-Language-Action,中文可以理解成“看图、听话、再动手”的机器人模型。它把视觉信息、语言指令和动作控制揉成一锅,目标不是答题,而是把夹子伸过去、把杯子拿起来、把零件装回去。听上去很酷,但真要上 RL(Reinforcement Learning,强化学习),麻烦就来了:模型最后真正执行的动作概率,算不出来。
问题出在这类离散扩散 VLA上。这里的离散扩散,不是像自回归那样一个 token 一个 token 从左到右往外吐,而是从一串 [MASK] 开始,经过多步去噪,逐渐把动作 token 补出来。这个过程很像“先打草稿,再反复涂改,最后交卷”。但政策梯度类强化学习,比如 PPO(Proximal Policy Optimization,近端策略优化),偏偏需要的是最终动作的精确概率。而离散扩散的最终动作不是一步生成的,是一条去噪轨迹绕出来的,边缘概率要把所有中间路径都加起来,路径一多,计算直接原地发疯。
本论文的核心意思其实很朴素:既然最终动作的边缘概率难算,那就别死磕它,直接把整条去噪路径当成优化对象。这样一来,强化学习不再对着“最后交卷的答案”抓耳挠腮,而是对“这份答案是怎么一步步写出来的”进行打分。这个转弯看似绕,实际上非常符合离散扩散模型的生成方式:动作不是凭空掉下来的,而是一步步从噪声里抠出来的。
巧解难题:轨迹级概率建模,将去噪路径变成可优化对象
这篇论文最关键的创新点,叫轨迹级概率建模。论文把离散扩散过程看成一个马尔可夫决策过程(MDP,Markov Decision Process,马尔可夫决策过程):每一步去噪都像一次小决策,整条路径则是一连串状态转移。这样,原本难以直接求解的边缘概率,就被改写成了每一步转移概率的连乘。说人话就是:别问“这道题最终答案的总概率是多少”,先把“每一笔是怎么写出来的”算清楚。
这里有个很妙的点。离散扩散每一步其实都包含两个动作:一个是选择哪些 token 继续更新,另一个是把这些 token 具体生成成什么。前者由调度器决定,后者由模型输出。论文发现,如果把“选哪些 token 更新”也硬塞进梯度里,训练会很不稳定,因为这个过程本身带有离散排序和采样,梯度像踩在香蕉皮上,容易滑倒。于是作者干脆把这部分当成系统动态处理,训练时只对真正从 [MASK] 变成具体 token 的部分计算损失。这个处理非常工程化:不跟离散选择死磕,专心让模型学会更准地补 token。
为了让这套东西能接上 PPO,论文把策略比率也改写成了轨迹级别。也就是说,更新时比较的是“当前策略生成这条去噪路径的概率”和“旧策略生成同一路径的概率”。这样 PPO 还是那个 PPO,但对象从“最终动作”变成了“生成最终动作的全过程”。这一步很关键,因为它把原来不可用的 RL 目标,变成了可直接跑起来的版本。
从方法论上说,这里最值得点头的是:作者没有把离散扩散硬拧成自回归,也没有把 RL 变成“看最后一帧猜过程”的玄学游戏,而是尊重离散扩散自己的生成逻辑。模型怎么生成,优化就怎么对齐。这个思路不花哨,但很硬。
性能暴涨:LIBERO上达到99.7%成功率,RoboTwin提升30.6%
实验结果这块,论文给出的信号很明确:轨迹级 RL 确实能把离散扩散 VLA 往上拽一大截。在 LIBERO 上,dVLA-RL 的平均成功率达到 99.7%,四个子任务都超过 99%。这已经不是“略有提升”,而是把任务做成了近乎满分答卷。对于机器人操作这种容易被细节绊倒的任务来说,能把成功率推到这个水平,说明方法不是只会纸上谈兵。
更有意思的是 RoboTwin 2.0。这个基准更难,还是双臂操作,场景变化也更复杂。论文里把 dVLA-RL 和 SFT 基线 MM-ACT* 做了对比,平均成功率从 61.4% 提到 92.0%,绝对提升 30.6 个百分点。这个数字很扎实,不是“涨了两个点,宣传稿写成起飞”,而是真有一大截改善。
这也解释了为什么论文要把 LIBERO 和 RoboTwin 2.0 放在一起看:前者更像“单臂精细操作的标准考场”,后者更像“多任务双臂实战现场”。如果一个方法只在简单环境里好看,那意义有限;而 dVLA-RL 在两类任务上都能打,说明轨迹级建模不是只对某个小场景有效。
一步到四步:混合去噪步数策略如何兼顾性能与效率
如果只看性能,很多人会下意识觉得:去噪步数越多越好,毕竟多磨几遍总能更稳。但机器人不是写作文,去噪步数一多,训练和推理成本也会跟着往上蹿。论文在这里做了一个很实用的折中:不同任务用不同去噪步数。简单任务可以少步数,复杂任务可以多步数,统一在同一个 RL 框架里训练。
这个“混合步数”设计有点像给不同难度的题配不同的草稿纸。简单题两张纸就够了,复杂题就得多写几轮。论文在 RoboTwin 上给出的结果表明,混合策略不仅能保持较高成功率,还能减少不必要的环境交互和推理开销。也就是说,它不是单纯追求“更大更慢”,而是尽量让模型在性能、样本效率、推理成本之间找到平衡点。
从工程角度看,这一块很重要。很多方法在 benchmark 上分数漂亮,但一到实际系统里就开始“CPU 先哭”。而 dVLA-RL 的混合步数策略至少说明作者没有把效率当空气,反而把它作为设计的一部分去优化,这对机器人落地是加分项。
实验深度剖析:轨迹级建模为何优于最后一步近似?
论文后面的分析部分,最有说服力的其实不是“分数高”,而是“为什么高”。作者专门比较了轨迹级对数概率和只看最后一步的近似。结果很清楚:后者虽然看起来省事,但它忽略了中间去噪状态对最终动作的真实贡献,等于只盯着交卷那一秒,不看整道题是怎么写的。对离散扩散这种多步生成过程来说,这种近似本身就不太对味。
原因并不复杂。第一,轨迹级目标和实际 rollout 完全一致,训练时优化的是“模型真正在执行的那条路径”,不是某个脱离过程的局部代理量。第二,去掉 token 选择项上的梯度后,优化目标更干净,减少了离散调度带来的高方差噪声。第三,混合步数让不同任务在不同复杂度上找到合适的去噪长度,既保留了多步细化的优势,又避免了所有任务都用同一种步数的“一刀切”。
再往细里说,这篇论文其实把离散扩散 VLA 的一个老问题掰开揉碎了:如果生成过程本身就是多步的,那 RL 的优化对象就不该假装成一步。这个结论不玄学,反而很朴素,但正因为朴素,才显得有效。
龙迷三问
这篇论文到底解决了什么问题?它解决的是离散扩散 VLA 做强化学习时“最终动作概率算不出来”的问题。论文没有硬算边缘似然,而是改成优化去噪轨迹的联合概率,这样 PPO 就能直接跑起来。
文中的 MDP 和 PPO 分别是什么意思?MDP 是马尔可夫决策过程,简单说就是“状态—动作—奖励”的循环;PPO 是近端策略优化,是一种常见的强化学习算法,擅长在不把策略更新搞崩的前提下慢慢提分。
为什么混合去噪步数会有用?因为不同任务难度不一样。简单任务不需要很多步反复修正,复杂任务则需要更长的去噪链条来细化动作。混合策略相当于“按题目难度发草稿纸”,更省算力,也更容易保持高成功率。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
把强化学习直接做在离散扩散的去噪轨迹上,这个切口挺准,属于“不是把旧工具硬套新问题,而是顺着新问题的脾气改工具”。
实验合理度:★★★★☆
LIBERO 和 RoboTwin 2.0 都做了,既有单臂也有双臂;再加上和 SFT 基线、VLA 基线、WAM 基线的对比,整体比较有说服力。
学术研究价值:★★★★☆
它补上了“离散扩散 VLA 怎么做 RL”这块空白,对后续研究很有启发,尤其适合继续探索更复杂的生成策略和信用分配方式。
稳定性:★★★☆☆
去掉了部分高方差梯度后,训练更稳,但本质上还是在线强化学习,样本和环境交互成本并不低,离“随便一台机器就能稳跑”还有距离。
适应性以及泛化能力:★★★★☆
在两个风格差异很大的基准上都能起作用,说明方法不太挑场景;但对超长时序、超复杂真实机器人环境,仍需要进一步验证。
硬件需求及成本:★★★☆☆
训练要在线 RL,成本不算低;不过混合去噪步数至少在推理侧给了一个更务实的平衡方案,不是纯堆算力。
复现难度:★★★☆☆
方法逻辑清楚,但依赖仿真环境、RL 训练框架和较完整的工程链路,复现门槛不算低。
产品化成熟度:★★★☆☆
在仿真里表现很强,但真实机器人落地还要面对传感噪声、执行偏差和安全约束,属于“很有希望”,还不是“开箱即用”。
可能的问题:思路漂亮,但仍依赖在线 RL 和仿真奖励,真实场景的稳定性、样本效率和安全性还需要进一步证明。
主要参考文献
Yuhao Wu, Yitian Liu, Weijie Shen, et al. dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models. arXiv:2606.23623, 2026.
Schulman et al. Proximal Policy Optimization Algorithms. 2017.
Liu et al. LIBERO benchmark. 2023.
Chen et al. RoboTwin 2.0 benchmark. 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!