← 返回 PaperDaily
视觉与图像
DynaWM登场:清华把VLA“反应式抓取”改成“预判式拦截”
机器人抓静态物体,大家早就不稀奇了;真正麻烦的是,目标自己在动,策略还在按“刚才的位置”出手。清华这篇 DynaWM 的思路很直接:不去硬改底座 VLA,而是把它吐出的动作块当条件,再结合多视角历史重画轨迹,专治“追着空气跑”。
龙哥读论文
发布于 2026-08-14 09:11:23
阅读 3
查看原文
原论文信息如下:
动“手”抓不住,只因对象太“皮”?
静态抓取已经卷到没意思了,真正难的是:目标自己还在跑,机器人却还在按“刚才看到的位置”出手。这个问题听起来像手慢半拍,实际上更像感知、决策、执行之间天然有延迟 ,等机械臂抬起手时,球早就溜了。
DynaWM 的切入点很有意思:不去推倒重练底座 VLA ,也不强行把世界模型塞进每个模型内部,而是把底座 VLA 已经吐出来的动作块当成条件,再结合多视角历史和机械臂状态,重新生成一段更“懂运动”的动作轨迹。说白了,就是让机器人别再追着空气跑,而是学会提前拦截。
这类工作最怕“看起来很聪明,落地一塌糊涂”。DynaWM 的优点是接口很克制:底座 VLA 冻结不动,新增模块只负责读动作、读历史、再生成动作,工程上比“把底座重新训一遍”现实得多。
把“计划”当条件,让机器人学会“预判”运动
先把问题讲人话:底座 VLA 看到的是“现在”,但动态抓取需要的是“下一秒会在哪里”。如果只盯着当前帧,策略就像在打地鼠,永远慢半拍。DynaWM 的关键判断是:底座动作块本身就包含了任务语义 ,比如朝哪边靠近、什么时候闭合夹爪、接下来是抓还是搬;而多视角历史则提供了“目标在怎么动”的证据。两者合起来,才有机会从“反应式追踪”变成“预判式拦截”。
这里有两个基础概念要先说清楚。VLA 是 vision-language-action 的缩写,中文可理解为“视觉-语言-动作模型”,它把看图、读指令和控制机器人连在一起。world foundation model 可以直译为“世界基础模型”,更通俗一点就是:它不直接出最终动作,而是先理解世界怎么变,再拿这个理解去辅助决策。DynaWM 的“world”不是玄学,核心就是补上时间维度,让模型别只看一张照片就下结论。
论文里还专门解释了一个容易误解的点:这里的 base VLA 指的是已经适配到基准任务、并在 DynaWM 训练和评估期间保持冻结的底座模型;base action chunk 则是这个底座一次输出的一段短动作序列。也就是说,DynaWM 不是去偷底座内部特征,而是直接利用它“说出来”的动作计划。这个设计很朴素,但也很聪明,因为不同 VLA 的内部表示空间可能完全不一样,动作序列却都要落在真实机器人控制接口上,物理意义更统一。
不是简单修图,而是“重画”轨迹
DynaWM 的核心设计可以拆成三块:动作编码、视觉编码、轨迹重生成。先看动作编码。底座输出的动作块不是直接执行,而是先经过一个 Mamba-3 动作编码器。Mamba-3 是一种状态空间模型,擅长处理长序列并保持计算效率,这里用来吃动作序列很合适,因为动作本身就是有顺序、有惯性的控制信号。论文里把 Mamba-3 解释为一种高效的序列编码器,作用不是“发明动作”,而是把底座吐出的动作块压成一个更稳定的条件表示。
视觉这边用的是 V-JEPA 2.1 ,英文全称是 Video Joint-Embedding Predictive Architecture 2.1 ,中文可以理解为“视频联合嵌入预测架构 2.1”。它的价值在于不需要真的把未来视频一帧帧生成出来,而是直接提取多视角历史中的时空特征。通俗点说,它不是去画未来,而是从过去的连续变化里读出“目标正在往哪边跑、速度有没有变、有没有碰撞反弹”。多视角同时输入还能缓解遮挡问题,这对机械臂视角经常被自己胳膊挡住的场景尤其重要。
第三块是轨迹重生成。这里用的是 DiT ,也就是 Diffusion Transformer,中文可理解为“扩散式 transformer”。它不是简单做残差修补,而是从高斯噪声出发,在条件约束下重新生成一段动作轨迹。论文把这个过程叫做 trajectory regeneration ,中文就是“轨迹重生成”。这个词很关键,因为它和“在原动作上微调一点点”不是一回事。对于动态目标,原动作往往已经朝旧位置去了,局部修修补补很容易越补越歪;直接重画一条更符合当前运动趋势的轨迹,反而更稳。
这里还有一个实现细节很值得记住:DynaWM 的动作条件不是拿来当初始点,而是作为持续存在的条件信号 。论文后面的消融实验专门验证了这一点:如果把 base action chunk 直接当作 flow 的起点,效果会明显掉;只有把它编码成条件,模型才更像在“参考计划”而不是“照抄起跑线”。这差别不花哨,但非常工程化——很多方法失败,不是不会生成,而是生成方式把自己带沟里了。
四大VLA底座,成功率最高猛涨45%
实验部分最重要的不是“有没有涨”,而是“涨得是否合理”。DynaWM 先做了一个很扎实的 benchmark:DynaGrasp-32 。这个基准覆盖 32 个任务,分成六类动态难点:基础拦截、物体属性迁移、碰撞反弹、环境变化、多物体排序,以及速度变化。它不是单纯考机器人抓球,而是把动态操控里最常见的“坑”拆开来测,方便判断到底是哪里出了问题。
再看数据集 DynaGrasp-1600 。它包含 32 个场景、1600 条示范轨迹、约 153 万张图像,三视角采集,全部来自仿真中的人工遥操作。这个规模不算离谱,但足够支撑系统评估,尤其适合做“底座 VLA + 动态世界模型”的统一诊断。论文还把每个任务都设置成闭环评估,单项 50 次 episode,避免只看开环轨迹漂亮、闭环一上手就翻车的尴尬。
为什么会这样?因为动态目标最怕“看到了但来不及”。底座越弱、越粗糙,越容易在速度变化、碰撞反弹、多目标顺序这些地方犯错;DynaWM 通过历史视觉和动作条件,把“现在的动作计划”往“未来的相遇点”拉。于是 coarse-tuned 底座的提升往往比 fine-tuned 更大,这个结果很符合直觉:底座越不稳,补上动态推断后越容易见效。
论文还做了两组很关键的消融。第一组是视觉动态证据:只用 V-JEPA 特征、不用 base action chunk 作为条件时,性能明显不如完整模型。第二组是动作条件形式:如果把动作块直接当作流起点,而不是作为持续条件,成功率会大幅掉下去。这个结论很重要,说明 DynaWM 的价值不只是“看见了更多历史”,而是把动作计划和视觉运动证据真正绑在了一起 。少了任何一环,都容易退化成普通的动作修补器。
总结与展望
DynaWM 最值得肯定的地方,不是某个炫技模块,而是它把一个很现实的问题讲透了:动态操控的关键,不是更会看,而是更会预判 。底座 VLA 负责给出任务级动作语义,DynaWM 负责把这份“计划”放到时间里重新校正。这个思路对于已经训练好的大模型尤其友好,因为它避免了对底座架构和内部表示的强依赖,工程上更容易接入。
不过,边界也很明显。第一,当前结果主要来自仿真闭环评估,真实机器人上还要面对传感器噪声、延迟漂移、反光遮挡和接触不确定性,没那么好说话。第二,多物体顺序任务上,DynaWM 还不能保证所有情况下都不扰乱原有绑定关系,说明“拦截”与“策略组织”仍是两件事。第三,这种方法对历史视觉质量比较敏感,视角缺失或跟踪不稳时,世界模型能提供的信息也会打折。
如果未来要继续往前走,比较自然的方向有两个:一是把这种“动作条件化世界模型”迁移到更多机器人底座上,看看是否真的具备跨架构通用性;二是把动态任务从抓取扩展到更复杂的接触操作,比如推、拨、递送、避障穿行等。只要目标会动,延迟就永远是机器人绕不开的老对手。DynaWM 这类工作至少证明了一件事:别光盯着“现在”,给机器人一点“提前量”,它才不会总是慢半拍。
龙迷三问
这篇论文到底解决什么问题? 它解决的是“动态目标抓取时,底座 VLA 只能看到当前位置、却来不及预测未来运动”这个老毛病。DynaWM 的做法不是重训底座,而是用底座动作块 + 多视角历史 + 机械臂状态,重新生成更适合拦截运动目标的动作轨迹。
base action chunk 是什么意思? 它就是底座 VLA 一次输出的一段短动作序列,可以理解成“底座已经想好的初步计划”。DynaWM 不直接执行这段计划,而是把它编码成条件信号,告诉生成器:底座原本想这么做,但现在世界已经动了,得重新算一遍。
V-JEPA 2.1 在这里起什么作用? 它负责从多视角历史里抽取视觉运动证据,帮助模型判断目标的方向、速度和碰撞后的轨迹变化。它不是生成未来视频,而是提供“世界正在怎么变”的表征,这正是动态拦截最需要的信息。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把底座动作块当条件、再用世界模型重画轨迹,这个思路不算完全颠覆,但组合得很实用,尤其适合冻结底座后做动态补强。
实验合理度: ★★★★☆
benchmark 设计比较完整,四类底座、两种 checkpoint、六类动态家族都覆盖到了,消融也能对上方法主张,实验链条是闭合的。
学术研究价值: ★★★★☆
它把“动态操控”从静态抓取里单独拎出来,给 VLA 和世界模型的结合提供了一个更明确的研究接口,后续可继续扩展。
稳定性: ★★★☆☆
仿真里表现不错,但真实场景还要面对延迟、噪声和遮挡;另外多物体顺序任务说明它并不是万能修补器。
适应性以及泛化能力: ★★★★☆
对不同底座 VLA 都能涨分,说明接口适应性不错;但泛化主要还停留在动态抓取这一类任务上。
硬件需求及成本: ★★★☆☆
训练和推理都比直接跑底座更重,但仍属于可控范围;真正的成本大头还是高质量多视角数据和仿真闭环评估。
复现难度: ★★★☆☆
方法本身结构清楚,但依赖仿真环境、底座 VLA、数据缓存和多模块对齐,复现门槛不低,不是随便敲几行代码就能跑通。
产品化成熟度: ★★★☆☆
适合做动态操控的研究型增强模块,离稳定产品还有距离;如果要上真机,还得补鲁棒性和时延控制。
可能的问题: 亮点在于“动作条件化世界模型”,但真实环境验证和更复杂长时序任务还不够,当前更像一篇很扎实的动态操控方法论文,而不是已经能端上桌的机器人系统。
主要参考文献
[1] DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation. arXiv:2607.02604v1, 2026.
[2] 论文原文链接:https://arxiv.org/pdf/2607.02604v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!