← 返回 PaperDaily 视觉与图像

MIT哈佛新作:DriftWorld单步世界模型快17倍

机器人规划最怕什么?不是动作难,而是“想一帧未来”都要慢吞吞算半天。DriftWorld直接把扩散式多步采样改成单步漂移生成,推理速度平均快17倍,还能拿去做规划和离线评估,够硬。

MIT哈佛新作:DriftWorld单步世界模型快17倍
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
机器人规划最怕什么?不是动作难,而是“想一帧未来”都要慢吞吞算半天。DriftWorld直接把扩散式多步采样改成单步漂移生成,推理速度平均快17倍,还能拿去做规划和离线评估,够硬。


原论文信息如下:
论文标题:
DriftWorld: Fast World Modeling through Drifting
发表日期:
2026年07月
发表单位:
Massachusetts Institute of Technology; Harvard University
原文链接:
https://arxiv.org/pdf/2607.15065v1.pdf
开源代码链接:
https://github.com/Susie-Lu/driftworld

机器人规划太慢?单步生成世界模型DriftWorld带来17倍加速

机器人世界模型这几年很热,但大多数方案有个老毛病:想得挺美,算得太慢。规划时要反复生成很多条未来轨迹,扩散模型一层层去噪,结果就是“脑内演练”还没结束,真实机器人已经在原地等得不耐烦了。
插图
图1:DriftWorld 总览。它把动作条件世界模型做成了“单步漂移生成”,一次前向传播就能生成未来帧,速度达到 30+ fps,在五个基准环境上都明显快于现有模型。更关键的是,这种快不是纯粹为了好看,而是直接服务于规划和离线策略评估。
这篇论文的思路很直接:既然机器人规划最怕“想一帧都慢”,那就别再让模型靠多步采样磨洋工了。DriftWorld 选择了一个更狠的路线——训练时学漂移,推理时一步到位。这个改法看起来朴素,实则把扩散式世界模型最痛的推理瓶颈,直接掀了桌子。

DriftWorld如何运作:训练时“漂移”学习,推理时一步到位

先把问题说人话:世界模型本质上是在“脑补未来”。给定当前观测和一串候选动作,模型要预测执行这些动作后,环境会变成什么样。对机器人来说,这件事很有价值,因为它能用“想象”替代一部分真实试错,既省时间也省硬件磨损。
但传统扩散式世界模型有个硬伤:每生成一帧都要多步去噪,做规划时还得对很多动作候选反复 rollout,推理成本直接爆炸。DriftWorld 的核心想法,就是把“生成未来”的过程改写成一种漂移(drifting):模型不在推理时慢慢改图,而是在训练时学会把噪声分布往真实数据分布上“推过去”。
插图
图2:漂移架构与训练概览。左边是带动作条件的 U-Net,输入历史观测和机器人动作,输出未来帧;右边是漂移损失,它本质上是一种对比式约束,让生成的未来帧朝真实未来帧靠近,同时远离模型自己生成的“负样本”。
这里的漂移不是玄学。论文引用的 drifting generative models,来自一类通过“吸引真实样本、排斥生成样本”来逐步修正生成分布的方法。原论文里,漂移场会把当前样本往目标分布推;到了 DriftWorld 这里,目标不是一张图,而是一段未来视频。换句话说,模型学的不是“怎么把图修干净”,而是“怎么把未来这条时间线走对”。
为了让漂移真正适合机器人,论文做了三处关键改造。第一处是动作强化的漂移场:正样本是“执行动作后的真实未来”,负样本不仅包括模型生成的结果,还混入了“没动”的真实帧,防止模型偷懒学成复制上一帧。这个设计很像在训练时不停提醒模型:别装死,动作真的会改变世界。
第二处是特征空间漂移。在简单任务里直接在像素空间算损失就够了,但真实机器人场景背景复杂、分辨率高、细节多,像素级距离常常很蠢:背景差一点点,损失就乱跳;机械臂该动的地方没动,模型却可能因为背景像素少变而自我感觉良好。于是论文引入 DINOv2/DINOv3 作为特征编码器,先把图像投到语义更稳定的特征空间,再在特征上做漂移约束。这里的 DINOv2/DINOv3,分别是 Self-Distillation with No Labels 的第二、第三代视觉表征模型,中文可理解为“无标签自蒸馏视觉特征提取器”。
第三处是按帧注入动作条件的 U-Net。很多视频生成模型把动作条件喂进去以后,容易出现“动作和帧对不上号”的问题:动作说右移,模型却在中间帧才慢半拍反应。DriftWorld 用 FiLM(Feature-wise Linear Modulation,特征逐通道线性调制)把每个未来动作和对应帧一一绑定,再配合时空分解卷积,让模型知道“这一帧到底该听哪个动作的指挥”。
插图
图3:DriftWorld 的配置说明。论文把不同环境的预测步长、特征空间、训练细节都做了针对性设置,不是“一套参数打天下”,而是按任务复杂度做适配。
训练过程也不复杂,但很讲究。先从噪声开始生成一段未来视频,再把这段生成结果和真实未来帧一起送进漂移场,算出该往哪里“漂”。随后模型学习让自己的输出更接近漂移后的目标。论文里给出的训练步骤,本质上就是“生成—比较—修正—再生成”的固定点迭代。推理时则完全不需要迭代,直接一次前向传播输出未来帧。训练时多费点劲,推理时少掉一大截成本,这笔账非常适合机器人。
如果把它翻译成更生活化的话,就是:以前的扩散模型像“每次都要把照片反复擦干净再看一眼”,DriftWorld 更像“先把脑子训练到位,看到输入就直接给结论”。前者稳,但慢;后者追求的是规划场景下的实时性,这正是机器人世界模型最缺的东西。

实验验证:又快又好,还能精准评估策略

插图
图4:Push-T 上的定量结果与可视化对比。上面这张图把“快”和“准”放在一起看,DriftWorld 在视觉质量上不仅没有明显掉队,速度还比扩散式基线快得多。右侧的 rollout 可视化也说明,它不是只会生成“看起来差不多”的视频,而是能把目标块的位置一路跟对。
先看最硬的指标:在 Push-T 上,DriftWorld 的单帧生成时间只有 0.0037 秒 左右,而扩散式 GPC World Model、Ctrl-World 的时间分别高得多。论文给出的平均速度提升达到 17 倍,有些场景甚至更夸张。对机器人规划来说,这不是“快一点点”,而是能不能做大规模候选动作搜索的分水岭。
再看画质。Push-T 上,DriftWorld 在 SSIM、PSNR、LPIPS 等指标上都很强。这里顺手解释一下:SSIM 是结构相似度,越高越像;PSNR 是峰值信噪比,越高越好;LPIPS 是感知相似度距离,越低越好。说白了,就是既要像素别跑偏,也要人眼看着别崩。
更有意思的是,DriftWorld 还拿一个 MSE Baseline 做了直接对比。这个基线和 DriftWorld 共享 U-Net 骨干,但训练目标换成普通均方误差。结果很说明问题:同样的骨架,不同的训练目标,最后效果差一截。也就是说,DriftWorld 的优势不是“模型更大更贵”,而是漂移损失真的在帮它学会一步生成
插图
图5:Robomimic 任务上的定量结果。左边是单视角生成,右边是双视角生成。DriftWorld 在 Lift 和 Can 任务上保持了较好的视觉质量,同时推理时间依旧很低。
在 Robomimic 上,DriftWorld 的表现也比较稳。无论是单视角还是双视角设置,它都能在视觉质量上维持竞争力,同时把推理时间压到一个很低的水平。这里最值得注意的点,不是某个指标极限刷爆,而是它在不同任务上都没有明显“翻车”。对世界模型来说,这种跨任务稳定性比单次高分更重要,因为真实机器人场景从来不是只打一张试卷。
插图
图6:Bridge-V2、RT-1 和 Language Table 上的结果。DriftWorld 在多数视觉指标上优于基线,同时每帧生成时间更低,说明它并不是只在某个模拟环境里“会演戏”。
Bridge-V2、RT-1 和 Language Table 这些真实世界数据集更能说明问题。DriftWorld 不只是在合成环境里看着顺眼,在真实机器人数据上也能把接触动作、抓取动作、抽屉开合这些细粒度变化模拟出来。尤其是 RT-1 这类场景,模型如果动作跟不紧,画面就会出现“手是手、物是物,但就是不在一个世界里”的尴尬。DriftWorld 在这类任务上明显更像“听得懂动作”的模型。
插图
图7:Bridge-V2 的 rollout 对比。DriftWorld 对黄瓜、盘子、蘑菇和方块等接触交互的模拟更准确,说明它不只是“会画”,还比较懂物理变化。
插图
图8:RT-1 的 rollout 对比。DriftWorld 生成的视频能更准确地表现抓起物体、打开抽屉等动作,动作—帧对齐做得更扎实。
论文最实用的部分,其实不是单纯画面好看,而是它能直接拿来做推理时策略改进。做法也很典型:让基础策略提出一堆候选动作,把这些动作都丢进世界模型里 rollout,再用奖励模型给未来状态打分,最后选分数最高的动作执行。这个过程在 GPC-RANK 框架里很常见,但它前提是世界模型必须足够快,否则候选动作一多,系统就卡成 PPT。
结果非常直白:在 Push-T 上,原始策略的 IoU 只有 0.635 左右,接上 DriftWorld 之后能涨到 0.781;另一条策略也有类似提升。更妙的是,DriftWorld 在做这件事时比 GPC、AVDC 等基线更快,说明它不是靠“算得久”堆出来的效果,而是真正把高频规划变得可行了。
插图
图9:离线策略评估结果。DriftWorld 在 Lift、Can、Push-T 上与真实成功率或 IoU 的相关性更高,说明它不只是会“生成视频”,还具备当模拟器给策略排队打分的能力。
离线策略评估是另一个很实在的用途。很多机器人策略不能随便上真机测,成本高、风险大、效率低,所以常常需要一个足够靠谱的模拟器来先筛策略。DriftWorld 在 Push-T 和 Robomimic 上都能把策略的绝对表现和相对排序预测得比较准,相关系数最高接近 0.99。这就很关键了:如果一个模拟器连谁强谁弱都分不清,那基本只能当视频播放器,不能当评估工具。
插图
图10:特征空间消融可视化。用了 DINOv2 或 DINOv3 之后,机械臂抓手更清晰;不用特征空间时,抓手容易发糊。这说明特征空间不是“锦上添花”,而是复杂场景里稳定生成的关键。
插图
图11:动作跟随权重的效果。没有 motion weighting 时,后续帧里机械臂容易“原地摆烂”;加上之后,动作执行更贴合指令,说明模型确实被迫认真看动作了。
消融实验也挺有说服力。论文发现,DINO 特征、motion weighting、self-forcing 这些模块都不是摆设。尤其是 motion weighting,解决的是机器人视频里常见的“背景很安静、动作很小、模型就想偷懒复制过去”的问题。给运动区域更高权重后,模型才会老老实实把注意力放到真正变化的地方。

总结与未来展望:单步生成,未来可期

DriftWorld 最值得记住的一点,不是它用了某个新奇名词,而是它把一个老问题讲透了:机器人世界模型真正的瓶颈,往往不在“能不能生成”,而在“能不能足够快地生成很多次”。一旦把推理速度提上来,世界模型就不再只是展示视频效果的玩具,而是能进入规划、搜索、筛选和离线评估的工作流。
当然,这类方法也不是没有边界。首先,DriftWorld 依赖高质量动作条件和合适的特征空间,任务越复杂,对数据和表示的要求越高。其次,虽然它在多个基准上很强,但世界模型终究还是近似环境,遇到分布外场景、长时序误差累积、稀有物体交互时,仍然可能出现偏差。最后,单步生成虽然快,但训练目标和系统设计更讲究,工程实现并不是“换个损失函数就完事”。
不过从研究方向上看,这条路是值得继续走的。未来如果能把 DriftWorld 这类单步生成方法和更强的动作规划器、语言条件、长期记忆以及更稳的物理约束结合起来,机器人世界模型就可能从“会看见未来”走向“会更可靠地决定未来”。这才是它真正让人期待的地方。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是机器人世界模型“能生成但太慢”的问题。DriftWorld 把原本依赖多步去噪的扩散式 rollout,改成单步漂移生成,让模型在规划时能一次性评估更多候选动作。

DINOv2 / DINOv3 为什么这么重要?它们是强视觉特征提取器,中文可以理解为“无标签自蒸馏视觉表征模型”。在复杂机器人场景里,直接算像素差容易被背景噪声带偏,而特征空间更能抓住“物体位置、接触关系、动作变化”这些真正重要的信息。

它为什么能又快又准?快,是因为推理时只做一次前向传播,不再多步采样;准,是因为训练时用漂移损失把生成结果往真实未来拉,同时用动作强化、motion weighting 和特征空间约束,避免模型学成“复制上一帧”的懒汉。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把 drifting 迁移到动作条件视频预测里,并补上动作强化、特征空间漂移和帧级条件注入,思路完整,不是简单换壳。

实验合理度:★★★★☆。对比基线、速度指标、可视化、消融和下游规划/评估都做了,证据链比较完整;如果再补更多极端场景,会更稳。

学术研究价值:★★★★☆。它把“快的世界模型”这个方向往前推了一步,对机器人规划、策略筛选和离线评估都有启发。

稳定性:★★★☆☆。在基准上表现不错,但真实部署还要看分布外泛化、长时序误差和复杂交互,不能把 demo 当终局。

适应性以及泛化能力:★★★☆☆。对机器人操作任务适配得不错,但对更开放的场景,特征空间和动作建模还需要继续打磨。

硬件需求及成本:★★★★☆。推理很省,适合规划;训练阶段依赖较强视觉特征和视频数据,成本不低,但总体比反复跑扩散采样友好得多。

复现难度:★★★☆☆。代码已开源是加分项,但漂移训练、特征空间、动作强化这些细节叠在一起,工程复现并不算省心。

产品化成熟度:★★★☆☆。更像是“可进入机器人规划管线的研究原型”,在高频候选搜索、离线评估这类场景有潜力,但还需要更强鲁棒性验证。

可能的问题:核心价值很清楚,但对复杂分布外场景、长时序累积误差和更广泛任务的验证还不够,离“通吃所有机器人世界模型”还差得远。


主要参考文献

1. Susie Lu, Haonan Chen, Weirui Ye, Yilun Du. DriftWorld: Fast World Modeling through Drifting. arXiv:2607.15065v1, 2026.
2. 项目代码:https://github.com/Susie-Lu/driftworld
3. 原文链接:https://arxiv.org/pdf/2607.15065v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。