← 返回 PaperDaily
视觉与图像
CVPR 2026 PhyWM:1.4万亿token训练通用世界模型
继2026年5月推送的NeoVerse之后,斯坦福又带来一款暴力物理世界模型PhyWM。它没有标注,没有动作标签,仅靠自回归预测光流和RGB,就能零样本完成物体分割、3D操纵甚至Visual Jenga。对机器人、具身智能来说,这是一条通往物理智能的捷径。
龙哥读论文
发布于 2026-08-14 09:11:26
阅读 4
查看原文
原论文信息如下:
引言
视觉智能的一个核心挑战是从原始视频中学习场景的物理结构:区域如何构成物体,以及支配它们相互作用的规律。解决这些问题需要世界模型能够从部分观测中推断出世界的分布状态——当前大多数架构并不支持这一能力。斯坦福大学联合OpenAI、Noetik和Google的研究者提出了一类新的概率世界模型,能够估计任意视觉变量(如外观、运动)在给定其他变量时的条件概率。本文证明,这类模型可以通过自回归序列建模高效训练,从而得到能够涌现丰富物体理解的世界模型。
具体来说,本文提出的PhyWM(Physically controllable World Model)模型使用token描述视觉场景:RGB token编码外观,光流token编码运动,相机token编码视角变化。通过在不同掩码模式下训练,PhyWM支持多种推理路径:既可以以流为预测目标(基于稀疏提示生成合理场景动态),也可以以流为条件信号(基于动态渲染未来外观)。更关键的是,PhyWM能够利用这些推理能力提取多种物体理解:通过运动统计识别可移动区域;通过序列推理生成多种可能的未来;通过运动相关分析进行物体分割、关节部位分割;实现3D物体操纵以及物理关系推理(如Visual Jenga)。
这项工作的价值在于:它展示了如何用一个统一的、自监督的、可物理提示的世界模型,通过简单的过程零样本提取各种丰富的物体理解,为通用场景理解奠定了基础。它的方法简洁而有力——将问题转化为GPT风格的next token预测,让强大的语言模型架构直接服务于视觉物理建模。
方法概述
PhyWM的整体架构如图1所示。其核心是将视觉世界建模为一个概率图模型(PGM),其中世界状态被分解为一组局部变量,模型学习在给定任意子集变量的情况下预测每个变量的条件概率分布。然后,这个PGM被等价地转化为自回归序列预测问题:将观测数据序列化为交错的指针token和内容token,通过标准的下一token预测损失进行训练。
PhyWM的内容词汇表包含RGB token(编码外观)、光流token(编码动态)和相机token(编码视角变化)。RGB和光流token通过在空间patch数据上训练浅层卷积量化器获得,相机token通过对6DOF变换进行分箱获得。训练序列的构造方式为:将两个视频帧的RGB指针-内容序列、光流序列和相机token拼接,在训练时对光流token进行随机掩码(掩码率0-1),迫使模型学习在给定任意量光流条件下预测RGB。
核心设计
PhyWM的核心设计思想是将世界模型构建为概率图模型,并通过自回归序列模型高效实现。这区别于传统的基于prompt的世界模型(如文本、动作或全局场景嵌入),后者无法提供对局部场景变量之间相互影响的精确查询能力。PhyWM通过token化表示,使得对任意变量的条件推理成为可能。
具体来说,模型Φ接受部分观测数据X(将部分时空索引映射到内容变量),以及一个未观测的查询位置p,返回该位置内容变量的概率分布Pr[v | X, p]。这一概念上类似于概率图模型,但传统PGM难以学习。本文的核心洞见是:学习任意变量之间的条件关系可以重新表述为GPT风格的next token预测序列模型。具体地,将观测数据X序列化为交错的指针和内容token [p0, v0, p1, v1, ...],则PGM公式简化为标准的自回归框架:在序列末尾追加一个指针token,即可获得内容token的概率分布。
核心设计: 将世界状态分解为一组局部变量,并学习在给定任意其他变量的条件下预测每个变量的条件概率分布。这本质上是一个概率图模型(PGM)。PGM 是一种用图来表示随机变量之间依赖关系的数学模型,在传统机器学习中非常经典,但往往计算复杂、难以扩展。本文的核心洞察是:学习任意变量之间的条件关系,可以重新表述为 GPT 风格的“下一个 token 预测”序列模型。具体做法是将观测数据 X 序列化为交错的指针 token 和内容 token:[p0, v0, p1, v1, ...]。这样一来,PGM 公式就简化为标准的自回归框架:在序列末尾追加一个指针 token,就能获得该位置内容 token 的概率分布。这种等价关系使得我们可以直接利用在语言建模中被证明极其有效的 Transformer 架构进行训练。
训练细节: PhyWM 实现为一个 70 亿参数的 GPT Transformer,使用交叉熵损失进行下一 token 预测训练。训练数据包含 300 万个真实世界 RGB 视频片段,总共约 1.4 万亿个 token。训练使用批次大小 512,共进行 150 万步,采用 Warmup-StableDecay 学习率调度策略。在训练过程中,模型需要同时处理来自不同视频帧的RGB token、光流token以及相机token。为了增强模型对物理交互的理解,训练时对光流token采用了随机掩码策略,掩码率在0到1之间均匀采样。这意味着模型有时需要在完全没有光流信息的情况下仅凭RGB预测运动,有时又需要在给定部分光流的情况下补全剩余的运动场。这种多样化的掩码策略迫使模型学习到RGB与光流之间的深层映射关系,从而掌握物理世界的运动规律。此外,相机token的引入使得模型能够区分由相机运动引起的全局光流和由物体运动引起的局部光流,这对于准确理解场景动态至关重要。训练数据涵盖了室内外各种场景,包括静态场景、物体交互场景以及相机运动场景,确保模型能够泛化到多样化的真实世界环境。
从物理世界模型到零样本对象理解
PhyWM 的训练目标看似简单——只是预测下一个 token,但它学到的东西远超想象。在训练完成后,这个模型实际上掌握了一个关于物理世界的经验性“联合概率分布”。它知道:当一个物体被推动时,哪些区域会跟着动,哪些不会;当视角变化时,原本被遮挡的部分可能是什么样。这种知识是隐式的,但可以通过不同的查询方式来显式揭示。
本文的核心亮点在于,基于这一个统一的模型,通过设计精巧的推理过程,零样本 地完成了多种物体理解任务。所谓零样本,是指模型在训练时从未见过任何分割标注、物体标签或 3D 操纵数据,这些能力完全是基于对物理世界的建模而“涌现”出来的。这种涌现能力源于模型对物理规律的内在学习:通过海量视频数据,模型自发地学会了物体作为刚性整体运动的统计规律,学会了遮挡与可见性的几何关系,以及力传递与运动传播的物理约束。这些知识不是通过显式标注获得的,而是作为预测下一个token的副产品自然形成的。
运动统计揭示可移动区域
对于机器人来说,搞清楚“哪里可以推、哪里不可以推”是基础中的基础。墙壁、地板是不可移动的“静态背景”,而桌上的杯子则是可移动的“前景物体”。PhyWM 通过一种非常巧妙的方式来回答这个问题:直接查询模型对于运动概率和期望运动的预测。
运动概率图: 给定一张输入图像和一个“相机停止”条件(即告诉模型相机不再移动),模型可以通过并行计算所有位置的运动概率。这个概率值反映的是:如果这个地方被虚拟地戳了一下,它是不是会移动。结果会形成一张热力图,清晰标出哪些区域是“可移动的”。对于刚性物体,整个物体区域呈现出均匀的高概率响应;对于可变形物体(如布料),响应则聚集在虚拟戳点附近。这种差异本身就蕴含了丰富的物理信息:刚性物体的运动是整体性的,而可变形物体的运动是局部性的。运动概率图的计算方式非常高效:模型对每个空间位置独立进行查询,所有查询可以并行执行,因此可以在单次前向传播中完成整张图的构建。具体实现上,模型将输入图像编码为RGB token序列,然后对每个空间位置插入一个查询指针token,模型输出该位置光流token的概率分布。通过计算光流非零的概率,即可得到运动概率图。
期望运动图: 除了知道“会不会动”,我们还想知道“会往哪动”。PhyWM 可以通过概率加权平均的方式,计算出每个位置在受到虚拟操作后的期望运动向量。这相当于为场景中的潜在交互描绘了一幅“运动地图”。期望运动图的计算利用了光流token的离散化特性:每个光流token对应一个特定的运动向量,模型输出的是每个token的概率,因此期望运动向量就是所有可能运动向量的概率加权平均。这种计算方式不仅给出了运动方向,还提供了运动幅度的估计。在机器人规划中,期望运动图可以直接用于预测操作后果:如果机器人在某个点施加力,场景中的各个部分将如何响应。这对于避免碰撞、规划抓取策略以及预测物体动态行为都具有重要价值。
序列生成捕获复杂运动依赖
并行计算有一个假设前提:所有位置的运动是条件独立的。但对于复杂的多关节物体(比如有脖子和腿的马),一个部位的运动往往会决定其他部位的运动——这种依赖关系无法在并行计算中完整捕获。为了突破这个限制,PhyWM 采用顺序生成 的方式来产生更高质量的运动场。
在顺序生成中,模型会一次一个 token 地采样,每一步都利用已经生成的所有 token 作为条件。这类似于大语言模型逐字生成文本时的推理过程。通过这种方式,PhyWM 可以产生多样化的、物理合理的运动场。无论是受条件控制(如戳一下熊的头部)还是无条件的运动生成,模型都能给出令人信服的结果。顺序生成的过程本质上是在对联合概率分布进行采样,因此能够捕获变量之间的高阶依赖关系。例如,当模型先生成熊的头部运动时,它会根据头部运动的方向和幅度,推断出身体其他部位(如四肢、躯干)应该如何响应。这种因果推理能力使得生成的运动场不仅在局部合理,在全局上也保持了一致性。论文中的实验表明,顺序生成的运动场在物理合理性评分上显著优于并行计算的结果,尤其是在涉及多关节物体的场景中。
运动相关实现精确对象分割
物体分割是一个经典的视觉任务,其核心在于定义“什么是物体”。传统的分割模型(如 SAM2)依赖人工标注,且往往基于外观纹理进行分割,导致一个物体被过度切碎成多个部分,或者不同实例被合并。PhyWM 给出了一个更自然的定义:物体是那些倾向于一起运动的像素集合 。
点提示可移动物体分割: 用户只需在图像上点一个点,指定要分割的目标。PhyWM 会根据这个点,进行多次虚拟戳操作,计算每次戳操作下各个位置的期望运动,然后通过运动相关性分析,找出哪些区域会与这个点的运动模式高度相关。经过阈值化处理后,就得到了一个与戳点一起移动的物体掩码。具体实现上,模型首先在用户指定的点处施加一个虚拟戳,生成该点的期望运动向量。然后,模型以这个运动向量为条件,查询场景中其他所有位置在相同戳操作下的期望运动。通过计算每个位置的运动向量与戳点运动向量之间的余弦相似度,可以得到一个相关性热力图。最后,通过设定一个相关性阈值(论文中采用0.5),即可得到二值化的物体掩码。这种方法的核心优势在于,它完全基于物理运动的一致性来定义物体,因此对于纹理复杂但物理上属于同一物体的区域(如斑马身上的条纹),能够正确地将其归为一个整体。
无提示可移动物体分割: 对于完全自主动态,PhyWM 可以先分析场景的“运动概率图”,自动识别出倾向于移动的区域,然后以这些区域为起点进行分割。最终通过非极大值抑制去除重叠的、相似的掩码,得到一个场景中所有独立可移动物体的集合。无提示分割的流程如下:首先计算整张图像的运动概率图,找到所有运动概率高于阈值(论文中采用0.3)的局部峰值点。然后,以每个峰值点作为候选戳点,进行点提示分割,得到一组候选物体掩码。最后,对这些候选掩码进行非极大值抑制,去除重叠度超过0.5的冗余掩码,保留最终的物体集合。这种方法能够自动发现场景中所有潜在的可移动物体,而无需任何人工标注。论文在SpelkeBench基准上的实验表明,无提示分割的F1分数达到0.38,虽然绝对数值不高,但考虑到这是零样本且无任何标注信息的结果,已经显著优于所有基线方法。
关节部位分割: 对于像笔记本电脑或剪刀这样有关节的物体,PhyWM 能够进一步区分出可以独立移动的子部分。通过在一个子部分上施加虚拟戳,分析运动相关性,可以精确地找到那些会随之运动的子区域。关节部位分割的关键在于,模型能够识别出虽然属于同一物体但可以独立运动的部件。例如,笔记本电脑的屏幕和键盘虽然通过铰链连接,但它们的运动是相对独立的。PhyWM通过在不同位置施加虚拟戳,并分析运动相关性的空间分布模式,可以自动发现这种关节结构。具体来说,如果在屏幕区域戳一下,屏幕会整体运动但键盘保持静止;如果在键盘区域戳一下,键盘会整体运动但屏幕保持静止。通过聚类这些运动模式,模型可以自动将物体分解为关节部件。论文在剪刀、笔记本电脑、钳子等关节物体上的实验表明,PhyWM能够准确地分割出各个关节部件,其分割质量与有监督方法相当。
实验结果: 在点提示分割任务上,PhyWM 在 SpelkeBench 基准测试中取得了最先进的 mIoU(0.681)和 AR(0.541),显著优于所有自监督和基于 SAM 的监督方法。SpelkeBench是一个专门设计用于评估物体分割物理合理性的基准,包含各种室内外场景中的刚性物体和可变形物体。PhyWM的mIoU达到0.681,意味着预测掩码与真实掩码的平均交并比超过68%,这是一个非常高的数值。相比之下,基于外观的SAM2虽然mIoU也达到0.65左右,但在处理纹理复杂或遮挡严重的物体时表现不佳。PhyWM的AR(平均召回率)达到0.541,表明它能够检测到超过一半的可移动物体,这在零样本设置下是非常出色的表现。在无提示分割任务中,PhyWM的F1分数为0.38,虽然低于点提示设置,但考虑到这是完全自动化的分割,且没有任何先验信息,这个结果已经证明了模型强大的物理理解能力。
3D操纵与物理关系推理
PhyWM 的进阶应用是理解物体如何在三维空间中移动。给定一个图像、一个点提示和一个期望的 6DOF(六自由度)变换(即指定物体在三维空间中的平移和旋转),PhyWM 可以生成一个密集的光流场,反映这个变换,然后基于该流场渲染出最终的照片级真实感图像。这一过程的核心在于,模型需要理解3D变换如何映射到2D图像平面上的像素运动。具体来说,给定一个6DOF变换(包括沿x、y、z轴的平移和绕各轴的旋转),模型首先根据物体的3D几何结构(隐含在RGB token中)和相机参数(由相机token提供),计算出每个像素应该产生的光流。然后,模型以这个光流场为条件,生成变换后的RGB图像。这种能力使得PhyWM可以作为一个3D场景编辑器使用:用户可以选择一个物体,指定它在3D空间中的新位置和姿态,模型就能自动生成编辑后的逼真图像。
更令人印象深刻的是物理关系推理。PhyWM 可以对“堆叠”场景(如积木塔)进行推理,判断哪些物体依赖于哪些物体。通过在一个物体上施加虚拟戳,观察哪些其他物体会因此移动,可以构建一个“物体支持图”。基于这个图,就能计算出每个物体的“运动影响分数”,从而知道哪个物体是“最安全的”可以从堆叠中拿走的。这个过程被称为Visual Jenga ,即通过反复查询世界模型来判断如何在不引发倒塌的情况下移除一个物体。Visual Jenga的具体算法如下:首先,使用无提示分割方法检测出场景中的所有可移动物体。然后,对每个物体施加一个虚拟戳操作,并观察其他物体的运动响应。如果物体A被戳时物体B也发生运动,则在支持图中添加一条从A指向B的有向边,权重为运动概率。基于这个有向图,可以计算每个物体的“运动影响分数”,即该物体被移除后可能受到影响的物体数量。最后,选择影响分数最小的物体作为最安全的移除目标。模型生成一个大的虚拟戳操作将该物体从场景中移除,然后更新支持图并重复上述过程。论文在积木塔、杯子堆叠等场景中的实验表明,PhyWM能够正确地识别出支撑结构,并安全地移除物体而不引发倒塌。这种能力对于机器人操作具有重要价值,例如在拆解、整理或搜索任务中,机器人需要理解物体之间的物理依赖关系。
统一架构下的物理智能
纵观整个 PhyWM,它的核心优势在于统一性 。传统的做法是:用一个模型做分割(SAM),另一个模型做生成(扩散模型),再一个模型做动态预测(物理模拟器)。这些模型互相不通信,维护和迭代的成本极高。而 PhyWM 用一个 70 亿参数的 Transformer 模型,把所有能力整合在一起。
从训练数据看,它只依赖 300 万无标注视频片段。这个数字在今天的视觉数据规模下不算夸张,但绝对算得上“高效”。从训练目标看,它只做一件很简单的事:预测下一个 token。从训练方法看,它使用标准的 GPT 式训练策略,没有引入任何花哨的监督信号。这种简洁性本身就是一种优势:它意味着模型的能力不是通过精心设计的任务特定损失函数获得的,而是通过大规模自监督学习自然涌现的。这种涌现能力具有很好的可扩展性:随着训练数据规模和模型参数量的增加,模型能够学到更精细的物理规律,从而在更多下游任务上表现出更强的能力。
本文的这项研究虽处于学术前沿,但在光流计算、大型序列模型训练效率、零样本泛化边界等方面仍面临挑战。模型的 1.4 万亿 token 训练规模也意味着硬件需求极高。不过,它展示了一个清晰的未来方向:AI 对物理世界的理解,可能会从精心设计的专用模型,走向自我生成的、基于世界模型的统一推理。对机器人、具身智能、游戏开发和人类场景理解等领域,PhyWM 提供了一个极具吸引力的基础框架。未来可能的研究方向包括:将PhyWM扩展到视频预测任务,使其能够生成长时间段的物理合理视频;将PhyWM与强化学习结合,用于机器人策略学习;以及开发更高效的token化方法,降低模型的计算成本。
龙迷三问
Q:PhyWM 和常见的图像分割模型(如 SAM2)有什么区别?
A:最主要的区别在于定义“物体”的方式。SAM2 基于外观纹理和边缘进行分割,容易把有纹理的同一个物体切碎,或者把不同实例混合。PhyWM 则基于运动相关性,定义为“在物理上倾向于一起移动的像素集合”,这样得到的分割更符合物理直觉,更适合需要理解物体互动关系的机器人任务。此外,SAM2需要大量人工标注的分割掩码进行训练,而PhyWM完全不需要任何标注,仅通过自监督学习就能获得分割能力。这种零样本能力使得PhyWM可以应用于任何新的场景和物体类别,而不需要重新训练或微调。
Q:光流(optical flow) 到底是什么,为什么它这么重要?
A:光流是指视频中连续两帧之间,每个像素点的运动方向和大小的集合。可以理解为“一张运动地图”。在 PhyWM 中,光流 token 充当了“物理交互的桥梁”:既然很难获取真实的机器人动作标签(如“推了 5 牛”),那就用光流这种低成本、易获得的视觉数据来代理。模型通过预测和生成光流,间接学会了物理世界的动态规律。光流的一个重要特性是它包含了丰富的物理信息:物体的刚性运动、非刚性变形、遮挡边界、运动速度等都可以从光流中推断出来。通过将光流作为中间表示,PhyWM能够在不依赖任何物理模拟器的情况下,学习到物体之间的相互作用规律。
Q:PhyWM 在 Visual Jenga 任务中具体是怎么做的?
A:给定一个堆叠物体的场景(如积木塔),PhyWM 首先检测并分割出所有可移动物体。然后,它通过虚拟戳压一个物体,并观察其他物体是否跟着移动,从而构建一个“支持图”:每个物体的边缘权重为“如果 A 被戳,B 也跟着动的概率”。根据这个图,可以计算每个物体的“运动影响分数”——即它在哪些方向上能自由移动而不触动别人。最后,模型选择影响分数最小的物体,生成一个大的虚拟戳操作将其从场景中移除,然后更新支持图,迭代进行。这整个过程完全不需要真实的物理模拟器,纯靠世界模型的内在知识完成。Visual Jenga的实验结果表明,PhyWM在堆叠场景中的物体移除成功率超过80%,显著优于基于规则的方法。这种能力对于机器人操作具有重要价值,例如在拆解、整理或搜索任务中,机器人需要理解物体之间的物理依赖关系。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★★
将概率图模型与GPT式序列建模巧妙结合,以“穷人版世界模型”的思路用光流代理动作信号,是概念和方法上的双重突破。
实验合理度: ★★★★✰
在SpelkeBench、DragAMove、3DEditBench等多个基准上与多种SOTA方法对比,覆盖全面。但在自然场景下的复杂光照和遮挡能否保持同样效果,缺乏系统性压力测试。
学术研究价值: ★★★★★
开创性地证明世界模型内部知识可以零样本迁移到多种下游任务,为通用视觉智能提供了新范式。论文本身也展示了方法在医学影像、材料科学等领域的潜在应用方向。
稳定性: ★★★✰✰
训练依赖高质量光流估计,对数据噪声敏感。同时在无提示分割中,对场景中静止的但实际可移动物体识别可能较弱,稳定性有待提升。
适应性以及泛化能力: ★★★★✰
在常见的室内外场景和小型物体上表现良好,但对极端远距离、透明物体、低纹理场景的泛化能力有待验证。
硬件需求及成本: ★★✰✰✰
70B参数模型在推理时需要大量显存和算力,训练更是耗费300万视频片段和1.4万亿token。论文未提供更低成本的蒸馏或量化版本。
复现难度: ★★✰✰✰
论文未提供公开源码或预训练检查点。训练所需数据(300万视频)和计算资源(如没有说明TPU规模)对普通实验室难以复现。
产品化成熟度: ★★✰✰✰
概念验证阶段,算力和延迟远不能满足实时或嵌入式应用需求。但在云端离线处理(如游戏场景设计、影视后期)场景有一定潜力。
可能的问题: 论文的性能提升主要来自更大规模的模型和数据,而非路径上的根本性突破。光流 token 的量化方法可能会丢失细粒度运动的精度。在无提示分割任务中,F1分数(0.38)虽优于基线,但绝对数值仍偏低。
主要参考文献
[1] Niket Agarwal, Arslan Ali, Maciej Bala, et al. Cosmos world foundation model platform for physical ai. arXiv preprint arXiv:2501.03575, 2025.
[2] Stefan Andreas Baumann, Nick Stracke, Timy Phan, et al. What if: Understanding motion through sparse interactions. ICCV, 2025.
[3] Rahul Venkatesh, Klemen Kotar, Lilian Naing Chen, et al. Physical Object Understanding with a Physically Controllable World Model. CVPR, 2026.
[4] Honglin Chen, Rahul Venkatesh, Yoni Friedman, et al. Unsupervised segmentation in real-world images via spelke object inference. ECCV, 2022.
[5] Anand Bhattad, Konpat Preechakul, Alexei A Efros. Visual jenga: Discovering object dependencies via counterfactual inpainting. arXiv preprint arXiv:2503.21770, 2025.
本文旨在分享AI学术前沿动态,不提供任何形式的开源代码或模型。文章内容仅供读者学习参考,不代表本公众号立场。转载或引用请注明出处。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想要解锁零样本物体理解的奥秘?添加龙哥助手微信号:kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称,即可加入龙哥读论文粉丝群,与13000+同道交流最新AI技术。群内每周解读顶会论文,附代码和数据集资源,不容错过!