← 返回 PaperDaily 视觉与图像

卡内基梅隆大学机器人三维世界模型:无动作预训练让平均成功率80.5%升至88.2%

论文基本信息 方法名称: PointZero 原文标题: PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics 署名单位: 卡内基梅隆大学、哥伦比亚大学、英伟达 首次公开: 2026年9月17日(北京时间,arXiv v1) 原论文: https://arxiv.

论文基本信息

方法名称:PointZero

原文标题:PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

署名单位:卡内基梅隆大学、哥伦比亚大学、英伟达

首次公开:2026年9月17日(北京时间,arXiv v1)

原论文:
https://arxiv.org/abs/2609.19142

项目页:
https://pointzero-wm.github.io/

龙哥导读

机器人学习最贵的东西,往往不是模型,而是带动作标注的真实操作数据。PointZero换了一个起点:不给机器人动作,只给一张彩色深度图和少量三维点运动轨迹,让模型补全整片场景未来会怎样移动。它用290万帧合成数据先学物体动力学,再用很少的动作示范适配机器人任务。在三项仿真操作中,带点轨迹辅助监督时,预训练把平均成功率从80.5%提高到88.2%。这篇论文真正值得看的,不只是7.7个百分点,而是它尝试把“理解物体怎么动”和“学习机器人怎么做”拆成前后两步。

一个机器人第一次见到抽屉、纸袋或袜子,怎样预判它们被推、拉、折叠之后会发生什么?最直接的办法,是让机器人亲自试很多次,再把每次末端执行器的位置和物体变化一起记下来。可这种数据采集既慢又贵,还被具体机械臂、夹爪和控制接口绑住。

PointZero提出的问题更接近人类学习:能不能先不学“手该怎么动”,只学习“世界受到局部推动后会怎样变化”?如果这份三维动力学先验足够通用,等真正面对机器人任务时,只需少量动作示范就能把它转成控制能力。

图1:PointZero的核心任务。模型从单张彩色深度图和一条或少数几条橙色稀疏轨迹出发,预测所有可见点未来的三维运动;随后分别迁移到动作条件动力学预测与机器人操作策略。来源:论文官方图1。

一、先学“世界怎么动”,再学“机器人怎么做”

传统机器人动力学模型通常把机器人动作当作条件:给定当前点云和未来几步机械臂位姿,预测物体会移动到哪里。这个设置很适合针对一个场景做精细建模,却有一个规模化难题——训练样本必须带机器人动作标签。

动作标签不只是几个数字。它们依赖具体机器人的坐标系、夹爪状态、控制频率和标定方式。换一台机器人,动作空间可能就变了。公开视频里虽然有大量“人或工具推动物体”的运动信息,却没有统一的机器人控制记录,因此很难直接加入这种预训练。

PointZero把条件改成少量三维点轨迹。例如,视频里一根手指按住布料向右拖,模型不需要知道机械臂关节角,只需要看到接触附近几个点怎样移动,然后补全布面上其他点未来的位置。抽屉、绳子、盒子和软物体都可以统一成“点随时间移动”的语言。

这就是三维点轨迹补全。输入包含初始时刻的彩色深度图、由深度恢复的三维点云,以及少数完整的引导轨迹;输出则是所有观测点接下来9帧的三维位置。总序列长度为10帧,第一帧提供初始状态,后9帧描述未来。

它与二维视频预测的区别也很明确。视频模型可以生成“看起来会动”的像素,却不一定维持真实尺度、表面结构和三维对应关系。点轨迹直接记录每个物理点在三维空间里的运动,更适合回答机器人关心的问题:抓取点会到哪里、布面是否被拉伸、抽屉是否沿正确轴转动。

二、三类信息怎样进入同一个模型

PointZero采用一个统一的扩散Transformer,把三类信息放在一起:初始点云告诉模型物体的三维几何;稀疏轨迹告诉模型哪里受到怎样的推动;图像特征补充材质、纹理和物体类别。模型再从随机噪声出发,逐步生成每个点的完整未来轨迹。

第一类是点标记。对初始点云中的每个点,模型把它的三维坐标重复9次,形成“如果只知道起点,这个点未来可能去哪里”的查询底座。重复并不意味着假设它静止,而是让每个未来时刻都保留同一个空间锚点。

第二类是稀疏轨迹标记。每条引导轨迹在每个时刻都有一个三维坐标,模型再叠加时间位置和轨迹编号。这样,同样的坐标出现在第2帧和第9帧含义不同,两条相交轨迹也不会被混为一谈。

第三类是视觉标记。论文使用自监督视觉特征提取图像语义,再通过感知器输入输出模块(Perceiver-IO)压缩成少量视觉标记。这里的作用不是替代点云,而是补上几何难以表达的信息:一团点究竟是可以折叠的布、刚性的杯子,还是带关节的抽屉。

图2:PointZero方法结构。上方把初始点、稀疏轨迹和图像压缩成条件;下方以带噪的未来点轨迹作为查询,通过自注意力交换点间信息,再通过交叉注意力读取几何、动作线索与视觉语义。来源:论文官方方法图。

图2下方的查询可以理解为“所有点未来运动的草稿”。在自注意力层里,不同点互相交流:布料一个角被拉动,附近点不能各走各的;刚体上的点也应维持整体结构。交叉注意力层再读取初始几何、稀疏轨迹和视觉条件,决定这份草稿应该向哪种物理变化修正。

这个结构还有一个很实用的好处:迁移时不用推倒重来。把稀疏轨迹条件替换成机械臂末端执行器的六自由度位姿与夹爪状态,模型就变成动作条件动力学预测器;再增加一个动作输出头,它又可以同时预测点轨迹和机器人动作。

预训练学到的是物体运动规律,后训练只负责把新的控制接口接到这份规律上。这比让每个任务从随机参数开始重新认识“布会变形、抽屉绕轴运动、杯子大体保持刚性”更节省数据。

三、为什么不直接回归一条唯一轨迹

只给一张图和少数轨迹时,未来通常不唯一。抓住布角向右移动,布的其他区域可能滑动、折叠,也可能被摩擦力暂时拉住。若直接用均方误差回归一个答案,模型容易把多种合理结果平均成一条不真实的“中间轨迹”。

论文比较了直接回归、流匹配和类似“直接预测干净样本”的三种目标。流匹配先采样一个高斯噪声轨迹ε,再用时间变量t在噪声与真实轨迹p之间插值:

pt = (1 - t)ε + tp

当t接近0,输入几乎是噪声;当t接近1,输入逐渐靠近真实未来。模型学习的目标速度是v* = p - ε,也就是从当前带噪轨迹朝真实轨迹前进的方向。推理时用四次前向欧拉更新,就能把噪声逐步推成完整点轨迹。

另一种目标借鉴“直接在像素空间去噪”的思路,不让模型预测速度,而是直接预测最终干净轨迹p̂,再由p̂和当前pt计算隐含速度。它不需要额外的三维流自编码器,假设真实轨迹虽然位于高维坐标空间,但有效运动仍落在较低维的物理结构上。

实验中,两种生成式目标通常优于直接回归,但直接预测干净轨迹并没有在充分训练后稳定超过流匹配。这提醒读者:新的生成目标并不会自动赢,真正决定结果的仍是数据覆盖、条件信息和模型是否能表达多种合理动力学。

四、290万帧数据,覆盖三种最难统一的物体

三维动力学预训练的瓶颈不只是规模,而是物理类型。刚体通常整体移动,关节物体沿特定轴旋转或平移,绳子和布料却拥有大量自由度。如果数据只覆盖一种类型,模型很容易把局部规律误当成通用物理。

PointZero构建了290万帧合成数据,包含可变形物体、关节物体和刚体,由随机交互驱动。每个样本都能获得稠密、时间一致的三维点对应,这恰恰是现实视频最难稳定标注的部分。

为了检查仿真里学到的先验能否离开仿真,论文还采集了14种真实物体、124次人工交互,其中包括6种关节物体、5种可变形物体和3种刚体。真实数据只用于零样本评估,模型训练阶段没有针对这些物体微调。

图3:左侧为合成训练数据中的可变形、关节和刚体交互;右侧为真实世界零样本评估,覆盖14种物体与124次交互。来源:论文官方数据集图。

真实视频中的深度与轨迹来自双目深度估计和点跟踪工具。操作者手部与物体的接触点由人工在首帧标注,再向后传播轨迹。这里仍会受到深度误差、遮挡和跟踪漂移影响,因此它既测试物理泛化,也测试模型对不完美观测的耐受度。

论文还对点云做中心与尺度归一化,并加入旋转、坐标噪声、亮度变化、椒盐噪声和高斯噪声。这些增强并不能把仿真自动变成现实,但能减少模型依赖干净坐标和固定视觉外观的机会。

训练采用视觉Transformer基础规模骨干,每个变体使用8张H100约两天。这个成本比单个机器人任务的小模型训练高得多,但它被设计为可跨任务复用的预训练投入。是否划算,取决于后续能迁移到多少场景,而不是只看一次训练账单。

五、零样本结果:更会跟随动作,也更守物体结构

为了公平比较,论文把图神经动力学、粒子Transformer、粒子—网格动力学和第三版点Transformer等基线都改成相同输入、相同条件、相同预测目标,并在同一份合成数据上训练。差别主要留在模型怎样表示点之间的关系,以及一次预测整段未来还是逐步滚动。

在约3.2万个合成测试场景中,PointZero所有变体在各类物体和全部报告指标上都超过基线。生成式版本每个场景采样10次,再按指标选最接近真值的一次。这种“十选一”是带真值的预言机口径,说明模型能覆盖合理结果,但不等于实际部署时知道该选哪一次。

真实零样本测试更直观。论文报告流匹配与直接预测版本在12项真实指标中的11项超过全部基线,唯一例外是刚体的均方误差由第三版点Transformer领先。

图4:真实物体零样本定性对比。橙色箭头是模型获得的稀疏引导轨迹,其余颜色展示预测出的稠密运动。PointZero更能沿输入动作传播运动,同时减少布面面积异常变化和刚体形变。来源:论文官方定性图。

图4里可以看出三种典型失败。图神经基线有时几乎预测不动;逐步滚动模型容易让刚体“软掉”或让关节运动偏离轴;布料预测则容易出现面积被不合理拉伸。PointZero一次生成整段轨迹,并允许所有点通过注意力交流,对这些整体结构更友好。

这组结果证明的不是模型已经掌握真实世界全部物理,而是同样训练数据下,统一Transformer更善于把局部运动线索扩散到完整三维结构。测试对象仍只有14种,交互时长也较短。

六、迁移一:接入机器人动作,六个场景赢下四个

第一个下游任务来自粒子—网格神经动力学(PGND)基准。它要求模型接收机器人末端执行器的未来位姿,预测面包、纸袋、布、盒子、绳子和软体玩具六个场景中的三维变化。

PointZero把原来的稀疏点轨迹条件替换为六自由度末端位姿和夹爪状态,兼容组件从预训练权重初始化,再针对每个场景分别微调。论文同时训练完全随机初始化的同结构版本,用来区分“架构本身强”与“预训练真的有用”。

微调后的PointZero在六个场景中的四个明确超过应用专用基线,并在纸袋场景的一项指标打平最佳值。更关键的是,从随机初始化训练的同结构版本明显更差:例如面包场景平均距离误差为4.2厘米,预训练后降到1.5厘米;绳子场景从9.3厘米降到3.3厘米。

这组对照说明,优势不是简单来自“换了一个更大的Transformer”。预训练已经让模型形成点之间如何共同运动的空间先验,场景微调主要学习机器人动作怎样触发这套动力学。

不过,论文的PointZero结果也采用每场景、每指标10次采样取最好值。它适合衡量生成分布是否覆盖真实未来,却会高估单次在线预测的可靠性。未来更有工程意义的问题,是没有真值帮助选择时,模型怎样稳定挑出可用于规划的一条轨迹。

七、迁移二:20条动作示范,预训练把80.5%推到88.2%

第二个下游任务更直接:让模型输出机器人动作。论文在三项仿真任务和四项真实任务上测试,包括堆积木、打开微波炉、抓取玻璃杯、打开抽屉、抓杯子、把纸放进杯子和折袜子。

完整配方中,每项任务使用20条带动作标签的专家示范,再加入100段没有动作标签的专家视频。PointZero增加一个动作头,同时预测末端执行器轨迹与三维点轨迹。点轨迹不是最终控制命令,却给策略提供了“动作之后世界应该怎样变化”的辅助监督。

图5:三项仿真与四项真实机器人操作任务,以及PointZero与多种模仿学习方法的成功率对比。PointZero在7项任务中的6项取得最高或并列最高成功率。来源:论文官方机器人任务图。

完整比较中,PointZero在堆积木、微波炉和玻璃杯仿真任务分别达到99.8%、93.1%和95.9%;真实抽屉与杯子任务达到100%,折袜子达到90%。把纸放进杯子得到70%,低于对比方法的90%,说明预训练并没有让每个任务都自动变容易。

最能隔离预训练贡献的是20条示范消融。它去掉100段额外无动作视频,只保留每项任务20条动作示范,并让预训练版和随机初始化版使用相同架构、相同任务数据、相同辅助点轨迹监督。三项仿真任务均各评估1000次滚动。

随机初始化版本在堆积木、微波炉和玻璃杯上分别为93.5%、81.4%和66.6%,平均80.5%;预训练版本对应93.2%、91.9%和79.5%,平均88.2%。堆积木略降0.3个百分点,但微波炉提高10.5个百分点,玻璃杯提高12.9个百分点。

80.5%到88.2%的核心含义,是预训练没有靠更多任务动作标签取胜,而是把“物体怎样响应局部运动”的知识带进了小样本策略学习。提升主要出现在更依赖接触关系和物体状态变化的任务。

论文还做了一个更严格的版本:下游训练不再提供点轨迹辅助监督,只训练动作输出,并冻结预训练的点处理支路。此时随机初始化平均成功率为74.1%,预训练版为80.0%。差距缩小但仍存在,说明收益不完全来自下游多了一个辅助标签。

八、与PGND、3PoinTr相比,它补上了哪一环

PGND代表的是“为具体场景学习动作条件动力学”。它在目标场景采集交互数据,把点云映射到网格并逐步预测粒子速度,擅长针对单个对象做精细建模。PointZero并不是完全抛弃这条路线,而是在它前面增加跨物体预训练,让场景微调不必从零开始。

3PoinTr代表的是“先从视频预测点轨迹,再把预测结果交给策略”。这种两阶段设计让动作学习能利用无动作视频,但策略依赖上游轨迹预测质量。PointZero把动作头和点轨迹预测放进同一个模型,在后训练时联合优化,让共享表示同时服务“世界会怎样变”和“机器人应该怎样做”。

因此,三者并不是简单的榜单竞争。PGND强调场景专用精度,3PoinTr强调视频轨迹对策略的帮助,PointZero则把三维轨迹补全做成可迁移的统一预训练任务。它补上的环节,是在动作标签出现之前先建立跨物体、跨交互的三维动力学底座。

从工程角度看,这条路线最有吸引力的地方是数据兼容性。仿真可以直接给出稠密点对应;现实视频可以通过深度重建和点跟踪产生伪标签;机器人数据则在后训练阶段提供动作接口。如果三者能稳定对齐,同一个世界模型就可能利用远多于机器人示范的数据。

九、真正落地前,还要回答四个问题

第一,预训练数据仍以仿真为主。290万帧提供了规模和稠密真值,但真实世界的摩擦、材料、接触、遮挡和杂乱程度更复杂。14种真实物体的零样本结果令人鼓舞,还不足以代表开放家庭或工业环境。

第二,条件信号仍比较理想化。预训练时输入的是少量完整点轨迹,动作条件微调时输入末端位姿。真实操作还涉及接触位置、力、摩擦、工具形状和物体内部状态;两条相同的末端轨迹,可能因为是否真正接触而产生完全不同的结果。

第三,预测时间只有10帧。短时点运动适合抓住局部接触,但折叠、装配和长任务规划会积累误差。模型能否稳定滚动更长时间,或者与规划器闭环结合后是否出现分布漂移,论文尚未给出大规模答案。

第四,多样生成怎样变成可靠控制。合成与动力学测试采用10次采样取最优的预言机评估,实际机器人没有真实未来替它挑答案。部署系统需要不确定性估计、候选排序、碰撞检查或闭环重规划,才能把“覆盖过正确未来”变成“每次都选到可执行未来”。

此外,官方项目仓库当前只提供论文与项目页入口,完整代码、数据和训练配方尚未实际落地到仓库。论文声明将发布这些资源,但现阶段还无法独立复现290万帧数据生成和完整训练过程,因此工程采用者需要等待正式制品。

十、龙哥点评:世界模型不一定先学“动作语言”

这篇工作最聪明的地方,是没有执着于寻找一个统一的机器人动作空间。不同机器人很难共享关节命令,但它们推动同一个杯子时,杯子在三维空间中的运动是可以共享的。PointZero把可迁移性放在“世界发生了什么”上,再把“是谁、用什么动作造成的”留给后训练。

它也提供了一种更务实的世界模型定义:不必先生成完整逼真视频,也不必一次模拟所有隐藏物理量。只要模型能在度量三维空间里预测关键点怎样运动,并把这份能力可靠迁移到动作学习,就已经能为机器人提供真实价值。

但龙哥不会因为88.2%就直接喊“通用机器人世界模型来了”。这个结果来自三项仿真任务、每项20条示范和明确的点轨迹监督;真实任务数量仍少,代码也尚未可复现。更准确的判断是:三维点轨迹补全已经显示出成为机器人预训练接口的潜力,但它还需要更真实的数据、更长时预测和无预言机的闭环选择来证明规模化价值。

如果后续工作能从普通视频稳定恢复深度、遮挡后的点轨迹和接触线索,这条路线的意义会进一步放大。公开视频不再只是教机器人识别物体,也可以教它理解“推一下、拉一下、折一下之后,整个三维世界怎样响应”。

对机器人团队来说,这也会改变数据预算的分配方式:昂贵的动作示范更适合用来校准控制接口和任务目标,大量无动作视频则负责扩充物体、材质与交互的覆盖面。两类数据各做擅长的事,比要求每段视频都配齐机器人控制记录更现实。

十一、龙迷三问

1. 没有机器人动作标签,模型怎么知道是谁推动了物体?

它不需要知道具体机械臂命令,而是把少量已发生的三维点轨迹当作交互线索。例如接触点向右移动,模型据此推断其他点怎样跟随。迁移到机器人后,再把这类轨迹条件替换为末端位姿。

2. 80.5%升至88.2%是不是因为预训练版用了更多任务数据?

这组隔离实验中,两者都只使用每项任务20条动作示范,不加入额外无动作视频,并采用相同架构和辅助点轨迹监督。主要差别是参数是否经过三维点轨迹补全预训练,因此它能较直接地反映预训练贡献。

3. 它能直接用在家庭机器人上吗?

还不能这样下结论。论文证明了短时三维动力学先验可以迁移到少量仿真与真实操作任务,但开放环境还需要处理杂乱场景、长时误差、真实接触力、不确定性选择和安全闭环。它更像一个有前景的预训练底座,而不是即插即用的家庭机器人控制系统。

十二、总结与展望

PointZero把机器人世界模型的预训练目标,从“根据机器人动作预测未来”改成“根据少量三维运动补全整个场景”。这个变化移除了对具体机器人动作标签的依赖,让合成数据和未来的视频伪标签有机会进入同一个训练池。

论文用290万帧合成数据建立预训练,在真实物体零样本补全、六场景动作条件动力学和七项机器人操作中展示迁移能力。最关键的隔离结果是:相同20条动作示范下,带点轨迹辅助监督的三项仿真平均成功率由80.5%提高到88.2%;不带下游点轨迹监督时,也由74.1%提高到80.0%。

对研究者而言,这项工作的价值还在于提供了一个容易扩展的中间表示:点轨迹既能从仿真直接获得,也能从视频估计,还能和机器人动作建立对应。相比为每种机械臂重新定义预训练任务,它更有机会成为连接公开视频、仿真交互和真实机器人数据的共同接口。

它留下的下一道题同样清晰:怎样从真实视频获得足够可靠的三维轨迹,怎样把短时多样预测变成长时闭环控制,以及怎样在没有真值的现场从多个未来中挑出最可信的一个。谁能补上这些环节,谁就更接近真正可规模化的机器人三维世界模型。

本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。本文为论文解读与个人学习笔记,不构成任何论文审核意见,及对产品能力、安全性或商业可用性的保证。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球