← 返回 PaperDaily 视觉与图像

Apple新作Velox:单段视频生成4D世界

这篇 Velox 有点意思:不靠时间对应,不靠复杂输入,只拿动态点云就想把 4D 几何和外观一起学明白。更妙的是,它不止会“记住”4D,还能拿去做视频转4D、3D追踪和布料仿真,算是把潜在表征这张牌打得挺顺。

Apple新作Velox:单段视频生成4D世界
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇 Velox 有点意思:不靠时间对应,不靠复杂输入,只拿动态点云就想把 4D 几何和外观一起学明白。更妙的是,它不止会“记住”4D,还能拿去做视频转4D、3D追踪和布料仿真,算是把潜在表征这张牌打得挺顺。


原论文信息如下:
论文标题:
Velox: Learning Representations of 4D Geometry and Appearance
发表日期:
2026年05月
发表单位:
Apple;University of Toronto
原文链接:
https://arxiv.org/pdf/2605.04527.pdf
项目链接:
https://apple.github.io/ml-velox

不用相机参数,不用时间对应,4D空间里点云也能学出高逼真动态物体!

4D 这事儿,听起来就像“3D 再加一层时间滤镜”,但真做起来,麻烦得很。物体在动,外观在变,局部还会遮挡、消失、再冒出来;如果只盯着单帧,模型很容易学成“每一帧都认识一点,但连起来全靠猜”。Velox 想做的,就是把这种碎片化理解,压成一个可以反复调用的4D 潜在表示,既能记住几何,也能记住外观,还能拿去做生成、追踪和仿真。
这篇论文最有意思的地方在于,它没有把门槛抬到“必须有时间对应、必须有复杂监督、必须先准备好一堆精细几何资产”这种程度,而是尽量把输入压到一个更朴素的形态:非结构化时变点云。换句话说,只要能拿到多视角 RGBD 视频并反投影成点云,模型就有机会自己把 4D 世界的骨架和皮肤一起学出来。这个思路很像给模型一本“动态物体说明书”,而不是只给它几张照片让它自己脑补整部电影。
图1:Velox 学到的动态令牌可用于视频转4D、3D追踪和布料仿真
图1:Velox 学到的动态令牌可用于视频转4D、3D追踪和布料仿真。左边是直接在潜在空间里生成 4D 对象;右上是根据输入 RGBD 视频追踪三维点;右下则是从单张初始图像出发,做布料模拟。一个表示,三种活儿,挺会“打工”。

从零到一:只用非结构化的时变点云,就能练出一个“啥都会”的4D表示

先把概念捋顺。所谓4D 表示,不是玄学,也不是把 3D 再乘一个“时间外挂”,而是要把物体在不同时间点上的几何形状和外观变化,压缩进一个紧凑、可查询、可迁移的潜在空间。理想情况下,这个表示应该同时满足三件事:一是描述性强,能把动态物体的结构和颜色都说清;二是压缩高效,别一整个序列塞进去还像搬家;三是输入友好,别总要求稀有标注或精确对应。
Velox 的做法是:把输入写成一个时空彩色点云集合,也就是下面这个形式。这里的 x 是空间坐标,c 是 RGB 颜色,τ 是时间戳,N 是点的数量。
公式1:输入的时空彩色点云定义
公式1:输入的时空彩色点云定义。意思很朴素:模型不直接吃视频帧,而是吃一堆“带坐标、带颜色、带时间”的点。这样做的好处是,几何和外观天然就被放进同一个容器里了,后面再怎么压缩、查询、解码,都不至于把时间和空间彻底拆散。
更关键的是,Velox 训练时并不依赖时间对应关系,也就是不要求“这个点在 t1 时刻对应 t2 时刻的那个点”先被人工或算法标出来。这个选择很重要,因为现实动态场景里,复杂变形、遮挡、局部消失出现时,找对应关系本身就像在忙乱人群里认亲,难度不小。Velox 直接让模型从整体时空结构里自己学,少了很多人为前置条件。
图4:相关4D表示方法概览
图4:相关 4D 表示方法概览。这个表格的作用很像“同学们请看黑板”,把现有方法按是否建模外观、是否需要对应关系、是否支持通用下游任务等维度摆出来。Velox 的位置很明确:尽量少依赖额外输入,同时把几何和外观一起学进去。

核心揭秘:动态令牌(Dynamic Tokens)+ 双解码器,把时变几何和外观一把抓

Velox 的核心产物叫动态令牌(Dynamic Tokens)。名字听着像某种高端会员卡,其实就是一组紧凑的潜变量,用来概括整个动态物体在时空中的状态。编码器把原始点云压成这些 token,后面的任务只需要围绕 token 做文章,不必再面对原始点云那一大坨“信息海”。论文里给出的压缩比超过 30 倍,这意味着它不是简单存档,而是在认真做“信息瘦身”。
图2:Velox 方法总览
图2:Velox 方法总览。编码器把动态点云和查询点映射成动态令牌;训练时再用两个解码器去“反向验收”这些令牌是否真的学到了东西:一个负责几何,一个负责外观。下游任务里,视频转4D和布料仿真走生成分支,3D 追踪则直接吃动态令牌做时序预测。
先说编码器。Velox 用的是 Perceiver IO 风格的结构。这里的 IO 是 Input-Output,中文可理解为“输入-输出型感知器”。它的好处是能用少量查询点去跨注意力读取大规模输入,再通过窗口化自注意力把局部信息传播到其他查询上,兼顾了表达能力和计算效率。论文还把查询点限制在局部邻域里,让每个 token 先管好自己附近的那片“小地盘”,再逐步汇总成全局理解,避免直接全场撒网导致算力爆炸。
图9:编码器结构图
图9:编码器结构图。它的重点不是“堆得越深越好”,而是“怎么在有限显存里把时空信息读明白”。局部 patch 化、跨注意力、窗口自注意力,这三步连起来,像是先看近景、再串成片、最后形成整体印象。
再说两个解码器。第一个是4D surface decoder,中文可以叫“4D 表面解码器”。它借鉴 flow-matching 的思路,把某个时间点的表面看成一个条件分布:给定 token 和时间 τ,去预测该时刻表面上点的位置分布。这里的 flow-matching 可以粗略理解成“从噪声点往真实表面慢慢推”的过程,最后通过积分得到目标时间的点云。它解决的是几何问题:物体此刻长什么样,表面在哪里,形状怎么随时间变。
图8:4D表面解码器结构图
图8:4D 表面解码器结构图。它接收动态令牌、噪声点、流匹配时间 t 和目标帧时间 τ,然后预测速度场。说人话就是:先把点“拽”向真实表面,再把整张时间切片的几何形状还原出来。
第二个是Gaussian decoder,也就是把 token 映射成三维高斯参数的解码器。三维高斯这里指的是一种可渲染的三维表示,适合恢复外观和视图合成。Velox 没有把整个时间段的高斯一次性全吐出来,那样太吃显存;也没有只学一个静态 canonical 再硬做形变,因为动态场景里物体可能出现、消失、局部重组,canonical 方案容易卡壳。它选择的是“给定时间 τ,直接预测该时刻的高斯”,更灵活,也更贴近动态场景。
公式2:4D表面解码器的流匹配损失
公式2:4D 表面解码器的流匹配损失。v 是模型预测的速度,αtσt 描述噪声到数据的插值过程,ε 是标准高斯噪声。它的本质是:让预测速度尽量接近“把噪声点推回真实表面”所需要的方向。
公式3:高斯解码器的图像重建损失
公式3:高斯解码器的图像重建损失。这里 IGT 是真值图像,Render 表示把预测的高斯渲染成图像。也就是说,外观学得好不好,不看嘴上说,直接看渲染结果像不像。
公式4:总训练目标
公式4:总训练目标。Velox 把几何监督、外观监督和一个简单的正则项加在一起。这个正则项相当于给动态令牌做“收一收、别飘太远”的约束,避免 token 空间过于散乱,训练更稳。
图3:纹理增强示意图
图3:纹理增强示意图。论文发现,原始动态数据的外观太“朴素”了,很多序列颜色单一、纹理低频,模型很容易学成“会看形状,不太会看皮肤”。于是作者给训练序列随机换纹理,相当于给模型做外观扩容,让它别只会认白衣服和灰衣服。

效果炸裂:视频变4D、无纹理3D追踪、布料物理仿真,一个模型全搞定

Velox 不是只在论文里“会说”,它还真拿去做了三类下游任务,而且都挺像样。先看视频转4D。输入是一段单目视频,模型要直接生成一个能从多个视角观察的 4D 对象。这里的关键不是“把输入视角拟合得像”,而是“既要保住输入视角,还要让没见过的视角也别崩”。这事儿难度不小,因为很多方法一到新视角就开始露馅:要么表面浮点乱飞,要么形变一大就塌。
图5:视频转4D结果对比
图5:视频转4D 结果对比。第二行的 GVF 在复杂形变上泛化不稳;第三行的 L4GM 虽然能把输入视角渲染得挺像,但新视角会冒出不少“浮游粒子”;最下面是 Velox,输入视角和新视角都更完整,尤其对复杂结构的恢复更自然。
公式5:视频实验中的视场角设置
公式5:视频实验中的视场角设置。这里的 r 是相机到原点的距离,公式用来配合不同距离下的视角覆盖,避免实验只在“固定机位”里自嗨。换句话说,评价不是挑最容易的角度拍一张,而是让模型在更真实的视角变化下接受检验。
图10:布料仿真任务示意图
图10:布料仿真任务示意图。给一张布料初始图像,模型要补完它后续完整的 4D 轨迹。这个任务特别考验表示能力,因为它不只要知道“布是什么形状”,还要知道“它会怎么下落、折叠、碰撞、反弹”。
图7:布料仿真结果。图中不仅能看到生成序列的整体运动,还能看到质心位置、速度和加速度随时间变化的曲线。它们和参考轨迹非常接近,尤其是在接触地面后出现的回弹行为,说明这个表示不仅“像”,还保留了一些物理规律的影子。
再看 3D 追踪。这里输入的是 RGBD 视频,模型要跟踪第一帧选中的三维点在后续帧中的位置。为了证明动态令牌真的有料,论文没有搞复杂的迭代细化,而是直接训练一个轻量追踪网络,让它从 token 里读出轨迹。这个设计很“直球”:如果 token 里真有时空几何信息,那追踪就应该自然;如果没有,再花里胡哨的后处理也救不回来。
图6:3D追踪结果
图6:3D 追踪结果。上排是真值轨迹,下面是各方法的回投结果。Velox 的轨迹更贴近真实点云,尤其对纹理少、结构简单但深度变化明显的区域更稳。这个现象挺合理,因为它不是只盯着纹理边缘,而是把动态几何和外观一起编码了。
表2:Objaverse上的3D追踪评估结果
表2:Objaverse 上的 3D 追踪评估结果。Velox 在 L2 距离、APD、AJ3D 等指标上都明显优于对比方法,说明动态令牌里确实存进了可用于轨迹预测的结构信息。需要注意的是,论文也坦率指出它在遮挡精度上没有单独建模,所以这块不是满分选手。
如果把三项任务连起来看,就会发现 Velox 的思路不是“为每个任务单独造轮子”,而是先学一个足够通用的 4D 表示,再把不同任务都挂到这个表示上。这样做的好处是,生成、追踪、仿真虽然表面上是三类问题,底层却都在问同一件事:这个动态物体在时空里到底长什么样、怎么变、怎么被高效读取。
表1:重建评估结果
表1:重建评估结果。Velox 在图像指标和视频指标上都优于 GVF 与 LiTo,尤其在 PSNR、LPIPS 和 FVD 上提升明显。更有意思的是,使用训练出来的 voxel decoder,比直接靠采样点生成体素更稳,也更快,说明“别迷信暴力采样”,学一个专门的体素预测器往往更划算。

优缺点并存:强通用性但计算量大,未来可期!

Velox 最值得肯定的地方,是它把“4D 表示”这件事从单一任务里拔了出来,变成了一个可以服务多个下游任务的通用底座。它的几何监督和外观监督不是各说各话,而是互相补位:几何解码器逼着 token 记住表面怎么走,Gaussian 解码器逼着 token 记住外观怎么长,最后得到的表示就不容易偏科。再加上不依赖时间对应,训练和数据构建都更自然,适合更广泛的动态场景。
但它也不是“拿来就能无限开挂”。论文自己也承认,复杂纹理和大位移区域仍会出现轻微闪烁;视频转4D 的纹理质量在高频细节场景下还有提升空间;训练成本也不低,因为当前还没有成熟的大规模 4D 基础模型可以直接拿来初始化。也就是说,Velox 已经把方向跑通了,但离“手机上随便点一下就生成高保真动态世界”还有不小距离。
插图
从工程角度看,这篇工作像是把“动态世界建模”往前推了一步:不再只是单帧重建,也不只是局部跟踪,而是把表示学习、生成、追踪、仿真放进同一个框架里统一处理。未来如果能把解码器做得更省显存、把训练数据规模再扩一扩、再配合更强的预训练初始化,这类 4D 表示很可能会在机器人感知、数字人、交互式内容生成里更有存在感。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“怎么用尽量少、尽量自然的输入,学到一个既能表示动态几何又能表示外观的 4D 潜在表示”。这个表示不仅能重建动态物体,还能迁移到视频转4D、3D 追踪和布料仿真。

Dynamic Tokens 是什么意思?可以把它理解成动态物体的“压缩记忆”。编码器把时空点云压成一组 token,里面既有形状信息,也有颜色与时间变化信息;后续任务只要读取这些 token,就能做重建、生成或追踪。

为什么要两个解码器一起训练?因为几何和外观本来就不是一回事。4D surface decoder 负责“物体在哪里、形状怎么变”,Gaussian decoder 负责“看起来像不像”。两个监督一起上,token 才不容易学偏,既能看也能说,才更像一个合格的 4D 表示。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把动态令牌、4D 表面解码器和三维高斯解码器绑成一个统一的 4D 表示框架,思路完整,且能跨任务迁移,创新点是实打实的。

实验合理度:★★★★☆。重建、视频转4D、3D 追踪、布料仿真四条线都做了,而且对比对象也基本对口;不过部分任务的指标还受数据分布和生成模型容量影响,不能把所有差距都简单归因于表示本身。

学术研究价值:★★★★★。这类“统一表示”工作很有研究价值,因为它不是只解决单点任务,而是在搭建动态三维理解的底座。

稳定性:★★★☆☆。整体比单帧方法稳,但复杂纹理和大位移下仍有闪烁,说明离工业级稳定输出还有距离。

适应性以及泛化能力:★★★★☆。不依赖对应关系,输入也相对容易获取,跨任务表现不错;但对极复杂场景和高频纹理仍有压力。

硬件需求及成本:★★★☆☆。表示压缩得不错,但训练阶段仍然吃算力、吃显存,不是轻量级模型。

复现难度:★★★☆☆。方法链条长,涉及编码、双解码器、生成器和追踪器,多模块联动,复现门槛中等偏上。

产品化成熟度:★★★☆☆。在研究和原型层面已经很能打,但距离大规模实时产品化,还需要更省算力的解码与更稳的生成质量。

可能的问题:模型会学表示,但训练贵、解码贵、复杂纹理仍会闪,说明“统一 4D 表示”这条路通了,离“通吃所有场景”还差最后几步。


主要参考文献

Anagh Malik, Dorian Chan, Xiaoming Zhao, David B. Lindell, Oncel Tuzel, Jen-Hao Rick Chang. Velox: Learning Representations of 4D Geometry and Appearance. arXiv:2605.04527, 2026.
项目主页:https://apple.github.io/ml-velox
原文链接:https://arxiv.org/pdf/2605.04527.pdf
视频转4D演示:https://apple.github.io/ml-velox/assets/tracking_viz/6b3cb0f76a7540f7968e785c68058883_a000_s0000_fskip1.mp4
图像转4D布料仿真演示:https://apple.github.io/ml-velox/assets/tracking_viz/9c918560ee0944ec8337c6516263eed1_a000_s0000_fskip1.mp4
3D追踪演示:https://apple.github.io/ml-velox/assets/tracking_viz/da4105b90c8b4db29739b1f7d49bbaac_a000_s0000_fskip1.mp4

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。