← 返回 PaperDaily
视觉与图像
Apple新作Velox:单段视频生成4D世界
这篇 Velox 有点意思:不靠时间对应,不靠复杂输入,只拿动态点云就想把 4D 几何和外观一起学明白。更妙的是,它不止会“记住”4D,还能拿去做视频转4D、3D追踪和布料仿真,算是把潜在表征这张牌打得挺顺。
龙哥读论文
发布于 2026-08-14 09:10:46
阅读 5
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇 Velox 有点意思:不靠时间对应,不靠复杂输入,只拿动态点云就想把 4D 几何和外观一起学明白。更妙的是,它不止会“记住”4D,还能拿去做视频转4D、3D追踪和布料仿真,算是把潜在表征这张牌打得挺顺。
原论文信息如下:
不用相机参数,不用时间对应,4D空间里点云也能学出高逼真动态物体!
4D 这事儿,听起来就像“3D 再加一层时间滤镜”,但真做起来,麻烦得很。物体在动,外观在变,局部还会遮挡、消失、再冒出来;如果只盯着单帧,模型很容易学成“每一帧都认识一点,但连起来全靠猜”。Velox 想做的,就是把这种碎片化理解,压成一个可以反复调用的4D 潜在表示 ,既能记住几何,也能记住外观,还能拿去做生成、追踪和仿真。
这篇论文最有意思的地方在于,它没有把门槛抬到“必须有时间对应、必须有复杂监督、必须先准备好一堆精细几何资产”这种程度,而是尽量把输入压到一个更朴素的形态:非结构化时变点云 。换句话说,只要能拿到多视角 RGBD 视频并反投影成点云,模型就有机会自己把 4D 世界的骨架和皮肤一起学出来。这个思路很像给模型一本“动态物体说明书”,而不是只给它几张照片让它自己脑补整部电影。
从零到一:只用非结构化的时变点云,就能练出一个“啥都会”的4D表示
先把概念捋顺。所谓4D 表示 ,不是玄学,也不是把 3D 再乘一个“时间外挂”,而是要把物体在不同时间点上的几何形状和外观变化,压缩进一个紧凑、可查询、可迁移的潜在空间。理想情况下,这个表示应该同时满足三件事:一是描述性强 ,能把动态物体的结构和颜色都说清;二是压缩高效 ,别一整个序列塞进去还像搬家;三是输入友好 ,别总要求稀有标注或精确对应。
Velox 的做法是:把输入写成一个时空彩色点云集合,也就是下面这个形式。这里的 x 是空间坐标,c 是 RGB 颜色,τ 是时间戳,N 是点的数量。
更关键的是,Velox 训练时并不依赖时间对应关系,也就是不要求“这个点在 t1 时刻对应 t2 时刻的那个点”先被人工或算法标出来。这个选择很重要,因为现实动态场景里,复杂变形、遮挡、局部消失出现时,找对应关系本身就像在忙乱人群里认亲,难度不小。Velox 直接让模型从整体时空结构里自己学,少了很多人为前置条件。
核心揭秘:动态令牌(Dynamic Tokens)+ 双解码器,把时变几何和外观一把抓
Velox 的核心产物叫动态令牌(Dynamic Tokens) 。名字听着像某种高端会员卡,其实就是一组紧凑的潜变量,用来概括整个动态物体在时空中的状态。编码器把原始点云压成这些 token,后面的任务只需要围绕 token 做文章,不必再面对原始点云那一大坨“信息海”。论文里给出的压缩比超过 30 倍,这意味着它不是简单存档,而是在认真做“信息瘦身”。
先说编码器。Velox 用的是 Perceiver IO 风格的结构。这里的 IO 是 Input-Output ,中文可理解为“输入-输出型感知器”。它的好处是能用少量查询点去跨注意力读取大规模输入,再通过窗口化自注意力把局部信息传播到其他查询上,兼顾了表达能力和计算效率。论文还把查询点限制在局部邻域里,让每个 token 先管好自己附近的那片“小地盘”,再逐步汇总成全局理解,避免直接全场撒网导致算力爆炸。
再说两个解码器。第一个是4D surface decoder ,中文可以叫“4D 表面解码器”。它借鉴 flow-matching 的思路,把某个时间点的表面看成一个条件分布:给定 token 和时间 τ,去预测该时刻表面上点的位置分布。这里的 flow-matching 可以粗略理解成“从噪声点往真实表面慢慢推”的过程,最后通过积分得到目标时间的点云。它解决的是几何问题:物体此刻长什么样,表面在哪里,形状怎么随时间变。
第二个是Gaussian decoder ,也就是把 token 映射成三维高斯参数的解码器。三维高斯这里指的是一种可渲染的三维表示,适合恢复外观和视图合成。Velox 没有把整个时间段的高斯一次性全吐出来,那样太吃显存;也没有只学一个静态 canonical 再硬做形变,因为动态场景里物体可能出现、消失、局部重组,canonical 方案容易卡壳。它选择的是“给定时间 τ,直接预测该时刻的高斯”,更灵活,也更贴近动态场景。
效果炸裂:视频变4D、无纹理3D追踪、布料物理仿真,一个模型全搞定
Velox 不是只在论文里“会说”,它还真拿去做了三类下游任务,而且都挺像样。先看视频转4D。输入是一段单目视频,模型要直接生成一个能从多个视角观察的 4D 对象。这里的关键不是“把输入视角拟合得像”,而是“既要保住输入视角,还要让没见过的视角也别崩”。这事儿难度不小,因为很多方法一到新视角就开始露馅:要么表面浮点乱飞,要么形变一大就塌。
图7:布料仿真结果。图中不仅能看到生成序列的整体运动,还能看到质心位置、速度和加速度随时间变化的曲线。它们和参考轨迹非常接近,尤其是在接触地面后出现的回弹行为,说明这个表示不仅“像”,还保留了一些物理规律的影子。
再看 3D 追踪。这里输入的是 RGBD 视频,模型要跟踪第一帧选中的三维点在后续帧中的位置。为了证明动态令牌真的有料,论文没有搞复杂的迭代细化,而是直接训练一个轻量追踪网络,让它从 token 里读出轨迹。这个设计很“直球”:如果 token 里真有时空几何信息,那追踪就应该自然;如果没有,再花里胡哨的后处理也救不回来。
如果把三项任务连起来看,就会发现 Velox 的思路不是“为每个任务单独造轮子”,而是先学一个足够通用的 4D 表示,再把不同任务都挂到这个表示上。这样做的好处是,生成、追踪、仿真虽然表面上是三类问题,底层却都在问同一件事:这个动态物体在时空里到底长什么样、怎么变、怎么被高效读取。
优缺点并存:强通用性但计算量大,未来可期!
Velox 最值得肯定的地方,是它把“4D 表示”这件事从单一任务里拔了出来,变成了一个可以服务多个下游任务的通用底座。它的几何监督和外观监督不是各说各话,而是互相补位:几何解码器逼着 token 记住表面怎么走,Gaussian 解码器逼着 token 记住外观怎么长,最后得到的表示就不容易偏科。再加上不依赖时间对应,训练和数据构建都更自然,适合更广泛的动态场景。
但它也不是“拿来就能无限开挂”。论文自己也承认,复杂纹理和大位移区域仍会出现轻微闪烁;视频转4D 的纹理质量在高频细节场景下还有提升空间;训练成本也不低,因为当前还没有成熟的大规模 4D 基础模型可以直接拿来初始化。也就是说,Velox 已经把方向跑通了,但离“手机上随便点一下就生成高保真动态世界”还有不小距离。
龙迷三问
这篇论文到底解决什么问题? 它解决的是“怎么用尽量少、尽量自然的输入,学到一个既能表示动态几何又能表示外观的 4D 潜在表示”。这个表示不仅能重建动态物体,还能迁移到视频转4D、3D 追踪和布料仿真。
Dynamic Tokens 是什么意思? 可以把它理解成动态物体的“压缩记忆”。编码器把时空点云压成一组 token,里面既有形状信息,也有颜色与时间变化信息;后续任务只要读取这些 token,就能做重建、生成或追踪。
为什么要两个解码器一起训练? 因为几何和外观本来就不是一回事。4D surface decoder 负责“物体在哪里、形状怎么变”,Gaussian decoder 负责“看起来像不像”。两个监督一起上,token 才不容易学偏,既能看也能说,才更像一个合格的 4D 表示。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把动态令牌、4D 表面解码器和三维高斯解码器绑成一个统一的 4D 表示框架,思路完整,且能跨任务迁移,创新点是实打实的。
实验合理度: ★★★★☆。重建、视频转4D、3D 追踪、布料仿真四条线都做了,而且对比对象也基本对口;不过部分任务的指标还受数据分布和生成模型容量影响,不能把所有差距都简单归因于表示本身。
学术研究价值: ★★★★★。这类“统一表示”工作很有研究价值,因为它不是只解决单点任务,而是在搭建动态三维理解的底座。
稳定性: ★★★☆☆。整体比单帧方法稳,但复杂纹理和大位移下仍有闪烁,说明离工业级稳定输出还有距离。
适应性以及泛化能力: ★★★★☆。不依赖对应关系,输入也相对容易获取,跨任务表现不错;但对极复杂场景和高频纹理仍有压力。
硬件需求及成本: ★★★☆☆。表示压缩得不错,但训练阶段仍然吃算力、吃显存,不是轻量级模型。
复现难度: ★★★☆☆。方法链条长,涉及编码、双解码器、生成器和追踪器,多模块联动,复现门槛中等偏上。
产品化成熟度: ★★★☆☆。在研究和原型层面已经很能打,但距离大规模实时产品化,还需要更省算力的解码与更稳的生成质量。
可能的问题: 模型会学表示,但训练贵、解码贵、复杂纹理仍会闪,说明“统一 4D 表示”这条路通了,离“通吃所有场景”还差最后几步。
主要参考文献
Anagh Malik, Dorian Chan, Xiaoming Zhao, David B. Lindell, Oncel Tuzel, Jen-Hao Rick Chang. Velox: Learning Representations of 4D Geometry and Appearance. arXiv:2605.04527, 2026.
项目主页:https://apple.github.io/ml-velox
原文链接:https://arxiv.org/pdf/2605.04527.pdf
视频转4D演示:https://apple.github.io/ml-velox/assets/tracking_viz/6b3cb0f76a7540f7968e785c68058883_a000_s0000_fskip1.mp4
图像转4D布料仿真演示:https://apple.github.io/ml-velox/assets/tracking_viz/9c918560ee0944ec8337c6516263eed1_a000_s0000_fskip1.mp4
3D追踪演示:https://apple.github.io/ml-velox/assets/tracking_viz/da4105b90c8b4db29739b1f7d49bbaac_a000_s0000_fskip1.mp4
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群