← 返回 PaperDaily
视觉与图像
CVPR 2026最佳论文!Google DeepMind新作D4RT:动态4D重建效率吊打各路大神,2
Google DeepMind把动态4D重建做成了"点单式"服务:一段视频编码一次,任何时间、任何空间位置的3D坐标随查随到。200+FPS位姿估计、18-300倍跟踪提速,CVPR 2026最佳论文的含金量,龙哥带大家一探究竟。
龙哥读论文
发布于 2026-08-14 21:47:24
阅读 7
查看原文
原论文信息如下:
动态4D重建的困境:碎片化方法为何低效?
拿到一段视频,想重建出完整的动态三维场景——知道每个像素在每一帧的三维位置、知道它随时间运动的轨迹、还要知道拍摄的相机参数。这听上去像是一个统一的任务,对不对?但在D4RT出现之前,主流做法是:把它拆成好几个子任务,各自训练模型,最后再拼装起来。这种"碎片化"路线有两个典型代表:一类是MegaSaM,把单目深度估计、度量深度估计、运动分割等模块一一拼凑,再通过测试时的额外优化强行统一几何一致性,流程又长又重;另一类是VGGT这样的前馈方法,虽然用一个Vision Transformer(视觉Transformer)骨干提取全局特征,但每种输出——深度、位姿、点云——都要挂一个专门的解码头,框架复杂不说,还建立不了动态场景的跨帧对应关系。SpatialTrackerV2倒是能处理动态,但它是多阶段方法,依赖迭代精化,推理速度感人,而且只能跟踪第一帧能看到的点,重建结果到处是洞。
问题出在哪?出在"解码"的设计哲学上。传统方法要么要求对每一帧做密集解码,算力爆炸;要么为不同任务各搞一套解码器,管理复杂。而场景是动态的,几何和运动高度耦合,却被粗暴拆开处理,自然处处别扭。
D4RT完全是另一套逻辑:一次编码、按需查询、单个解码器通吃所有任务。它把"重建整段视频"这个宏大的问题,重构为"随时可以查询场景中任何一个点在任意时间、任意相机坐标系下的三维位置"。有点像把4D重建做成了"点单式服务"——先一次性编码视频,之后想查哪个点就查哪个点😏。
D4RT的整体架构是标准的编码器-解码器:视频先被一个全局自注意力编码器压缩成潜在场景表征F,再交给一个轻量级解码器,通过交叉注意力机制"查询"其中的信息。关键在于查询本身怎么设计。
查询被定义为(q) = (u, v, t_src, t_tgt, t_cam)这样一个五元组。其中(u, v)是源图像t_src中的归一化二维坐标,t_tgt是目标时间步,t_cam是相机坐标系参考帧。这个设计的精妙之处在于:三个时间索引(源帧、目标帧、相机参考帧)完全解耦,可以自由取值。每次查询输出对应的三维坐标P。就这么简单,但几乎所有4D任务都能通过调整查询参数来覆盖。
编码器部分沿用Vision Transformer(视觉Transformer)结构,局部逐帧自注意力与全局自注意力交替排列。输入视频被切分成token(词元),并额外嵌入一个宽高比token以支持任意宽高比。全局自注意力让模型能够捕捉跨帧的密集对应关系——这是后续一切解码的基础。
解码器是一个8层轻量级交叉注意力Transformer,参数量仅1.44亿。每次查询token由三部分组成:二维坐标(u, v)的傅里叶特征嵌入、三个时间步(t_src、t_tgt、t_cam)的离散时间嵌入、以及以(u, v)为中心的9×9像素局部RGB小图像块嵌入。论文实验发现,这个9×9的局部外观信息非常关键——没了它,深度图的边缘锐利度和细节保持都会明显缩水。
查询之间是完全独立的,这带来了工程上的巨大优势:训练时可以只随机采样2048个查询参与损失计算,推理时则可以根据需要任意选择稠密或稀疏的查询,而且天然可并行。你可能想问:为什么不同查询之间不做self-attention?论文作者做过实验,一旦让查询之间相互交互,性能大幅下降。原因很直白——查询本来就是"独立的、没有先验关系的采样点",硬让它们相互作用只会引入噪声,并不能带来额外上下文。
Table 1直观展示了D4RT的"接口"哲学:五种任务,同一套解码机制,区别仅仅在于查询参数如何变化。
点轨迹(Point Track):固定源点(u, v, t_src),让t_tgt遍历所有视频帧,即可得到某个物理点在整段视频中的三维轨迹。
点云(Point Cloud):固定相机参考帧t_cam,对所有像素和所有时间步查询三维位置,直接在统一的参考坐标系中得到整个视频的点云。
深度图(Depth Map):令t_src = t_tgt = t_cam,查询得到该点在相机坐标系下的三维坐标,取Z通道即为深度值。
相机外参(Extrinsics):在参考帧i和j中各采样一个网格点集,分别解码得到同一批三维点在两个不同相机坐标系下的坐标,然后用Umeyama算法求解两组点之间的刚体变换。这个过程可以表示为:
相机内参(Intrinsics):假设针孔相机模型且主点位于画面中心,从三维坐标反推焦距,取中位数获得稳定估计:
Table 2对比了D4RT与主流方法的能力矩阵。可以看到,D4RT是唯一同时支持动态对应、灵活参考帧、稀疏解码、全局上下文和单解码器的模型,而其他方法各自都有明显短板。
值得注意的是,为了进一步实现全像素密集跟踪,论文设计了一个利用时空冗余的高效算法:用占据网格(occupancy grid)记录哪些时空像素已经被可见轨迹覆盖,只为未覆盖的点启动新轨迹,由此获得自适应5-15倍的加速。这个策略能派上用场,恰恰得益于解码器的"稀疏且轻量"特性——传统密集解码方法根本无法优雅地支持这种增量式查询。
论文在4D重建与跟踪、深度估计、点云重建、相机位姿估计等多个任务上进行了系统评估,覆盖了TAPVid-3D、Sintel、ScanNet、KITTI、Bonn、Re10K等多个基准数据集。
先看4D重建与跟踪结果。在TAPVid-3D基准上,D4RT在DriveTrack、ADT、PStudio三个子集上的APD3D指标均大幅领先于St4RTrack、CoTracker3+UniDepthV2、CoTracker3+VGGT、DELTA、SpatialTrackerV2等对比方案。尤其在DriveTrack子集上,D4RT的APD3D比SpatialTrackerV2提升了近50%。在世界坐标系跟踪中,L1误差更是降到0.017,比此前最好成绩还低一个数量级。
在3D重建部分,D4RT在Sintel点云重建上的L1距离直接打到0.768,此前最好的π³是1.139,提升超过32%。ScanNet上也以0.028继续领跑。深度估计方面,D4RT在最难的动态场景Sintel上大幅领先,AbsRel(S)从π³的0.241降到0.171;在ScanNet、KITTI、Bonn上与其他SOTA基本持平或小幅领先。
相机位姿估计上,D4RT在Sintel的ATE(绝对平移误差)降到0.065,RPE-T降到0.024,Re10K的Pose AUC@30达到83.5,全面领先。对比之下,VGGT的AUC只有70.2,π³也不过78.7。
效率方面更是直接碾压:Table 3显示,在60 FPS实时目标下,D4RT每帧能产出550条全视频三维点轨迹,SpatialTrackerV2只有29条,DELTA直接是0条。综合来看,D4RT比其他方法快18-300倍。图3则展示了位姿估计速度对比:D4RT达到200+ FPS,比VGGT快9倍,比MegaSaM快100倍,同时精度还更高。
图4的定性对比更直观:MegaSaM把天鹅重建出了残影,π³干脆重建不出花来,SpatialTrackerV2虽然在运动区域有效果,但第一帧被遮挡的像素永远无法补全。D4RT是唯一做到把所有像素(包括动态和遮挡区域)统一重建为完整4D表征的方法。
在自然视频上的可视化结果同样稳健,无论在静态场景还是动态场景中,D4RT都能给出准确重建,并在存在运动时额外生成鲁棒的3D点轨迹。
消融研究主要回答"为什么D4RT的设计选择是合理"的。首先是最关键的RGB局部补丁:图6的可视化显示,没有RGB补丁输入的模型,深度图的细粒度细节和边界锐利度明显下降。Table 7的定量结果也证实了这一点。
Table 8和Table 9展示了辅助损失和骨干网络规模的影响:辅助损失虽然每一项单独移除的影响不大,但全部加上之后整体效果最好,说明这些损失之间存在互补关系。骨干网络从ViT-B到ViT-g,性能一路提升,符合Scaling Law的预期。
图10对RGB补丁大小做了系统扫描,发现9到12之间最优,过小或过大都会引入噪声或稀释有效信息。
Table 10讨论了一个非常巧妙的细节:把高分辨率视频中对应的RGB补丁喂给解码器,而不是用编码器降分辨率后的补丁。因为编码器为了控制内存,输入分辨率有限(256×256),但解码器的查询是"事后"的,可以直接从原始高清视频中提取补丁作为额外条件,从而恢复出原本在低分辨率编码中被抹掉的细节。这种"编码器低分辨率 + 解码器高清补丁"的非对称设计,让模型在不增加编码器负担的情况下恢复了子像素级细节。图9的对比清楚显示,高清补丁输入下头发丝、边缘等细节显著更锐利。
Table 11则验证了模型初始化的重要性:使用VideoMAE预训练权重初始化,相比随机初始化在各项指标上都有大幅提升。
严格来说,D4RT不只是刷了一波SOTA,更重要的是它证明了"统一查询式解码"可以成为4D感知的一种新范式。它把多个子任务收敛到同一个极简接口上,让训练流程、推理流程、任务扩展逻辑都得到了极大简化。
对行业来说,这种思路可能带来几个重要启发:动态场景理解不再需要复杂的pipeline拼装;查询式设计天然适合大规模并行和流式处理;统一架构意味着未来可以更顺畅地往更大的模型、更多样化的数据上扩展。
当然,D4RT也存在自己的边界和挑战:目前训练数据依赖合成数据和真实数据的混合,域迁移问题仍然存在;编码器对视频长度的容忍度有限;一些动态场景中的极端遮挡、非刚性形变等仍然可能出现误差累积。但论文展示的方向是清晰的:把动态场景重建从"分而治之的拼图游戏"推向"一次编码、按需查询的统一服务"。对计算机视觉来说,这也许才是通向通用动态场景理解的正确姿势。
龙迷三问
这篇论文到底在解决什么问题? D4RT是Google DeepMind提出的统一前馈模型,用单一Transformer架构同时推断深度、时空对应关系和相机参数,通过新颖的查询机制实现按需解码,在4D重建与跟踪任务上刷新SOTA,推理速度比MegaSaM快100
这篇工作最值得看的点是什么? D4RT在4D重建和跟踪任务上全面超越现有方法,在深度估计、点云重建、相机姿态估计和3D点跟踪等多个任务上均取得最优或接近最优的结果,同时推理速度显著快于对比方法。
这篇工作的边界或风险在哪里? 优点:统一架构,单一解码器支持多种任务;查询机制灵活高效,支持稀疏和密集解码;推理速度快,可扩展性强。缺点:依赖大规模训练数据;对长视频处理需要分段对齐;相机内参估计假设针孔模型,对畸变镜头需额外处理。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出D4RT,一种基于统一transformer架构的前馈模型,通过新颖的查询机制联合推断深度、时空对应关系和完整相机参数,实现高效动态4D场景重建。
实验合理度: ★★★★☆
APD3D, OA, AJ, AbsRel, ATE, RPE-T, RPE-R, Pose AUC, L1距离
学术研究价值: ★★★★☆
提出D4RT,一种基于统一transformer架构的前馈模型,通过新颖的查询机制联合推断深度、时空对应关系和完整相机参数,实现高效动态4D场景重建;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
编码器约1B参数,解码器约144M参数;训练约2天(64个TPU芯片,500k步);推理时姿态估计速度达200+ FPS。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 依赖大规模训练数据;对长视频处理需要分段对齐;相机内参估计假设针孔模型,对畸变镜头需额外处理。
主要参考文献
[1] Chuhan Zhang, Guillaume Le Moing, Skanda Koppula, et al. Efficiently Reconstructing Dynamic Scenes One D4RT at a Time. arXiv:2512.08924, 2025.
[2] Li, et al. MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos. (论文中引用 [29])
[3] Wang, et al. VGGT: Visual Geometry Grounded Transformer. (论文中引用 [48])
[4] Wang, et al. DUSt3R: Geometric 3D Vision Made Easy. (论文中引用 [51])
[5] Xiao, et al. SpatialTracker V2: Tracking Any 2D Pixels in 3D, Immediately. (论文中引用 [56])
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
动态场景重建太烧算力?D4RT一次编码、按需查询,点云、深度、相机位姿全搞定,速度还快百倍。想跟龙哥一起追踪这类顶会神作?
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 4D重建+上海+Google+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群