← 返回 PaperDaily 视觉与图像

CVPR 2026最佳论文!Google DeepMind新作D4RT:动态4D重建效率吊打各路大神,2

Google DeepMind把动态4D重建做成了"点单式"服务:一段视频编码一次,任何时间、任何空间位置的3D坐标随查随到。200+FPS位姿估计、18-300倍跟踪提速,CVPR 2026最佳论文的含金量,龙哥带大家一探究竟。

CVPR 2026最佳论文!Google DeepMind新作D4RT:动态4D重建效率吊打各路大神,2
原论文信息如下:
论文标题:
Efficiently Reconstructing Dynamic Scenes One D4RT at a Time
发表日期:
2025年12月(arXiv预印本)
发表单位:
Google DeepMind、伦敦大学学院、牛津大学
原文链接:
https://arxiv.org/abs/2512.08924

动态4D重建的困境:碎片化方法为何低效?

拿到一段视频,想重建出完整的动态三维场景——知道每个像素在每一帧的三维位置、知道它随时间运动的轨迹、还要知道拍摄的相机参数。这听上去像是一个统一的任务,对不对?但在D4RT出现之前,主流做法是:把它拆成好几个子任务,各自训练模型,最后再拼装起来。这种"碎片化"路线有两个典型代表:一类是MegaSaM,把单目深度估计、度量深度估计、运动分割等模块一一拼凑,再通过测试时的额外优化强行统一几何一致性,流程又长又重;另一类是VGGT这样的前馈方法,虽然用一个Vision Transformer(视觉Transformer)骨干提取全局特征,但每种输出——深度、位姿、点云——都要挂一个专门的解码头,框架复杂不说,还建立不了动态场景的跨帧对应关系。SpatialTrackerV2倒是能处理动态,但它是多阶段方法,依赖迭代精化,推理速度感人,而且只能跟踪第一帧能看到的点,重建结果到处是洞。
问题出在哪?出在"解码"的设计哲学上。传统方法要么要求对每一帧做密集解码,算力爆炸;要么为不同任务各搞一套解码器,管理复杂。而场景是动态的,几何和运动高度耦合,却被粗暴拆开处理,自然处处别扭。
D4RT完全是另一套逻辑:一次编码、按需查询、单个解码器通吃所有任务。它把"重建整段视频"这个宏大的问题,重构为"随时可以查询场景中任何一个点在任意时间、任意相机坐标系下的三维位置"。有点像把4D重建做成了"点单式服务"——先一次性编码视频,之后想查哪个点就查哪个点😏。

D4RT核心创新:统一查询机制如何实现高效解码?

D4RT的整体架构是标准的编码器-解码器:视频先被一个全局自注意力编码器压缩成潜在场景表征F,再交给一个轻量级解码器,通过交叉注意力机制"查询"其中的信息。关键在于查询本身怎么设计。
查询被定义为(q) = (u, v, t_src, t_tgt, t_cam)这样一个五元组。其中(u, v)是源图像t_src中的归一化二维坐标,t_tgt是目标时间步,t_cam是相机坐标系参考帧。这个设计的精妙之处在于:三个时间索引(源帧、目标帧、相机参考帧)完全解耦,可以自由取值。每次查询输出对应的三维坐标P。就这么简单,但几乎所有4D任务都能通过调整查询参数来覆盖。
编码器部分沿用Vision Transformer(视觉Transformer)结构,局部逐帧自注意力与全局自注意力交替排列。输入视频被切分成token(词元),并额外嵌入一个宽高比token以支持任意宽高比。全局自注意力让模型能够捕捉跨帧的密集对应关系——这是后续一切解码的基础。
图2:D4RT模型概览——全局自注意力编码器先将输入视频转换为潜在全局场景表征F,再传给轻量级解码器。解码器可以被独立查询任意2D点(u, v)在目标时间步t_tgt、相机坐标系t_cam下的3D位置P,实现空间和时间上任意点的完整解码。查询还包含以(u, v)为中心的局部视频块嵌入,提供额外的空间上下文。
图2:D4RT模型概览——全局自注意力编码器先将输入视频转换为潜在全局场景表征F,再传给轻量级解码器。解码器可以被独立查询任意2D点(u, v)在目标时间步t_tgt、相机坐标系t_cam下的3D位置P,实现空间和时间上任意点的完整解码。查询还包含以(u, v)为中心的局部视频块嵌入,提供额外的空间上下文。
编码器将视频V映射为全局场景表征F:
公式:F = E(V) ∈ R^(N×C),其中E表示编码器,N是token数量,C是特征维度。
公式:F = E(V) ∈ R^(N×C),其中E表示编码器,N是token数量,C是特征维度。解码器则通过交叉注意力从F中按需查询信息:
公式:P = D(q, F) ∈ R^3,其中D表示解码器,q是查询元组,P是预测的三维点位置。
公式:P = D(q, F) ∈ R^3,其中D表示解码器,q是查询元组,P是预测的三维点位置。
解码器是一个8层轻量级交叉注意力Transformer,参数量仅1.44亿。每次查询token由三部分组成:二维坐标(u, v)的傅里叶特征嵌入、三个时间步(t_src、t_tgt、t_cam)的离散时间嵌入、以及以(u, v)为中心的9×9像素局部RGB小图像块嵌入。论文实验发现,这个9×9的局部外观信息非常关键——没了它,深度图的边缘锐利度和细节保持都会明显缩水。
查询之间是完全独立的,这带来了工程上的巨大优势:训练时可以只随机采样2048个查询参与损失计算,推理时则可以根据需要任意选择稠密或稀疏的查询,而且天然可并行。你可能想问:为什么不同查询之间不做self-attention?论文作者做过实验,一旦让查询之间相互交互,性能大幅下降。原因很直白——查询本来就是"独立的、没有先验关系的采样点",硬让它们相互作用只会引入噪声,并不能带来额外上下文。

从点到面:D4RT如何解锁多种4D任务?

Table 1直观展示了D4RT的"接口"哲学:五种任务,同一套解码机制,区别仅仅在于查询参数如何变化。
表1:统一解码——通过查询相应条目的笛卡尔积,可以推断各种几何相关任务。注意,对于内参和外参,为了加快推理,只查询粗粒度(h, w)网格。
表1:统一解码——通过查询相应条目的笛卡尔积,可以推断各种几何相关任务。注意,对于内参和外参,为了加快推理,只查询粗粒度(h, w)网格。
点轨迹(Point Track):固定源点(u, v, t_src),让t_tgt遍历所有视频帧,即可得到某个物理点在整段视频中的三维轨迹。
点云(Point Cloud):固定相机参考帧t_cam,对所有像素和所有时间步查询三维位置,直接在统一的参考坐标系中得到整个视频的点云。
深度图(Depth Map):令t_src = t_tgt = t_cam,查询得到该点在相机坐标系下的三维坐标,取Z通道即为深度值。
相机外参(Extrinsics):在参考帧i和j中各采样一个网格点集,分别解码得到同一批三维点在两个不同相机坐标系下的坐标,然后用Umeyama算法求解两组点之间的刚体变换。这个过程可以表示为:
公式:q_i,k = (u_k, v_k, i, i, i),q_j,k = (u_k, v_k, i, i, j),表示在参考帧i和j中查询同一物理点的不同坐标表示。
公式:q_i,k = (u_k, v_k, i, i, i),q_j,k = (u_k, v_k, i, i, j),表示在参考帧i和j中查询同一物理点的不同坐标表示。两组解码结果描述的是同一批3D点在两个不同参考系中的坐标,只需求解它们之间的刚体变换即可,可通过3×3 SVD分解高效完成。
相机内参(Intrinsics):假设针孔相机模型且主点位于画面中心,从三维坐标反推焦距,取中位数获得稳定估计:
公式:f_x = p_z(u − 0.5) / p_x,f_y = p_z(v − 0.5) / p_y,其中(p_x, p_y, p_z)是解码出的三维点坐标。
公式:f_x = p_z(u − 0.5) / p_x,f_y = p_z(v − 0.5) / p_y,其中(p_x, p_y, p_z)是解码出的三维点坐标。对于存在畸变的相机模型(如鱼眼镜头),还可以在初始估计之上叠加非线性优化步骤来无缝适配。
Table 2对比了D4RT与主流方法的能力矩阵。可以看到,D4RT是唯一同时支持动态对应、灵活参考帧、稀疏解码、全局上下文和单解码器的模型,而其他方法各自都有明显短板。
表2:模型能力对比——同时展示本模型执行的任务及其综合功能和简洁的模型架构。
表2:模型能力对比——同时展示本模型执行的任务及其综合功能和简洁的模型架构。
值得注意的是,为了进一步实现全像素密集跟踪,论文设计了一个利用时空冗余的高效算法:用占据网格(occupancy grid)记录哪些时空像素已经被可见轨迹覆盖,只为未覆盖的点启动新轨迹,由此获得自适应5-15倍的加速。这个策略能派上用场,恰恰得益于解码器的"稀疏且轻量"特性——传统密集解码方法根本无法优雅地支持这种增量式查询。

实验验证:D4RT在各项任务中的表现如何?

论文在4D重建与跟踪、深度估计、点云重建、相机位姿估计等多个任务上进行了系统评估,覆盖了TAPVid-3D、Sintel、ScanNet、KITTI、Bonn、Re10K等多个基准数据集。
先看4D重建与跟踪结果。在TAPVid-3D基准上,D4RT在DriveTrack、ADT、PStudio三个子集上的APD3D指标均大幅领先于St4RTrack、CoTracker3+UniDepthV2、CoTracker3+VGGT、DELTA、SpatialTrackerV2等对比方案。尤其在DriveTrack子集上,D4RT的APD3D比SpatialTrackerV2提升了近50%。在世界坐标系跟踪中,L1误差更是降到0.017,比此前最好成绩还低一个数量级。
表4:4D重建与跟踪——在动态视频上评估3D跟踪能力,分别在局部相机坐标(左)和世界坐标(右)下预测轨迹。本模型相比之前的最先进方法取得了更优性能。
表4:4D重建与跟踪——在动态视频上评估3D跟踪能力,分别在局部相机坐标(左)和世界坐标(右)下预测轨迹。本模型相比之前的最先进方法取得了更优性能。
在3D重建部分,D4RT在Sintel点云重建上的L1距离直接打到0.768,此前最好的π³是1.139,提升超过32%。ScanNet上也以0.028继续领跑。深度估计方面,D4RT在最难的动态场景Sintel上大幅领先,AbsRel(S)从π³的0.241降到0.171;在ScanNet、KITTI、Bonn上与其他SOTA基本持平或小幅领先。
表5:视频深度和点图估计——在四个基准上的定量结果。本模型在深度估计任务上,在仅尺度(S)和尺度+平移(SS)对齐两种设置下均达到顶级性能。
表5:视频深度和点图估计——在四个基准上的定量结果。本模型在深度估计任务上,在仅尺度(S)和尺度+平移(SS)对齐两种设置下均达到顶级性能。
相机位姿估计上,D4RT在Sintel的ATE(绝对平移误差)降到0.065,RPE-T降到0.024,Re10K的Pose AUC@30达到83.5,全面领先。对比之下,VGGT的AUC只有70.2,π³也不过78.7。
表6:相机位姿估计——在静态室内场景(ScanNet、Re10K)和动态室外场景(Sintel)上与最先进方法的对比评估。
表6:相机位姿估计——在静态室内场景(ScanNet、Re10K)和动态室外场景(Sintel)上与最先进方法的对比评估。
效率方面更是直接碾压:Table 3显示,在60 FPS实时目标下,D4RT每帧能产出550条全视频三维点轨迹,SpatialTrackerV2只有29条,DELTA直接是0条。综合来看,D4RT比其他方法快18-300倍。图3则展示了位姿估计速度对比:D4RT达到200+ FPS,比VGGT快9倍,比MegaSaM快100倍,同时精度还更高。
表3:3D跟踪吞吐量——在单个A100 GPU上,测量不同模型在维持给定FPS目标时能产生的全视频3D点轨迹最大数量。对于D4RT,每条轨迹由T个独立查询经解码器处理。D4RT比其他模型快18–300倍。
表3:3D跟踪吞吐量——在单个A100 GPU上,测量不同模型在维持给定FPS目标时能产生的全视频3D点轨迹最大数量。对于D4RT,每条轨迹由T个独立查询经解码器处理。D4RT比其他模型快18–300倍。
图3:位姿精度与速度对比——与近期最先进方法比较位姿精度与吞吐量。位姿精度在Sintel和ScanNet上取ATE/RTE/RPE误差平均后的1 − error值。吞吐量以A100 GPU上的FPS计。D4RT实现200+ FPS位姿估计,比VGGT快9倍,比MegaSaM快100倍,且精度更高。
图3:位姿精度与速度对比——与近期最先进方法比较位姿精度与吞吐量。位姿精度在Sintel和ScanNet上取ATE/RTE/RPE误差平均后的1 − error值。吞吐量以A100 GPU上的FPS计。D4RT实现200+ FPS位姿估计,比VGGT快9倍,比MegaSaM快100倍,且精度更高。
图4的定性对比更直观:MegaSaM把天鹅重建出了残影,π³干脆重建不出花来,SpatialTrackerV2虽然在运动区域有效果,但第一帧被遮挡的像素永远无法补全。D4RT是唯一做到把所有像素(包括动态和遮挡区域)统一重建为完整4D表征的方法。
图4:不同方法重建结果对比——纯重建方法(MegaSaM和π³)只能累积所有像素的点云,在动态场景中存在明显失败情况。例如MegaSaM的重建中天鹅出现重复,π³完全无法重建花朵。SpatialTrackerV2这一最先进的跟踪方法能成功捕捉动态,但其设计只允许跟踪一帧中的点,导致重建出现空洞(天鹅和火车后面)。D4RT是唯一成功重建包含视频所有像素的完整4D场景表示的方法。
图4:不同方法重建结果对比——纯重建方法(MegaSaM和π³)只能累积所有像素的点云,在动态场景中存在明显失败情况。例如MegaSaM的重建中天鹅出现重复,π³完全无法重建花朵。SpatialTrackerV2这一最先进的跟踪方法能成功捕捉动态,但其设计只允许跟踪一帧中的点,导致重建出现空洞(天鹅和火车后面)。D4RT是唯一成功重建包含视频所有像素的完整4D场景表示的方法。
在自然视频上的可视化结果同样稳健,无论在静态场景还是动态场景中,D4RT都能给出准确重建,并在存在运动时额外生成鲁棒的3D点轨迹。
图5:自然视频可视化——D4RT在静态场景(上排)和动态场景(下排)中都展示了准确的重建。在存在运动的情况下,D4RT还生成了鲁棒的3D点轨迹。
图5:自然视频可视化——D4RT在静态场景(上排)和动态场景(下排)中都展示了准确的重建。在存在运动的情况下,D4RT还生成了鲁棒的3D点轨迹。

消融研究:关键设计选择的影响有多大?

消融研究主要回答"为什么D4RT的设计选择是合理"的。首先是最关键的RGB局部补丁:图6的可视化显示,没有RGB补丁输入的模型,深度图的细粒度细节和边界锐利度明显下降。Table 7的定量结果也证实了这一点。
图6:低层细节保留——消融在模型查询中注入局部补丁信息的效果,展示Sintel数据集样例上的深度图。局部RGB补丁有助于保留细粒度细节,产生更锐利的物体边界。表7:局部RGB补丁——使用ViT-L模型,评估解码器有无外观补丁输入对Sintel视频深度和相机位姿估计的影响。
图6:低层细节保留——消融在模型查询中注入局部补丁信息的效果,展示Sintel数据集样例上的深度图。局部RGB补丁有助于保留细粒度细节,产生更锐利的物体边界。表7:局部RGB补丁——使用ViT-L模型,评估解码器有无外观补丁输入对Sintel视频深度和相机位姿估计的影响。
Table 8和Table 9展示了辅助损失和骨干网络规模的影响:辅助损失虽然每一项单独移除的影响不大,但全部加上之后整体效果最好,说明这些损失之间存在互补关系。骨干网络从ViT-B到ViT-g,性能一路提升,符合Scaling Law的预期。
表8:辅助损失——逐一移除辅助损失来评估其对模型性能的影响。在深度和相机位姿估计之间存在轻微权衡,但所有辅助损失整体上都能提升性能。表9:骨干网络规模——检验D4RT性能如何随预训练ViT编码器骨干规模变化,在Sintel上评估视频深度和相机位姿估计。随着骨干网络从ViT-B增大到ViT-g,性能明显提升。
表8:辅助损失——逐一移除辅助损失来评估其对模型性能的影响。在深度和相机位姿估计之间存在轻微权衡,但所有辅助损失整体上都能提升性能。表9:骨干网络规模——检验D4RT性能如何随预训练ViT编码器骨干规模变化,在Sintel上评估视频深度和相机位姿估计。随着骨干网络从ViT-B增大到ViT-g,性能明显提升。
图10对RGB补丁大小做了系统扫描,发现9到12之间最优,过小或过大都会引入噪声或稀释有效信息。
图10:RGB补丁大小消融——图中显示Sintel上深度和位姿估计的平均误差。补丁大小在9到12之间时,两个任务都能获得最佳性能。
图10:RGB补丁大小消融——图中显示Sintel上深度和位姿估计的平均误差。补丁大小在9到12之间时,两个任务都能获得最佳性能。
Table 10讨论了一个非常巧妙的细节:把高分辨率视频中对应的RGB补丁喂给解码器,而不是用编码器降分辨率后的补丁。因为编码器为了控制内存,输入分辨率有限(256×256),但解码器的查询是"事后"的,可以直接从原始高清视频中提取补丁作为额外条件,从而恢复出原本在低分辨率编码中被抹掉的细节。这种"编码器低分辨率 + 解码器高清补丁"的非对称设计,让模型在不增加编码器负担的情况下恢复了子像素级细节。图9的对比清楚显示,高清补丁输入下头发丝、边缘等细节显著更锐利。
表10:查询密度和补丁保真度的定量影响——将高分辨率视频中的RGB补丁输入解码器(配置④)在深度图的边缘锐度(以ε^acc_PDBE衡量)上带来显著提升。
表10:查询密度和补丁保真度的定量影响——将高分辨率视频中的RGB补丁输入解码器(配置④)在深度图的边缘锐度(以ε^acc_PDBE衡量)上带来显著提升。
图9:子像素细节恢复——不同高分辨率配置的可视化对比。配置④保真度最高,能保持锐利边缘并恢复精细细节(如下排的头发),且不增加整体模型的计算成本或内存占用。
图9:子像素细节恢复——不同高分辨率配置的可视化对比。配置④保真度最高,能保持锐利边缘并恢复精细细节(如下排的头发),且不增加整体模型的计算成本或内存占用。
Table 11则验证了模型初始化的重要性:使用VideoMAE预训练权重初始化,相比随机初始化在各项指标上都有大幅提升。
表11:模型初始化——使用VideoMAE权重初始化模型带来了显著的性能提升。
表11:模型初始化——使用VideoMAE权重初始化模型带来了显著的性能提升。

未来展望:D4RT对4D感知领域的启示

严格来说,D4RT不只是刷了一波SOTA,更重要的是它证明了"统一查询式解码"可以成为4D感知的一种新范式。它把多个子任务收敛到同一个极简接口上,让训练流程、推理流程、任务扩展逻辑都得到了极大简化。
对行业来说,这种思路可能带来几个重要启发:动态场景理解不再需要复杂的pipeline拼装;查询式设计天然适合大规模并行和流式处理;统一架构意味着未来可以更顺畅地往更大的模型、更多样化的数据上扩展。
当然,D4RT也存在自己的边界和挑战:目前训练数据依赖合成数据和真实数据的混合,域迁移问题仍然存在;编码器对视频长度的容忍度有限;一些动态场景中的极端遮挡、非刚性形变等仍然可能出现误差累积。但论文展示的方向是清晰的:把动态场景重建从"分而治之的拼图游戏"推向"一次编码、按需查询的统一服务"。对计算机视觉来说,这也许才是通向通用动态场景理解的正确姿势。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?D4RT是Google DeepMind提出的统一前馈模型,用单一Transformer架构同时推断深度、时空对应关系和相机参数,通过新颖的查询机制实现按需解码,在4D重建与跟踪任务上刷新SOTA,推理速度比MegaSaM快100
这篇工作最值得看的点是什么?D4RT在4D重建和跟踪任务上全面超越现有方法,在深度估计、点云重建、相机姿态估计和3D点跟踪等多个任务上均取得最优或接近最优的结果,同时推理速度显著快于对比方法。
这篇工作的边界或风险在哪里?优点:统一架构,单一解码器支持多种任务;查询机制灵活高效,支持稀疏和密集解码;推理速度快,可扩展性强。缺点:依赖大规模训练数据;对长视频处理需要分段对齐;相机内参估计假设针孔模型,对畸变镜头需额外处理。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出D4RT,一种基于统一transformer架构的前馈模型,通过新颖的查询机制联合推断深度、时空对应关系和完整相机参数,实现高效动态4D场景重建。

实验合理度:★★★★☆

APD3D, OA, AJ, AbsRel, ATE, RPE-T, RPE-R, Pose AUC, L1距离

学术研究价值:★★★★☆

提出D4RT,一种基于统一transformer架构的前馈模型,通过新颖的查询机制联合推断深度、时空对应关系和完整相机参数,实现高效动态4D场景重建;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

编码器约1B参数,解码器约144M参数;训练约2天(64个TPU芯片,500k步);推理时姿态估计速度达200+ FPS。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:依赖大规模训练数据;对长视频处理需要分段对齐;相机内参估计假设针孔模型,对畸变镜头需额外处理。

主要参考文献

[1] Chuhan Zhang, Guillaume Le Moing, Skanda Koppula, et al. Efficiently Reconstructing Dynamic Scenes One D4RT at a Time. arXiv:2512.08924, 2025.
[2] Li, et al. MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos. (论文中引用 [29])
[3] Wang, et al. VGGT: Visual Geometry Grounded Transformer. (论文中引用 [48])
[4] Wang, et al. DUSt3R: Geometric 3D Vision Made Easy. (论文中引用 [51])
[5] Xiao, et al. SpatialTracker V2: Tracking Any 2D Pixels in 3D, Immediately. (论文中引用 [56])

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
动态场景重建太烧算力?D4RT一次编码、按需查询,点云、深度、相机位姿全搞定,速度还快百倍。想跟龙哥一起追踪这类顶会神作?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 4D重建+上海+Google+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。