研究团队没有从零设计网络,而是直接站在了视频生成大模型的肩膀上。他们采用Stable Video Diffusion (SVD)作为基座模型,把“生成视频”的任务转换成了“生成视频的深度图”的任务。整个模型架构如下图所示:图2:整体架构图。视频经过编码器压缩到潜空间,深度图通过加噪与去噪过程进行条件生成。在此基础上,团队提出了三项关键创新:
团队在NYUv2、KITTI、ETH3D、ScanNet四个零样本数据集上评估。Depth Any Video以绝对优势碾压所有对手。例如在KITTI上,误差(AbsRel)仅7.3,远低于GeoWizard(9.7)和Marigold(9.9),甚至比很多判别式模型还好。表2:在4个零样本基准上的定量对比。在视频深度估计上,它在ScanNet++上空间精度和时间一致性指标TAE均为最优。表3:在ScanNet++上的视频深度对比。速度和效率方面,参数量比ChronoDepth少,推理只需3步,在ScanNet上跑一次仅0.37秒,而DepthCrafter要4.8秒。表4:推理效率对比。
Depth Any Video的成功是“数据+模型”双螺旋驱动的结果。SVD作为视频生成大模型,内部编码了丰富的视频常识,本方法将这些“生成先验”转化为“深度先验”。再加上DA-V海量、多样、高精度的合成数据,泛化能力一飞冲天。消融实验做得非常扎实。下表清晰展示了每个组件的贡献:表5:消融实验。每个创新点都带来了可量化的提升。
[1] Blattmann, A., et al. Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets. 2023.[2] Ke, B., et al. Marigold: Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation. 2024.[3] Fu, X., et al. GeoWizard: Unleashing the Diffusion Priors for 3D Geometry Estimation from a Single Image. 2024.[4] Yang, L., et al. Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data. 2024.