← 返回 PaperDaily 视觉与图像

上海AI Lab最新研究:给视频做深度估计,零成本“打游戏”就搞定了?

视频深度估计一直卡在“没数据”上。这篇来自上海AI Lab、浙大和悉大的论文,直接去游戏里“白嫖”了4万段高精度视频深度数据,再把手里的视频生成扩散模型改成深度估计模型,3步去噪就出结果,跑得比谁都快。效果直接起飞,把之前所有生成式深度模型都甩在身后。

上海AI Lab最新研究:给视频做深度估计,零成本“打游戏”就搞定了?
🐉 龙哥读论文知识星球来了!
还在为视频深度数据的标注成本发愁?星球无上限分享「合成数据+扩散模型」等前沿路线解读、代码与资源,每日2分钟速览,省下90%调参读论文时间! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
视频深度估计一直卡在“没数据”上。这篇来自上海AI Lab、浙大和悉大的论文,直接去游戏里“白嫖”了4万段高精度视频深度数据,再把手里的视频生成扩散模型改成深度估计模型,3步去噪就出结果,跑得比谁都快。效果直接起飞,把之前所有生成式深度模型都甩在身后。


原论文信息如下:
论文标题:
Depth Any Video with Scalable Synthetic Data
发表日期:
2024年10月
发表单位:
上海人工智能实验室, 浙江大学, 悉尼大学
原文链接:
https://arxiv.org/pdf/2410.10815
项目链接:
https://depthanyvideo.github.io

视频深度估计的“拦路虎”:数据与一致性

视频深度估计,就是给视频每帧算出每个像素的距离。应用场景很广:自动驾驶、AR/VR、视频后期等。但领域长期被两只“拦路虎”按住。

第一只虎:数据极度匮乏。激光雷达贵、立体匹配算不动、现有数据集场景少。模型泛化能力一塌糊涂。

第二只虎:时间一致性难以保证。单帧独立预测导致深度值忽大忽小,视频里物体像在“呼吸”,闪烁不定。

来自上海AI Lab、浙江大学和悉尼大学的研究团队,直接给出了一个“釜底抽薪”的方案:既然真实数据搞不到,那我自己“造”!

合成数据破局:40,000个高质量视频片段

研究人员直接去现有的3A游戏大作里“白嫖”深度数据。现代游戏引擎内部有深度缓冲区(Depth Buffer),记录了每个像素的Z轴坐标,被直接拿过来当成了最精确的深度真值。
他们构建了名为DA-V的合成数据集。用ReShade插件访问深度缓冲区,OBS录屏同步录制彩色图和深度图。数据来源包括《城市:天际线II》和《侠盗猎车手V》。团队用CLIP模型和初步训练的深度模型自动过滤“脏数据”。
最终耗时两周,10位玩家收集并清洗出了40,000段高质量视频片段,总计600万帧,在视频深度领域是“核弹级别”的。
下表中,DA-V数据集的规模相比之前的合成数据集,完全是碾压式的存在:
表1:合成数据集对比。DA-V在视频数量、总帧数和场景多样性上全面领先。
表1:合成数据集对比。DA-V在室外、室内、动态场景和视频帧数上全面覆盖且数量最多。

模型创新:混合训练+长视频推理

研究团队没有从零设计网络,而是直接站在了视频生成大模型的肩膀上。他们采用Stable Video Diffusion (SVD)作为基座模型,把“生成视频”的任务转换成了“生成视频的深度图”的任务。
整个模型架构如下图所示:
图2:模型整体架构。展示了将视频深度估计建模为条件去噪过程的原理,以及混合时长训练策略中的帧丢弃和视频打包技术。
图2:整体架构图。视频经过编码器压缩到潜空间,深度图通过加噪与去噪过程进行条件生成。
在此基础上,团队提出了三项关键创新:

创新一:用条件流匹配加速推理

团队引入条件流匹配(CFM)技术替代传统去噪调度器。CFM让模型学习从噪声到数据的“直线冲刺”,只需3步去噪就能达到之前25步的效果,推理速度提升6.5倍
CFM的核心公式如下:
公式:φ_t(x) = t x + (1-t)ε, 其中ε是噪声,x是数据,t是插值系数。
公式1:线性插值过程,随着t从0到1,数据从纯噪声变为干净数据。
公式:速度场 v_t(x) = x - ε,表示数据的流动方向。
公式2:对应的速度场,训练目标就是让模型预测出这个速度。

创新二:混合时长训练策略

团队提出混合时长训练策略,包含两个核心技巧:

1. 帧丢弃(Frame Dropout):用旋转位置编码替换固定位置编码,训练时从长视频随机采样少量帧,让模型学会处理不同帧率和长度。

2. 视频打包(Video Packing):将长度相同的视频分到一个批次,对分辨率小、帧数少的视频自动增大批处理量,把显存用到极致。


创新三:长视频推理的深度插值

团队整了一个深度插值网络。先在低分辨率下生成整个视频的“关键帧深度图”,再用插值网络填充中间帧,确保每个窗口内的深度与全局分布一致。
图3:深度插值网络示意图。网络以关键帧和原始视频为条件,预测中间帧的深度。
图3:深度插值网络。它以关键帧为条件生成窗口内的中间帧深度,保证了长视频的时间一致性。

效果惊艳:零样本超越所有生成式模型

定量对比:全面超越,稳坐头把交椅

团队在NYUv2、KITTI、ETH3D、ScanNet四个零样本数据集上评估。Depth Any Video以绝对优势碾压所有对手。例如在KITTI上,误差(AbsRel)仅7.3,远低于GeoWizard(9.7)和Marigold(9.9),甚至比很多判别式模型还好。
表2:零样本单帧深度估计定量对比。Depth Any Video 在所有生成式模型中表现最好,在多个指标上超越了强大的判别式模型。
表2:在4个零样本基准上的定量对比。
在视频深度估计上,它在ScanNet++上空间精度和时间一致性指标TAE均为最优。
表3:ScanNet++视频深度估计对比。在有时间和空间两个维度的评估上全面领先。
表3:在ScanNet++上的视频深度对比。
速度和效率方面,参数量比ChronoDepth少,推理只需3步,在ScanNet上跑一次仅0.37秒,而DepthCrafter要4.8秒。
表4:ScanNet上性能与推理效率对比。Depth Any Video 仅需3步去噪,速度和精度双杀。
表4:推理效率对比。

定性对比:细节满分,一致性吊打对手

单帧效果上,模型能捕捉极细节的物体,如杯子手柄、梯子,对天空和前景区分清晰锐利。
图4:不同数据集上的单目深度估计对比。本方法在细节和边缘处表现更好。
图4:单帧深度估计对比。
视频深度上,时间一致性优势明显。右侧时间切片曲线显示,只有本方法是一条丝滑的直线,时间稳定性拉满。
图5:真实世界视频上的深度估计对比。本方法的时间一致性最佳,无明显闪烁。
图5:视频深度对比。右边的时间切片图里,越平整的线代表时间一致性越好。

实验结果分析

Depth Any Video的成功是“数据+模型”双螺旋驱动的结果。SVD作为视频生成大模型,内部编码了丰富的视频常识,本方法将这些“生成先验”转化为“深度先验”。再加上DA-V海量、多样、高精度的合成数据,泛化能力一飞冲天。
消融实验做得非常扎实。下表清晰展示了每个组件的贡献:
表5:各个组件的消融实验。每个组件都对最终性能有显著贡献。
表5:消融实验。每个创新点都带来了可量化的提升。

局限与未来:通向3D感知的下一站

论文作者坦诚指出了目前的局限:模型更倾向于“2.5D”感知,缺乏对场景全局3D几何结构的建模;对部分物体仍存在过拟合风险,游戏世界和真实世界之间存在“领域鸿沟”。
展望未来,将这种视频深度估计能力与SLAM或NeRF等技术结合,将是通向真正3D感知的下一步。代码和模型权重都已开源。

龙迷三问

这篇论文解决什么问题?解决了视频深度估计中数据匮乏和时间不一致两大难题。通过从游戏引擎大规模采集合成数据解决数据瓶颈,利用视频生成扩散模型的先验知识保证时间连贯性。

TAE是什么指标,有什么用?TAE是Temporal Alignment Error(时间对齐误差),衡量视频深度估计中时间一致性的好坏。TAE值越低,相邻帧之间的深度估计越稳定连贯。

条件流匹配和传统的扩散模型有什么不同?传统扩散模型需要很多步去噪。条件流匹配(CFM)学习一个“速度场”,描述从噪声到数据的“最短直线路径”,因此可以用很少步骤(如3步)完成生成,大幅提升推理速度。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★✰✰

创新点在于“用游戏数据白嫖深度真值”的思路,以及将视频生成模型应用到深度估计上的范式,整体创新度不错。

实验合理度:★★★★✰

实验设计规范,零样本评估、多数据集对比、消融实验到位,结果令人信服。

学术研究价值:★★★★✰

为视频深度估计开辟了“合成数据+生成模型”的新路线,具有很高的参考价值。

稳定性:★★★✰✰

主流数据集上表现惊艳,但合成数据可能在对特定真实场景泛化上存在退化。

适应性以及泛化能力:★★★★✰

零样本下跨数据集表现优秀,能同时处理单张图和长短不一的视频。

硬件需求及成本:★★✰✰✰

训练需要32块A100跑一天,成本较高。推理时仅需一块A100且3步出结果。

复现难度:★★★★✰

论文描述详细,代码和模型权重已开源,复现条件友好。

产品化成熟度:★★★✰✰

适用于AR/VR、视频编辑等领域,但对L4自动驾驶等高安全场景还需打磨。

可能的问题:对视频生成模型的先验过于依赖,可能导致学到生成模型中的“幻觉”或偏差。数据仅来自两款游戏,画风相对单一。


主要参考文献

[1] Blattmann, A., et al. Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets. 2023.
[2] Ke, B., et al. Marigold: Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation. 2024.
[3] Fu, X., et al. GeoWizard: Unleashing the Diffusion Priors for 3D Geometry Estimation from a Single Image. 2024.
[4] Yang, L., et al. Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data. 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨~ 想了解更多原文细节的小伙伴,可以点击"阅读原文"查看更多原论文细节哦!

end
既然“打游戏”都能白嫖精准深度数据,为什么不在群里也白嫖点前沿知识呢?😎
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。