论文标题:
LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
发表日期: 2026年8月 发表单位: University of Tübingen, LAION, JSC FZJ, Wynd Labs, MPI for Intelligent Systems, Technical University of Munich 原文链接: https://arxiv.org/pdf/2608.24845v1.pdf 项目链接: https://projects.laion.ai/bvd/
说到多模态预训练,就绕不开一个名字:LAION。这个开源的公益研究社区,当初一手推出LAION-5B,用20多亿图文对喂出了Stable Diffusion和OpenCLIP,让全世界个人研究者第一次用上了接近大厂级别的图文数据。不过,LAION心里一直有个遗憾:图像数据早就几十亿规模了,但视频数据呢?最大的开源视频数据集InternVid也就760k小时、700多万视频,和图片数据的规模差了不止一个数量级。视频不只是静态图片的简单堆叠,它还自带天然对齐的音频信号。如果把视频、音频、文本三个模态一起训练,模型能学到的信息密度是静态图片完全没法比的。问题在于,想要构建这种数据集,光是下载和处理视频的工程量就劝退了绝大多数团队。然而,LAION这次真的把这件事干完了,而且干得相当彻底。LAION-BVD是一个规模空前的开放网页视频数据集,为多模态预训练提供了强大的下游性能支持。左图:与现有视频数据集的规模对比;右图:ViCLIP(视频-文本)与CLAP(音频-文本)在标准基准上的扩展趋势。先看一组数字:从CommonCrawl中提取出13亿条平台视频URL,实际尝试下载1.3亿个视频,最终成功得到8000万个视频,总时长达到1000万小时。这是什么概念?相当于人类连续看1140多年。这就是LAION-BVD(LAION大视频数据集,Big Video Dataset)的体量。为什么视频数据集这么难做?图片爬虫一天能抓几百万张图,但视频不一样。视频文件体积大、下载慢,YouTube等平台还有各种访问限制和反爬机制。存储和带宽成本是一方面,后续还需要做场景切分、字幕生成、质量过滤,每一步都是烧钱的活。此前开源视频数据集的规模之所以一直上不去,核心瓶颈就在这里。LAION-BVD与公开开放式视频-文本数据集的对比。LAION-BVD行展示了完整发布语料库的规模;当前ViCLIP和CLAP实验使用来自LAION-BVD约240万视频的55M片段重标注子集。从表1可以看到,此前最大的开源视频数据集是InternVid,时长约760k小时,而LAION-BVD直接把数字拉到10M小时,是它的十倍以上。像OpenVid-1M、Panda-70M这些数据集,在时长维度上直接被碾压。这意味着学术界终于有了一个能与商业闭源数据规模掰手腕的视频级资源。
*表格超出部分左右可以滑动Table 1: LAION-BVD compared to public open-ended video-text datasets. The LAION-BVD row contextualizes the full released corpus scale; our current ViCLIP and CLAP experiments use a recaptioned subset of 55M clips from roughly 2.4M videos from LAION-BVD.
与InternVid正面交锋:ViCLIP性能全面超越
视频验证部分选择ViCLIP不是偶然。InternVid数据集开源后,ViCLIP已经成为视频-文本对比学习的事实标准模型之一。LAION-BVD直接拿ViCLIP做基准测试,等于和InternVid站在同一赛道上正面PK。评估任务覆盖两个方向:三个动作识别数据集Kinetics-400(K400)、UCF-101、HMDB51,以及两个视频-文本检索数据集MSR-VTT和MSVD。表4:L-14规模下LAION-BVD数据在分类与检索任务上的表现。基于LAION-BVD训练的ViCLIP在整体平均指标上超越InternVid训练的ViCLIP以及仅使用图像训练的CLIP基线。性能随训练数据量和数据集规模持续提升,BVD-V-50M取得最佳平均成绩。从表4可以看到几个关键结论。第一,LAION-BVD训练的ViCLIP全面超过了InternVid训练的同规模模型。在整体平均指标上,BVD-V-10M在5000万样本下的平均得分比InternVid-10M-FLT(过滤版)高约3.4个百分点,BVD-V-50M则高出约4.0个百分点。第二,仅用1000万样本的BVD-V-10M,平均表现已经超过了使用5000万样本的InternVid-50M,说明数据质量并不差。第三,数据规模增加时性能持续提升,BVD-V-50M在5000万样本下达到最佳平均62.0。表5:ViCLIP在LAION-BVD上的扩展行为。结果表明在增大模型规模和训练样本量时,性能呈现一致的提升趋势。表5进一步展示了清晰的缩放规律:从ViT-B/32到ViT-B/16再到ViT-L/14,模型越大效果越好;训练数据从1000万样本增加到5000万样本,性能也稳步上升。这种单调增长趋势说明LAION-BVD的数据质量和数量都能支撑更大规模的预训练。表6:结合WiSE-FT权重合并后,LAION-BVD数据训练的ViCLIP L-14进一步提升。WiSE-FT(Weight Space Ensembling for Fine-Tuning,权重空间集成微调)通过合并预训练和微调后的权重来提升模型鲁棒性与精度。论文还额外做了数据污染检查。他们统计了BVD-V-55M与K400、MSR-VTT、MSVD评估集的YouTube视频ID重叠情况,发现重叠比例非常低,而且去除重叠样本后检索性能几乎没有变化。这个检查怎么说呢?确实很良心,避免了很多数据集论文被质疑“测试集混进训练集”的尴尬。
[1] Hochlehnert A, Nezhurina M, Cherti M, et al. LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training[J]. arXiv preprint arXiv:2608.24845, 2026.[2] Schuhmann C, Beaumont R, Vencu R, et al. LAION-5B: An open large-scale dataset for training next generation image-text models[C]. NeurIPS 2022.[3] Wang Y, He Y, Li Y, et al. InternVid: A large-scale video-text dataset for multimodal understanding and generation[C]. ICLR 2024.[4] Radford A, Kim J W, Hallacy C, et al. Learning transferable visual models from natural language supervision[C]. ICML 2021.[5] Wu Y, Chen K, Zhang T, et al. Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation[C]. ICASSP 2023.[6] Wortsman M, Ilharco G, Gadre S Y, et al. Robust fine-tuning of zero-shot models[C]. CVPR 2022.