← 返回 PaperDaily 视觉与图像

LAION-BVD开源:1000万小时视频,多模态预训练一次喂饱

当开源视频数据集还在几百万视频级别徘徊时,LAION直接把数字拉到了8000万视频、1000万小时,还一口气验证了视频、音频、图像三种模态的预训练效果。这种级别的数据弹药,对做多模态研究的团队来说,值得好好研究。

LAION-BVD开源:1000万小时视频,多模态预训练一次喂饱
原论文信息如下:
论文标题:
LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
发表日期: 2026年8月
发表单位: University of Tübingen, LAION, JSC FZJ, Wynd Labs, MPI for Intelligent Systems, Technical University of Munich
原文链接: https://arxiv.org/pdf/2608.24845v1.pdf
项目链接: https://projects.laion.ai/bvd/

在开始今天的正文之前,先来看看这个项目的标志——没错,就是那个曾经做出LAION-5B、把Stable Diffusion喂大的LAION社区。这次他们把手伸向了视频,而且一出手就是王炸级别。

10M小时视频数据集LAION-BVD震撼发布,多模态预训练迎来新纪元

LAION-BVD项目标志
说到多模态预训练,就绕不开一个名字:LAION。这个开源的公益研究社区,当初一手推出LAION-5B,用20多亿图文对喂出了Stable Diffusion和OpenCLIP,让全世界个人研究者第一次用上了接近大厂级别的图文数据。不过,LAION心里一直有个遗憾:图像数据早就几十亿规模了,但视频数据呢?最大的开源视频数据集InternVid也就760k小时、700多万视频,和图片数据的规模差了不止一个数量级。
视频不只是静态图片的简单堆叠,它还自带天然对齐的音频信号。如果把视频、音频、文本三个模态一起训练,模型能学到的信息密度是静态图片完全没法比的。问题在于,想要构建这种数据集,光是下载和处理视频的工程量就劝退了绝大多数团队。然而,LAION这次真的把这件事干完了,而且干得相当彻底。
图1:LAION-BVD是一个规模空前的开放网页视频数据集,为多模态预训练提供了强大的下游性能支持。左图:与现有视频数据集的规模对比;右图:ViCLIP(视频-文本)与CLAP(音频-文本)在标准基准上的扩展趋势。
LAION-BVD是一个规模空前的开放网页视频数据集,为多模态预训练提供了强大的下游性能支持。左图:与现有视频数据集的规模对比;右图:ViCLIP(视频-文本)与CLAP(音频-文本)在标准基准上的扩展趋势。
先看一组数字:从CommonCrawl中提取出13亿条平台视频URL,实际尝试下载1.3亿个视频,最终成功得到8000万个视频,总时长达到1000万小时。这是什么概念?相当于人类连续看1140多年。这就是LAION-BVD(LAION大视频数据集,Big Video Dataset)的体量。
为什么视频数据集这么难做?图片爬虫一天能抓几百万张图,但视频不一样。视频文件体积大、下载慢,YouTube等平台还有各种访问限制和反爬机制。存储和带宽成本是一方面,后续还需要做场景切分、字幕生成、质量过滤,每一步都是烧钱的活。此前开源视频数据集的规模之所以一直上不去,核心瓶颈就在这里。
表1:LAION-BVD与公开开放式视频-文本数据集的对比。LAION-BVD行展示了完整发布语料库的规模;当前ViCLIP和CLAP实验使用来自LAION-BVD约240万视频的55M片段重标注子集。
LAION-BVD与公开开放式视频-文本数据集的对比。LAION-BVD行展示了完整发布语料库的规模;当前ViCLIP和CLAP实验使用来自LAION-BVD约240万视频的55M片段重标注子集。
从表1可以看到,此前最大的开源视频数据集是InternVid,时长约760k小时,而LAION-BVD直接把数字拉到10M小时,是它的十倍以上。像OpenVid-1M、Panda-70M这些数据集,在时长维度上直接被碾压。这意味着学术界终于有了一个能与商业闭源数据规模掰手腕的视频级资源。

从CommonCrawl到千万小时视频:LAION-BVD的数据整理之道

这套数据管道到底是怎么搭建的?先看整体流程。LAION延续了LAION-5B时代的经验,继续从CommonCrawl(一个开放的网络爬虫语料库)取数据。具体来说,用的是CommonCrawl的WAT文件(Web Archive Transformation,网页归档转换文件),这种文件里保存了网页的HTTP头和超链接等元数据。然后借助yt-dlp的提取器,把其中的平台专属视频链接筛出来。
图2:LAION-BVD数据整理管道。从CommonCrawl获取数据,过滤平台专属视频URL,得到13亿高质量视频候选。通过分布式基础设施成功下载1000万小时视频,并创建BVD-*子集。
图2:LAION-BVD数据整理管道。从CommonCrawl获取数据,过滤平台专属视频URL,得到13亿高质量视频候选。通过分布式基础设施成功下载1000万小时视频,并创建BVD-*子集。
LAION-BVD只保留了三个主流平台的视频链接:YouTube、Vimeo和Dailymotion,过滤之后还剩13亿条URL。这些视频链接来源很广,涵盖了各种类型的内容。数据集的构建参考了LAION-5B的方法论,但工程规模完全不同。
下载环节是整个工程最硬核的部分。论文里提到,他们部署了2000台虚拟服务器,用Celery分布式任务队列做调度,再配合住宅代理网络(residential proxy network)绕过平台限制。最终尝试下载1.3亿个视频,链接成功率约60%,拿到8000万个视频,总时长1000万小时。
拿到原始视频之后,还要做模态专属的加工。对于视频-文本和音频-文本训练,他们随机采样了240万个视频,先用PySceneDetect做内容感知的场景检测,把视频切成场景级片段,再通过运动估计把静态片段丢掉。视频字幕用Qwen3-VL-2B-Instruct生成,采样最多32帧,限制在20个词以内;音频字幕用Audio Flamingo 3生成,限制在10个词以内。对于图像-文本训练,则用ffmpeg的场景检测提取关键帧,再过滤掉黑帧,最后得到约3亿个场景变化帧。
图3:LAION-BVD数据集统计信息。上排:视频来自YouTube、Vimeo和Dailymotion,覆盖多样的主题。英语占比最高,但近一半视频使用其他语言。下排:视频平均时长7.7分钟,覆盖近二十年的上传时间。
图3:LAION-BVD数据集统计信息。上排:视频来自YouTube、Vimeo和Dailymotion,覆盖多样的主题。英语占比最高,但近一半视频使用其他语言。下排:视频平均时长7.7分钟,覆盖近二十年的上传时间。
从图3可以看到,94%的视频来自YouTube,Vimeo和Dailymotion各占4%和2%。内容主题方面,Vlog占20%,音乐占17%,其他类别分布很广。语言分布上,英语占近60%,剩下的40%覆盖了多种语言。整体来看,这是一个相当多语言、多主题的大规模视频池。

三模态验证:视频、音频、图像帧全面开花

构建数据集的最终目的是服务预训练。LAION-BVD没有像很多数据集论文那样只给资源不验证,而是实打实地训练了三种模态的模型:用ViCLIP(Video CLIP,视频-文本对比学习模型)验证视频-文本对齐能力,用CLAP(Contrastive Language-Audio Pretraining,对比语言-音频预训练)验证音频-文本对齐能力,用CLIP(Contrastive Language-Image Pretraining,对比语言-图像预训练)验证图像-文本对齐能力。这三个模型分别对应三种模态,用同一份视频数据源,完成了全链路验证。
图4:LAION-BVD语料库中提取的5500万片段概览。上排:从5500万提取片段中采样的示例片段及其对应的视频和音频字幕。下排:视频(BVD-V-*)和音频(BVD-A-*)模态的片段与字幕长度分布。
图4:LAION-BVD语料库中提取的5500万片段概览。上排:从5500万提取片段中采样的示例片段及其对应的视频和音频字幕。下排:视频(BVD-V-*)和音频(BVD-A-*)模态的片段与字幕长度分布。
实验设置上,视频和音频使用从240万视频中提取的5500万片段(BVD-V-55M / BVD-A-55M),图像使用3亿帧(BVD-I-300M)。为了保证与已有工作的可比性,ViCLIP沿用InternVid的训练配置,CLAP沿用LAION-CLAP的配置,CLIP则基于OpenCLIP框架训练。整体实验设计的核心信息,汇总如下:
*表格超出部分左右可以滑动 Table 1: LAION-BVD compared to public open-ended video-text datasets. The LAION-BVD row contextualizes the full released corpus scale; our current ViCLIP and CLAP experiments use a recaptioned subset of 55M clips from roughly 2.4M videos from LAION-BVD.
Table 1: LAION-BVD compared to public open-ended video-text datasets. The LAION-BVD row contextualizes the full released corpus scale; our current ViCLIP and CLAP experiments use a recaptioned subset of 55M clips from roughly 2.4M videos from LAION-BVD.

与InternVid正面交锋:ViCLIP性能全面超越

视频验证部分选择ViCLIP不是偶然。InternVid数据集开源后,ViCLIP已经成为视频-文本对比学习的事实标准模型之一。LAION-BVD直接拿ViCLIP做基准测试,等于和InternVid站在同一赛道上正面PK。评估任务覆盖两个方向:三个动作识别数据集Kinetics-400(K400)、UCF-101、HMDB51,以及两个视频-文本检索数据集MSR-VTT和MSVD。
表4:L-14规模下LAION-BVD数据在分类与检索任务上的表现。基于LAION-BVD训练的ViCLIP在整体平均指标上超越InternVid训练的ViCLIP以及仅使用图像训练的CLIP基线。性能随训练数据量和数据集规模持续提升,BVD-V-50M取得最佳平均成绩。
表4:L-14规模下LAION-BVD数据在分类与检索任务上的表现。基于LAION-BVD训练的ViCLIP在整体平均指标上超越InternVid训练的ViCLIP以及仅使用图像训练的CLIP基线。性能随训练数据量和数据集规模持续提升,BVD-V-50M取得最佳平均成绩。
从表4可以看到几个关键结论。第一,LAION-BVD训练的ViCLIP全面超过了InternVid训练的同规模模型。在整体平均指标上,BVD-V-10M在5000万样本下的平均得分比InternVid-10M-FLT(过滤版)高约3.4个百分点,BVD-V-50M则高出约4.0个百分点。第二,仅用1000万样本的BVD-V-10M,平均表现已经超过了使用5000万样本的InternVid-50M,说明数据质量并不差。第三,数据规模增加时性能持续提升,BVD-V-50M在5000万样本下达到最佳平均62.0。
表5:ViCLIP在LAION-BVD上的扩展行为。结果表明在增大模型规模和训练样本量时,性能呈现一致的提升趋势。
表5:ViCLIP在LAION-BVD上的扩展行为。结果表明在增大模型规模和训练样本量时,性能呈现一致的提升趋势。
表5进一步展示了清晰的缩放规律:从ViT-B/32到ViT-B/16再到ViT-L/14,模型越大效果越好;训练数据从1000万样本增加到5000万样本,性能也稳步上升。这种单调增长趋势说明LAION-BVD的数据质量和数量都能支撑更大规模的预训练。
表6:结合WiSE-FT权重合并后,LAION-BVD数据训练的ViCLIP L-14进一步提升。WiSE-FT权重空间集成(Weight Space Ensembling for Fine-Tuning)进一步提升了模型性能。
表6:结合WiSE-FT权重合并后,LAION-BVD数据训练的ViCLIP L-14进一步提升。WiSE-FT(Weight Space Ensembling for Fine-Tuning,权重空间集成微调)通过合并预训练和微调后的权重来提升模型鲁棒性与精度。
论文还额外做了数据污染检查。他们统计了BVD-V-55M与K400、MSR-VTT、MSVD评估集的YouTube视频ID重叠情况,发现重叠比例非常低,而且去除重叠样本后检索性能几乎没有变化。这个检查怎么说呢?确实很良心,避免了很多数据集论文被质疑“测试集混进训练集”的尴尬。
621df26778f05KkH.gif

音频与图像验证:CLAP与CLIP的亮眼表现

视频验证通过之后,再看音频模态。音频-文本数据集普遍更小,像LAION-Audio-630K这种代表性数据集,也只有63万对音频-文本数据。LAION-BVD天然包含了和视频同步的音频轨道,等于白送了一批大规模的音频-文本训练数据。
表2:LAION-BVD与代表性公开音频-文本数据集的对比。带字幕的LAION-BVD行对应实验使用的约240万视频的55M片段,全部行对应完整发布的语料库规模。
表2:LAION-BVD与代表性公开音频-文本数据集的对比。带字幕的LAION-BVD行对应实验使用的约240万视频的55M片段,全部行对应完整发布的语料库规模。
表7:纯训练数据源下CLAP模型的平均零样本音频性能(3000万样本)。大规规模LAION-BVD音频单独使用即可匹配或超越LAION-Audio(LA),但加入AudioSet精选音频数据(LA+AS)后结果最强。
表7:纯训练数据源下CLAP模型的平均零样本音频性能(3000万样本)。大规模LAION-BVD音频单独使用即可匹配或超越LAION-Audio(LA),但加入AudioSet精选音频数据(LA+AS)后结果最强。
从表7可以看到一个有意思的结论:纯用LAION-BVD音频训练的CLAP,在多个模型规模上已经能和专门收集的LAION-Audio数据打平甚至反超。当然,如果混合了AudioSet(音频事件分类数据集)这种人工标注的精选数据,效果仍然是最强的。这说明LAION-BVD的音频数据在质量和分布上都相当能打。
表9:纯BVD-A-10M数据下CLAP训练的扩展行为。更多的音频-文本训练样本在较大模型规模下带来明显收益,431M模型在1.1亿样本下达到最强平均48.7。
表9:纯BVD-A-10M数据下CLAP训练的扩展行为。更多的音频-文本训练样本在较大模型规模下带来明显收益,431M模型在1.1亿样本下达到最强平均48.7。
音频验证是视频数据的“副产品红利”,图像部分则更像一次大胆的实验。LAION-BVD把视频中场景切换的帧提取出来,配上DeepSeek-VL2-tiny生成的描述,得到BVD-I-300M。这些帧不是网页图片,不会和现有图文数据集分布重复,可以用来补充图像预训练的数据多样性。
表3:LAION-BVD与公开图像-文本数据集的对比。由于图像是从视频帧中采样,与网络爬取的图像页面不同,可补充现有数据集。
表3:LAION-BVD与公开图像-文本数据集的对比。由于图像是从视频帧中采样,与网络爬取的图像页面不同,可补充现有数据集。
表10:CLIP在不同数据集和规模下的图像-文本训练效果。LAION-BVD在COCO检索任务上取得最佳结果,而网页图像数据集在ImageNet风格分类上更强。
表10:CLIP在不同数据集和规模下的图像-文本训练效果。LAION-BVD在COCO检索任务上取得最佳结果,而网页图像数据集在ImageNet风格分类上更强。
从表10可以看到,用BVD-I-300M训练的CLIP在MS-COCO图像检索上表现最强,但在ImageNet-1K零样本分类上明显弱于网页图文数据。为什么会这样?论文做了一项非常细致的分布分析:计算了BVD-I-300M与Re-LAION-5B之间的FID(Fréchet Inception Distance,弗雷歇初始距离)值,发现两者差异高达33.92,而Re-LAION自身两次独立采样之间的FID只有0.16。这说明视频帧和网页图片的视觉分布确实很不一样。
图5(a):ImageNet-1K零样本分类错误率对比。
图5(a):ImageNet-1K零样本分类错误率对比。
图5(b):MS-COCO图像检索R@5错误率。图5:LAION-BVD、Re-LAION和DataComp-1B的图像-文本缩放趋势。LAION-BVD在检索任务上缩放效果尤其好,而ImageNet零样本分类性能弱于网页alt-text基线。
图5(b):MS-COCO图像检索R@5错误率。图5:LAION-BVD、Re-LAION和DataComp-1B的图像-文本缩放趋势。LAION-BVD在检索任务上缩放效果尤其好,而ImageNet零样本分类性能弱于网页alt-text基线。
图6:BVD-I-300M合成字幕子集(左)和300M DataComp子集(右)的字幕长度分布。LAION-BVD字幕更长、分布更窄,而DataComp字幕分布更宽、短字幕占主导。
图6:BVD-I-300M合成字幕子集(左)和300M DataComp子集(右)的字幕长度分布。LAION-BVD字幕更长、分布更窄,而DataComp字幕分布更宽、短字幕占主导。
图7:300M DataComp字幕中出现频率最高的前50个ImageNet-1K类别名称。DataComp的真实字幕与IN1K语义类别高度对齐,类别名称共出现1.41亿次。
图7:300M DataComp字幕中出现频率最高的前50个ImageNet-1K类别名称。DataComp的真实字幕与IN1K语义类别高度对齐,类别名称共出现1.41亿次。
图8:300M LAION-BVD合成字幕中出现频率最高的前50个ImageNet-1K类别名称。LAION-BVD字幕中类别名称出现2100万次,远少于DataComp,与ImageNet零样本性能差异一致。
图8:300M LAION-BVD合成字幕中出现频率最高的前50个ImageNet-1K类别名称。LAION-BVD字幕中类别名称出现2100万次,远少于DataComp,与ImageNet零样本性能差异一致。
对比图7和图8就非常直观了:DataComp的真实网页alt-text字幕中,ImageNet类别名称出现了1.41亿次;而LAION-BVD的合成字幕里只有2100万次。ImageNet本身就是一个按网页图片语义分类构建的数据集,LAION-BVD的视频帧分布不在这个语义空间里,分类弱是正常的。但这恰恰说明视频帧带来了网页图片没有的视觉多样性,作为互补数据源价值极高。

开放共享:LAION-BVD如何推动多模态研究民主化

文章写到这里,如果想找缺点,那就是论文本身的方法创新有限;但这不是一篇方法论文,而是一份数据基础设施级别的贡献。LAION社区一贯的作风就是:把数据做出来,然后开源给所有人。
LAION-BVD的发布方式也很务实:视频URL列表和字幕数据会放在HuggingFace上,原始视频数据则通过研究协议向学术机构开放。这意味着全球任何一家大学实验室,只要通过了数据使用条款审核,就有机会拿到8000万视频、1000万小时的多模态数据。放在以前,这种量级的数据基本只存在于大厂内部。
当然,开放不等于没有风险。数据集中视频全部来自第三方平台,平台政策调整可能导致部分URL失效;自动生成的字幕质量参差不齐;版权和隐私问题也需要使用方自行评估。但这些问题不影响LAION-BVD作为多模态研究基础设施的价值。视频预训练的数据弹药,上一次这么大规模的补充,还是LAION-5B发布的时候。这次,LAION把同样的配方用在了视频上,而且一次覆盖了视频、音频、图像三种模态。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?LAION发布全球最大开源视频数据集LAION-BVD,含8000万视频、总时长1000万小时,并生成5500万视频/音频片段及3亿帧图像字幕。
这篇工作最值得看的点是什么?ViCLIP在LAION-BVD上训练优于InternVid训练模型(平均指标提升2.1-4.0个百分点);CLAP在纯BVD-A-10M训练下匹配或超过LAION-Audio;CLIP在BVD-I-300M上取得最强COCO检索性能
这篇工作的边界或风险在哪里?优点:数据集规模空前(10M小时),覆盖视频、音频、图像三种模态,验证实验全面且显示一致的scaling趋势;缺点:caption全部为自动生成且较短,可能引入系统性偏差;未进行联合音视频模型训练;数据过滤较少可能包含偏见内容
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

数据集构建流程本身不是全新范式,但把视频数据集规模推高十倍以上,并同时验证视频、音频、图像三种模态,这种工程层面的系统创新已经足够有分量。

实验合理度:★★★★☆

对比数据集覆盖了主流开源选项,模型规模和训练数据量都做了多组缩放实验,还做了数据污染检查,整体设计相当扎实。不过实验子集只用240万视频中的5500万片段,没有把8000万视频全部跑完,验证的完整性稍有保留。

学术研究价值:★★★★★

这是视频多模态领域的“LAION-5B时刻”。后续视频理解、视频-音频联合建模、跨模态检索等方向的研究,大概率都要拿它当基础数据源。开放规模和完整多模态验证,让这篇论文的引用潜力非常大。

稳定性:★★★☆☆

视频URL会随平台政策变化而失效,自动生成字幕也存在噪声。数据集的原始内容源依赖第三方平台,长期可用性存在不确定性。使用时需要额外设计过滤和容错策略。

适应性以及泛化能力:★★★★☆

视频、音频、图像三种模态都验证通过,多语言覆盖也不错,基本覆盖多模态预训练的主流场景。扣分点在于英语内容占比接近60%,非英语场景的覆盖相对有限。

硬件需求及成本:★★☆☆☆

下载和字幕生成是重型工程,训练ViCLIP、CLAP、CLIP也需要大量GPU资源。这套数据集的门槛主要不在数据本身,而在于后续处理和训练所需的算力与存储,小团队直接全量跑会很吃力。

复现难度:★★★★☆

URL列表、字幕数据和详细超参数都会开源,按论文附录的信息基本可以复现主要实验。但完整复现需要巨大的下载带宽和存储空间,一般实验室只能按子集做部分复现。

产品化成熟度:★★★☆☆

作为训练数据资源,成熟度已经很高;但直接用于商业产品还需要考虑平台使用条款、版权、内容安全和URL失效等问题。用于研究和内部预训练管道则完全可行。

可能的问题:过滤策略非常少,数据质量参差不齐;字幕完全由模型自动生成,存在描述不准确的风险;视频来源集中在YouTube等商业平台,长期可获得性受平台政策影响较大。后续如果能提供更细粒度的过滤子集,并覆盖更多非英语内容,价值会进一步提升。


主要参考文献

[1] Hochlehnert A, Nezhurina M, Cherti M, et al. LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training[J]. arXiv preprint arXiv:2608.24845, 2026.
[2] Schuhmann C, Beaumont R, Vencu R, et al. LAION-5B: An open large-scale dataset for training next generation image-text models[C]. NeurIPS 2022.
[3] Wang Y, He Y, Li Y, et al. InternVid: A large-scale video-text dataset for multimodal understanding and generation[C]. ICLR 2024.
[4] Radford A, Kim J W, Hallacy C, et al. Learning transferable visual models from natural language supervision[C]. ICML 2021.
[5] Wu Y, Chen K, Zhang T, et al. Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation[C]. ICASSP 2023.
[6] Wortsman M, Ilharco G, Gadre S Y, et al. Robust fine-tuning of zero-shot models[C]. CVPR 2022.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球