← 返回 PaperDaily 视觉与图像

4B参数搞定视频理解?VideoChat3把算力省下来了

一个模型把细粒度动作、长视频问答和直播流主动响应都装进去了,还只用4B参数。更关键的是,模型、代码、训练策略和数据集全开源,社区终于不用对着“半遮半掩”的视频大模型干瞪眼了。

4B参数搞定视频理解?VideoChat3把算力省下来了
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
一个模型把细粒度动作、长视频问答和直播流主动响应都装进去了,还只用4B参数。更关键的是,模型、代码、训练策略和数据集全开源,社区终于不用对着“半遮半掩”的视频大模型干瞪眼了。


原论文信息如下:
论文标题:
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
发表日期:
2026年07月
发表单位:
Nanjing University, Shanghai AI Laboratory, Nanyang Technological University, Peking University
原文链接:
https://arxiv.org/pdf/2607.14935v1.pdf
开源代码链接:
https://github.com/MCG-NJU/VideoChat3
项目链接:
https://mcg-nju.github.io/VideoChat3
开源数据集链接:
https://huggingface.co/collections/MCG-NJU/videochat3

VideoChat3:全开源高效通用视频多模态大模型,告别碎片化与高算力

一个模型同时吃下细粒度动作、长视频问答、时间定位和直播流主动响应,还只用4B 参数,这事听起来就有点离谱。但 VideoChat3 真把这件事做成了,而且更狠的是,它不是“只放模型不放配方”的半开源,而是把模型权重、训练代码、训练策略和完整数据集一起端了出来。对视频多模态领域来说,这种“全家桶式开源”比单纯刷分更稀缺,因为它直接决定了别人能不能复现、能不能继续做、能不能真正落地。
封面
图1:VideoChat3 在时间感知、长视频理解、时间定位和在线主动响应等任务上都表现强势,说明它不是只会背题的“短视频选手”,而是想做一个真正能上场干活的通才模型。
这篇论文的核心矛盾也很直白:视频理解越往前走,模型就越像在和自己的算力预算打架。视频不是图片,帧与帧之间有时间关系;但如果把每帧都当图片处理,视觉 token 会瞬间爆炸,长视频和流式场景更是直接把上下文窗口塞满。VideoChat3 的思路不是硬扛,而是先把视频里的冗余压掉,再把真正有用的信息喂给语言模型。说人话就是:别让大模型对着一堆重复画面发呆,先把视频“瘦身”再说

I3D-ViT:将3D时序建模引入ViT,实现高效视频token压缩

先解释一个基础概念:传统视频多模态模型常把视频拆成若干帧,然后每帧像图片一样送进视觉编码器。问题在于,这种做法很容易把“时间”这件事丢在后面,等视觉 token 送进语言模型时,已经是又长又贵的一串了。VideoChat3 的 I3D-ViT(Inflated 3D Vision Transformer,膨胀式三维视觉 transformer)就是来补这个洞的:它不是把帧孤立处理,而是把连续帧按小片段组起来,在视觉编码阶段就做时空联合建模。
图2:VideoChat3 的 I3D-ViT 架构
图2:VideoChat3 的整体架构。它仍然是经典的“视觉编码器 + projector + 语言模型”路线,但关键变化在于 I3D-ViT 先做视频级压缩,再把更短的视觉序列交给语言模型。默认设置下,时间维度压缩 4 倍,再叠加 2×2 的空间合并,整体就是16× 时空压缩
它的做法可以拆成几步看。第一步是分块,把视频切成最多 T 帧一组的连续片段,默认 T=4。这样做的好处是,邻近帧之间的重复信息不会被浪费掉,而是先在视觉编码器里互相“聊一聊”。第二步是时序位置编码,也就是给每一帧加上时间身份,避免模型把前后帧看混。第三步是时空自注意力,让同一片段内的空间与时间信息一起被建模,而不是先把帧切碎再指望语言模型自己悟出来。最后再做时间池化,把一个片段内的 token 压缩成更少的表示。
这个设计最聪明的地方,是它没有把“压缩”理解成简单粗暴地删帧,而是先让模型在视觉侧学会总结。这样一来,短时动作、细微变化、局部运动这些原本容易在采样时丢掉的信息,能在视觉编码阶段先被消化掉。换句话说,I3D-ViT 干的是“先做压缩,再做理解”,而不是“先砍掉,再祈祷”。
看到这里,比较容易让人点头的地方是:这套压缩不是为了“显得模型更轻”,而是真的在给后面的语言模型减负。长视频场景里,视觉 token 的长度如果不控制,LLM 再强也会被上下文拖死。VideoChat3 的路线等于把瓶颈前移,先在编码器里做时空结构建模,再把更紧凑的证据交给语言模型处理。

自适应帧分辨率:像人一样,只在关键时刻“看高清”

如果说 I3D-ViT 解决的是“视频太长,token 太多”,那自适应帧分辨率解决的就是“流式场景下,什么时候该多看一点”。这部分特别像人类看直播:平时随便扫一眼,真到球快进门、人物突然动作异常、字幕里出现关键信息的时候,眼睛才会自动切到高清模式。论文把这个直觉做成了一个状态控制闭环。
图3:自适应帧分辨率策略示意图
图3:自适应帧分辨率策略示意图。模型通过状态 token 决定下一段流式窗口是低分辨率还是高分辨率输入,Routine 情况下低成本监看,遇到潜在证据时进入 Standby 提高像素预算,确认后再切回 Response。
这里的三个状态要先讲清楚。Silence 表示当前窗口没有足够证据,模型继续观察,不急着开口;Standby 表示模型已经嗅到一点“有戏”,但证据还不够完整,于是下一段视频会用更高分辨率来检查细节;Response 则表示证据已经够了,模型开始正式回答。这个设计的妙处在于,状态 token 不只是“要不要说话”的信号,还是下一帧看多细的控制信号。
这就让流式理解不再是“每一帧都高配硬看”,而变成了“默认省着看,必要时再放大”。从工程角度看,这种策略特别实用,因为它直接对应推理成本:低分辨率窗口负责常规监测,高分辨率窗口只留给真正可能有答案的时刻。论文还给出了状态转移监督掩码的设计,用来训练模型在状态切换点和状态保持点上都学会正确决策。
图9:流式训练中的状态转移监督掩码
图9:流式训练中的状态转移监督掩码。蓝色位置是保留损失的状态 token,其中转移点最关键,因为它定义了什么时候该从观察切到响应;保持点则补充监督,避免模型只会“突然开口”,不会“持续观察”。

三阶段数据合成流水线:通用、长视频、流式全覆盖

视频大模型最容易翻车的地方,不是结构,而是数据。因为视频理解不是单一任务:有的要看短动作,有的要跨分钟找证据,有的要边看边等、边等边答。VideoChat3 的数据策略很清楚:通用短视频数据打底,长视频数据补时间跨度,流式数据补主动响应。三条线一起上,模型才不会只会一种视频。
图5:从简短答案增强到证据驱动回答的示例
图5:注释增强示例。原本只有简短答案的样本,被改写成带有时间线索和视觉证据的自然语言回答,监督密度明显更高,但语义仍然受原始标签约束。
第一阶段是 VideoChat3-Academic2M。它汇聚了多个公开视频学术数据源,总量达到 2.27M 条,特点是来源可靠、任务类型多,但很多原始标注太“短平快”,比如只给一个选项字母或一句很短的答案。论文没有机械照搬这些标签,而是用更强的多模态模型把它们改写成更完整的、带证据解释的回答,同时再用一个判别器检查改写是否与原始标签一致。这样做的本质是:把稀疏监督变成密集监督,但不让模型借题发挥
图7:长视频数据合成流水线
图7:长视频数据合成流水线。它不是直接拿整段长视频硬标,而是先筛选、再切段、再逐段注释、再质检,最后把通过审核的片段拼成完整监督。这样做像是在建立一份“证据账本”,而不是让模型直接面对一锅大乱炖。
第二阶段是 VideoChat3-LV116K,专门补长视频。长视频和短视频不是长度关系,而是难度关系:证据更稀疏,事件更分散,答案往往要跨多个时间段才能拼出来。论文先用场景切分工具把长视频拆成相对连贯的片段,再对每个片段做带时间戳的描述,最后把这些描述拼成可以用于长视频问答、时间线生成、时间定位等任务的训练样本。这里最有价值的不是“样本更多”,而是“监督更像长视频该有的样子”。
图8:流式数据的来源组成与时间覆盖
图8:VideoChat3-OL617K 的来源组成与时间覆盖。不同流式数据子集的时间跨度差异很大,既有短时窗口,也有长时上下文,这正好支持模型学习“什么时候该等、什么时候该答”。
第三阶段是 VideoChat3-OL617K,专门补流式主动响应。这里的关键不再是“看完再答”,而是“证据出现时再答”。论文先从视频问答对里找出关键信息出现的时间点,再构造带状态 token 的因果训练序列,让模型学会在 Silence、Standby、Response 之间切换。换句话说,模型不只是学会回答问题,还要学会在对的时机开口,这对直播、监控、在线助手类场景都更接近真实需求。
表1:VideoChat3 各训练阶段的详细配置
表1:VideoChat3 各训练阶段的详细配置。它展示了模型如何按阶段推进训练课程,先打基础,再补长视频,再补流式能力,整体是典型的课程式训练思路。

全面超越同量级开源模型,效率提升显著

实验部分最值得看的,不是某一个单点指标,而是 VideoChat3 在通用视频、长视频、流式视频三类任务上都能保持比较均衡的表现。很多视频模型的问题在于:短视频刷得不错,长视频一塌糊涂;或者离线问答还行,一到实时流式就露馅。VideoChat3 的结果说明,这套“先压缩、再分层训练、再做自适应分辨率”的组合拳是能打通多个场景的。
表4:NVIDIA H200 上的推理成本比较
表4:NVIDIA H200 上的推理成本比较。它直接说明 VideoChat3 不只是“分数不错”,还在吞吐和速度上更友好,至少不是那种一上生产就把显卡烤成铁板烧的方案。
从图1能看出,它在时间感知、长视频理解、时间定位和在线主动响应上都覆盖到了;而表4则补了工程侧最关键的一刀:效率不是附赠品,而是方法设计的一部分。这点很重要,因为很多论文只会说“效果更好”,但一落到部署,视觉 token 数量、显存占用、推理延迟立刻把梦打碎。VideoChat3 把压缩和动态分辨率前置,本质上就是在为实际部署铺路。
表5:MoonViT 与 I3D-ViT 的对比
表5:MoonViT 与 I3D-ViT 的对比。这里主要说明 I3D-ViT 不是单纯把视频 token 压缩得更狠,而是在多个视频基准上保持了更好的平衡,属于“既省又不太掉点”的那一类设计。
表3:在线流式视频基准结果
表3:在线流式视频基准结果。这里能看出主动响应能力不是靠“猜得快”凑出来的,而是靠状态控制和流式监督真正学出来的。
定性结果也挺说明问题。图10 里模型能把撑杆跳的完整过程讲清楚,不是只认出“有人在跳”;图11 里它能从长视频里找出一个很具体的细节;图12 里它能按时间顺序组织事件;图13 里它能把语言描述准确定位到视频片段;图14 则展示了主动响应的节奏控制——没证据时安静,有证据时开口。说白了,这些图共同证明了一件事:VideoChat3 不只是“会看”,而是开始像一个有节奏感的视频助手了。
图10:细粒度视频描述示例
图10:细粒度视频描述示例。模型能把动作过程拆成多个连续阶段,说明它不是只抓结果,而是能理解动作演化。
图11:长视频问答示例
图11:长视频问答示例。模型能从扩展上下文中检索到具体视觉细节,说明长程证据聚合确实起作用了。
图12:时间推理示例
图12:时间推理示例。模型能够把分散在视频中的事件按时间顺序组织起来,说明它不只是识别内容,还在做时序推理。
图13:时间定位示例
图13:时间定位示例。给定语言描述后,模型能较准确地找出对应事件的时间区间,边界偏差不大。
图14:在线主动响应示例
图14:在线主动响应示例。模型在证据不足时保持静默,在关键信息出现后及时响应,这才是流式场景真正想要的行为。
图15:密集视频描述示例
图15:密集视频描述示例。模型能识别多个事件并生成时间连贯的描述,说明它对长视频的事件结构有比较稳定的把握。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决三件事:视频理解太吃算力、现有开源模型泛化不够、训练和数据不够透明。VideoChat3 用 I3D-ViT 降 token 成本,用三阶段数据流水线补齐不同场景监督,再把模型、代码、数据全部开源,目标就是做一个能复现、能扩展、能落地的通用视频多模态底座。

I3D-ViT 和普通 ViT 有什么区别?普通做法更像“每帧单独看”,而 I3D-ViT 先把连续帧按片段组起来,在视觉侧做时空联合建模,再做时间池化。它的本质不是单纯压缩,而是先把局部时序信息整合好,再把更短的视觉序列交给语言模型。

Silence、Standby、Response 分别是什么意思?这是流式主动响应里的三个状态。Silence 表示当前没有足够证据,先继续看;Standby 表示已经看到可能有用的信息,下一窗口要提高分辨率;Response 表示证据够了,可以正式回答。它们既是语言输出状态,也是下一段视频怎么采样的控制信号。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把时空压缩、动态分辨率和三阶段数据合成绑成一个完整系统,这个组合并不土;真正有价值的是它把“视频理解的三个痛点”都对上了号。

实验合理度:★★★★☆

通用、长视频、流式三类基准都做了,而且还有推理成本对比,实验结构比较完整。唯一的现实问题是,数据流水线很重,别人复现时未必能完全拿到同样质量的数据。

学术研究价值:★★★★★

这篇工作的价值不只是刷榜,而是给视频 MLLM 提供了一套能继续扩展的开源底座,尤其在长视频与流式主动响应上,很适合后续继续做系统性研究。

稳定性:★★★☆☆

离线视频任务比较稳,但流式主动响应对状态预测和证据时机比较敏感,真实场景里如果输入分布变化大,效果仍可能波动。

适应性以及泛化能力:★★★★☆

从短视频到长视频再到流式场景都覆盖了,泛化目标很明确。不过它仍然依赖较强的数据构造与训练配方,换领域时可能还需要重新调教。

硬件需求及成本:★★★★☆

相较同量级模型更省,但训练阶段依旧不轻松,尤其是三套数据流水线和长视频处理,对算力与数据工程都有要求。好消息是,推理侧比很多“视觉 token 黑洞”友好得多。

复现难度:★★★☆☆

代码和数据都开源是加分项,但完整复现三阶段数据构造、过滤和训练课程,工程量不会小,属于“给了钥匙,但门后面是大仓库”。

产品化成熟度:★★★☆☆

离线理解和长视频问答已经比较接近可用状态,流式主动响应也有雏形,但要进生产还得补鲁棒性、延迟控制和场景适配。

可能的问题:方法很完整,但依赖重数据合成与多阶段训练,成本不低;流式状态控制的泛化边界也还需要更多真实场景验证。


主要参考文献

[1] VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding. arXiv, 2026.
[2] VideoChat3 项目主页:https://mcg-nju.github.io/VideoChat3
[3] VideoChat3 代码仓库:https://github.com/MCG-NJU/VideoChat3
[4] VideoChat3 数据集集合:https://huggingface.co/collections/MCG-NJU/videochat3

看视频别再一帧一帧硬扛了,VideoChat3把“看得快、看得准、还会等时机再说”这件事做成了开源范本。想继续追视频理解、长上下文、流式交互这条线,欢迎来龙哥读论文星球和群里一起拆。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。