← 返回 PaperDaily
视觉与图像
4B参数搞定视频理解?VideoChat3把算力省下来了
一个模型把细粒度动作、长视频问答和直播流主动响应都装进去了,还只用4B参数。更关键的是,模型、代码、训练策略和数据集全开源,社区终于不用对着“半遮半掩”的视频大模型干瞪眼了。
龙哥读论文
发布于 2026-08-26 00:20:05
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 一个模型把细粒度动作、长视频问答和直播流主动响应都装进去了,还只用4B参数。更关键的是,模型、代码、训练策略和数据集全开源,社区终于不用对着“半遮半掩”的视频大模型干瞪眼了。
原论文信息如下:
VideoChat3:全开源高效通用视频多模态大模型,告别碎片化与高算力
一个模型同时吃下细粒度动作、长视频问答、时间定位和直播流主动响应,还只用4B 参数 ,这事听起来就有点离谱。但 VideoChat3 真把这件事做成了,而且更狠的是,它不是“只放模型不放配方”的半开源,而是把模型权重、训练代码、训练策略和完整数据集 一起端了出来。对视频多模态领域来说,这种“全家桶式开源”比单纯刷分更稀缺,因为它直接决定了别人能不能复现、能不能继续做、能不能真正落地。
这篇论文的核心矛盾也很直白:视频理解越往前走,模型就越像在和自己的算力预算打架。视频不是图片,帧与帧之间有时间关系;但如果把每帧都当图片处理,视觉 token 会瞬间爆炸,长视频和流式场景更是直接把上下文窗口塞满。VideoChat3 的思路不是硬扛,而是先把视频里的冗余压掉,再把真正有用的信息喂给语言模型。说人话就是:别让大模型对着一堆重复画面发呆,先把视频“瘦身”再说 。
I3D-ViT:将3D时序建模引入ViT,实现高效视频token压缩
先解释一个基础概念:传统视频多模态模型常把视频拆成若干帧,然后每帧像图片一样送进视觉编码器。问题在于,这种做法很容易把“时间”这件事丢在后面,等视觉 token 送进语言模型时,已经是又长又贵的一串了。VideoChat3 的 I3D-ViT(Inflated 3D Vision Transformer,膨胀式三维视觉 transformer )就是来补这个洞的:它不是把帧孤立处理,而是把连续帧按小片段组起来,在视觉编码阶段就做时空联合建模。
它的做法可以拆成几步看。第一步是分块 ,把视频切成最多 T 帧一组的连续片段,默认 T=4。这样做的好处是,邻近帧之间的重复信息不会被浪费掉,而是先在视觉编码器里互相“聊一聊”。第二步是时序位置编码 ,也就是给每一帧加上时间身份,避免模型把前后帧看混。第三步是时空自注意力 ,让同一片段内的空间与时间信息一起被建模,而不是先把帧切碎再指望语言模型自己悟出来。最后再做时间池化 ,把一个片段内的 token 压缩成更少的表示。
这个设计最聪明的地方,是它没有把“压缩”理解成简单粗暴地删帧,而是先让模型在视觉侧学会总结。这样一来,短时动作、细微变化、局部运动这些原本容易在采样时丢掉的信息,能在视觉编码阶段先被消化掉。换句话说,I3D-ViT 干的是“先做压缩,再做理解”,而不是“先砍掉,再祈祷”。
看到这里,比较容易让人点头的地方是:这套压缩不是为了“显得模型更轻”,而是真的在给后面的语言模型减负。长视频场景里,视觉 token 的长度如果不控制,LLM 再强也会被上下文拖死。VideoChat3 的路线等于把瓶颈前移,先在编码器里做时空结构建模,再把更紧凑的证据交给语言模型处理。
自适应帧分辨率:像人一样,只在关键时刻“看高清”
如果说 I3D-ViT 解决的是“视频太长,token 太多”,那自适应帧分辨率解决的就是“流式场景下,什么时候该多看一点”。这部分特别像人类看直播:平时随便扫一眼,真到球快进门、人物突然动作异常、字幕里出现关键信息的时候,眼睛才会自动切到高清模式。论文把这个直觉做成了一个状态控制闭环。
这里的三个状态要先讲清楚。Silence 表示当前窗口没有足够证据,模型继续观察,不急着开口;Standby 表示模型已经嗅到一点“有戏”,但证据还不够完整,于是下一段视频会用更高分辨率来检查细节;Response 则表示证据已经够了,模型开始正式回答。这个设计的妙处在于,状态 token 不只是“要不要说话”的信号,还是下一帧看多细 的控制信号。
这就让流式理解不再是“每一帧都高配硬看”,而变成了“默认省着看,必要时再放大”。从工程角度看,这种策略特别实用,因为它直接对应推理成本:低分辨率窗口负责常规监测,高分辨率窗口只留给真正可能有答案的时刻。论文还给出了状态转移监督掩码的设计,用来训练模型在状态切换点和状态保持点上都学会正确决策。
三阶段数据合成流水线:通用、长视频、流式全覆盖
视频大模型最容易翻车的地方,不是结构,而是数据。因为视频理解不是单一任务:有的要看短动作,有的要跨分钟找证据,有的要边看边等、边等边答。VideoChat3 的数据策略很清楚:通用短视频数据打底,长视频数据补时间跨度,流式数据补主动响应 。三条线一起上,模型才不会只会一种视频。
第一阶段是 VideoChat3-Academic2M 。它汇聚了多个公开视频学术数据源,总量达到 2.27M 条,特点是来源可靠、任务类型多,但很多原始标注太“短平快”,比如只给一个选项字母或一句很短的答案。论文没有机械照搬这些标签,而是用更强的多模态模型把它们改写成更完整的、带证据解释的回答,同时再用一个判别器检查改写是否与原始标签一致。这样做的本质是:把稀疏监督变成密集监督,但不让模型借题发挥 。
第二阶段是 VideoChat3-LV116K ,专门补长视频。长视频和短视频不是长度关系,而是难度关系:证据更稀疏,事件更分散,答案往往要跨多个时间段才能拼出来。论文先用场景切分工具把长视频拆成相对连贯的片段,再对每个片段做带时间戳的描述,最后把这些描述拼成可以用于长视频问答、时间线生成、时间定位等任务的训练样本。这里最有价值的不是“样本更多”,而是“监督更像长视频该有的样子”。
第三阶段是 VideoChat3-OL617K ,专门补流式主动响应。这里的关键不再是“看完再答”,而是“证据出现时再答”。论文先从视频问答对里找出关键信息出现的时间点,再构造带状态 token 的因果训练序列,让模型学会在 Silence、Standby、Response 之间切换。换句话说,模型不只是学会回答问题,还要学会在对的时机开口 ,这对直播、监控、在线助手类场景都更接近真实需求。
全面超越同量级开源模型,效率提升显著
实验部分最值得看的,不是某一个单点指标,而是 VideoChat3 在通用视频、长视频、流式视频 三类任务上都能保持比较均衡的表现。很多视频模型的问题在于:短视频刷得不错,长视频一塌糊涂;或者离线问答还行,一到实时流式就露馅。VideoChat3 的结果说明,这套“先压缩、再分层训练、再做自适应分辨率”的组合拳是能打通多个场景的。
从图1能看出,它在时间感知、长视频理解、时间定位和在线主动响应上都覆盖到了;而表4则补了工程侧最关键的一刀:效率不是附赠品,而是方法设计的一部分 。这点很重要,因为很多论文只会说“效果更好”,但一落到部署,视觉 token 数量、显存占用、推理延迟立刻把梦打碎。VideoChat3 把压缩和动态分辨率前置,本质上就是在为实际部署铺路。
定性结果也挺说明问题。图10 里模型能把撑杆跳的完整过程讲清楚,不是只认出“有人在跳”;图11 里它能从长视频里找出一个很具体的细节;图12 里它能按时间顺序组织事件;图13 里它能把语言描述准确定位到视频片段;图14 则展示了主动响应的节奏控制——没证据时安静,有证据时开口。说白了,这些图共同证明了一件事:VideoChat3 不只是“会看”,而是开始像一个有节奏感的视频助手了。
龙迷三问
这篇论文到底解决了什么问题? 它主要解决三件事:视频理解太吃算力、现有开源模型泛化不够、训练和数据不够透明。VideoChat3 用 I3D-ViT 降 token 成本,用三阶段数据流水线补齐不同场景监督,再把模型、代码、数据全部开源,目标就是做一个能复现、能扩展、能落地的通用视频多模态底座。
I3D-ViT 和普通 ViT 有什么区别? 普通做法更像“每帧单独看”,而 I3D-ViT 先把连续帧按片段组起来,在视觉侧做时空联合建模,再做时间池化。它的本质不是单纯压缩,而是先把局部时序信息整合好,再把更短的视觉序列交给语言模型。
Silence、Standby、Response 分别是什么意思? 这是流式主动响应里的三个状态。Silence 表示当前没有足够证据,先继续看;Standby 表示已经看到可能有用的信息,下一窗口要提高分辨率;Response 表示证据够了,可以正式回答。它们既是语言输出状态,也是下一段视频怎么采样的控制信号。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把时空压缩、动态分辨率和三阶段数据合成绑成一个完整系统,这个组合并不土;真正有价值的是它把“视频理解的三个痛点”都对上了号。
实验合理度: ★★★★☆
通用、长视频、流式三类基准都做了,而且还有推理成本对比,实验结构比较完整。唯一的现实问题是,数据流水线很重,别人复现时未必能完全拿到同样质量的数据。
学术研究价值: ★★★★★
这篇工作的价值不只是刷榜,而是给视频 MLLM 提供了一套能继续扩展的开源底座,尤其在长视频与流式主动响应上,很适合后续继续做系统性研究。
稳定性: ★★★☆☆
离线视频任务比较稳,但流式主动响应对状态预测和证据时机比较敏感,真实场景里如果输入分布变化大,效果仍可能波动。
适应性以及泛化能力: ★★★★☆
从短视频到长视频再到流式场景都覆盖了,泛化目标很明确。不过它仍然依赖较强的数据构造与训练配方,换领域时可能还需要重新调教。
硬件需求及成本: ★★★★☆
相较同量级模型更省,但训练阶段依旧不轻松,尤其是三套数据流水线和长视频处理,对算力与数据工程都有要求。好消息是,推理侧比很多“视觉 token 黑洞”友好得多。
复现难度: ★★★☆☆
代码和数据都开源是加分项,但完整复现三阶段数据构造、过滤和训练课程,工程量不会小,属于“给了钥匙,但门后面是大仓库”。
产品化成熟度: ★★★☆☆
离线理解和长视频问答已经比较接近可用状态,流式主动响应也有雏形,但要进生产还得补鲁棒性、延迟控制和场景适配。
可能的问题: 方法很完整,但依赖重数据合成与多阶段训练,成本不低;流式状态控制的泛化边界也还需要更多真实场景验证。
主要参考文献
[1] VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding. arXiv, 2026.
[2] VideoChat3 项目主页:https://mcg-nju.github.io/VideoChat3
[3] VideoChat3 代码仓库:https://github.com/MCG-NJU/VideoChat3
[4] VideoChat3 数据集集合:https://huggingface.co/collections/MCG-NJU/videochat3
看视频别再一帧一帧硬扛了,VideoChat3把“看得快、看得准、还会等时机再说”这件事做成了开源范本。想继续追视频理解、长上下文、流式交互这条线,欢迎来龙哥读论文星球和群里一起拆。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群