← 返回 PaperDaily 视觉与图像

把视频“偷摸”压缩的事告诉大模型:微软新方法令牌省93%

视频理解模型往往要把每一帧都当成独立图片来处理,这又慢又浪费算力。微软和斯坦福的研究人员直接从视频压缩算法中取经,用轻量级的运动向量和残差代替大部分图像的密集编码,让首帧生成时间快了86%,令牌用量暴减93%,同时性能还不降反升!这个方法与之前的Quickviewer等非均匀采样思路不同,它是在编解码层面做“减法”,从根源上避免了冗余。

把视频“偷摸”压缩的事告诉大模型:微软新方法令牌省93%
原论文信息如下:
论文标题:
CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling
发表日期:
2026年02月
发表单位:
Microsoft Spatial AI Lab, Stanford University, ETH Zurich
原文链接:
https://arxiv.org/pdf/2602.13191
项目链接:
https://microsoft.github.io/CoPE

方法概览图
图一:CoPE-VideoLM整体流程图。左半部分展示了标准视频语言模型需要对所有帧进行完整的RGB编码,导致计算量巨大。右半部分展示了本文的方法:只对稀疏的I帧进行完整的RGB编码,而对P帧则利用其运动的天然稀疏性,直接处理轻量级的运动向量和残差,大幅减少了计算和令牌数量。

引言

视频语言模型(VideoLM)是当前AI领域的热点,但一个老问题始终困扰着研究者:视频通常包含大量冗余信息,而现有的VideoLM几乎都会先把每一帧视频图像编码成独立的“图像”,再一股脑地喂给大模型。这种做法不仅在计算上非常奢侈,而且很容易受限于大模型的上下文窗口——视频长了,帧数一多,模型就“看不过来了”。
现有的解决方案通常是:减少帧数,也就是进行关键帧采样。但这会带来“一叶障目”的问题,要么错过了宏观事件,要么丢失了微观细节。而且,即便是从30 FPS的视频中抽取1帧/秒,你依然要对抽取出来的每一帧做完整的图像编码,这个过程耗时且占内存。
这就引出了一个非常有趣的问题:既然视频在存储时已经经过了高度压缩,那为什么在理解视频时,我们还要走“先解压成满屏图像,再挨个儿编码”的回头路呢?
这正是微软和斯坦福大学研究团队在CoPE-VideoLM中所要解决的核心问题。他们敏锐地发现,现代视频编解码器(如MPEG-4, H.264)在压缩视频时,已经天然地提取了关键帧(I帧)和描述帧间运动的“运动向量”以及“残差”。这些 编解码器原语 本身就是对视频冗余信息的一种高效结构化表示。
交互式运行时对比演示GIF
图二:交互式运行时对比演示。左侧(原方法)在用户提问后需要长时间等待,而右侧(CoPE-VideoLM)几乎实时响应,展示了极快的首令牌生成速度。

问题背景及核心思路

传统VideoLM的工作流大致是这样的:给定一个视频,你先通过某种方式(比如均匀采样)选出N个关键帧,然后用一个视觉编码器(比如SigLIP)把这些帧变成一系列的视觉令牌,最后将这些令牌连同用户的问题一起输送给一个大语言模型(LLM)来生成答案。
这个流程有两个显著的瓶颈:

1. 计算瓶颈: 视频中相邻帧之间往往高度相似(即使降采样到1 FPS依然如此)。对每一关键帧都进行完整的图像编码,浪费了大量算力在处理冗余信息上。这会显著延长模型的 首令牌生成时间(TTFT),对用户体验和机器人等实时应用非常不友好。

2. 上下文瓶颈: LLM的上下文窗口是有限的。关键帧采样本质上是“用稀疏覆盖代替全覆盖”,无论怎么选,总会有信息遗漏。而且,每帧生成的令牌数量是固定的(比如196个),视频一长,令牌总数就迅速超标,让人进退两难。

为了解决这些问题,CoPE-VideoLM提出了一个大胆的想法:能不能直接利用视频在压缩状态下的“原语”呢?
标准的视频编解码器(比如MPEG-4, H.264)在编码时,会用到下面几种帧:

I帧(关键帧/帧内编码帧): 一个独立编码的完整RGB图像,是整个画面组(GOP)的参考点。可以理解为一本书里的一章标题。

P帧(预测帧): 它只记录跟前一帧之间的变化。这个变化由两部分组成:

- 运动向量: 描述了一个个宏块(比如16x16像素的块)从前一帧到当前帧的位移,类似于一个粗糙的光流场。

- 残差: 在根据运动向量 “预测” 出目标帧后,还剩下的像素差异细节。这是对 “运动补偿” 之后的补充修正。

这个结构太吸引人了:I帧提供了“全景图”,而P帧则提供了“变化量”,这不就是视频理解所需要的全部信息吗?而且P帧的数据量天生就比I帧小得多。

核心设计:Delta编码器与编解码器感知的令牌化


方法概述

CoPE-VideoLM的流程很清晰。它没有像传统方法那样将每个帧都视为独立的图像并对其进行完整的RGB编码,而是利用了视频画面组的结构。在推理时,I帧照常通过一个冻结的视觉编码器(如SigLIP),生成一系列标准的RGB令牌。而对于P帧,它们不再需要经过这个昂贵的编码器,而是直接输入到一个轻量级的 Delta编码器 中,生成极少量的、高度紧凑的“Delta令牌”。最终,I帧的令牌和P帧的Delta令牌按时间顺序交错排列,形成最终输入给大语言模型的令牌序列。
下面这张图将整个过程展示得很清楚:
方法架构图
图三:CoPE-VideoLM的方法架构图。展示了如何利用画面组结构,将I帧和P帧分别处理,并交错组成高效的令牌序列,输入给LLM。

Delta编码器

Delta编码器的设计非常巧妙。它采用了一个双分支的Transformer架构,专门处理运动向量和残差这两种不同模态的数据。
Delta编码器设计图
图四:Delta编码器设计图。展示了轻量级双分支架构:运动向量分支通过MLP和运动Transformer压缩成少量令牌,残差分支通过ResNet和残差Transformer压缩成少量令牌,拼接形成最终的Delta令牌。
具体来说:

运动向量分支: 运动向量本质上是整数,代表宏块位移。它先通过一个简单的MLP网络提取特征,然后由一个带有一小组可学习查询令牌的“运动Transformer”来“阅读”并压缩这些特征,最终输出非常少的(论文中设为4个)运动令牌。

残差分支: 残差是一个“图”状数据(虽然很稀疏空洞)。它由一个轻量级的ResNet-18模型处理,提取局部特征后,再用另一个(结构与运动分支相同,但参数独立的)“残差Transformer”进行压缩,同样输出少量的(论文中设为4个)残差令牌。

最终,这K_tau=4个运动令牌和K_delta=4个残差令牌被拼接成一个包含N=8个令牌的 Delta令牌,这就是整个P帧的压缩表示。这意味着,一个原本需要196个RGB令牌来描述的P帧,现在只需要8个Delta令牌!此外,整个Delta编码器仅仅增加了不到1500万的参数,相比70亿参数的大语言模型来说,几乎可以忽略不计。
此外,论文还提出了一个“P帧融合”的特性。当需要更稀疏的时间采样时(比如每30帧处理一次),可以将连续的30个P帧进行融合,将它们产生的Delta令牌进一步压缩,从而在帧率覆盖范围和令牌数量之间取得更灵活的平衡。

训练策略

为了让Delta编码器“学会”如何将运动向量和残差映射到与SigLIP视觉编码器兼容的潜在空间,论文提出了一套两阶段的训练策略。

第一阶段:Delta编码器预训练。目标是让Delta编码器学会将其生成的令牌映射到与冻结的视觉编码器(如SigLIP)相同的特征空间。论文额外引入了两个小型Transformer模块(“参考”Transformer和“扭曲”Transformer),它们模拟编解码器的重建过程,接收前一帧的RGB令牌、当前帧的运动令牌和残差令牌,试图重建出当前帧的RGB特征。然后,将这个重建的特征与真实的当前帧RGB特征进行逐补丁的均方误差损失计算。通过这种方式,Delta编码器被迫学会将“运动的抽象描述”和“视觉残差”转化为跟“真实视觉特征”相似的表示形式。

第二阶段:端到端微调。完成预训练后,预训练阶段使用的“参考”和“扭曲”Transformer就被丢弃了。此时,训练好的Delta编码器被插入到整个视频语言模型中。I帧照常通过冻结的SigLIP编码器,P帧通过冻结的Delta编码器,生成的令牌交错排列后,送入大语言模型。整个模型(包括LLM和Delta编码器)利用标准的指令微调损失函数进行联合训练。因为Delta编码器极其轻量(仅1500万参数),相对于70亿参数的LLM来说,增加的训练成本微乎其微。

实证验证:效率与精度的双重飞跃

纸上谈兵终觉浅。咱们来看看在14个主流视频理解基准测试上的实际表现。

实验结果分析:解码效率如何转化为理解优势

方法的有效性首先体现在 Delta令牌的有效性 上。从下面的表1可以看到,在相同的画面组抽取方案下,仅靠稀疏的RGB帧(如1个I帧/GOP)并不能达到很好的效果。但是,当加上少量的Delta令牌(仅增加1.6%的令牌预算)后,模型表现出了显著提升(PerceptionTest上从60.4%提升到65.5%)。这说明Delta令牌确实为大语言模型提供了关键的、互补的时间动态信息。
表一:令牌效率与视频问答准确率对比
表一:令牌效率与视频问答准确率对比。显示了在不同关键帧密度下,CoPE-VideoLM 相比 LLaVA-Video 的准确率提升(绿色数字)和非常低的额外令牌开销。本文方法在极低的令牌预算下(如6.9%的令牌)就能取得非常有竞争力的成绩。
这种优势在低令牌预算下尤为明显。下面的图清晰地展示了CoPE-VideoLM在帕累托最优前沿上的领先地位:
图六:性能-令牌预算帕累托曲线
图六:性能-令牌预算帕累托曲线。在所有三个基准测试中,CoPE-VideoLM(绿色/橙色线)一致地处于LLaVA-Video(蓝色/红色线)的“左上方”,意味着在相同的令牌消耗下,本文方法达成了更高的准确率,或者在相同的准确率下,使用了少得多的令牌。
为什么能work?核心原因在于: 编解码器原语提供了极强的归纳偏置 。密集的RGB帧包含了太多与动作理解无关的静态背景信息,而运动向量直接告诉模型“哪里在动、往哪里动”。这种聚焦于变化的信号,天然适合基于时间动态的任务,这也是CoPE在需要精确时间推理的基准(如TempCompass, CVRR-ES)上有突出表现的根本原因。

实验结果:全面对比与性能分析

在通用视频问答基准测试中,CoPE-VideoLM 在7B量级的开源模型中达到了顶级水平,甚至在ActivityNet-QA上超越了LLaVA-Video(60.3% vs 56.5%)。
表二:通用视频理解基准测试对比
表二:通用视频理解基准测试对比。CoPE-VideoLM在7B参数级别的开源模型中达到了先进的水平,尤其是在ActivityNet-QA和TempCompass等需要深入时间理解的基准上表现突出。
在需要精确时间推理的基准测试上,本文方法的表现更是亮眼:
表三:时间推理与长视频理解基准测试对比
表三:(a)时间推理与运动理解基准测试。CoPE-VideoLM在TempCompass、TOMATO和CVRR-ES上取得了最高准确率,证实了编解码器原语对时间推理提供了强大的归纳偏置。(b)长视频与指令遵循基准测试。本文方法在Video-TT、Video-MMMU和LVBench上表现优于其他开源模型。
尤其值得注意的是在效率方面的巨大飞跃。下图展示了具体的运行时对比结果:
图四:运行时与令牌预算对比
图四:(a)运行时对比:在1 FPS处理速度下,生成64个文本令牌的首令牌生成时间和端到端延迟。CoPE-VideoLM将TTFT降低了最多86%。(b)视频时长与令牌预算:令牌预算在对数坐标上显示;虚线标记了评估的预算线。Delta令牌表示使得模型能够在不超出上下文窗口限制的情况下,处理更长的视频。
在复杂的多轮对话和精细动作理解场景中,CoPE-VideoLM也能提供准确且快速的回答:
图七:定性结果-角色关系理解
图七:定性结果-多轮问答。在需要理解角色关系和叙事事件的电视剧片段中,CoPE-VideoLM实现了8.2倍的TTFT加速和76%的令牌节省。
图八:定性结果-精细动作理解
图八:定性结果-需要精细动作理解的田径比赛和户外活动。本文方法实现了4.2-6.2倍的TTFT加速和84-86%的令牌节省,同时提供了正确的细致回答。
图九:定性结果-多步时间推理
图九:定性结果-需要多步时间推理的冰球比赛和厨艺视频。本文方法在2.4-3.9倍更快的TTFT和减少82%令牌的情况下,提供了准确的回答。
这些实验结果的显著性表明,编解码器原语不仅没有丢失关键信息,反而通过其“天生去冗余”的特性,帮助大语言模型聚焦于场景中的动态变化,从而做出了更准确的判断。

应用前景与未来挑战

CoPE-VideoLM的高效性使其应用前景非常广阔:

实时视频分析与机器人:在机器人和自动驾驶中,延迟是致命的。CoPE-VideoLM将首令牌生成时间降低几个数量级,使得机器人可以在“看到”场景后几乎立即做出反应或回答。

边缘设备部署:由于令牌预算极低,且不需要对每帧运行昂贵的视觉编码器,这种方法对于算力有限的手机或嵌入式系统非常友好。

超长视频理解:传统方法在处理1小时以上的视频时往往面临严重的上下文瓶颈。CoPE通过其高效编码,可以轻松扩展至数小时级别的视频内容。

当然,这项技术也面临一些挑战和局限性:

编解码器依赖:方法依赖于标准的MPEG-4、H.264/HEVC等编解码器。对于一些特殊编码格式或者实时未压缩的视频流,可能需要额外的预处理步骤。

极端场景下的信息丢失:在快速、连续且复杂的场景变换中(如眼花缭乱的剪辑、激烈的爆炸场面),P帧融合可能会导致部分细节信息的丢失。虽然实验结果表明影响较小,但在任务需要极高精度的场景下仍需注意。

总的来说,CoPE-VideoLM代表了一个重要的方向:从处理“原始数据”转向处理“压缩后的、结构化的数据”。或许未来的AI模型,不再是越大越好,而是越“聪明”越好——学会利用数据本身的自然结构来为自己减负。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问:CoPE-VideoLM最大的缺点是什么?最大的缺点是它依赖标准的视频编解码器结构(如MPEG-4中的GOP)。如果视频是实时流、无损存储或者使用了特殊的私有编码格式,就需要额外的预处理环节来提取运动向量和残差,这会引入一点点额外的延迟。另外,虽然论文在14个基准上验证了性能,但还不是在所有场景下都经过了充分的测试。

问:Delta编码器为什么不直接处理B帧(双向预测帧)?B帧不仅利用过去帧,还利用未来帧的信息,这破坏了模型处理视频时的因果性。对于需要实时响应或逐帧顺序处理的下游任务(如机器人的视觉伺服)来说,这种未来的依赖关系是不可接受的。因此论文明智地只选择了P帧(仅依赖过去帧)作为主要处理对象,以保证模型的时间一致性和实时性。

问:这个方法跟传统的令牌压缩方法(如Token Merging, Q-Former)有什么本质不同?传统方法是对“已经生成的密集RGB令牌”进行后处理压缩,属于“亡羊补牢”。而CoPE-VideoLM是从源头做起,直接利用编解码器原语中“天生稀疏”的特性来生成令牌,属于“未雨绸缪”。P帧的Delta令牌是对“变化”的直接数字化描述,而非对“完整图像”的暴力压缩。因此,CoPE在减少计算量(P帧绕过了昂贵的大视觉编码器)和保留时间语义方面具有天然优势。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

思路新颖,将古老的视频编解码原理与现代的大模型Tokenization结合,属于跨界缝合创新。虽然此前有CoViAR等工作,但本文是第一个提出完整的、可训练的、保持时间顺序的视频语言模型解决方案。

实验合理度:★★★★★

实验设计非常全面。涵盖了14个基准测试,从通用问答到时间推理、长视频理解、3D空间理解。不仅与开源模型对比,还对Delta令牌的有效性做了充分的消融和鲁棒性分析,令人信服。

学术研究价值:★★★★★

有重要的启发性。它证明了“数据本身的原始压缩格式”可以作为一种有效的先验知识输入给大模型。这不仅为视频理解,也可能为音频、3D点云等其他模态的高效模型设计提供新的思路。

稳定性:★★★★☆

在各种不同帧率、关键帧密度下表现稳定,没有出现“崩溃”现象。但由于依赖编解码器,在面对极端复杂的场景变换时(如大量镜头切换),残差的分布可能会有较大波动。

适应性以及泛化能力:★★★★☆

在大多数时间依赖型任务上表现很好,但对“静态图像识别”占主导的任务(如VideoMME的部分子集)优势不明显,与LLaVA-Video基本持平。不过,这类任务本来就不是设计着重解决的问题。

硬件需求及成本:★★★★★

极其优秀。Token减少了93%,TTFT降低了86%,Delta编码器仅增加1500万参数。无论是训练还是推理,对硬件的需求都低于其他同等性能的模型。

复现难度:★★★☆☆

论文公开了训练策略和数据集(基于LLaVA-Video-178K),但未提及是否开源所有代码和权重。预训练阶段涉及两个辅助Transformer,增加了复现的工程复杂度。

产品化成熟度:★★★★☆

对于以H.264/MPEG-4为主的在线视频流、监控视频等场景,直接可用。但在需要高质量第一人称视频或无损格式的工业质检场景,需要额外的适配工作。

可能的问题:对于完全静态的、无运动的视频(如固定机位的会议录像),Delta令牌可能提供的信息非常少,此时本文方法就降级为普通的稀疏帧采样方法。另外,在训练中固定使用MPEG-4编解码器可能使模型在其他编解码器上产生域偏移。


主要参考文献

[1] Sarkar, S. D., Pautrat, R., Miksik, O., et al. CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling. arXiv:2602.13191, 2026.
[2] Zhang, Y., et al. LLaVA-Video: A Large Multimodal Model for Video Understanding. 2024.
[3] Wu, C., et al. Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual Tokenization. 2024.
[4] Zhang, C., et al. EMA: Efficient Motion Adaptation for Video Language Models. 2025.
[5] 微软项目主页: https://microsoft.github.io/CoPE
封面图:CoPE-VideoLM 编解码器感知的令牌化框架

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",<

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球