论文标题:
CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling
发表日期:
2026年02月
发表单位:
Microsoft Spatial AI Lab, Stanford University, ETH Zurich
原文链接:
https://arxiv.org/pdf/2602.13191
项目链接:
https://microsoft.github.io/CoPE
在通用视频问答基准测试中,CoPE-VideoLM 在7B量级的开源模型中达到了顶级水平,甚至在ActivityNet-QA上超越了LLaVA-Video(60.3% vs 56.5%)。表二:通用视频理解基准测试对比。CoPE-VideoLM在7B参数级别的开源模型中达到了先进的水平,尤其是在ActivityNet-QA和TempCompass等需要深入时间理解的基准上表现突出。在需要精确时间推理的基准测试上,本文方法的表现更是亮眼:表三:(a)时间推理与运动理解基准测试。CoPE-VideoLM在TempCompass、TOMATO和CVRR-ES上取得了最高准确率,证实了编解码器原语对时间推理提供了强大的归纳偏置。(b)长视频与指令遵循基准测试。本文方法在Video-TT、Video-MMMU和LVBench上表现优于其他开源模型。尤其值得注意的是在效率方面的巨大飞跃。下图展示了具体的运行时对比结果:图四:(a)运行时对比:在1 FPS处理速度下,生成64个文本令牌的首令牌生成时间和端到端延迟。CoPE-VideoLM将TTFT降低了最多86%。(b)视频时长与令牌预算:令牌预算在对数坐标上显示;虚线标记了评估的预算线。Delta令牌表示使得模型能够在不超出上下文窗口限制的情况下,处理更长的视频。在复杂的多轮对话和精细动作理解场景中,CoPE-VideoLM也能提供准确且快速的回答:图七:定性结果-多轮问答。在需要理解角色关系和叙事事件的电视剧片段中,CoPE-VideoLM实现了8.2倍的TTFT加速和76%的令牌节省。图八:定性结果-需要精细动作理解的田径比赛和户外活动。本文方法实现了4.2-6.2倍的TTFT加速和84-86%的令牌节省,同时提供了正确的细致回答。图九:定性结果-需要多步时间推理的冰球比赛和厨艺视频。本文方法在2.4-3.9倍更快的TTFT和减少82%令牌的情况下,提供了准确的回答。这些实验结果的显著性表明,编解码器原语不仅没有丢失关键信息,反而通过其“天生去冗余”的特性,帮助大语言模型聚焦于场景中的动态变化,从而做出了更准确的判断。
[1] Sarkar, S. D., Pautrat, R., Miksik, O., et al. CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling. arXiv:2602.13191, 2026.[2] Zhang, Y., et al. LLaVA-Video: A Large Multimodal Model for Video Understanding. 2024.[3] Wu, C., et al. Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual Tokenization. 2024.[4] Zhang, C., et al. EMA: Efficient Motion Adaptation for Video Language Models. 2025.[5] 微软项目主页: https://microsoft.github.io/CoPE