← 返回 PaperDaily
视觉与图像
CVPR 2026思路很新:EVIS把视频分成事件再分割
视频里常常不止一个事件,硬把它们当成“一锅粥”来分割,模型就容易看花眼。EVIS干脆先把视频拆成简单事件,再一段一段对齐文本,思路挺顺手。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读:
视频里常常不止一个事件,硬把它们当成“一锅粥”来分割,模型就容易看花眼。EVIS干脆先把视频拆成简单事件,再一段一段对齐文本,思路挺顺手。
原论文信息如下:
视频分割新突破:事件感知助手EVIS,从“一锅端”到“分步理解”
视频里的目标分割,表面上看是“把人、车、狗抠出来”,实际上常常是“把一段会动的故事抠出来”。问题就来了:一个视频里往往不是一个事件,而是好几个事件连着发生,模型如果硬把整段视频当成一锅端,容易把前后动作、不同对象、文本里的细微指代搅成一团,最后不是分错,就是开始“脑补”。
EVIS 的思路很直接:既然人理解复杂视频时会先拆成几个小片段,再把这些片段拼回整体,那模型也别逞强,先按事件拆视频,再按事件做对齐。它不是把所有帧一股脑塞进大模型里硬算,而是先用可学习的 Event Query(事件查询)把视频分成若干简单事件,再让模型逐段理解、逐段对齐文本,最后完成分割。这个设计的核心味道就四个字:先拆后看。
如果把传统方法比作“整锅炖”,那 EVIS 更像“分菜上桌”。每道菜都先看清,再决定怎么配。
事件查询:将复杂视频“化整为零”
这里先补一个基础概念。论文里提到的 Event Taxonomy(事件分类体系)是 Shipley 等人提出的观点:一个复合事件可以由两个或多个简单事件组成。放到视频理解里,就是一段视频不一定是“一个动作从头到尾”,更可能是“先上楼,再转身,再坐下”这种连续变化。文本描述也常常顺着这个逻辑,把视频切成几个语义片段。
EVIS 的 Event Query(事件查询)就是干这个活的。它不是去硬编码“第几帧是什么事件”,而是让一组可学习的查询向量去和文本特征交互,再去吸附视频中的对象轨迹。说人话就是:先让文本带路,再让查询去找事件。这样做的好处很明显:模型不必一次性吞下整段复杂视频,而是可以把复杂内容拆成若干容易理解的小块,降低混乱和幻觉概率。
这个设计最妙的地方在于,它不是把对象“硬切”到互不相交的时间段里。论文明确强调,同一个对象可以同时参与多个事件,这就比传统的轨迹重分组更灵活。毕竟现实视频里,一个人拿起杯子、走两步、又放下杯子,动作之间并不是泾渭分明的刀切豆腐。
EAFM模块:如何优雅地“合并”与“交互”
如果说 Event Query 负责“切题”,那 Event-Aware Frame Merging Module(EAFM,事件感知帧合并模块)就是负责“把题做细”。它做了三件事:先把帧级对象查询按事件聚起来,再在事件内部做细粒度建模,最后再把不同事件之间的长程关系串起来。这个流程听上去像在做项目管理:先分组、再开组会、最后开跨组会。
EAFM 里面最关键的第一步是 Frame Merging Block。它的作用是把不同帧里与同一事件相关的对象查询聚到一起。论文这里用了可微分的 top-k 分配和 Gumbel Softmax(Gumbel Softmax:一种把离散选择变得可训练的技巧)来做事件归属。Gumbel Softmax 的英文全称是 Gumbel-Softmax,中文常译为“吉布斯/古贝尔-软最大采样”或“可微分离散采样”,核心意思是:既想做“选哪个”的离散决策,又想保留梯度继续训练。
接下来是 Event-Intra Attention(事件内注意力)。它只看同一个事件里的对象,不让别的事件来捣乱。可以把它理解成“同一小组内部先把事情说清楚”。这个模块的重点是捕捉短时的空间-时间动态,比如一个目标在当前事件里怎么移动、怎么遮挡、怎么恢复可见。相比直接对整段视频做全局注意力,这种做法更像先把局部细节摸透,再谈整体。
然后是 Event-Inter Attention(事件间注意力)。如果说事件内注意力负责“这一段里发生了什么”,那事件间注意力负责“前后几个事件怎么接上”。它建模的是更长时间跨度上的轨迹关系,帮助模型记住目标从一个事件走到下一个事件时的连续性。这个设计对长视频尤其重要,因为长视频最怕的就是:前面认出来了,后面突然忘了,像金鱼附体一样。
论文里还有一个很细的操作:事件内和事件间得到的表示会再做融合,并映射回原来的位置。这样做的目的,是让局部和全局信息都能保留下来,不至于在层层聚合后把细节磨没了。这个地方属于“看起来不炫,但很重要”的工程细节,很多方法的性能差距,最后就死在这类地方。
对象-像素混合学习:兼顾细节与抽象
光靠对象查询还不够,因为对象查询偏抽象,像素特征又偏细碎。前者像“总结汇报”,后者像“现场录像”。EVIS 提出的 Object-Pixel-Hybrid Learning(对象-像素混合学习,简称 OPH)就是把这两种信息绑在一起:既保留像素级细节,又让对象级语义来帮忙过滤冗余。
这里可以先解释一下 MLLM。MLLM 是 Multi-Modal Large Language Model 的缩写,中文是“多模态大语言模型”。它的任务不是单纯识别图片,而是把视觉信息和语言推理连起来。EVIS 选择把事件级对象查询和像素 token 一起送进 MLLM,相当于给大模型同时递上一份“摘要”和“原始证据”,避免它只看摘要太粗,也避免它只看原始证据太乱。
OPH 的另一个关键点,是它不是简单地把像素特征平均掉。论文明确指出,直接平均高维特征很容易损失细节,于是它用一个 hybrid unit,把单个像素特征和多个对象查询交织在一起输入大模型。这样一来,模型既能看到局部纹理,也能借助对象查询知道“这块纹理到底属于谁”。
训练目标也不复杂:文本生成损失加上分割掩码损失,其中分割损失又由 BCE(二元交叉熵)和 DICE 损失组成。BCE 负责逐像素判断对不对,DICE 更关注掩码重叠程度。这个组合属于经典但靠谱的搭配,没什么花活,胜在稳。
实验证明:EVIS在多数据集上“大杀四方”
先说实验设置。EVIS 采用 InternVL2-1B 作为多模态大模型骨干,视觉编码器和 mask decoder 来自 SAM。训练时同时用图像和视频数据,视频侧重点优化 EAFM。这样的配置有个现实意义:它不是只在某个小数据集上“表演”,而是尽量让模型在多种视频分割场景里都能站得住。
消融结果最有说服力。基线模型加上 EAFM 后,J&F 提升非常明显;再加上 OPH,性能继续往上走,最后在 MeViS 上达到 46.8%。这个结果说明,事件拆分确实不是“换个名词讲故事”,而是实打实地帮助模型更好理解复杂视频。尤其在 MeViS 这种强调运动和时序变化的基准上,事件级建模的收益更容易体现出来。
再看 EAFM 内部拆解。Frame Merging 先把事件找出来,已经带来大头收益;事件内注意力和事件间注意力再继续补细节和补长程关系,最终把性能推到更高。这里的逻辑很顺:先把“分组”做好,再谈“组内”和“组间”,否则模型连人都没认清,就急着开跨组会,多少有点离谱。
这个消融很有启发性。事件数太少,单个事件装太多东西,模型还是会糊;事件数太多,虽然每段更简单,但整合成本飙升。最后的最佳点出现在 6 个事件查询附近,说明这类方法的关键不是“拆得越细越好”,而是找到一个能兼顾局部理解和全局整合的平衡点。
论文还特地做了一个很关键的对比:在相同的 InternVL2-1B 设置下,EVIS 仍然能明显优于 VideoLISA。这说明提升不只是“大模型换得更强”,而是事件感知的结构设计真的在起作用。换句话说,别把功劳全算给底座,方法本身也很能打。
从整体结果看,EVIS 的优势不是“某个数据集上小赢一点”,而是在多个基准上都比较稳定。尤其是对长视频、复杂动作和多事件场景,它的事件级组织方式更容易把信息理顺。相比一些直接做 token 堆叠或者稀疏采样的方法,EVIS 的层级建模更像是在给模型装一个“理解路线图”。
当然,实验也透露出一个现实:EVIS 的表现依赖于事件查询数量、骨干模型和训练数据搭配,说明这套方法并不是“拿来即满分”。但它的整体方向很清楚——把复杂视频理解拆成更容易学的中间任务,通常比直接端到端硬啃更稳。
局限与展望:LLM驱动的视频理解之路
EVIS 的方法论很漂亮,但也不是没有代价。首先,事件查询和多层注意力会让系统更复杂,训练和部署都比纯粹的轻量分割模型更重。其次,事件划分本身是学习出来的,碰到极端模糊、文本线索很少或者事件边界不明显的视频时,模型依然可能分不干净。再者,论文虽然展示了去掉 LLM 后 EAFM 仍然可用,但真正把这套机制做成稳定产品,仍需要进一步验证在不同场景、不同输入质量下的鲁棒性。
不过,EVIS 这篇工作的价值也正在这里:它没有把“更大模型”当成唯一答案,而是尝试从认知方式上改造视频理解流程。对后续研究来说,一个很自然的方向是继续优化事件划分机制,让事件查询更稳定、更可解释;另一个方向是把这种事件级组织方式迁移到更多长视频任务里,比如视频问答、时序定位、复杂动作理解等。简单说,视频理解可能不只是“看得更多”,而是“看得更有层次”。
龙迷三问
这篇论文到底解决了什么问题?它主要解决的是“视频里有多个事件时,模型容易把内容看乱”的问题。EVIS 通过事件查询先把视频拆成多个简单事件,再逐段理解和分割,减少了直接处理整段复杂视频带来的混乱和幻觉。
EAFM 和 OPH 分别是什么意思?EAFM 是 Event-Aware Frame Merging Module,中文可理解为“事件感知帧合并模块”;OPH 是 Object-Pixel-Hybrid Learning,中文是“对象-像素混合学习”。前者负责按事件聚合和建模,后者负责把对象级语义和像素级细节一起喂给多模态大模型。
为什么要强调事件划分,而不是直接做整段视频分割?因为长视频里的语义往往是分段变化的,文本描述也经常对应不同片段。直接整段处理容易把多个动作混在一起,而事件划分能让模型先理解局部,再整合全局,通常更适合复杂视频场景。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 事件级拆分视频理解的思路不算凭空冒出来,但把 Event Query、EAFM 和 OPH 串成一套完整方案,还是有比较清晰的结构创新。
实验合理度:★★★★☆ 消融做得比较完整,既看模块贡献,也看事件数、骨干模型和训练数据,说明作者对方法有效性是认真验证过的。
学术研究价值:★★★★☆ 这篇工作对长视频、多事件理解很有启发意义,尤其适合后续继续往事件层级建模、视频推理和复杂指代分割方向延伸。
稳定性:★★★☆☆ 事件拆分思路挺稳,但整体仍依赖多模块协同和较强底座,遇到边界模糊、文本稀疏或极端长视频时,鲁棒性还有提升空间。
适应性以及泛化能力:★★★★☆ 在多个公开视频分割基准上都有表现,说明方法不只盯着单一场景,但对任务形式仍有一定依赖。
硬件需求及成本:★★★☆☆ 1B 级多模态大模型加上事件模块,训练和推理都不算轻,离“随便一台机器就能跑”还有距离。
复现难度:★★★☆☆ 论文给了较清楚的训练配置和模块设计,但多组件联动、数据预处理和大模型环境仍会让复现有一定门槛。
产品化成熟度:★★★☆☆ 思路有潜力,尤其适合复杂视频理解和辅助标注场景;但要真正上产品,还得继续压成本、提稳定性、做更强的异常场景验证。
可能的问题:方法链路较长,模块多、依赖强,若事件划分不准,后面的理解和分割也会跟着跑偏。
主要参考文献
[1] Liu, J., Ding, H., He, S., & Jiang, Y.-G. Event-Aware Instructed Assistant for Referring Video Segmentation. arXiv, 2026.
[2] Shipley, T. F., et al. Event Taxonomy related work, cited in the paper.
[3] LISA, SAM, InternVL2, VideoLISA, MeViS 等相关方法与数据集,详见原论文参考文献。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!