← 返回 PaperDaily 视觉与图像

CVPR 2026思路很新:EVIS把视频分成事件再分割

视频里常常不止一个事件,硬把它们当成“一锅粥”来分割,模型就容易看花眼。EVIS干脆先把视频拆成简单事件,再一段一段对齐文本,思路挺顺手。

CVPR 2026思路很新:EVIS把视频分成事件再分割
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
视频里常常不止一个事件,硬把它们当成“一锅粥”来分割,模型就容易看花眼。EVIS干脆先把视频拆成简单事件,再一段一段对齐文本,思路挺顺手。


原论文信息如下:
论文标题:
Event-Aware Instructed Assistant for Referring Video Segmentation
发表日期:
2026年06月
发表单位:
复旦大学
原文链接:
https://arxiv.org/pdf/2606.26994v1.pdf

视频分割新突破:事件感知助手EVIS,从“一锅端”到“分步理解”

视频里的目标分割,表面上看是“把人、车、狗抠出来”,实际上常常是“把一段会动的故事抠出来”。问题就来了:一个视频里往往不是一个事件,而是好几个事件连着发生,模型如果硬把整段视频当成一锅端,容易把前后动作、不同对象、文本里的细微指代搅成一团,最后不是分错,就是开始“脑补”。
EVIS 的思路很直接:既然人理解复杂视频时会先拆成几个小片段,再把这些片段拼回整体,那模型也别逞强,先按事件拆视频,再按事件做对齐。它不是把所有帧一股脑塞进大模型里硬算,而是先用可学习的 Event Query(事件查询)把视频分成若干简单事件,再让模型逐段理解、逐段对齐文本,最后完成分割。这个设计的核心味道就四个字:先拆后看
封面
图2:与以往把视频当成单一复合事件的做法不同,EVIS 把视频改写成“多个简单事件”的层级理解问题。
如果把传统方法比作“整锅炖”,那 EVIS 更像“分菜上桌”。每道菜都先看清,再决定怎么配。

事件查询:将复杂视频“化整为零”

这里先补一个基础概念。论文里提到的 Event Taxonomy(事件分类体系)是 Shipley 等人提出的观点:一个复合事件可以由两个或多个简单事件组成。放到视频理解里,就是一段视频不一定是“一个动作从头到尾”,更可能是“先上楼,再转身,再坐下”这种连续变化。文本描述也常常顺着这个逻辑,把视频切成几个语义片段。
EVIS 的 Event Query(事件查询)就是干这个活的。它不是去硬编码“第几帧是什么事件”,而是让一组可学习的查询向量去和文本特征交互,再去吸附视频中的对象轨迹。说人话就是:先让文本带路,再让查询去找事件。这样做的好处很明显:模型不必一次性吞下整段复杂视频,而是可以把复杂内容拆成若干容易理解的小块,降低混乱和幻觉概率。
图1:事件分类体系示意图
图1:当关注不同的表达片段时,视频里相关对象的轨迹会变化;每一段轨迹都可以抽象成一个简单事件,多个简单事件共同组成复合事件。
这个设计最妙的地方在于,它不是把对象“硬切”到互不相交的时间段里。论文明确强调,同一个对象可以同时参与多个事件,这就比传统的轨迹重分组更灵活。毕竟现实视频里,一个人拿起杯子、走两步、又放下杯子,动作之间并不是泾渭分明的刀切豆腐。
图10:事件分解可视化
图10:通过 EAFM 中全局对象查询与事件查询的余弦相似度,可以看到模型学到的事件分解并不是瞎猜,而是有明显的语义聚类倾向。

EAFM模块:如何优雅地“合并”与“交互”

如果说 Event Query 负责“切题”,那 Event-Aware Frame Merging Module(EAFM,事件感知帧合并模块)就是负责“把题做细”。它做了三件事:先把帧级对象查询按事件聚起来,再在事件内部做细粒度建模,最后再把不同事件之间的长程关系串起来。这个流程听上去像在做项目管理:先分组、再开组会、最后开跨组会。
图3:EVIS整体架构图
图3:EVIS 的整体流程。视频先被拆成像素 token 和对象 token,事件查询与文本先交互,再驱动 EAFM 聚合对象信息,最后送入多模态大模型生成分割结果。
EAFM 里面最关键的第一步是 Frame Merging Block。它的作用是把不同帧里与同一事件相关的对象查询聚到一起。论文这里用了可微分的 top-k 分配和 Gumbel Softmax(Gumbel Softmax:一种把离散选择变得可训练的技巧)来做事件归属。Gumbel Softmax 的英文全称是 Gumbel-Softmax,中文常译为“吉布斯/古贝尔-软最大采样”或“可微分离散采样”,核心意思是:既想做“选哪个”的离散决策,又想保留梯度继续训练。
图5:Frame Merging Block
图5:Frame Merging Block 通过选择 top-k 个事件查询,把对象查询分配到最相关的事件中。这里的“top-k”不是拍脑袋,而是为了在事件数和信息保留之间找平衡。
接下来是 Event-Intra Attention(事件内注意力)。它只看同一个事件里的对象,不让别的事件来捣乱。可以把它理解成“同一小组内部先把事情说清楚”。这个模块的重点是捕捉短时的空间-时间动态,比如一个目标在当前事件里怎么移动、怎么遮挡、怎么恢复可见。相比直接对整段视频做全局注意力,这种做法更像先把局部细节摸透,再谈整体。
然后是 Event-Inter Attention(事件间注意力)。如果说事件内注意力负责“这一段里发生了什么”,那事件间注意力负责“前后几个事件怎么接上”。它建模的是更长时间跨度上的轨迹关系,帮助模型记住目标从一个事件走到下一个事件时的连续性。这个设计对长视频尤其重要,因为长视频最怕的就是:前面认出来了,后面突然忘了,像金鱼附体一样。
图4:EAFM模块
图4:EAFM 模块把事件内和事件间信息都纳入建模,目标不是“看见一个框”,而是“看懂一个过程”。
论文里还有一个很细的操作:事件内和事件间得到的表示会再做融合,并映射回原来的位置。这样做的目的,是让局部和全局信息都能保留下来,不至于在层层聚合后把细节磨没了。这个地方属于“看起来不炫,但很重要”的工程细节,很多方法的性能差距,最后就死在这类地方。

对象-像素混合学习:兼顾细节与抽象

光靠对象查询还不够,因为对象查询偏抽象,像素特征又偏细碎。前者像“总结汇报”,后者像“现场录像”。EVIS 提出的 Object-Pixel-Hybrid Learning(对象-像素混合学习,简称 OPH)就是把这两种信息绑在一起:既保留像素级细节,又让对象级语义来帮忙过滤冗余。
这里可以先解释一下 MLLM。MLLMMulti-Modal Large Language Model 的缩写,中文是“多模态大语言模型”。它的任务不是单纯识别图片,而是把视觉信息和语言推理连起来。EVIS 选择把事件级对象查询和像素 token 一起送进 MLLM,相当于给大模型同时递上一份“摘要”和“原始证据”,避免它只看摘要太粗,也避免它只看原始证据太乱。
图6:去掉LLM后的EVIS结构
图6:把 LLM 去掉后,EAFM 仍然可以单独作为一种事件中心的视频理解模块使用,这也说明它不是“只靠大模型光环”的装饰件。
OPH 的另一个关键点,是它不是简单地把像素特征平均掉。论文明确指出,直接平均高维特征很容易损失细节,于是它用一个 hybrid unit,把单个像素特征和多个对象查询交织在一起输入大模型。这样一来,模型既能看到局部纹理,也能借助对象查询知道“这块纹理到底属于谁”。
训练目标也不复杂:文本生成损失加上分割掩码损失,其中分割损失又由 BCE(二元交叉熵)和 DICE 损失组成。BCE 负责逐像素判断对不对,DICE 更关注掩码重叠程度。这个组合属于经典但靠谱的搭配,没什么花活,胜在稳。
图8:成功与失败案例
图8:成功与失败案例能看出,EVIS 在复杂动作和多事件场景里更稳,但在黑字不可见、语义线索极少的情况下,模型依然会吃力。

实验证明:EVIS在多数据集上“大杀四方”

先说实验设置。EVIS 采用 InternVL2-1B 作为多模态大模型骨干,视觉编码器和 mask decoder 来自 SAM。训练时同时用图像和视频数据,视频侧重点优化 EAFM。这样的配置有个现实意义:它不是只在某个小数据集上“表演”,而是尽量让模型在多种视频分割场景里都能站得住。
表1:EVIS在MeViS上的消融实验
表1:在 MeViS 数据集上的消融实验。EAFM 和 OPH 都带来明显增益,最终把 J&F 提到 46.8%。
消融结果最有说服力。基线模型加上 EAFM 后,J&F 提升非常明显;再加上 OPH,性能继续往上走,最后在 MeViS 上达到 46.8%。这个结果说明,事件拆分确实不是“换个名词讲故事”,而是实打实地帮助模型更好理解复杂视频。尤其在 MeViS 这种强调运动和时序变化的基准上,事件级建模的收益更容易体现出来。
表2:EAFM模块消融
表2:EAFM 的消融表明,Frame Merging、Event-Intra Attention、Event-Inter Attention 三者是递进式增益,不是摆设。
再看 EAFM 内部拆解。Frame Merging 先把事件找出来,已经带来大头收益;事件内注意力和事件间注意力再继续补细节和补长程关系,最终把性能推到更高。这里的逻辑很顺:先把“分组”做好,再谈“组内”和“组间”,否则模型连人都没认清,就急着开跨组会,多少有点离谱。
表3:事件查询数量消融
表3:事件查询数量并不是越多越好,6 个事件查询左右取得最好结果,说明“拆得太碎”也会让跨事件整合变难。
这个消融很有启发性。事件数太少,单个事件装太多东西,模型还是会糊;事件数太多,虽然每段更简单,但整合成本飙升。最后的最佳点出现在 6 个事件查询附近,说明这类方法的关键不是“拆得越细越好”,而是找到一个能兼顾局部理解和全局整合的平衡点。
表4:不同多模态大模型的影响
表4:更换不同多模态大模型后,EVIS 仍然保持优势,说明方法本身的贡献并不依赖某个特定底座。
论文还特地做了一个很关键的对比:在相同的 InternVL2-1B 设置下,EVIS 仍然能明显优于 VideoLISA。这说明提升不只是“大模型换得更强”,而是事件感知的结构设计真的在起作用。换句话说,别把功劳全算给底座,方法本身也很能打。
表9:多数据集定量结果
表9:在 MeViS、Ref-YouTube-VOS 和 Ref-DAVIS17 上,EVIS 都拿到很有竞争力的结果,尤其在强调运动理解的 MeViS 上表现突出。
从整体结果看,EVIS 的优势不是“某个数据集上小赢一点”,而是在多个基准上都比较稳定。尤其是对长视频、复杂动作和多事件场景,它的事件级组织方式更容易把信息理顺。相比一些直接做 token 堆叠或者稀疏采样的方法,EVIS 的层级建模更像是在给模型装一个“理解路线图”。
表10:A2D-Sentences与JHMDB-Sentences结果
表10:在动作类数据集 A2D-Sentences 和 JHMDB-Sentences 上,EVIS 同样维持较强表现,说明它不只是对某一种视频类型有效。
表11:推理分割结果
表11:在 reasoning segmentation 任务上,EVIS 也能保持不错的结果,说明事件建模对更复杂的语言理解任务同样有帮助。
表12:ReasonSeg基准结果
表12:在 ReasonSeg 上,EVIS 继续保持竞争力,说明它不仅能“分割”,还多少有点“理解”味道。
当然,实验也透露出一个现实:EVIS 的表现依赖于事件查询数量、骨干模型和训练数据搭配,说明这套方法并不是“拿来即满分”。但它的整体方向很清楚——把复杂视频理解拆成更容易学的中间任务,通常比直接端到端硬啃更稳。

局限与展望:LLM驱动的视频理解之路

EVIS 的方法论很漂亮,但也不是没有代价。首先,事件查询和多层注意力会让系统更复杂,训练和部署都比纯粹的轻量分割模型更重。其次,事件划分本身是学习出来的,碰到极端模糊、文本线索很少或者事件边界不明显的视频时,模型依然可能分不干净。再者,论文虽然展示了去掉 LLM 后 EAFM 仍然可用,但真正把这套机制做成稳定产品,仍需要进一步验证在不同场景、不同输入质量下的鲁棒性。
不过,EVIS 这篇工作的价值也正在这里:它没有把“更大模型”当成唯一答案,而是尝试从认知方式上改造视频理解流程。对后续研究来说,一个很自然的方向是继续优化事件划分机制,让事件查询更稳定、更可解释;另一个方向是把这种事件级组织方式迁移到更多长视频任务里,比如视频问答、时序定位、复杂动作理解等。简单说,视频理解可能不只是“看得更多”,而是“看得更有层次”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决的是“视频里有多个事件时,模型容易把内容看乱”的问题。EVIS 通过事件查询先把视频拆成多个简单事件,再逐段理解和分割,减少了直接处理整段复杂视频带来的混乱和幻觉。

EAFM 和 OPH 分别是什么意思?EAFM 是 Event-Aware Frame Merging Module,中文可理解为“事件感知帧合并模块”;OPH 是 Object-Pixel-Hybrid Learning,中文是“对象-像素混合学习”。前者负责按事件聚合和建模,后者负责把对象级语义和像素级细节一起喂给多模态大模型。

为什么要强调事件划分,而不是直接做整段视频分割?因为长视频里的语义往往是分段变化的,文本描述也经常对应不同片段。直接整段处理容易把多个动作混在一起,而事件划分能让模型先理解局部,再整合全局,通常更适合复杂视频场景。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 事件级拆分视频理解的思路不算凭空冒出来,但把 Event Query、EAFM 和 OPH 串成一套完整方案,还是有比较清晰的结构创新。

实验合理度:★★★★☆ 消融做得比较完整,既看模块贡献,也看事件数、骨干模型和训练数据,说明作者对方法有效性是认真验证过的。

学术研究价值:★★★★☆ 这篇工作对长视频、多事件理解很有启发意义,尤其适合后续继续往事件层级建模、视频推理和复杂指代分割方向延伸。

稳定性:★★★☆☆ 事件拆分思路挺稳,但整体仍依赖多模块协同和较强底座,遇到边界模糊、文本稀疏或极端长视频时,鲁棒性还有提升空间。

适应性以及泛化能力:★★★★☆ 在多个公开视频分割基准上都有表现,说明方法不只盯着单一场景,但对任务形式仍有一定依赖。

硬件需求及成本:★★★☆☆ 1B 级多模态大模型加上事件模块,训练和推理都不算轻,离“随便一台机器就能跑”还有距离。

复现难度:★★★☆☆ 论文给了较清楚的训练配置和模块设计,但多组件联动、数据预处理和大模型环境仍会让复现有一定门槛。

产品化成熟度:★★★☆☆ 思路有潜力,尤其适合复杂视频理解和辅助标注场景;但要真正上产品,还得继续压成本、提稳定性、做更强的异常场景验证。

可能的问题:方法链路较长,模块多、依赖强,若事件划分不准,后面的理解和分割也会跟着跑偏。


主要参考文献

[1] Liu, J., Ding, H., He, S., & Jiang, Y.-G. Event-Aware Instructed Assistant for Referring Video Segmentation. arXiv, 2026.
[2] Shipley, T. F., et al. Event Taxonomy related work, cited in the paper.
[3] LISA, SAM, InternVL2, VideoLISA, MeViS 等相关方法与数据集,详见原论文参考文献。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
这篇讲视频分割的“分事件思路”很适合群里继续掰扯,欢迎来一起聊🤘
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。