论文标题:
Context-structured Video Anomaly Detection with Large Vision-Language Models
发表日期:
2026年07月
发表单位:
Yonsei University, Queen Mary University of London, EPFL
原文链接:
https://arxiv.org/pdf/2607.19077v1.pdf
项目链接:
https://dj991108.github.io/CSI-VAD/
论文把视频异常判断拆成三个分支,每个分支盯住一种上下文。这里的“上下文”不是聊天记录里的上下文,而是视频里能帮助理解异常的背景信息。环境上下文看场景,对象上下文看人和物的关系,时间上下文看事件怎么发展。三者各管一摊,避免一个分支既要看场景又要看动作还要猜时间线,最后忙得像在监控室里同时接三通电话。这种分工明确的架构设计,使得每个分支的提示词(prompt)可以高度定制化,从而引导大模型关注最关键的信息,而不是在无关的视觉细节上浪费注意力。图2:CSI-VAD的三个识别模块。环境模块、对象模块和时间模块分别构造不同的输入表示,再交给大视觉语言模型或大语言模型推理。每个模块的输入都经过了精心设计,以确保大模型接收到的是最有利于判断该维度异常的信息。环境模块先抽取三个关键帧,分别对应视频开头、中间和结尾。这样做不是偷懒,而是为了快速抓住场景主基调,比如是不是地铁站、停车场、商店、夜晚街区。大模型先看这些代表性画面,再总结出场所、时段、环境类型和“这个地方通常会发生什么”。这一步相当于先问一句:这里本来应该长什么样?如果场景本身就不对劲,异常的概率自然更高。例如,一个在白天繁忙的商场里出现的人,与一个在凌晨空旷的停车场里出现的人,前者是正常的,后者则可能预示着异常。环境模块通过建立“场景基线”,为后续的异常判断提供了重要的先验知识。论文中具体使用的提示词会引导模型输出诸如“这是一个夜晚的停车场,通常只有车辆进出和少量行人”这样的描述,然后基于这个描述来判断当前场景是否偏离了常态。对象模块更像“盯人盯物”的版本。它先用目标检测和跟踪模型,把视频里的人、车、箱子、商品等目标标出来,再把跟踪框画回原始帧上。这样一来,大模型看到的不是一锅乱炖,而是带着轨迹和身份信息的对象序列。这个设计很聪明,因为很多异常并不体现在“这个场景怪不怪”,而体现在“这个人和这个物体的互动怪不怪”,比如偷窃、打斗、碰撞、抢夺之类。对象模块的输入是一系列带有边界框的帧,这些边界框不仅标出了对象的位置,还通过不同的颜色或ID标识了同一对象在不同帧中的轨迹。大模型因此能够理解“这个人一直在跟踪那个包”或者“这两个人突然开始激烈运动”这样的动态交互信息,从而更准确地判断是否存在异常互动。时间模块则负责把长视频压缩成“事件摘要”。它不是直接把整段视频丢给模型,而是先对稀疏采样帧生成逐帧描述,再把描述按语义相似度切成若干片段,最后交给大语言模型总结每个片段的状态变化。这个思路很像把“流水账”整理成“剧情梗概”,重点不是每一帧都记住,而是抓住事件从平静到异常的演化过程。对异常检测来说,很多线索恰恰藏在变化里,不在静态画面里。例如,一个打架事件,其异常性不仅在于“两个人扭打在一起”这个瞬间,更在于“之前他们在争吵”到“现在他们开始动手”这个状态转变。时间模块通过捕捉这种状态变化,能够识别出那些在单个帧中看起来正常,但在时间序列上呈现出异常演化模式的事件。论文中具体做法是:先用一个视觉语言模型(如BLIP-2)对每帧生成简短描述,然后用一个文本嵌入模型将这些描述向量化,最后用聚类或变化点检测算法将描述序列分割成语义连贯的片段,每个片段对应一个“事件阶段”。大语言模型再基于这些片段描述,判断整个事件的发展是否正常。论文里还专门解释了几个缩写。LVLM是 Large Vision-Language Model,中文可理解为“大视觉语言模型”,既能看图又能读文本;LLM是 Large Language Model,也就是“大语言模型”;VAD是 Video Anomaly Detection,视频异常检测;CSI-VAD则是 Context-Structured Inference for Video Anomaly Detection,中文可以直译为“面向视频异常检测的上下文结构化推理”。名字不算花里胡哨,意思倒是挺实在:别一把梭,按上下文拆开推理。这三个模块之间并非完全独立,它们的输出最终会通过一个聚合模块进行融合,从而形成一个综合的异常判断。这种“分-总”结构,既保证了每个维度分析的深度,又兼顾了全局判断的广度。
[1] W. Sultani, C. Chen, and M. Shah, “Real-world anomaly detection in surveillance videos,” in IEEE Conf. Comput. Vis. Pattern Recognit., 2018.[7] L. Zanella, W. Menapace, M. Mancini, Y. Wang, and E. Ricci, “Harnessing large language models for training-free video anomaly detection,” in IEEE/CVF Conf. Comput. Vis. Pattern Recognit., 2024.[10] A. Acsintoae, A. Florescu, M.-I. Georgescu, T. Mare, P. Sumedrea et al., “UBnormal: New benchmark for supervised open-set video anomaly detection,” in IEEE/CVF Conf. Comput. Vis. Pattern Recognit., 2022.Project page: https://dj991108.github.io/CSI-VAD/ArXiv: https://arxiv.org/pdf/2607.19077v1.pdf