← 返回 PaperDaily 视觉与图像

无需训练就能做异常检测?CSI-VAD新思路来了

视频异常检测最怕什么?不是模型不够大,而是它总爱把整段视频一锅端,结果真正的异常被“正常背景”冲掉了。CSI-VAD干脆把视频拆成环境、对象、时间三路分别看,零训练也能把异常线索抓得更稳。

无需训练就能做异常检测?CSI-VAD新思路来了
原论文信息如下:
论文标题:
Context-structured Video Anomaly Detection with Large Vision-Language Models 发表日期:
2026年07月 发表单位:
Yonsei University, Queen Mary University of London, EPFL 原文链接:
https://arxiv.org/pdf/2607.19077v1.pdf 项目链接:
https://dj991108.github.io/CSI-VAD/

大模型拯救监控:无训练视频异常检测新思路

视频异常检测这活儿,说白了就是在一大段“看起来都挺正常”的监控里,找出那几秒钟不对劲的地方。难点不在“看”,而在“别被正常背景带跑偏”。这篇论文的思路很直接:既然大视觉语言模型已经会看、会描述、还会总结,那就别让它一口气吞整段视频,而是把视频拆成环境、对象、时间三个上下文,分别判断,再把结果合起来。听上去像“拆开看更清楚”,但真正厉害的地方在于:它是训练免费的,不用为异常类型重新标注,也不用为某个数据集专门调教。这意味着,当你面对一个全新的监控场景——比如从商场换到停车场,或者从白天换到夜晚——CSI-VAD不需要重新收集异常样本、不需要重新训练模型,直接拿过来就能用。这种“开箱即用”的特性,在实际安防部署中价值巨大,因为真实世界的异常类型层出不穷,你永远不可能提前标注完所有可能出现的“不对劲”。
图1:CSI-VAD整体框架图
图1:CSI-VAD整体框架图。输入视频先被拆成环境、对象和时间三个上下文分支,每个分支独立推理,最后再做聚合,输出视频级异常判断。这个框架的核心在于“分而治之”——把复杂的视频理解任务拆解成三个相对独立的子问题,每个子问题都有明确的输入输出和判断标准,从而降低单一模型被长视频背景信息淹没的风险。
这类方法的价值不在于“又多了一个大模型接口”,而在于它试图解决一个很现实的问题:传统训练型异常检测太吃标注,换个场景就容易翻车;而直接把整段视频丢给大模型,又容易被冗长背景稀释掉真正的异常线索。CSI-VAD的做法像是把监控员的脑子拆成三块:先看现场像不像“出事的地方”,再看人物和物体在干什么,最后看事件是怎么一步步演变的。这个拆法不花哨,但很像工程里真正能落地的思路。它没有引入复杂的数学公式或者花哨的网络结构,而是巧妙地利用了现有大模型的能力,通过输入结构的优化来提升输出质量。这种“重架构、轻训练”的思路,在算力成本日益高昂的今天,显得尤为务实。

拆解视频三要素:环境、对象、时间分别检测异常

论文把视频异常判断拆成三个分支,每个分支盯住一种上下文。这里的“上下文”不是聊天记录里的上下文,而是视频里能帮助理解异常的背景信息。环境上下文看场景,对象上下文看人和物的关系,时间上下文看事件怎么发展。三者各管一摊,避免一个分支既要看场景又要看动作还要猜时间线,最后忙得像在监控室里同时接三通电话。这种分工明确的架构设计,使得每个分支的提示词(prompt)可以高度定制化,从而引导大模型关注最关键的信息,而不是在无关的视觉细节上浪费注意力。
图2:CSI-VAD的三个识别模块
图2:CSI-VAD的三个识别模块。环境模块、对象模块和时间模块分别构造不同的输入表示,再交给大视觉语言模型或大语言模型推理。每个模块的输入都经过了精心设计,以确保大模型接收到的是最有利于判断该维度异常的信息。
环境模块先抽取三个关键帧,分别对应视频开头、中间和结尾。这样做不是偷懒,而是为了快速抓住场景主基调,比如是不是地铁站、停车场、商店、夜晚街区。大模型先看这些代表性画面,再总结出场所、时段、环境类型和“这个地方通常会发生什么”。这一步相当于先问一句:这里本来应该长什么样?如果场景本身就不对劲,异常的概率自然更高。例如,一个在白天繁忙的商场里出现的人,与一个在凌晨空旷的停车场里出现的人,前者是正常的,后者则可能预示着异常。环境模块通过建立“场景基线”,为后续的异常判断提供了重要的先验知识。论文中具体使用的提示词会引导模型输出诸如“这是一个夜晚的停车场,通常只有车辆进出和少量行人”这样的描述,然后基于这个描述来判断当前场景是否偏离了常态。
对象模块更像“盯人盯物”的版本。它先用目标检测和跟踪模型,把视频里的人、车、箱子、商品等目标标出来,再把跟踪框画回原始帧上。这样一来,大模型看到的不是一锅乱炖,而是带着轨迹和身份信息的对象序列。这个设计很聪明,因为很多异常并不体现在“这个场景怪不怪”,而体现在“这个人和这个物体的互动怪不怪”,比如偷窃、打斗、碰撞、抢夺之类。对象模块的输入是一系列带有边界框的帧,这些边界框不仅标出了对象的位置,还通过不同的颜色或ID标识了同一对象在不同帧中的轨迹。大模型因此能够理解“这个人一直在跟踪那个包”或者“这两个人突然开始激烈运动”这样的动态交互信息,从而更准确地判断是否存在异常互动。
时间模块则负责把长视频压缩成“事件摘要”。它不是直接把整段视频丢给模型,而是先对稀疏采样帧生成逐帧描述,再把描述按语义相似度切成若干片段,最后交给大语言模型总结每个片段的状态变化。这个思路很像把“流水账”整理成“剧情梗概”,重点不是每一帧都记住,而是抓住事件从平静到异常的演化过程。对异常检测来说,很多线索恰恰藏在变化里,不在静态画面里。例如,一个打架事件,其异常性不仅在于“两个人扭打在一起”这个瞬间,更在于“之前他们在争吵”到“现在他们开始动手”这个状态转变。时间模块通过捕捉这种状态变化,能够识别出那些在单个帧中看起来正常,但在时间序列上呈现出异常演化模式的事件。论文中具体做法是:先用一个视觉语言模型(如BLIP-2)对每帧生成简短描述,然后用一个文本嵌入模型将这些描述向量化,最后用聚类或变化点检测算法将描述序列分割成语义连贯的片段,每个片段对应一个“事件阶段”。大语言模型再基于这些片段描述,判断整个事件的发展是否正常。
论文里还专门解释了几个缩写。LVLM是 Large Vision-Language Model,中文可理解为“大视觉语言模型”,既能看图又能读文本;LLM是 Large Language Model,也就是“大语言模型”;VAD是 Video Anomaly Detection,视频异常检测;CSI-VAD则是 Context-Structured Inference for Video Anomaly Detection,中文可以直译为“面向视频异常检测的上下文结构化推理”。名字不算花里胡哨,意思倒是挺实在:别一把梭,按上下文拆开推理。这三个模块之间并非完全独立,它们的输出最终会通过一个聚合模块进行融合,从而形成一个综合的异常判断。这种“分-总”结构,既保证了每个维度分析的深度,又兼顾了全局判断的广度。

无需标注、无需训练:CSI-VAD如何实现更优检测?

这篇工作的真正重点,不是“用了大模型”,而是“怎么让大模型别犯懒”。直接做整段视频的全局判断,往往会遇到两个问题:第一,信息太杂,大模型容易抓错重点;第二,异常太稀有,单次全局推理很容易被正常内容淹没。CSI-VAD的解法是把一个难题拆成三个相对容易的小题,再让每个分支各自输出异常标签、异常分数和简短解释,最后再聚合。这样做的收益很现实:减少对异常文本提示词的依赖,也减少了对数据集专门调参的需求。在传统的训练免费方法中,提示词的设计往往需要针对特定数据集进行大量调试,比如在UCF-Crime数据集上表现良好的提示词,换到UBnormal上可能效果大打折扣。CSI-VAD通过结构化分解,使得每个分支的提示词更加通用,例如环境模块的提示词只需关注“场景描述”,对象模块的提示词只需关注“对象交互”,这些任务本身具有跨数据集的通用性,从而提升了方法的泛化能力。
从工程角度看,这个设计的代价也很明确:它不是一个单模型一把梭的轻量方案,而是要同时跑多个大模型调用,还要加上目标检测和跟踪。也就是说,它省了训练成本,换来了推理成本。论文没有回避这一点,反而在结尾直接承认:如果要上实时监控,算力和延迟都得认真算账。这个态度比“demo很丝滑,落地再说”靠谱得多。具体来说,CSI-VAD的推理流程包括:运行一个目标检测模型(如YOLOv8)和一个目标跟踪模型(如ByteTrack),然后对三个分支分别调用LVLM或LLM进行推理。这意味着对于一个视频,可能需要调用大模型3到4次(环境模块1次,对象模块1次,时间模块可能多次)。虽然单次调用大模型的成本在下降,但累积起来仍然不菲。因此,论文也指出,未来的工作可以探索如何通过级联或缓存机制来减少大模型的调用次数。
如果把流程说得更白一点,大概就是下面这条线:
    输入视频
    → 取环境关键帧,生成场景描述
    → 做目标检测和跟踪,生成对象叠加图
    → 逐帧生成字幕,再按语义切分并总结时间状态
    → 三个分支分别输出异常标签、异常分数、解释
    → 用打分融合和投票规则得到最终异常判断
    这里最值得注意的一点是,三个分支不是重复劳动,而是在看不同证据。环境分支更擅长压制“看起来很吓人但其实正常”的误报;对象分支更擅长抓住人和物之间的异常互动;时间分支则更擅长识别事件进程中的异常演化。也就是说,它不是让三个模型投票凑热闹,而是让三个视角互相补位。这个结构化拆分,正是它比“整段视频直接问大模型”更稳的原因。例如,一个在夜晚街道上快速奔跑的人,环境分支可能会因为“夜晚街道”这个场景而提高警惕,对象分支可能会因为“人快速移动”而给出中等异常分数,而时间分支如果看到这个人是从一辆车旁边开始奔跑的,可能会结合“从车旁跑开”这个事件演化给出更高的异常分数。三个分支的证据相互印证,最终得出一个更可靠的结论。

    UCF-Crime上AUC达92.9%:比肩甚至超越训练型方法

    实验部分的看点很直接:在 UCF-Crime 和 UBnormal 上,CSI-VAD 作为训练免费方法,能不能真的打过一些训练型方法?答案是:能,而且不是碰运气那种赢法。论文在不同评测协议、不同采样帧数下都做了验证,说明提升不是某个设置下偶然冒出来的。UCF-Crime是一个包含128小时监控视频的大型数据集,涵盖了13种真实世界的异常行为,如盗窃、打架、枪击等。UBnormal则是一个合成数据集,用于测试模型的开放集检测能力。在这两个差异巨大的数据集上都取得优异表现,有力地证明了CSI-VAD的鲁棒性和泛化能力。
    表1:UCF-Crime上的代表性视频级异常检测方法对比
    表1:UCF-Crime上的代表性视频级异常检测方法对比。可以看到,CSI-VAD 的均值集成和 Noisy-OR 在训练免费设置下已经接近并超过部分训练型方法。值得注意的是,表中对比的训练型方法包括了一些近年来性能很强的基线,如DUAL-VAD和GCN-based方法。CSI-VAD能够与这些需要大量标注数据训练的方法相抗衡,甚至在某些指标上超越它们,这充分展示了“结构化推理”策略的巨大潜力。
    在论文采用的一个对比表里,CSI-VAD 的 Mean Ensemble 和 Noisy-OR 都达到了92.9%左右的AUC,已经超过了不少传统训练方法,和强基线 DUAL-VAD 也几乎打平甚至略高。这一点很重要,因为它说明上下文拆分不是“换个说法包装一下大模型”,而是真的把异常线索挖出来了。尤其是在训练数据稀缺、异常类型变化大、场景迁移强的监控任务里,训练免费方案的实用意义非常高。AUC(Area Under the ROC Curve)是评估异常检测模型性能的常用指标,它衡量的是模型在不同阈值下的综合表现。92.9%的AUC意味着模型有很高的概率将异常视频排在正常视频前面,这是一个非常优秀的成绩。
    表2:与近期方法在UCF-Crime上的对比
    表2:与近期方法在UCF-Crime上的对比。在统一评测协议下,CSI-VAD 明显优于训练免费基线 LAVAD,也能压过部分训练型方法。这个结果说明,结构化上下文推理不是只在某个表格里“看起来不错”,而是在更接近真实对比的设置里也站得住。LAVAD是2024年提出的一种训练免费方法,它直接使用大语言模型对视频字幕进行推理。CSI-VAD相比LAVAD的提升,主要来自于其结构化的多分支设计,而不是简单地换了一个更大的模型。这进一步印证了“如何用”比“用什么”更重要的观点。
    更有意思的是,论文还专门看了采样帧数从 32 到 256 的变化。结果显示,不管帧数多还是少,CSI-VAD 都比直接整段推理的基线更稳。也就是说,它不是靠“喂更多帧”硬堆出来的,而是靠分解上下文把信息利用得更好。对于实际部署来说,这种特性很关键:监控系统往往不可能无限加算力,方法如果对输入预算太敏感,落地时就很容易露馅。例如,一个需要处理1000路摄像头的安防中心,每路摄像头如果都要采样256帧进行分析,计算压力会非常大。CSI-VAD在32帧的低采样率下依然能保持较高的性能,这意味着它可以在更低的计算成本下运行,从而支持更大规模的部署。
    表3:不同采样预算下的AUC-ROC表现
    表3:不同采样预算下的AUC-ROC表现。无论是在 UCF-Crime 还是 UBnormal 上,CSI-VAD 都持续优于直接基线;在较低采样预算下,Noisy-OR 往往更占优,而在更高预算下,Mean Ensemble 表现更稳。这个趋势非常有趣,它揭示了不同聚合策略在不同信息密度下的行为差异。当采样帧数少时,每个分支获得的信息都不完整,此时任何一个分支的强烈信号都值得重视,因此Noisy-OR这种“一票通过”的机制更有效。而当采样帧数多时,信息更充分,取平均可以平滑掉单个分支的偶然波动,因此Mean Ensemble更稳定。
    这说明不同聚合方式的性格不一样。Max Ensemble 像“只看最强证据”,适合抓明显异常;Mean Ensemble 像“综合判断”,更稳定;Noisy-OR 则偏向“只要有一个分支强烈报警,就提高总分”,因此对稀疏采样更敏感。论文把这些策略都保留下来,没有强行说某一种永远最好,这种做法比较诚实,也更符合工程现实。在实际应用中,用户可以根据自己的需求(是更怕漏报还是更怕误报)和计算资源(采样帧数多少)来灵活选择最合适的聚合策略。
    表4:视频级二分类性能对比
    表4:视频级二分类性能对比。这里最亮眼的是 OR 聚合,也就是只要任一分支判异常就触发报警。它把召回率拉了上去,同时保持了不错的精度,说明“宁可多报一点,也别漏掉异常”的策略在这个任务里更实用。召回率(Recall)衡量的是模型找出了多少真正的异常,而精度(Precision)衡量的是模型找出的异常中有多少是真正的异常。在安防场景中,漏报一个真正的异常(如盗窃)可能造成巨大损失,而误报(如把正常活动当成异常)通常只会增加一些人工复核的成本。因此,高召回率往往比高精度更重要,OR聚合策略正好满足了这一需求。
    这部分结果有个很朴素但很重要的结论:在异常检测里,漏报往往比误报更糟。严格的 AND 投票要求三个分支都说异常,结果召回率反而掉得厉害;OR 投票虽然更宽松,但更容易把真正异常捞出来。论文没有把这个结论包装成玄学,而是用数据说明:多上下文分支最有价值的地方,不是让系统更“谨慎”,而是让系统更“有机会看见异常”。AND投票虽然精度很高,但会错过很多只有一两个分支能察觉到的细微异常,这在安防场景中是不可接受的。
    表5:UCF-Crime异常类别级准确率
    表5:UCF-Crime异常类别级准确率。OR 聚合在多个类别上都有明显提升,尤其是 burglary、assault、shoplifting、shooting、fighting 这些更依赖对象互动或事件演化的类别,提升更明显。这个细粒度的分析非常有价值,它揭示了不同分支对不同类型异常的贡献。例如,对于“shoplifting”(入店行窃),对象分支(关注人与商品的互动)和时间分支(关注事件从挑选到藏匿的演化)可能贡献更大;而对于“explosion”(爆炸),环境分支(关注场景的突然变化)可能贡献更大。OR聚合能够综合所有分支的优势,从而在各类异常上都取得更好的表现。
    这也反过来验证了方法设计:对象分支和时间分支确实在补足全局推理容易漏掉的细节。比如偷窃不一定场景很怪,但对象交互很怪;打架不一定场景很怪,但时间上会出现冲突升级;停车场夜景本身不异常,但光照突变可能让全局模型误判。CSI-VAD 的优势就在于,它不是只看“像不像异常”,而是看“哪个上下文在支持异常”。这种多证据交叉验证的方式,使得模型在面对复杂、模糊的异常场景时,能够做出更可靠的判断。
    图3:UCF-Crime中的定性示例
    图3:UCF-Crime中的定性示例。前三个案例分别展示时间、对象、环境分支如何纠正整体基线的误判,最后一个案例则展示了稀疏采样导致的失败情形。这些可视化案例非常直观地展示了CSI-VAD的工作机制。例如,在一个“爆炸”场景中,整体基线可能因为画面中突然出现的火光和烟雾而判断为异常,但环境分支可能会指出“这是一个施工场地,有控制的爆破作业是正常的”,从而纠正误判。而在一个“商店盗窃”场景中,整体基线可能只看到一个人在正常购物,但对象分支通过跟踪发现这个人的手一直在货架和口袋之间移动,从而识别出异常。
    论文给出的可视化案例其实比数字更有说服力。地铁打斗场景里,整体基线把它看成普通公共空间活动,时间分支却能抓到持续冲突和奔跑;商店盗窃场景里,对象分支把人和货架的互动盯住了;停车场夜景里,环境分支成功压住了“光线突变就当爆炸”的误报。最后那个失败案例也很关键:如果异常只出现极短时间,而采样刚好没抓到,那三个分支都可能无从下手。这个失败不是小瑕疵,而是结构化推理在稀疏采样下的硬边界。它提醒我们,任何方法都有其局限性,CSI-VAD虽然强大,但依然受限于输入信息的完整性。未来的工作可以探索如何通过自适应采样或运动检测来缓解这个问题。

    三个臭皮匠赛过诸葛亮:多上下文聚合让检测更稳健

    CSI-VAD 最像样的地方,恰恰在聚合策略。单个分支可能只看见局部证据,但多个分支合起来,就能形成更完整的异常判断。论文把分数聚合和标签聚合分开处理,这一点很专业:打分用于排序评测,投票用于二分类评测,两者目标不同,不能混为一谈。在AUC-ROC这类排序指标中,我们需要的是每个视频的连续异常分数,因此采用Mean Ensemble或Noisy-OR这样的分数聚合方式更合适。而在二分类任务中,我们需要的是最终的“异常/正常”标签,因此采用OR、AND或Majority Vote这样的标签聚合方式更直接。
    从方法论上看,这种设计很像把“专家会诊”搬进了视频异常检测。环境专家负责判断场地是否异常,对象专家负责判断交互是否异常,时间专家负责判断演化是否异常。会诊的好处是能降低单一视角的偏差,坏处是系统更复杂、推理更慢。CSI-VAD 没有假装自己是“零成本方案”,而是明确承认:它换来了更好的泛化,也换来了更高的推理开销。这个代价,论文交代得很清楚。这种坦诚在学术论文中难能可贵,它让读者能够更全面地评估方法的优缺点,而不是被华丽的实验结果所迷惑。
    从结果上看,Mean Ensemble 和 Noisy-OR 是最稳的两种聚合方式,说明多分支信息确实有互补性。Max Ensemble 更像“抓最强异常线索”,在某些设置下不错,但容易受单个分支波动影响;Mean Ensemble 更均衡;Noisy-OR 则更适合异常稀疏、不能错过报警的场景。要是把它类比成安防系统,Max 是“盯最可疑的人”,Mean 是“综合巡逻”,Noisy-OR 则是“任一摄像头报警都先拉响警报”。这个类比非常形象,有助于读者理解不同聚合策略背后的逻辑。在实际部署中,可以根据安防等级和风险偏好来选择不同的策略:对于银行金库等高安全等级场所,可以采用Noisy-OR策略以确保万无一失;对于商场等一般场所,可以采用Mean Ensemble策略以平衡准确率和召回率。

    局限与未来:稀疏采样与推理效率如何突破?

    这篇论文最诚实的地方,是没有把“训练免费”说成“完全免费”。它的局限也很明确:如果异常发生得太短,而采样帧没抓到,三个分支都会失去关键证据。此外,目标检测、跟踪、LVLM、LLM 这几步串起来,推理链条并不轻,实时监控部署时必须考虑吞吐量和延迟。例如,一个只有几帧的“快速抢夺”事件,如果采样间隔是16帧,很可能根本就没采到那关键的几帧,导致模型完全错过这个异常。同样,对于需要处理24小时不间断视频流的安防系统,CSI-VAD目前的推理速度可能还无法满足实时性要求。
    未来如果要继续往前走,方向大概有两个。一个是更聪明的采样,不是固定间隔硬抽帧,而是根据场景变化或对象运动自适应挑帧;另一个是更轻的上下文建模,不一定每个分支都用大模型全量推理,可以考虑轻量视觉编码器、局部缓存或者分层触发机制。说得直白点,就是既要看得准,也得跑得动,不然只能停留在“论文里很美,机房里很贵”的阶段。自适应采样可以基于运动检测或光流信息,只在场景发生显著变化时才增加采样密度,从而在保证检测精度的同时降低计算量。轻量上下文建模则可以探索使用更小的、专门蒸馏过的模型来替代庞大的通用大模型,或者通过级联架构,先用一个快速但粗糙的模型进行初筛,只有初筛认为可疑的视频才送入完整的多分支推理流程。
    不过从研究角度看,这篇工作的启发还是挺清楚的:当一个任务的误差主要来自“信息太杂、证据太散”时,最先该想的未必是堆更大的模型,而是把输入结构化。这比单纯追求更大参数量更接近工程现实,也更容易迁移到别的场景,比如工业质检、安防巡检、长视频事件理解等。CSI-VAD的成功表明,在AI领域,有时“如何组织信息”比“使用什么模型”更为关键。这种结构化推理的思想,有望在未来被应用到更多复杂的视频理解任务中。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:

    这篇论文到底解决了什么问题?它解决的是“训练成本高、全局推理容易漏异常”的视频异常检测问题。方法把视频拆成环境、对象、时间三个上下文分别判断,再聚合结果,从而在不训练的前提下提升检测效果。核心贡献在于提出了一种通用的、无需训练的、结构化的视频异常检测框架。

    环境、对象、时间三个分支分别在看什么?环境分支看场景是否符合常识,对象分支看人和物的互动是否异常,时间分支看事件是否沿着异常方向发展。三者关注点不同,所以能互补。环境分支建立“场景基线”,对象分支捕捉“交互异常”,时间分支识别“演化异常”。

    Noisy-OR、Mean Ensemble、OR投票这些词是什么意思?Noisy-OR 是一种“只要多个分支里有一个强烈异常,整体异常概率就上升”的融合方式;Mean Ensemble 是把三个分支分数平均;OR 投票则是只要任一分支判异常就触发最终异常。它们分别对应不同的风险偏好。Noisy-OR适合高召回率需求,Mean Ensemble适合平衡场景,OR投票则是最激进的策略。

    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★☆☆

    把“整段视频直接问大模型”改成“按环境、对象、时间拆开推理”,思路不算颠覆,但拆得比较合理,属于把已有能力用对地方。创新点在于“结构化”而非“模型”。

    实验合理度:★★★★☆

    对比了训练免费基线、训练型方法、不同采样预算和不同聚合策略,实验链条完整,结论也和方法设计一致。消融实验和可视化分析做得尤其出色。

    学术研究价值:★★★★☆

    它给视频异常检测提供了一个清晰的上下文分解范式,对长视频理解、零样本检测和多模态推理都有借鉴意义。为后续的“结构化提示”研究开辟了新方向。

    稳定性:★★★☆☆

    在常规采样和公开视频集上表现不错,但对短暂异常和稀疏采样仍然敏感,稳定性还没到“随便上生产”的程度。对输入信息的完整性依赖较高。

    适应性以及泛化能力:★★★★☆

    训练免费本身就带来较强迁移性,尤其适合场景变化大、异常标注难的监控任务。在两个差异巨大的数据集上表现一致,证明了其泛化能力。

    硬件需求及成本:★★☆☆☆

    推理要跑检测、跟踪和多次大模型调用,成本不低;训练省了,算力账却不能装作没看见。这是当前方法最主要的短板。

    复现难度:★★★☆☆

    方法组件比较多,但项目页、模型选择和实验设置都给得较清楚,属于“能复现,但不算轻松”。主要工作量在于搭建推理pipeline。

    产品化成熟度:★★★☆☆

    适合离线安防分析和辅助审查,不适合直接拿去做低延迟实时报警;若能做轻量化上下文选择,成熟度会明显提升。目前更适合作为安防系统的“第二道防线”。

    可能的问题:方法靠多次大模型推理和稀疏采样支撑,遇到短暂异常、算力受限或场景极端复杂时,效果和效率都可能打折。对快速发生的、持续时间极短的异常事件检测能力有限。


    主要参考文献

    [1] W. Sultani, C. Chen, and M. Shah, “Real-world anomaly detection in surveillance videos,” in IEEE Conf. Comput. Vis. Pattern Recognit., 2018.
    [7] L. Zanella, W. Menapace, M. Mancini, Y. Wang, and E. Ricci, “Harnessing large language models for training-free video anomaly detection,” in IEEE/CVF Conf. Comput. Vis. Pattern Recognit., 2024.
    [10] A. Acsintoae, A. Florescu, M.-I. Georgescu, T. Mare, P. Sumedrea et al., “UBnormal: New benchmark for supervised open-set video anomaly detection,” in IEEE/CVF Conf. Comput. Vis. Pattern Recognit., 2022.
    Project page: https://dj991108.github.io/CSI-VAD/
    ArXiv: https://arxiv.org/pdf/2607.19077v1.pdf

    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎交流探讨,理性发言哦~ 想看更多原文细节,记得点“阅读原文”。

    end
    欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,方便更快通过。一起拆论文、聊方法、看门道,别让好思路只停在摘要里。
    wechat_helperdianzan
    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。