实时异常检测新突破:YOLO+CLIP双阶段框架实现51FPS

从多组件到两阶段:架构简化的核心设计
零样本语义评分:CLIP文本提示如何工作
三大数据集验证:性能与速度的平衡
局限与展望:固定提示的边界与未来方向
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
提出两阶段轻量级框架,第一阶段用YOLO v11n-pose同时完成行人检测和17个骨骼关键点提取,第二阶段用CLIP ViT-B/32对裁剪行人区域编码并与预定义异常行为文本提示计算余弦相似度,实现实时视频异常检测。实验合理度:★★★★☆
帧级AUROC、精确率、召回率、mAP@.5、mAP@.5:.95、端到端吞吐量(FPS)学术研究价值:★★★★☆
提出两阶段轻量级框架,第一阶段用YOLO v11n-pose同时完成行人检测和17个骨骼关键点提取,第二阶段用CLIP ViT-B/32对裁剪行人区域编码并与预定义异常行为文本提示计算余弦相似度,实现。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
端到端处理速度51.39 FPS(NVIDIA Titan XP GPU),相比基线方法提升3.36倍。复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:1) 仅覆盖四种固定异常类型,对超出提示范围的异常检测能力有限;2) 在ShanghaiTech Campus等场景多样化的数据集上性能较低;
主要参考文献
监控视频千千万,AI眼睛帮你盯!
想和更多同行一起聊视频异常检测、目标检测、多模态大模型?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 视频异常检测+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,等你来唠~
想和更多同行一起聊视频异常检测、目标检测、多模态大模型?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 视频异常检测+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,等你来唠~
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!