← 返回 PaperDaily
视觉与图像
SENSE-VAD来了:自动驾驶异常检测,终于开始看“关系”了
自动驾驶异常检测最怕的,不是“看不见”,而是“看见了也不知道危险在哪”。这篇论文把问题从运动统计拉回到社会关系,直接把现有方法的盲区掀开了。
龙哥读论文
发布于 2026-08-14 09:11:00
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 自动驾驶异常检测最怕的,不是“看不见”,而是“看见了也不知道危险在哪”。这篇论文把问题从运动统计拉回到社会关系,直接把现有方法的盲区掀开了。
原论文信息如下:
新基准揭秘:自动驾驶为何“看不懂”社会性异常?
自动驾驶最怕的,不是路上突然冒出一个显眼目标,而是目标明明就在眼前,系统却压根不知道“危险”从哪来。一个孩子在路边奔跑、一个成年人抱着另一个人匆匆离开、一个人追着狗横穿人行道,这些场景单看动作都不算离谱,但放到社会关系里,就立刻变味了。说白了,危险不只来自“动得快不快”,还来自“谁和谁在一起、谁在追谁、谁被谁带走”。
这篇论文的核心态度很直接:现有自动驾驶异常检测,大多盯着运动统计,却没真正学会理解社会关系 。于是作者干脆造了一个新基准,把问题从“看见异常动作”推进到“看懂异常关系”。这一下,很多老方法就不太体面了。
SENSE-VAD 这个名字里,Sentient 可以理解成“有感知的”,Semantic 则是“语义的”。合在一起,就是想让模型不只看像素和轨迹,还要对场景里的社会语义有点“常识”。这里的异常检测,英文是 Video Anomaly Detection, VAD ,中文一般叫视频异常检测 。过去很多 VAD 方法,擅长抓“突然加速”“突然转向”“突然出现一个怪东西”,但对“关系异常”非常迟钝。
检测困境:运动统计异常的“视觉盲区”
先把问题讲人话:很多异常检测模型,本质上是在问“这段视频像不像平时见过的正常视频”。如果像,就判正常;不像,就判异常。问题来了,社会性异常往往看起来一点都不怪 。一个孩子奔跑、一个成年人快走、一个人抱着包离开,单独看都不一定异常。真正的异常藏在关系里:孩子是不是离开监护人?包是不是被故意丢下?狗是不是没人牵着?
这就解释了为什么很多基于重建、预测、特征距离的方法会失灵。它们最擅长的是抓“运动统计上的离群点”,也就是动作突然不符合训练分布;但 SENSE-VAD 里最麻烦的场景,恰恰是动作本身很正常,只是社会语义不正常 。换句话说,模型看到的是“人类世界的表面皮肤”,没看到“关系骨架”。
这张表其实已经把老问题说透了。比如 DoTA 更偏事故和车辆行为,AnoVox 更偏单目标异常,ComplexVAD 虽然有关系异常味道,但不是自动驾驶第一视角。SENSE-VAD 的野心,不是再补一个“看起来更复杂”的数据集,而是把异常的定义方式 改掉:不再问“这个动作怪不怪”,而是问“这个关系对不对”。
SENSE-VAD登场:首个社会性复杂异常基准
SENSE-VAD 的关键不是“多拍了几段视频”,而是先设计了一套社会性异常分类学 。论文把 15 类异常分成 6 个概念类别,比如儿童安全、群体行为、个体行为、人-物交互、骑行者交互、车辆与行人。每一类都不是按表面动作分,而是按模型需要理解的社会线索来分。
这个分类学很有意思,因为它不是“学术上分得漂亮”,而是直接服务于自动驾驶决策。比如“Child Running from Guardian”和“Dog Leaving Owner”在动作层面都像“一个目标在跑”,但在风险层面完全不同:前者和道路安全、监护关系强相关,后者则更像未受控制的动物进入车道风险。论文把这些场景拆开,等于逼模型别再靠偷懒的运动特征糊弄过去。
数据本身也不是随便拼的。作者用 CARLA 模拟器和 Unreal Engine 构建场景,按类别选择不同版本的 CARLA:有的版本更适合多人群体行为,有的更适合骨骼绑定和物体挂载,还有的更适合动物骨架控制。说白了,不是一个引擎包打天下,而是按任务选工具 。
这里还有一个很关键的设计:作者不仅做了异常视频,还给每类异常配了正常对照场景。比如孩子正常跟着监护人走、狗被牵着走、袋子没有被丢下。这样一来,模型如果真能分辨异常,就不能只靠“这张图里有孩子/狗/袋子”这种粗暴线索,而必须学会看关系变化 。
再看标注方式,论文也比较克制。异常从“社会性异常条件被明确建立”的那一帧开始算起,之后到视频结束都标为异常,前面的模糊帧全部保守地记为正常。这个做法不花哨,但很重要,因为它避免把边界帧硬塞成异常,导致模型学到一堆噪声。做数据,最怕的不是少标一点,而是把不确定当真理 。
多引擎构建,确保场景真实性与多样性
这部分最能看出作者不是只想“造个数据集交差”。他们用 CARLA 0.9.12、0.9.15 和 0.10.0 配合 UE4/UE5,原因很现实:不同版本擅长的事情不一样 。有人适合多人群体行为,有人适合骨骼绑定,有人适合动物动画。硬是拿一个版本硬扛,最后只会得到“看起来像、实际上不对”的假场景。
作者还尝试过 GTA V、CarSim、ETS,以及一些文生视频模型,最后都没作为主方案。原因也很工程:有的闭源,有的缺少行人交互控制,有的物理一致性不够,还有的会在复杂多人场景里乱编。这里没有“谁更潮就用谁”,只有一句朴素真理:做异常检测,物理和交互的可信度比画面更重要 。
11种SOTA方法“折戟”,社会性异常的独特挑战
结果很直接,也很扎心:11 个基线方法里,没有一个超过 57.2% AUC。更夸张的是,有些方法还低于随机水平。这个结果不是“模型不够大”,而是说明评价对象本身换了赛道 。过去那些拿来就能跑的运动统计招式,在这里基本失灵。
半监督方法里,未来帧预测那套很典型:训练时只看正常视频,测试时看预测误差。问题是,SENSE-VAD 的异常本来就不一定产生明显的运动惊讶。孩子朝监护人跑,和孩子朝车道跑,速度都可能差不多,轨迹也未必夸张,模型自然抓不住。换句话说,预测错了不等于社会关系错了 ,这两件事在这里不是一回事。
弱监督方法也没占到便宜。基于视觉-语言对齐的模型,或者基于特征分布距离的方法,看起来更“语义”,实际上还是经常卡在表层。因为它们依赖的特征空间,主要还是把“长得像不像正常”当判断依据,而社会异常偏偏是“长得像正常,关系却不正常”。这就像让一个只会看衣服颜色的人去判断家庭关系,多少有点为难。
更有意思的是,训练自由的基础模型推理也没讨到好。按直觉,既然它们会做图文理解、会讲自然语言规则,应该更适合这种“关系异常”。但现实很冷:它们能描述场景,却未必能把“看见”转成“识别异常”。论文里的一个探针实验甚至显示,某些视觉语言模型在异常帧上干脆不把异常当异常。这个结果很说明问题:会说,不等于会判;会描述,不等于会警觉 。
这张探针图的意思很简单:模型对“安全”问题几乎总是回答有风险,但对真正的异常并没有稳定识别能力。也就是说,它像个过度紧张的门卫,看到啥都想拉警报,真碰上坏人时反而没谱了。这个现象挺讽刺,但也挺真实:没有关系理解,语义模型也会变成空壳 。
龙哥总结
SENSE-VAD 最值得记住的,不是“又一个自动驾驶数据集”,而是它把异常检测的定义往前推了一步:异常不一定长得怪,但一定可能关系不对 。这句话听着像常识,做成数据和评测却一点都不简单。作者用多版本 CARLA、UE4/UE5、真实世界补充片段、逐帧标签和开放集划分,把这个常识做成了能实打实测模型的基准。
这项工作对行业的意义也很明确:自动驾驶不能只靠“检测到物体”或者“看出轨迹异常”就算安全,真正难的是对长尾社会场景保持警觉。对工程团队来说,这意味着异常检测的训练目标、数据采样方式、甚至评测标准都该升级;对研究者来说,这意味着下一步不该只卷 backbone,而要卷关系建模、社会语义、开放集泛化 。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是自动驾驶异常检测里一个被长期忽略的盲区:很多危险不是“动作异常”,而是“社会关系异常”。SENSE-VAD 用新数据集把这个问题单独拎出来测,逼模型别再只盯运动统计。
文中说的“社会性异常”是什么意思? 就是异常的判定要看人物、车辆、动物、物体之间的关系,而不是只看单个目标是否跑得快、转得急、长得怪。比如孩子离开监护人、狗离开主人、有人追逐别人,这些都属于关系层面的异常。
为什么很多现成方法在这个基准上都不行? 因为它们大多依赖运动预测、特征距离或视觉语义描述,但这些信号都很难直接表达“谁和谁的关系变了”。社会异常在动作上可能很正常,所以模型即便看见了,也未必能判断它危险。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是简单做一个更大的数据集,而是把“社会关系”作为异常定义核心,这个切口挺准。
实验合理度: ★★★★☆ 基准设计、开放集划分、逐帧标注和多范式对比都比较完整,结果也和方法机理对得上。
学术研究价值: ★★★★★ 这篇工作把自动驾驶异常检测从运动统计往社会语义推进了一步,研究意义很明确。
稳定性: ★★★☆☆ 作为基准本身很稳,但真正可落地的检测系统还得补强跨域泛化和实时推理。
适应性以及泛化能力: ★★★☆☆ 对社会性长尾场景有启发,但当前仍主要是仿真主导,真实复杂城市场景还要继续补数据。
硬件需求及成本: ★★★☆☆ 数据集生成依赖模拟器和多版本引擎,训练成本不算低,但推理侧未必特别重。
复现难度: ★★★☆☆ 数据和生成脚本公开是加分项,但多引擎、多版本、场景脚本调试仍然不算轻松。
产品化成熟度: ★★★☆☆ 更像是安全评测与研究基座,离大规模产品落地还差一段真实世界验证。
可能的问题: 数据以合成场景为主,真实社会异常覆盖还有限;模型评测也说明“看懂关系”仍然是难题。
主要参考文献
[1] Nghia T. Nguyen, Lokman Bekit, Yasin Yilmaz. SENSE-VAD: Sentient and Semantic Video Anomaly Detection for Autonomous Driving. arXiv:2205.06983, 2022.
[2] 论文中引用的相关基准与方法:CARLA、DriveLM、Qwen3-VL-4B-Instruct 等。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!