← 返回 PaperDaily 视觉与图像

机器人总“掉链子”? Fail-RAG:让 VLM 一眼看穿故障,准确率飙升 25%

给大模型加个“外挂经验库”,不用微调就能让机器人自己看懂各种故障。Fail-RAG 思路巧妙,效果扎实。无论是识别“夹爪歪了”还是“轮子卡了”,准确率都实打实提升了。想知道怎么做到的?看下去就对了。

机器人总“掉链子”? Fail-RAG:让 VLM 一眼看穿故障,准确率飙升 25%
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! xingqiu_header

龙哥推荐理由:
给大模型加个“外挂经验库”,不用微调就能让机器人自己看懂各种故障。Fail-RAG 思路巧妙,效果扎实。无论是识别“夹爪歪了”还是“轮子卡了”,准确率都实打实提升了。想知道怎么做到的?看下去就对了。


论文标题:
Fail-RAG : A Retrieval Augmented Generation Informed Framework for Robot Failure Identification
发表日期:
2026年06月

发表单位:
Ameya Salvi and Jie Hu (单位未在论文中明确列出)

原文链接:
https://arxiv.org/pdf/2606.19598v1.pdf



引言

想象一下,在繁忙的物流仓库里,一个“打工人”机器人正在搬运货物。突然,箱子歪了,或者轮子被卡住了。如果没人及时发现,轻则货物损坏,重则整个流程停摆。这就是机器人的故障问题。
传统的故障检测要么靠精密传感器,要么靠工程师写死的规则。但仓库环境千变万化,一个箱子的形状、一束光线的角度,都可能让规则失效,更何况要为每个新场景更新规则。这就像让一个只会读死书的学生去参加辩论赛,碰到没见过的问题就歇菜了。
最近,视觉语言模型(VLM)虽然能看又能说,但直接用“裸模型”去看,往往就像让一个实习生去挑故障——知识储备不够,容易看走眼。想要让它变专家,就得喂它海量故障数据进行微调,这又贵又慢。
那么,有没有一种既省钱又高效,还能让机器人“带着经验”去看问题的方法呢?这就是今天这篇论文的厉害之处。

痛点直击:机器人故障频发,传统方法为何捉襟见肘?

现有研究主要分两派。一派是“规则派”,比如用传感器数据做阈值判断或基于图匹配检测异常。这派方法精准,但扩展性差,换个环境或任务,代码就得重写。
另一派是“微调派”,通过微调大模型(VLM/VLA)让其成为故障检测专家,比如 AHA、FailSafe 等工作。它们虽然强大,但痛点也非常明显:需要大量标注好的故障数据,而且微调过程费时费力,计算资源需求极高,对于快速迭代的生产环境并不友好。
这就好比,你不能给一个新人配个最强的电脑,就指望他能看懂所有疑难杂症。你得让他有书可查,有经验可循。
插图
图1: 所提出的基于RAG的故障检测框架概述。多种机器人流程,如 (a) 物体操作、(b) 机器人导航 和 (c) 机器人协调,都被编码为RAG上下文,并用于使用多模态语言模型对机器人操作进行实时监控。

Fail-RAG登场:无需微调,即插即用的智能故障诊断黑科技

面对这些痛点,来自 Ameya Salvi 和 Jie Hu 的团队提出了一个非常巧妙的解决方案——Fail-RAG
核心思想很简单:既然微调大模型那么麻烦,我们干脆给它配一个“外挂知识库”——也就是检索增强生成(RAG)技术。让大模型在“看”当前机器人动作时,先去数据库里翻翻以前发生过的类似故障案例,然后带着这些“参考答案”再来做判断。这样一来,既不用动大模型本身,又能让它瞬间拥有丰富的“实战经验”


Fig 2
图2: 所提出的运动异常检测框架概述。视图规划器根据固定帧率从视频流中捕捉帧。由多帧合成的单张图像使用 CLIP 模型编码为 R512 向量。一个预编译的 RAG 数据集尝试使用向量比较指标之一来检索相关的故障模式。排序后的检索信息会与标准化的提示词和预期响应模板一起呈现给现成的 VLM 代理。结构化的响应可以集成到现有的 API 工具中,供人工解读和随后的操作干预。

方法概述

整个 Fail-RAG 框架像一个标准化的诊断流水线,主要分为以下几个步骤:

工作原理大揭秘:如何用RAG为视觉语言模型注入“经验记忆”?


第一步:构建故障“百科全书”(RAG数据库)

团队设计了一个“视图规划器”(View Planner),以5到25帧不等的固定帧率,从监控视频流中抓取一组连续帧,并拼接成一张图像。这一步既实现了数据压缩,又捕捉了动作的时间序列特征。
随后,使用 CLIP 模型,将这张“多帧快照”和对应的故障描述文本,都编码成一个512维的向量,存入一个故障数据库。这就好比给每种故障拍了一张“证件照”,然后统一放进了档案柜里。

第二步:精准“翻书”——检索最相似的故障案例

当需要判断一个新场景时,系统会将新生成的“多帧快照”同样用CLIP编码成一个向量,然后与数据库里的所有向量进行比较。论文测试了三种常见的向量相似度计算方法:余弦相似度、点积和 L2 距离
最终,余弦相似度以其稳定且优异的综合表现胜出,成为框架的标配检索工具。这一步就像是在给眼前的机器人做个“人脸识别”,从案底库里找出最像的那几个历史事件。

第三步:结构化“问诊”——让VLM对号入座

光找出相似案例还不够,得让VLM(本文使用的Qwen2.5V系列,参数规模从3B到32B不等)学会“对号入座”。Fail-RAG为此设计了一个标准化的提示词模板和 JSON 输出模板。比如,对于码垛任务,模板会要求模型明确回答:机器臂状态是正常还是异常?如果是异常,是夹爪故障还是关节卡死?以及原因是什么?
这种结构化的输出方式(状态被限定为‘正常’、‘异常’或‘未知’)极大地减少了模型“胡说八道”的可能性,使得评估结果一目了然,非常工程友好。


实战见真章:从仿真到实体,实验效果全面超越基线模型

说一千道一万,最终还是要看疗效。团队设计了五大典型仓库机器人任务进行测试,涵盖了仿真和物理实体:

Fig 3
图3:用于评估所提出故障检测方法的五个实验设置:仿真环境中的 [1] 码垛、[2] 移动机械手-运输、[4] 移动机械手-穿越 以及物理实验中的 [3] 卸垛、[5] 装配。

首先是纯检索性能测试。团队测试了RAG系统从数据库中正确召回相关故障案例的能力。结果显示,余弦相似度在所有操作中表现都相当不错,尤其是在复杂的物理实验中,检索优势更加明显。

Fig 4
传统方法之所以捉襟见肘,根子在于它们要么依赖“死规则”,要么依赖“死数据”。规则一换环境就崩,微调一换任务就废,而且微调大模型的计算成本,可不是每个工厂都扛得住的。更关键的是,这些方法大多只能告诉你“出故障了”,却说不清“为什么出故障”。

还有一类方法尝试用VLM直接做监控,但“裸模型”虽然能看懂画面,却缺乏对具体操作场景的“经验”,容易把正常抖动误判为故障,或者漏掉真正的异常。

所以,业界急需一种方法——既能复用大模型强大的视觉理解能力,又不需要昂贵的微调,还能让模型“带着历史经验”去判断。这正是在本篇论文中要介绍的 Fail-RAG 框架解决的痛点。

Fail-RAG登场:无需微调,即插即用的智能故障诊断黑科技

面对上述困境,这篇论文提出了一种非常优雅的解决方案:利用检索增强生成(RAG)技术,为现成的VLM配备一个“故障案例知识库”。这个知识库不需要重新训练模型,只需要把历史故障的图片和描述以向量形式存储起来。当新的监控画面到来时,系统先自动在知识库中检索出最相似的几个案例,然后连同当前画面一起送给 VLM,让模型“带着参考答案”做判断。

这个框架被命名为 Fail-RAG。它的最大亮点在于无需微调——不需要收集大量的故障标注数据去重新训练或微调大模型,直接使用市面上已有的 VLM(比如 Qwen2.5V 系列)即可。这意味着部署成本极低,而且可以快速适配新的机器人任务或新的故障类型:只需要往知识库里添加几个新样本,系统就能立刻学会识别新故障。

更妙的是,Fail-RAG 不仅告诉你“是否故障”,还能输出结构化的诊断信息,包括故障类型、子类型和可能的原因。这得益于其设计精巧的提示词模板和答案模板——要求 VLM 按照预定义的 JSON 格式输出,状态严格限定为“正常”“异常”或“未知”,从而避免了模型“说胡话”。

与同期工作(如 AHA、FailSafe 等需要微调的方法)相比,Fail-RAG 在保持甚至提升检测精度的同时,大幅降低了计算和数据成本。接下来我们就深入看看,这套黑科技到底是怎么工作的。

工作原理大揭秘:如何用RAG为视觉语言模型注入“经验记忆”?

Fail-RAG 的整体流程可以分为三个关键步骤:构建经验库、检索相似案例、结构化问诊。下面逐一拆解。

第一步:构建故障“百科全书”——RAG数据库

为了让VLM在检测故障时能参考历史经验,团队为每种机器人操作预先构建了一个小型的故障案例库。具体做法是:以不同的帧率从监控视频中抓取连续帧,并将它们拼接成一张多帧合成图像。接着,使用 CLIP 模型,将这张图像以及对应的故障描述文本都编码成 512 维的向量,然后一起存入数据库。

每个操作-故障组合都包含多个采样频率下的多个实例。比如,对于“码垛”操作,有 6 种失效变体,每种变体在 5 种帧率下各有 5 个实例,总计 150 条数据。这样的数据库虽然不大,但已经能覆盖主要的故障模式。

第二步:精准“翻书”——检索最相似的故障案例

当新的机器人操作画面到来时,系统同样用 CLIP 模型将当前的多帧合成图像编码成一个 512 维查询向量。然后,它需要从知识库中找出与这个查询向量最相似的几个故障案例向量。论文比较了三种常用的向量距离度量方法:余弦相似度、点积和 L2 距离

实验表明,余弦相似度在所有操作中表现最稳定,因此被选为框架的默认检索器。检索返回的 Top-K 个案例连同其对应的故障描述文本,将被送入下一步的 VLM 进行综合判断。

第三步:结构化“问诊”——让VLM对号入座

检索到相似案例后,系统将这些案例作为上下文,连同当前的多帧合成图像一起,输入给现成的 VLM(论文中使用的是 Qwen2.5V 系列模型)。同时,还会附带一个精心设计的提示词模板答案模板。答案模板采用 JSON 格式,要求模型输出故障类型、状态(normal/anomalous/unknown)、子故障及原因。这种结构化约束极大减少了 VLM 的“幻觉”,使其输出精准可控。

实战见真章:从仿真到实体,实验效果全面超越基线模型

理论说得再好,不如实际跑一跑。团队在 NVIDIA Isaac Sim 仿真环境和真实物理机器人上设计了五个典型的仓库自动化任务,覆盖了固定机械臂和移动机械臂两种平台:

码垛:UR5 机械臂抓取传送带上的箱子放到货盘上,可能出现箱子尺寸异常、翻转站定位不准等故障。

移动机械臂运输:移动机械臂运输货物,加速减速可能导致货物堆倒塌。

卸垛:物理机器人从货盘取下包裹放到传送带,软塑包装可能导致抓取失败。

移动机械臂穿越:移动机械臂在仓库中导航,地图未更新的微小布局变化可能导致碰撞。

装配:物理 UR5 进行机械套件装配,工作台定位误差可能导致装配失败。

每个操作都构建了专门的 RAG 数据集,其参数如下表所示:

表格 I:框架属性。列出了五种操作的变体数量、采样率范围以及推理时使用的向量编码模型(CLIP ViT-B-32)和VLM模型(Qwen2.5V:32b)。
表 I:框架属性。列出了五种操作的变体数量、采样率范围以及推理时使用的向量编码模型(CLIP ViT-B-32)和VLM模型(Qwen2.5V:32b)。

实验分为两个层面:首先是 RAG 纯检索性能,即测试不同距离度量方法从数据库中召回正确案例的能力;其次是 VLM-RAG 联合性能,即对比 Fail-RAG 与纯 VLM 在故障识别准确率上的差异。

纯检索结果:余弦相似度和 L2 距离在所有操作中表现良好,而点积效果稍差。总体而言,余弦相似度被选为最佳度量。

接下来是重头戏——VLM-RAG 对比结果。下图中,蓝色为纯 VLM(baseline)的准确率,橙色为 Fail-RAG 的准确率:

图 5:VLM与Fail-RAG框架在准确故障识别上的对比。图中展示了五种操作在不同帧率下的识别准确率,Fail-RAG在绝大多数情况下优于基线,平均提升约25个百分点。
图 5:VLM与Fail-RAG框架在准确故障识别上的对比。图中展示了五种操作在不同帧率下的识别准确率,Fail-RAG在绝大多数情况下优于基线,平均提升约25个百分点。

从图中可以清晰看到,Fail-RAG 在所有操作上的表现几乎都碾压了纯 VLM。平均来看,故障检测准确率提升了约 25 个百分点,其中卸垛和装配等物理实验场景的提升幅度甚至超过了 40 个百分点。唯一的例外是在 MoMa-Transport 的一个帧率点上,Fail-RAG 略低于基线,这可能是因为运输场景中故障模式本身的视觉差异太小。

有趣的是,帧率的变化对性能没有明显的统一规律。这暗示着,真正关键的是向量空间中各故障模式的区分度。这正是下一节要深入探讨的。

深度剖析:RAG向量空间里的“秘密”,决定成功的关键

为什么 Fail-RAG 在某些操作上效果拔群,而在另一些操作上提升有限?论文作者深入分析了 RAG 框架的内部机制,发现了一个关键因素——向量嵌入之间的区分度

为了直观展示这一点,作者绘制了每个操作所有向量嵌入之间的余弦距离热力图(图6)。每个小方格代表一个操作-帧率组合下的数据库,其中每个点表示两个向量的距离。黄色越深,表示向量之间越分散;蓝色越深,表示向量越聚集。

图 6:任意两个向量嵌入之间的余弦距离热力图。每个小图对应一个操作-帧率组合,N表示总向量数。黄色区域表示向量相互之间差异大,蓝色区域表示相似度高。每个小图下方的数值为平均余弦距离。
图 6:任意两个向量嵌入之间的余弦距离热力图。每个小图对应一个操作-帧率组合,N表示总向量数。黄色区域表示向量相互之间差异大,蓝色区域表示相似度高。每个小图下方的数值为平均余弦距离。

令人惊讶的是,改进后的 Fail-RAG 性能与平均余弦距离之间呈现出明显的正相关关系。下图(图7)将每个组合的 Fail-RAG 准确率与对应的平均余弦距离绘制在一起:

图 7:Fail-RAG准确率与平均余弦距离的关系。横轴为平均余弦距离,纵轴为准确率。趋势线表明,随着向量区分度增加,Fail-RAG性能持续提升。
图 7:Fail-RAG准确率与平均余弦距离的关系。横轴为平均余弦距离,纵轴为准确率。趋势线表明,随着向量区分度增加,Fail-RAG性能持续提升。

这一发现揭示了 RAG 系统的一个核心设计原则:数据库中的向量嵌入越分散,RAG 检索越容易找到最相关的案例,从而 VLM 的判断就越准确。反之,如果所有故障模式的向量都挤在一起,检索就像大海捞针,效果自然大打折扣。

这个洞察对于实际应用非常重要:在构建 RAG 故障库时,应当尽量选取视觉特征差异明显的故障样本,避免包含大量“看起来很像”的案例。这不仅可以减少数据库容量,还能直接提升检测性能。

此外,论文还指出,在物理实验中,由于真实光照、阴影和纹理的复杂性,不同故障的向量嵌入天然更加分散,这解释了为什么 Fail-RAG 在物理实验中的提升幅度更大。

总结与展望:迈向更智能、更可靠的机器人自主化未来

Fail-RAG 这篇论文的价值在于,它提供了一个轻量级、无需微调、可快速部署的机器人故障检测方案。通过将 RAG 与现成的 VLM 结合,在几乎不增加计算成本的前提下,实现了显著优于基线的检测精度,并且能够输出结构化的诊断信息。论文还在 RAG 内部机制的分析上做出了贡献,揭示了向量区分度与最终性能之间的量化关系,为后续优化数据库构建提供了科学依据。

当然,该方法也存在一些局限性:首先,它需要预先构建故障案例库,案例库的覆盖范围和质量直接影响性能;其次,由于需要拼接多帧图像,检测存在一定延迟;最后,向量空间分析虽然揭示了趋势,但还未形成精确的数学关系模型。

未来可能的改进方向包括:在潜在空间中进行早期故障预测以减少延迟,形式化向量区分度与性能之间的数学联系,以及将框架扩展到更多工业检测场景。可以预见,RAG 驱动的 VLM 将成为机器人自主化运维中一个极具潜力的工具。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Fail-RAG 需要多少故障样本才能工作?论文中每个操作使用了约几十到一百多个样本。理论上,只要故障的视觉特征可以被 CLIP 编码并区分,少量样本也能工作,但效果会随样本量和区分度提升。

为什么不直接使用端到端的 VLM 微调?微调需要大量标注数据,且每次新增故障类型都要重新微调,计算成本高。Fail-RAG 采用了“检索+推理”的范式,数据库可以动态增删,无需重新训练模型,更适合快速变化的工业场景。

如果遇到全新的、从未出现在数据库中的故障类型,Fail-RAG 能检测到吗?这取决于 VLM 的泛化能力。如果新故障与已有故障在向量空间上距离很远,检索到的案例可能不相关。此时 VLM 可能给出“unknown”状态。对于未知故障的检测,可能需要引入异常检测机制作为补充。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

插图

论文创新性分数:★★★✰✰

将RAG引入机器人故障检测,结合VLM和结构化输出,思路新颖。

实验合理度:★★★★✰

覆盖仿真和物理实验,操作类型多样,对比基线公平合理。但缺乏与同类RAG方法的横向对比。

学术研究价值:★★★✰✰

揭示了向量区分度与RAG性能的关系,对优化RAG数据库设计有指导意义。但整体偏工程实践。
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。