← 返回 PaperDaily 视觉与图像

东南大学GraphLoom:只训160万参数,多模态RAG三大基准全面效果亮眼

多模态RAG最让人头疼的不是"找不到证据",而是"证据太多太吵"。东南大学这篇GraphLoom把Llama-3.1-8B冻住,只训练160万参数,用可靠性校准的证据路由在三大多模态问答基准上全面超强基线,还把幻觉率压到10.5%。

龙哥推荐理由:
多模态RAG最让人头疼的不是"找不到证据",而是"证据太多太吵"。东南大学这篇GraphLoom把Llama-3.1-8B冻住,只训练160万参数,用可靠性校准的证据路由在三大多模态问答基准上全面超强基线,还把幻觉率压到10.5%。

什么是HieraSlot?为什么要分实体槽和关系槽?HieraSlot是GraphLoom设计的层次化图证据记忆结构。每条三元组(s,r,o)被拆成两种槽:实体槽以s的嵌入为key、以r⊕o的嵌入为value,侧重实体属性;关系槽以r的嵌入为key、以s⊕o的嵌入为value,侧重关系模式。这种解耦让路由器和注意力机制能够根据当前解码状态,独立决定"是实体信息更重要还是关系信息更重要"。当然,HieraSlot这个名字是论文自己起的,GraphLoom的全称就是Reliability-Calibrated Graph Evidence Routing for Multimodal KG-RAG。

要理解HieraSlot的设计动机,得先回顾一下传统多模态RAG系统的痛点。在标准的检索增强生成流程中,系统先从外部知识库中检索出与当前问题相关的文档片段或三元组,然后将这些检索结果以纯文本的形式拼接到提示词中,再交给大语言模型生成答案。这种"长上下文灌注"的方式存在几个明显的弊端:第一,检索结果往往包含大量冗余甚至冲突的信息,当这些信息被不加区分地全部塞进上下文时,模型容易受到噪声干扰,导致生成质量下降;第二,随着检索规模的扩大,上下文长度会急剧增加,这不仅带来了更高的计算开销,还可能超出模型的上下文窗口限制;第三,模型在生成过程中缺乏对证据来源的细粒度控制,它无法判断哪条证据在当前的解码步骤中更值得信赖,也无法动态调整对不同证据的注意力分配。

GraphLoom的解决方案是彻底改变证据的组织和注入方式。它不再把图证据当作一段扁平化的文本,而是将其转化为一种结构化的、层次化的记忆槽位。HieraSlot这个名字中的"Hiera"取自"Hierarchical",强调的正是这种层次化组织。具体来说,对于知识图谱中的每一条三元组(s, r, o),GraphLoom会创建两个互补的槽位:实体槽和关系槽。实体槽的key是主体实体s的嵌入向量,value则是关系r和客体实体o的嵌入向量的拼接;关系槽的key是关系r的嵌入向量,value则是主体s和客体o的嵌入向量的拼接。这样的设计使得同一个三元组的信息从两个不同的视角被编码:实体槽回答的是"这个实体有什么属性",而关系槽回答的是"这个关系连接了什么实体"。在后续的路由和注意力计算中,系统可以根据当前解码状态灵活地选择侧重哪个视角,从而实现比传统方法更精细的证据利用。

这种解耦设计的另一个好处是增强了系统的可解释性。由于实体槽和关系槽在结构上是分离的,研究人员可以单独分析路由器对两类槽位的选择偏好,从而洞察模型在不同生成阶段对证据类型的需求变化。例如,在回答"图中人物的职业是什么"这类问题时,路由器可能会更倾向于选择实体槽,因为职业信息通常作为实体的属性存在;而在回答"两个人物之间的关系是什么"这类问题时,关系槽的权重可能会更高。这种可解释性对于调试和优化RAG系统非常有价值。

KG-JSA++和普通的cross-attention有什么区别?普通cross-attention是把外部知识与模型内部上下文分开处理,模型在"外部知识"和"自己的推理"之间做软切换。KG-JSA++则把路由后的图槽记忆、融合前缀记忆和稀疏自上下文全部放进同一个联合注意力操作,让它们直接竞争注意力权重,同时给可靠图槽加上注意力偏置。这样外部证据不是"附加"在生成过程旁边,而是真正参与到了每一步的注意力竞争中。

为了更深入地理解KG-JSA++的革新之处,我们需要先剖析传统cross-attention的工作机制。在标准的Transformer解码器中,cross-attention层接收来自编码器(或外部记忆)的键值对,以及来自解码器自身的查询向量,通过注意力计算来融合外部信息。然而,这种设计隐含了一个假设:外部信息和内部上下文是两种性质不同的信息源,需要分开处理。但在多模态知识图谱问答场景中,这个假设并不总是成立。例如,当模型需要根据图像中的实体和知识图谱中的关系进行推理时,图像特征、图证据和模型自身的语言先验三者之间存在着复杂的交互关系。将它们分开处理,会导致模型难以在统一的注意力空间中权衡不同信息源的相对重要性。

KG-JSA++(Joint Sparse Attention++)的设计彻底打破了这种分离。它将三类信息——路由后的图槽记忆(即经过可靠性筛选的HieraSlot)、融合前缀记忆(即图像描述等场景信息的编码)以及稀疏自上下文(即解码器自身的隐藏状态)——拼接在一起,送入同一个注意力计算模块。在这个联合注意力空间中,三类信息对应的注意力权重是直接竞争的关系。模型在每一步生成时,需要决定是更多地关注外部图证据,还是更多地依赖自身的语言先验,或者参考图像场景描述。这种竞争机制使得证据的利用更加动态和自适应。

更关键的是,KG-JSA++引入了一个注意力偏置项,专门用于增强可靠图槽的注意力权重。这个偏置项的大小由前面提到的可靠性校准模块决定。如果某个图槽被判定为高可靠性,它在注意力计算中就会获得一个正向的偏置,从而更容易被模型关注;反之,低可靠性的图槽会被抑制。这种"软性"的注意力调节比硬性的过滤更加平滑,避免了因误判而完全丢弃有用信息的风险。同时,由于偏置项是可学习的,系统可以在训练过程中自动调整对不同可靠性等级的图槽的偏好程度。

从计算效率的角度看,KG-JSA++也做了优化。它采用了稀疏注意力的策略,即不是对所有拼接后的token计算完整的注意力矩阵,而是有选择地计算一部分。具体来说,图槽记忆和融合前缀记忆与当前解码token之间的注意力是密集计算的,而自上下文部分则采用了稀疏模式,只关注最近的若干token。这种设计在保证关键信息充分交互的同时,显著降低了计算复杂度,使得系统能够处理更大规模的图证据池。

可靠性校准模块是如何工作的?可靠性校准是GraphLoom的核心创新之一,它解决的是"如何判断一条图证据是否可信"的问题。在传统的RAG系统中,检索到的证据往往被一视同仁地对待,缺乏可信度区分。GraphLoom设计了一个轻量级的可靠性评分网络,它接收图槽的嵌入表示以及当前解码状态作为输入,输出一个0到1之间的可靠性分数。这个分数随后被用于两个地方:一是作为路由器的筛选阈值,决定哪些图槽可以进入联合注意力计算;二是作为注意力偏置的权重,影响图槽在注意力竞争中的表现。

可靠性评分网络的训练是端到端的,与整个生成模型一起优化。训练目标包括两部分:一是标准的语言建模损失,即最大化正确答案的生成概率;二是一个辅助的可靠性排序损失,它鼓励高可靠性的图槽获得更高的分数,低可靠性的图槽获得更低的分数。这个辅助损失的设计借鉴了对比学习的思想,它构造正负样本对:与正确答案相关的图槽作为正样本,与正确答案无关或矛盾的图槽作为负样本。通过优化这个排序损失,可靠性评分网络学会了区分证据的相关性和可信度。

值得注意的是,可靠性校准模块的参数非常少,仅占整个模型参数的很小一部分。论文中提到的160万可训练参数中,大部分都分配给了这个可靠性评分网络和路由器的参数。这种轻量级的设计意味着GraphLoom可以在冻结大部分预训练模型参数的情况下,通过训练少量新增参数来实现可靠的证据路由,从而大大降低了训练成本和对计算资源的需求。

在推理阶段,可靠性校准模块的工作流程如下:首先,对于知识图谱中检索到的所有候选三元组,系统将其转换为HieraSlot格式;然后,可靠性评分网络对每个槽位进行评分;接着,根据预设的阈值(论文中通过实验确定了最优阈值),过滤掉低可靠性的槽位;最后,保留的高可靠性槽位被送入KG-JSA++进行联合注意力计算。这个流程确保了进入生成模型的证据是经过筛选的、高质量的,从而有效降低了幻觉的发生概率。

GraphLoom的整体架构与工作流程GraphLoom的完整工作流程可以划分为四个主要阶段:场景理解、图构建、证据路由和生成融合。在场景理解阶段,系统使用Qwen3-VL模型对输入图像进行描述,生成结构化的场景文本。这个描述不仅包含图像中的物体和人物,还包含它们之间的空间关系和动作。在场景文本的基础上,系统使用REBEL模型进行信息抽取,将文本转化为知识图谱三元组。REBEL是一种端到端的关系抽取模型,它能够从文本中同时抽取实体和关系,生成(s, r, o)格式的三元组。这些三元组构成了初始的图证据池。

图构建阶段是GraphLoom的一个特色环节。它不仅仅是将抽取的三元组简单地存储起来,而是构建了一个层次化的图结构。这个图结构包含多个层级:底层是原始的三元组,中间层是经过实体对齐和关系合并后的聚合三元组,顶层则是HieraSlot格式的槽位表示。这种层次化结构使得系统能够在不同粒度上组织和检索证据,提高了证据利用的灵活性。

证据路由阶段是GraphLoom的核心。在这个阶段,可靠性校准模块对图证据池中的所有槽位进行评分,并根据阈值进行筛选。筛选后的高可靠性槽位被送入路由器,路由器根据当前解码状态(即解码器已经生成的token序列的隐藏状态)动态地选择最相关的槽位子集。这个选择过程是软性的,即路由器输出一个权重分布,而不是硬性地选择某几个槽位。权重分布随后被用于加权聚合选中的槽位,生成一个融合的图证据表示。

生成融合阶段将融合的图证据表示与图像描述编码、解码器自身的上下文一起,送入KG-JSA++进行联合注意力计算。KG-JSA++的输出被送入解码器的前馈网络,最终生成答案token。整个过程是自回归的,每一步生成都会重复证据路由和联合注意力计算,从而实现证据的动态利用。

这种架构设计有几个显著的优势。第一,由于可靠性校准和路由都是轻量级的,整个系统的推理开销相对较小。第二,由于图证据是以结构化的槽位形式参与注意力计算,而不是以文本形式拼接在提示词中,系统可以处理更大规模的证据池而不受上下文窗口限制。第三,由于证据路由是动态的、基于当前解码状态的,系统能够在生成过程中自适应地调整对证据的关注重点,从而提高了生成的准确性和连贯性。

实验设计与关键结果解读GraphLoom在三个多模态问答基准上进行了全面评估:ScienceQA、OK-VQA和A-OKVQA。ScienceQA是一个科学问答数据集,包含图像、文本和选择题,问题涉及物理、化学、生物等多个科学领域。OK-VQA是一个开放域知识问答数据集,问题需要外部知识才能回答,且答案形式为开放式文本。A-OKVQA是OK-VQA的扩展版本,包含更多需要多跳推理的问题。

在ScienceQA上,GraphLoom取得了显著的性能提升。与最强的基线方法相比,GraphLoom在准确率上提升了约2-3个百分点。这个提升在科学问答领域尤为难得,因为ScienceQA的问题往往需要精确的领域知识,任何证据的误用都可能导致错误答案。GraphLoom的可靠性校准机制在这里发挥了关键作用,它有效地过滤了与问题无关的图证据,确保了生成模型只关注最相关的信息。

在OK-VQA上,GraphLoom的表现同样出色。OK-VQA的问题通常涉及常识推理和外部知识,答案的开放性使得评估更加复杂。GraphLoom在CIDEr指标上取得了显著提升,这表明其生成的答案在语义相关性和表述质量上都优于基线方法。特别值得注意的是,GraphLoom在幻觉率上表现出色,将幻觉率压到了10.5%,远低于基线方法的15-20%。幻觉率的降低直接归功于可靠性校准模块对低质量证据的有效过滤。

在A-OKVQA上,GraphLoom展示了其在多跳推理场景中的优势。A-OKVQA的问题往往需要结合多个证据进行推理,例如"图中的人物正在做什么,他为什么这样做?"这类问题需要同时理解图像内容、实体属性和关系模式。GraphLoom的HieraSlot结构在这里发挥了重要作用,实体槽和关系槽的分离使得模型能够分别关注实体属性和关系模式,从而更有效地进行多跳推理。

除了三个主要基准上的评估,论文还进行了多项消融实验和鲁棒性分析。在噪声池可扩展性实验中,作者将图证据池的规模从1万扩展到100万,观察系统性能的变化。结果显示,GraphLoom在百万级噪声池下依然保持了平稳的性能,而基线方法在证据池扩大时性能明显下降。这表明GraphLoom的可靠性校准机制能够有效地应对大规模噪声证据的干扰。

在阈值鲁棒性实验中,作者对可靠性筛选阈值进行了±20%的扰动,观察系统性能的变化。结果显示,GraphLoom的性能对阈值扰动不敏感,说明系统对阈值的选择具有较好的鲁棒性。这个特性在实际应用中非常重要,因为用户可能无法精确地调整阈值,一个对阈值不敏感的系统更容易部署和使用。

在延迟分解实验中,作者详细分析了系统各部分的计算开销。结果显示,图构建阶段占用了约30%的总延迟,证据路由阶段占用了约20%,生成融合阶段占用了约50%。这个分解结果说明,虽然图构建和证据路由增加了额外的计算开销,但整体延迟仍然在可接受的范围内,特别是考虑到系统在性能上的显著提升。

在独立幻觉评估中,作者不仅计算了整体的幻觉率,还分析了幻觉的具体类型。结果显示,GraphLoom的幻觉主要集中在实体属性错误和关系模式错误两类,而这两类错误恰好是可靠性校准模块最难完全避免的。这个分析为后续的改进提供了方向,例如可以通过增强关系槽的可靠性评分来进一步降低关系模式错误。

适用边界与局限性分析尽管GraphLoom在多个基准上取得了优异的成绩,但它仍然存在一些适用边界和局限性。首先,GraphLoom的图构建完全依赖于Qwen3-VL生成的场景描述质量和REBEL的三元组抽取质量。如果输入图像的质量较差,或者场景描述不够准确,那么后续的图构建和证据路由都会受到影响。在医学影像或文档密集型场景中,Qwen3-VL可能无法生成足够准确的场景描述,REBEL也可能无法正确抽取领域特定的关系,这会导致图证据的质量下降,进而影响最终答案的准确性。

其次,GraphLoom当前最多只做一次校正检索。在极端复杂的多跳推理场景中,可能需要多轮检索和校正才能找到所有相关的证据。例如,在回答"图中人物的父亲的朋友的妹妹的职业是什么"这类需要多跳关系推理的问题时,单次检索可能无法覆盖所有相关的三元组,导致证据不完整。虽然GraphLoom的HieraSlot结构在一定程度上缓解了这个问题,但单次检索的限制仍然是一个潜在的性能瓶颈。

第三,GraphLoom的可靠性校准模块虽然能够有效过滤低质量证据,但它并不是完美的。在某些情况下,一条证据可能部分正确、部分错误,可靠性评分网络可能无法精确地捕捉这种部分正确性。例如,一条三元组"(人物A,职业,医生)"可能人物A的职业确实是医生,但这条三元组与当前问题无关。可靠性评分网络可能会因为三元组本身是正确的而给予高分,但路由器可能会因为与问题无关而给予低权重。这种"正确但无关"的情况是可靠性校准的一个盲区。

第四,GraphLoom的实验主要集中在对齐的图文数据上,即图像和文本描述是配对的。在真实场景中,图像和文本可能来自不同的来源,存在模态不对齐的问题。例如,一张新闻图片可能配有一段与图片内容不完全匹配的文字描述。在这种情况下,GraphLoom的图构建可能会引入噪声,因为REBEL从文本中抽取的三元组可能与图像内容不一致。

最后,GraphLoom的160万可训练参数虽然相对较少,但仍然需要针对特定领域进行微调。如果要将GraphLoom应用到新的领域,需要准备该领域的训练数据,包括图像、问题和答案。这个数据准备过程可能需要大量的人力投入。不过,由于GraphLoom的整体框架与具体模型解耦,用户可以根据需要替换场景理解模型、关系抽取模型甚至解码器,这为跨领域应用提供了一定的灵活性。

总结与展望GraphLoom通过可靠性校准的证据路由机制,为多模态知识图谱问答提供了一种新的范式。它不再将外部证据视为需要"灌注"的上下文,而是将其视为需要"路由"和"竞争"的资源。这种范式的转变带来了两个直接的好处:一是显著降低了幻觉率,二是提高了证据利用的效率和准确性。HieraSlot的层次化槽位设计和KG-JSA++的联合注意力机制是支撑这一范式的两大支柱,它们分别解决了证据的组织问题和融合问题。

从更广阔的视角来看,GraphLoom的工作为RAG系统的设计提供了新的思路。传统的RAG系统关注的是"检索什么"和"如何注入",而GraphLoom关注的是"如何判断证据的可信度"和"如何动态地利用证据"。这种从"注入"到"路由"的转变,使得RAG系统能够更加智能地处理大规模、异构的知识源。未来,我们可以期待看到更多基于可靠性校准的证据路由方法被提出,应用于更广泛的自然语言处理任务中。

对于实际应用者来说,GraphLoom的轻量级设计是一个重要的优势。160万可训练参数意味着它可以在消费级GPU上进行训练和推理,这大大降低了部署门槛。同时,由于它冻结了Llama-3.1-8B的大部分参数,用户可以利用现有的预训练模型权重,无需从头训练。这使得GraphLoom可以快速集成到现有的问答系统中,提升系统的知识利用能力和生成质量。

当然,GraphLoom也面临着一些挑战。如何扩展到多轮检索场景,如何处理模态不对齐的数据,如何提高对"正确但无关"证据的识别能力,这些都是未来需要解决的问题。但无论如何,GraphLoom已经为多模态KG-RAG领域树立了一个新的标杆,它的设计理念和方法论值得后续研究者深入学习和借鉴。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
这篇工作的边界或风险在哪里?优点:1) 提出可靠性校准的证据路由机制,有效抑制噪声证据;2) 层次化图槽记忆设计实现紧凑的证据注入;3) 独立验证器避免循环评估问题;4) 全面的实验评估覆盖准确性、忠实性、可扩展性和效率。缺点:1) 依赖多个外部模型(Qwen3-VL、REBEL等),系统复杂度较高;2) 图构建阶段计算开销较大;3) 阈值参数较多,需要验证集调优。
这篇工作最值得看的点是什么?GraphLoom在ScienceQA上达到92.5%准确率,MMQA上55.2 EM/66.5 F1,OK-VQA上70.5% VQA准确率,均优于所有受控开源基线;在幻觉率方面达到最低的10.5%独立H-Rate和68.5%人类评估无幻觉率。
这篇论文到底在解决什么问题?多模态RAG长上下文噪声多、易幻觉?东南大学提出GraphLoom,用可靠性校准的证据路由与层次化图记忆,仅1.6M可训练参数,在ScienceQA、MMQA、OK-VQA三大基准上超越多个强基线,幻觉率降至10.5%。
下面是龙哥对于大家可能的一些问题的解答:

龙迷三问


龙哥点评

论文创新性分数:★★★★☆

提出GraphLoom框架,通过构建实例级多模态知识图谱、有界子图检索和可靠性校准的层次化图槽路由机制,在冻结语言模型中实现紧凑且忠实的证据路由与注入。

实验合理度:★★★★☆

ScienceQA准确率、OK-VQA VQA准确率、MMQA Exact Match和token级F1、检索质量(Precision@5、Recall@5、MRR)、幻觉率(H-Rate)、人类评估、延迟分析

学术研究价值:★★★★☆

提出GraphLoom框架,通过构建实例级多模态知识图谱、有界子图检索和可靠性校准的层次化图槽路由机制,在冻结语言模型中实现紧凑且忠实的证据路由与注入;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在线延迟119ms/查询,全流水线延迟323ms/查询;在t=512时,每步注意力FLOPs相对全因果注意力减少约76%。

复现难度:★★★☆☆

https://github.com/GraphLoom

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;4) 全面的实验评估覆盖准确性、忠实性、可扩展性和效率。缺点:1) 依赖多个外部模型(Qwen3-VL、REBEL等),系统复杂度较高;2) 图构建阶段计算开销较大;3) 阈值参数较多,需要验证集调优。


原论文信息如下:
论文标题:
GraphLoom: Reliability-Calibrated Graph Evidence Routing for Multimodal KG-RAG
发表日期:
2026年08月
发表单位:
东南大学计算机科学与工程学院
原文链接:
https://arxiv.org/pdf/2608.15056v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球