← 返回 PaperDaily 视觉与图像

不碰文本也能改记忆:LUCID揭开多模态智能体新漏洞

多模态智能体最怕的不是答错,而是把错的东西“记牢”。这篇论文直接把矛头对准长期记忆:攻击者只改一张图,就能在黑盒条件下把记忆系统带偏,而且五种后端都没能幸免。更关键的是,它把“检索被命中”和“模型真的信了”这两件事分开看,结论很扎实。

不碰文本也能改记忆:LUCID揭开多模态智能体新漏洞
原论文信息如下:
论文标题:
Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents
发表日期:
2026年07月
发表单位:
University of California, Irvine
原文链接:
https://arxiv.org/pdf/2607.15657v1.pdf

多模态智能体的记忆,竟能被一张图片“篡改”?

多模态智能体最怕的,往往不是当场答错,而是把错的东西存进记忆里,还以为自己“记得很准”。这篇来自加州大学欧文分校的论文,瞄准的就是这个最阴的点:攻击者不用碰文本,不用改模型权重,甚至不需要知道目标系统长什么样,只要对一张用户共享的图片做不可见扰动,就可能把长期记忆带偏。这种攻击之所以令人不安,是因为它触及了多模态智能体架构中的一个根本假设——视觉输入是可信的。在大多数系统中,图像被当作客观事实的载体,与文本描述一同被编码、存储和检索,而系统很少对图像内容进行“真实性校验”。LUCID(Long-term memory Under Covert Image Distortion)攻击正是利用了这种信任,通过精心设计的对抗扰动,让一张看似无害的图片在嵌入空间中“漂移”到另一个语义区域,从而在系统记忆中植入错误信息。
封面
图1:LUCID整体流程。第1步先选出语义上“相冲突”的目标图像;第2步根据攻击场景分成两种模式:in-context poisoning(上下文内污染)和out-of-context injection(上下文外注入);第3步再做不可见对抗扰动。整条链路都是黑盒。这个流程的关键在于,攻击者不需要任何关于目标系统内部结构的先验知识,只需要能够向系统提交图像,并观察系统的响应(例如检索结果或生成的回答)。这种黑盒设定使得LUCID具有很高的实用威胁性,因为它模拟了真实世界中攻击者可能拥有的最有限的能力。
这事之所以吓人,不是因为“图片会骗人”,而是因为记忆系统默认相信图片。在很多多模态智能体里,图片和文本会一起被编码、一起被存储、一起被检索。系统看到一张图,通常不会先做“真假审问”,而是直接把它当成过去发生过的事实。于是,攻击者只需要让图像在嵌入空间里“滑”到另一个语义区域,表面看起来还是那张图,系统脑子里却已经换了剧情。这种攻击的隐蔽性在于,它不依赖于任何显式的触发词或异常文本模式,因此传统的基于规则的内容过滤方法很难检测到它。攻击者甚至不需要知道目标系统使用的是哪种具体的记忆后端或大语言模型,因为LUCID的对抗扰动是在一组公开的视觉编码器上优化的,然后通过迁移性攻击到目标系统上。
论文把攻击分成两类。第一类是记忆污染:原本对话里已经有文字上下文,图片只是证据之一,攻击者把这张图替换成扰动后的版本,让系统把真实事件“记错语境”。例如,在一个关于用户饮食偏好的对话中,用户上传了一张沙拉的照片并说“这是我今天的午餐”,攻击者将这张沙拉图片扰动后,系统可能会在记忆中错误地关联到“披萨”的概念。第二类是记忆注入:对话里本来没有任何历史上下文可供核对,系统只能相信新上传的图,于是错误概念直接被塞进记忆里,后续查询时再慢慢发酵。例如,攻击者上传一张看似普通的风景照,但经过扰动后,系统会将其记忆为“用户曾访问过某个危险区域”,从而在后续的安全相关查询中给出错误建议。

攻击者只需操纵一张图,就能让AI“记错”一切

先把人话讲明白:这不是那种“输入一张图,模型立刻胡说八道”的短命攻击,而是更麻烦的长期污染。一次成功,后面很多轮问答都可能继续被带偏。对个人助手来说,可能是把饮食记录记错;对机器人或任务助手来说,可能是把物品、地点、身份、限制条件都记歪。记忆一旦脏了,后面每次检索都像在翻一本被人偷偷改过的日记。这种长期污染的特性使得LUCID攻击的后果具有累积性和扩散性。例如,在一个智能家居助手中,如果用户的“禁止进入区域”的记忆被污染,助手可能会在未来多次错误地允许进入,造成持续的安全隐患。在医疗健康助手中,如果用户的过敏信息被错误地注入记忆,助手可能会在未来的饮食建议中反复推荐过敏原食物。这种“一次污染,长期受害”的特性,使得LUCID攻击比传统的对抗性攻击更具破坏力。
论文的威胁模型很克制,也因此更有说服力。攻击者只能改图,不能碰文本通道,不能看目标模型参数,不能读记忆库内容,也不能直接写入存储。换句话说,攻击者不是“后台管理员”,只是一个会在图片里藏针的人。黑盒、图像受限、无触发词、无文本辅助,这几个限制叠在一起,才显得这件事更扎心。具体来说,攻击者只能通过向目标系统提交图像来发起攻击,无法控制或修改系统接收到的文本输入,也无法访问系统的内部状态(如模型权重、记忆库内容)。攻击者甚至不需要知道系统使用的是哪种具体的记忆后端(如MuRAG、NGMemory等)或大语言模型(如GPT-4o、Claude等)。这种极端的黑盒设定,使得LUCID攻击在现实世界中具有很高的可行性,因为攻击者通常只能通过公共接口(如API)与目标系统交互。
表1:以往针对检索增强和记忆型多模态大模型系统的攻击对比
表1:以往针对检索增强和记忆型多模态大模型系统的攻击对比。LUCID同时满足长期记忆、仅图像、无触发词、无需直接写入、跨多种后端、黑盒和双模式攻击这几项条件,说明它不是在“顺手补个漏洞”,而是在补一个此前几乎没人正面打过的安全缺口。从表中可以看出,以往的工作要么只针对短期记忆(如单轮对话中的对抗性攻击),要么需要访问模型参数(白盒攻击),要么依赖于特定的触发词或文本模式。LUCID是第一个在如此严格的约束下,系统性地研究多模态智能体长期记忆安全的工作。它填补了从“图像对抗攻击”到“长期记忆污染”之间的空白,揭示了多模态智能体架构中一个被忽视的安全脆弱点。
这里顺手把几个缩写讲清楚。ASRAttack Success Rate,攻击成功率MLLMMultimodal Large Language Model,多模态大语言模型CLIPContrastive Language-Image Pre-training,对比式语言-图像预训练模型。论文还提到一个关键技巧叫FOA-Attack,即Feature Optimal Alignment Attack,特征最优对齐攻击,原始方法来自文献[41],LUCID在此基础上又加了文本对齐目标。这个文本对齐目标是LUCID的一个关键创新点。传统的FOA-Attack只优化图像特征的对齐,即让扰动后的图像在视觉编码器的特征空间中更接近目标概念。但LUCID发现,仅仅对齐图像特征是不够的,因为很多记忆后端在存储时会将图像和其关联的文本描述一起编码。因此,LUCID额外引入了一个文本对齐目标,让扰动后的图像在联合的图文嵌入空间中,也与其目标概念的文本描述更接近。这种“双对齐”策略,使得攻击效果更加鲁棒和可迁移。

揭秘LUCID:如何悄无声息地污染AI长时记忆?

LUCID不是一招鲜,而是一条三段式流水线。第一段先找目标,第二段构造攻击载荷,第三段把扰动真正“炼”出来。这个设计的聪明之处在于:它没有把攻击押宝在某个特定后端上,而是尽量把攻击目标放在记忆管线的共性上——图像编码、语义检索、图文联合存储、再到回答生成。这种“共性攻击”策略使得LUCID具有很好的泛化能力,能够在不同的记忆后端和大语言模型上取得一致的效果。它不依赖于某个特定系统的实现细节,而是利用了多模态智能体在记忆处理流程中的共同弱点:视觉输入的可信假设和嵌入空间的语义连续性。
图2:LUCID三阶段流程中的目标设计与语义矛盾选择细节
图2:LUCID在目标设计阶段会从真实图像池里挑出一个与原内容语义相矛盾的目标概念。这样做的目的不是“随便找张图糊上去”,而是让扰动后的图像更容易把检索结果拖向攻击者想要的方向。这个目标选择过程是自动化的,它从一个大规模的图文数据集(如ShareGPT4V-100K)中,为每个攻击样本自动筛选出最合适的“假记忆”目标。论文设计了一个评分函数,综合考虑了三个因素:1)目标概念与原始概念的语义冲突程度(冲突越大,攻击效果越明显);2)目标概念在嵌入空间中与原始概念的接近程度(太远可能无法被检索到,太近则可能无法产生明显的误导);3)目标概念的多样性(避免攻击结果过于单一)。通过这个评分函数,LUCID能够为每个攻击样本自动生成一个“最优”的假记忆目标。
第一阶段叫Adversarial Target Design,中文可以理解成“先决定要把记忆带到哪儿去”。论文从 ShareGPT4V-100K 里抽取候选图文对,再给每个候选打分。这个分数不是拍脑袋,而是三部分拼起来:一部分估计它能不能把检索结果挤走,一部分看它和真实答案是否语义冲突,还有一部分惩罚那些和原答案太像的候选。最后选出的目标图像,既要“像个合理的替代品”,又要“在语义上足够别扭”。具体来说,评分函数的第一部分(检索竞争力)通过计算候选目标图像与原始查询文本在嵌入空间中的相似度来估计,相似度越高,说明候选目标越有可能在检索时被命中。第二部分(语义冲突度)通过计算候选目标图像的文本描述与原始真实答案的语义相似度来衡量,相似度越低(即冲突越大),攻击效果越好。第三部分(多样性惩罚)通过计算候选目标与已选目标的相似度来避免重复,确保攻击结果的多样性。这三个部分的加权组合,构成了最终的评分函数。
第二阶段叫Payload Construction,也就是“把攻击装进具体对话里”。在上下文内污染里,原本那条图片消息已经被上下文文字背书,攻击者只替换图片,不动文本;在上下文外注入里,攻击对象是一条全新的图片消息,文本本身很中性,系统没有历史上下文可对照,因而更难发现异常。前者像是把一本已有记录的日记偷偷换了配图,后者更像是给一本新日记塞进一页假照片。在上下文内污染场景中,攻击者需要模拟一个完整的对话历史,其中包含一条或多条带有图片的消息。攻击者将其中一条消息中的原始图片替换为扰动后的版本,并保持其他所有文本内容不变。在上下文外注入场景中,攻击者只需要构造一条新的图片消息,其中包含一个中性的文本描述(如“这是一张照片”)和扰动后的图片。由于没有历史上下文,系统无法通过对比来发现异常,这使得注入攻击更加隐蔽。
第三阶段叫Adversarial Perturbation。这里真正做的是对抗优化:在很小的像素预算内,让源图像的特征尽量往目标概念靠。LUCID沿用了 FOA-Attack 的思路,把图像特征对齐做成一个优化目标,再额外加入文本对齐项,因为很多记忆后端在存储时会把图片和说明文字一起编码。换句话说,攻击者不只想让图“看起来像目标”,还想让系统“说起来也像目标”。这个优化过程是在一组公开的视觉编码器(如CLIP、SigLIP等)上进行的,而不是在目标系统的私有编码器上。通过在一组多样化的编码器上进行优化,LUCID生成的对抗扰动具有很好的迁移性,能够有效地攻击使用不同编码器的目标系统。优化过程中,攻击者使用投影梯度下降(PGD)算法,在L_infinity范数约束下(ε=16/255),最小化源图像特征与目标概念特征之间的距离。同时,还加入了一个文本对齐损失,让源图像的特征与目标概念的文本描述特征对齐。
图3:LUCID攻击管线示意图
图3:LUCID攻击管线示意图。三阶段串起来之后,攻击者只需要在图像上做极小扰动,就能把原本的视觉证据引导到错误语义上。这里最关键的不是“图变得像什么”,而是“检索和生成会不会真的跟着变”。整个管线是端到端的,从目标设计到载荷构造再到扰动生成,完全自动化,不需要人工干预。这使得LUCID可以大规模地生成攻击样本,用于评估多模态智能体记忆系统的安全性。论文在实验中使用了1000个攻击样本,覆盖了多个不同的对话主题和场景,确保了评估结果的统计显著性。
从工程角度看,这套方法的狠劲在于可迁移性。攻击不是针对某个记忆后端单独定制的,而是先在若干公开视觉编码器上做替代优化,再迁移到目标系统。论文用的对抗预算是 ε=16/255,优化步数是 1000 步,属于典型的“肉眼看不出,但模型可能已经中招”的区间。说白了,图还像那张图,系统却开始信另一套故事。这种迁移性攻击的成功,揭示了多模态智能体记忆系统的一个深层问题:不同的记忆后端虽然实现细节不同,但它们都依赖于相似的视觉语义空间来进行图像编码和检索。因此,只要攻击者能够在这个共享的语义空间中找到“漏洞”,就可以同时攻击多个不同的系统。这也意味着,防御LUCID这样的攻击,不能仅仅依靠更换记忆后端或视觉编码器,而需要从根本上重新思考视觉输入的可信性假设。
图4:上下文内污染与上下文外注入的快照诊断对比
图4:上下文内污染与上下文外注入的快照诊断对比。图中不同记忆系统在同一面板下表现几乎一致,说明攻击效果主要来自写入侧的视觉信号,而不是某个后端的偶然设计失误。这个发现非常重要,它表明LUCID攻击的成功不是由于某个特定记忆后端的实现缺陷,而是由于多模态智能体在记忆写入过程中对视觉信号的过度信任。无论记忆后端的检索算法多么复杂,只要它在写入时没有对视觉输入进行充分的真实性校验,就难以抵御这种攻击。这为后续的防御研究指明了方向:防御的重点应该放在记忆写入阶段,而不是检索或生成阶段。

五项记忆后端、五种大模型全面溃败:LUCID攻击成功率超60%

实验部分最值得看的,不是某个单点数字,而是跨后端、跨模型、跨场景都能打。论文一共测了五种记忆后端:MuRAG、NGMemory、AUGUSTUS、UniversalRAG 和 Mem0Memory;又在不同大模型上做了验证,包括 GPT-4o-mini、GPT-4o、GPT-4.1、Claude-Haiku-4.5 和 Gemini-2.5 Flash。这样的设计很像“别挑软柿子,直接一锅端”。这种全面的评估设计,使得论文的结论具有很强的说服力。它表明LUCID攻击的成功不是偶然的,而是多模态智能体记忆系统的一个普遍性安全漏洞。无论系统使用的是基于检索的RAG架构,还是基于图结构的记忆网络,或是基于向量数据库的简单存储,都难以抵御这种攻击。这为整个多模态AI领域敲响了警钟。
这里的态度只能是“认真看结果”。因为这类安全论文最怕两件事:一是只在单一系统上跑通,二是只看检索命中,不看模型是否真的被误导。LUCID把这两件事拆开了,分别看攻击是否把错误记忆检索出来,以及生成端是否真的跟着错误内容走。这个拆法很重要,毕竟检索命中不等于模型投降,模型投降也不一定来自检索。论文设计了两个主要的评估指标:ASR(VS)(视觉语义攻击成功率)和ASR(TS)(文本语义攻击成功率)。ASR(VS)衡量的是攻击是否成功地将检索结果引导到了目标视觉概念上,即系统是否检索到了与目标概念相关的图像。ASR(TS)衡量的是攻击是否成功地将生成结果引导到了目标文本概念上,即系统是否生成了与目标概念相关的文本回答。通过这两个指标,论文可以清晰地分辨出攻击是在检索层面成功,还是在生成层面成功,或者两者都成功。
表2:上下文内记忆污染在不同记忆后端上的结果
表2:上下文内记忆污染在不同记忆后端上的结果。平均来看,LUCID在污染场景下的 ASR(VS) 达到61.6%,接近 oracle 的 67.9%。这说明攻击图像不仅能被检索到,还能把模型往攻击者指定的视觉语义上拽。值得注意的是,oracle(即理想情况下的攻击成功率)是通过直接将目标图像替换原始图像来计算的,它代表了攻击的理论上限。LUCID达到了oracle的90%以上,说明其攻击效果非常接近理想情况。此外,ASR(TS)也达到了相当高的水平,表明攻击不仅在检索层面成功,在生成层面也成功地误导了模型。
污染场景里,UniversalRAG、MuRAG 这类检索后端的命中率都不低,说明扰动图像在嵌入空间里的位移足够有效。更有意思的是,NGMemory 虽然检索率没有最高,但正确答案下降最明显,说明只要关键视觉证据被污染,后续回答就会跟着歪。这里不是“全局崩盘”,而是关键样本一坏,整条推理链就开始漏风。这个现象揭示了不同记忆后端在面对攻击时的脆弱性差异。对于UniversalRAG和MuRAG这类基于检索的后端,攻击的主要影响是改变检索结果,从而间接影响生成。而对于NGMemory这类基于图结构的记忆网络,攻击可能直接污染了记忆网络中的节点或边,从而更直接地影响推理过程。这种差异表明,防御策略需要根据记忆后端的类型进行定制。
表3:上下文外记忆注入在不同记忆后端上的结果
表3:上下文外记忆注入在不同记忆后端上的结果。这个场景更像“凭空植入一个假事实”,平均攻击成功率也有58.4%。对没有历史上下文可核对的新图片来说,系统几乎没有天然的纠错信号。注入场景的攻击成功率略低于污染场景,但仍然相当可观。这主要是因为注入场景中,攻击者无法利用已有的对话上下文来“背书”攻击图像,因此攻击效果完全依赖于图像本身的扰动质量。尽管如此,LUCID仍然取得了接近60%的成功率,说明其生成的对抗扰动具有很强的误导性。这也意味着,即使在没有历史上下文的“干净”对话中,攻击者仍然可以成功地植入假记忆。
注入场景的结论更耐人寻味:很多后端的检索率很高,但这不代表安全。因为一旦错误图像被检索出来,模型会基于它继续生成,而它看到的又是一个“看上去很正常”的用户新上传内容。也就是说,系统不是被强行灌输一个荒诞故事,而是被诱导去合理化一个本来不存在的事实。这就很烦,像是把假新闻做成了高仿纪实片。这种“合理化”过程是LUCID攻击最危险的地方。系统不会直接输出一个明显荒谬的答案,而是会基于被污染的记忆,生成一个看似合理但实际错误的回答。例如,如果攻击者成功注入了“用户对花生过敏”的假记忆,当用户询问“我今晚可以吃什么?”时,系统可能会建议用户避免含有花生的食物,这个建议看起来非常合理,但实际上是基于一个不存在的“事实”。这种隐蔽性使得LUCID攻击很难被用户或系统管理员发现。
表4:在不同大模型上的上下文外记忆注入结果
表4:在不同大模型上的上下文外记忆注入结果。换模型后,攻击仍然能保持相当强的迁移性,说明问题不在某个特定回答器,而在于“图像进入记忆”的这条通路本身。从表中可以看出,无论是GPT-4o-mini这样的轻量级模型,还是GPT-4o、Claude-Haiku-4.5这样的重量级模型,LUCID攻击都取得了相似的成功率。这表明,大语言模型本身的鲁棒性并不能抵御这种攻击,因为攻击的根源在于记忆写入阶段,而不是生成阶段。即使大语言模型本身具有很强的推理能力和事实核查能力,如果它接收到的记忆信息本身就是错误的,那么它也很难生成正确的回答。
图5:不同检索编码器上的消融实验
图5:不同检索编码器上的消融实验。即便把检索编码器换成 GME、CLIP、CLIP-336 或 SigLIP,LUCID 依然有稳定表现。这说明它不是针对某一个编码器的“定制小抄”,而是对视觉语义检索机制本身下手。这个消融实验进一步证实了LUCID攻击的泛化能力。它表明,攻击者不需要知道目标系统具体使用哪种视觉编码器,只需要在一组公开的编码器上进行优化,生成的对抗扰动就可以有效地攻击使用不同编码器的系统。这大大降低了攻击的门槛,也增加了防御的难度。
图6:不同对话主题上的消融实验。无论是身份、过敏、安全、联系方式还是活动限制,攻击都能找到合适切口。尤其是这类高风险主题,一旦记忆被污染,后果不是“答错一道题”,而是可能把后续决策也带偏。这个实验揭示了LUCID攻击在不同应用场景中的广泛适用性。在身份相关的场景中,攻击可以导致系统错误地识别用户身份;在过敏相关的场景中,攻击可能导致系统给出危险的饮食建议;在安全相关的场景中,攻击可能导致系统忽略安全限制;在联系方式相关的场景中,攻击可能导致系统泄露或篡改用户的联系信息;在活动限制相关的场景中,攻击可能导致系统错误地允许或禁止某些活动。这些高风险主题的实验结果,凸显了LUCID攻击在现实世界中的潜在危害。
图7:上下文内污染与上下文外注入的快照诊断
图7:上下文内污染与上下文外注入的快照诊断。这个图的价值在于把“检索命中”和“生成受骗”拆成两个层面看,避免只盯着一个指标就自我感动。安全研究最怕的就是表面分数漂亮,实际业务一塌糊涂。通过这个诊断图,论文清晰地展示了LUCID攻击在检索和生成两个层面的效果。在大多数情况下,攻击在检索层面和生成层面都取得了成功,但也有少数情况是检索成功但生成失败,或者检索失败但生成成功。这种细粒度的分析,有助于更深入地理解攻击的机制和影响。
论文还做了防御评估,结论不太乐观。现有一些一致性检查、过滤或后处理手段,对这类攻击并不稳。原因也不复杂:攻击图像本身看起来正常,没有明显触发词,也没有文本异常,很多防线只能看到“这张图和别的图差不多正常”,却看不到它在嵌入空间里已经偷偷换了坐标系。对防御来说,这就是最烦的那种敌人——表面安静,内部作乱。论文测试了几种常见的防御方法,包括基于图像相似度的检测、基于文本一致性的校验、以及基于模型置信度的过滤。结果表明,这些方法都无法有效地检测出LUCID攻击。例如,基于图像相似度的检测方法无法区分原始图像和扰动后的图像,因为扰动幅度很小(ε=16/255)。基于文本一致性的校验方法也无法发现异常,因为攻击图像的文本描述是中性的。基于模型置信度的过滤方法同样无效,因为模型对攻击生成的回答往往具有很高的置信度。
表5:针对LUCID注入攻击的防御评估
表5:针对LUCID注入攻击的防御评估。可以看到,现有防御并没有把问题彻底堵住,说明这类攻击不是简单靠“加个规则”就能解决的。论文的防御评估结果,为后续的防御研究提供了重要的基准。它表明,现有的防御方法在面对LUCID这样的高级攻击时,效果有限。未来的防御研究需要探索新的思路,例如在记忆写入阶段引入对抗性训练、设计更鲁棒的视觉编码器、或者开发基于因果推理的记忆校验机制。
如果把整篇论文压缩成一句话,那就是:多模态智能体的长期记忆,不只是“存了什么”的问题,更是“图像能不能被悄悄改写”的问题。LUCID证明了,在黑盒、无文本、无触发词的条件下,图像仍然足以成为污染长期记忆的入口。这个结论对做多模态助手、RAG、记忆系统和安全防护的人都很直接:别只盯着回答对不对,还得盯着系统记住了什么、为什么会记成那样。这篇论文不仅揭示了一个重要的安全漏洞,也为未来的研究指明了方向。它提醒我们,在构建越来越智能的多模态系统时,不能只关注模型的性能和能力,还要关注其安全性和鲁棒性。记忆是智能的基础,如果记忆可以被污染,那么基于记忆的推理和决策都将变得不可靠。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它研究的是多模态智能体的长期记忆安全:攻击者只改图、不碰文本,也能把系统存下来的视觉记忆带偏。论文证明这不是单一后端的问题,而是多种记忆架构都可能存在的结构性风险。具体来说,论文提出了LUCID攻击方法,系统地评估了五种主流记忆后端和五种大语言模型在面对这种攻击时的脆弱性,并揭示了现有防御方法的不足。这项工作填补了多模态AI安全领域的一个重要空白,为后续的防御研究提供了基准和方向。

文中的 poisoning 和 injection 有什么区别?poisoning 是在已有对话上下文里污染一条本来可信的图像记录;injection 是在没有历史上下文的新图片消息里植入假概念。前者像把真日记改成假解释,后者像把假照片塞进新日记。从攻击难度上看,poisoning相对容易一些,因为攻击者可以利用已有的上下文来“背书”攻击图像;而injection更难,因为攻击者需要完全依靠图像本身的扰动来误导系统。但从隐蔽性上看,injection更难被发现,因为没有历史上下文可供对比。

为什么这种攻击难防?因为攻击图像肉眼几乎看不出来异常,文本通道又没有被动过,很多防御只能看到“正常图片”,看不到它在嵌入空间里已经偏航。只要记忆系统默认信任视觉证据,防守就会天然慢半拍。此外,现有的防御方法,如基于图像相似度的检测、基于文本一致性的校验、基于模型置信度的过滤等,都无法有效地检测出LUCID攻击。这主要是因为LUCID攻击的扰动幅度很小,且不依赖于任何显式的触发词或异常文本模式。未来的防御可能需要从记忆写入阶段入手,例如引入对抗性训练、设计更鲁棒的视觉编码器、或开发基于因果推理的记忆校验机制。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把攻击面从文本搬到图像长期记忆,而且还是黑盒、无触发词、无文本辅助,这个切口很新,也很实在。它首次系统性地研究了多模态智能体长期记忆的安全问题,填补了该领域的空白。

实验合理度:★★★★☆。五种后端、五种大模型、两种攻击模式、多个消融维度都覆盖到了,实验设计比较完整,结论不靠单点碰运气。评估指标的设计也很合理,区分了检索层面和生成层面的攻击效果。

学术研究价值:★★★★☆。它补上了多模态记忆安全里一个明显空白,至少能逼后续工作认真回答“记忆系统到底信不信图像”这个问题。这项工作为多模态AI安全领域开辟了一个新的研究方向。

稳定性:★★★☆☆。攻击在实验里能迁移,但真实产品里还要看输入链路、压缩、预处理和平台策略,离“拿来就能稳定复现”还有距离。不过,论文的实验设计已经尽可能地模拟了真实世界的攻击场景。

适应性以及泛化能力:★★★★☆。跨后端、跨模型表现都不错,说明不是某个架构的偶然漏洞,泛化性值得重视。消融实验也证实了攻击对不同视觉编码器和对话主题的适应性。

硬件需求及成本:★★★☆☆。攻击优化步数不算少,研究复现需要一定算力;但从防守视角看,代价更低的筛查机制仍然值得投入。不过,对于一次性的攻击准备来说,这个成本是可以接受的。

复现难度:★★★☆☆。方法链路清楚,但涉及多个后端、多个编码器和黑盒迁移,完整复现并不算轻松。不过,论文提供了详细的算法描述和实验设置,为复现提供了良好的基础。

产品化成熟度:★★★☆☆。作为攻击研究已经很成熟,但作为防御问题,离可直接落地还差一套更强的视觉一致性验证机制。论文提出的防御评估结果为后续的防御研究提供了重要的基准。

可能的问题:论文把风险讲得很清楚,但防御部分还偏弱;真正难的是如何在不伤用户体验的前提下,识别“看起来正常、实际上被改写”的图像记忆。未来的研究需要探索更有效的防御方法,例如基于对抗性训练的记忆净化、基于因果推理的记忆校验、或基于多模态一致性的异常检测。


主要参考文献

[1] Halima Bouzidi, Mboutidem Mkpong, Mohammad Al Faruque. Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents. arXiv:2607.15657v1, 2026.
[2] 原文链接:https://arxiv.org/pdf/2607.15657v1.pdf
[3] 文中引用方法:FOA-Attack [41]、CLIP [60]、Mem-Gallery [7]、ShareGPT4V-100K [13]、Mem0Memory [18] 等,具体定义与实验细节见原文。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。最近这类“记忆安全”论文越来越多,想和同好一起拆招、看门道、聊落地,进群就对了。🤚
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。