论文标题:
Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents
发表日期:
2026年07月
发表单位:
University of California, Irvine
原文链接:
https://arxiv.org/pdf/2607.15657v1.pdf
多模态智能体的记忆,竟能被一张图片“篡改”?
多模态智能体最怕的,往往不是当场答错,而是把错的东西存进记忆里,还以为自己“记得很准”。这篇来自加州大学欧文分校的论文,瞄准的就是这个最阴的点:攻击者不用碰文本,不用改模型权重,甚至不需要知道目标系统长什么样,只要对一张用户共享的图片做不可见扰动,就可能把长期记忆带偏。这种攻击之所以令人不安,是因为它触及了多模态智能体架构中的一个根本假设——视觉输入是可信的。在大多数系统中,图像被当作客观事实的载体,与文本描述一同被编码、存储和检索,而系统很少对图像内容进行“真实性校验”。LUCID(Long-term memory Under Covert Image Distortion)攻击正是利用了这种信任,通过精心设计的对抗扰动,让一张看似无害的图片在嵌入空间中“漂移”到另一个语义区域,从而在系统记忆中植入错误信息。图1:LUCID整体流程。第1步先选出语义上“相冲突”的目标图像;第2步根据攻击场景分成两种模式:in-context poisoning(上下文内污染)和out-of-context injection(上下文外注入);第3步再做不可见对抗扰动。整条链路都是黑盒。这个流程的关键在于,攻击者不需要任何关于目标系统内部结构的先验知识,只需要能够向系统提交图像,并观察系统的响应(例如检索结果或生成的回答)。这种黑盒设定使得LUCID具有很高的实用威胁性,因为它模拟了真实世界中攻击者可能拥有的最有限的能力。这事之所以吓人,不是因为“图片会骗人”,而是因为记忆系统默认相信图片。在很多多模态智能体里,图片和文本会一起被编码、一起被存储、一起被检索。系统看到一张图,通常不会先做“真假审问”,而是直接把它当成过去发生过的事实。于是,攻击者只需要让图像在嵌入空间里“滑”到另一个语义区域,表面看起来还是那张图,系统脑子里却已经换了剧情。这种攻击的隐蔽性在于,它不依赖于任何显式的触发词或异常文本模式,因此传统的基于规则的内容过滤方法很难检测到它。攻击者甚至不需要知道目标系统使用的是哪种具体的记忆后端或大语言模型,因为LUCID的对抗扰动是在一组公开的视觉编码器上优化的,然后通过迁移性攻击到目标系统上。论文把攻击分成两类。第一类是记忆污染:原本对话里已经有文字上下文,图片只是证据之一,攻击者把这张图替换成扰动后的版本,让系统把真实事件“记错语境”。例如,在一个关于用户饮食偏好的对话中,用户上传了一张沙拉的照片并说“这是我今天的午餐”,攻击者将这张沙拉图片扰动后,系统可能会在记忆中错误地关联到“披萨”的概念。第二类是记忆注入:对话里本来没有任何历史上下文可供核对,系统只能相信新上传的图,于是错误概念直接被塞进记忆里,后续查询时再慢慢发酵。例如,攻击者上传一张看似普通的风景照,但经过扰动后,系统会将其记忆为“用户曾访问过某个危险区域”,从而在后续的安全相关查询中给出错误建议。
攻击者只需操纵一张图,就能让AI“记错”一切
先把人话讲明白:这不是那种“输入一张图,模型立刻胡说八道”的短命攻击,而是更麻烦的长期污染。一次成功,后面很多轮问答都可能继续被带偏。对个人助手来说,可能是把饮食记录记错;对机器人或任务助手来说,可能是把物品、地点、身份、限制条件都记歪。记忆一旦脏了,后面每次检索都像在翻一本被人偷偷改过的日记。这种长期污染的特性使得LUCID攻击的后果具有累积性和扩散性。例如,在一个智能家居助手中,如果用户的“禁止进入区域”的记忆被污染,助手可能会在未来多次错误地允许进入,造成持续的安全隐患。在医疗健康助手中,如果用户的过敏信息被错误地注入记忆,助手可能会在未来的饮食建议中反复推荐过敏原食物。这种“一次污染,长期受害”的特性,使得LUCID攻击比传统的对抗性攻击更具破坏力。论文的威胁模型很克制,也因此更有说服力。攻击者只能改图,不能碰文本通道,不能看目标模型参数,不能读记忆库内容,也不能直接写入存储。换句话说,攻击者不是“后台管理员”,只是一个会在图片里藏针的人。黑盒、图像受限、无触发词、无文本辅助,这几个限制叠在一起,才显得这件事更扎心。具体来说,攻击者只能通过向目标系统提交图像来发起攻击,无法控制或修改系统接收到的文本输入,也无法访问系统的内部状态(如模型权重、记忆库内容)。攻击者甚至不需要知道系统使用的是哪种具体的记忆后端(如MuRAG、NGMemory等)或大语言模型(如GPT-4o、Claude等)。这种极端的黑盒设定,使得LUCID攻击在现实世界中具有很高的可行性,因为攻击者通常只能通过公共接口(如API)与目标系统交互。表1:以往针对检索增强和记忆型多模态大模型系统的攻击对比。LUCID同时满足长期记忆、仅图像、无触发词、无需直接写入、跨多种后端、黑盒和双模式攻击这几项条件,说明它不是在“顺手补个漏洞”,而是在补一个此前几乎没人正面打过的安全缺口。从表中可以看出,以往的工作要么只针对短期记忆(如单轮对话中的对抗性攻击),要么需要访问模型参数(白盒攻击),要么依赖于特定的触发词或文本模式。LUCID是第一个在如此严格的约束下,系统性地研究多模态智能体长期记忆安全的工作。它填补了从“图像对抗攻击”到“长期记忆污染”之间的空白,揭示了多模态智能体架构中一个被忽视的安全脆弱点。这里顺手把几个缩写讲清楚。ASR是Attack Success Rate,攻击成功率;MLLM是Multimodal Large Language Model,多模态大语言模型;CLIP是Contrastive Language-Image Pre-training,对比式语言-图像预训练模型。论文还提到一个关键技巧叫FOA-Attack,即Feature Optimal Alignment Attack,特征最优对齐攻击,原始方法来自文献[41],LUCID在此基础上又加了文本对齐目标。这个文本对齐目标是LUCID的一个关键创新点。传统的FOA-Attack只优化图像特征的对齐,即让扰动后的图像在视觉编码器的特征空间中更接近目标概念。但LUCID发现,仅仅对齐图像特征是不够的,因为很多记忆后端在存储时会将图像和其关联的文本描述一起编码。因此,LUCID额外引入了一个文本对齐目标,让扰动后的图像在联合的图文嵌入空间中,也与其目标概念的文本描述更接近。这种“双对齐”策略,使得攻击效果更加鲁棒和可迁移。
[1] Halima Bouzidi, Mboutidem Mkpong, Mohammad Al Faruque. Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents. arXiv:2607.15657v1, 2026.[2] 原文链接:https://arxiv.org/pdf/2607.15657v1.pdf[3] 文中引用方法:FOA-Attack [41]、CLIP [60]、Mem-Gallery [7]、ShareGPT4V-100K [13]、Mem0Memory [18] 等,具体定义与实验细节见原文。