Lucid:一张无法察觉的图片即可改写多模态智能体的记忆
2026 年 7 月的一篇论文表明,仅掌控一张图片的黑盒攻击者——无需访问模型、无需文本——就能破坏多模态智能体的「记忆」,进而左右其后续回答。该方法在五种记忆架构上得到验证,其中包括一套商用系统。
这是什么?
2026 年 7 月 20 日,Halima Bouzidi、Mboutidem Ekemini Mkpong 与 Mohammad Abdullah Al Faruque 在 arXiv 上发表了题为《Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents》的论文,提出了一套名为 Lucid 的攻击框架。这是在受控测试环境中开展的实验室研究,并非真实发生的安全事件。
结论虽范围有限,却相当尖锐。保有长期记忆的多模态智能体——即存放过往图像与文本、可供日后调取的存储——会像信任忠实记录一样信任记忆中的图像。Lucid 表明:一名仅掌控一张图片、且无法访问模型、检索系统或其周边文本的攻击者,能够在该图片中植入无法察觉的扰动,从而改变智能体日后回忆并陈述的内容。用户看到的是一张普通图片和一个普通回答,始终不会察觉记忆已被篡改。
工作原理
Lucid 在作者所称的「严格限定于图像的黑盒威胁模型」下运作。攻击者无需窥视视觉语言模型的内部,无需接触为记忆建立索引的检索编码器,也不触碰文本通道,只影响智能体将要存储或推理的那张图片的像素。该扰动被设计为视觉上无法察觉,因而能够通过粗略的人工审阅。
在此基础上,论文描述了两种不同的失效模式。在记忆投毒(一种上下文内攻击)中,对抗图像替换掉一张含义被周边文本强化的良性图像,从而破坏智能体的视觉回忆,并在后续对话轮次中将其引向攻击者选定的叙事。在记忆注入(一种脱离上下文的攻击)中,对抗图像出现在一个没有先前文本支撑的对话轮次里,因此没有来自记忆的纠正信号,智能体会直接生成受攻击者影响的回答。
真正值得注意的是其覆盖面。作者在多个对话领域以及五种黑盒记忆架构上评估了 Lucid,其中包括图结构记忆、由 LLM 摘要的记忆以及一套商业化部署的系统,最终取得投毒 61.6%、注入 58.4% 的攻击成功率。本文不复现任何扰动配方或载荷;重点在于机制本身。
为何重要
已公开的记忆攻击大多经由文本进入——一封陷阱邮件、一份伪造文档、一条藏在网页里的指令。Lucid 堵住了「图片比文字更安全」这一假设。如果智能体会拍摄收据、截取仪表盘、接收共享图片,或从网页上抓取图片并归入长期记忆,那么这张图片如今就是对持久状态的一次不可信写入。这种污染会跨会话持续存在,在原始对话轮次早已滚出屏幕之后仍左右决策;而且由于改动存在于像素而非文字之中,文本输入过滤器与指令加固都无从察觉。
这与一条快速扩张的研究脉络相呼应,即把多模态记忆视为攻击面,包括针对 Web 智能体多模态记忆的触发式投毒,以及针对智能体推荐系统的记忆投毒。它是MemGhost等文本通道隐蔽写入的视觉对应物:在每一种情形中,外部内容都在没有任何可见批准环节的情况下变成了受信任的内部状态——这正是贯穿智能体记忆的同一处写入时刻盲区。
防御
把每一张被存储的图片都当作不可信输入,而非事实依据。为记忆标注来源,使智能体能够判断被调取的图像究竟来自可信采集,还是来自攻击者可触及的外部来源,并拒绝让不可信图像悄然「晋升」为影响决策的持久记忆。由于 Lucid 是黑盒且无法察觉,人眼无从辨识:防御者应依靠集成方法与交叉校验——将被调取的图像与随附文本相互印证,标记「仅凭一张无文本支撑的图像即左右决策」的对话轮次,并在仅基于图像的回忆触发有后果的动作之前要求确认。对进入记忆的图像进行净化与对抗鲁棒性预处理,可提高可用扰动的成本,但论文的黑盒结果也提醒我们:不应把任何单一过滤器视为充分。最重要的是,把记忆的写入与读取置于带日志记录的安全边界之内,使被投毒的回忆可被追溯并回滚——可参见OWASP 关于智能体记忆的指南中可落地的控制措施。
状态
| 项目 | 详情 |
|---|---|
| 披露 | arXiv 论文于 2026 年 7 月 20 日公布 |
| 性质 | 针对多模态智能体长期记忆的黑盒、仅凭图像的对抗攻击(投毒与注入) |
| 威胁模型 | 无法访问目标 MLLM、检索编码器或文本通道;仅有一处无法察觉的图像扰动 |
| 测试对象 | 五种黑盒记忆架构,含图结构、LLM 摘要以及商业化部署系统 |
| 成功率 | 投毒 61.6%;注入 58.4% |
| 前提条件 | 对抗图像须进入智能体的记忆流水线;仅限实验室,未见真实滥用 |
| 类别 | 由对抗扰动引发的多模态记忆投毒;缺失来源标注与写入审批 |
上述数字反映作者在密封实验室环境中、针对特定模型与记忆版本运行的基准结果。智能体行为与防御措施会随版本变化——在得出结论前,请针对任何部署的当前版本加以验证。