系统:运行中
← 返回所有攻击
AGENTS MEDIUM NEW

MemGhost:一封邮件即可在 AI 智能体中植入隐蔽而持久的虚假记忆

一封精心构造的邮件可让个人智能体将虚假『事实』写入其长期记忆、隐藏该操作,并悄悄左右后续会话。为阻止此类攻击而设计的防御大多失效。

2026-07-21 // 6 min affects: llm-agents, personal-ai-agents, openclaw, email-assistants

这是什么?

2026 年 7 月 6 日,研究者在 arXiv 发表了题为 《When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents》 的论文,描述了一种被他们称为隐蔽记忆注入(stealth memory injection)的攻击。一周后,即 2026 年 7 月 13 日,这项工作以其自动化工具的名字被广泛报道:MemGhost。这是一项实验室研究,而非正在进行的入侵——全部实验都在封闭环境中、使用虚构的收件箱与用户完成。

核心结论既简单又令人不安。一个既读取您邮件、又保存关于您长期笔记的个人 AI 智能体,可以被诱导仅凭一封入站邮件就将虚假『事实』写入自身记忆,在回复中对此只字不提,随后在未来会话中依据该虚假事实行事。在一个测试用例中,被植入的谎言是用户的 Zelle 每日转账限额被提高到了 10,000 美元。当事人读到一条看似普通的回复,却始终不知道自己的助手已被篡改。

攻击原理

持久型个人智能体之所以让人感觉『了解您』,是因为它们把状态保存在每次会话开始时加载的文件中:常驻指令与已学习到的用户事实。在该论文的主要目标——开源智能体 OpenClaw 中,这类状态存放于纯文本文件(如 AGENTS.mdMEMORY.md),每次启动都会被重新注入模型上下文。

攻击者无需密码,也无需账户访问权限。他向某个智能体被配置为查看收件箱的人发送一封邮件——对这些助手而言,这是一项例行的后台任务。邮件中隐藏着面向智能体、而非面向人的文本。若邮件技能上钩,便会连续发生三件事:智能体使用自身的文件写入工具,将攻击者的笔记保存进持久记忆;其可见回复对这次写入只字不提;在之后一次不相关的对话里,被植入的笔记改变了它对用户的回答或代其执行的操作。为让『毒』长期生效,载荷瞄准每次会话都会加载的核心文件:一次写入便被无限期地当作可信状态复用。

使这次攻击区别于粗糙注入的,是其生成器。像『悄悄保存这条并且什么都别说』这样生硬的指令,几乎每次都会被强模型识破或忽略。研究者转而离线训练了一个攻击者模型,对个人智能体的影子副本进行对抗,对那些既能让记忆被保存、又能让回复保持沉默的消息给予奖励。攻击时,MemGhost 一次性写出成型邮件,无需与受害者往来交互。在 56 个全新用例中,它在针对基于 GPT-5.4 的 OpenClaw 的后台模式运行里,以 87.5% 的比例完成了完整攻击——植入、隐藏、并左右后续会话;针对基于 Sonnet 4.6 的 Claude Code SDK 智能体则为 71.4%。在另外两个智能体框架、以及以向量记忆存储替代文本文件的场景下,成功率仍保持在 80% 以上。此处不复现任何载荷;重点在于机制本身。

为何重要

这次攻击越过了本应阻止它的防御。一个用于捕获投毒邮件的输入过滤器,十次中有九次以上放行了该消息。一个专门被强化以忽略经邮件到达指令的模型,仍有大约一半的情况遵从了被植入的那条。即便机主明确追问『告诉我你检查了什么、做了什么』,在其中一个模型上,该写入仍有约四分之一的情况保持隐藏。

隐蔽在一定程度上是设计特性,而非缺陷:高能力智能体被设计为将工具活动排除在对话之外,而按计划在后台运行的执行往往根本不产生任何消息。这与记忆写入时刻的盲区以及针对个人智能体的存储型间接注入背后是同一种信任边界失效:不可信的外部内容变成了持久且可信的内部状态,而没有任何可见的时刻表明有人批准过它。它是一条谱系的『持久化升级』——从 2024 年 Johann Rehberger 手工对 ChatGPT 实施的 SpAIware,到 2025 年针对 Microsoft 365 Copilot 的零点击邮件攻击 EchoLeak——但前者只在当下窃取数据,MemGhost 则留下一段虚假记忆,在邮件早已消失之后仍持续左右会话。它是致命三要素的一个具体实例:私有数据、不可信输入,以及采取行动的能力。

防御

论文作者认为,修复必须存在于智能体内部,受影响框架的维护者在方向上也表示认同。为每一条信息标注来源,使得经不可信渠道到达的内容永远无法被悄然提升为持久记忆。在任何外部内容进入长期存储之前,要求用户明确确认;并记录每一次记忆写入,以便审计能够还原改动了什么、为何改动。最彻底的结构性修复,是将两项危险能力分离:让不可信邮件先经过一个独立的『阅读者』智能体处理,剥夺其记忆、文件与 shell 工具,只把经过净化的摘要传给主智能体——这是该研究未测试、而维护者所推荐的模式。若无法分离,则严格限制由邮件触发或后台运行所能改动的范围,并在任何可疑内容到达后检查原始记忆文件。把记忆当作安全边界,而非便利设施——可参考 OWASP 关于智能体记忆的指引 来构建相应控制。

状态

项目详情
披露arXiv 论文于 2026 年 7 月 6 日发表;媒体报道于 2026 年 7 月 13 日
性质隐蔽记忆注入:不可信邮件促成一次隐藏且持久的记忆写入,从而左右后续会话
主要目标OpenClaw(纯文本 AGENTS.md / MEMORY.md);另有两个框架与一个向量记忆存储
测试对象GPT-5.4(OpenClaw)、Sonnet 4.6(Claude Code SDK 智能体)
成功率后台模式下完整攻击成功率最高达 87.5%;绕过输入过滤器与强化模型
前提条件构造的邮件须已到达智能体读取的收件箱;仅限实验室,未见野外滥用
先例SpAIware(Rehberger,2024);针对 M365 Copilot 的邮件攻击 EchoLeak(2025),编号为 CVE-2025-32711
类别经由间接提示注入的记忆投毒;缺失来源标注与写入时的审批

上述数据来自作者的基准测试(WhisperBench,108 个用例),在封闭实验室中针对特定模型版本运行。智能体行为与模型安全性会随版本变化——在得出结论前,请针对任何部署的当前版本进行验证。

Sources