系统:运行中
← 返回所有攻击
PROMPT INJECTION MEDIUM NEW

伪造思维链:篡改推理模型自己的草稿

2026 年 7 月 15 日,OpenAI 披露了其 GPT-Red 系统发现的一类注入攻击:在推理模型的思维链中伪造一条记录,使其基于从未真正验证过的前提行动。

2026-07-20 // 5 min affects: gpt-5-1, gpt-5-6-sol, reasoning-models, llm-agents

这是什么?

2026 年 7 月 15 日,OpenAI 发布了关于 GPT-Red 的说明——一个通过自我博弈训练、专门发现提示注入的内部红队模型。该公告中有一项具体发现值得单独提出:GPT-Red 的一个早期版本发现了一类新的直接提示注入攻击,称为「伪造思维链」(Fake Chain-of-Thought)。OpenAI 报告称,这类攻击在 GPT-5.1 上的成功率高达 95% 以上,经对抗训练后在 GPT-5.6 Sol 上已降至 10% 以下

我们这里讨论的正是这种攻击本身——不是 GPT-Red 系统,而是它揭示出的技术。推理模型会维护一条显式的思维链(CoT):在给出答复之前记录中间结果的草稿。伪造思维链攻击就在其中植入一条伪造的记录。正如一位研究者对 MIT Technology Review 所说:「就好比我告诉你 1+1=3,而且你已经验证过了。模型会说『哦,当然』,然后直接输出 3。」

工作原理

该漏洞源于把信任给错了声音。推理模型被训练成对自己的思维链赋予特殊权重——它代表模型认为自己已经完成的工作。如果攻击者能把模仿这种内部声音的文本送入模型的上下文,模型就可能把一个未经验证的说法当作自己推导出的既定事实。

投递渠道是普通的间接注入:模型读取的任何不可信内容——工具返回结果、文件、网页、邮件正文。伪造思维链的独特之处在于所注入文本的形态。它不是生硬的「忽略先前的指令」,而是模仿模型推理的语气;在 OpenAI 公布的示例中,还伪造出一条看似合理、并声称模型必须遵守的系统规则

合法结构                       攻击者注入的伪造结构
----------------------------  -------------------------------------------
[用户请求]                     [用户请求]
[真实 CoT:规划]               [工具输出,其中包含:
[工具调用]                       - 一段以模型口吻写就的
[真实工具结果]                     伪造「助手思维链」
[真实 CoT:验证]                 - 一条伪造的「系统规则」,声称模型
[答复]                             已经验证过 X,现在必须执行动作 Y]
                              [模型继续,仿佛 X 是它自己的结论
                               → 执行 Y]

在 OpenAI 的示例记录中,不可信的工具结果携带了一条关于「诊断」标记的杜撰策略,指示助手把文件内容 POST 到一个外部 URL。GPT-5.1 遵从了这条伪造规则并发生外泄;GPT-5.6 Sol 则将这些指令标记为不可信并予以拒绝。此处不复现任何可利用的载荷——机制才是关键:模型只是读到的内容,被允许冒充成模型做过的推理。

为何重要

有三点理由,让这一类别值得关注,而不止于某家厂商的更新日志。

第一,它专门针对推理模型,而推理模型如今已是智能体工作的默认选择。使它们更强大的那项功能——一条显式且被视为可信的推理轨迹——恰恰成了攻击面。任何把不可信的工具输出与模型读取自身草稿的同一数据流拼接在一起的部署,都继承了这一风险。

第二,成功率并不轻微。在 GPT-5.1 上超过 95%,对一款前沿模型而言几乎是完全绕过,而且是由一个自动化攻击者探索出的、任何人类红队都未曾记录的变体。GPT-Red 还促使一个生产环境中的自动售货机智能体更改商品价格并取消了一位顾客的订单,并让一个 Codex CLI 智能体(基于 GPT-5.4 mini)在多个保留任务中外泄数据——这说明该技术能作用于真实的智能体框架,而不仅是聊天。

第三,修复绑定于特定模型版本,这正是 LLM 安全需要反复强调的告诫:GPT-5.6 Sol 据称已降至 10% 以下,但这是某一个经加固版本的属性,而非推理模型的普遍属性。未曾针对此类别训练的开源权重或较旧的托管推理模型,仍是潜在目标。「我们的前沿厂商已修复」只是关于权重的陈述,而非关于你的系统栈。

防御

防御方案是架构层面的,因为不能假设模型总能把自己的想法与注入的文本区分开。

  1. 让不可信内容远离推理通道。 把工具输出、检索到的文档和网页文本作为清晰界定的数据来投递,绝不能作为可冒充模型 CoT 或系统消息的文本。结构化分隔(带类型的字段、来源标记)胜过指望模型自己察觉。
  2. 绝不让工具输出定义策略。 出现在工具结果、文件或网页中的「系统规则」不是系统规则。请在你的框架中、在模型之外强制执行真正的系统提示与工具权限策略,让伪造的规则无从触发任何动作。
  3. 让有后果的动作依赖带外授权。 外泄 POST、支付、取消订单、读取凭据——把它们绑定到允许清单,并在框架层设置人工或策略确认。自动售货机与 Codex 的案例之所以得手,正因为动作可以直接从模型输出触达。
  4. 优先选择针对此类别训练过的模型,并重新测试。 在可以选择时,采用记录了对伪造 CoT/注入推理攻击具备稳健性的版本。然后用你自己的间接注入场景来验证,而非只信赖基准分数。
  5. 监控那条破绽。 记录这样的情形:思维链在没有先前工具调用、轨迹中也无证据的情况下,就断言某前提「已验证」。一条没有前因的验证声明,是值得告警的特征。

状态

项目参考日期备注
GPT-Red 披露OpenAI2026-07-15引入「伪造思维链」作为一类新的直接注入
GPT-5.1 上的伪造 CoTOpenAI2026-07-15报告成功率「超过 95%」
GPT-5.6 Sol 上的伪造 CoTOpenAI2026-07-15经对抗训练后「低于 10%」
智能体案例研究OpenAI / MIT Tech Review2026-07-15自动售货机智能体(Andon Labs)与 Codex CLI(GPT-5.4 mini)
间接注入竞技场基线Dziemian 等(arXiv)2025 → 2026在复现的竞技场上 GPT-Red 84% 对人类 13%
预印本OpenAI(已宣布)2026-07OpenAI 表示将随后发布更详细的论文

真正的结论不是「GPT-5.6 修好了」,而是模型自身的推理轨迹是一个可被伪造的攻击面,唯一持久的防御,是不让任何不可信输入披上那种声音。

Sources