系统:运行中
← 返回所有攻击
DATA LEAK MEDIUM NEW

上下文推断攻击:无需越狱即可泄露

2026 年 8 月的一篇论文形式化了上下文推断攻击:智能体即便从未直接披露,也会泄露关于其静默加载记录的可利用信号。

2026-09-21 // 6 min affects: llm-agents, rag, web-browsing-agents, mcp, a2a

这是什么?

关于大模型系统隐私的研究大多只衡量一件事:攻击者能否让模型把秘密说出来?越狱式提取、系统提示词转储、逐字复述。2026 年 8 月 31 日提交至 arXiv 的论文 Context Inference Attacks Without Jailbreaks(arXiv:2609.01663,作者 Prince Jha、Samuele Poppi、Nils Lukas)认为,这一视角完全忽略了智能体场景。

在智能体部署中,敏感材料——医疗记录、财务文件、内部工单——并非由用户粘贴,而是由智能体自身的工具调用组装进一个隐藏的上下文,随后智能体在此基础上回答普通且无害的问题。作者形式化了上下文推断攻击:攻击者即使从未获得任何披露,仅凭智能体的正常回答,仍可判定哪些记录被加载。

工作原理

论文将该问题表述为一个安全博弈。攻击者提交无害查询、观察回答,并为候选上下文打分——目标是在候选集合中识别出真实的那一个,而非让模型复述内容。整个交互过程看不出任何攻击迹象:没有对抗性后缀,没有角色扮演,也没有需要绕过的拒绝。

论文评估了三种设定,攻击者知识逐步减少,上下文的传递方式也逐步间接:

  • 已知上下文——攻击者知晓候选记录。
  • 未知上下文——提示词模板与周边记录均未知。
  • 智能体检索的上下文——记录经由智能体自身的检索调用到达,攻击者完全不触及加载路径。

作者还区分了灰盒设定(使用目标模型本身为观测打分)与黑盒设定(攻击者使用自己掌控的替代模型打分)。同一套攻击无需修改即可贯穿三种设定。

论文报告的数值(随机基线分别为 1/|候选数| 与 50 AUROC):在小候选集合上攻击成功率为 100%,已知上下文下 1024 个候选时为 63%;模板与周边记录未知时为 78.9 AUROC;以 140 亿参数替代模型为 320 亿参数目标打分时为 92.5 AUROC;记录经由智能体检索返回时为 81.8 AUROC。泄露程度被刻画为查询预算、上下文规模与目标模型规模的函数。

为何重要

真正令人不安的是被测试的那组控制措施。作者指出,所评估的智能体在以下缓解手段下依然脆弱:不得披露上下文的指令、logit 抑制与上下文稀释。而这三者恰恰是大量生产部署实际依赖的手段——系统提示词中一条严厉条款、一层输出过滤,外加大量周边文本。

它们都没有触及真正的泄露,因为泄露并不在输出文本之中,而在以上下文为条件的无害输出的分布之中。一个网页浏览智能体在回答无关紧要的问题时,仍然携带着关于静默加载内容的可利用信号。而某条记录是否在其中——「这份病历是否在范围内?」——本身往往就是敏感事实,与内容无关。

2026 年 9 月 1 日发表的另一项受控研究(arXiv:2609.01693)在上下文内敏感度标签方面给出了方向一致的结果。在单一 MCP-到-A2A 配置下的 480 次试验中,PUBLIC - OK TO SHARE 标头在描述层面与更多逐字字段外泄相关联,且模型间差异显著;而「机密」与「无标签」之间的对比受地板效应限制,结论不明确。作者明确说明这只是单一配置下的相关性,并非因果或普遍效应——但这仍是一个理由,说明不应把置于上下文中的敏感度标签当作执行机制。

防御

论文在防御方面的贡献是否定性的——它表明哪些控制未能奏效。因此以下建议源自威胁模型本身,而非经过测量验证的缓解措施。

不要再把提示词层面的保密当作一项控制。「不要泄露上下文」是对一个通过输出分布泄露信息的组件下达的指令,而非一道边界。应将其视为基本卫生,绝不可作为评估通过的理由。

把检索范围变成授权决策,而非提示词细节。 如果某条记录不应被某个调用方推断出来,它就不应进入该调用方的上下文。应在组装之前,于检索层与工具权限层按请求者身份进行过滤。

对每个会话的查询设限并监控。 泄露随查询预算增长。速率限制、会话上限,以及对重复且高度相似查询的异常检测,能显著抬高这一区分博弈的成本。

假定存在替代模型打分。 黑盒并不等于安全:较小的开源权重替代模型以 92.5 AUROC 为更大的目标打分。仅控制对 logits 或目标模型的访问并不足够。

在组装环节做脱敏与泛化。 当「是否在其中」本身即属敏感时,应优先在上下文窗口中使用聚合、分桶或合成的表示,而非逐字记录。

把上下文中的标签视为元数据,而非策略。 应在智能体之间的工具层与传输层执行共享决策,而不是依靠一个请求模型遵守的标头。

状态

方面详情
主要来源Context Inference Attacks Without Jailbreaks(arXiv:2609.01663),2026 年 8 月 31 日提交
类别针对智能体隐藏上下文的推断 / 隐私攻击——无需越狱,也无需披露
报告无效的控制不披露指令、logit 抑制、上下文稀释
主要结果小候选集合 100% 成功率;1024 候选时 63%;未知上下文 78.9 AUROC;14B 替代模型对 32B 目标 92.5 AUROC;智能体检索场景 81.8 AUROC
佐证研究MCP-到-A2A 逐字字段外泄研究(arXiv:2609.01693),2026 年 9 月 1 日
性质研究成果——无 CVE、无厂商公告;影响的是智能体架构本身,而非某一具体产品

Sources