系统:运行中
← 返回所有攻击
DATA LEAK MEDIUM NEW

智能体隐私评测只盯住一个出口,漏掉近半暴露

2026 年 9 月 16 日的一篇 arXiv 论文为「隐私暴露位移」命名并给出数字:只看预期出口,会漏掉可见出口并集所能发现暴露量的 46.9%。

2026-09-20 // 7 min affects: llm-agents, tool-using-agents, computer-use-agents, web-navigation-agents

这是什么?

2026 年 9 月 16 日,五位作者——Guosen Wu、Huizhen Huang、Guoxiong Long、Tao Huang 和 Chen Hou——在 arXiv cs.CR 上发布了 ASLEval。全文八页,讨论的是一个测量误差而非一种攻击,却是本月智能体隐私领域最有价值的一份成果。

这个误差如今有了名字:隐私暴露位移(privacy exposure displacement),定义为局部评测代理指标与以目标为基准的会话真实暴露之间的偏差。说得直白一些:多数针对工具型智能体的隐私评测,只检查某一个指定动作、最终回复,或攻击方的自我报告。而一次智能体会话的出口远不止这些。从其他通道流出的内容不被计分,因而等同于不存在。

需要记住的核心数字:在多个企业级环境和两套独立实现的运行时上,只看预期出口的视角,会漏掉所有已声明可见出口并集所能发现暴露量的 46.9%。

工作原理

ASLEval 的贡献是一份测量契约,而不是一项技术。三个设计选择承担了主要作用。

预先登记一组隐藏目标。 事先确定哪些具体条目算作敏感信息,并据此计分,而不是依据评判者对会话记录的主观印象。缺少预先指定的目标,出口、报告与工具路径之间就没有共同的真值基准,两个基准测试完全可能仅仅因为标注对象不同而结论相左。

声明完整的可见边界。 枚举内容可能离开会话的每一条通道——不只是场景预期的那一条——并测量其并集。46.9% 这个数字正是相对该并集得出的。

内部轨迹仅用于诊断,不用于计分。 智能体循环内部的中间证据被排除在结论之外,只用来解释结论。论文在此给出的是一个方向性结论:与结构对齐的内部证据通常先于可见暴露出现,体现在请求或探测层面。

  多数评测计分的范围            ASLEval 计分的范围
  ──────────────────            ──────────────────
                                ┌─ 预期出口      ─┐
  仅预期出口  ──────────►       ├─ 其他可见出口  ─┤──► 并集
                                ├─ 工具路径      ─┤    (+46.9%)
                                └─ 替代通道      ─┘
                                       │
                                内部轨迹 ──► 仅用于诊断

另有两项结论,对任何解读隐私分数的人都很重要。攻击方自我报告同时存在遗漏与高误报——询问攻击模型是否拿到了数据,它会在两个方向上同时出错,因此其报告无法替代实际观测。以及,减少模型可见的返回内容会改变暴露路径,但可能使正常任务无法完成:那个显而易见的缓解手段——少给模型看——并非没有代价。

为什么重要

这一结果落在一片已经向代理指标漂移两年的文献之中,并且解释了一个早已显现的规律。

回看 AgentDAM(arXiv 2503.09780),一个面向网页导航智能体数据最小化的 246 项任务基准。其作者做过同类的小规模对照:先询问模型披露某条信息是否合适(probing),再观察智能体的实际行为。差距明显且方向一致——gpt-4o 在询问下得 0.915,实际执行中只有 0.646;gpt-4o-mini 为 0.890 对 0.557。询问模型关于隐私的看法,测的是它声明的规范;运行它,测的是它的行为。这是两个不同的量。

随后是 AgentCIBench,由 UKP Lab 的 Anmol Goel 与 Iryna Gurevych 于 2026 年 6 月 22 日以 Capable but Careless 为题发布。它在一个六应用工作区中对情境完整性失效进行确定性评分,基于 128 个人工撰写的种子场景,采用确定性匹配器与 LLM 评判者保守合并的方式。其自身的表述很说明问题:由于拒答会掩盖原始泄漏率,主要指标改为按参与度归一的泄漏率 Leng = L / (1 − R)。他们给出的结论——任务完成能力并不能预测披露上的克制——意味着”能干”与”审慎”是两条互相独立的轴。其报告的 15 个前沿智能体评测中,有 11 个在超过半数场景中发生泄漏,平均为 67.9%。

把三者并排来看,结论并不令人舒服:已公布的智能体泄漏率是下限,而非估计值。 询问式评测高估了克制程度;只计预期出口的评分把暴露低估了约一半;若不作修正,拒答还会抬高分母。这条测量链条上所有已知偏差都指向同一个方向。

这对采购有直接影响。供应商的隐私分数,其价值取决于计算时所覆盖的出口集合,而几乎没有哪份报告会说明这个集合。我们曾就防护分数不等于部署证据以及安全基准彼此矛盾提出过同样的论点;这一次是隐私领域的具体实例,并且带着一个数字。

防御建议

对任何隐私数字,先问它的出口集合是什么。 比较两个智能体之前,先确认二者是按可见出口的并集计分,还是只按预期出口计分。如果报告没有说明,就把该数字当作下限处理,并把这一点写进评估结论。这是当前 AI 供应商评审中回报最高的一个问题。

在做监控之前,先枚举自己的出口。 在自有部署中列出内容可能离开的每一条通道:助手回复、外发消息与邮件、文件写入、发送给第三方的工具参数、日志、遥测、搜索查询、webhook 载荷。多数团队都会发现此前未曾计入的通道。没有写下来的边界无法监控。这自然延续了目的绑定披露的思路——目的约束”什么”,出口集合约束”去哪里”。

在内部测试中预先登记目标。 在运行之前就确定哪些记录算作敏感,而不是事后翻看会话记录再判定。事后标注等于让评判者只对它碰巧注意到的内容打分,而这正是 ASLEval 所形式化的那种失效。

不要把模型的自我报告当作证据。 这既适用于红队框架中的攻击模型,也同样适用于被要求上报自身披露行为的生产环境智能体。结论是遗漏叠加高误报——两个方向同时出错,误差不会相互抵消。

在请求层面对前兆告警。 由于与结构对齐的内部证据通常先于可见暴露出现,一条形态贴合敏感结构的查询,就是在任何内容流出之前即可获得的信号。检查工具调用参数的成本,低于事后重建暴露路径,而且与幽灵工具调用使用的是同一个监控点。

隐私与效用一并报告。 两篇论文在此达成一致:限制模型可见的返回内容可能使正常任务无法完成,而效用并不能预测克制。脱离任务成功率的隐私数字无法解读,反之亦然。

状态

项目详情
主要来源Wu G.、Huang H.、Long G.、Huang T.、Hou C.,《ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions》,arXiv:2609.18864 [cs.CR]
日期2026 年 9 月 16 日提交(v1);8 页,3 幅图
许可CC BY-NC-SA 4.0
核心概念隐私暴露位移——局部评测代理指标与以目标为基准的会话暴露之间的偏差
核心数字只看预期出口,会漏掉可见出口并集所发现暴露量的 46.9%
次要结论攻击方自我报告同时存在遗漏与高误报;与结构对齐的内部证据先于可见暴露;减少模型可见返回可能导致正常任务失败
方法预先登记隐藏目标集;测量全部已声明可见出口;内部轨迹仅用于诊断;对裁决流程进行独立人工复核
佐证工作Goel A.、Gurevych I.,《Capable but Careless》,arXiv:2606.23189,2026 年 6 月 22 日——AgentCIBench,128 个种子场景,六应用工作区,按参与度归一的泄漏率 Leng = L / (1 − R)
先前证据AGENTDAM,arXiv:2503.09780——246 项任务;询问式与实际执行的隐私分数存在分歧(gpt-4o 0.915 / 0.646;gpt-4o-mini 0.890 / 0.557)
厂商状态并非产品漏洞;不涉及安全公告、补丁或协调披露
实践状态属基准测试方法建议,可立即用于采购评估与内部红队设计

Sources