系统:运行中
← 返回所有攻击
DEFENSE MEDIUM NEW

在一个基准上表现出色的提示注入检测器,在你的智能体里可能几乎全部漏检

2026年10月2日的arXiv研究评估了十五个检测器,发现基准排名无法迁移到智能体工具输出:同一检测器在BIPIA上检出95.1%,在AgentDojo上仅2.1%。

2026-10-06 // 6 分钟 affects: prompt-injection-detectors, prompt-guard, protectai-deberta, llm-agents

这是什么?

提示注入检测器是部署在智能体与其读取内容(网页、邮件、工具返回结果)之间的小型分类器,用来标记试图向智能体下达新指令的文本。厂商通常以公开基准上的得分来证明其效果。2026年10月2日提交到arXiv的一篇预印本(arXiv:2610.03448,《Passing the Test You Trained On》,作者Zhuowen Liu)提出了一个实际问题:这个得分能否预测检测器在智能体内部的表现?

答案在很大程度上是否定的。该研究评估了十五个检测器和两个LLM评判模型,发现在偏文本的基准(BIPIA,2023年12月发布)上的排名,几乎无法说明它们在智能体工具输出(AgentDojo,2024年6月,以及tau-bench)上的表现。

工作原理

作者在干净环境和被注入的环境中重放相同的真实工具调用。通过比较两份输出(他们称之为differential replay),可以标注哪些输出确实含有注入内容,避免在结果被重新序列化为YAML或JSON时子串匹配失效。

随后,他们在1%误报率的固定条件下,对三组数据测量检测率:AgentDojo v1.2(339条干净输出、1,152条注入输出)、tau-bench(1,533条干净、584条注入)和BIPIA(1,200条良性、2,435条注入)。

差距很大。某个检测器在BIPIA上检出95.1%的注入,在AgentDojo上只有2.1%;另一个在AgentDojo上检出72.2%,在tau-bench上仅15.2%。BIPIA与AgentDojo之间的排名相关性几乎为零(Kendall tau为0.01),两个智能体基准之间也较弱(0.28)。相反,误报行为在智能体基准之间相当稳定(tau 0.67),但不同检测器差异极大:良性工具输出被标记的比例从0%到超过90%不等。

在智能体基准上整体表现最好的检测器,是用智能体风格的输入训练的,并且与被测基准没有共享数据,这说明决定因素更可能是训练数据的分布,而不是榜单名次。

为什么重要

在简短的自然语言注入上调优的检测器,可能看起来很出色,却漏掉嵌在结构化工具输出中的注入。反过来,把大量正常JSON结果都标为可疑的检测器会破坏工作流程,最终被关闭。如果只看一个总体准确率数字,这两种失败都不会被发现。

作者也指出了局限:环境为模拟环境,攻击是公开基准中的静态模板,面对自适应攻击者检测率很可能更低,且只有两个检测器的训练数据可被审计。这些数字是方法论上的警示,而不是产品排名。

防御

请在自己智能体的真实工具输出上评估检测器,而不是通用文本。在固定的低误报率(如1%)下报告检测率,并单独测量对自身工具良性输出的误报,因为这个数字是可以迁移的。确认检测器是否曾在其宣传所用的基准上训练过。优先选择以智能体风格输入训练的检测器,并在工具格式每次变更后重新测试。

不要把检测器作为唯一的控制措施。应结合架构层面的限制:工具最小权限、高影响操作需人工确认、将不可信内容与指令分离,以及记录工具调用以便审查。

Status

项目详情
论文arXiv:2610.03448,2026年10月2日提交
范围15个检测器 + 2个LLM评判模型;AgentDojo、tau-bench、BIPIA
关键结果同一检测器在BIPIA上95.1%,AgentDojo上2.1%(1%误报率)
局限模拟环境、静态攻击、训练数据审计有限
修复状态方法论建议;不涉及产品补丁

Sources