système : OPÉRATIONNEL
← retour à tous les hacks
DEFENSE MEDIUM NEW

Ces détecteurs d'injection de prompt brillent sur un benchmark mais ratent presque tout dans votre agent

Une étude arXiv du 2 octobre 2026 sur quinze détecteurs montre que les classements ne se transfèrent pas aux sorties d'outils : 95,1 % sur BIPIA, 2,1 % sur AgentDojo.

2026-10-06 // 6 min affects: prompt-injection-detectors, prompt-guard, protectai-deberta, llm-agents

De quoi s’agit-il ?

Les détecteurs d’injection de prompt sont de petits classifieurs placés entre un agent et les contenus qu’il lit : pages web, e-mails, résultats d’outils. Ils signalent les textes qui tentent de donner de nouvelles instructions à l’agent. Les éditeurs les justifient en général par un score sur un benchmark public. Un preprint déposé sur arXiv le 2 octobre 2026 (arXiv:2610.03448, « Passing the Test You Trained On », auteur unique Zhuowen Liu) pose une question pratique : ce score prédit-il le comportement du détecteur dans un agent ?

La réponse est en grande partie non. L’étude évalue quinze détecteurs et deux juges LLM, et constate que les classements sur un benchmark centré sur le texte (BIPIA, publié en décembre 2023) disent très peu de choses des performances sur des sorties d’outils d’agents (AgentDojo, juin 2024, et tau-bench).

Comment cela fonctionne

Les auteurs rejouent les mêmes appels d’outils dans un environnement propre et dans un environnement injecté. La comparaison des deux sorties, méthode qu’ils appellent « differential replay », permet d’étiqueter les sorties qui contiennent réellement l’injection, sans recourir à une recherche de sous-chaînes fragile lorsque les résultats sont resérialisés en YAML ou JSON.

Ils mesurent ensuite la détection à un taux de faux positifs fixé à 1 % sur trois jeux : AgentDojo v1.2 (339 sorties saines, 1 152 injectées), tau-bench (1 533 saines, 584 injectées) et BIPIA (1 200 saines, 2 435 injectées).

Les écarts sont importants. Un détecteur capte 95,1 % des injections BIPIA mais seulement 2,1 % de celles d’AgentDojo. Un autre en capte 72,2 % sur AgentDojo mais 15,2 % sur tau-bench. La corrélation de rang entre BIPIA et AgentDojo est quasi nulle (tau de Kendall 0,01) ; entre les deux benchmarks d’agents, elle est faible (0,28). Le comportement en faux positifs, lui, est stable entre benchmarks d’agents (tau 0,67) et très variable : de 0 % à plus de 90 % des sorties d’outils bénignes signalées selon le détecteur.

Le meilleur détecteur sur les benchmarks d’agents avait été entraîné sur des entrées de type agent et ne partageait aucune donnée avec les benchmarks testés : c’est la distribution des données d’entraînement, plus que le rang au classement, qui semble déterminante.

Pourquoi c’est important

Un détecteur réglé sur de courtes injections en langage naturel peut paraître excellent tout en laissant passer des injections noyées dans des sorties structurées. À l’inverse, un détecteur qui signale une grande part de résultats JSON ordinaires perturbe les workflows et finit désactivé. Ces deux défaillances restent invisibles si l’on ne lit qu’un chiffre de précision global.

Les auteurs signalent des limites : environnements simulés, attaques statiques issues de benchmarks publics, détection probablement plus faible face à des attaquants adaptatifs, et données d’entraînement auditables pour seulement deux détecteurs. Ces chiffres sont un avertissement méthodologique, pas un classement de produits.

Défenses

Évaluez les détecteurs sur les sorties d’outils réelles de votre agent, pas sur du texte générique. Rapportez la détection à un faible taux de faux positifs fixé (par exemple 1 %), et mesurez séparément les faux positifs sur les sorties bénignes de vos outils, car c’est ce chiffre qui se transfère. Vérifiez si un détecteur a été entraîné sur le benchmark qui sert à le promouvoir. Privilégiez les détecteurs entraînés sur des entrées de type agent et refaites les tests à chaque changement de format d’outil.

Ne faites pas d’un détecteur votre unique contrôle. Associez-le à des limites d’architecture : moindre privilège pour les outils, confirmation humaine des actions à fort impact, séparation du contenu non fiable et des instructions, journalisation des appels d’outils.

Status

ÉlémentDétail
PublicationarXiv:2610.03448, déposée le 2 octobre 2026
Périmètre15 détecteurs + 2 juges LLM ; AgentDojo, tau-bench, BIPIA
Résultat clé95,1 % sur BIPIA contre 2,1 % sur AgentDojo pour un même détecteur (1 % FPR)
LimitesEnvironnements simulés, attaques statiques, audit partiel des données d’entraînement
Statut du correctifRecommandations méthodologiques ; aucun correctif produit concerné

Sources