système : OPÉRATIONNEL
← retour à tous les hacks
DEFENSE MEDIUM NEW

CASCADE : quelles défenses anti-jailbreak fonctionnent vraiment combinées

Une étude de l'Université nationale de Singapour teste 19 attaques de jailbreak contre 15 défenses et montre que les combiner réduit le taux de succès de plus de 95 %.

2026-09-27 // 6 min affects: llama-2, llama-3.1, vicuna, gpt-3.5, gpt-4o, gpt-5.4-mini, claude-sonnet-4, gemini-2.5-flash, gemini-3.1-flash-lite

De quoi s’agit-il ?

Le 18 septembre 2026, les chercheurs Jiale Luo et Eric Han, de la School of Computing de la National University of Singapore, ont publié CASCADE Against Jailbreaks, présentée comme la première étude systématique de la performance des défenses anti-jailbreak lorsqu’elles sont combinées entre plusieurs étages du pipeline, plutôt qu’évaluées isolément. La plupart des travaux antérieurs sur les défenses anti-jailbreak testent une seule technique à la fois — un filtre en entrée, un classifieur en sortie, un garde-fou au moment du décodage — et rapportent sa réduction du taux de succès d’attaque (ASR) de façon isolée, avec des métriques et des modèles de menace incohérents d’un article à l’autre, ce qui rend les comparaisons peu fiables. CASCADE évalue au contraire 19 attaques contre 15 défenses sous un modèle de menace unique, standardisé, en boîte noire et à un seul tour, sur neuf modèles cibles couvrant des poids ouverts (Vicuna-7B, Llama-2-7B-chat, Llama-3.1-8B) et des systèmes propriétaires (GPT-3.5-turbo, GPT-4o, GPT-5.4-mini, Claude Sonnet 4, Gemini 2.5 Flash, Gemini 3.1 Flash-Lite).

Comment cela fonctionne

Le jeu d’attaques couvre trois familles : les attaques transférables en boîte blanche (GCG, I-GCG, AmpleGCG, DSN, Adaptive), les attaques par gabarit en boîte noire (jailbreaks de persona comme DAN et AIM, techniques de déguisement comme le découpage de séquence ou l’encodage par inversion de code, manipulations du style de sortie), et les attaques assistées par LLM en boîte noire (ReNeLLM, PAP, GPTFuzzer, TAP). Le jeu de défenses couvre trois étages du pipeline : les gardes en entrée qui filtrent l’invite avant qu’elle n’atteigne le modèle (filtrage par perplexité, WildGuard, PromptGuard), les techniques de modification de l’entrée qui réécrivent ou paraphrasent l’invite (rappels automatiques, retokenisation, défenses par paraphrase), et les gardes en sortie qui filtrent la réponse du modèle avant qu’elle ne soit renvoyée (Llama Guard, classifieurs de sortie). Plutôt que de tester chaque défense isolément, CASCADE confronte chaque attaque à chaque défense prise seule, puis à des combinaisons de défenses au sein d’un même étage et entre étages, sous un budget de requêtes fixe et une définition commune de l’ASR, afin que les résultats soient directement comparables.

Standalone input guards   : 79.9% - 82.3% ASR reduction
Standalone output guards  : 67.0% - 70.8% ASR reduction
Best cross-stage stack    : 95.4% ASR reduction (-11.5% utility)
Lean utility-first stack  : 82.3% ASR reduction (-7.0% utility)

Pourquoi c’est important

Le constat le plus utile pour les équipes de défense n’est pas l’existence d’une défense gagnante — c’est qu’aucune défense évaluée ne fonctionne universellement, et que tester les défenses isolément, ce qui reste la norme dans la plupart des articles publiés sur le sujet, surestime ce qu’un système en production obtiendra réellement une fois que le trafic réel fait intervenir simultanément les interactions entre étages, les faux positifs et les contraintes de latence. Une équipe qui déploie uniquement un classifieur en entrée parce qu’il obtient un bon score dans un benchmark laisse de côté 20 à 30 % de succès d’attaque résiduel qu’une vérification en sortie, peu coûteuse et indépendante, aurait pu intercepter. Les réductions supérieures à 90 % rapportées par CASCADE pour les combinaisons en couches dépendent du périmètre d’attaques testé : les attaques assistées par LLM et les attaques adaptatives les plus récentes restent plus difficiles à neutraliser complètement que des jailbreaks à gabarit fixe comme DAN. Ces chiffres doivent donc être lus comme « atteignables face au panel d’attaques testé », et non comme un plafond valable contre des techniques futures encore inconnues.

Défenses

  • Superposez les défenses, ne misez pas sur une seule. Combinez une garde en entrée avec une garde en sortie indépendante plutôt que de vous reposer sur un seul étage — les combinaisons entre étages surpassent systématiquement, dans l’étude, toute combinaison à un seul étage pour un coût en utilité comparable.
  • Adaptez la combinaison à votre tolérance au risque. Les résultats de CASCADE donnent des configurations concrètes pour des déploiements orientés sécurité (~95 % de réduction d’ASR, ~11 % de perte d’utilité), équilibrés, ou orientés utilité (~82 % de réduction d’ASR, ~7 % de perte d’utilité) — choisissez en fonction du coût d’un faux refus pour votre produit.
  • Retestez à chaque changement de version de modèle ou de défense. Les chiffres de réduction d’ASR sont liés aux versions précises des modèles et des défenses évaluées en septembre 2026 ; une mise à jour du modèle côté fournisseur ou de la bibliothèque de défense peut faire varier ces chiffres sans préavis.
  • Ne présumez pas que les scores isolés se généralisent. La réduction d’ASR publiée pour une défense seule ne s’additionne pas avec le score d’une autre défense seule ; mesurez la combinaison réelle sur votre propre trafic et votre propre panel d’attaques avant de faire confiance à une estimation combinée.

État

ÉlémentStatut
ArticlePrépublication arXiv 2609.21793, soumise le 18 sept. 2026, licence CC BY 4.0
Relecture par les pairsPas encore effectuée (stade de prépublication)
Modèles évalués9 au total (3 à poids ouverts, 6 propriétaires), dont GPT-5.4-mini, Claude Sonnet 4, Gemini 3.1 Flash-Lite
Attaques / défenses testées19 attaques x 15 défenses
Meilleur résultat rapporté95,4 % de réduction d’ASR, -11,5 % d’utilité (combinaison entre étages)

Les chiffres ci-dessus proviennent directement des expériences rapportées par l’article ; les résultats en production varieront selon la version du modèle, le mix de trafic et le panel d’attaques.

Sources