sistema: OPERATIVO
← volver a todos los hacks
DEFENSE MEDIUM NEW

CASCADE: qué defensas contra jailbreaks funcionan realmente combinadas

Un estudio de la Universidad Nacional de Singapur evalúa 19 ataques de jailbreak frente a 15 defensas y muestra que combinarlas reduce el éxito de ataque en más del 95 %.

2026-09-27 // 6 min affects: llama-2, llama-3.1, vicuna, gpt-3.5, gpt-4o, gpt-5.4-mini, claude-sonnet-4, gemini-2.5-flash, gemini-3.1-flash-lite

¿Qué es esto?

El 18 de septiembre de 2026, los investigadores Jiale Luo y Eric Han, de la School of Computing de la National University of Singapore, publicaron CASCADE Against Jailbreaks, presentado como el primer estudio sistemático sobre cómo se comportan las defensas contra jailbreaks cuando se combinan entre distintas etapas del pipeline, en lugar de evaluarse de forma aislada. La mayoría de los trabajos previos sobre defensas contra jailbreaks prueban una sola técnica a la vez —un filtro de entrada, un clasificador de salida, una protección en el momento de la generación— y reportan su reducción de la tasa de éxito de ataque (ASR) de forma aislada, con métricas y modelos de amenaza inconsistentes entre artículos, lo que dificulta comparar resultados. CASCADE, en cambio, evalúa 19 ataques frente a 15 defensas bajo un único modelo de amenaza estandarizado, de caja negra y de un solo turno, sobre nueve modelos objetivo que abarcan pesos abiertos (Vicuna-7B, Llama-2-7B-chat, Llama-3.1-8B) y sistemas propietarios (GPT-3.5-turbo, GPT-4o, GPT-5.4-mini, Claude Sonnet 4, Gemini 2.5 Flash, Gemini 3.1 Flash-Lite).

Cómo funciona

El conjunto de ataques abarca tres familias: ataques transferibles de caja blanca (GCG, I-GCG, AmpleGCG, DSN, Adaptive), ataques de caja negra basados en plantillas (jailbreaks de persona como DAN y AIM, técnicas de disfraz como la fragmentación de secuencias o la codificación por inversión de código, manipulaciones del estilo de salida) y ataques de caja negra asistidos por LLM (ReNeLLM, PAP, GPTFuzzer, TAP). El conjunto de defensas cubre tres etapas del pipeline: protecciones de entrada que filtran el prompt antes de que llegue al modelo (filtrado por perplejidad, WildGuard, PromptGuard), técnicas de modificación de entrada que reescriben o parafrasean el prompt (autorrecordatorios, retokenización, defensas por paráfrasis) y protecciones de salida que filtran la respuesta del modelo antes de devolverla (Llama Guard, clasificadores de salida). En lugar de probar cada defensa por separado, CASCADE enfrenta cada ataque contra cada defensa individual y contra combinaciones de defensas dentro de una misma etapa y entre etapas, bajo un presupuesto de consultas fijo y una definición común de ASR, de modo que los resultados sean directamente comparables.

Standalone input guards   : 79.9% - 82.3% ASR reduction
Standalone output guards  : 67.0% - 70.8% ASR reduction
Best cross-stage stack    : 95.4% ASR reduction (-11.5% utility)
Lean utility-first stack  : 82.3% ASR reduction (-7.0% utility)

Por qué importa

El hallazgo más relevante para los equipos de defensa no es que exista una defensa ganadora, sino que ninguna de las defensas evaluadas funciona de forma universal, y que probar las defensas de manera aislada —la norma en la mayoría de los artículos publicados sobre el tema— sobreestima lo que un sistema en producción logrará realmente cuando el tráfico real ponga en juego a la vez las interacciones entre etapas, los falsos positivos y los límites de latencia. Un equipo que despliega solo un clasificador de entrada porque obtuvo buena puntuación en un benchmark deja sobre la mesa entre un 20 % y un 30 % de éxito de ataque residual que una verificación de salida, barata e independiente, habría podido detectar. Las reducciones superiores al 90 % que reporta CASCADE para las combinaciones en capas dependen del conjunto de ataques evaluado: los ataques asistidos por LLM y los adaptativos más recientes siguen siendo más difíciles de neutralizar por completo que los jailbreaks de plantilla fija como DAN, por lo que estas cifras deben interpretarse como “alcanzables frente al conjunto de ataques probado”, no como un techo válido frente a técnicas futuras aún desconocidas.

Defensas

  • Combine varias defensas, no dependa de una sola. Combine una protección de entrada con una protección de salida independiente en lugar de confiar en una sola etapa: en el estudio, las combinaciones entre etapas superan sistemáticamente a cualquier combinación de una sola etapa con un coste de utilidad comparable.
  • Ajuste la combinación a su tolerancia al riesgo. Los resultados de CASCADE ofrecen configuraciones concretas para despliegues centrados en seguridad (~95 % de reducción de ASR, ~11 % de pérdida de utilidad), equilibrados o centrados en utilidad (~82 % de reducción de ASR, ~7 % de pérdida de utilidad); elija según lo que le cueste a su producto un rechazo falso.
  • Vuelva a probar tras cada cambio de versión de modelo o de defensa. Las cifras de reducción de ASR están ligadas a las versiones concretas de modelos y defensas evaluadas en septiembre de 2026; una actualización del modelo por parte del proveedor o de la biblioteca de defensa puede modificar estas cifras sin previo aviso.
  • No asuma que las puntuaciones aisladas se generalizan. La reducción de ASR publicada para una defensa individual no se suma a la de otra defensa individual; mida la combinación real sobre su propio tráfico y su propio conjunto de ataques antes de confiar en una estimación combinada.

Estado

ElementoEstado
ArtículoPreprint en arXiv 2609.21793, presentado el 18 sept. 2026, licencia CC BY 4.0
Revisión por paresAún no realizada (fase de preprint)
Modelos evaluados9 en total (3 de pesos abiertos, 6 propietarios), incl. GPT-5.4-mini, Claude Sonnet 4, Gemini 3.1 Flash-Lite
Ataques / defensas probados19 ataques x 15 defensas
Mejor resultado reportado95,4 % de reducción de ASR, -11,5 % de utilidad (combinación entre etapas)

Las cifras anteriores proceden directamente de los experimentos reportados en el artículo; los resultados en producción variarán según la versión del modelo, la mezcla de tráfico y el conjunto de ataques.

Sources