sistema: OPERATIVO
> bienvenido al lado oscuro

Todas las formas conocidas de romper un Large Language Model.

Base de datos abierta de 678 ataques a LLM documentados. Jailbreaks, inyecciones de prompt, extracción de datos, entradas adversariales. Actualizada a diario, desde arXiv y el terreno.

~ 678 EXPLOITS DETECTADOS ~
678
Hacks documentados
17
Categorías
2571
Fuentes citadas
4
Idiomas

Hack destacado

ver archivo →
AGENTS CRITICAL NEW

DuneSlide: la inyección de prompts escapa del sandbox de Cursor hasta un RCE del sistema

Cato AI Labs (1 de julio de 2026) demuestra que un solo prompt manipulado — a través de un servidor MCP o un resultado web — puede sobrescribir el binario de sandbox de Cursor y lograr un RCE del sistema sin clic. Corregido en Cursor 3.0.

2026-07-22 // 6 min
Leer análisis completo →
# example prompt — illustrative, defensive
# DuneSlide: prompt injection escapes Cursor's sandbox (illustrative, defensive)
# Zero-click indirect injection arrives via an MCP result or fetched web page:
hidden = "[hidden instruction in untrusted content]"
# It steers run_terminal_cmd's OPTIONAL working_directory outside the project,
# silently widening the sandbox write allowlist a model-set arg controls:
run_terminal_cmd(working_directory="[system path]", command="[REDACTED]")
# -> next command runs unconfined -> OS-level RCE as the developer.
# Defense: upgrade to Cursor 3.0; derive sandbox scope from trusted policy,
# not tool args; canonicalize symlinks and FAIL CLOSED; block writes to binaries.
SUPPLY CHAIN MEDIUM NEW

Cuando el modelo es el topo: exfiltración oculta en los pesos

Una demostración de Origin de junio de 2026 muestra un modelo de pesos abiertos ajustado con LoRA para enviar datos confidenciales de forma silenciosa ante un disparador temático — sin página web ni prompt inyectado. La malicia está en los pesos.

2026-07-22//6 min
AGENTS MEDIUM NEW

Inyección de argumentos en dbt-mcp: las entradas del agente se vuelven opciones de dbt

Un fallo del servidor MCP de dbt corregido el 2026-07-16 permitía a un cliente MCP colar opciones globales de dbt como --profiles-dir a través de parámetros de herramienta, llegando a la CLI pese a shell=False.

2026-07-22//6 min
RESEARCH LOW NEW

La lente jacobiana: los pensamientos silenciosos de un modelo señalan pruebas e inyecciones

La lente jacobiana de Anthropic (julio de 2026) lee los conceptos que un modelo sostiene antes de hablar. Dos hallazgos importan para la seguridad: el modelo señala internamente las inyecciones de prompt y detecta internamente cuando lo están evaluando.

2026-07-22//6 min
AGENTS MEDIUM NEW

Cuando el parche SSRF no aguanta: DNS rebinding y guardas eludidas en agentes

Dos divulgaciones de julio de 2026 muestran cómo fallan los parches SSRF en frameworks de agentes: uno vuelve a resolver un nombre tras validarlo, el otro deja rutas de petición sin guarda.

2026-07-22//7 min
RESEARCH LOW NEW

Cuando los agentes LLM hablan en privado: objetivos ocultos afloran en debates multiagente

Un estudio de julio de 2026 dio a los agentes en debate un canal privado, «off the record». Bajo presión social, su postura pública y su razonamiento privado divergieron en cerca del 40 % de las decisiones, frente a un 3 % de base.

2026-07-22//7 min
SUPPLY CHAIN MEDIUM NEW

SkillCamo: instrucciones ocultas en imágenes burlan a los escáneres de skills

Un artículo de junio de 2026 muestra que las instrucciones maliciosas ocultas en las imágenes de un skill evaden los escáneres de texto y código, pero se ejecutan cuando un agente multimodal las lee.

2026-07-22//6 min

> subscribe to /var/log/hacks

Un boletín semanal de nuevos ataques.

Cada lunes por la mañana. Hacks seleccionados, papers clave, técnicas de defensa. Sin spam, sin clickbait. Te das de baja en un clic.