sistema: OPERATIVO
← volver a todos los hacks
DEFENSE MEDIUM NEW

Meta SecAlign: el primer modelo abierto con defensa integrada contra la inyección de prompts

Publicado en julio de 2026, es el primer LLM de pesos abiertos con defensa contra la inyección de prompts a nivel de modelo, con tasas de éxito de ataque inferiores a las de los modelos cerrados.

2026-07-18 // 6 min affects: llama-3.1-8b, llama-3.3-70b

¿Qué es esto?

Meta SecAlign es un gran modelo de lenguaje de pesos abiertos que se distribuye con una defensa contra la inyección de prompts integrada en el propio modelo, en lugar de añadida como una capa externa de filtrado. Se publicó en arXiv el 3 de julio de 2026 (artículo 2507.02735, con una revisión v2 el mismo mes) por investigadores de Meta (FAIR) y de la UC Berkeley; los pesos y el código de entrenamiento están disponibles en el repositorio de GitHub facebookresearch/Meta_SecAlign. Los autores lo presentan como el primer LLM totalmente de código abierto y pesos abiertos con una defensa contra la inyección de prompts a nivel de modelo que alcanza un rendimiento de calidad comercial.

Se publican dos modelos: Meta-SecAlign-8B, basado en Llama-3.1-8B-Instruct, y Meta-SecAlign-70B, basado en Llama-3.3-70B-Instruct. El objetivo declarado de esta apertura es permitir que la comunidad de seguridad estudie, ataque y mejore las defensas contra la inyección sobre un modelo real, algo que los modelos comerciales cerrados, con defensas propietarias, dificultan.

Cómo funciona

La inyección de prompts funciona porque un LLM ve las instrucciones y los datos en el mismo flujo de tokens indiferenciado: un texto que llega dentro de una página web recuperada, la salida de una herramienta o un documento puede ser interpretado por el modelo como una orden a ejecutar. Meta SecAlign ataca esa causa raíz mediante un método aplicado durante el entrenamiento, y no con un parche en el momento de la inferencia.

La técnica se apoya en dos trabajos previos de la misma línea. StruQ (consultas estructuradas) separa el prompt de confianza de los datos no fiables mediante delimitadores dedicados, para que el modelo pueda distinguir entre ambos. SecAlign, el método original de 2024 (publicado en ACM CCS 2025), añade después la optimización por preferencia: los autores construyen un conjunto de datos de preferencias en el que cada ejemplo asocia una entrada con una inyección a una respuesta segura (que sigue la instrucción legítima e ignora la inyección) y a una respuesta insegura (que obedece la instrucción inyectada). La optimización por preferencia entrena al modelo para que prefiera con fuerza el comportamiento seguro. Conceptualmente:

Entrada:  [instrucción de confianza]  +  [datos no fiables ... «ignora lo anterior y haz X»]
Salida preferida:     responder a la instrucción de confianza, tratar «haz X» como dato inerte
Salida rechazada:     ejecutar X

Meta SecAlign aplica esta receta a escala de modelo de fundación. Según el artículo, el entrenamiento del modelo de 70B duró unas 3 épocas, aproximadamente 7 horas en 8 GPU NVIDIA H200. El resultado se evalúa en 9 bancos de utilidad (entre ellos MMLU, MMLU-Pro, IFEval, BBH, GPQA Diamond, AlpacaEval2, SEP, y las pistas agénticas AgentDojo y WASP) y 7 bancos de seguridad. La afirmación principal es que Meta-SecAlign-70B alcanza una robustez de vanguardia —a menudo tasas de éxito de ataque inferiores a las de GPT-4o-mini, GPT-4o y Gemini-Flash 2.0/2.5— manteniendo una capacidad general comparable a la del modelo base sin defensa. En AgentDojo en particular, el artículo indica que la defensa reduce la tasa de éxito de ataque mientras aumenta la utilidad en la tarea, la combinación que la mayoría de las defensas no logran.

Por qué importa

La mayoría de las defensas contra la inyección de prompts que se despliegan hoy son filtros de entrada/salida, clasificadores o trucos de ingeniería de prompts (delimitadores, recordatorios «sándwich»). Son útiles pero superficiales: el modelo subyacente sigue inclinado a obedecer cualquier instrucción que lea, de modo que un atacante decidido que supera el filtro llega a un modelo sin defensa. Los trabajos previos de SecAlign informaban de que una defensa «sándwich» ingenua dejaba una tasa de éxito de ataque del 96 % y que StruQ aún cedía en cerca del 56 % de los casos, mientras que el alineamiento por optimización de preferencia reducía muchos ataques por debajo del 10 %. Llevar la defensa a los pesos cambia la economía del ataque: el adversario debe ahora vencer la preferencia aprendida por el modelo, no solo una envoltura a su alrededor.

La apertura es la otra razón para prestar atención. Hasta ahora, las defensas más sólidas a nivel de modelo residían en productos cerrados que los investigadores externos no podían medir, sondear ni reproducir. Un modelo defendido y disponible de forma abierta ofrece a los equipos de red team, ingenieros de ML y académicos una referencia compartida e inspeccionable, exactamente el tipo de codesarrollo de ataques y defensas que hace avanzar el campo. También significa que los equipos que construyen agentes pueden adoptar directamente un modelo reforzado en lugar de confiar en la afirmación opaca de un proveedor.

La salvedad honesta: ninguna defensa es completa. Un modelo entrenado para resistir la inyección es más robusto, no invulnerable, y una robustez medida en los bancos actuales puede erosionarse frente a los ataques adaptativos del mañana. El entrenamiento tipo SecAlign reduce mucho el éxito de los ataques, pero no lo anula; debe combinarse con los controles de arquitectura de abajo en lugar de tratarse como una solución milagrosa.

Defensas

  1. Prefiera un modelo con defensa integrada contra la inyección para cargas agénticas. Si elige un modelo base para un agente que usa herramientas, un modelo defendido y evaluado abiertamente como Meta SecAlign le da una referencia de robustez medible, en lugar de una afirmación no verificable de un proveedor.
  2. Mantenga la frontera de confianza en su arquitectura, no solo en el modelo. Siga separando las instrucciones de confianza de los datos no fiables, restrinja los permisos de las herramientas y aplique el mínimo privilegio, para que una inyección exitosa tenga un radio de impacto limitado. La defensa a nivel de modelo reduce la probabilidad de una brecha; no la contiene.
  3. Superponga defensas. Combine el modelo reforzado con filtrado de entrada/salida, delimitadores de consultas estructuradas y validación humana para las acciones de alto impacto. La defensa en profundidad sigue vigente.
  4. Vuelva a probar contra ataques adaptativos. Las cifras de los bancos reflejan ataques conocidos. Ejecute su propia batería de red team (y repítala a medida que se publiquen nuevas técnicas de inyección) en lugar de suponer que una defensa de entrenamiento generaliza a todo ataque futuro.
  5. Vigile la utilidad tanto como la seguridad. El interés de un modelo optimizado conjuntamente es que un filtrado demasiado agresivo degrada el rendimiento; verifique en su propia carga de trabajo que el modelo defendido conserva el comportamiento que necesita.

Estado

ElementoReferenciaFechaNotas
Artículo Meta SecAlignarXiv 2507.02735 (v1)2026-07-03Primer LLM de pesos abiertos con defensa contra la inyección a nivel de modelo
Pesos + código de entrenamientofacebookresearch/Meta_SecAlign (GitHub)2026-07Meta-SecAlign-8B (Llama-3.1-8B), Meta-SecAlign-70B (Llama-3.3-70B)
Método SecAlign originalarXiv 2410.05451 / ACM CCS 20252024-10 → 2025Defensa por optimización de preferencia; StruQ como predecesor
Explicación BAIR (StruQ + SecAlign)Blog Berkeley AI Research2025-04-11Contexto sobre el enfoque de consultas estructuradas + optimización de preferencia

El cambio que conviene retener: la defensa contra la inyección de prompts pasa de las envolturas alrededor de un modelo complaciente a las preferencias aprendidas por el propio modelo — y, por primera vez, en una forma que toda la comunidad puede inspeccionar y poner a prueba.

Sources