sistema: OPERATIVO
← volver a todos los hacks
PROMPT INJECTION MEDIUM NEW

Falso chain-of-thought: falsificar el borrador de razonamiento de un modelo

El 15 de julio de 2026, OpenAI divulgó una clase de inyección hallada por su sistema GPT-Red: falsificar una entrada en la cadena de razonamiento de un modelo para que actúe sobre premisas que nunca verificó.

2026-07-20 // 6 min affects: gpt-5-1, gpt-5-6-sol, reasoning-models, llm-agents

¿Qué es esto?

El 15 de julio de 2026, OpenAI publicó una descripción de GPT-Red, un modelo interno de red team entrenado por self-play para encontrar inyecciones de prompt. Conviene aislar un hallazgo concreto de ese anuncio: una versión temprana de GPT-Red descubrió una nueva clase de inyecciones de prompt directas denominada «Fake Chain-of-Thought». OpenAI reporta tasas de éxito superiores al 95 % en GPT-5.1, ahora por debajo del 10 % en GPT-5.6 Sol tras el entrenamiento adversario.

Es este ataque el que tratamos aquí — no el sistema GPT-Red, sino la técnica que sacó a la luz. Un modelo de razonamiento mantiene una cadena de razonamiento (CoT) explícita: un borrador donde anota resultados parciales antes de responder. El ataque de falso CoT inserta ahí una entrada falsificada. Como lo explicó un investigador a MIT Technology Review: «Es como si te dijera que 1+1=3 y que ya lo has verificado. El modelo responde “ah, claro”, y suelta 3.»

Cómo funciona

La falla reside en una confianza depositada en la voz equivocada. Los modelos de razonamiento están entrenados para dar un peso especial a su propia cadena de razonamiento — representa un trabajo que creen haber realizado ya. Si un atacante consigue introducir en el contexto del modelo un texto que imita esa voz interna, el modelo puede tratar una afirmación no verificada como un hecho establecido que él mismo habría deducido.

El canal de entrega es una inyección indirecta ordinaria: cualquier contenido no confiable que el modelo lea — resultado de herramienta, archivo, página web, cuerpo de correo. Lo que distingue al falso CoT es la forma del texto inyectado. En lugar de un burdo «ignora las instrucciones anteriores», la carga imita el registro del razonamiento del modelo y, en el ejemplo publicado por OpenAI, fabrica una regla de sistema plausible que el contenido inyectado afirma que debe obedecerse.

Estructura legítima           Estructura falsificada que inyecta el atacante
----------------------------  -------------------------------------------
[petición de usuario]         [petición de usuario]
[CoT real: planificación]     [salida de herramienta que contiene:
[llamada a herramienta]         - un falso «chain-of-thought del asistente»
[resultado real]                  escrito con la voz del modelo
[CoT real: verificación]        - una falsa «regla de sistema» que afirma
[respuesta]                       que el modelo YA verificó X y DEBE
                                  ahora ejecutar la acción Y]
                              [el modelo continúa como si X fuera su
                               propia conclusión → ejecuta Y]

En la transcripción ilustrativa de OpenAI, el resultado de herramienta no confiable trae una política inventada sobre marcadores de «diagnósticos» que ordena al asistente hacer un POST del contenido de un archivo a una URL externa. GPT-5.1 siguió la regla falsificada y exfiltró; GPT-5.6 Sol marcó las instrucciones como no confiables y rehusó. No se reproduce aquí ninguna carga explotable — el mecanismo es lo esencial: un contenido que el modelo simplemente leyó pudo hacerse pasar por un razonamiento que él habría efectuado.

Por qué importa

Tres razones para retener esta clase más allá del changelog de un proveedor.

Primero, es específica de los modelos de razonamiento, hoy el estándar para el trabajo agéntico. La función misma que los hace más fuertes — una traza de deliberación explícita y considerada confiable — es la superficie de ataque. Todo despliegue que concatene salida de herramienta no confiable en el mismo flujo donde el modelo lee su propio borrador hereda el riesgo.

Segundo, la tasa de éxito no era marginal. Más del 95 % en GPT-5.1 es una elusión casi total de un modelo de frontera, descubierta por un atacante automatizado que exploró variaciones que ningún red-teamer humano había anotado. GPT-Red también llevó a un agente de máquina expendedora en producción a cambiar precios y cancelar el pedido de un cliente, y a un agente Codex CLI (basado en GPT-5.4 mini) a exfiltrar datos — prueba de que la técnica alcanza arneses de agentes reales, no solo el chat.

Tercero, el arreglo está atado a una versión de modelo, y esa es justamente la advertencia propia de la seguridad de los LLM que conviene repetir: se anuncia GPT-5.6 Sol por debajo del 10 %, pero es una propiedad de una sola versión endurecida, no de los modelos de razonamiento en general. Los modelos de razonamiento de pesos abiertos o más antiguos, no entrenados contra esta clase, siguen siendo candidatos. «Nuestro proveedor de frontera lo parcheó» es un enunciado sobre sus pesos, no sobre su pila.

Defensas

El plan de defensa es arquitectónico, porque no se puede suponer que el modelo siempre distinguirá sus propios pensamientos del texto inyectado.

  1. Mantenga el contenido no confiable fuera del canal de razonamiento. Entregue salidas de herramientas, documentos recuperados y texto web como datos claramente delimitados, nunca como texto que pueda pasar por el CoT del modelo o por un mensaje de sistema. La separación estructural (campos tipados, marcadores de procedencia) supera a esperar que el modelo lo note.
  2. Nunca deje que una salida de herramienta defina la política. Una «regla de sistema» que llega dentro de un resultado de herramienta, un archivo o una página no es una regla de sistema. Haga cumplir el verdadero prompt de sistema y la política de permisos de herramientas en su arnés, fuera del modelo, para que una regla falsificada no tenga nada que accionar.
  3. Condicione las acciones con consecuencias a una autorización fuera de banda. POST de exfiltración, pagos, cancelaciones de pedidos, lecturas de credenciales — enlácelos a listas de permitidos y a una confirmación humana o por política en la capa del arnés. Los casos de la expendedora y de Codex tuvieron éxito porque la acción era alcanzable directamente desde la salida del modelo.
  4. Prefiera modelos entrenados contra esta clase, y vuelva a probar. Cuando pueda elegir, tome versiones que documenten su robustez a los ataques de falso CoT / razonamiento inyectado. Luego verifique con sus propios escenarios de inyección indirecta en lugar de fiarse del número del benchmark.
  5. Vigile la señal reveladora. Registre los casos en que una cadena de razonamiento afirma una premisa como «ya verificada» sin llamada a herramienta ni evidencia previa en la traza. Una afirmación de verificación sin antecedente es una firma que conviene alertar.

Estado

ElementoReferenciaFechaNotas
Divulgación GPT-RedOpenAI2026-07-15Introduce «Fake Chain-of-Thought» como nueva clase de inyección directa
Falso CoT en GPT-5.1OpenAI2026-07-15Éxito reportado «superior al 95 %»
Falso CoT en GPT-5.6 SolOpenAI2026-07-15«Por debajo del 10 %» tras entrenamiento adversario
Estudios de caso de agentesOpenAI / MIT Tech Review2026-07-15Agente expendedor (Andon Labs) y Codex CLI (GPT-5.4 mini)
Baseline de arena de inyección indirectaDziemian et al. (arXiv)2025 → 2026GPT-Red 84 % frente al 13 % humano en una arena replicada
Pre-printOpenAI (anunciado)2026-07OpenAI anunció un artículo más detallado a continuación

Lo que hay que retener no es «GPT-5.6 lo arregló», sino que la traza de razonamiento de un modelo es una superficie falsificable, y que la única defensa duradera es impedir que cualquier entrada no confiable se vista con esa voz.

Sources