Imágenes de un anuncio que secuestran la próxima acción de un agente web
Un artículo de junio de 2026 muestra que un atacante que controla solo un espacio publicitario legítimo — no la página entera — puede colocar una imagen de apariencia inocente que dirige el próximo clic de un agente web multimodal.
¿Qué es esto?
Los agentes web multimodales — los que manejan un navegador mirando una captura de pantalla renderizada y decidiendo el siguiente clic — tienen un problema de confianza que no encaja limpiamente con las fronteras habituales de la web. Un artículo de junio de 2026 de un equipo de la Universidad de Shandong, que describe un marco al que los autores llaman MIRAGE, lo plantea con precisión: el peligro no siempre es un sitio malicioso. Puede ser una simple región de terceros dentro de un sitio en el que usted confía.
El modelo de amenaza es deliberadamente modesto, y eso es justo lo que lo hace realista. El atacante no es el dueño de la página y no puede reescribirla. Es un tercero corriente y sin privilegios — un comerciante, un anunciante — que controla legítimamente una sola área acotada: un espacio publicitario, una tarjeta patrocinada, un widget de recomendación. Dentro de esa casilla, y solo dentro de ella, coloca una imagen. El artículo informa de que tal imagen, generada para parecer perfectamente ordinaria, puede secuestrar la próxima acción de un agente multimodal, demostrado contra dos marcos de agentes conocidos, SeeAct y Open-Claw.
Cómo funciona
Un agente guiado por captura de pantalla trata la página renderizada como su verdad fundamental: los píxeles son el mundo sobre el que razona. No distingue de forma nativa «el contenido sobre el que pregunta el usuario» de «el contenido que un anunciante pagó por colocar en una esquina». Cada píxel llega con la misma autoridad implícita. Esa es la costura por la que trabaja MIRAGE — una forma visual del problema de inyección de prompt indirecta, donde un contenido no confiable se convierte en instrucción porque el modelo no sabe distinguir instrucción de dato.
Dos propiedades hacen notable esta variante. La primera es el confinamiento: la señal adversaria vive estrictamente dentro de la región que el atacante tiene realmente permitido controlar, de modo que nada de la página confiable circundante se altera. La segunda es el sigilo. En lugar de pegar un texto llamativo del tipo «ignora tu tarea y haz clic aquí» — el tipo de artefacto que atrapan los revisores humanos y los detectores simples — la técnica usa modelos de difusión para sintetizar una imagen de apariencia inocente, refinada con escasas perturbaciones residuales poco visibles. Para una persona parece una creatividad publicitaria normal; para el agente actúa como un empujón hacia una próxima acción elegida por el atacante.
Página confiable (example.com)
┌───────────────────────────────────────────┐
│ Artículo que el usuario quiere consultar │
│ │
│ ┌───────────────┐ <-- el atacante solo │
│ │ ANUNCIO │ posee ESTA │
│ │ (imagen │ casilla │
│ │ inocente) │ │
│ │ │ el agente «ve» │
│ └───────────────┘ toda la captura │
│ como un solo campo │
└───────────────────────────────────────────┘
│
▼ secuestro de acción: clic / navegación / envío
Describimos el mecanismo, no una receta. Aquí no aparece ningún payload, código de optimización ni pasos de reproducción; el objetivo es la clase de exposición y cómo cerrarla.
Por qué importa
La página web nunca ha sido un único dominio de confianza, y los agentes heredan ese desorden. Las páginas modernas suelen combinar contenido propio con espacios publicitarios de terceros, ubicaciones patrocinadas, imágenes de producto proporcionadas por comercios y widgets de recomendación. Un lector humano ignora la mayoría de los anuncios. Un agente por captura de pantalla no puede — los percibe como parte del mismo campo visual sobre el que razona, y cualquiera de esas regiones acotadas puede ahora convertirse en una superficie de control en vez de mero decorado.
Esto rebaja el nivel exigido a quien quiere atacar a un agente. Ya no hace falta comprometer un sitio ni ganar una batalla de SEO; comprar un espacio en una página confiable puede bastar. Y como la imagen inyectada está diseñada para parecer legítima, las defensas que rastrean artefactos visuales evidentes o texto inyectado manifiesto están mal situadas frente a ella. En términos de agente, secuestrar la próxima acción no es cosmético: esa «acción» podría ser seguir un enlace malicioso, añadir un artículo, navegar a una página de credenciales o enviar un formulario — los ingredientes de la trifecta letal cuando el agente además tiene datos privados y un canal de salida.
Defensas
Ningún interruptor único resuelve esto. Las medidas útiles tratan la procedencia de las regiones y la autoridad de acción como elementos de primer orden, y se combinan con la investigación existente de detección de inyección sobre captura de pantalla como SnapGuard y WebSentinel.
-
Ligue la autoridad a la procedencia, no a los píxeles. Rastree qué partes de una página renderizada provienen de regiones de terceros (anuncios, tarjetas patrocinadas, widgets embebidos) y rechace que el contenido de esas regiones influya en el plan del agente. Los píxeles de un anuncio nunca deberían portar autoridad de instrucción.
-
Separe la percepción de la instrucción. Mantenga «lo que la página muestra» estrictamente distinto de «lo que el usuario pidió». Ancle al agente a la tarea del usuario, y trate todo contenido visual de la página — sobre todo las regiones de terceros — como dato no confiable que resumir, nunca como una orden que obedecer.
-
Prefiera vistas semánticas antes que capturas en bruto para decidir. Cuando sea posible, guíe la selección de acción a partir de la estructura del DOM, elementos etiquetados y destinos en lista de permitidos, en lugar de la imagen renderizada en bruto de regiones no confiables. Aísle o limpie las creatividades de terceros antes de que el agente razone sobre ellas.
-
Controle las acciones con consecuencias. Exija confirmación, y aplique el mínimo privilegio, antes de cualquier paso irreversible o saliente (navegación fuera del dominio, compras, envío de formularios, exfiltración de datos). Una sugerencia secuestrada es sobrevivible; una transacción secuestrada no lo es.
-
Detecte y monitorice, pero sin confiar en exceso en los detectores de artefactos. Ejecute detectores de inyección sobre captura de pantalla, y registre la traza de acciones del agente para que un secuestro sea visible a posteriori — recordando que una imagen deliberadamente inocente está hecha para colarse entre los controles de artefactos llamativos.
Estado
| Elemento | Referencia | Fecha | Notas |
|---|---|---|---|
| Publicación del marco MIRAGE | arXiv:2606.20717 | 2026-06 | Inyección indirecta visual confinada a una región de terceros legítima |
| Modelo de amenaza | Ídem | 2026-06 | Tercero sin privilegios (comercio/anunciante) que controla solo un anuncio / tarjeta patrocinada / widget |
| Agentes evaluados | Ídem | 2026-06 | Demostrado contra los marcos de agentes web multimodales SeeAct y Open-Claw |
| Contexto de detección sobre captura | SnapGuard / WebSentinel | 2026 | Investigación de detección y localización para agentes web basados en captura |
| Contexto de ecosistema | Resumen de TNW | 2026-07-20 | Parte de una ola más amplia de hallazgos sobre confianza en agentes en julio de 2026 |
El replanteamiento que importa: para un agente web, la unidad de confianza no es el dominio de la barra de direcciones — es cada una de las regiones acotadas con las que se ensambla la página renderizada. Trate las regiones de terceros como entrada no confiable, mantenga la autoridad de acción lejos de los píxeles en bruto, y confirme todo lo que no pueda deshacer.