DualView: cerrando la brecha de inyección «almacenada» en agentes de IA personales
Un artículo de arXiv de julio de 2026 muestra por qué las defensas por sustitución simbólica pasan por alto las inyecciones que un agente escribe en disco y vuelve a leer, y propone rastrear los datos no confiables en todo el entorno, no solo en el contexto.
¿Qué es esto?
Los agentes de IA personales —los que se ejecutan en tu propia máquina y automatizan la búsqueda web, el correo y la gestión de archivos— se sitúan frente a una superficie amplia y sensible: la red, el sistema de archivos y el shell. Ese acceso es justamente lo que vuelve peligrosa la inyección de prompt indirecta (IPI), porque cualquier página web, correo o documento que el agente lea puede llevar instrucciones que el agente luego ejecuta. Un artículo de arXiv de julio de 2026, DualView: Preventing Indirect Prompt Injection in Personal AI Agents (2607.03821), de Juhee Kim, Woohyuk Choi, Taehyun Kang, Youngmin Kim y Byoungyoung Lee, identifica un punto ciego en uno de los principales patrones defensivos y propone una solución.
El patrón en cuestión es el diseño Dual LLM, descrito por Simon Willison en abril de 2023 y luego formalizado por sistemas como CaMeL (Defeating Prompt Injections by Design, arXiv 2503.18813). La idea es mantener el contenido no confiable alejado del modelo que posee las herramientas: un componente privilegiado planifica y actúa, mientras que los datos no confiables se sustituyen por símbolos opacos que el agente puede manipular pero nunca leer realmente. El aporte de DualView es señalar que esa contabilidad se detiene en el borde del contexto del agente, y que los atacantes pueden rodear ese borde.
Cómo funciona
La brecha que el artículo nombra es la IPI almacenada (stored IPI). Las defensas Dual LLM rastrean el carácter no confiable de un dato solo mientras reside dentro del contexto de trabajo del agente. En cuanto el agente escribe algo hacia fuera —guarda un fragmento web en un archivo, añade una nota, coloca un valor en una variable del shell— esa etiqueta de procedencia se pierde. Cuando el agente vuelve a leer el mismo contenido, este regresa como un dato nuevo, tratado como confiable en lugar de como un símbolo protegido. Si la instrucción de un atacante estaba oculta ahí, acaba de «blanquearse»: pasó de «no confiable» a «confiable» con un simple viaje de ida y vuelta por el sistema de archivos.
La secuencia, a nivel conceptual:
[ página web / correo con una cadena en forma de instrucción ]
│ lectura en el contexto → etiquetada NO CONFIABLE (mostrada como símbolo)
▼
[ el agente escribe el valor en un archivo / nota / variable del shell ]
│ la etiqueta de procedencia NO acompaña al dato fuera del contexto
▼
[ más tarde, el agente vuelve a leer el archivo ]
│ el dato regresa sin etiqueta → tratado como CONFIABLE
▼
[ el agente «ve» ahora la instrucción plantada y puede obedecerla ]
La respuesta de DualView es extender el rastreo de datos no confiables más allá de la ventana de contexto, hasta el propio entorno: sistema de archivos, shell, red y otros agentes. Cada canal recibe dos vistas del mismo dato. En la AgentView, el agente sigue viendo el contenido no confiable como símbolos incluso después de haberlo escrito y vuelto a leer, lo que cierra la vía de la IPI almacenada. En la HumanView, el dato original se preserva para que los usuarios humanos y las herramientas ordinarias sigan viendo los valores reales y funcionando con normalidad. Dicho de otro modo, la etiqueta se vuelve persistente allí donde el dato circule, en lugar de evaporarse en la frontera del contexto del modelo.
Por qué importa
La IPI almacenada importa porque derrota una defensa que muchos equipos ya consideran una base sólida. Los enfoques Dual LLM y basados en capacidades resultan atractivos precisamente porque prometen una protección estructural en lugar de un filtrado de mejor esfuerzo —CaMeL, por ejemplo, informa resolver el 77 % de las tareas de AgentDojo con seguridad demostrable frente a la inyección, frente al 84 % de un agente sin defensa—. Pero una defensa que asume que los datos no confiables pueden confinarse dentro del contexto tiene una frontera implícita, y un agente personal que lee y escribe archivos todo el día cruza esa frontera constantemente. El atacante no necesita un exploit novedoso; le basta con colocar su texto en algo que el agente guardará y volverá a abrir, lo que, para un asistente de gestión de archivos, forma parte de su funcionamiento normal. El riesgo residual es la persistencia: una inyección que sobrevive en disco puede rearmarse cada vez que el agente vuelve a visitar el archivo.
Defensas
La lección del artículo es sumamente práctica: trata la procedencia como una propiedad del dato, no de un momento de la conversación. Si te apoyas en un esquema Dual LLM o de sustitución simbólica, comprueba si su rastreo de datos no confiables acompaña al contenido a través de las escrituras y lecturas hacia el sistema de archivos, el shell y la red, y asume que, si no lo hace, la IPI almacenada forma parte de tu exposición. Un enfoque de doble vista que mantenga la etiqueta «no confiable» adherida allí donde viaje el valor es una forma de cerrar esa brecha; el principio general se aplica sea cual sea la implementación.
Más allá de esa solución concreta, la literatura circundante sobre patrones de diseño sigue vigente. Mantén el componente que puede actuar separado del contenido no confiable, como en el catálogo de patrones de Willison y colaboradores y su artículo asociado (arXiv 2506.08837). Aplica el mínimo privilegio al alcance de archivos, shell y red del agente, para que una instrucción blanqueada disponga de menos palancas. Y cuando evalúes una defensa contra la inyección, pruébala con cargas escritas en disco y vueltas a leer —no solo inyecciones en contexto de un solo turno— para que la IPI almacenada forme parte del modelo de amenaza antes del despliegue, no después.
Estado
| Elemento | Referencia | Fecha | Notas |
|---|---|---|---|
| Artículo de investigación | DualView: Preventing Indirect Prompt Injection in Personal AI Agents, arXiv 2607.03821 | Julio 2026 | Define la «IPI almacenada»; rastreo de doble vista AgentView/HumanView |
| Defensa previa | Defeating Prompt Injections by Design (CaMeL), arXiv 2503.18813 | Marzo 2025 | Dual-LLM con capacidades; 77 % de tareas AgentDojo con seguridad demostrable |
| Linaje de diseño | Patrón Dual LLM (Simon Willison) | Abril 2023 | Actor privilegiado + lector en cuarentena; respuestas simbólicas |
| Catálogo de patrones | Design Patterns for Securing LLM Agents against Prompt Injections, arXiv 2506.08837 | Junio 2025 | Conjunto ampliado de patrones defensivos para agentes |