Las evaluaciones de privacidad de agentes vigilan una sola salida
Un artículo de arXiv del 16 de septiembre de 2026 bautiza el desplazamiento de exposición y lo cuantifica: mirar solo la salida esperada pierde el 46,9 % de lo que recupera la unión de salidas visibles.
¿Qué es esto?
El 16 de septiembre de 2026, cinco autores — Guosen Wu, Huizhen Huang, Guoxiong Long, Tao Huang y Chen Hou — publicaron ASLEval en arXiv cs.CR. Son ocho páginas sobre un error de medición, no sobre un ataque, y constituyen lo más útil que se ha publicado este mes en privacidad de agentes.
Ese error ya tiene nombre: desplazamiento de exposición de privacidad (privacy exposure displacement), definido como el desajuste entre un indicador de evaluación local y la exposición real de la sesión medida contra objetivos definidos. Dicho llanamente: la mayoría de las evaluaciones de privacidad de agentes con herramientas inspeccionan una acción designada, la respuesta final o el autoinforme de un atacante. Una sesión de agente tiene muchas más salidas que esas. Lo que escapa por otra vía no se puntúa y, por tanto, no existe.
La cifra que hay que retener: en varios entornos de tipo empresarial y dos runtimes implementados de forma independiente, una vista limitada a la salida esperada pierde el 46,9 % de la exposición que recupera la unión de todas las salidas visibles declaradas.
Cómo funciona
La aportación de ASLEval es un contrato de medición más que una técnica. Tres decisiones de diseño hacen el trabajo.
Preregistrar un conjunto oculto de objetivos. Decidir de antemano qué elementos concretos cuentan como sensibles y puntuar contra ellos, no contra la impresión que un juez extrae de la transcripción. Sin objetivos preespecificados no existe una verdad de referencia común entre salidas, informes y rutas de herramientas, y dos benchmarks pueden discrepar simplemente porque etiquetaron cosas distintas.
Declarar la frontera visible completa. Enumerar todos los canales por los que el contenido puede salir de la sesión —no solo el que el escenario espera— y medir la unión. Contra esa unión se compara la cifra del 46,9 %.
Reservar las trazas internas al diagnóstico, no a la puntuación. La evidencia intermedia dentro del bucle del agente se excluye del veredicto y sirve para explicarlo. El hallazgo es direccional: la evidencia interna alineada con el esquema suele preceder a la exposición visible, a nivel de petición o de sonda.
lo que puntúan casi todas las evals lo que puntúa ASLEval
─────────────────────────────────── ─────────────────────
┌─ salida esperada ─┐
solo la salida esperada ────────► ├─ otra salida visible─┤──► unión
├─ ruta de herramienta─┤ (+46,9 %)
└─ canal alternativo ─┘
│
trazas internas ──► solo diagnóstico
Otros dos resultados importan a quien lea una puntuación de privacidad. Los autoinformes del atacante combinan omisiones con una alta tasa de falsos descubrimientos: un modelo atacante al que se le pregunta si obtuvo el dato se equivoca en ambos sentidos a la vez, de modo que su informe no sustituye a la observación. Y reducir lo que el modelo recibe de vuelta cambia la ruta de exposición pero puede eliminar el éxito en las tareas normales: la mitigación obvia, mostrar menos al modelo, no sale gratis.
Por qué importa
El resultado aterriza en una literatura que lleva dos años derivando hacia indicadores indirectos, y explica un patrón que ya era visible.
Volvamos a AgentDAM (arXiv 2503.09780), un benchmark de 246 tareas sobre minimización de datos en agentes de navegación web. Sus autores hicieron la misma comparación en miniatura: preguntar al modelo si divulgar un elemento sería apropiado (probing) y después observar qué hace el agente. La brecha es amplia y constante en su dirección: gpt-4o obtiene 0,915 en probing y 0,646 en acción; gpt-4o-mini, 0,890 frente a 0,557. Preguntar a un modelo sobre privacidad mide sus normas declaradas. Ejecutarlo mide su comportamiento. Son dos magnitudes distintas.
Después llega AgentCIBench, publicado el 22 de junio de 2026 por Anmol Goel e Iryna Gurevych en UKP Lab con el título Capable but Careless. Puntúa de forma determinista los fallos de integridad contextual en un espacio de trabajo de seis aplicaciones, a partir de 128 escenarios semilla escritos a mano, mediante un matcher combinado de forma conservadora con un juez LLM. Su propio encuadre es revelador: como el rechazo enmascara la fuga bruta, la métrica principal es la fuga condicionada al compromiso, Leng = L / (1 − R). Su conclusión declarada —la utilidad en completar tareas no predice la contención en la divulgación— significa que un agente capaz y un agente prudente son ejes independientes. La evaluación reportada sobre 15 agentes de frontera halló 11 con fugas en más de la mitad de los escenarios, con una media del 67,9 %.
Alinee los tres y la conclusión resulta incómoda: las tasas de fuga publicadas son suelos, no estimaciones. El probing sobrestima la contención. Puntuar solo la salida esperada subestima la exposición aproximadamente a la mitad. El rechazo infla el denominador si no se corrige. Todos los sesgos conocidos de esta cadena de medición apuntan en la misma dirección.
Las consecuencias en compras son directas. Una puntuación de privacidad de un proveedor vale lo que valga el conjunto de salidas sobre el que se calculó, y casi ninguna especifica ese conjunto. Hemos sostenido el mismo argumento sobre las puntuaciones de salvaguardas que no son prueba de despliegue y sobre los benchmarks de seguridad que se contradicen entre sí; esta es la instancia específica de privacidad, con una cifra detrás.
Defensas
Pregunte a cualquier cifra de privacidad cuál era su conjunto de salidas. Antes de comparar dos agentes, determine si ambos se puntuaron sobre la unión de salidas visibles o solo sobre la esperada. Si el informe no lo dice, trate la cifra como una cota inferior y hágalo constar por escrito. Es hoy la pregunta más rentable de una revisión de proveedor de IA.
Enumere sus propias salidas antes de instrumentar. En su despliegue, liste cada canal por el que puede salir contenido: la respuesta del asistente, mensajes y correos salientes, escrituras de archivos, argumentos de herramientas enviados a terceros, registros, telemetría, consultas de búsqueda, cargas útiles de webhooks. La mayoría de los equipos descubre canales que no había contabilizado. No se vigila una frontera que no se ha escrito. Esto prolonga de forma natural la divulgación ligada a una finalidad: la finalidad restringe el qué, el conjunto de salidas restringe el dónde.
Preregistre los objetivos en sus pruebas internas. Decida qué registros cuentan como sensibles antes de la ejecución, no releyendo la transcripción después. El etiquetado a posteriori deja que un juez califique lo que alcanza a notar, que es exactamente el fallo que ASLEval formaliza.
No acepte el autoinforme de un modelo como prueba. Vale para los modelos atacantes de los arneses de red team y también para los agentes en producción a los que se pide que señalen sus propias divulgaciones. El hallazgo es omisiones más alta tasa de falsos descubrimientos: erróneo en ambos sentidos, así que el error no se compensa.
Alerte sobre los precursores a nivel de petición. Dado que la evidencia interna alineada con el esquema suele preceder a la exposición visible, una consulta con la forma del esquema sensible es una señal disponible antes de que salga nada. Inspeccionar los argumentos de las llamadas a herramientas cuesta menos que reconstruir la exposición a posteriori, y es el mismo punto de instrumentación que en las llamadas a herramientas fantasma.
Publique privacidad y utilidad juntas. Ambos trabajos convergen aquí: restringir lo que el modelo recibe de vuelta puede eliminar el éxito en tareas normales, y la utilidad no predice la contención. Una cifra de privacidad sin la cifra de éxito que la acompaña no es interpretable, y a la inversa tampoco.
Estado
| Elemento | Detalle |
|---|---|
| Fuente principal | Wu G., Huang H., Long G., Huang T., Hou C., ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions, arXiv:2609.18864 [cs.CR] |
| Fecha | Enviado el 16 de septiembre de 2026 (v1); 8 páginas, 3 figuras |
| Licencia | CC BY-NC-SA 4.0 |
| Concepto central | Desplazamiento de exposición — desajuste entre un indicador de evaluación local y la exposición de sesión medida contra objetivos |
| Cifra principal | La vista limitada a la salida esperada pierde el 46,9 % de la exposición recuperada por la unión de salidas visibles |
| Hallazgos secundarios | Los autoinformes del atacante combinan omisiones y alta tasa de falsos descubrimientos; la evidencia interna alineada con el esquema precede a la exposición visible; reducir los retornos visibles al modelo puede eliminar el éxito en tareas normales |
| Método | Conjunto oculto de objetivos preregistrado; medición de todas las salidas visibles declaradas; trazas internas reservadas al diagnóstico; revisión humana independiente del proceso de arbitraje |
| Trabajos corroborantes | Goel A., Gurevych I., Capable but Careless, arXiv:2606.23189, 22 de junio de 2026 — AgentCIBench, 128 escenarios semilla, espacio de seis aplicaciones, fuga condicionada al compromiso Leng = L / (1 − R) |
| Antecedentes | AGENTDAM, arXiv:2503.09780 — 246 tareas; las puntuaciones de privacidad por probing y en acción divergen (gpt-4o 0,915 / 0,646; gpt-4o-mini 0,890 / 0,557) |
| Estado del proveedor | No es una vulnerabilidad de producto; no aplica advisory, parche ni divulgación coordinada |
| Estado práctico | Recomendaciones de benchmarking, accionables hoy en compras y en el diseño de red team interno |