sistema: OPERATIVO
← volver a todos los hacks
RESEARCH MEDIUM NEW

El envenenamiento Sybil polimórfico burla los filtros anti-duplicados de RAG

Un benchmark de julio de 2026 muestra que pasajes coordinados y léxicamente variados burlan los filtros anti-duplicados que detienen el envenenamiento RAG simple — y que la tasa de éxito oculta la mayor parte del daño.

2026-07-20 // 7 min affects: rag-systems, retrieval-augmented-generation, llm-agents

¿Qué es esto?

En julio de 2026, un grupo de investigadores publicó en arXiv un benchmark y un marco de evaluación para la respuesta a preguntas fundamentada (grounded QA) sometida a envenenamiento de recuperación coordinado — ataques que insertan documentos hostiles en el corpus que consulta un sistema de generación aumentada por recuperación (RAG). Su aporte principal es una clase de ataque con nombre propio, el envenenamiento Sybil polimórfico, y un resultado de medición: las métricas que la mayoría de los equipos usa para evaluar la robustez de RAG subestiman de forma sistemática lo mal que se comporta un sistema envenenado. El trabajo se inscribe en una literatura de 2026 en pleno crecimiento sobre el envenenamiento de corpus RAG, pero es el primero en aislar lo que la diversidad superficial entre pasajes cómplices provoca tanto en los ataques como en las defensas.

Cómo funciona

El envenenamiento RAG clásico inserta un pasaje hostil — o varias copias casi idénticas — que un recuperador presenta ante una pregunta objetivo, empujando al modelo lector hacia una respuesta elegida por el atacante. Una defensa común y barata es el filtrado de casi-duplicados léxicos: si muchos pasajes recuperados son textualmente casi iguales, se descartan los duplicados. Ese filtro detecta por completo el caso monomórfico, en el que el atacante reutiliza una sola cadena.

Un ataque Sybil lo sortea. En lugar de un pasaje repetido, el atacante siembra muchos pasajes léxicamente diversos que defienden todos la misma afirmación objetivo. Cada uno parece una fuente independiente; en conjunto forman un falso consenso. Como ningún par es casi idéntico, el filtro de deduplicación que detiene la versión de copiar y pegar no ve nada que eliminar. Los investigadores llaman polimorfismo a esa variación superficial y tratan el eje monomórfico/polimórfico como la variable clave.

Para medir el efecto con limpieza, separan dos cosas que suelen mezclarse: si el veneno llega a recuperarse, y cómo el lector resuelve el conflicto una vez que el veneno está presente. Un protocolo de «exposición forzada» fija el contexto recuperado para que la evaluación aísle el comportamiento del lado del lector del ruido de recuperación. Cada salida se clasifica luego en cuatro categorías mutuamente excluyentes — gold (respuesta correcta), hijack (la respuesta del atacante), abstención (el modelo se niega a responder) y drift (otra respuesta errónea) — con matrices de transición emparejadas de limpio-a-envenenado que siguen cómo se desplaza cada pregunta al introducir el veneno.

Por qué importa

Destacan dos resultados. Primero, el polimorfismo compensa. En una ablación controlada, las copias monomórficas lograron un hijack solo el 4,0 % de las veces, mientras que dar a la misma afirmación maliciosa formas superficiales variadas elevó esa cifra al 22,8 % — un salto de +18,8 puntos porcentuales, es decir, una amplificación de cerca de 5,7× del canal de ataque visible para una métrica de tasa de éxito (ASR) estándar. La defensa que neutraliza el ataque ingenuo apenas afecta a la versión coordinada.

Segundo, el ASR por sí solo es la regla equivocada. Bajo ataque, las categorías «abstención» y «drift» juntas concentraban entre el 47 % y el 66 % de toda la masa de salidas — fallos que nunca aparecen como un hijack. Dos modelos lectores con un ASR casi idéntico diferían en 16,5 puntos en abstención y en 17,2 puntos en drift. Dicho de otro modo, dos sistemas que parecen igual de robustos según la cifra principal pueden fallar de maneras completamente distintas, y un equipo que solo optimiza un ASR bajo queda ciego ante la mayor parte de lo que el veneno hace realmente a su pipeline. Para hacerlo reproducible, los autores publicaron un benchmark congelado de 3.145 preguntas y 2.982 grupos Sybil retenidos, que abarca cinco modelos lectores de 7B a 120B parámetros, dos recuperadores y dos configuraciones de validación cruzada.

Defensas

La lección práctica: el filtrado de casi-duplicados y la evaluación basada únicamente en el ASR dan una falsa confianza frente al envenenamiento coordinado. Trate la deduplicación léxica como un suelo, no como una defensa: añada un agrupamiento semántico capaz de detectar muchos pasajes redactados de forma distinta que empujan una misma afirmación, y pondere la evidencia recuperada por la procedencia e independencia de las fuentes en lugar de por su número, de modo que un enjambre de «fuentes» fabricadas no pueda fabricar consenso. Del lado del lector, prefiera un prompting consciente de los conflictos que haga aflorar los desacuerdos entre fuentes y permita la abstención cuando el respaldo sea escaso o contradictorio, y exija anclaje mediante citas para que una respuesta apunte a evidencia identificable.

En cuanto a la evaluación, deje de medir la robustez con un solo número. Rastree la abstención y el drift junto al hijack, use transiciones emparejadas de limpio-a-envenenado para ver cómo se mueve cada pregunta, y someta sus pipelines de recuperación a red team con variantes polimórficas — no solo cadenas repetidas — antes de cualquier despliegue. El benchmark publicado ofrece a los defensores una forma lista de hacerlo. Por último, endurezca la cadena de ingesta: vigile lo que entra en el corpus, aplique niveles de confianza a las fuentes y limite cuánto puede aportar un mismo origen no verificado a la evidencia detrás de una respuesta. Estos controles concuerdan con las recomendaciones de OWASP sobre el envenenamiento de datos y bases de conocimiento para aplicaciones LLM.

Estado

ElementoDetalle
ContribuciónBenchmark de modos de fallo + marco de evaluación del envenenamiento RAG
Clase de ataqueEnvenenamiento Sybil polimórfico (pasajes coordinados, léxicamente variados)
Taxonomía de salidasGold · hijack · abstención · drift
Resultado claveEl polimorfismo amplifica el hijack visible ~5,7× (4,0 % → 22,8 %)
Fallos ocultosAbstención + drift = 47–66 % de las salidas bajo ataque
Benchmark3.145 preguntas · 2.982 grupos Sybil · cinco lectores (7B–120B) · dos recuperadores

Fecha clave: artículo de benchmark publicado en arXiv en julio de 2026.

Sources