Inducción de lenguaje «ebrio»: cómo un estilo de texto debilita la seguridad de los LLM
Un estudio de UNSW muestra que inducir lenguaje «ebrio» en un LLM (persona, fine-tuning, RL) aumenta el éxito de los jailbreaks y las fugas de privacidad, incluso frente a defensas habituales.
¿Qué es esto?
En «In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement» (arXiv:2601.22169, enviado el 19 de enero de 2026), Anudeex Shetty, Aditya Joshi y Salil S. Kanhere (UNSW Sydney) examinan si hacer que un modelo imite el habla de una persona ebria degrada su comportamiento de seguridad. El trabajo recibió nueva atención mediática el 28 de septiembre de 2026 (Help Net Security). El artículo está marcado como trabajo en curso.
Se probaron cinco modelos: LLaMA2-7B, LLaMA3-8B, Mistral-7B, GPT-3.5 y GPT-4. Los autores informan de mayor susceptibilidad a jailbreaks en JailbreakBench y más fugas de privacidad en ConfAIde, y lo atribuyen al antropomorfismo: el modelo reproduce la desinhibición que ha visto en textos humanos.
Cómo funciona
El estudio compara tres formas de inducir el comportamiento, descritas aquí a alto nivel:
- Persona por prompt: se instruye al modelo a comportarse como si estuviera ebrio.
- Fine-tuning causal: entrenamiento con DRUNKTEXT, un conjunto de 63.577 textos (2.363 de TFLN y 61.214 de la comunidad Reddit /drunk).
- Aprendizaje por refuerzo: optimización PPO frente a un modelo de recompensa que puntúa el carácter «ebrio» del texto.
En JailbreakBench (100 consultas), las tasas de éxito de ataque (ASR) reportadas son 21-90 % con prompting, 41-74 % con fine-tuning y 35-53 % con RL, según el modelo. Una línea base más pesada (prompt + búsqueda aleatoria) alcanzó 78-93 %, pero requiere mucho más cómputo; por eso los autores presentan la inducción «ebria» como una alternativa barata. En ConfAIde, las violaciones de privacidad contextual y las fugas aumentaron en los tres niveles de escenarios.
No hace falta ninguna cadena de explotación para entender el hallazgo: el riesgo proviene de un cambio de estilo o persona que aleja al modelo de la distribución con la que aprendió a rechazar. La evaluación del artículo es de un solo turno, solo en inglés y limitada a tres métodos de inducción.
Por qué importa
Primero, muestra que la seguridad depende del registro y la persona, no solo del contenido semántico de la petición. Cualquier sistema que permita a usuarios o terceros definir persona, tono o rol (bots de atención al cliente, productos de rol, APIs de fine-tuning) amplía esta superficie.
Segundo, un fine-tuning con texto corriente de redes sociales, sin intención maliciosa, puede erosionar las salvaguardas. Es relevante para equipos que adaptan modelos de pesos abiertos con datos de usuarios.
Tercero, las defensas evaluadas fueron débiles. En LLaMA2-7B, los autores indican que SmoothLLM elevó la ASR al 90 %, Rephrase la aumentó modestamente y Retokenize tuvo un efecto insignificante. Las defensas basadas en perturbación parecen mal adaptadas a cambios estilísticos, y las variantes más afinadas fueron robustas frente a ellas.
Defensas
- Repetir las evaluaciones de seguridad tras cada fine-tuning o cambio de persona, incluso con corpus de apariencia benigna. Añadir variantes estilísticas (registros informal, alterado, emocional) a las suites de red teaming.
- No depender solo de la perturbación de entradas. Combinarla con moderación de salida y clasificadores de política que evalúen la respuesta, no la forma superficial del prompt.
- Acotar las personas. Limitar o revisar las personas definidas por el usuario en producción y separar la política del sistema del tono controlable por el usuario.
- Proteger el contexto sensible. Mantener secretos y datos personales fuera del contexto del modelo cuando sea posible, para que un rechazo degradado no pueda filtrarlos (la fuga de privacidad fue el segundo eje medido).
- Valorar la monitorización a nivel de representaciones. Los autores sugieren estudiar el control de representaciones internas como trabajo futuro; es investigación, no un control listo para usar.
Estado
| Elemento | Detalle |
|---|---|
| Artículo | arXiv:2601.22169, enviado el 19 ene. 2026, trabajo en curso |
| Cobertura de prensa | Help Net Security, 28 sep. 2026 |
| Modelos probados | LLaMA2-7B, LLaMA3-8B, Mistral-7B, GPT-3.5, GPT-4 |
| Límites | Un solo turno, solo inglés, tres técnicas de inducción |
| Parche del proveedor | No aplica: debilidad de comportamiento, no un fallo de software puntual |