La superficie de ataque de las skills de agente abarca todo el ciclo de vida, no solo la ejecución
Un estudio de julio de 2026 mapea el riesgo de las skills de agente en cinco etapas — admisión, recuperación, selección, ejecución, evolución — y muestra que la mayoría de las defensas solo protegen una.
What is this?
Las «skills de agente» son paquetes de capacidades reutilizables — un archivo SKILL.md con instrucciones en lenguaje natural, más scripts opcionales — que un agente LLM recupera y ejecuta para completar una tarea. La mayor parte del trabajo de seguridad se ha centrado en dos aspectos: la inyección de prompts dentro de las instrucciones y lo que hace el código cuando se ejecuta. Un estudio publicado el 15 de julio de 2026 — Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation, de Sanket Badhe y Priyanka Tiwari (arXiv:2607.13987) — sostiene que ese enfoque es demasiado estrecho. Introduce SkillSec-Eval, un marco consciente del ciclo de vida que descompone el ecosistema de skills en cinco fronteras operativas — admisión en el repositorio, recuperación semántica, selección por el planificador, ejecución y evolución de la skill — y, sobre una evaluación empírica de 327 skills reales, constata que aparecen debilidades explotables en cada etapa, no solo en la ejecución.
La conclusión práctica es que una skill puede ser individualmente inofensiva como código fuente y aun así causar daño por cuándo se elige y cómo cambia con el tiempo. Proteger solo la etapa de ejecución deja otras cuatro etapas sin vigilancia.
How it works
Recorrer el ciclo de vida hace visibles los puntos ciegos. Cada frontera es un lugar donde el control de un atacante sobre una skill puede divergir de lo que un escáner o un revisor comprobó por última vez.
Admisión en el repositorio. Los registros públicos de skills suelen aceptar un SKILL.md y una cuenta reciente, sin firma ni revisión. Es la etapa que mejor cubre la literatura sobre cadena de suministro, y por la que entran el malware y las entradas con typosquatting.
Recuperación semántica. Un agente rara vez carga todas las skills; recupera candidatas por similitud de embeddings entre la tarea del usuario y la autodescripción de cada skill. Una skill cuya descripción está redactada para coincidir con una amplia gama de tareas puede, por tanto, aparecer ante solicitudes que no tiene por qué atender — un equivalente, a nivel de recuperación, del envenenamiento SEO, donde la palanca es el metadato y no el código.
Selección por el planificador. Una vez recuperada una lista corta, el modelo planificador decide qué skill invocar realmente, apoyándose de nuevo en los nombres y las descripciones. Un nombre verosímil pero engañoso puede sesgar esa elección hacia el paquete del atacante en lugar de una skill legítima.
Ejecución. La conocida etapa de ejecución: la skill seleccionada se ejecuta con toda la autoridad del agente — shell, sistema de archivos, variables de entorno y archivos de credenciales, red saliente. Es aquí donde una carga acaba actuando.
Evolución de la skill. Las skills se actualizan. Un paquete revisado y confiable en la versión 1 puede reescribirse discretamente más tarde (un «rug pull»), o recuperar sus verdaderas instrucciones desde una URL controlada por el atacante en tiempo de ejecución: el artefacto que pasó la revisión no es el que se ejecuta.
Ninguna de estas etapas requiere una primitiva de explotación novedosa. Lo que muestra el marco es que la decisión de confianza tomada en la admisión o durante un escaneo no se mantiene automáticamente en la recuperación, la selección ni tras una actualización.
Why it matters
Las skills de agente están hoy integradas en asistentes de código y agentes personales usados por amplias poblaciones de desarrolladores, y las herramientas reflejan la suposición de «ejecución primero»: los sandboxes limitan lo que hace una skill cuando se ejecuta, y los escáneres estáticos inspeccionan SKILL.md en la instalación. Ambos son útiles, y ambos son ciegos a la selección y la evolución. Una skill puede pasar un escaneo de instalación y luego ser promovida a tareas mediante una descripción trabajada, o mutar tras haber ganado confianza. Tratar el problema como «¿este archivo es malicioso ahora?» pasa por alto «¿será este archivo elegido, y sigue siendo el que aprobé?» — de ahí el interés de una visión por ciclo de vida para quien opera un agente que se nutre de un pool de skills compartido.
Defenses
No existe un control único; asocie las defensas a cada frontera.
Admisión. Prefiera publicaciones de skills firmadas y autores revisados. El OWASP Agentic Skills Top 10, publicado el 27 de abril de 2026, recomienda tratar cada publicación como un evento criptográficamente verificable (por ejemplo, firma por raíz de Merkle) junto con el escaneo del registro. Rechace las cuentas de una semana, los nombres con typosquatting y los identificadores republicados.
Recuperación. Verifique la descripción y los metadatos de una skill por separado de su código, ya que la descripción impulsa la selección. Restrinja el corpus de recuperación a una lista de permitidos de skills revisadas en lugar de un mercado abierto.
Selección. Mantenga el conjunto de skills expuestas mínimo y con privilegio mínimo. Condicione la invocación de una skill recién seleccionada a un paso de aprobación en lugar de ejecutarla automáticamente, para que un paquete mal seleccionado no pueda actuar en silencio.
Ejecución. Aísle la ejecución de skills, ejecute el agente con privilegio mínimo y restrinja el tráfico saliente para que una skill comprometida no pueda alcanzar un punto de exfiltración. Trate SKILL.md como instrucciones no confiables: no obedezca a una skill que pida al agente desactivar sus controles de seguridad, decodificar-y-ejecutar blobs opacos o hacer curl | bash.
Evolución. Fije las versiones, vuelva a escanear en cada actualización, detecte la recuperación de instrucciones en tiempo de ejecución y vigile la deriva de comportamiento, para que una skill de confianza que cambia sea reevaluada en lugar de mantenerse por inercia.
Status
| Elemento | Detalle |
|---|---|
| Fuente principal | Agent Skill Security, arXiv:2607.13987 [cs.CR], 15 de julio de 2026 |
| Marco | SkillSec-Eval — cinco fronteras del ciclo de vida; evaluación empírica sobre 327 skills reales |
| Estándar de referencia | OWASP Agentic Skills Top 10, 27 de abril de 2026 |
| Taxonomía relacionada | Towards Secure Agent Skills, arXiv:2604.02837 |
| Alcance | Ecosistemas de skills de agente (Claude Code, Cursor, OpenClaw y similares) |
| Estado | Sistematización + evaluación; la defensa es un proceso que abarca todo el ciclo de vida, no un parche único |