La promesa de los agentes de IA basados en habilidades (skills) es seductora: módulos reutilizables de instrucciones en lenguaje natural, scripts ejecutables y recursos de referencia que se cargan en tiempo de ejecución para extender capacidades bajo demanda. Esta arquitectura modular impulsa la flexibilidad y el ecosistema de terceros, pero, según un nuevo trabajo publicado en arXiv (2609.30383v1), también abre una superficie de ataque hasta ahora ignorada: las interacciones entre habilidades.

Hasta la fecha, la investigación en seguridad se ha centrado en vulnerabilidades dentro de una sola skill: inyección de prompts, código malicioso o fugas de datos en un paquete aislado. El artículo "Stealth Apart, Harm Together" cambia el foco hacia un paradigma más insidioso: los ataques en cascada (skill cascading attacks). La idea es diabólicamente simple: distribuir un objetivo malicioso a través de varias habilidades de modo que cada modificación parezca inofensiva al analizarse por separado, pero su ejecución combinada produce un resultado dañino.

El ejemplo canónico que presentan los autores es clínico y escalofriante. Imaginemos un pipeline de revisión de recetas médicas compuesto por tres skills encadenadas: la primera debilita las señales de medicamentos retirados recientemente en el historial extraído; la segunda rebaja la gravedad de cualquier interacción farmacológica asociada a esos fármacos; la tercera suprime la alerta de baja prioridad resultante en el resumen final. Individualmente, cada ajuste podría justificarse como una optimización de ruido o una decisión de diseño. Juntas, hacen desaparecer silenciosamente una advertencia crítica de interacción medicamentosa antes de que llegue al médico.

Para estudiar sistemáticamente este punto ciego, el equipo ha desarrollado SkillCascade, un marco de red-teaming multi-agente automatizado, y SkillCascade-Bench, un benchmark con 213 casos de prueba validados de cascadas maliciosas que abarcan múltiples sistemas de agentes y dominios. Los experimentos evalúan agentes representativos como OpenClaw, Claude Code y Codex, respaldados por diversos modelos de lenguaje (LLM). Los resultados son contundentes: las interacciones en cascada inducen comportamientos dañinos de forma fiable y, lo que es peor, evaden tanto los escáneres por skill existentes como los monitores de tiempo de ejecución diseñados para detectar anomalías en componentes individuales.

Este hallazgo expone una brecha fundamental: la integridad a nivel de componente no garantiza la seguridad a nivel de sistema. Las defensas actuales operan bajo la suposición implícita de que los límites de las skills son fronteras de confianza. Los ataques en cascada demuestran que el daño emerge precisamente en las costuras entre esas fronteras, explotando la semántica compartida y el flujo de datos implícito entre módulos.

Las implicaciones para la industria son inmediatas. A medida que los agentes autónomos pasan de demostraciones de laboratorio a entornos de producción —sanidad, finanzas, infraestructura crítica—, la cadena de suministro de skills se convierte en un vector de riesgo sistémico. Un marketplace de skills comprometido, o incluso uno bienintencionado pero mal auditado, podría inyectar una cascada latente que permanezca dormida hasta que se active la combinación específica de módulos.

La respuesta no puede ser abandonar la modularidad, sino elevar la capa de defensa. Los autores abogan por mecanismos que razonen sobre interacciones cruzadas entre skills: análisis de flujo de información inter-modular, detección de patrones de cascada en tiempo de ejecución y, quizás lo más difícil, una gobernanza de composición que evalúe la seguridad del ensamblaje completo, no solo de sus partes. En definitiva, el artículo nos obliga a madurar el modelo de amenaza: en la era de los agentes compuestos, el todo es inseguro incluso si cada parte parece segura.