El auge de los agentes de inteligencia artificial diseñados para asistir en la programación ha transformado la forma en que los desarrolladores revisan, depuran y aseguran su código. Herramientas como Claude Code de Anthropic y Codex de OpenAI, cuando operan en modo autónomo, pueden analizar repositorios abiertos, proponer correcciones e incluso aplicar parches sin intervención humana. Sin embargo, un reciente proof‑of‑concept publicado por el AI Now Institute revela una vulnerabilidad crítica: estos mismos agentes pueden ser inducidos a ejecutar el código que supuestamente están intentando detectar.
La técnica, bautizada "Friendly Fire", aprovecha la confianza que los agentes depositan en su propio juicio. Cuando se les pide que escaneen un proyecto en busca de fallos de seguridad, un atacante puede insertar fragmentos de código malicioso disfrazados de comentarios, documentación o incluso de pruebas unitarias aparentemente inocuas. Debido a que los agentes operan en un ciclo de retroalimentación donde aprueban sus propias acciones, el código malicioso pasa desapercibido y se ejecuta en el entorno del desarrollador, comprometiendo la máquina local o incluso la cadena de suministro de software.
El ataque no requiere que el agente sea comprometido directamente; basta con que el código objetivo contenga la trampa. En modo autónomo, el agente interpreta la solicitud de análisis como una orden legítima y, al encontrar lo que interpreta como una vulnerabilidad, procede a parchearla o a ejecutar el fragmento sospechoso. En la práctica, esto significa que un desarrollador que confía en una herramienta de IA para mejorar la seguridad de su proyecto podría, sin darse cuenta, estar ejecutando ransomware, puertas traseras o mineros de criptomonedas en su propio entorno de trabajo.
Este hallazgo tiene implicaciones profundas para equipos de DevSecOps y para empresas que están adoptando asistentes de código basados en grandes modelos de lenguaje. La confianza en la automatización puede crear un punto único de falla donde la propia herramienta de defensa se convierte en vector de ataque. Además, la dificultad de detectar este tipo de manipulación radica en que el comportamiento del agente parece legítimo: está cumpliendo con la tarea solicitada, pero bajo una condición adversaria que el modelo no está diseñado para reconocer.
Para mitigar el riesgo, los expertos recomiendan varias capas de defensa. En primer lugar, limitar el modo autónomo de los agentes a entornos aislados, como contenedores o máquinas virtuales sin acceso a recursos críticos. En segundo lugar, implementar revisión humana obligatoria antes de que cualquier cambio propuesto por la IA se aplique al código base. Tercero, utilizar herramientas de análisis estático y dinámico independientes que no dependan de la misma IA que está siendo evaluada. Finalmente, mantener actualizados los modelos y aplicar los parches de seguridad que los proveedores lanzan tras descubrir este tipo de vulnerabilidades.
El descubrimiento de "Friendly Fire" sirve como recordatorio de que la inteligencia artificial, aunque poderosa, no es infalible y puede ser utilizada en su contra si no se diseñan salvaguardas adecuadas. A medida que la adopción de agentes de código crece, la industria debe equilibrar la eficiencia que aportan con una rigurosa evaluación de riesgos, asegurando que la innovación no se vuelva en contra de quienes la crean.