El término "agent washing" empieza a instalarse en las conversaciones de los CTOs y directores de ingeniería como lo hizo "AI washing" hace un par de años. La dinámica es conocida: el vendedor muestra una demo impecable donde un agente resuelve un ticket complejo, navega por la web, consulta APIs y devuelve una respuesta estructurada en segundos. El problema aparece cuando ese mismo agente aterriza en el entorno real: datos sucios, APIs que cambian sin aviso, excepciones no documentadas y usuarios que no siguen el guion.
La brecha entre la demo y la producción no es un detalle menor. En una demo controlada, el proveedor curatea los datos, limita el alcance y ensaya el happy path. En producción, el agente se enfrenta a la entropía de los sistemas legacy, a la falta de estándares en los datos y a la imprevisibilidad humana. Según datos de Gartner, para 2026 más del 60% de los proyectos de agentes autónomos no superarán la fase piloto por esta desconexión.
La primera pregunta que debe hacer cualquier equipo técnico es: "¿Cómo razona el agente cuando no encuentra la respuesta en su base de conocimiento?". Un agente real no debe alucinar ni inventar; debe saber escalar, pedir clarificación o devolver un "no sé" estructurado. La segunda: "¿Qué pasa cuando la API externa cambia su schema sin previo aviso?". La robustez no se demuestra en el happy path, sino en la gestión de errores no previstos.
Tercera: "Enséñame cómo el agente maneja datos contradictorios en mi propio dataset". Los datos empresariales son inconsistentes por definición. Un agente que solo funciona con datos limpios es un juguete, no una herramienta. Cuarta: "¿Cómo se audita la cadena de razonamiento completa?". Sin trazabilidad, no hay compliance posible ni debugging efectivo.
Quinta: "¿Cuál es el coste real por tarea completada en producción, no en el sandbox?". Los proveedores suelen ocultar el consumo de tokens, las llamadas repetidas y la latencia acumulada. Sexta y definitiva: "Dame acceso a un entorno de staging con mis datos reales durante dos semanas". Cualquier proveedor que se niegue está vendiendo humo.
Estas preguntas no son capricho técnico. El mercado está saturado de wrappers sobre GPT-4 o Claude que se venden como "agentes autónomos" pero que son, en el mejor de los casos, flujos de trabajo deterministas con un LLM en el medio. La diferencia entre un workflow y un agente real es la agencia: la capacidad de decidir el siguiente paso basándose en el contexto, no en un diagrama de flujo predefinido.
Para los compradores, el coste del error no es solo el presupuesto malgastado. Es la credibilidad interna del equipo de IA, la resistencia organizacional a futuros proyectos y, en sectores regulados, el riesgo legal de desplegar sistemas que toman decisiones opacas. El "agent washing" no es solo marketing agresivo; es una transferencia de riesgo del proveedor al cliente.
La lección es la de siempre: desconfía de las demos perfectas. Exige pruebas en tu entorno, con tus datos, con tus excepciones. El agente que sobrevive al caos de tu producción es el único que merece el nombre.