Supabase, la plataforma de backend abierta basada en PostgreSQL, ha lanzado recientemente supabase/evals, un proyecto open source que propone un benchmark estructurado para medir el desempeño de agentes de generación de código. Este benchmark se diferencia por ejecutar los agentes dentro de entornos contenedores aislados que replican fielmente el stack de Supabase, garantizando reproducibilidad y aislamiento.
El núcleo de Evals consiste en una serie de pruebas diseñadas alrededor de tareas típicas que los desarrolladores realizan en la plataforma: creación de esquemas de base de datos, depuración de Edge Functions y corrección de políticas Row Level Security (RLS). Cada tarea se formula de manera que el agente debe producir código funcional que pase una batería de validaciones automáticas, lo que permite evaluar no solo la sintaxis sino también la lógica de negocio y la adherencia a buenas prácticas.
Para puntuación, Evals combina dos enfoques: verificaciones determinísticas mediante pruebas unitarias y de integración, y una capa de "LLM-as-a-judge" que utiliza modelos de lenguaje para evaluar la calidad del código generado en áreas como claridad, modularidad y eficiencia. Los resultados se consolidan en una puntuación numérica que refleja el nivel de éxito en cada tarea.
Los resultados preliminares revelan diferencias notables entre los principales agentes disponibles en el mercado. Claude Code, desarrollado por Anthropic, mostró un rendimiento sólido en la generación de esquemas y en la corrección de políticas RLS, alcanzando una puntuación superior al 85 % en esas categorías. Por su parte, Codex, la herramienta de GitHub, destacó en la depuración de Edge Functions, con una tasa de éxito del 92 % en pruebas de ejecución. OpenCode, una solución emergente de la comunidad, obtuvo resultados competitivos pero ligeramente por detrás de los líderes, especialmente en tareas que requieren razonamiento contextual.
Este benchmark no solo sirve como referencia para los desarrolladores que buscan integrar IA en sus flujos de trabajo, sino que también plantea preguntas sobre la fiabilidad de los agentes en entornos críticos. La capacidad de validar de forma automática y reproducible el desempeño de estos sistemas abre la puerta a una nueva generación de herramientas de desarrollo asistido, donde la selección de un modelo o framework puede basarse en datos empíricos más que en opiniones subjetivas.
En conclusión, supabase/evals representa un paso significativo hacia la estandarización de la evaluación de agentes de código en aplicaciones reales. Al combinar pruebas determinísticas con una capa de juicio LLM, ofrece una metodología robusta que puede ser adoptada por otras plataformas y comunidades. La apertura del código del proyecto invita a la colaboración abierta, permitiendo que investigadores y practitioners contribuyan a refinamientos futuros y a la expansión del conjunto de pruebas a nuevos casos de uso.
En última instancia, Evals podría convertirse en un referente para medir la madurez de la inteligencia artificial aplicada al desarrollo de software, impulsando una adopción más segura y responsable de estas tecnologías en la industria.