AgentLens: El Nuevo Benchmark que Evalúa el Comportamiento Real de los Agentes de Código en Acción
Un nuevo benchmark llamado AgentLens revoluciona la evaluación de agentes de código al analizar su trayectoria completa durante la ejecución. Esta herramienta combina verificación formal con revisiones de IA para ofrecer diagnósticos detallados y prevenir errores en desarrollo.
5 min lectura9semIAOnda Redaccion