La crisis de los benchmarks: ¿Cómo medimos ya a los LLMs?
Los modelos de lenguaje avanzan a velocidad vertiginosa, pero sus pruebas de evaluación se quedan obsoletas. El pequeño conjunto de benchmarks que quedan ya muestra serios problemas de confiabilidad, abriendo una crisis metodológica en la IA.
5 min lectura19semIAOnda Redaccion