¿Qué significan realmente los puntajes de los benchmarks de IA? Guía práctica
Los benchmarks de IA como MMLU, GPQA o SWE‑bench pretenden medir distintas facetas de la inteligencia de los modelos, pero sus resultados varían según la tarea. Entender su alcance es clave para evaluar avances reales y evitar confusiones.
5 min lectura2hIAOnda Redaccion