¿Por qué los leaderboards de IA siguen engañando? La brecha entre los benchmarks y el mundo real
Los modelos de frontera alcanzan más del 88 % en el MMLU, pero persiste una diferencia del 37 % entre los resultados de laboratorio y su desempeño real. Descubre qué fallan los tests y cómo evaluar IA de forma rigurosa.
5 min lectura13semIAOnda Redaccion