El problema de los benchmarks contaminados: OpenAI reconoce uso de datos de evaluación en entrenamiento de GPT
OpenAI ha admitido oficialmente que el conjunto de datos GSM-8K, usado para evaluar modelos de IA en matemáticas, formó parte del entrenamiento de GPT. Esta revelación abre un debate sobre la fiabilidad de las métricas de rendimiento.
5 min lectura5dIAOnda Redaccion