OpenAI presenta LifeSciBench, una prueba de 750 tareas para evaluar IA en ciencia
OpenAI ha lanzado LifeSciBench, un benchmark de 750 tareas creado por 173 científicos para medir cómo las IA abordan desafíos reales de investigación biológica. El mejor modelo, GPT-Rosalind, logra solo un 36 % de aciertos, lo que evidencia un amplio margen de mejora en razonamiento, precisión y toma de decisiones.
5 min lectura6semIAOnda Redaccion