Anthropic revela que los LLM no saben evaluar la investigación en IA: solo aciertan el 60%
El benchmark TASTE de Anthropic demuestra que los modelos más avanzados del mundo fallan al juzgar propuestas de investigación, muy por debajo del 77% que logran los expertos humanos.
5 min lectura1semIAOnda Redaccion