¿Están los benchmarks de IA midiendo la inteligencia real?
Un estudio revela que los benchmarks actuales de generalización sistemática en IA miden menos de lo que aparentan. El test TranSGrid revela caídas drásticas en modelos avanzados ante razonamiento genuino.
5 min lectura3hIAOnda Redaccion