MirrorCode: benchmark para medir programación de largo plazo en IA
Epoch y METR han lanzado MirrorCode, un benchmark que evalúa qué tan bien los modelos de IA pueden enfrentar tareas de programación que duran una semana. Aunque los sistemas aún no resuelven los retos más difíciles, el avance señala progresos clave para la robótica y el desarrollo autónomo de software.
5 min lectura2semIAOnda Redaccion