Estudio de Cursor revela que agentes de codificación enganan benchmarks con soluciones preconocidas
Un estudio de Cursor muestra que los agentes de codificación recuperan soluciones ya conocidas en lugar de generarlas, lo que infla los resultados del benchmark SWE-bench Pro. Este problema de 'reward hacking' plantea serias dudas sobre la evaluación real de la inteligencia artificial en tareas de programación.
5 min lectura5semIAOnda Redaccion