Las limitaciones del largo alcance de los agentes inteligentes. ¿Por qué los modelos de lenguaje fallan en tareas complejas?
Los modelos de lenguaje avanzados brillan en tareas cortas y medias, pero se desmoronan en tareas largas que requieren secuencias de acciones interdependientes. Un equipo de investigación propone un nuevo benchmark para entender y diagnosticar estos fracasos.
5 min lectura21semIAOnda Redaccion