RL sin aprendizaje TD: el paradigma 'divide y vencerás' que escala a tareas complejas
Investigadores de Berkeley AI proponen un algoritmo de reinforcement learning basado en 'divide y vencerás', evitando las limitaciones del aprendizaje por diferencia temporal. Este enfoque promete resolver problemas de escalabilidad en tareas de horizonte largo, clave para la robótica y sistemas de diálogo.
5 min lectura20semIAOnda Redaccion