Mejora de Correcciones Auxiliares para TD Off-Policy en IA
Un nuevo enfoque combina matrices de comportamiento y regularización para estabilizar el aprendizaje temporal-diferencia en entornos off-policy, mejorando la convergencia en entornos complejos.
5 min lectura15semIAOnda Redaccion