STHTD-MP: la nueva técnica de TD que acelera la predicción off-policy
Los investigadores de arXiv han presentado STHTD-MP, un algoritmo que usa la métrica inducida por la política de comportamiento para mejorar la geometría de actualización en el aprendizaje temporal-diferencial. El método promete convergencia más rápida y mayor estabilidad que sus predecesores.
5 min lectura15semIAOnda Redaccion