2
¿Por qué la reproducción de experiencia requiere un algoritmo fuera de la política?
En el documento que presenta DQN " Playing Atari with Deep Reinforcement Learning ", mencionó: Tenga en cuenta que cuando se aprende por repetición de experiencia, es necesario aprender fuera de la política (porque nuestros parámetros actuales son diferentes a los utilizados para generar la muestra), lo que motiva la …