Recompensas de curiosidad con norma nuclear para aprendizaje por refuerzo en trading
Resumen
El artículo presenta la maximización de la norma nuclear como recompensa intrínseca para agentes de aprendizaje por refuerzo que exploran entornos con escasas recompensas externas. Forma una matriz a partir de representaciones codificadas de un estado visitado y sus estados vecinos más cercanos, y usa la norma nuclear como aproximación continua a la diversidad de estados. La recompensa propuesta normaliza esta medida por la norma de Frobenius de la matriz para limitar la influencia de la baja entropía y adaptar la escala de la recompensa a las dimensiones de la matriz. El enfoque se integra en RE3, que ya utiliza un codificador y estados cercanos, con un codificador convolucional aleatorio y recompensas de trading descompuestas.
El artículo cita investigaciones anteriores que informan de un mejor rendimiento de exploración que otros métodos, incluso con ruido añadido. En la implementación de trading del propio artículo, las pruebas supuestamente produjeron un comportamiento del agente más variado que RE3 sin modificaciones, pero también un trading más caótico; el factor de beneficio indicado fue 1.02. El autor dice que sigue sin resolverse cómo equilibrar exploración y explotación. Estos resultados son específicos del experimento descrito y no demuestran que el método se generalice ni que sea rentable en mercados reales.
Ideas clave
- El método usa la norma nuclear como aproximación continua a la diversidad entre estados vecinos codificados.
- La recompensa intrínseca se normaliza mediante la norma de Frobenius para reducir la influencia de la baja entropía y controlar su escala.
- El artículo integra la recompensa en RE3 con un codificador convolucional aleatorio y recompensas de trading descompuestas.
- El experimento de trading descrito produjo un comportamiento más variado, pero también más caótico, que RE3 sin modificaciones, con un factor de beneficio de 1.02.
- El equilibrio entre exploración y explotación sigue siendo una cuestión abierta en esta implementación.
Etiquetas
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.