Saltar al contenido
Todos los documentos de la biblioteca

Aprendizaje por refuerzo exploratorio para trading especulativo y de pares

Artículo arXiv papers · Autor: Yun Zhao et al.

Resumen

Este estudio formula el trading especulativo como un problema secuencial de parada óptima, que elige momentos de entrada y salida bajo funciones de utilidad y procesos de precios generales. Primero relaja el problema de parada representando los eventos de entrada y salida como saltos de procesos de Cox, cuyas intensidades acotadas controla el agente.

En la formulación de aprendizaje por refuerzo exploratorio, las políticas aleatorias asignan distribuciones de probabilidad a estas intensidades y la entropía diferencial de Shannon regulariza el objetivo. Las ecuaciones exploratorias de Hamilton-Jacobi-Bellman resultantes producen políticas óptimas en forma de Gibbs. Los autores establecen estimaciones de error y la convergencia del objetivo de aprendizaje a la función de valor del problema original, y después muestran un algoritmo aplicado al trading de pares. La descripción no aporta datos ni resultados de rendimiento para esa aplicación, y la convergencia indicada se refiere al objetivo modelado, no a un resultado demostrado de trading en vivo.

Ideas clave

  • El trading especulativo se modela como un problema de parada óptima sobre los momentos de entrada y salida.
  • Una formulación relajada representa los eventos de parada mediante saltos de procesos de Cox controlados con intensidades acotadas.
  • Las políticas de intensidad aleatorias se regularizan mediante la entropía diferencial de Shannon.
  • El marco deriva ecuaciones HJB exploratorias y políticas óptimas en forma de Gibbs.
  • El trabajo establece resultados de error y convergencia y presenta un algoritmo para trading de pares.

Etiquetas

Texto completo
# Reinforcement Learning for Speculative Trading under Exploratory Framework


# Reinforcement Learning for Speculative Trading under Exploratory Framework









We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.