Saltar al contenido
Todos los documentos de la biblioteca

PPO Aprendizaje por refuerzo para el trading activo de acciones de alta frecuencia

Artículo arXiv papers · Autor: Antonio Briola et al.

Resumen

El documento describe un método integral de aprendizaje profundo por refuerzo para el trading activo de acciones de alta frecuencia. Los agentes utilizan optimización de políticas proximales para negociar una unidad de la acción de Intel, con estados construidos a partir de distintos conjuntos de características del libro de órdenes. Los datos de entrenamiento se seleccionan por grandes cambios de precios para aumentar la relación señal-ruido; se reserva un mes consecutivo para la validación y otro mes distinto para las pruebas. Los hiperparámetros se ajustan mediante optimización secuencial basada en modelos.

Los autores afirman que los agentes detectan patrones recurrentes en el libro de órdenes y generan rendimientos positivos estables durante el periodo de prueba, pese a las condiciones ruidosas y cambiantes. Se trata de pruebas de un experimento de alcance limitado, con una sola acción y una secuencia breve de meses. La descripción no ofrece estadísticas de rendimiento, costes de transacción, comparaciones con referencias ni pruebas de que el comportamiento aprendido se mantenga en otros periodos, activos y condiciones de ejecución en vivo. La selección de muestras de entrenamiento según los movimientos de precios también puede influir en lo que aprenden los agentes, por lo que el resultado descrito no debe considerarse una prueba general de rentabilidad.

Ideas clave

  • Los agentes utilizan optimización de políticas proximales para negociar una unidad de una acción bursátil.
  • Sus representaciones de estado varían según las características del libro de órdenes limitadas que incluyen.
  • El entrenamiento da prioridad a muestras con grandes movimientos de precios y separa los periodos de validación y prueba.
  • Los hiperparámetros se ajustan mediante optimización secuencial basada en modelos.
  • Se informan rendimientos positivos en las pruebas, pero no se establecen la generalización más amplia ni los costes de ejecución.

Etiquetas

Texto completo
# Deep Reinforcement Learning for Active High Frequency Trading


# Deep Reinforcement Learning for Active High Frequency Trading









We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.