Aprendizaje por refuerzo profundo para ejecutar órdenes limitadas con señales de pronóstico
Resumen
El estudio utiliza aprendizaje por refuerzo profundo para convertir un pronóstico de trading a corto plazo en decisiones de colocación de órdenes limitadas y gestión del inventario en un libro de órdenes limitadas. Entrena a un agente en un entorno simulado de renta variable de NASDAQ, construido a partir de mensajes históricos del libro de órdenes, con el simulador ABIDES. El agente observa el libro actual, el historial reciente del mercado y una señal direccional, y luego aprende una política de ejecución mediante Deep Double Duelling Q-learning y repetición priorizada y asíncrona de experiencias.
Para evaluar la ejecución por separado de cualquier método de pronóstico concreto, los investigadores prueban señales alfa sintéticas con distintos niveles de ruido. Señalan que el agente entrenado gestiona el inventario y coloca órdenes de forma eficaz, superando a una estrategia heurística que recibe la misma señal. Esta comparación respalda el método de ejecución dentro del simulador descrito, pero el documento no ofrece cifras de rendimiento ni pruebas de resultados en mercados reales. Por ello, la calidad y el realismo de las señales sintéticas y del entorno simulado limitan las conclusiones sobre su implementación.
Ideas clave
- El agente aprende a convertir un pronóstico direccional en decisiones sobre órdenes limitadas e inventario.
- El entrenamiento utiliza un simulador de libro de órdenes limitadas de NASDAQ basado en mensajes históricos.
- El agente observa el estado del libro, el historial reciente y un pronóstico a corto plazo.
- Las señales sintéticas con distintos niveles de ruido permiten a los investigadores centrarse en la ejecución y no en la calidad del pronóstico.
- En la simulación, la política aprendida supera a una heurística que utiliza la misma señal, pero no se ha demostrado su rendimiento en vivo.
Etiquetas
Texto completo
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets # Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.