Apprentissage par renforcement profond pour l’exécution d’ordres à cours limité
Résumé
L’étude utilise l’apprentissage par renforcement profond pour transformer une prévision de trading à court terme en décisions de placement d’ordres à cours limité et de gestion de l’inventaire dans un carnet d’ordres à cours limité. Elle entraîne un agent dans un environnement simulé d’actions NASDAQ, construit à partir de messages historiques du carnet d’ordres et utilisant le simulateur ABIDES. L’agent observe le carnet actuel, l’historique récent du marché et un signal directionnel, puis apprend une politique d’exécution avec l’algorithme Deep Double Duelling Q-learning et la relecture asynchrone priorisée des expériences.
Pour évaluer l’exécution indépendamment d’une méthode de prévision particulière, les chercheurs testent des signaux alpha synthétiques présentant différents niveaux de bruit. Ils indiquent que l’agent entraîné gère efficacement l’inventaire et place les ordres, surpassant une stratégie heuristique recevant le même signal. Cette comparaison étaye la méthode d’exécution dans le simulateur décrit, mais le document ne fournit ni chiffres de performance ni preuve de résultats en marché réel. La qualité et le réalisme des signaux synthétiques et de l’environnement simulé limitent donc les conclusions sur son déploiement.
Idées clés
- L’agent apprend à convertir une prévision directionnelle en décisions concernant les ordres à cours limité et l’inventaire.
- L’entraînement utilise un simulateur de carnet d’ordres à cours limité NASDAQ fondé sur des messages historiques.
- L’agent observe l’état du carnet, l’historique récent et une prévision à court terme.
- Des signaux synthétiques avec différents niveaux de bruit permettent aux chercheurs de se concentrer sur l’exécution plutôt que sur la qualité des prévisions.
- En simulation, la politique apprise surpasse une heuristique utilisant le même signal, mais ses performances en marché réel ne sont pas établies.
Étiquettes
Texte intégral
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets # Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.