Deep Reinforcement Learning für die Ausführung von Limitorders mit Prognosesignalen
Zusammenfassung
Die Studie nutzt Deep Reinforcement Learning, um eine kurzfristige Handelsprognose in Limitorderplatzierungen und Bestandsentscheidungen in einem Limit-Orderbuch zu übersetzen. Ein Agent wird in einer simulierten Aktienumgebung der NASDAQ trainiert, die auf historischen Orderbuchmeldungen basiert und den Simulator ABIDES verwendet. Der Agent beobachtet das aktuelle Orderbuch, die jüngste Markthistorie und ein Richtungssignal und lernt anschließend eine Ausführungsstrategie mit Deep Double Duelling Q-Learning und priorisiertem asynchronem Experience Replay.
Um die Ausführung unabhängig von einer bestimmten Prognosemethode zu bewerten, testen die Forschenden synthetische Alpha-Signale mit unterschiedlichen Rauschstärken. Sie berichten, dass der gelernte Agent Bestände effektiv verwaltet und Orders platziert und dabei eine heuristische Strategie mit demselben Signal übertrifft. Dieser Vergleich spricht für die Ausführungsmethode im beschriebenen Simulator. Das Dokument nennt jedoch weder Leistungskennzahlen noch Belege für Ergebnisse im Live-Markt. Qualität und Realitätsnähe der synthetischen Signale und der simulierten Umgebung schränken daher Schlussfolgerungen zur Umsetzung ein.
Kernaussagen
- Der Agent lernt, eine Richtungsprognose in Entscheidungen zu Limitorders und Beständen umzusetzen.
- Das Training nutzt einen auf historischen Meldungen basierenden NASDAQ-Limit-Orderbuch-Simulator.
- Der Agent beobachtet den Orderbuchzustand, die jüngste Markthistorie und eine kurzfristige Prognose.
- Synthetische Signale mit unterschiedlichem Rauschen ermöglichen es den Forschenden, die Ausführung statt der Prognosequalität zu untersuchen.
- In der Simulation übertrifft die gelernte Strategie eine Heuristik mit demselben Signal; die Leistung im Live-Markt ist damit nicht belegt.
Schlagwörter
Volltext
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets # Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.
Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.