Dynamisches Pair-Trading mit Kryptowährungen durch Deep Reinforcement Learning
Zusammenfassung
Diese Studie prüft Deep Reinforcement Learning als ergänzende Ausführungsstrategie für den Paarhandel in volatilen Kryptowährungsmärkten. Der Ansatz filtert und ordnet zunächst mögliche Paare und setzt dann einen Proximal-Policy-Optimization-Agenten mit einer Long-Short-Term-Memory-Schicht für Ausführungsentscheidungen ein. Ein Design mit festem Risiko und adaptivem Mittelwert sowie deterministische Risikokontrollen begrenzen den Agenten, um das Divergenzrisiko zu senken. Die Auswertung verwendet stündliche Binance USD-M-Futuresdaten und vergleicht die gelernte Strategie mit einer heuristischen Basisstrategie.
Die berichteten Ergebnisse außerhalb der Stichprobe sprechen für die Reinforcement-Learning-Policy; ein stationärer zirkulärer Block-Bootstrap weist auf eine statistisch signifikante risikoadjustierte Überrendite auf dem Niveau von 10 Prozent hin. Das Ergebnis erreicht nicht die strengere Signifikanzschwelle von 5 Prozent, was die Studie mit der hohen idiosynkratischen Varianz digitaler Vermögenswerte in Verbindung bringt. Die Evidenz gilt speziell für die getesteten Daten und den untersuchten Ansatz. Die Beschreibung nennt weder das Ausmaß der Performance noch Annahmen zu Transaktionskosten oder Tests an anderen Handelsplätzen und in anderen Zeiträumen. Das hybride Design bietet eine Möglichkeit, gelernte Ausführungsentscheidungen einzugrenzen; die Robustheit über den untersuchten Rahmen hinaus bleibt jedoch offen.
Kernaussagen
- Das vorgeschlagene System kombiniert die statistische Auswahl von Paaren mit einer ergänzenden Ausführungsstrategie.
- Ein PPO-Agent mit einer LSTM-Strategie trifft Ausführungsentscheidungen innerhalb deterministischer Risikogrenzen.
- Die Studie bewertet den Ansatz anhand stündlicher Binance-USD-M-Futuresdaten im Vergleich zu einer heuristischen Basisstrategie.
- Die berichtete risikoadjustierte Überrendite ist auf dem Niveau von 10 Prozent signifikant, aber nicht auf dem Niveau von 5 Prozent.
- Die Ergebnisse gelten speziell für den getesteten Markt, die verwendeten Daten und die Strategiekonfiguration.
Schlagwörter
Volltext
# Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning # Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning This study aims to determine whether the application of Deep Reinforcement Learning (DRL) as a specialized execution overlay can enhance pair trading in highly volatile cryptocurrency markets. Although classical implementations of the strategy have proven successful in traditional equities, they frequently exhibit rigidity and suffer from severe divergence risks when applied to high-variance environments. To address this need, this research introduces novel concepts. To construct a robust system, we developed a hierarchical "Filter-then-Rank" pair selection methodology and a proprietary "Fixed Risk, Adaptive Mean" execution model. The system employs a Proximal Policy Optimization (PPO) agent with a Long Short-Term Memory (LSTM) layer to govern execution decisions within strict deterministic risk management boundaries. Evaluated on 1-hour interval data from the Binance USD-M Futures market, the optimized RL policy achieved an out-of-sample performance that substantially outperformed the heuristic baseline. A stationary circular block bootstrap robustness check confirms that the agent's risk-adjusted outperformance is statistically significant at the 10 percent level. Although falling marginally short of the stricter 5 percent threshold, this result highlights the extreme idiosyncratic variance characteristic of digital assets. Ultimately, this thesis contributes to the quantitative finance literature by introducing a hybrid architecture that combines statistical arbitrage with DRL execution policies. Furthermore, it delivers a novel framework for safe reinforcement learning via deterministic shielding, proving that anchoring a neural policy to statistically robust boundaries successfully mitigates severe divergence risks.
Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.