Apprentissage profond par renforcement pour le trading dynamique de paires crypto
Résumé
Cette étude teste l’apprentissage profond par renforcement comme couche d’exécution pour le trading par paires sur des marchés de cryptomonnaies volatils. Le cadre filtre et classe d’abord les paires candidates, puis utilise un agent Proximal Policy Optimization doté d’une couche Long Short-Term Memory pour prendre les décisions d’exécution. Une conception à risque fixe et moyenne adaptative, ainsi que des contrôles déterministes du risque, encadrent l’agent afin de réduire le risque de divergence. L’évaluation utilise des données horaires sur les contrats à terme Binance USD-M et compare la politique apprise à une référence heuristique.
Les résultats hors échantillon rapportés favorisent la politique d’apprentissage par renforcement, et un bootstrap circulaire stationnaire par blocs indique une surperformance ajustée du risque statistiquement significative au seuil de 10 pour cent. Le résultat n’atteint pas le seuil de signification plus strict de 5 pour cent, ce que l’étude relie à la forte variance idiosyncratique des actifs numériques. Les éléments de preuve sont propres aux données et au dispositif testés ; la description ne précise ni l’ampleur des performances, ni les hypothèses de coûts de transaction, ni les tests sur d’autres plateformes et périodes. La conception hybride propose une façon de borner les décisions d’exécution apprises, mais sa robustesse générale reste une question ouverte.
Idées clés
- Le système proposé combine la sélection statistique de paires avec une couche d’exécution apprise.
- Un agent PPO doté d’un LSTM prend les décisions d’exécution dans des limites de risque déterministes.
- L’étude évalue l’approche sur des données horaires de contrats à terme Binance USD-M par rapport à une référence heuristique.
- La surperformance ajustée du risque rapportée est significative au seuil de 10 pour cent, mais pas à celui de 5 pour cent.
- Les résultats sont propres au marché, aux données et à la configuration de stratégie testés.
Étiquettes
Texte intégral
# Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning # Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning This study aims to determine whether the application of Deep Reinforcement Learning (DRL) as a specialized execution overlay can enhance pair trading in highly volatile cryptocurrency markets. Although classical implementations of the strategy have proven successful in traditional equities, they frequently exhibit rigidity and suffer from severe divergence risks when applied to high-variance environments. To address this need, this research introduces novel concepts. To construct a robust system, we developed a hierarchical "Filter-then-Rank" pair selection methodology and a proprietary "Fixed Risk, Adaptive Mean" execution model. The system employs a Proximal Policy Optimization (PPO) agent with a Long Short-Term Memory (LSTM) layer to govern execution decisions within strict deterministic risk management boundaries. Evaluated on 1-hour interval data from the Binance USD-M Futures market, the optimized RL policy achieved an out-of-sample performance that substantially outperformed the heuristic baseline. A stationary circular block bootstrap robustness check confirms that the agent's risk-adjusted outperformance is statistically significant at the 10 percent level. Although falling marginally short of the stricter 5 percent threshold, this result highlights the extreme idiosyncratic variance characteristic of digital assets. Ultimately, this thesis contributes to the quantitative finance literature by introducing a hybrid architecture that combines statistical arbitrage with DRL execution policies. Furthermore, it delivers a novel framework for safe reinforcement learning via deterministic shielding, proving that anchoring a neural policy to statistically robust boundaries successfully mitigates severe divergence risks.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.