Apprentissage profond par renforcement appliqué au trading multi-marchés
Résumé
L’article évalue deux méthodes d’apprentissage profond par renforcement, Double Deep Q-Network et Proximal Policy Optimization, appliquées au trading. Leurs performances sont comparées à une référence d’achat-conservation à partir de données quotidiennes de 2019 à 2023. Les actifs décrits comprennent trois paires de devises, l’indice S&P 500 et Bitcoin.
Les résultats rapportés indiquent que les systèmes d’apprentissage par renforcement peuvent éviter les transactions dans des conditions défavorables et obtenir de meilleurs rendements ajustés au risque que les approches classiques d’apprentissage supervisé. Cela suggère qu’une politique capable de choisir quand rester hors marché peut contribuer à la gestion du risque autant qu’à la sélection des transactions. Le résumé ne précise ni les paires de devises, ni la conception des modèles, les coûts de transaction, la procédure de validation ou les résultats par actif, et ne fournit aucune mesure numérique de performance. Les conclusions doivent donc être comprises comme portant sur les données et le dispositif testés dans l’étude, et non comme la preuve que ces méthodes se généraliseront à d’autres périodes ou au trading en réel.
Idées clés
- L’étude compare DDQN et PPO à une référence d’achat-conservation.
- Elle évalue des stratégies sur des observations quotidiennes portant sur des paires de devises, un indice boursier et Bitcoin.
- La période de test rapportée va de 2019 à 2023.
- Selon les auteurs, l’évitement des transactions défavorables contribue à la gestion du risque des méthodes.
- Dans cette étude, les rendements ajustés au risque rapportés dépassent ceux des approches classiques d’apprentissage supervisé.
Étiquettes
Texte intégral
# Can Artificial Intelligence Trade the Stock Market? # Can Artificial Intelligence Trade the Stock Market? The paper explores the use of Deep Reinforcement Learning (DRL) in stock market trading, focusing on two algorithms: Double Deep Q-Network (DDQN) and Proximal Policy Optimization (PPO) and compares them with Buy and Hold benchmark. It evaluates these algorithms across three currency pairs, the S&P 500 index and Bitcoin, on the daily data in the period of 2019-2023. The results demonstrate DRL's effectiveness in trading and its ability to manage risk by strategically avoiding trades in unfavorable conditions, providing a substantial edge over classical approaches, based on supervised learning in terms of risk-adjusted returns.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.