Apprentissage profond par renforcement Q pour le trading de portefeuille multi-actifs
Résumé
Cette étude formule le trading de portefeuille comme un processus de décision de Markov et entraîne un agent par apprentissage profond par renforcement Q afin de choisir des allocations entre plusieurs actifs. Son espace d’action est discret et combinatoire : pour chaque actif, l’agent sélectionne une direction de trading avec une taille prédéfinie. Pour traiter les actions qui enfreignent les contraintes, la méthode transforme une proposition non réalisable en l’alternative réalisable la plus proche. Elle décrit également une architecture d’agent et de réseau Q conçue pour gérer l’espace d’action multi-actifs et simuler des actions réalisables dans chaque état.
L’approche est évaluée par backtests sur deux portefeuilles représentatifs, dont les résultats sont présentés comme supérieurs à ceux des stratégies de référence. Le document n’identifie pas les portefeuilles, les références, la période d’évaluation ni les hypothèses de coûts de transaction ; la portée de cette comparaison et sa pertinence pour le trading en réel ne peuvent donc pas être évaluées à partir de la seule description.
Idées clés
- Le processus de décision du portefeuille est modélisé comme un processus de décision de Markov entraîné par apprentissage profond par renforcement Q.
- L’agent choisit des directions discrètes et des tailles de trading prédéfinies pour chaque actif.
- Une étape de transformation convertit les actions proposées non réalisables en actions réalisables proches.
- Les backtests sur deux portefeuilles sont présentés comme supérieurs aux stratégies de référence, mais les détails de l’évaluation ne sont pas fournis.
Étiquettes
Texte intégral
# An intelligent financial portfolio trading strategy using deep Q-learning # An intelligent financial portfolio trading strategy using deep Q-learning Portfolio traders strive to identify dynamic portfolio allocation schemes so that their total budgets are efficiently allocated through the investment horizon. This study proposes a novel portfolio trading strategy in which an intelligent agent is trained to identify an optimal trading action by using deep Q-learning. We formulate a Markov decision process model for the portfolio trading process, and the model adopts a discrete combinatorial action space, determining the trading direction at prespecified trading size for each asset, to ensure practical applicability. Our novel portfolio trading strategy takes advantage of three features to outperform in real-world trading. First, a mapping function is devised to handle and transform an initially found but infeasible action into a feasible action closest to the originally proposed ideal action. Second, by overcoming the dimensionality problem, this study establishes models of agent and Q-network for deriving a multi-asset trading strategy in the predefined action space. Last, this study introduces a technique that has the advantage of deriving a well-fitted multi-asset trading strategy by designing an agent to simulate all feasible actions in each state. To validate our approach, we conduct backtests for two representative portfolios and demonstrate superior results over the benchmark strategies.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.