Passer au contenu
Tous les documents de la bibliothèque

Combiner des agents d’apprentissage par renforcement profond pour le trading d’actions

Article arXiv papers · Auteur: Hongyang Yang et al.

Résumé

L’article décrit une approche automatisée du trading d’actions qui combine trois algorithmes d’apprentissage par renforcement acteur-critique : Proximal Policy Optimization, Advantage Actor Critic et Deep Deterministic Policy Gradient. Les agents sont entraînés à apprendre des décisions de trading visant à maximiser les rendements de l’investissement, et leurs points forts sont intégrés dans un ensemble conçu pour s’adapter aux conditions de marché. Une technique de chargement à la demande sert également à traiter de grands volumes de données tout en limitant l’utilisation de la mémoire pendant l’entraînement avec des actions continues.

L’approche est évaluée sur des actions liquides de l’univers Dow Jones et comparée aux algorithmes d’apprentissage individuels, au Dow Jones Industrial Average et à un portefeuille à variance minimale. Le résultat rapporté est que l’ensemble obtient un ratio de Sharpe supérieur à celui des méthodes individuelles et des références. L’extrait ne précise ni la période d’évaluation, ni les contraintes détaillées du portefeuille, ni les hypothèses de coûts de transaction, ni les tests de robustesse. La performance annoncée doit donc être comprise dans le cadre de test indiqué par l’étude, et non comme une preuve de rendements futurs.

Idées clés

  • La stratégie combine PPO, A2C et DDPG, des agents acteur-critique, dans un ensemble.
  • Les agents apprennent des décisions de trading d’actions visant le rendement de l’investissement.
  • Le traitement des données à la demande sert à réduire les besoins en mémoire pendant l’entraînement.
  • L’évaluation compare l’ensemble à ses méthodes constitutives, à un indice de marché et à un portefeuille à variance minimale.
  • Dans ces comparaisons, l’ensemble présenterait le meilleur ratio de Sharpe, sous réserve du cadre de test de l’étude.

Étiquettes

Texte intégral
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy


# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy









Stock trading strategies play a critical role in investment. However, it is challenging to design a profitable strategy in a complex and dynamic stock market. In this paper, we propose an ensemble strategy that employs deep reinforcement schemes to learn a stock trading strategy by maximizing investment return. We train a deep reinforcement learning agent and obtain an ensemble trading strategy using three actor-critic based algorithms: Proximal Policy Optimization (PPO), Advantage Actor Critic (A2C), and Deep Deterministic Policy Gradient (DDPG). The ensemble strategy inherits and integrates the best features of the three algorithms, thereby robustly adjusting to different market situations. In order to avoid the large memory consumption in training networks with continuous action space, we employ a load-on-demand technique for processing very large data. We test our algorithms on the 30 Dow Jones stocks that have adequate liquidity. The performance of the trading agent with different reinforcement learning algorithms is evaluated and compared with both the Dow Jones Industrial Average index and the traditional min-variance portfolio allocation strategy. The proposed deep ensemble strategy is shown to outperform the three individual algorithms and two baselines in terms of the risk-adjusted return measured by the Sharpe ratio. This work is fully open-sourced at \href{https://github.com/AI4Finance-Foundation/Deep-Reinforcement-Learning-for-Automated-Stock-Trading-Ensemble-Strategy-ICAIF-2020}{GitHub}.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.