Ensemble aus Deep-Reinforcement-Learning-Agenten für den Aktienhandel
Zusammenfassung
Die Studie beschreibt einen automatisierten Aktienhandelsansatz, der drei Actor-Critic-Algorithmen des Reinforcement Learning kombiniert: Proximal Policy Optimization, Advantage Actor Critic und Deep Deterministic Policy Gradient. Die Agenten werden darauf trainiert, Handelsentscheidungen mit dem Ziel zu lernen, die Anlagerenditen zu maximieren. Ihre Stärken werden in einem Ensemble gebündelt, das sich an unterschiedliche Marktbedingungen anpassen soll. Außerdem kommt eine bedarfsabhängige Lademethode zum Einsatz, um große Datenmengen zu verarbeiten und beim Training mit kontinuierlichen Aktionen den Speicherbedarf zu begrenzen.
Der Ansatz wird anhand liquider Aktien aus dem Dow-Jones-Universum bewertet und mit den einzelnen Lernalgorithmen, dem Dow Jones Industrial Average und einem Minimum-Varianz-Portfolio verglichen. Als Ergebnis wird berichtet, dass das Ensemble eine höhere Sharpe-Ratio erzielt als die einzelnen Methoden und Vergleichsmaßstäbe. Der Auszug nennt weder den Bewertungszeitraum noch detaillierte Portfoliobeschränkungen, Annahmen zu Transaktionskosten oder Robustheitsprüfungen. Die Leistungsbehauptung ist daher im Rahmen des angegebenen Testaufbaus der Studie zu verstehen und nicht als Beleg für künftige Renditen.
Kernaussagen
- Die Strategie bündelt PPO, A2C und DDPG Actor-Critic-Agenten zu einem Ensemble.
- Die Agenten lernen Aktienhandelsentscheidungen mit den Anlagerenditen als Zielgröße.
- Die bedarfsabhängige Datenverarbeitung senkt den Speicherbedarf während des Trainings.
- Die Bewertung vergleicht das Ensemble mit seinen Einzelmethoden, einem Marktindex und einem Minimum-Varianz-Portfolio.
- Laut Bericht erzielt das Ensemble in diesen Vergleichen die höchste Sharpe-Ratio, unter den Bedingungen des Testaufbaus.
Schlagwörter
Volltext
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy
Stock trading strategies play a critical role in investment. However, it is challenging to design a profitable strategy in a complex and dynamic stock market. In this paper, we propose an ensemble strategy that employs deep reinforcement schemes to learn a stock trading strategy by maximizing investment return. We train a deep reinforcement learning agent and obtain an ensemble trading strategy using three actor-critic based algorithms: Proximal Policy Optimization (PPO), Advantage Actor Critic (A2C), and Deep Deterministic Policy Gradient (DDPG). The ensemble strategy inherits and integrates the best features of the three algorithms, thereby robustly adjusting to different market situations. In order to avoid the large memory consumption in training networks with continuous action space, we employ a load-on-demand technique for processing very large data. We test our algorithms on the 30 Dow Jones stocks that have adequate liquidity. The performance of the trading agent with different reinforcement learning algorithms is evaluated and compared with both the Dow Jones Industrial Average index and the traditional min-variance portfolio allocation strategy. The proposed deep ensemble strategy is shown to outperform the three individual algorithms and two baselines in terms of the risk-adjusted return measured by the Sharpe ratio. This work is fully open-sourced at \href{https://github.com/AI4Finance-Foundation/Deep-Reinforcement-Learning-for-Automated-Stock-Trading-Ensemble-Strategy-ICAIF-2020}{GitHub}.Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.