Перейти к содержимому
Все документы библиотеки

Ансамбль агентов глубокого обучения с подкреплением для торговли акциями

Статья arXiv papers · Автор: Hongyang Yang et al.

Сводка

В статье описан подход к автоматизированной торговле акциями, объединяющий три алгоритма обучения с подкреплением типа «актор-критик»: проксимальную оптимизацию политики, Advantage Actor Critic и Deep Deterministic Policy Gradient. Агенты обучаются принимать торговые решения с целью максимизации инвестиционной доходности, а их сильные стороны объединяются в ансамбль, призванный адаптироваться к разным рыночным условиям. При обучении с непрерывными действиями также применяется метод загрузки данных по требованию, позволяющий обрабатывать большие объёмы данных и ограничивать использование памяти.

Подход оценивается на ликвидных акциях из индекса Dow Jones и сравнивается с отдельными алгоритмами обучения, промышленным индексом Dow Jones и портфелем с минимальной дисперсией. Согласно результатам, коэффициент Шарпа ансамбля выше, чем у отдельных методов и базовых стратегий. В отрывке не указаны период оценки, подробные ограничения портфеля, допущения о транзакционных издержках или проверки устойчивости. Поэтому заявление об эффективности следует рассматривать в рамках условий проверки, описанных в исследовании, а не как свидетельство будущей доходности.

Ключевые идеи

  • Стратегия объединяет агентов «актор-критик» PPO, A2C и DDPG в ансамбль.
  • Агенты учатся принимать решения о торговле акциями, стремясь к инвестиционной доходности.
  • Обработка данных по требованию используется для снижения потребности в памяти во время обучения.
  • В ходе оценки ансамбль сравнивается с входящими в него методами, рыночным индексом и портфелем с минимальной дисперсией.
  • Согласно результатам сравнения, ансамбль показал наибольший коэффициент Шарпа с учётом условий проверки в исследовании.

Теги

Полный текст
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy


# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy









Stock trading strategies play a critical role in investment. However, it is challenging to design a profitable strategy in a complex and dynamic stock market. In this paper, we propose an ensemble strategy that employs deep reinforcement schemes to learn a stock trading strategy by maximizing investment return. We train a deep reinforcement learning agent and obtain an ensemble trading strategy using three actor-critic based algorithms: Proximal Policy Optimization (PPO), Advantage Actor Critic (A2C), and Deep Deterministic Policy Gradient (DDPG). The ensemble strategy inherits and integrates the best features of the three algorithms, thereby robustly adjusting to different market situations. In order to avoid the large memory consumption in training networks with continuous action space, we employ a load-on-demand technique for processing very large data. We test our algorithms on the 30 Dow Jones stocks that have adequate liquidity. The performance of the trading agent with different reinforcement learning algorithms is evaluated and compared with both the Dow Jones Industrial Average index and the traditional min-variance portfolio allocation strategy. The proposed deep ensemble strategy is shown to outperform the three individual algorithms and two baselines in terms of the risk-adjusted return measured by the Sharpe ratio. This work is fully open-sourced at \href{https://github.com/AI4Finance-Foundation/Deep-Reinforcement-Learning-for-Automated-Stock-Trading-Ensemble-Strategy-ICAIF-2020}{GitHub}.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.