Combinação de agentes de aprendizado por reforço profundo para trading de ações
Resumo
O artigo descreve uma abordagem automatizada de trading de ações que combina três algoritmos de aprendizado por reforço ator-crítico: Proximal Policy Optimization, Advantage Actor Critic e Deep Deterministic Policy Gradient. Os agentes são treinados para aprender decisões de trading com o objetivo de maximizar os retornos dos investimentos, e seus pontos fortes são integrados em um conjunto que pretende se adaptar às condições do mercado. Também é usada uma técnica de carregamento sob demanda para processar grandes volumes de dados e limitar o uso de memória durante o treinamento com ações contínuas.
A abordagem é avaliada com ações líquidas do universo Dow Jones e comparada aos algoritmos de aprendizado individuais, ao Dow Jones Industrial Average e a uma carteira de variância mínima. O resultado relatado é que o conjunto alcança um índice de Sharpe maior do que esses métodos individuais e referências. O trecho não informa o período de avaliação, as restrições detalhadas da carteira, as premissas sobre custos de transação nem verificações de robustez. A alegação de desempenho deve, portanto, ser entendida no contexto da configuração de teste descrita pelo estudo, e não como evidência de retornos futuros.
Ideias principais
- A estratégia combina agentes ator-crítico PPO, A2C e DDPG em um conjunto.
- Os agentes aprendem decisões de trading de ações com o retorno do investimento como objetivo.
- O processamento de dados sob demanda é usado para reduzir a demanda de memória durante o treinamento.
- A avaliação compara o conjunto com seus métodos componentes, um índice de mercado e uma carteira de variância mínima.
- Relata-se que o conjunto tem o maior índice de Sharpe nessas comparações, dentro da configuração de teste do estudo.
Tags
Texto completo
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy
Stock trading strategies play a critical role in investment. However, it is challenging to design a profitable strategy in a complex and dynamic stock market. In this paper, we propose an ensemble strategy that employs deep reinforcement schemes to learn a stock trading strategy by maximizing investment return. We train a deep reinforcement learning agent and obtain an ensemble trading strategy using three actor-critic based algorithms: Proximal Policy Optimization (PPO), Advantage Actor Critic (A2C), and Deep Deterministic Policy Gradient (DDPG). The ensemble strategy inherits and integrates the best features of the three algorithms, thereby robustly adjusting to different market situations. In order to avoid the large memory consumption in training networks with continuous action space, we employ a load-on-demand technique for processing very large data. We test our algorithms on the 30 Dow Jones stocks that have adequate liquidity. The performance of the trading agent with different reinforcement learning algorithms is evaluated and compared with both the Dow Jones Industrial Average index and the traditional min-variance portfolio allocation strategy. The proposed deep ensemble strategy is shown to outperform the three individual algorithms and two baselines in terms of the risk-adjusted return measured by the Sharpe ratio. This work is fully open-sourced at \href{https://github.com/AI4Finance-Foundation/Deep-Reinforcement-Learning-for-Automated-Stock-Trading-Ensemble-Strategy-ICAIF-2020}{GitHub}.Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.