Aprendizado por reforço profundo para trading em vários mercados
Resumo
O artigo avalia dois métodos de aprendizado por reforço profundo, Double Deep Q-Network e Proximal Policy Optimization, para trading. O desempenho é comparado com uma referência de compra e manutenção usando dados diários de 2019 a 2023. Os ativos descritos incluem três pares de moedas, o índice S&P 500 e Bitcoin.
Os resultados relatados indicam que os sistemas de aprendizado por reforço conseguem evitar operações em condições desfavoráveis e obter retornos ajustados ao risco melhores que os métodos clássicos de aprendizado supervisionado. Isso sugere que uma política capaz de escolher quando ficar fora do mercado pode contribuir tanto para a gestão de risco quanto para a seleção de operações. O resumo não especifica os pares de moedas, o desenho do modelo, os custos de transação, o procedimento de validação ou os resultados por ativo, e não apresenta medidas numéricas de desempenho. Portanto, os resultados devem ser entendidos como alegações sobre os dados e a configuração testados no estudo, e não como evidência de que os métodos funcionarão em outros períodos ou no trading ao vivo.
Ideias principais
- O estudo compara DDQN e PPO com uma referência de compra e manutenção.
- As estratégias são avaliadas com observações diárias de pares de moedas, um índice de ações e Bitcoin.
- O período de teste relatado vai de 2019 a 2023.
- Os autores atribuem parte da gestão de risco dos métodos à prevenção de operações desfavoráveis.
- No estudo, os retornos ajustados ao risco relatados superam os dos métodos clássicos de aprendizado supervisionado.
Tags
Texto completo
# Can Artificial Intelligence Trade the Stock Market? # Can Artificial Intelligence Trade the Stock Market? The paper explores the use of Deep Reinforcement Learning (DRL) in stock market trading, focusing on two algorithms: Double Deep Q-Network (DDQN) and Proximal Policy Optimization (PPO) and compares them with Buy and Hold benchmark. It evaluates these algorithms across three currency pairs, the S&P 500 index and Bitcoin, on the daily data in the period of 2019-2023. The results demonstrate DRL's effectiveness in trading and its ability to manage risk by strategically avoiding trades in unfavorable conditions, providing a substantial edge over classical approaches, based on supervised learning in terms of risk-adjusted returns.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.