Pular para o conteúdo
Todos os documentos da biblioteca

Aprendizado por reforço profundo para trading em vários mercados

Artigo arXiv papers · Autor: Jędrzej Maskiewicz et al.

Resumo

O artigo avalia dois métodos de aprendizado por reforço profundo, Double Deep Q-Network e Proximal Policy Optimization, para trading. O desempenho é comparado com uma referência de compra e manutenção usando dados diários de 2019 a 2023. Os ativos descritos incluem três pares de moedas, o índice S&P 500 e Bitcoin.

Os resultados relatados indicam que os sistemas de aprendizado por reforço conseguem evitar operações em condições desfavoráveis e obter retornos ajustados ao risco melhores que os métodos clássicos de aprendizado supervisionado. Isso sugere que uma política capaz de escolher quando ficar fora do mercado pode contribuir tanto para a gestão de risco quanto para a seleção de operações. O resumo não especifica os pares de moedas, o desenho do modelo, os custos de transação, o procedimento de validação ou os resultados por ativo, e não apresenta medidas numéricas de desempenho. Portanto, os resultados devem ser entendidos como alegações sobre os dados e a configuração testados no estudo, e não como evidência de que os métodos funcionarão em outros períodos ou no trading ao vivo.

Ideias principais

  • O estudo compara DDQN e PPO com uma referência de compra e manutenção.
  • As estratégias são avaliadas com observações diárias de pares de moedas, um índice de ações e Bitcoin.
  • O período de teste relatado vai de 2019 a 2023.
  • Os autores atribuem parte da gestão de risco dos métodos à prevenção de operações desfavoráveis.
  • No estudo, os retornos ajustados ao risco relatados superam os dos métodos clássicos de aprendizado supervisionado.

Tags

Texto completo
# Can Artificial Intelligence Trade the Stock Market?


# Can Artificial Intelligence Trade the Stock Market?









The paper explores the use of Deep Reinforcement Learning (DRL) in stock market trading, focusing on two algorithms: Double Deep Q-Network (DDQN) and Proximal Policy Optimization (PPO) and compares them with Buy and Hold benchmark. It evaluates these algorithms across three currency pairs, the S&P 500 index and Bitcoin, on the daily data in the period of 2019-2023. The results demonstrate DRL's effectiveness in trading and its ability to manage risk by strategically avoiding trades in unfavorable conditions, providing a substantial edge over classical approaches, based on supervised learning in terms of risk-adjusted returns.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.