Pular para o conteúdo
Todos os documentos da biblioteca

Gradiente determinístico profundo de política para otimização de carteiras

Artigo arXiv papers · Autor: Ayman Chaouki et al.

Resumo

Este trabalho testa se o aprendizado por reforço profundo consegue recuperar estratégias de trading ótimas em ambientes simples de descrever, mas matematicamente desafiadores. Os autores se concentram no gradiente determinístico profundo de política, um método que aprende uma política para escolher ações ao interagir com um ambiente. Eles selecionam cenários em que a estratégia ótima, ou uma aproximação próxima, já é conhecida, permitindo comparar o comportamento aprendido e a recompensa com uma solução de referência.

O resultado relatado é que o agente recupera características essenciais das estratégias conhecidas e obtém recompensas próximas do ótimo. Isso fornece evidências de que o algoritmo pode funcionar como um solucionador nos ambientes testados. O trecho não identifica os modelos de mercado específicos, as restrições da carteira, os procedimentos de treinamento nem as métricas de avaliação. Portanto, sua conclusão se limita aos cenários controlados escolhidos e não estabelece desempenho em mercados ao vivo ruidosos, com custos de transação ou quando a política ótima é desconhecida.

Ideias principais

  • O estudo avalia o aprendizado por reforço profundo como método para resolver estratégias de trading.
  • Ele usa gradiente determinístico profundo de política em ambientes matematicamente complexos, mas conceitualmente simples.
  • Os ambientes testados têm estratégias ótimas conhecidas ou quase conhecidas para comparação.
  • Segundo os resultados, o agente recupera características importantes das estratégias e alcança recompensas quase ótimas.
  • O trecho não estabelece desempenho diante de fricções de mercado ao vivo nem quando as políticas ótimas são desconhecidas.

Tags

Texto completo
# Deep Deterministic Portfolio Optimization


# Deep Deterministic Portfolio Optimization









Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.