Pular para o conteúdo
Todos os documentos da biblioteca

Aprendizado por reforço PPO para trading ativo de ações em alta frequência

Artigo arXiv papers · Autor: Antonio Briola et al.

Resumo

O documento descreve uma abordagem de ponta a ponta de aprendizado profundo por reforço para trading ativo de ações em alta frequência. Os agentes usam otimização por política proximal para negociar uma ação da Intel, com estados construídos a partir de diferentes conjuntos de características do livro de ofertas. Os dados de treinamento são selecionados por grandes variações de preço para aumentar a relação sinal-ruído; um mês consecutivo é reservado para validação, seguido de outro mês para teste. Os hiperparâmetros são ajustados com otimização sequencial baseada em modelos.

Os autores relatam que os agentes encontram padrões recorrentes no livro de ofertas e produzem retornos positivos estáveis no período de teste, apesar das condições ruidosas e variáveis. Essa é uma evidência de um experimento de escopo restrito, com uma ação específica e uma sequência curta de meses. A descrição não informa estatísticas de retorno, custos de transação, comparações com benchmarks nem evidências de que o comportamento aprendido se mantenha em outros períodos, ativos e execução ao vivo. A seleção de amostras de treinamento por movimento de preço também pode influenciar o que os agentes aprendem; portanto, o resultado relatado não deve ser considerado prova ampla de lucratividade.

Ideias principais

  • Os agentes usam otimização por política proximal para negociar uma unidade de uma única ação.
  • As representações de estado variam nas características do livro de ofertas que incluem.
  • O treinamento dá ênfase a amostras com grandes movimentos de preço, com períodos separados para validação e teste.
  • Os hiperparâmetros são ajustados por otimização sequencial baseada em modelos.
  • São relatados retornos positivos no teste, mas a generalização mais ampla não foi demonstrada e os custos de execução não foram estabelecidos.

Tags

Texto completo
# Deep Reinforcement Learning for Active High Frequency Trading


# Deep Reinforcement Learning for Active High Frequency Trading









We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.