Pular para o conteúdo
Todos os documentos da biblioteca

Aprendizado por reforço profundo para execução de ordens limitadas com sinais de previsão

Artigo arXiv papers · Autor: Peer Nagy et al.

Resumo

O estudo usa aprendizado por reforço profundo para converter uma previsão de trading de curto prazo em decisões de envio de ordens limitadas e gestão de inventário em um livro de ofertas. Ele treina um agente em um ambiente simulado de ações da NASDAQ, construído com mensagens históricas do livro de ofertas, usando o simulador ABIDES. O agente observa o livro atual, o histórico recente do mercado e um sinal direcional; em seguida, aprende uma política de execução com Deep Double Duelling Q-learning e repetição priorizada e assíncrona de experiências.

Para avaliar a execução separadamente de qualquer método específico de previsão, os pesquisadores testam sinais alfa sintéticos com diferentes níveis de ruído. Eles relatam que o agente treinado administra o inventário e envia ordens de forma eficaz, superando uma estratégia heurística que recebe o mesmo sinal. Essa comparação dá suporte ao método de execução dentro do simulador descrito, mas o documento não apresenta números de desempenho nem evidências de resultados em mercados ao vivo. A qualidade e o realismo dos sinais sintéticos e do ambiente simulado limitam, portanto, as conclusões sobre a implementação.

Ideias principais

  • O agente aprende a converter uma previsão direcional em decisões sobre ordens limitadas e inventário.
  • O treinamento usa um simulador de livro de ofertas limitadas da NASDAQ, baseado em mensagens históricas.
  • O agente observa o estado do livro, o histórico recente e uma previsão de curto prazo.
  • Sinais sintéticos com níveis variados de ruído permitem que os pesquisadores se concentrem na execução, e não na qualidade da previsão.
  • Na simulação, a política aprendida supera uma heurística que usa o mesmo sinal, mas o desempenho ao vivo não foi estabelecido.

Tags

Texto completo
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets


# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets









We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.