Pular para o conteúdo
Todos os documentos da biblioteca

Aprendizado profundo por reforço para formadores de mercado de criptomoedas

Artigo arXiv papers · Autor: Jonathan Sadighian

Resumo

O artigo descreve uma estrutura de aprendizado profundo por reforço para formação de mercado de criptomoedas, na qual agentes aprendem a gerenciar estoque interagindo com um ambiente de trading simulado. O ambiente representa as observações do mercado usando dados do livro de ofertas e estatísticas de chegada do fluxo de ordens. Algoritmos de gradiente de política atuam como agentes, e uma rede neural feed-forward aproxima suas políticas ou funções de valor.

O experimento compara duas funções de recompensa e avalia combinações de agentes e recompensas usando retornos diários e médios das operações. Os autores apresentam a estrutura como uma forma de lidar com o problema estocástico de controle de estoque enfrentado por formadores de mercado. A descrição fornecida não identifica os algoritmos específicos, as definições de recompensa, o conjunto de dados nem os resultados numéricos; portanto, não estabelece como o desempenho se transfere para mercados ao vivo ou outras condições de mercado.

Ideias principais

  • A estrutura aplica aprendizado profundo por reforço à formação de mercado de criptomoedas.
  • Os agentes observam informações do livro de ofertas e estatísticas de chegada do fluxo de ordens.
  • Métodos de gradiente de política interagem com o ambiente de mercado usando uma rede neural feed-forward.
  • Duas funções de recompensa são comparadas usando retornos diários e médios das operações.
  • A aplicação declarada é o controle estocástico de estoque para formadores de mercado, embora a descrição fornecida omita detalhes de implementação e transferência.

Tags

Texto completo
# Deep Reinforcement Learning in Cryptocurrency Market Making


# Deep Reinforcement Learning in Cryptocurrency Market Making









This paper sets forth a framework for deep reinforcement learning as applied to market making (DRLMM) for cryptocurrencies. Two advanced policy gradient-based algorithms were selected as agents to interact with an environment that represents the observation space through limit order book data, and order flow arrival statistics. Within the experiment, a forward-feed neural network is used as the function approximator and two reward functions are compared. The performance of each combination of agent and reward function is evaluated by daily and average trade returns. Using this DRLMM framework, this paper demonstrates the effectiveness of deep reinforcement learning in solving stochastic inventory control challenges market makers face.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.