Pular para o conteúdo
Todos os documentos da biblioteca

Aprendizado de políticas de liquidação em leilões de fechamento

Artigo arXiv papers · Autor: Julius Graf et al.

Resumo

Este estudo considera um trader que vende por meio de um livro de ofertas e depois ajusta o estoque restante usando programações de ordens com sinais de compra ou venda em um leilão de fechamento. As duas etapas são conectadas por uma previsão do preço de liquidação do leilão e pelo feedback durante o leilão. Os autores comparam redes Q profundas com políticas de aprendizado por reforço projetadas DDPG, TD3 e SAC em um mercado simulado, usando preços sintéticos de Heston rugoso e trajetórias históricas do preço médio.

As políticas são escolhidas e avaliadas pelo déficit de execução penalizado pelo estoque, mantendo a avaliação separada de uma função objetivo ponderada de treinamento. Nas simulações relatadas, as abordagens aprendidas alcançam déficit penalizado menor que as estratégias de referência Avellaneda–Stoikov e TWAP. Comparações sintéticas equivalentes também indicam que o acesso ao leilão ajuda os quatro métodos de aprendizado. Um feedback mais frequente do leilão melhora o aprendizado, enquanto o valor adicional da previsão do preço de liquidação varia conforme o método. Esses resultados se baseiam em simulações; a descrição não demonstra desempenho em trading ao vivo nem generalização para outras condições de mercado.

Ideias principais

  • O processo de liquidação combina negociação contínua em livro de ofertas com um leilão de fechamento.
  • Os cronogramas do leilão ajustam o estoque que resta após a negociação contínua.
  • Quatro abordagens de aprendizado por reforço são comparadas com preços simulados e trajetórias históricas do preço médio.
  • As políticas aprendidas apresentam déficit menor, penalizado pelo estoque, que as referências Avellaneda–Stoikov e TWAP.
  • O acesso ao leilão beneficia cada método nas comparações sintéticas equivalentes, enquanto o valor da previsão depende do método.

Tags

Texto completo
# Learning Optimal Liquidation with Closing Auctions


# Learning Optimal Liquidation with Closing Auctions









We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.