Pular para o conteúdo
Todos os documentos da biblioteca

Aprendizado profundo por reforço encontra respostas punitivas em jogos de execução

Artigo arXiv papers · Autor: Christos Spyridon Koulouris et al.

Resumo

Este artigo analisa se agentes independentes de aprendizado profundo por reforço desenvolvem comportamentos compatíveis com conluio em um jogo de execução ótima. Em um cenário de liquidação com dois participantes e horizonte finito, os agentes usam otimização de política proximal e têm acesso aos históricos de preços e ações durante cada episódio. Seus custos de liquidação aprendidos ficam abaixo do parâmetro de referência de Nash, resultado que os autores descrevem como supracompetitivo.

Para investigar o motivo, os pesquisadores treinam os agentes contra uma programação média de liquidação aprendida e, em seguida, testam um desvio impondo sua operação inicial a um agente original. O oponente responde vendendo mais rápido; nas execuções e nos papéis dos participantes relatados, essa resposta mais que anula o ganho de quem desviou, enquanto mantém praticamente inalterado o retorno médio de quem pune. Os autores também verificam se a punição supera o benefício do desvio e se a mudança no comportamento de trading explica a perda imposta; ambas as verificações se confirmam para o desvio testado. Esses resultados sustentam uma interpretação de conluio neste jogo simulado específico, mas não demonstram que agentes de trading implantados coludam em mercados reais.

Ideias principais

  • Agentes independentes de aprendizado por reforço alcançam custos de liquidação abaixo do parâmetro de referência de Nash no jogo estudado.
  • Um desvio testado leva o oponente a acelerar a liquidação como resposta punitiva.
  • Segundo os resultados, a punição mais que compensa o ganho de quem desviou, preservando o retorno médio de quem pune.
  • Os autores testam se a punição supera o ganho e se mudanças de comportamento explicam a perda; ambas as verificações se confirmam para o desvio testado.
  • As evidências vêm de um jogo simulado com dois participantes e não demonstram conluio em mercados ao vivo.

Tags

Texto completo
# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games


# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games









In this paper, we extend earlier findings of supra-competitive outcomes in optimal-execution games by identifying a learned punitive mechanism that deters deviations and provides behavioural evidence of collusion. We investigate this mechanism in a two-player, finite-horizon Almgren-Chriss liquidation game. Independent proximal policy optimisation agents with access to within-episode price and action histories achieve costs below the Nash benchmark. We identify a profitable deviation by training against the mean learned liquidation schedule, then impose its first trade on one of the original agents. The opponent responds by accelerating liquidation. This response more than offsets the deviator's gain in every run and both player roles, while leaving the punisher's average payoff materially unchanged relative to not punishing under the same deviation. The punisher imposes greater losses on the deviator while preserving its own average payoff, despite the availability of more profitable, less punitive liquidation plans. Matching deviations and subsequent additional selling rise and later decline during training, while final policies retain an effective punitive response. We formalise two checks: whether punishment outweighs the gain from deviating, and whether the change in trading behaviour is large enough to account for the loss imposed. Both checks hold for the tested deviation. Together, these findings provide behavioural and economic evidence supporting a collusive interpretation of the learned supra-competitive outcomes.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.