Aprendizado por reforço para arbitragem estatística entre ações pareadas
Resumo
Este estudo apresenta uma estrutura de aprendizado por reforço sem modelo para arbitragem estatística entre pares de ações. Primeiro, constrói um spread com reversão à média escolhendo coeficientes dos ativos que minimizam uma medida empírica do tempo que o spread leva para reverter. Assim, usa um critério observado de tempo de reversão em vez de depender de uma hipótese fixa de modelo.
Para o trading, a estrutura usa aprendizado por reforço para selecionar uma estratégia de reversão à média. Seu estado inclui tendências recentes dos movimentos de preços, em vez de depender apenas da distância do spread em relação a uma média de longo prazo, e sua recompensa é ajustada às características do trading de reversão à média. A descrição fornecida apresenta o desenho, mas não traz resultados empíricos de desempenho, detalhes do treinamento ou comparação com outras estratégias. Portanto, explica uma abordagem, mas não estabelece aqui sua eficácia prática nem sua robustez.
Ideias principais
- A estrutura constrói spreads entre ações pareadas minimizando uma medida empírica do tempo de reversão.
- Os coeficientes dos ativos são otimizados como parte da construção do spread.
- O aprendizado por reforço é usado para escolher as ações de trading para o spread.
- A representação do estado inclui tendências recentes dos preços e o contexto de reversão à média.
- A descrição não apresenta evidências de desempenho nem detalhes de implementação.
Tags
Texto completo
# Advanced Statistical Arbitrage with Reinforcement Learning # Advanced Statistical Arbitrage with Reinforcement Learning Statistical arbitrage is a prevalent trading strategy which takes advantage of mean reverse property of spread of paired stocks. Studies on this strategy often rely heavily on model assumption. In this study, we introduce an innovative model-free and reinforcement learning based framework for statistical arbitrage. For the construction of mean reversion spreads, we establish an empirical reversion time metric and optimize asset coefficients by minimizing this empirical mean reversion time. In the trading phase, we employ a reinforcement learning framework to identify the optimal mean reversion strategy. Diverging from traditional mean reversion strategies that primarily focus on price deviations from a long-term mean, our methodology creatively constructs the state space to encapsulate the recent trends in price movements. Additionally, the reward function is carefully tailored to reflect the unique characteristics of mean reversion trading.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.