Aprendizado por reforço recorrente com controle de risco para pairs trading
Resumo
Este documento descreve o CREDIT, uma abordagem de aprendizado por reforço para pairs trading que usa uma unidade recorrente com portas bidirecionais e atenção temporal. A arquitetura busca capturar relações ao longo do tempo nos movimentos de preço de dois ativos, incluindo padrões que podem passar despercebidos quando os estados do mercado são considerados de forma independente. A abordagem também usa uma recompensa que considera tanto o lucro do trading quanto o risco, com o objetivo de desencorajar operações com ganhos e perdas potenciais elevados.
Os autores apresentam o método como uma resposta à frequência elevada de operações, aos custos de transação e à tomada de risco em abordagens anteriores de aprendizado por reforço. Eles relatam que o CREDIT supera métodos existentes de aprendizado por reforço e obtém lucro significativo em experimentos com cinco anos de dados de ações dos EUA. O trecho não informa detalhes das referências, premissas de custo, medidas de risco ou resultados numéricos, portanto não é possível avaliar a magnitude ou a robustez da vantagem relatada. O desempenho em outros mercados ou períodos não é estabelecido aqui.
Ideias principais
- O CREDIT aplica aprendizado recorrente e atenção temporal a históricos de preços para pairs trading entre dois ativos.
- Sua recompensa considera tanto o lucro quanto o risco de trading.
- O desenho busca aprender padrões de preços de longo prazo e reduzir operações excessivas.
- Experimentos com cinco anos de dados de ações dos EUA supostamente superam outros métodos de aprendizado por reforço.
- O trecho não fornece detalhes suficientes para avaliar a robustez ou os custos de trading no mundo real.
Tags
Texto completo
# Mastering Pair Trading with Risk-Aware Recurrent Reinforcement Learning # Mastering Pair Trading with Risk-Aware Recurrent Reinforcement Learning Although pair trading is the simplest hedging strategy for an investor to eliminate market risk, it is still a great challenge for reinforcement learning (RL) methods to perform pair trading as human expertise. It requires RL methods to make thousands of correct actions that nevertheless have no obvious relations to the overall trading profit, and to reason over infinite states of the time-varying market most of which have never appeared in history. However, existing RL methods ignore the temporal connections between asset price movements and the risk of the performed trading. These lead to frequent tradings with high transaction costs and potential losses, which barely reach the human expertise level of trading. Therefore, we introduce CREDIT, a risk-aware agent capable of learning to exploit long-term trading opportunities in pair trading similar to a human expert. CREDIT is the first to apply bidirectional GRU along with the temporal attention mechanism to fully consider the temporal correlations embedded in the states, which allows CREDIT to capture long-term patterns of the price movements of two assets to earn higher profit. We also design the risk-aware reward inspired by the economic theory, that models both the profit and risk of the tradings during the trading period. It helps our agent to master pair trading with a robust trading preference that avoids risky trading with possible high returns and losses. Experiments show that it outperforms existing reinforcement learning methods in pair trading and achieves a significant profit over five years of U.S. stock data.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.