Aprendizado por reforço profundo para trading dinâmico de pares de criptomoedas
Resumo
Este estudo testa o aprendizado por reforço profundo como uma camada de execução para operações de pares em mercados voláteis de criptomoedas. A estrutura primeiro filtra e classifica pares candidatos e, em seguida, usa um agente de Otimização de Política Proximal com uma camada de Memória de Longo e Curto Prazo para tomar decisões de execução. Um desenho de risco fixo e média adaptativa, junto a controles de risco determinísticos, limita o agente com o objetivo de reduzir o risco de divergência. A avaliação usa dados horários de futuros Binance USD-M e compara a política aprendida com uma referência heurística.
Os resultados fora da amostra relatados favorecem a política de aprendizado por reforço, e um bootstrap estacionário de blocos circulares indica desempenho superior ajustado ao risco estatisticamente significativo ao nível de 10 por cento. O resultado não atinge o limiar de significância mais rigoroso de 5 por cento, o que o estudo relaciona à alta variância idiossincrática dos ativos digitais. As evidências se restringem aos dados e à configuração testados; a descrição não informa magnitudes de desempenho, premissas de custos de transação nem testes em outras plataformas e períodos. O desenho híbrido oferece uma forma de limitar decisões de execução aprendidas, mas a robustez mais ampla continua sendo uma questão em aberto.
Ideias principais
- O sistema proposto combina a seleção estatística de pares com uma camada de execução aprendida.
- Um agente PPO com uma LSTM toma decisões de execução dentro de limites de risco determinísticos.
- O estudo avalia a abordagem com dados horários de futuros Binance USD-M, comparando-a com uma referência heurística.
- O desempenho superior ajustado ao risco relatado é significativo ao nível de 10 por cento, mas não ao nível de 5 por cento.
- Os resultados se restringem ao mercado, aos dados e à configuração da estratégia testados.
Tags
Texto completo
# Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning # Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning This study aims to determine whether the application of Deep Reinforcement Learning (DRL) as a specialized execution overlay can enhance pair trading in highly volatile cryptocurrency markets. Although classical implementations of the strategy have proven successful in traditional equities, they frequently exhibit rigidity and suffer from severe divergence risks when applied to high-variance environments. To address this need, this research introduces novel concepts. To construct a robust system, we developed a hierarchical "Filter-then-Rank" pair selection methodology and a proprietary "Fixed Risk, Adaptive Mean" execution model. The system employs a Proximal Policy Optimization (PPO) agent with a Long Short-Term Memory (LSTM) layer to govern execution decisions within strict deterministic risk management boundaries. Evaluated on 1-hour interval data from the Binance USD-M Futures market, the optimized RL policy achieved an out-of-sample performance that substantially outperformed the heuristic baseline. A stationary circular block bootstrap robustness check confirms that the agent's risk-adjusted outperformance is statistically significant at the 10 percent level. Although falling marginally short of the stricter 5 percent threshold, this result highlights the extreme idiosyncratic variance characteristic of digital assets. Ultimately, this thesis contributes to the quantitative finance literature by introducing a hybrid architecture that combines statistical arbitrage with DRL execution policies. Furthermore, it delivers a novel framework for safe reinforcement learning via deterministic shielding, proving that anchoring a neural policy to statistically robust boundaries successfully mitigates severe divergence risks.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.