Ensembles de estratégias de aprendizado profundo por reforço para trading de cripto
Resumo
Este estudo apresenta uma abordagem de ensemble para trading intradiário de carteiras de criptomoedas com aprendizado profundo por reforço. Ele seleciona modelos candidatos usando vários períodos de validação e, em seguida, combina as políticas selecionadas por meio de uma distribuição de mistura. O objetivo é melhorar a generalização em um ambiente de mercado altamente estocástico.
Os autores avaliam o desempenho em períodos granulares de teste fora da amostra e retreinam os modelos periodicamente para levar em conta as mudanças nos dados financeiros. Eles relatam desempenho superior fora da amostra em relação tanto a uma estratégia isolada de aprendizado profundo por reforço quanto ao investimento passivo. O documento não fornece detalhes sobre ativos, custos, implementação nem a magnitude e a significância estatística dos ganhos; portanto, a comparação relatada, por si só, não comprova eficácia no trading ao vivo.
Ideias principais
- Vários períodos de validação são usados para selecionar modelos para o ensemble.
- Uma política de distribuição de mistura combina os modelos selecionados de aprendizado por reforço.
- O desempenho é examinado em períodos mais curtos fora da amostra para avaliar a robustez conforme os mercados evoluem.
- O retreinamento periódico é usado para lidar com dados financeiros não estacionários.
- Nas comparações fora da amostra relatadas, o ensemble supera uma estratégia isolada de aprendizado profundo por reforço e o investimento passivo.
Tags
Texto completo
# An Ensemble Method of Deep Reinforcement Learning for Automated Cryptocurrency Trading # An Ensemble Method of Deep Reinforcement Learning for Automated Cryptocurrency Trading We propose an ensemble method to improve the generalization performance of trading strategies trained by deep reinforcement learning algorithms in a highly stochastic environment of intraday cryptocurrency portfolio trading. We adopt a model selection method that evaluates on multiple validation periods, and propose a novel mixture distribution policy to effectively ensemble the selected models. We provide a distributional view of the out-of-sample performance on granular test periods to demonstrate the robustness of the strategies in evolving market conditions, and retrain the models periodically to address non-stationarity of financial data. Our proposed ensemble method improves the out-of-sample performance compared with the benchmarks of a deep reinforcement learning strategy and a passive investment strategy.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.