Comparação entre DQN e PPO para aprendizado por reforço no trading de Forex
Resumo
Este estudo aplica aprendizado profundo por reforço ao trading de câmbio, tratando a escolha de operações como uma sequência de decisões, em vez de depender de previsões diretas de preços. Ele adapta uma política de arbitragem estatística Sure-Fire a três ações possíveis e converte históricos contínuos de preços em imagens Gramian Angular Field. Os autores comparam Deep Q Learning e Proximal Policy Optimization usando dados de EUR/USD, GBP/USD e AUD/USD em intervalos de quatro horas.
O treinamento usa dados de 1 de agosto a 30 de novembro de 2018, enquanto o período de teste é dezembro de 2018. Os autores relatam desempenho de investimento favorável para modelos capazes de representar comportamentos de mercado complexos e aleatórios, além de estados que descrevem adequadamente o ambiente de trading. A descrição fornecida não apresenta valores de retorno, métricas de risco, hipóteses sobre taxas ou configurações detalhadas dos modelos; portanto, não é possível avaliar aqui a força e a comparabilidade dos resultados. As evidências consistem em um teste de viabilidade com três pares de moedas e uma breve divisão histórica; elas não demonstram que qualquer um dos algoritmos terá desempenho confiável em outros períodos ou em condições de execução ao vivo.
Ideias principais
- A abordagem trata o trading de Forex como um problema de decisão sequencial com aprendizado por reforço.
- Três ações de trading são definidas em uma política adaptada de arbitragem estatística.
- Janelas de preços são codificadas como imagens Gramian Angular Field para servir de entrada ao modelo.
- Deep Q Learning e Proximal Policy Optimization são comparados em três pares de moedas.
- A breve avaliação histórica relata desempenho favorável, mas omite métricas detalhadas e hipóteses sobre custos de trading.
Tags
Texto completo
# Deep Reinforcement Learning for Foreign Exchange Trading # Deep Reinforcement Learning for Foreign Exchange Trading Reinforcement learning can interact with the environment and is suitable for applications in decision control systems. Therefore, we used the reinforcement learning method to establish a foreign exchange transaction, avoiding the long-standing problem of unstable trends in deep learning predictions. In the system design, we optimized the Sure-Fire statistical arbitrage policy, set three different actions, encoded the continuous price over a period of time into a heat-map view of the Gramian Angular Field (GAF) and compared the Deep Q Learning (DQN) and Proximal Policy Optimization (PPO) algorithms. To test feasibility, we analyzed three currency pairs, namely EUR/USD, GBP/USD, and AUD/USD. We trained the data in units of four hours from 1 August 2018 to 30 November 2018 and tested model performance using data between 1 December 2018 and 31 December 2018. The test results of the various models indicated that favorable investment performance was achieved as long as the model was able to handle complex and random processes and the state was able to describe the environment, validating the feasibility of reinforcement learning in the development of trading strategies.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.