Comparación de DQN y PPO para aprendizaje por refuerzo en forex
Resumen
Este estudio aplica aprendizaje profundo por refuerzo al trading de divisas y plantea la elección de operaciones como una secuencia de decisiones, en lugar de basarse en predicciones directas de precios. Adapta una política de arbitraje estadístico Sure-Fire a tres acciones posibles y convierte historiales continuos de precios en imágenes Gramian Angular Field. Los autores comparan Deep Q Learning con Proximal Policy Optimization usando datos de EUR/USD, GBP/USD y AUD/USD en intervalos de cuatro horas.
El entrenamiento usa datos desde el 1 de agosto hasta el 30 de noviembre de 2018, mientras que el periodo de prueba es diciembre de 2018. Los autores comunican un rendimiento de inversión favorable para modelos capaces de representar comportamientos de mercado complejos y aleatorios, y estados que describen adecuadamente el entorno de trading. La descripción proporcionada no incluye cifras de rentabilidad, métricas de riesgo, supuestos sobre comisiones ni ajustes detallados del modelo, por lo que aquí no se puede evaluar la solidez ni la comparabilidad de los resultados. La evidencia consiste en una prueba de viabilidad sobre tres pares de divisas y una breve división histórica; no demuestra que ninguno de los algoritmos vaya a funcionar de forma fiable en otros periodos o en condiciones de ejecución en vivo.
Ideas clave
- El enfoque plantea el trading de forex como un problema de decisiones secuenciales mediante aprendizaje por refuerzo.
- Una política de arbitraje estadístico adaptada define tres acciones de trading.
- Las ventanas de precios se codifican como imágenes Gramian Angular Field para introducirlas en el modelo.
- Se comparan Deep Q Learning y Proximal Policy Optimization con tres pares de divisas.
- La breve evaluación histórica comunica un rendimiento favorable, pero omite métricas detalladas y supuestos sobre costes de trading.
Etiquetas
Texto completo
# Deep Reinforcement Learning for Foreign Exchange Trading # Deep Reinforcement Learning for Foreign Exchange Trading Reinforcement learning can interact with the environment and is suitable for applications in decision control systems. Therefore, we used the reinforcement learning method to establish a foreign exchange transaction, avoiding the long-standing problem of unstable trends in deep learning predictions. In the system design, we optimized the Sure-Fire statistical arbitrage policy, set three different actions, encoded the continuous price over a period of time into a heat-map view of the Gramian Angular Field (GAF) and compared the Deep Q Learning (DQN) and Proximal Policy Optimization (PPO) algorithms. To test feasibility, we analyzed three currency pairs, namely EUR/USD, GBP/USD, and AUD/USD. We trained the data in units of four hours from 1 August 2018 to 30 November 2018 and tested model performance using data between 1 December 2018 and 31 December 2018. The test results of the various models indicated that favorable investment performance was achieved as long as the model was able to handle complex and random processes and the state was able to describe the environment, validating the feasibility of reinforcement learning in the development of trading strategies.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.