Trading de Bitcoin con modelos de precios LSTM y PPO
Resumen
El estudio propone un marco automatizado de trading de alta frecuencia con Bitcoin que combina un modelo de precios de memoria a corto y largo plazo (LSTM) con optimización de políticas proximales (PPO). Representa los precios como estados del agente, las operaciones como acciones y los rendimientos como recompensas. Para el componente de predicción de precios, compara máquinas de vectores de soporte, perceptrones multicapa, LSTM, redes convolucionales temporales y Transformers; los experimentos descritos favorecen LSTM.
Los autores evalúan la estrategia PPO resultante en un entorno simulado con datos sincronizados y la comparan con referencias habituales de estrategias para un único activo. Informan de rendimientos superiores a los de la referencia más sólida y describen ganancias tanto en periodos volátiles como alcistas. Estos resultados se limitan al entorno de Bitcoin y a la simulación del estudio; el fragmento no especifica los costes de transacción, el impacto de mercado, el diseño de la muestra ni la robustez fuera de muestra. Por tanto, sus afirmaciones no demuestran que el método pueda trasladarse a la operativa real ni a otros productos.
Ideas clave
- El marco utiliza PPO para generar operaciones con Bitcoin a partir de estados de precios y recompensas basadas en rendimientos.
- Un LSTM proporciona la base del modelo de precios de la política tras compararlo con varios métodos de predicción.
- El estudio evalúa la estrategia en un entorno simulado con datos sincronizados.
- Las comparaciones con referencias favorecen el método propuesto en el entorno probado de un único activo.
- El fragmento no describe los costes de trading ni pruebas de robustez en mercados reales.
Etiquetas
Texto completo
# Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning # Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning The emerging cryptocurrency market has lately received great attention for asset allocation due to its decentralization uniqueness. However, its volatility and brand new trading mode have made it challenging to devising an acceptable automatically-generating strategy. This study proposes a framework for automatic high-frequency bitcoin transactions based on a deep reinforcement learning algorithm-proximal policy optimization (PPO). The framework creatively regards the transaction process as actions, returns as awards and prices as states to align with the idea of reinforcement learning. It compares advanced machine learning-based models for static price predictions including support vector machine (SVM), multi-layer perceptron (MLP), long short-term memory (LSTM), temporal convolutional network (TCN), and Transformer by applying them to the real-time bitcoin price and the experimental results demonstrate that LSTM outperforms. Then an automatically-generating transaction strategy is constructed building on PPO with LSTM as the basis to construct the policy. Extensive empirical studies validate that the proposed method performs superiorly to various common trading strategy benchmarks for a single financial product. The approach is able to trade bitcoins in a simulated environment with synchronous data and obtains a 31.67% more return than that of the best benchmark, improving the benchmark by 12.75%. The proposed framework can earn excess returns through both the period of volatility and surge, which opens the door to research on building a single cryptocurrency trading strategy based on deep learning. Visualizations of trading the process show how the model handles high-frequency transactions to provide inspiration and demonstrate that it can be expanded to other financial products.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.