Торговля биткоином с ценовыми моделями LSTM и PPO
Сводка
В исследовании предлагается система высокочастотной автоматизированной торговли биткоином, сочетающая ценовую модель LSTM (LSTM) с проксимальной оптимизацией политики (PPO). Цены представлены как состояния агента, сделки — как действия, а доходность — как вознаграждение. Для прогнозирования цен сравниваются машины опорных векторов, многослойные перцептроны, LSTM, временные сверточные сети и трансформеры; в описанных экспериментах предпочтение отдано LSTM.
Авторы оценивают полученную стратегию PPO в симулируемой среде на синхронизированных данных и сравнивают её с распространёнными стратегиями-бенчмарками для одного актива. Они сообщают, что доходность выше, чем у лучшего бенчмарка, и отмечают рост в периоды как высокой волатильности, так и подъёма рынка. Результаты ограничены рассмотренными в исследовании биткоином и симуляцией; в отрывке не указаны транзакционные издержки, влияние на рынок, дизайн выборки или устойчивость вне выборки. Поэтому эти утверждения не доказывают, что подход применим к реальной торговле или другим продуктам.
Ключевые идеи
- Система использует PPO, чтобы формировать сделки с биткоином на основе ценовых состояний и вознаграждений за доходность.
- Модель LSTM задаёт ценовую основу политики после сравнения с несколькими другими методами прогнозирования.
- Стратегия оценивается в симулируемой среде на синхронизированных данных.
- В описанных сравнениях с бенчмарками предложенный метод показывает лучшие результаты в условиях тестирования на одном активе.
- В отрывке не описаны торговые издержки или свидетельства устойчивости на реальном рынке.
Теги
Полный текст
# Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning # Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning The emerging cryptocurrency market has lately received great attention for asset allocation due to its decentralization uniqueness. However, its volatility and brand new trading mode have made it challenging to devising an acceptable automatically-generating strategy. This study proposes a framework for automatic high-frequency bitcoin transactions based on a deep reinforcement learning algorithm-proximal policy optimization (PPO). The framework creatively regards the transaction process as actions, returns as awards and prices as states to align with the idea of reinforcement learning. It compares advanced machine learning-based models for static price predictions including support vector machine (SVM), multi-layer perceptron (MLP), long short-term memory (LSTM), temporal convolutional network (TCN), and Transformer by applying them to the real-time bitcoin price and the experimental results demonstrate that LSTM outperforms. Then an automatically-generating transaction strategy is constructed building on PPO with LSTM as the basis to construct the policy. Extensive empirical studies validate that the proposed method performs superiorly to various common trading strategy benchmarks for a single financial product. The approach is able to trade bitcoins in a simulated environment with synchronous data and obtains a 31.67% more return than that of the best benchmark, improving the benchmark by 12.75%. The proposed framework can earn excess returns through both the period of volatility and surge, which opens the door to research on building a single cryptocurrency trading strategy based on deep learning. Visualizations of trading the process show how the model handles high-frequency transactions to provide inspiration and demonstrate that it can be expanded to other financial products.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.