Bitcoin-Trading mit LSTM-Preismodellen und PPO
Zusammenfassung
Die Studie schlägt ein Rahmenwerk für den automatisierten Bitcoin-Hochfrequenzhandel vor, das ein Preismodell mit Long Short-Term Memory (LSTM) und Proximal Policy Optimization (PPO) kombiniert. Dabei gelten Preise als Zustände des Agenten, Trades als Aktionen und Renditen als Belohnungen. Für die Preisprognose vergleicht die Studie Support Vector Machines, mehrschichtige Perzeptronen, LSTMs, zeitliche Faltungsnetzwerke und Transformer; den berichteten Experimenten zufolge schneidet LSTM am besten ab.
Die Autoren bewerten die resultierende PPO-Strategie in einer simulierten Umgebung mit synchronisierten Daten und vergleichen sie mit gängigen Strategie-Benchmarks für einen einzelnen Vermögenswert. Sie berichten höhere Renditen als beim stärksten Benchmark und beschreiben Gewinne sowohl in volatilen als auch in steigenden Phasen. Die Ergebnisse sind auf das Bitcoin-Szenario und die Simulation der Studie beschränkt; der Auszug nennt weder Transaktionskosten noch Markteinfluss, Stichprobendesign oder Robustheit außerhalb der Stichprobe. Die Aussagen belegen daher nicht, dass sich der Ansatz auf Live-Trading oder andere Produkte übertragen lässt.
Kernaussagen
- Der Rahmen nutzt PPO, um aus Preiszuständen und Renditebelohnungen Bitcoin-Trades abzuleiten.
- Ein LSTM bildet nach dem Vergleich mit mehreren anderen Prognoseverfahren die Preis-Modellgrundlage der Strategie.
- Die Studie bewertet die Strategie in einer simulierten Umgebung mit synchronisierten Daten.
- Die berichteten Benchmark-Vergleiche sprechen im getesteten Szenario mit einem einzelnen Vermögenswert für die vorgeschlagene Methode.
- Der Auszug beschreibt weder Handelskosten noch Belege für Robustheit unter Live-Marktbedingungen.
Schlagwörter
Volltext
# Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning # Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning The emerging cryptocurrency market has lately received great attention for asset allocation due to its decentralization uniqueness. However, its volatility and brand new trading mode have made it challenging to devising an acceptable automatically-generating strategy. This study proposes a framework for automatic high-frequency bitcoin transactions based on a deep reinforcement learning algorithm-proximal policy optimization (PPO). The framework creatively regards the transaction process as actions, returns as awards and prices as states to align with the idea of reinforcement learning. It compares advanced machine learning-based models for static price predictions including support vector machine (SVM), multi-layer perceptron (MLP), long short-term memory (LSTM), temporal convolutional network (TCN), and Transformer by applying them to the real-time bitcoin price and the experimental results demonstrate that LSTM outperforms. Then an automatically-generating transaction strategy is constructed building on PPO with LSTM as the basis to construct the policy. Extensive empirical studies validate that the proposed method performs superiorly to various common trading strategy benchmarks for a single financial product. The approach is able to trade bitcoins in a simulated environment with synchronous data and obtains a 31.67% more return than that of the best benchmark, improving the benchmark by 12.75%. The proposed framework can earn excess returns through both the period of volatility and surge, which opens the door to research on building a single cryptocurrency trading strategy based on deep learning. Visualizations of trading the process show how the model handles high-frequency transactions to provide inspiration and demonstrate that it can be expanded to other financial products.
Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.