معامله بیتکوین با مدلهای قیمت LSTM و PPO
خلاصه
این پژوهش چارچوب خودکار معاملات پُربسامد بیتکوین را پیشنهاد میکند که مدل قیمت حافظه کوتاهمدت و بلندمدت (LSTM) را با بهینهسازی سیاست مجاورتی (PPO) ترکیب میکند. قیمتها را حالتهای عامل، معاملات را کنشها و بازده معاملات را پاداشها در نظر میگیرد. برای مؤلفه پیشبینی قیمت، ماشینهای بردار پشتیبان، پرسپترونهای چندلایه، LSTMها، شبکههای کانولوشنی زمانی و ترنسفورمرها مقایسه میشوند؛ آزمایشهای گزارششده LSTM را ترجیح میدهند.
نویسندگان استراتژی PPO حاصل را در محیطی شبیهسازیشده با دادههای همزمان ارزیابی میکنند و آن را با معیارهای رایج استراتژی برای یک دارایی مقایسه میکنند. آنها بازده بیشتر از قویترین معیار مقایسه را گزارش میکنند و از عملکرد مثبت در دورههای پرنوسان و صعودی میگویند. این نتایج به شرایط بیتکوین و شبیهسازی همین پژوهش محدودند؛ گزیده مقاله هزینههای تراکنش، اثر بازار، طراحی نمونه یا استحکام خارج از نمونه را مشخص نمیکند. بنابراین، ادعاهای مقاله نشان نمیدهند که این رویکرد به معامله زنده یا محصولات دیگر منتقل میشود.
ایدههای کلیدی
- این چارچوب با استفاده از PPO از حالتهای قیمت برای ایجاد معاملات بیتکوین و از بازده معاملات بهعنوان پاداش استفاده میکند.
- LSTM پس از مقایسه با چند روش پیشبینی دیگر، مبنای مدل قیمتِ سیاست را فراهم میکند.
- این پژوهش استراتژی را در محیطی شبیهسازیشده و با دادههای همزمان ارزیابی میکند.
- مقایسههای گزارششده با معیارها نشان میدهند که روش پیشنهادی در آزمونهای تکدارایی عملکرد بهتری دارد.
- گزیده مقاله هزینههای معامله یا شواهدی از استحکام در بازار زنده را شرح نمیدهد.
برچسبها
متن کامل
# Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning # Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning The emerging cryptocurrency market has lately received great attention for asset allocation due to its decentralization uniqueness. However, its volatility and brand new trading mode have made it challenging to devising an acceptable automatically-generating strategy. This study proposes a framework for automatic high-frequency bitcoin transactions based on a deep reinforcement learning algorithm-proximal policy optimization (PPO). The framework creatively regards the transaction process as actions, returns as awards and prices as states to align with the idea of reinforcement learning. It compares advanced machine learning-based models for static price predictions including support vector machine (SVM), multi-layer perceptron (MLP), long short-term memory (LSTM), temporal convolutional network (TCN), and Transformer by applying them to the real-time bitcoin price and the experimental results demonstrate that LSTM outperforms. Then an automatically-generating transaction strategy is constructed building on PPO with LSTM as the basis to construct the policy. Extensive empirical studies validate that the proposed method performs superiorly to various common trading strategy benchmarks for a single financial product. The approach is able to trade bitcoins in a simulated environment with synchronous data and obtains a 31.67% more return than that of the best benchmark, improving the benchmark by 12.75%. The proposed framework can earn excess returns through both the period of volatility and surge, which opens the door to research on building a single cryptocurrency trading strategy based on deep learning. Visualizations of trading the process show how the model handles high-frequency transactions to provide inspiration and demonstrate that it can be expanded to other financial products.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.