رفتن به محتوا
همه اسناد کتابخانه

معامله بیت‌کوین با مدل‌های قیمت LSTM و PPO

مقاله arXiv papers · نویسنده: Fengrui Liu et al.

خلاصه

این پژوهش چارچوب خودکار معاملات پُربسامد بیت‌کوین را پیشنهاد می‌کند که مدل قیمت حافظه کوتاه‌مدت و بلندمدت (LSTM) را با بهینه‌سازی سیاست مجاورتی (PPO) ترکیب می‌کند. قیمت‌ها را حالت‌های عامل، معاملات را کنش‌ها و بازده معاملات را پاداش‌ها در نظر می‌گیرد. برای مؤلفه پیش‌بینی قیمت، ماشین‌های بردار پشتیبان، پرسپترون‌های چندلایه، LSTMها، شبکه‌های کانولوشنی زمانی و ترنسفورمرها مقایسه می‌شوند؛ آزمایش‌های گزارش‌شده LSTM را ترجیح می‌دهند.

نویسندگان استراتژی PPO حاصل را در محیطی شبیه‌سازی‌شده با داده‌های هم‌زمان ارزیابی می‌کنند و آن را با معیارهای رایج استراتژی برای یک دارایی مقایسه می‌کنند. آن‌ها بازده بیشتر از قوی‌ترین معیار مقایسه را گزارش می‌کنند و از عملکرد مثبت در دوره‌های پرنوسان و صعودی می‌گویند. این نتایج به شرایط بیت‌کوین و شبیه‌سازی همین پژوهش محدودند؛ گزیده مقاله هزینه‌های تراکنش، اثر بازار، طراحی نمونه یا استحکام خارج از نمونه را مشخص نمی‌کند. بنابراین، ادعاهای مقاله نشان نمی‌دهند که این رویکرد به معامله زنده یا محصولات دیگر منتقل می‌شود.

ایده‌های کلیدی

  • این چارچوب با استفاده از PPO از حالت‌های قیمت برای ایجاد معاملات بیت‌کوین و از بازده معاملات به‌عنوان پاداش استفاده می‌کند.
  • LSTM پس از مقایسه با چند روش پیش‌بینی دیگر، مبنای مدل قیمتِ سیاست را فراهم می‌کند.
  • این پژوهش استراتژی را در محیطی شبیه‌سازی‌شده و با داده‌های هم‌زمان ارزیابی می‌کند.
  • مقایسه‌های گزارش‌شده با معیارها نشان می‌دهند که روش پیشنهادی در آزمون‌های تک‌دارایی عملکرد بهتری دارد.
  • گزیده مقاله هزینه‌های معامله یا شواهدی از استحکام در بازار زنده را شرح نمی‌دهد.

برچسب‌ها

متن کامل
# Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning


# Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning









The emerging cryptocurrency market has lately received great attention for asset allocation due to its decentralization uniqueness. However, its volatility and brand new trading mode have made it challenging to devising an acceptable automatically-generating strategy. This study proposes a framework for automatic high-frequency bitcoin transactions based on a deep reinforcement learning algorithm-proximal policy optimization (PPO). The framework creatively regards the transaction process as actions, returns as awards and prices as states to align with the idea of reinforcement learning. It compares advanced machine learning-based models for static price predictions including support vector machine (SVM), multi-layer perceptron (MLP), long short-term memory (LSTM), temporal convolutional network (TCN), and Transformer by applying them to the real-time bitcoin price and the experimental results demonstrate that LSTM outperforms. Then an automatically-generating transaction strategy is constructed building on PPO with LSTM as the basis to construct the policy. Extensive empirical studies validate that the proposed method performs superiorly to various common trading strategy benchmarks for a single financial product. The approach is able to trade bitcoins in a simulated environment with synchronous data and obtains a 31.67% more return than that of the best benchmark, improving the benchmark by 12.75%. The proposed framework can earn excess returns through both the period of volatility and surge, which opens the door to research on building a single cryptocurrency trading strategy based on deep learning. Visualizations of trading the process show how the model handles high-frequency transactions to provide inspiration and demonstrate that it can be expanded to other financial products.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.