رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی عمیق برای تخصیص سبد رمزارز

مقاله arXiv papers · نویسنده: Zhengyao Jiang et al.

خلاصه

این مقاله شبکه عصبی کانولوشنیِ بدون مدل را توصیف می‌کند که قیمت‌های تاریخی مجموعه‌ای از دارایی‌ها را دریافت می‌کند و وزن‌های سبد را خروجی می‌دهد. شبکه با یادگیری تقویتی آموزش می‌بیند و بازده تجمعی نقش پاداش را دارد. داده آموزشی شامل قیمت‌های رمزارز از یک صرافی در بازه 0.7 سال است و فاصله زمانی معاملاتیِ توصیف‌شده 30 دقیقه است.

بک‌تست‌ها در همان بازار، بازدهی ده‌برابری را طی دوره‌ای به‌مدت 1.8 ماه گزارش می‌کنند و نتایج با چند استراتژی انتخاب سبد که اخیراً منتشر شده‌اند مقایسه می‌شوند. گزیده نام صرافی، دارایی‌ها، جزئیات معیارهای مرجع، هزینه‌های معاملاتی یا مستقل‌بودن داده‌های ارزیابی از داده‌های آموزش را مشخص نمی‌کند. سابقه آموزشی کوتاه و آزمون در همان بازار، استنباط درباره استحکام یا انتقال به بازارهای دیگر را محدود می‌کند؛ نتایج توصیف‌شده از ادعای کاربرد روش در بازارهای دیگر پشتیبانی نمی‌کنند.

ایده‌های کلیدی

  • یک شبکه عصبی کانولوشنی قیمت‌های تاریخی دارایی‌ها را به وزن‌های سبد تبدیل می‌کند.
  • مدل با یادگیری تقویتی و برای بیشینه‌کردن بازده تجمعی آموزش داده می‌شود.
  • نمونه آموزشی گزارش‌شده، 0.7 سال داده قیمت رمزارز را در بر می‌گیرد.
  • بک‌تست‌ها از دوره‌های معاملاتی 30 دقیقه‌ای در همان بازار استفاده می‌کنند و بازدهی ده‌برابری را طی 1.8 ماه گزارش می‌دهند.
  • گزیده، استحکام خارج از نمونه یا عملکرد در بازارهای دیگر را اثبات نمی‌کند.

برچسب‌ها

متن کامل
# Cryptocurrency Portfolio Management with Deep Reinforcement Learning


# Cryptocurrency Portfolio Management with Deep Reinforcement Learning









Portfolio management is the decision-making process of allocating an amount of fund into different financial investment products. Cryptocurrencies are electronic and decentralized alternatives to government-issued money, with Bitcoin as the best-known example of a cryptocurrency. This paper presents a model-less convolutional neural network with historic prices of a set of financial assets as its input, outputting portfolio weights of the set. The network is trained with 0.7 years' price data from a cryptocurrency exchange. The training is done in a reinforcement manner, maximizing the accumulative return, which is regarded as the reward function of the network. Backtest trading experiments with trading period of 30 minutes is conducted in the same market, achieving 10-fold returns in 1.8 months' periods. Some recently published portfolio selection strategies are also used to perform the same back-tests, whose results are compared with the neural network. The network is not limited to cryptocurrency, but can be applied to any other financial markets.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.