یادگیری تقویتی عمیق برای تخصیص سبد رمزارز
خلاصه
این مقاله شبکه عصبی کانولوشنیِ بدون مدل را توصیف میکند که قیمتهای تاریخی مجموعهای از داراییها را دریافت میکند و وزنهای سبد را خروجی میدهد. شبکه با یادگیری تقویتی آموزش میبیند و بازده تجمعی نقش پاداش را دارد. داده آموزشی شامل قیمتهای رمزارز از یک صرافی در بازه 0.7 سال است و فاصله زمانی معاملاتیِ توصیفشده 30 دقیقه است.
بکتستها در همان بازار، بازدهی دهبرابری را طی دورهای بهمدت 1.8 ماه گزارش میکنند و نتایج با چند استراتژی انتخاب سبد که اخیراً منتشر شدهاند مقایسه میشوند. گزیده نام صرافی، داراییها، جزئیات معیارهای مرجع، هزینههای معاملاتی یا مستقلبودن دادههای ارزیابی از دادههای آموزش را مشخص نمیکند. سابقه آموزشی کوتاه و آزمون در همان بازار، استنباط درباره استحکام یا انتقال به بازارهای دیگر را محدود میکند؛ نتایج توصیفشده از ادعای کاربرد روش در بازارهای دیگر پشتیبانی نمیکنند.
ایدههای کلیدی
- یک شبکه عصبی کانولوشنی قیمتهای تاریخی داراییها را به وزنهای سبد تبدیل میکند.
- مدل با یادگیری تقویتی و برای بیشینهکردن بازده تجمعی آموزش داده میشود.
- نمونه آموزشی گزارششده، 0.7 سال داده قیمت رمزارز را در بر میگیرد.
- بکتستها از دورههای معاملاتی 30 دقیقهای در همان بازار استفاده میکنند و بازدهی دهبرابری را طی 1.8 ماه گزارش میدهند.
- گزیده، استحکام خارج از نمونه یا عملکرد در بازارهای دیگر را اثبات نمیکند.
برچسبها
متن کامل
# Cryptocurrency Portfolio Management with Deep Reinforcement Learning # Cryptocurrency Portfolio Management with Deep Reinforcement Learning Portfolio management is the decision-making process of allocating an amount of fund into different financial investment products. Cryptocurrencies are electronic and decentralized alternatives to government-issued money, with Bitcoin as the best-known example of a cryptocurrency. This paper presents a model-less convolutional neural network with historic prices of a set of financial assets as its input, outputting portfolio weights of the set. The network is trained with 0.7 years' price data from a cryptocurrency exchange. The training is done in a reinforcement manner, maximizing the accumulative return, which is regarded as the reward function of the network. Backtest trading experiments with trading period of 30 minutes is conducted in the same market, achieving 10-fold returns in 1.8 months' periods. Some recently published portfolio selection strategies are also used to perform the same back-tests, whose results are compared with the neural network. The network is not limited to cryptocurrency, but can be applied to any other financial markets.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.