TD3 با کنش پیوسته برای معامله سهام و بیتکوین
خلاصه
این پژوهش گرادیان سیاست قطعی عمیق با تأخیر دوقلو (TD3)، روشی از یادگیری تقویتی با کنش پیوسته، را روی قیمتهای پایانی روزانه سهام آمازون و بیتکوین به کار میگیرد. کنش معاملاتی هم موقعیت انتخابی و هم تعداد سهام مورد معامله را مشخص میکند و رویکردهای مبتنی بر کنشهای گسسته را گسترش میدهد. مقاله راهبردهای حاصل را با روشهای تحلیل تکنیکال، رویکردهای دیگر یادگیری تقویتی و راهبردهای تصادفی و قطعی مقایسه میکند.
عملکرد با استفاده از بازده و نسبت شارپ ارزیابی میشود. نتایج گزارششده نشان میدهند که انتخاب همزمان موقعیت و اندازه معامله میتواند عملکرد را بر اساس این معیارها بهبود دهد. سند جزئیات ارزیابی، نتایج مشخص یا شواهدی درباره استحکام در داراییها یا دورههای دیگر بازار ارائه نمیکند. بنابراین، نتیجهگیریها بازارها و روشهای مقایسهشده را توصیف میکنند و ثابت نمیکنند که TD3 با کنش پیوسته در شرایط دیگر عملکرد بهتری خواهد داشت.
ایدههای کلیدی
- از TD3 برای تولید کنشهای معاملاتی بر اساس قیمتهای پایانی روزانه آمازون و بیتکوین استفاده میشود.
- فضای کنش هم موقعیت معاملاتی و هم تعداد سهام معاملهشده را نشان میدهد.
- این پژوهش TD3 را با راهبردهای تحلیل تکنیکال، یادگیری تقویتی، تصادفی و قطعی مقایسه میکند.
- بازده و نسبت شارپ معیارهای عملکرد ذکرشده هستند.
- مقایسه گزارششده در شرایط آزمودهشده پژوهش، ترکیب انتخاب موقعیت با تعیین اندازه معامله را ترجیح میدهد.
برچسبها
متن کامل
# Algorithmic Trading Using Continuous Action Space Deep Reinforcement Learning # Algorithmic Trading Using Continuous Action Space Deep Reinforcement Learning Price movement prediction has always been one of the traders' concerns in financial market trading. In order to increase their profit, they can analyze the historical data and predict the price movement. The large size of the data and complex relations between them lead us to use algorithmic trading and artificial intelligence. This paper aims to offer an approach using Twin-Delayed DDPG (TD3) and the daily close price in order to achieve a trading strategy in the stock and cryptocurrency markets. Unlike previous studies using a discrete action space reinforcement learning algorithm, the TD3 is continuous, offering both position and the number of trading shares. Both the stock (Amazon) and cryptocurrency (Bitcoin) markets are addressed in this research to evaluate the performance of the proposed algorithm. The achieved strategy using the TD3 is compared with some algorithms using technical analysis, reinforcement learning, stochastic, and deterministic strategies through two standard metrics, Return and Sharpe ratio. The results indicate that employing both position and the number of trading shares can improve the performance of a trading system based on the mentioned metrics.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.