ترکیب عاملهای یادگیری تقویتی عمیق برای معامله سهام
خلاصه
این مقاله رویکردی برای معامله خودکار سهام توصیف میکند که سه الگوریتم یادگیری تقویتی کنشگر-منتقد را ترکیب میکند: بهینهسازی سیاست مجاور، کنشگر-منتقد مزیت و گرادیان سیاست قطعی عمیق. عاملها برای یادگیری تصمیمهای معاملاتی با هدف بیشینهسازی بازده سرمایهگذاری آموزش میبینند و تواناییهایشان در گروهی ترکیب میشود که قرار است با شرایط مختلف بازار سازگار شود. همچنین هنگام آموزش با کنشهای پیوسته از روش بارگذاری هنگام نیاز برای پردازش دادههای حجیم و محدودکردن مصرف حافظه استفاده میشود.
این رویکرد روی سهام نقدشونده از مجموعه داو جونز ارزیابی و با الگوریتمهای یادگیری منفرد، میانگین صنعتی داو جونز و یک سبد حداقلواریانس مقایسه میشود. نتیجه گزارششده این است که گروه ترکیبی نسبت شارپ بالاتری از روشهای منفرد و معیارهای مبنا به دست میآورد. متن دوره ارزیابی، محدودیتهای تفصیلی سبد، فرضهای هزینه تراکنش یا بررسیهای استحکام را مشخص نمیکند. بنابراین ادعای عملکرد باید در چارچوب تنظیمات آزمون بیانشده در پژوهش درک شود، نه بهعنوان شاهدی بر بازده آینده.
ایدههای کلیدی
- استراتژی عاملهای کنشگر-منتقد PPO، A2C و DDPG را در یک گروه ترکیب میکند.
- عاملها تصمیمهای معامله سهام را با هدف بازده سرمایهگذاری یاد میگیرند.
- برای کاهش نیاز حافظه هنگام آموزش، از پردازش داده با بارگذاری هنگام نیاز استفاده میشود.
- ارزیابی، گروه ترکیبی را با روشهای سازنده آن، یک شاخص بازار و یک سبد حداقلواریانس مقایسه میکند.
- گزارش شده است که گروه ترکیبی در این مقایسهها بالاترین نسبت شارپ را دارد؛ این نتیجه به تنظیمات آزمون پژوهش وابسته است.
برچسبها
متن کامل
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy
Stock trading strategies play a critical role in investment. However, it is challenging to design a profitable strategy in a complex and dynamic stock market. In this paper, we propose an ensemble strategy that employs deep reinforcement schemes to learn a stock trading strategy by maximizing investment return. We train a deep reinforcement learning agent and obtain an ensemble trading strategy using three actor-critic based algorithms: Proximal Policy Optimization (PPO), Advantage Actor Critic (A2C), and Deep Deterministic Policy Gradient (DDPG). The ensemble strategy inherits and integrates the best features of the three algorithms, thereby robustly adjusting to different market situations. In order to avoid the large memory consumption in training networks with continuous action space, we employ a load-on-demand technique for processing very large data. We test our algorithms on the 30 Dow Jones stocks that have adequate liquidity. The performance of the trading agent with different reinforcement learning algorithms is evaluated and compared with both the Dow Jones Industrial Average index and the traditional min-variance portfolio allocation strategy. The proposed deep ensemble strategy is shown to outperform the three individual algorithms and two baselines in terms of the risk-adjusted return measured by the Sharpe ratio. This work is fully open-sourced at \href{https://github.com/AI4Finance-Foundation/Deep-Reinforcement-Learning-for-Automated-Stock-Trading-Ensemble-Strategy-ICAIF-2020}{GitHub}.با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.