رفتن به محتوا
همه اسناد کتابخانه

ترکیب عامل‌های یادگیری تقویتی عمیق برای معامله سهام

مقاله arXiv papers · نویسنده: Hongyang Yang et al.

خلاصه

این مقاله رویکردی برای معامله خودکار سهام توصیف می‌کند که سه الگوریتم یادگیری تقویتی کنشگر-منتقد را ترکیب می‌کند: بهینه‌سازی سیاست مجاور، کنشگر-منتقد مزیت و گرادیان سیاست قطعی عمیق. عامل‌ها برای یادگیری تصمیم‌های معاملاتی با هدف بیشینه‌سازی بازده سرمایه‌گذاری آموزش می‌بینند و توانایی‌هایشان در گروهی ترکیب می‌شود که قرار است با شرایط مختلف بازار سازگار شود. همچنین هنگام آموزش با کنش‌های پیوسته از روش بارگذاری هنگام نیاز برای پردازش داده‌های حجیم و محدودکردن مصرف حافظه استفاده می‌شود.

این رویکرد روی سهام نقدشونده از مجموعه داو جونز ارزیابی و با الگوریتم‌های یادگیری منفرد، میانگین صنعتی داو جونز و یک سبد حداقل‌واریانس مقایسه می‌شود. نتیجه گزارش‌شده این است که گروه ترکیبی نسبت شارپ بالاتری از روش‌های منفرد و معیارهای مبنا به دست می‌آورد. متن دوره ارزیابی، محدودیت‌های تفصیلی سبد، فرض‌های هزینه تراکنش یا بررسی‌های استحکام را مشخص نمی‌کند. بنابراین ادعای عملکرد باید در چارچوب تنظیمات آزمون بیان‌شده در پژوهش درک شود، نه به‌عنوان شاهدی بر بازده آینده.

ایده‌های کلیدی

  • استراتژی عامل‌های کنشگر-منتقد PPO، A2C و DDPG را در یک گروه ترکیب می‌کند.
  • عامل‌ها تصمیم‌های معامله سهام را با هدف بازده سرمایه‌گذاری یاد می‌گیرند.
  • برای کاهش نیاز حافظه هنگام آموزش، از پردازش داده با بارگذاری هنگام نیاز استفاده می‌شود.
  • ارزیابی، گروه ترکیبی را با روش‌های سازنده آن، یک شاخص بازار و یک سبد حداقل‌واریانس مقایسه می‌کند.
  • گزارش شده است که گروه ترکیبی در این مقایسه‌ها بالاترین نسبت شارپ را دارد؛ این نتیجه به تنظیمات آزمون پژوهش وابسته است.

برچسب‌ها

متن کامل
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy


# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy









Stock trading strategies play a critical role in investment. However, it is challenging to design a profitable strategy in a complex and dynamic stock market. In this paper, we propose an ensemble strategy that employs deep reinforcement schemes to learn a stock trading strategy by maximizing investment return. We train a deep reinforcement learning agent and obtain an ensemble trading strategy using three actor-critic based algorithms: Proximal Policy Optimization (PPO), Advantage Actor Critic (A2C), and Deep Deterministic Policy Gradient (DDPG). The ensemble strategy inherits and integrates the best features of the three algorithms, thereby robustly adjusting to different market situations. In order to avoid the large memory consumption in training networks with continuous action space, we employ a load-on-demand technique for processing very large data. We test our algorithms on the 30 Dow Jones stocks that have adequate liquidity. The performance of the trading agent with different reinforcement learning algorithms is evaluated and compared with both the Dow Jones Industrial Average index and the traditional min-variance portfolio allocation strategy. The proposed deep ensemble strategy is shown to outperform the three individual algorithms and two baselines in terms of the risk-adjusted return measured by the Sharpe ratio. This work is fully open-sourced at \href{https://github.com/AI4Finance-Foundation/Deep-Reinforcement-Learning-for-Automated-Stock-Trading-Ensemble-Strategy-ICAIF-2020}{GitHub}.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.