مواد پر جائیں
لائبریری کی تمام دستاویزات

اسٹاک ٹریڈنگ کے لیے ڈیپ ری انفورسمنٹ لرننگ ایجنٹس کا مجموعہ

مضمون arXiv papers · مصنف: Hongyang Yang et al.

خلاصہ

یہ مقالہ اسٹاک کی خودکار ٹریڈنگ کا ایک طریقہ بیان کرتا ہے جو ایکٹر کریٹک ری انفورسمنٹ لرننگ کے تین الگورتھم ملاتا ہے: پروگزمل پالیسی آپٹیمائزیشن، ایڈوانٹیج ایکٹر کریٹک اور ڈیپ ڈیٹرمنسٹک پالیسی گریڈینٹ۔ ایجنٹس کو سرمایہ کاری کے منافع زیادہ سے زیادہ کرنے کے مقصد سے ٹریڈنگ کے فیصلے سیکھنے کی تربیت دی جاتی ہے، اور ان کی قوتوں کو ایسے مجموعے میں یکجا کیا جاتا ہے جس کا مقصد مارکیٹ کے حالات کے مطابق ڈھلنا ہے۔ مسلسل ایکشنز کے ساتھ تربیت کے دوران میموری کا استعمال محدود رکھتے ہوئے بڑے ڈیٹا پر کارروائی کے لیے لوڈ آن ڈیمانڈ تکنیک بھی استعمال کی جاتی ہے۔

اس طریقے کا جائزہ Dow Jones کائنات کے زیادہ لیکویڈ اسٹاکس پر لیا گیا اور اس کا موازنہ الگ الگ لرننگ الگورتھمز، Dow Jones Industrial Average اور کم سے کم ویرینس والے پورٹ فولیو سے کیا گیا۔ رپورٹ شدہ نتیجہ یہ ہے کہ مجموعہ ان انفرادی طریقوں اور بنیادی موازنوں سے زیادہ شارپ تناسب حاصل کرتا ہے۔ اقتباس جائزے کا دورانیہ، پورٹ فولیو کی تفصیلی پابندیاں، ٹرانزیکشن لاگت کے مفروضے یا مضبوطی کی جانچ نہیں بتاتا۔ اس لیے کارکردگی کے دعوے کو مطالعے کے بیان کردہ ٹیسٹ سیٹ اپ کے اندر سمجھنا چاہیے، مستقبل کے منافع کے ثبوت کے طور پر نہیں۔

اہم خیالات

  • اسٹریٹیجی PPO، A2C اور DDPG ایکٹر کریٹک ایجنٹس کو ایک مجموعے میں ملاتی ہے۔
  • ایجنٹس سرمایہ کاری کے منافع کو مقصد بنا کر اسٹاک ٹریڈنگ کے فیصلے سیکھتے ہیں۔
  • تربیت کے دوران میموری کی ضرورت کم کرنے کے لیے لوڈ آن ڈیمانڈ ڈیٹا پروسیسنگ استعمال ہوتی ہے۔
  • جائزے میں مجموعے کا موازنہ اس کے اجزائی طریقوں، ایک مارکیٹ انڈیکس اور کم سے کم ویرینس والے پورٹ فولیو سے کیا گیا ہے۔
  • مطالعے کے ٹیسٹ سیٹ اپ کے تحت مجموعے کا شارپ تناسب ان موازنوں میں سب سے زیادہ رپورٹ ہوا ہے۔

ٹیگز

مکمل متن
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy


# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy









Stock trading strategies play a critical role in investment. However, it is challenging to design a profitable strategy in a complex and dynamic stock market. In this paper, we propose an ensemble strategy that employs deep reinforcement schemes to learn a stock trading strategy by maximizing investment return. We train a deep reinforcement learning agent and obtain an ensemble trading strategy using three actor-critic based algorithms: Proximal Policy Optimization (PPO), Advantage Actor Critic (A2C), and Deep Deterministic Policy Gradient (DDPG). The ensemble strategy inherits and integrates the best features of the three algorithms, thereby robustly adjusting to different market situations. In order to avoid the large memory consumption in training networks with continuous action space, we employ a load-on-demand technique for processing very large data. We test our algorithms on the 30 Dow Jones stocks that have adequate liquidity. The performance of the trading agent with different reinforcement learning algorithms is evaluated and compared with both the Dow Jones Industrial Average index and the traditional min-variance portfolio allocation strategy. The proposed deep ensemble strategy is shown to outperform the three individual algorithms and two baselines in terms of the risk-adjusted return measured by the Sharpe ratio. This work is fully open-sourced at \href{https://github.com/AI4Finance-Foundation/Deep-Reinforcement-Learning-for-Automated-Stock-Trading-Ensemble-Strategy-ICAIF-2020}{GitHub}.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔