فاریکس ٹریڈنگ میں تقویتی لرننگ کے لیے DQN اور PPO کا موازنہ
خلاصہ
یہ مطالعہ زرمبادلہ ٹریڈنگ میں ڈیپ ری انفورسمنٹ لرننگ لاگو کرتا ہے اور براہِ راست قیمت کی پیش گوئی پر انحصار کرنے کے بجائے ٹریڈ کے انتخاب کو فیصلوں کے سلسلے کے طور پر دیکھتا ہے۔ یہ سور فائر شماریاتی آربیٹریج پالیسی کو تین ممکنہ اقدامات میں ڈھالتا ہے اور قیمتوں کی مسلسل تاریخ کو گرامین اینگولر فیلڈ تصاویر میں تبدیل کرتا ہے۔ مصنفین چار گھنٹے کے وقفوں والے EUR/USD، GBP/USD اور AUD/USD ڈیٹا سے ڈیپ کیو لرننگ کا پروکسمل پالیسی آپٹیمائزیشن سے موازنہ کرتے ہیں۔
تربیت میں 1 اگست سے 30 نومبر 2018 تک کا ڈیٹا استعمال ہوتا ہے، جبکہ آزمائشی مدت دسمبر 2018 ہے۔ مصنفین ان ماڈلز کی سرمایہ کاری کی سازگار کارکردگی رپورٹ کرتے ہیں جو پیچیدہ، بے ترتیب مارکیٹ رویے اور ٹریڈنگ ماحول کی مناسب نمائندگی کرنے والی حالتوں کو ظاہر کر سکتے ہیں۔ فراہم کردہ بیان میں منافع کے اعداد، خطرے کے پیمانے، فیس کے مفروضے یا ماڈل کی تفصیلی ترتیبات نہیں، اس لیے یہاں نتائج کی قوت اور باہمی موازنے کا اندازہ نہیں لگایا جا سکتا۔ شواہد تین کرنسی جوڑوں پر مختصر تاریخی تقسیم کا امکان پذیری ٹیسٹ ہیں؛ ان سے یہ ثابت نہیں ہوتا کہ کوئی الگورتھم دوسرے ادوار یا لائیو اجرا میں قابلِ اعتماد کارکردگی دکھائے گا۔
اہم خیالات
- یہ طریقہ فاریکس ٹریڈنگ کو تقویتی لرننگ کے ذریعے سلسلہ وار فیصلہ سازی کا مسئلہ سمجھتا ہے۔
- موافقت شدہ شماریاتی آربیٹریج پالیسی میں ٹریڈنگ کے تین اقدامات متعین کیے گئے ہیں۔
- ماڈل کے اِن پٹ کے لیے قیمتوں کی مدتوں کو گرامین اینگولر فیلڈ تصاویر میں رمز بند کیا جاتا ہے۔
- تین کرنسی جوڑوں پر ڈیپ کیو لرننگ اور پروکسمل پالیسی آپٹیمائزیشن کا موازنہ کیا گیا ہے۔
- مختصر تاریخی جائزے میں سازگار کارکردگی رپورٹ ہوئی، مگر تفصیلی پیمانے اور ٹریڈنگ لاگت کے مفروضے موجود نہیں۔
ٹیگز
مکمل متن
# Deep Reinforcement Learning for Foreign Exchange Trading # Deep Reinforcement Learning for Foreign Exchange Trading Reinforcement learning can interact with the environment and is suitable for applications in decision control systems. Therefore, we used the reinforcement learning method to establish a foreign exchange transaction, avoiding the long-standing problem of unstable trends in deep learning predictions. In the system design, we optimized the Sure-Fire statistical arbitrage policy, set three different actions, encoded the continuous price over a period of time into a heat-map view of the Gramian Angular Field (GAF) and compared the Deep Q Learning (DQN) and Proximal Policy Optimization (PPO) algorithms. To test feasibility, we analyzed three currency pairs, namely EUR/USD, GBP/USD, and AUD/USD. We trained the data in units of four hours from 1 August 2018 to 30 November 2018 and tested model performance using data between 1 December 2018 and 31 December 2018. The test results of the various models indicated that favorable investment performance was achieved as long as the model was able to handle complex and random processes and the state was able to describe the environment, validating the feasibility of reinforcement learning in the development of trading strategies.
ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0
یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔