پورٹ فولیو کی بہتری کے لیے ڈیپ ڈیٹرمنسٹک پالیسی گریڈینٹ
خلاصہ
یہ کام جانچتا ہے کہ کیا ڈیپ ری اِنفورسمنٹ لرننگ ایسے ماحول میں بہترین ٹریڈنگ اسٹریٹیجیز اخذ کر سکتی ہے جنہیں بیان کرنا آسان مگر ریاضیاتی طور پر مشکل ہو۔ مصنفین ڈیپ ڈیٹرمنسٹک پالیسی گریڈینٹ پر توجہ دیتے ہیں، جو ماحول کے ساتھ تعامل کے ذریعے اعمال چننے کی پالیسی سیکھنے کا طریقہ ہے۔ وہ ایسے حالات منتخب کرتے ہیں جہاں بہترین اسٹریٹیجی، یا اس کا قریب ترین اندازہ، پہلے سے معلوم ہو؛ یوں سیکھی ہوئی حکمتِ عملی اور انعام کا حوالہ جاتی حل سے تقابل ممکن ہوتا ہے۔
رپورٹ کردہ نتیجے کے مطابق ایجنٹ معلوم اسٹریٹیجیز کی بنیادی خصوصیات اخذ کرتا اور تقریباً بہترین انعام حاصل کرتا ہے۔ اس سے ثبوت ملتا ہے کہ آزمائے گئے ماحول میں الگورتھم حل کنندہ کے طور پر کام کر سکتا ہے۔ اقتباس مخصوص مارکیٹ ماڈلز، پورٹ فولیو کی پابندیوں، تربیتی طریقہ کار یا جانچ کے پیمانوں کی شناخت نہیں کرتا۔ لہٰذا نتیجہ منتخب کنٹرول شدہ حالات تک محدود ہے اور شور والی لائیو مارکیٹوں، ٹرانزیکشن لاگت کے ساتھ، یا جہاں بہترین پالیسی نامعلوم ہو، کارکردگی ثابت نہیں کرتا۔
اہم خیالات
- مطالعہ ڈیپ ری اِنفورسمنٹ لرننگ کو ٹریڈنگ اسٹریٹیجیز حل کرنے والے طریقے کے طور پر جانچتا ہے۔
- اس میں ریاضیاتی طور پر مشکل مگر تصوراتی طور پر سادہ ماحول میں ڈیپ ڈیٹرمنسٹک پالیسی گریڈینٹ استعمال کیا گیا ہے۔
- جانچ کے ماحول میں تقابل کے لیے بہترین اسٹریٹیجیز معلوم یا تقریباً معلوم ہیں۔
- رپورٹ کردہ ایجنٹ اسٹریٹیجی کی اہم خصوصیات اخذ کرتا اور تقریباً بہترین انعام حاصل کرتا ہے۔
- اقتباس لائیو مارکیٹ کی رکاوٹوں یا نامعلوم بہترین پالیسیوں میں کارکردگی ثابت نہیں کرتا۔
ٹیگز
مکمل متن
# Deep Deterministic Portfolio Optimization # Deep Deterministic Portfolio Optimization Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.
ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0
یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔