قیاسی ٹریڈنگ اور پیئرز ٹریڈنگ کے لیے اکتشافی ری انفورسمنٹ لرننگ
خلاصہ
یہ مطالعہ قیاسی ٹریڈنگ کو یکے بعد دیگرے بہترین اسٹاپنگ مسئلے کے طور پر بیان کرتا ہے، جس میں عمومی افادیتی افعال اور قیمتوں کے عمل کے تحت داخلے اور اخراج کے اوقات منتخب کیے جاتے ہیں۔ پہلے اسٹاپنگ مسئلے کو نرم کیا جاتا ہے: داخلے اور اخراج کے واقعات کو کاکس عمل کی چھلانگوں سے ظاہر کیا جاتا ہے، جن کی محدود شدت پر قابو ایجنٹ منتخب کرتا ہے۔
اکتشافی ری انفورسمنٹ لرننگ کی تشکیل میں بے ترتیب پالیسیاں ان شدتوں پر امکانی تقسیم قائم کرتی ہیں، اور شینن تفریقی اینٹروپی مقصد کو ریگولرائز کرتی ہے۔ اس سے حاصل ہونے والی اکتشافی ہیملٹن-جیکوبی-بیل مین مساواتیں گِبس شکل میں بہترین پالیسیاں دیتی ہیں۔ مصنفین خطا کے تخمینے قائم کرتے ہیں اور ثابت کرتے ہیں کہ سیکھنے کا مقصد اصل مسئلے کے قدر کے فنکشن کی طرف مقارب ہوتا ہے، پھر پیئرز ٹریڈنگ کی ایک مثال میں الگورتھم دکھاتے ہیں۔ فراہم کردہ بیان میں اس مثال کے ڈیٹا یا کارکردگی کے نتائج نہیں، اور بیان کردہ تقارب ماڈل کردہ مقصد سے متعلق ہے، ثابت شدہ لائیو ٹریڈنگ نتیجے سے نہیں۔
اہم خیالات
- قیاسی ٹریڈنگ کو داخلے اور اخراج کے اوقات پر بہترین اسٹاپنگ مسئلے کے طور پر ماڈل کیا گیا ہے۔
- نرم تشکیل میں اسٹاپنگ واقعات کو محدود شدت سے قابو کردہ کاکس عمل کی چھلانگوں سے ظاہر کیا گیا ہے۔
- بے ترتیب شدت والی پالیسیوں کو شینن تفریقی اینٹروپی سے ریگولرائز کیا جاتا ہے۔
- فریم ورک تحقیقی HJB مساواتیں اور گِبس شکل کی بہترین پالیسیاں اخذ کرتا ہے۔
- کام خطا کے تخمینے اور تقارب کے نتائج قائم کرتا ہے اور پیئرز ٹریڈنگ کے لیے ایک الگورتھم دکھاتا ہے۔
ٹیگز
مکمل متن
# Reinforcement Learning for Speculative Trading under Exploratory Framework # Reinforcement Learning for Speculative Trading under Exploratory Framework We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.
ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0
یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔