پوشیدہ عوامل والے کنٹرول میں ٹسالس اینٹروپی کے ذریعے ایکسپلوریشن
خلاصہ
یہ کام ایسے ماڈل میں بہترین کنٹرول کا مطالعہ کرتا ہے جس میں پوشیدہ عوامل ہوں اور فیصلہ کرنے والا براہِ راست ایک ایکشن منتخب کرنے کے بجائے ایکشنز کی تقسیم منتخب کرے۔ یہ مجرد اور مسلسل وقت دونوں میں حالت کی جگہ کو کھوجنے کے انعام کے طور پر ٹسالس اینٹروپی متعارف کرتا ہے۔ مصنفین q-گاؤسیئن صورت والی بہترین حالت کی تقسیم اخذ کرتے اور متعلقہ صورتوں میں فارورڈ-بیک ورڈ مساوات کے ذریعے اس کا مقام متعین کرتے ہیں۔
مقالہ یہ بھی جانچتا ہے کہ ایکسپلوریشن کے نتیجے میں ملنے والے حل معیاری ڈائنامک بہترین کنٹرول سے کیسے جڑتے ہیں۔ ماڈل سے غیر وابستہ طریقے کے لیے یہ soft Q-learning کے عمومی خیال کی پیروی کرتی بہترین پالیسی تیار کرتا ہے۔ اس طریقے کو زیادہ مضبوط شماریاتی آربیٹریج اسٹریٹیجیز بنانے کے لیے ممکنہ طور پر مفید بتایا گیا ہے، نہ کہ اس ثبوت کے طور پر کہ کسی خاص ٹریڈنگ نظام کو آزمایا یا بہتر کیا گیا ہے۔ فراہم کردہ وضاحت نظریاتی نتائج اور اطلاق کی سمت دیتی ہے، مگر مارکیٹ ڈیٹا، ٹریڈنگ کارکردگی یا عملی نفاذ کی تفصیلات نہیں۔ ٹریڈنگ سے اس کی مطابقت اس بات پر منحصر ہے کہ کنٹرول فریم ورک کو اسٹریٹیجی میں کیسے ڈھالا اور تجرباتی طور پر کیسے جانچا جاتا ہے۔
اہم خیالات
- یہ فریم ورک پوشیدہ عوامل والے ماڈلز میں ایکشنز کی تقسیم کو کنٹرول کرتا ہے۔
- ٹسالس اینٹروپی مجرد اور مسلسل وقت میں حالت کی جگہ کی کھوج کا انعام دیتی ہے۔
- اخذ کردہ بہترین حالت کی تقسیم q-گاؤسیئن صورت رکھتی ہے۔
- تجزیہ ایکسپلوریشن سے باخبر حلوں کو معیاری ڈائنامک بہترین کنٹرول سے جوڑتا ہے۔
- soft Q-learning کے مطابق ماڈل سے غیر وابستہ پالیسی تیار کی گئی ہے اور یہ شماریاتی آربیٹریج تحقیق کے لیے رہنمائی دے سکتی ہے۔
ٹیگز
مکمل متن
# Exploratory Control with Tsallis Entropy for Latent Factor Models # Exploratory Control with Tsallis Entropy for Latent Factor Models We study optimal control in models with latent factors where the agent controls the distribution over actions, rather than actions themselves, in both discrete and continuous time. To encourage exploration of the state space, we reward exploration with Tsallis Entropy and derive the optimal distribution over states - which we prove is $q$-Gaussian distributed with location characterized through the solution of an FBS$Δ$E and FBSDE in discrete and continuous time, respectively. We discuss the relation between the solutions of the optimal exploration problems and the standard dynamic optimal control solution. Finally, we develop the optimal policy in a model-agnostic setting along the lines of soft $Q$-learning. The approach may be applied in, e.g., developing more robust statistical arbitrage trading strategies.
ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0
یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔