مواد پر جائیں
لائبریری کی تمام دستاویزات

پورٹ فولیو اسٹریٹیجیز کے لیے مضبوط، خطرے سے آگاہ ری انفورسمنٹ لرننگ

مضمون arXiv papers · مصنف: Sebastian Jaimungal et al.

خلاصہ

یہ کام خطرے سے آگاہ کارکردگی کے معیار کے تحت پالیسیوں کو بہتر بنانے کے لیے ری انفورسمنٹ لرننگ کا طریقہ تیار کرتا ہے۔ یہ پالیسیوں کا جائزہ درجہ بندی پر منحصر متوقع افادیت سے لیتا ہے، جس سے ایجنٹ منافع اور منفی نتائج کے بارے میں مختلف ترجیحات ظاہر کر سکتا ہے۔ ماڈل کی غیر یقینی سے نمٹنے کے لیے پالیسی کو ماڈل کردہ تقسیم کے گرد Wasserstein فاصلے کے دائرے میں بدترین ممکنہ منافع تقسیم کے تحت جانچا جاتا ہے۔ اس سے فیصلہ سازی کا درجہ دار مسئلہ بنتا ہے: ایجنٹ پالیسی منتخب کرتا ہے، پھر مخالف قریب کی ایسی تقسیم منتخب کرتا ہے جو اس کی کارکردگی گھٹائے۔

مصنفین پالیسی کے انتخاب اور مخالفانہ تقسیم کے مسائل، دونوں کے لیے پالیسی گریڈینٹ فارمولے اخذ کرتے ہیں۔ وہ اس طریقے کا مظاہرہ مضبوط پورٹ فولیو تخصیص، معیار کی اصلاح اور شماریاتی آربیٹریج پر کرتے ہیں۔ یہ اطلاقات فریم ورک کا مطلوبہ دائرہ دکھاتے ہیں، مگر دستاویز تقابلی کارکردگی کے اعداد، مارکیٹ ڈیٹا کی تفصیل یا عملی نفاذ کی رہنمائی نہیں دیتی۔ اس لیے مخصوص ٹریڈنگ ماحول میں اس کی افادیت ماڈل، غیر یقینی کے مجموعے اور خطرے کی ترجیحات کی مزید توثیق پر منحصر ہے۔

اہم خیالات

  • درجہ بندی پر منحصر متوقع افادیت پالیسیوں کو منافع اور منفی خطرے کے درمیان مختلف توازن ظاہر کرنے دیتی ہے۔
  • فریم ورک ہر پالیسی کو Wasserstein ہمسائیگی کے اندر بدترین ممکنہ تقسیم کے مقابل جانچتا ہے۔
  • اندرونی مخالفانہ مسئلہ ایسی تقسیم تلاش کرتا ہے جو منتخب پالیسی کی کارکردگی گھٹائے۔
  • مصنفین پالیسی کی اصلاح اور مخالفانہ مسئلے، دونوں کے لیے پالیسی گریڈینٹس اخذ کرتے ہیں۔
  • مظاہروں میں پورٹ فولیو تخصیص، معیار کی اصلاح اور شماریاتی آربیٹریج شامل ہیں۔

ٹیگز

مکمل متن
# Robust Risk-Aware Reinforcement Learning


# Robust Risk-Aware Reinforcement Learning









We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔