مواد پر جائیں
لائبریری کی تمام دستاویزات

متحرک محدب خطرے کے پیمانوں کے ساتھ پالیسی گریڈینٹ ری انفورسمنٹ لرننگ

مضمون arXiv papers · مصنف: Anthony Coache et al.

خلاصہ

یہ دستاویز اس وقت سلسلہ وار بہتری کے لیے ماڈل سے آزاد ری انفورسمنٹ لرننگ طریقہ پیش کرتی ہے جب نتائج کا جائزہ متحرک محدب خطرے کے پیمانوں سے لیا جائے۔ یہ پالیسیوں کی قدر جانچنے کے لیے وقت سے ہم آہنگ متحرک پروگرامنگ اصول استعمال کرتی اور بہتر پالیسیاں تلاش کرنے کے لیے پالیسی گریڈینٹ اپ ڈیٹس اخذ کرتی ہے۔ ان پالیسیوں کو بہتر بنانے کے لیے نیورل نیٹ ورکس پر مبنی ایکٹر-کریٹک طریقہ تجویز کیا گیا ہے۔

اس طریقے کا مظاہرہ تین کاموں پر کیا گیا ہے: شماریاتی آربیٹریج ٹریڈنگ، مالیاتی ہیجنگ اور روبوٹ کے لیے رکاوٹوں سے بچنے کا کنٹرول۔ اس سے ثابت ہوتا ہے کہ فریم ورک مالی اور غیر مالی دونوں طرح کے حالات میں لاگو کیا گیا ہے، مگر بیان میں کارکردگی کے اعداد، تقابلی طریقے، مارکیٹ مفروضے یا نفاذ کی تفصیلات نہیں۔ لہٰذا یہ بہتری کے ڈھانچے اور استعمال کے دائرے کی وضاحت کرتا ہے، جبکہ ٹریڈنگ کی مؤثریت اور عملی حدود کے ثبوت غیر متعین رہتے ہیں۔

اہم خیالات

  • متحرک محدب خطرے کے پیمانے غیر یقینی نتائج کے سلسلوں کا جائزہ لینے کا طریقہ فراہم کرتے ہیں۔
  • امیدوار پالیسیوں کی قدر جانچنے کے لیے وقت سے ہم آہنگ متحرک پروگرامنگ استعمال ہوتی ہے۔
  • پالیسی گریڈینٹ قواعد اور نیورل نیٹ ورک ایکٹر-کریٹک طریقہ پالیسی کو بہتر بناتے ہیں۔
  • مظاہروں میں شماریاتی آربیٹریج، مالیاتی ہیجنگ اور روبوٹ کا رکاوٹوں سے بچاؤ شامل ہیں۔
  • دستیاب بیان میں تقابلی نتائج یا مارکیٹ میں نفاذ کے مفروضے نہیں دیے گئے۔

ٹیگز

مکمل متن
# Reinforcement Learning with Dynamic Convex Risk Measures


# Reinforcement Learning with Dynamic Convex Risk Measures









We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔