مواد پر جائیں
لائبریری کی تمام دستاویزات

ٹریڈنگ کے لیے تقویتی سیکھنے میں محدب خطرے کے مقاصد

مضمون arXiv papers · مصنف: Shanyu Han et al.

خلاصہ

یہ مقالہ ایسے فیصلہ جاتی مسائل کے لیے تقویتی سیکھنے کا ڈھانچا پیش کرتا ہے جن کے خطرے کے مقاصد محدب اسکورنگ فنکشنز سے ظاہر کیے جاتے ہیں۔ یہ ڈھانچا ویرینس، متوقع شارٹ فال اور اینٹروپک ویلیو ایٹ رسک سمیت پیمانوں، نیز اوسط-خطرہ افادیت کی نمائندگی کر سکتا ہے۔ توجہ ان مقاصد کو وقت کے ساتھ قابلِ عمل بنانے پر ہے، کیونکہ خطرے کے مقصد کو بہتر بنانے سے وقت کی عدم مطابقت پیدا ہو سکتی ہے: پہلے پسند کی گئی پالیسی بعد کے فیصلے کے وقت پسندیدہ نہ رہے۔

اس مسئلے کے حل کے لیے مصنفین حالت میں ایک معاون متغیر شامل کرتے اور مسئلے کو دو حالتوں کی اصلاحِ عمل کے طور پر ازسرنو مرتب کرتے ہیں۔ وہ حسبِ ضرورت ایکٹر-کریٹک الگورتھم، ایسے نظریاتی تخمینی ضمانتوں کی وضاحت کرتے ہیں جن کے لیے مسلسل مارکوف فیصلہ جاتی عمل درکار نہیں، اور متبادل کم سے کم کاری سے متاثر معاون متغیر کی سیمپلنگ کا طریقہ بیان کرتے ہیں۔ مقالہ طریقے کی افادیت کے ثبوت کے طور پر سمیولیشن تجربات، بشمول شماریاتی آربیٹریج کی ایک ایپلی کیشن، رپورٹ کرتا ہے۔ دستیاب تفصیل میں عددی نتائج یا تجربے کی مکمل ترتیب نہیں، اور سیمپلنگ طریقے کا اجتماع بیان کردہ مفروضوں سے مشروط ہے؛ اس لیے آزمودہ سمیولیشنز سے آگے عملی کارکردگی واضح نہیں۔

اہم خیالات

  • محدب اسکورنگ فنکشنز تقویتی سیکھنے کے مقصد میں کئی معروف خطرے کے پیمانوں کا اظہار کر سکتی ہیں۔
  • معاون متغیر کے ذریعے حالت کو بڑھانا خطرے سے حساس فیصلوں میں وقت کی عدم مطابقت حل کرنے میں مدد دیتا ہے۔
  • مجوزہ ایکٹر-کریٹک طریقے کے ساتھ تخمینی ضمانتیں ہیں جن کے لیے مسلسل حالتوں والا عمل درکار نہیں۔
  • متبادل کم سے کم کاری سے متاثر سیمپلنگ طریقہ مخصوص شرائط کے تحت مجتمع ہونے کی اطلاع دیتا ہے۔
  • سمیولیشن تجربات میں شماریاتی آربیٹریج ٹریڈنگ کی ایپلی کیشن شامل ہے۔

ٹیگز

مکمل متن
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions


# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions









We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔