الانتقال إلى المحتوى
جميع مستندات المكتبة

التعلم المعزز العميق بمقاييس المخاطر الطيفية الديناميكية القابلة للاستثارة

مقال arXiv papers · المؤلف: Anthony Coache et al.

الملخص

تعرض الوثيقة إطارًا للتعلم المعزز المراعي للمخاطر، يحسّن فيه وكيل مقاييس المخاطر الطيفية الديناميكية المتسقة زمنيًا. ويستخدم الإطار قابلية الاستثارة الشرطية لبناء دوال تسجيل متسقة تمامًا، تعمل كعقوبات أثناء التقدير. وتقدّر الشبكات العصبية العميقة مقاييس المخاطر، ويبرهن المؤلفون أن هذه الفئة من المقاييس يمكن تقريبها بهذه الشبكات بدقة اعتباطية.

يتضمن الإطار أيضًا خوارزمية الناقد-الممثل التي تتعلم من الحلقات الكاملة دون إضافة انتقالات متداخلة. ويقارنها المؤلفون بنهج المحاكاة المتداخلة في تطبيقين: المراجحة الإحصائية وتخصيص المحافظ، باستخدام بيانات محاكاة وحقيقية. ولا يقدم الوصف نتائج رقمية أو تفاصيل التنفيذ أو معلومات عن مجموعات البيانات الحقيقية، لذا يوضح تصميم الإطار ونطاق التقييم المذكور، لكنه لا يتيح الحكم على مكاسب الأداء أو المتانة. والمنهج ذو صلة بقرارات المحافظ التي يهم فيها ضبط توزيع الخسائر إلى جانب العائد المتوقع.

الأفكار الرئيسية

  • يحسّن الإطار مقاييس المخاطر الطيفية الديناميكية المتسقة زمنيًا ضمن التعلم المعزز.
  • توفر قابلية الاستثارة الشرطية دوال تسجيل متسقة تمامًا تُستخدم عقوباتٍ أثناء التقدير.
  • تقدّر الشبكات العصبية العميقة مقاييس المخاطر، مع ذكر نتيجة تقريبية لفئة المقاييس.
  • تستخدم طريقة الناقد-الممثل حلقات كاملة وتتجنب الانتقالات المتداخلة الإضافية.
  • تشمل المقارنة المحاكاة المتداخلة والمراجحة الإحصائية وتخصيص المحافظ باستخدام بيانات محاكاة وحقيقية.

الوسوم

النص الكامل
# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning


# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning









We propose a novel framework to solve risk-sensitive reinforcement learning (RL) problems where the agent optimises time-consistent dynamic spectral risk measures. Based on the notion of conditional elicitability, our methodology constructs (strictly consistent) scoring functions that are used as penalizers in the estimation procedure. Our contribution is threefold: we (i) devise an efficient approach to estimate a class of dynamic spectral risk measures with deep neural networks, (ii) prove that these dynamic spectral risk measures may be approximated to any arbitrary accuracy using deep neural networks, and (iii) develop a risk-sensitive actor-critic algorithm that uses full episodes and does not require any additional nested transitions. We compare our conceptually improved reinforcement learning algorithm with the nested simulation approach and illustrate its performance in two settings: statistical arbitrage and portfolio allocation on both simulated and real data.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.