الانتقال إلى المحتوى
جميع مستندات المكتبة

أهداف المخاطر المحدبة في التعلم المعزز للتداول

مقال arXiv papers · المؤلف: Shanyu Han et al.

الملخص

تقدم هذه الورقة إطارًا للتعلم المعزز لمسائل القرار ذات أهداف المخاطر المصاغة بدوال تسجيل محدبة. ويمكن للإطار تمثيل مقاييس تشمل التباين والخسارة المتوقعة والقيمة المعرضة للخطر الإنتروبية، فضلًا عن منفعة المتوسط والمخاطر. ويركز على جعل هذه الأهداف قابلة للتطبيق عبر الزمن، إذ قد يؤدي تحسين المخاطر إلى عدم الاتساق الزمني: فقد لا تعود السياسة المفضلة في وقت سابق هي المفضلة عند نقطة قرار لاحقة.

لمعالجة ذلك، يضيف المؤلفون متغيرًا مساعدًا إلى الحالة ويعيدون صياغة المسألة على هيئة تحسين ذي حالتين. ويصفون خوارزمية مخصصة للناقد والفاعل، وضمانات نظرية للتقريب لا تتطلب عملية قرار ماركوفية مستمرة، وإجراءً لأخذ العينات بمتغير مساعد مستوحى من التقليل بالتناوب. وتورد الورقة تجارب محاكاة، منها تطبيق على المراجحة الإحصائية، بوصفها دليلًا على فعالية الطريقة. ولا يقدم الوصف المتاح نتائج رقمية أو إعدادًا تجريبيًا مفصلًا، كما أن تقارب طريقة أخذ العينات مشروط بالافتراضات المذكورة؛ لذلك لا يتضح الأداء العملي خارج نطاق المحاكاة المختبرة.

الأفكار الرئيسية

  • يمكن لدوال التسجيل المحدبة التعبير عن عدة مقاييس مألوفة للمخاطر ضمن هدف للتعلم المعزز.
  • تساعد إضافة متغير مساعد إلى الحالة على معالجة عدم الاتساق الزمني في القرارات الحساسة للمخاطر.
  • تأتي طريقة الفاعل والناقد المقترحة مع ضمانات تقريب لا تتطلب عملية حالات مستمرة.
  • يُذكر أن طريقة أخذ العينات المستوحاة من التقليل بالتناوب تتقارب في ظل شروط معينة.
  • تشمل تجارب المحاكاة تطبيقًا على تداول المراجحة الإحصائية.

الوسوم

النص الكامل
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions


# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions









We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.