التعلم المعزز بتدرج السياسة ومقاييس المخاطر المحدبة الديناميكية
الملخص
تعرض الوثيقة طريقة للتعلم المعزز بلا نموذج للتحسين المتتابع عندما تُقيّم النتائج باستخدام مقاييس مخاطر محدبة ديناميكية. وتستخدم مبدأ البرمجة الديناميكية المتسق زمنياً لتقييم السياسات، ثم تشتق تحديثات تدرج السياسة للعثور على سياسات محسنة. وتقترح نهج الممثل والناقد باستخدام الشبكات العصبية لتحسين تلك السياسات.
تُعرض الطريقة في ثلاث مهام: تداول المراجحة الإحصائية، والتحوط المالي، والتحكم في تجنب العوائق لروبوت. وهذا يثبت تطبيق الإطار في سياقات مالية وغير مالية، لكن الوصف لا يقدم أرقام أداء أو مناهج مقارنة أو افتراضات سوقية أو تفاصيل تنفيذ. لذلك يوضح بنية التحسين ونطاق التطبيقات، فيما يترك الأدلة على فعالية التداول والقيود العملية دون تحديد.
الأفكار الرئيسية
- توفر مقاييس المخاطر المحدبة الديناميكية وسيلة لتقييم سلاسل من النتائج غير المؤكدة.
- تُستخدم البرمجة الديناميكية المتسقة زمنياً لتقييم السياسات المرشحة.
- تدعم قواعد تدرج السياسة ونهج الممثل والناقد بالشبكات العصبية تحسين السياسات.
- تشمل التطبيقات المراجحة الإحصائية والتحوط المالي وتجنب الروبوت للعوائق.
- لا يقدم الوصف المتاح نتائج مقارنة أو افتراضات بشأن التطبيق في الأسواق.
الوسوم
النص الكامل
# Reinforcement Learning with Dynamic Convex Risk Measures # Reinforcement Learning with Dynamic Convex Risk Measures We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.
يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0
أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.