الانتقال إلى المحتوى
جميع مستندات المكتبة

تعلم معزز متين يراعي المخاطر لاستراتيجيات المحافظ

مقال arXiv papers · المؤلف: Sebastian Jaimungal et al.

الملخص

يطور هذا العمل نهجاً للتعلم المعزز لتحسين السياسات وفق معايير أداء تراعي المخاطر. ويقيّم السياسات باستخدام المنفعة المتوقعة المعتمدة على الرتب، التي تتيح للوكيل التعبير عن تفضيلات مختلفة تجاه المكاسب والنتائج السلبية. ولمعالجة عدم اليقين في النموذج، تُقيّم السياسة وفق أسوأ توزيع للعوائد ضمن كرة مسافة فاسرشتاين حول التوزيع المنمذج. وينشئ ذلك مسألة قرار متداخلة: يختار الوكيل سياسة، ثم يختار خصم توزيعاً قريباً يخفض أداءها.

يشتق المؤلفون صيغ تدرج السياسة لكل من مسألة اختيار السياسة ومسألة التوزيع الخصومي. ويعرضون الطريقة في تخصيص متين للمحافظ وتحسين المعايير المرجعية والمراجحة الإحصائية. وتوضح هذه التطبيقات النطاق المقصود للإطار، لكن الوثيقة لا تقدم أرقام أداء مقارنة أو تفاصيل بيانات السوق أو إرشادات تنفيذ عملية. لذا تعتمد فائدته على مزيد من التحقق من النموذج ومجموعة عدم اليقين وتفضيلات المخاطر في سياق تداول محدد.

الأفكار الرئيسية

  • تتيح المنفعة المتوقعة المعتمدة على الرتب للسياسات ترميز مفاضلات مختلفة بين المكاسب ومخاطر الهبوط.
  • يقيّم الإطار كل سياسة وفق توزيع أسوأ حالة ضمن جوار فاسرشتاين.
  • تسعى مسألة داخلية خصومية إلى اختيار توزيع يخفض أداء السياسة المختارة.
  • يشتق المؤلفون تدرجات السياسة لكل من تحسين السياسة والمسألة الخصومية.
  • تشمل التطبيقات التوضيحية تخصيص المحافظ وتحسين المعايير المرجعية والمراجحة الإحصائية.

الوسوم

النص الكامل
# Robust Risk-Aware Reinforcement Learning


# Robust Risk-Aware Reinforcement Learning









We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.