رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی مقاوم و ریسک‌آگاه برای راهبردهای سبد

مقاله arXiv papers · نویسنده: Sebastian Jaimungal et al.

خلاصه

این پژوهش رویکردی مبتنی بر یادگیری تقویتی برای بهینه‌سازی سیاست‌ها بر پایه معیارهای عملکردِ ریسک‌آگاه ارائه می‌دهد. سیاست‌ها را با مطلوبیت انتظاری وابسته به رتبه ارزیابی می‌کند؛ معیاری که به عامل امکان می‌دهد ترجیح‌های متفاوتی درباره سودها و پیامدهای نزولی بیان کند. برای رسیدگی به عدم‌قطعیت مدل، سیاست در برابر بدترین توزیع بازده درون یک کره فاصله واسرشتاین پیرامون توزیع مدل‌شده ارزیابی می‌شود. این کار مسئله‌ای تودرتو ایجاد می‌کند: عامل سیاستی انتخاب می‌کند و سپس یک عامل خصمانه توزیعی نزدیک را برمی‌گزیند که عملکرد آن را تضعیف می‌کند.

نویسندگان فرمول‌های گرادیان سیاست را هم برای مسئله انتخاب سیاست و هم برای مسئله توزیع خصمانه استخراج می‌کنند. روش را در تخصیص مقاوم سبد، بهینه‌سازی معیار مرجع و آربیتراژ آماری نشان می‌دهند. این کاربردها دامنه موردنظر چارچوب را نشان می‌دهند، اما سند ارقام مقایسه‌ای عملکرد، جزئیات داده‌های بازار یا راهنمای عملی پیاده‌سازی ارائه نمی‌کند. بنابراین سودمندی آن به اعتبارسنجی بیشتر مدل، مجموعه عدم‌قطعیت و ترجیح‌های ریسک در یک محیط معاملاتی مشخص وابسته است.

ایده‌های کلیدی

  • مطلوبیت انتظاری وابسته به رتبه به سیاست‌ها اجازه می‌دهد بده‌بستان‌های متفاوت میان سود و ریسک نزولی را بازنمایی کنند.
  • چارچوب هر سیاست را در برابر بدترین توزیع در همسایگی واسرشتاین ارزیابی می‌کند.
  • مسئله درونی خصمانه به‌دنبال توزیعی است که عملکرد سیاست انتخاب‌شده را کاهش دهد.
  • نویسندگان گرادیان‌های سیاست را برای بهینه‌سازی سیاست و مسئله خصمانه استخراج می‌کنند.
  • نمونه‌های نمایشی شامل تخصیص سبد، بهینه‌سازی معیار مرجع و آربیتراژ آماری هستند.

برچسب‌ها

متن کامل
# Robust Risk-Aware Reinforcement Learning


# Robust Risk-Aware Reinforcement Learning









We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.