یادگیری تقویتی مقاوم و ریسکآگاه برای راهبردهای سبد
خلاصه
این پژوهش رویکردی مبتنی بر یادگیری تقویتی برای بهینهسازی سیاستها بر پایه معیارهای عملکردِ ریسکآگاه ارائه میدهد. سیاستها را با مطلوبیت انتظاری وابسته به رتبه ارزیابی میکند؛ معیاری که به عامل امکان میدهد ترجیحهای متفاوتی درباره سودها و پیامدهای نزولی بیان کند. برای رسیدگی به عدمقطعیت مدل، سیاست در برابر بدترین توزیع بازده درون یک کره فاصله واسرشتاین پیرامون توزیع مدلشده ارزیابی میشود. این کار مسئلهای تودرتو ایجاد میکند: عامل سیاستی انتخاب میکند و سپس یک عامل خصمانه توزیعی نزدیک را برمیگزیند که عملکرد آن را تضعیف میکند.
نویسندگان فرمولهای گرادیان سیاست را هم برای مسئله انتخاب سیاست و هم برای مسئله توزیع خصمانه استخراج میکنند. روش را در تخصیص مقاوم سبد، بهینهسازی معیار مرجع و آربیتراژ آماری نشان میدهند. این کاربردها دامنه موردنظر چارچوب را نشان میدهند، اما سند ارقام مقایسهای عملکرد، جزئیات دادههای بازار یا راهنمای عملی پیادهسازی ارائه نمیکند. بنابراین سودمندی آن به اعتبارسنجی بیشتر مدل، مجموعه عدمقطعیت و ترجیحهای ریسک در یک محیط معاملاتی مشخص وابسته است.
ایدههای کلیدی
- مطلوبیت انتظاری وابسته به رتبه به سیاستها اجازه میدهد بدهبستانهای متفاوت میان سود و ریسک نزولی را بازنمایی کنند.
- چارچوب هر سیاست را در برابر بدترین توزیع در همسایگی واسرشتاین ارزیابی میکند.
- مسئله درونی خصمانه بهدنبال توزیعی است که عملکرد سیاست انتخابشده را کاهش دهد.
- نویسندگان گرادیانهای سیاست را برای بهینهسازی سیاست و مسئله خصمانه استخراج میکنند.
- نمونههای نمایشی شامل تخصیص سبد، بهینهسازی معیار مرجع و آربیتراژ آماری هستند.
برچسبها
متن کامل
# Robust Risk-Aware Reinforcement Learning # Robust Risk-Aware Reinforcement Learning We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.