یادگیری تقویتی گرادیان سیاست با سنجههای ریسک محدب پویا
خلاصه
این سند روشی برای یادگیری تقویتیِ بدون مدل در بهینهسازی ترتیبی ارائه میکند که در آن پیامدها با سنجههای ریسک محدب پویا ارزیابی میشوند. از اصل برنامهریزی پویای سازگار با زمان برای ارزشگذاری سیاستها استفاده میکند و سپس بهروزرسانیهای گرادیان سیاست را برای یافتن سیاستهای بهتر بهدست میآورد. برای بهینهسازی این سیاستها، رویکرد بازیگر-منتقد با شبکههای عصبی پیشنهاد شده است.
این روش در سه وظیفه نمایش داده میشود: معامله آربیتراژ آماری، پوشش ریسک مالی و کنترل اجتناب از مانع برای ربات. این امر نشان میدهد چارچوب در حوزههای مالی و غیرمالی بهکار رفته است، اما توضیحات ارقام عملکرد، روشهای مقایسه، فرضهای بازار یا جزئیات پیادهسازی را ارائه نمیکند. در نتیجه، ساختار بهینهسازی و دامنه کاربرد را بیان میکند، ولی شواهد اثربخشی معاملاتی و محدودیتهای عملی را مشخص نمیسازد.
ایدههای کلیدی
- سنجههای ریسک محدب پویا راهی برای ارزیابی دنبالهای از پیامدهای نامطمئن فراهم میکنند.
- از برنامهریزی پویای سازگار با زمان برای ارزشگذاری سیاستهای پیشنهادی استفاده میشود.
- قواعد گرادیان سیاست و روش بازیگر-منتقد مبتنی بر شبکه عصبی، بهینهسازی سیاست را پشتیبانی میکنند.
- نمونههای کاربردی شامل آربیتراژ آماری، پوشش ریسک مالی و اجتناب ربات از مانعاند.
- توضیحات موجود نتایج مقایسهای یا فرضهای پیادهسازی در بازار را بیان نمیکند.
برچسبها
متن کامل
# Reinforcement Learning with Dynamic Convex Risk Measures # Reinforcement Learning with Dynamic Convex Risk Measures We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.