رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی گرادیان سیاست با سنجه‌های ریسک محدب پویا

مقاله arXiv papers · نویسنده: Anthony Coache et al.

خلاصه

این سند روشی برای یادگیری تقویتیِ بدون مدل در بهینه‌سازی ترتیبی ارائه می‌کند که در آن پیامدها با سنجه‌های ریسک محدب پویا ارزیابی می‌شوند. از اصل برنامه‌ریزی پویای سازگار با زمان برای ارزش‌گذاری سیاست‌ها استفاده می‌کند و سپس به‌روزرسانی‌های گرادیان سیاست را برای یافتن سیاست‌های بهتر به‌دست می‌آورد. برای بهینه‌سازی این سیاست‌ها، رویکرد بازیگر-منتقد با شبکه‌های عصبی پیشنهاد شده است.

این روش در سه وظیفه نمایش داده می‌شود: معامله آربیتراژ آماری، پوشش ریسک مالی و کنترل اجتناب از مانع برای ربات. این امر نشان می‌دهد چارچوب در حوزه‌های مالی و غیرمالی به‌کار رفته است، اما توضیحات ارقام عملکرد، روش‌های مقایسه، فرض‌های بازار یا جزئیات پیاده‌سازی را ارائه نمی‌کند. در نتیجه، ساختار بهینه‌سازی و دامنه کاربرد را بیان می‌کند، ولی شواهد اثربخشی معاملاتی و محدودیت‌های عملی را مشخص نمی‌سازد.

ایده‌های کلیدی

  • سنجه‌های ریسک محدب پویا راهی برای ارزیابی دنباله‌ای از پیامدهای نامطمئن فراهم می‌کنند.
  • از برنامه‌ریزی پویای سازگار با زمان برای ارزش‌گذاری سیاست‌های پیشنهادی استفاده می‌شود.
  • قواعد گرادیان سیاست و روش بازیگر-منتقد مبتنی بر شبکه عصبی، بهینه‌سازی سیاست را پشتیبانی می‌کنند.
  • نمونه‌های کاربردی شامل آربیتراژ آماری، پوشش ریسک مالی و اجتناب ربات از مانع‌اند.
  • توضیحات موجود نتایج مقایسه‌ای یا فرض‌های پیاده‌سازی در بازار را بیان نمی‌کند.

برچسب‌ها

متن کامل
# Reinforcement Learning with Dynamic Convex Risk Measures


# Reinforcement Learning with Dynamic Convex Risk Measures









We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.