رفتن به محتوا
همه اسناد کتابخانه

هدف‌های ریسک محدب در یادگیری تقویتی برای معامله‌گری

مقاله arXiv papers · نویسنده: Shanyu Han et al.

خلاصه

این مقاله چارچوبی برای یادگیری تقویتی در مسائل تصمیم‌گیری با هدف‌های ریسکِ بیان‌شده از طریق توابع امتیازدهی محدب ارائه می‌کند. چارچوب می‌تواند معیارهایی از جمله واریانس، زیان فراتر از آستانه مورد انتظار (Expected Shortfall) و ارزش در معرض ریسک آنتروپیک، و نیز مطلوبیت میانگین‌ـ‌ریسک را نشان دهد. تمرکز آن بر عملی‌کردن این هدف‌ها در طول زمان است؛ جایی که بهینه‌سازی ریسک می‌تواند ناسازگاری زمانی ایجاد کند: سیاستی که پیش‌تر ترجیح داده می‌شد، ممکن است در نقطه تصمیم‌گیری بعدی دیگر ترجیح داده نشود.

برای حل این مسئله، نویسندگان متغیری کمکی به حالت می‌افزایند و مسئله را بهینه‌سازی‌ای دوحالته بازنویسی می‌کنند. آن‌ها الگوریتم عامل‌ـ‌منتقد سفارشی، تضمین‌های نظری تقریب که به فرایند تصمیم‌گیری مارکوف پیوسته نیاز ندارند و روشی برای نمونه‌گیری با متغیر کمکی الهام‌گرفته از کمینه‌سازی متناوب را شرح می‌دهند. مقاله آزمایش‌های شبیه‌سازی، از جمله کاربردی در آربیتراژ آماری، را به‌عنوان شواهدی از اثربخشی روش گزارش می‌کند. شرح موجود نتایج عددی یا جزئیات تنظیمات آزمایش را ارائه نمی‌دهد و همگرایی روش نمونه‌گیری به فرض‌های بیان‌شده مشروط است؛ بنابراین عملکرد عملی فراتر از شبیه‌سازی‌های آزموده‌شده روشن نیست.

ایده‌های کلیدی

  • توابع امتیازدهی محدب می‌توانند چند معیار آشنای ریسک را در قالب هدف یادگیری تقویتی بیان کنند.
  • افزودن متغیری کمکی به حالت به حل ناسازگاری زمانی در تصمیم‌های حساس به ریسک کمک می‌کند.
  • روش عامل‌ـ‌منتقد پیشنهادی تضمین‌های تقریبی دارد که به فرایند حالت پیوسته نیاز ندارند.
  • گزارش شده است که روش نمونه‌گیری الهام‌گرفته از کمینه‌سازی متناوب، تحت شرایطی همگرا می‌شود.
  • آزمایش‌های شبیه‌سازی شامل کاربردی در معامله آربیتراژ آماری است.

برچسب‌ها

متن کامل
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions


# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions









We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.