هدفهای ریسک محدب در یادگیری تقویتی برای معاملهگری
خلاصه
این مقاله چارچوبی برای یادگیری تقویتی در مسائل تصمیمگیری با هدفهای ریسکِ بیانشده از طریق توابع امتیازدهی محدب ارائه میکند. چارچوب میتواند معیارهایی از جمله واریانس، زیان فراتر از آستانه مورد انتظار (Expected Shortfall) و ارزش در معرض ریسک آنتروپیک، و نیز مطلوبیت میانگینـریسک را نشان دهد. تمرکز آن بر عملیکردن این هدفها در طول زمان است؛ جایی که بهینهسازی ریسک میتواند ناسازگاری زمانی ایجاد کند: سیاستی که پیشتر ترجیح داده میشد، ممکن است در نقطه تصمیمگیری بعدی دیگر ترجیح داده نشود.
برای حل این مسئله، نویسندگان متغیری کمکی به حالت میافزایند و مسئله را بهینهسازیای دوحالته بازنویسی میکنند. آنها الگوریتم عاملـمنتقد سفارشی، تضمینهای نظری تقریب که به فرایند تصمیمگیری مارکوف پیوسته نیاز ندارند و روشی برای نمونهگیری با متغیر کمکی الهامگرفته از کمینهسازی متناوب را شرح میدهند. مقاله آزمایشهای شبیهسازی، از جمله کاربردی در آربیتراژ آماری، را بهعنوان شواهدی از اثربخشی روش گزارش میکند. شرح موجود نتایج عددی یا جزئیات تنظیمات آزمایش را ارائه نمیدهد و همگرایی روش نمونهگیری به فرضهای بیانشده مشروط است؛ بنابراین عملکرد عملی فراتر از شبیهسازیهای آزمودهشده روشن نیست.
ایدههای کلیدی
- توابع امتیازدهی محدب میتوانند چند معیار آشنای ریسک را در قالب هدف یادگیری تقویتی بیان کنند.
- افزودن متغیری کمکی به حالت به حل ناسازگاری زمانی در تصمیمهای حساس به ریسک کمک میکند.
- روش عاملـمنتقد پیشنهادی تضمینهای تقریبی دارد که به فرایند حالت پیوسته نیاز ندارند.
- گزارش شده است که روش نمونهگیری الهامگرفته از کمینهسازی متناوب، تحت شرایطی همگرا میشود.
- آزمایشهای شبیهسازی شامل کاربردی در معامله آربیتراژ آماری است.
برچسبها
متن کامل
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions # Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.