למידת חיזוק עמוקה עם מדדי סיכון ספקטרליים דינמיים ניתנים לאליציטציה
סיכום
המסמך מציג מסגרת ללמידת חיזוק הרגישה לסיכון, שבה סוכן ממקסם מדדי סיכון ספקטרליים דינמיים עקביים בזמן. היא משתמשת באליציטביליות מותנית לבניית פונקציות ניקוד עקביות לחלוטין, המשמשות כקנסות במהלך האמידה. רשתות נוירונים עמוקות אומדות את מדדי הסיכון, והמחברים מוכיחים שניתן לקרב מחלקה זו של מדדים בדיוק שרירותי באמצעות רשתות כאלה.
המסגרת כוללת גם אלגוריתם שחקן־מבקר הלומד מפרקים מלאים בלי להוסיף מעברים מקוננים. המחברים משווים אותו לגישת סימולציה מקוננת בשני יישומים: ארביטראז׳ סטטיסטי והקצאת תיק, תוך שימוש בנתונים מדומים ואמיתיים. התיאור אינו מספק תוצאות מספריות, פרטי מימוש או מידע על מערכי הנתונים האמיתיים, ולכן הוא מסייע להבין את התכנון ואת היקף ההערכה המתואר, אך לא לשפוט שיפורים בביצועים או חוסן. השיטה רלוונטית להחלטות בתיק שבהן חשוב לשלוט בהתפלגות ההפסדים לצד התגמול הצפוי.
רעיונות מרכזיים
- המסגרת ממקסמת מדדי סיכון ספקטרליים דינמיים עקביים בזמן בלמידת חיזוק.
- אליציטביליות מותנית מספקת פונקציות ניקוד עקביות לחלוטין, המשמשות כקנסות באמידה.
- רשתות נוירונים עמוקות אומדות את מדדי הסיכון, ולמחלקת המדדים מוצגת תוצאת קירוב.
- שיטת השחקן־מבקר משתמשת בפרקים מלאים ונמנעת ממעברים מקוננים נוספים.
- ההשוואה כוללת סימולציה מקוננת, ארביטראז׳ סטטיסטי והקצאת תיק, על נתונים מדומים ואמיתיים.
תגיות
הטקסט המלא
# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning # Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning We propose a novel framework to solve risk-sensitive reinforcement learning (RL) problems where the agent optimises time-consistent dynamic spectral risk measures. Based on the notion of conditional elicitability, our methodology constructs (strictly consistent) scoring functions that are used as penalizers in the estimation procedure. Our contribution is threefold: we (i) devise an efficient approach to estimate a class of dynamic spectral risk measures with deep neural networks, (ii) prove that these dynamic spectral risk measures may be approximated to any arbitrary accuracy using deep neural networks, and (iii) develop a risk-sensitive actor-critic algorithm that uses full episodes and does not require any additional nested transitions. We compare our conceptually improved reinforcement learning algorithm with the nested simulation approach and illustrate its performance in two settings: statistical arbitrage and portfolio allocation on both simulated and real data.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.