למידת חיזוק עם גרדיאנט מדיניות ומדדי סיכון קמורים דינמיים
סיכום
המסמך מציג שיטת למידת חיזוק נטולת מודל לאופטימיזציה סדרתית, שבה התוצאות מוערכות באמצעות מדדי סיכון קמורים דינמיים. היא משתמשת בעיקרון תכנות דינמי עקבי בזמן כדי להעריך מדיניות, ואז גוזרת עדכוני גרדיאנט מדיניות למציאת מדיניות משופרת. מוצעת גישת שחקן־מבקר עם רשתות נוירונים לאופטימיזציה של המדיניות.
השיטה מודגמת בשלוש משימות: מסחר בארביטראז׳ סטטיסטי, גידור פיננסי ובקרת הימנעות ממכשולים לרובוט. הדבר מראה שהמסגרת מיושמת בהקשרים פיננסיים ולא־פיננסיים כאחד, אך התיאור אינו מספק נתוני ביצועים, שיטות השוואה, הנחות שוק או פרטי מימוש. לכן הוא מציג את מבנה האופטימיזציה ואת טווח היישומים, אך אינו מפרט ראיות ליעילות המסחר או למגבלות המעשיות.
רעיונות מרכזיים
- מדדי סיכון קמורים דינמיים מספקים דרך להעריך רצפים של תוצאות לא ודאיות.
- תכנות דינמי עקבי בזמן משמש להערכת מדיניות אפשרית.
- כללי גרדיאנט מדיניות ושיטת שחקן־מבקר המבוססת על רשת נוירונים מסייעים באופטימיזציה של המדיניות.
- ההדגמות כוללות ארביטראז׳ סטטיסטי, גידור פיננסי והימנעות של רובוט ממכשולים.
- התיאור הזמין אינו מספק תוצאות השוואתיות או הנחות על יישום בשוק.
תגיות
הטקסט המלא
# Reinforcement Learning with Dynamic Convex Risk Measures # Reinforcement Learning with Dynamic Convex Risk Measures We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.