יעדי סיכון קמורים בלמידת חיזוק למסחר
סיכום
המאמר מציג מסגרת ללמידה באמצעות חיזוק עבור בעיות החלטה שבהן יעדי הסיכון מבוטאים באמצעות פונקציות ניקוד קמורות. המסגרת יכולה לייצג מדדים כגון שונות, Expected Shortfall ו-Value-at-Risk אנטרופי, וכן תועלת של ממוצע־סיכון. היא מתמקדת בהפיכת יעדים אלה לישים לאורך זמן, כאשר אופטימיזציה של סיכון עלולה ליצור חוסר עקביות בזמן: מדיניות שהועדפה קודם עשויה שלא להיות מועדפת עוד בנקודת החלטה מאוחרת יותר.
כדי להתמודד עם כך, המחברים מרחיבים את המצב באמצעות משתנה עזר ומנסחים מחדש את הבעיה כאופטימיזציה של שני מצבים. הם מתארים אלגוריתם Actor-Critic מותאם, ערבויות תאורטיות לקירוב שאינן דורשות תהליך החלטה מרקובי רציף, והליך דגימה עם משתנה עזר בהשראת מזעור לסירוגין. המאמר מדווח על ניסויי סימולציה, לרבות יישום לארביטראז׳ סטטיסטי, כראיה ליעילות השיטה. התיאור הזמין אינו כולל תוצאות מספריות או הגדרה מפורטת של הניסויים, והתכנסות שיטת הדגימה מותנית בהנחות שצוינו; לכן הביצועים המעשיים מעבר לסימולציות שנבדקו אינם ברורים.
רעיונות מרכזיים
- פונקציות ניקוד קמורות יכולות לייצג כמה מדדי סיכון מוכרים במסגרת יעד של למידה באמצעות חיזוק.
- הרחבת המצב באמצעות משתנה עזר מסייעת להתמודד עם חוסר עקביות בזמן בהחלטות רגישות לסיכון.
- לשיטת Actor-Critic המוצעת יש ערבויות קירוב שאינן דורשות תהליך מצב רציף.
- מדווח כי שיטת דגימה בהשראת מזעור לסירוגין מתכנסת בתנאים מסוימים.
- ניסויי הסימולציה כוללים יישום למסחר בארביטראז׳ סטטיסטי.
תגיות
הטקסט המלא
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions # Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.