עבור לתוכן
כל מסמכי הספרייה

למידת חיזוק חסינה ומודעת סיכון לאסטרטגיות תיק

מאמר arXiv papers · מחבר: Sebastian Jaimungal et al.

סיכום

עבודה זו מפתחת גישת למידת חיזוק לאופטימיזציה של מדיניות לפי קריטריוני ביצועים המודעים לסיכון. היא מעריכה מדיניות באמצעות תועלת צפויה התלויה בדירוג, המאפשרת לסוכן לבטא העדפות שונות ביחס לרווחים ולתוצאות שליליות. כדי להתמודד עם אי־ודאות במודל, המדיניות נבחנת מול התפלגות התשואות הגרועה ביותר בתוך כדור מרחק וסרשטיין סביב ההתפלגות הממודלת. כך נוצרת בעיית החלטה מקוננת: הסוכן בוחר מדיניות, ואז יריב בוחר התפלגות סמוכה שמפחיתה את ביצועיה.

החוקרים גוזרים נוסחאות לגרדיאנט מדיניות הן לבעיית בחירת המדיניות והן לבעיית ההתפלגות היריבית. הם מדגימים את השיטה בהקצאת תיק חסינה, באופטימיזציה של מדד ייחוס ובארביטראז׳ סטטיסטי. היישומים מדגימים את היקף המסגרת, אך המסמך אינו מספק נתוני ביצועים השוואתיים, פרטי נתוני שוק או הנחיות יישום מעשיות. לכן התועלת תלויה באימות נוסף של המודל, קבוצת אי־הוודאות והעדפות הסיכון בהקשר מסחר מסוים.

רעיונות מרכזיים

  • תועלת צפויה התלויה בדירוג מאפשרת למדיניות לקודד פשרות שונות בין רווחים לסיכון הפסד.
  • המסגרת מעריכה כל מדיניות מול התפלגות גרועה ביותר בתוך סביבת וסרשטיין.
  • בעיה פנימית יריבית מחפשת התפלגות שמפחיתה את ביצועי המדיניות שנבחרה.
  • החוקרים גוזרים גרדיאנטים של מדיניות הן לאופטימיזציה שלה והן לבעיה היריבית.
  • ההדגמות עוסקות בהקצאת תיק, באופטימיזציה של מדד ייחוס ובארביטראז׳ סטטיסטי.

תגיות

הטקסט המלא
# Robust Risk-Aware Reinforcement Learning


# Robust Risk-Aware Reinforcement Learning









We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.

מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0

הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.