חקירה באמצעות אנטרופיית צאליס לבקרה עם גורמים חבויים
סיכום
עבודה זו בוחנת בקרה אופטימלית כאשר מודל כולל גורמים חבויים ומקבל ההחלטות בוחר התפלגות על פני פעולות במקום לבחור פעולה יחידה ישירות. היא מציגה את אנטרופיית צאליס כתגמול על חקירת מרחב המצבים, הן בזמן בדיד והן בזמן רציף. המחברים גוזרים התפלגות מצב אופטימלית בצורת q-גאוסית ומאפיינים את מיקומה באמצעות משוואות קדימה-אחורה עבור שני סוגי המודלים.
המאמר בוחן גם כיצד פתרונות החקירה המתקבלים קשורים לבקרה אופטימלית דינמית סטנדרטית. עבור גישה שאינה תלויה במודל, הוא מפתח מדיניות אופטימלית לפי הרעיון הכללי של למידת Q רכה. השיטה מוצגת כבעלת פוטנציאל לסייע בבניית אסטרטגיות ארביטראז' סטטיסטי עמידות יותר, ולא כראיה לכך שמערכת מסחר מסוימת נבחנה או השתפרה. התיאור שסופק מציג תוצאות תיאורטיות וכיוון ליישום, אך אין בו נתוני שוק, ביצועי מסחר או פרטי יישום מעשי. הרלוונטיות למסחר תלויה אפוא באופן שבו מסגרת הבקרה מתורגמת לאסטרטגיה ונבחנת אמפירית.
רעיונות מרכזיים
- המסגרת מבקרת התפלגות על פני פעולות במודלים עם גורמים חבויים.
- אנטרופיית צאליס מתגמלת חקירה של מרחב המצבים בזמן בדיד ורציף.
- להתפלגות המצב האופטימלית הנגזרת יש צורה q-גאוסית.
- הניתוח קושר פתרונות המתחשבים בחקירה לבקרה אופטימלית דינמית סטנדרטית.
- פותחה מדיניות שאינה תלויה במודל, ברוח למידת Q רכה, ועשויה לסייע למחקר ארביטראז' סטטיסטי.
תגיות
הטקסט המלא
# Exploratory Control with Tsallis Entropy for Latent Factor Models # Exploratory Control with Tsallis Entropy for Latent Factor Models We study optimal control in models with latent factors where the agent controls the distribution over actions, rather than actions themselves, in both discrete and continuous time. To encourage exploration of the state space, we reward exploration with Tsallis Entropy and derive the optimal distribution over states - which we prove is $q$-Gaussian distributed with location characterized through the solution of an FBS$Δ$E and FBSDE in discrete and continuous time, respectively. We discuss the relation between the solutions of the optimal exploration problems and the standard dynamic optimal control solution. Finally, we develop the optimal policy in a model-agnostic setting along the lines of soft $Q$-learning. The approach may be applied in, e.g., developing more robust statistical arbitrage trading strategies.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.