עבור לתוכן
כל מסמכי הספרייה

למידת חיזוק חקרנית למסחר ספקולטיבי ולמסחר בזוגות

מאמר arXiv papers · מחבר: Yun Zhao et al.

סיכום

מחקר זה מנסח מסחר ספקולטיבי כבעיית עצירה אופטימלית סדרתית, שבה נבחרים מועדי כניסה ויציאה תחת פונקציות תועלת ותהליכי מחירים כלליים. תחילה הוא מרכך את בעיית העצירה באמצעות ייצוג אירועי הכניסה והיציאה כקפיצות של תהליכי קוקס, שהסוכן בוחר בהם עוצמות חסומות.

בניסוח של למידת חיזוק חקרנית, מדיניות אקראית מציבה התפלגויות הסתברות על עוצמות אלה, ואנטרופיה דיפרנציאלית של שאנון מרסנת את פונקציית המטרה. משוואות המילטון־יעקובי־בלמן החקרניות המתקבלות מניבות מדיניות אופטימלית בצורת גיבס. המחברים מבססים אומדני שגיאה והתכנסות של מטרת הלמידה לפונקציית הערך של הבעיה המקורית, ואז מדגימים אלגוריתם ביישום של מסחר בזוגות. התיאור שסופק אינו נותן נתונים או תוצאות ביצועים ליישום הזה, וההתכנסות המתוארת נוגעת למטרה הממודלת ולא לתוצאת מסחר חי שהודגמה.

רעיונות מרכזיים

  • מסחר ספקולטיבי ממודל כבעיית עצירה אופטימלית על פני מועדי כניסה ויציאה.
  • ניסוח מרוכך מייצג אירועי עצירה בקפיצות של תהליך קוקס הנשלטות באמצעות עוצמות חסומות.
  • מדיניות עוצמה אקראית עוברת רגולריזציה באמצעות אנטרופיה דיפרנציאלית של שאנון.
  • המסגרת גוזרת משוואות HJB חקרניות ומדיניות אופטימלית בצורת גיבס.
  • העבודה מבססת תוצאות שגיאה והתכנסות ומדגימה אלגוריתם למסחר בזוגות.

תגיות

הטקסט המלא
# Reinforcement Learning for Speculative Trading under Exploratory Framework


# Reinforcement Learning for Speculative Trading under Exploratory Framework









We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.

מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0

הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.