לימוד מדיניות חיסול בשווקים עם מכרזי נעילה
סיכום
המחקר בוחן סוחר שמוכר באמצעות ספר פקודות לימיט ולאחר מכן מתאים את יתרת המלאי באמצעות לוחות זמנים חתומים במכרז נעילה. שני השלבים מקושרים באמצעות תחזית של מחיר הסליקה במכרז ומשוב במהלכו. המחברים משווים רשתות Q עמוקות למדיניות למידה באמצעות חיזוק מסוג DDPG, TD3 ו-SAC לאחר הטלה, בשוק מדומה המשתמש במחירי Heston מחוספסים סינתטיים ובמסלולים היסטוריים של מחיר האמצע.
המדיניות נבחרת ומוערכת לפי חסר ביצוע עם קנס על מלאי, תוך הפרדה בין ההערכה לבין פונקציית מטרה משוקללת לאימון. בגישות שנלמדו נרשם חסר ביצוע נמוך יותר עם קנס לעומת אסטרטגיות הייחוס של Avellaneda–Stoikov ו-TWAP בסימולציות המדווחות. השוואות סינתטיות מותאמות מצביעות גם על כך שגישה למכרז מסייעת לכל ארבע שיטות הלמידה. משוב צפוף יותר מהמכרז משפר את הלמידה, ואילו הערך הנוסף בקבלת החלטות של תחזית מחיר הסליקה משתנה בין הלומדים. הממצאים מבוססים על סימולציות; התיאור אינו מבסס ביצועים במסחר בזמן אמת או הכללה לתנאי שוק אחרים.
רעיונות מרכזיים
- תהליך החיסול משלב מסחר רציף באמצעות פקודות לימיט עם מכרז נעילה.
- לוחות הזמנים במכרז מתאימים את המלאי שנותר לאחר המסחר הרציף.
- ארבע גישות למידה באמצעות חיזוק מושוות באמצעות מחירים מדומים ומסלולים היסטוריים של מחיר האמצע.
- המדיניות שנלמדה מציגה חסר ביצוע נמוך יותר עם קנס על מלאי לעומת אסטרטגיות הייחוס של Avellaneda–Stoikov ו-TWAP.
- גישה למכרז מסייעת לכל לומד בהשוואות סינתטיות מותאמות, בעוד שערך התחזית תלוי בלומד.
תגיות
הטקסט המלא
# Learning Optimal Liquidation with Closing Auctions # Learning Optimal Liquidation with Closing Auctions We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.