למידת חיזוק עמוקה לביצוע פקודות מוגבלות עם אותות תחזית
סיכום
המחקר משתמש בלמידת חיזוק עמוקה כדי להפוך תחזית מסחר לטווח קצר להחלטות על הצבת פקודות מוגבלות ועל מלאי בספר פקודות מוגבלות. הוא מאמן סוכן בסביבת מניות מדומה של NASDAQ, שנבנתה מתוך הודעות היסטוריות של ספר הפקודות, באמצעות הסימולטור ABIDES. הסוכן צופה בספר הנוכחי, בהיסטוריית השוק האחרונה ובאות כיווני, ואז לומד מדיניות ביצוע באמצעות Deep Double Duelling Q-learning ושחזור ניסיון אסינכרוני בעדיפות.
כדי להעריך ביצוע בנפרד מכל שיטת חיזוי מסוימת, החוקרים בוחנים אותות אלפא סינתטיים ברמות רעש שונות. הם מדווחים שהסוכן המאומן מנהל מלאי ומציב פקודות ביעילות, ועולה בביצועיו על אסטרטגיה היוריסטית שמקבלת את אותו אות. ההשוואה תומכת בשיטת הביצוע בתוך הסימולטור המתואר, אך המסמך אינו מציג נתוני ביצועים או ראיות לתוצאות בשוק חי. לכן איכותם ומידת המציאות של האותות הסינתטיים ושל הסביבה המדומה מגבילות את המסקנות לגבי פריסה.
רעיונות מרכזיים
- הסוכן לומד להמיר תחזית כיוונית להחלטות על פקודות מוגבלות ועל מלאי.
- האימון משתמש בסימולטור ספר פקודות מוגבלות NASDAQ, המבוסס על הודעות היסטוריות.
- הסוכן צופה במצב ספר הפקודות, בהיסטוריה האחרונה ובתחזית לטווח קצר.
- אותות סינתטיים עם רמות רעש שונות מאפשרים לחוקרים להתמקד בביצוע ולא באיכות התחזית.
- בסימולציה, המדיניות הנלמדת עולה על היוריסטיקה המשתמשת באותו אות, אך ביצועים חיים אינם מבוססים.
תגיות
הטקסט המלא
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets # Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.