למידת חיזוק PPO למסחר פעיל במניות בתדירות גבוהה
סיכום
המסמך מתאר גישה מקצה לקצה של למידת חיזוק עמוקה למסחר פעיל במניות בתדירות גבוהה. סוכנים משתמשים באופטימיזציה של מדיניות באמצעות חיתוך פרוקסימלי כדי לסחור ביחידה אחת של מניית Intel, כאשר המצבים נבנים מקבוצות שונות של מאפייני ספר הפקודות. נתוני האימון נבחרים לפי שינויי מחיר גדולים כדי להגדיל את יחס האות לרעש; חודש רציף אחד נשמר לאימות, ולאחריו חודש נפרד לבדיקה. ההיפר־פרמטרים מכוילים באמצעות אופטימיזציה סדרתית מבוססת מודל.
המחברים מדווחים שהסוכנים מזהים דפוסים חוזרים בספר הפקודות ומפיקים תשואות חיוביות יציבות בתקופת הבדיקה, למרות תנאים רועשים ומשתנים. אלה ראיות מניסוי מצומצם מאוד במניה אחת לאורך רצף קצר של חודשים. התיאור אינו מספק נתוני תשואה, עלויות עסקה, השוואות למדדי ייחוס או ראיות לכך שההתנהגות שנלמדה נשמרת בתקופות אחרות, בנכסים אחרים ובביצוע חי. גם בחירת דוגמאות האימון לפי תנועת המחיר עשויה להשפיע על מה שהסוכנים לומדים, ולכן אין לראות בתוצאה המדווחת הוכחה רחבה לרווחיות.
רעיונות מרכזיים
- הסוכנים משתמשים באופטימיזציה של מדיניות באמצעות חיתוך פרוקסימלי כדי לסחור ביחידה אחת של מניה יחידה.
- ייצוגי המצבים שלהם נבדלים במאפייני ספר הפקודות שהם כוללים.
- האימון מדגיש דוגמאות עם תנועות מחיר גדולות, עם תקופות נפרדות לאימות ולבדיקה.
- ההיפר־פרמטרים מכוילים באמצעות אופטימיזציה סדרתית מבוססת מודל.
- מדווחות תשואות חיוביות בתקופת הבדיקה, אך הכללה רחבה יותר ועלויות ביצוע אינן מבוססות.
תגיות
הטקסט המלא
# Deep Reinforcement Learning for Active High Frequency Trading # Deep Reinforcement Learning for Active High Frequency Trading We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.