מודלי מצב־מרחב עמוק אוטורגרסיביים לזרם הודעות בספר פקודות לימיט
סיכום
המאמר מפתח מודל אוטורגרסיבי שמייצר הודעות מטוקננות של ספר פקודות לימיט, שבהן משתמש סימולטור כדי לעדכן את מצב הספר. הארכיטקטורה שלו משתמשת בשכבות מרחב־מצב מובנות ומפושטות לעיבוד רצפים ארוכים של הודעות ומצבים. המחברים יוצרים גם טוקנייזר להודעות פקודות של NASDAQ בנתוני LOBSTER, המקבץ ספרות עוקבות לאסימונים.
בהערכה מחוץ למדגם, המודל מקרב את התפלגות ההודעות שנצפתה עם פרפלקסיות נמוכה. תשואות מחיר האמצע המחושבות מזרם הפקודות שהוא יוצר מתואמות במובהק עם הנתונים, והמאמר מציג זאת כראיה ליכולת חיזוי מותנית. המחברים מציעים שזרם פקודות סינתטי מפורט עשוי לתמוך בעבודה מעבר לחיזוי, לרבות כסביבה מדומה ללמידת חיזוק בתדירות גבוהה. התוצאות נוגעות למערך הנתונים ולמדדים שדווחו; התקציר אינו מספק אימות רחב יותר בשווקים, תוצאות ביצוע או ראיות לכך שהזרמים המדומים משחזרים כל מאפיין הנדרש ליישומי מסחר.
רעיונות מרכזיים
- המודל יוצר באופן אוטורגרסיבי רצפים של הודעות מטוקננות של ספר פקודות לימיט.
- שכבות מצב־מרחב מובנות משמשות לעיבוד רצפים ארוכים של הודעות ומצבי ספר הפקודות.
- טוקנייזר ייעודי מוחל על הודעות פקודות מניות של NASDAQ מתוך נתוני LOBSTER.
- בהערכה מחוץ למדגם מדווחים על פרפלקסיות נמוכה ועל מתאם מובהק בין תשואות מחיר האמצע שנוצרו לבין התשואות שנצפו.
- זרם פקודות סינתטי עשוי לשמש סביבת מידול למחקר בתדירות גבוהה, אף שאימות רחב יותר אינו מתואר.
תגיות
הטקסט המלא
# 2309.00638 # Generative AI for End-to-End Limit Order Book Modelling: A Token-Level Autoregressive Generative Model of Message Flow Using a Deep State Space Network Developing a generative model of realistic order flow in financial markets is a challenging open problem, with numerous applications for market participants. Addressing this, we propose the first end-to-end autoregressive generative model that generates tokenized limit order book (LOB) messages. These messages are interpreted by a Jax-LOB simulator, which updates the LOB state. To handle long sequences efficiently, the model employs simplified structured state-space layers to process sequences of order book states and tokenized messages. Using LOBSTER data of NASDAQ equity LOBs, we develop a custom tokenizer for message data, converting groups of successive digits to tokens, similar to tokenization in large language models. Out-of-sample results show promising performance in approximating the data distribution, as evidenced by low model perplexity. Furthermore, the mid-price returns calculated from the generated order flow exhibit a significant correlation with the data, indicating impressive conditional forecast performance. Due to the granularity of generated data, and the accuracy of the model, it offers new application areas for future work beyond forecasting, e.g. acting as a world model in high-frequency financial reinforcement learning applications. Overall, our results invite the use and extension of the model in the direction of autoregressive large financial models for the generation of high-frequency financial data and we commit to open-sourcing our code to facilitate future research.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.