למידת חיזוק עמוקה לעשיית שוק במטבעות קריפטוגרפיים
סיכום
המאמר מתאר מסגרת ללמידת חיזוק עמוקה לעשיית שוק במטבעות קריפטוגרפיים, שבה סוכנים לומדים לנהל מלאי תוך כדי אינטראקציה עם סביבת מסחר מדומה. הסביבה מייצגת תצפיות שוק באמצעות נתוני ספר פקודות וסטטיסטיקות של הגעת זרם הפקודות. אלגוריתמים של גרדיאנט מדיניות משמשים כסוכנים, ורשת נוירונים קדמית מעריכה את המדיניות או את פונקציות הערך שלהם.
הניסוי משווה שתי פונקציות תגמול ומעריך צירופים של סוכן ותגמול באמצעות תשואות מסחר יומיות וממוצעות. המחברים מציגים את המסגרת כדרך להתמודד עם בעיית בקרת המלאי הסטוכסטית שעמה מתמודדים עושי שוק. התיאור שסופק אינו מזהה את האלגוריתמים הספציפיים, הגדרות התגמול, מערך הנתונים או תוצאות מספריות, ולכן אינו מבסס כיצד הביצועים עוברים לשווקים חיים או לתנאי שוק אחרים.
רעיונות מרכזיים
- המסגרת מיישמת למידת חיזוק עמוקה לעשיית שוק במטבעות קריפטוגרפיים.
- הסוכנים צופים במידע מספר הפקודות ומסטטיסטיקות של הגעת זרם הפקודות.
- שיטות גרדיאנט מדיניות מקיימות אינטראקציה עם סביבת השוק באמצעות רשת נוירונים קדמית.
- שתי פונקציות תגמול מושוות לפי תשואות מסחר יומיות וממוצעות.
- היישום המתואר עוסק בבקרת מלאי סטוכסטית לעושי שוק, אך התיאור שסופק אינו מפרט מימוש או העברה לתנאים אחרים.
תגיות
הטקסט המלא
# Deep Reinforcement Learning in Cryptocurrency Market Making # Deep Reinforcement Learning in Cryptocurrency Market Making This paper sets forth a framework for deep reinforcement learning as applied to market making (DRLMM) for cryptocurrencies. Two advanced policy gradient-based algorithms were selected as agents to interact with an environment that represents the observation space through limit order book data, and order flow arrival statistics. Within the experiment, a forward-feed neural network is used as the function approximator and two reward functions are compared. The performance of each combination of agent and reward function is evaluated by daily and average trade returns. Using this DRLMM framework, this paper demonstrates the effectiveness of deep reinforcement learning in solving stochastic inventory control challenges market makers face.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.