עבור לתוכן
כל מסמכי הספרייה

השוואת DQN ו־PPO ללמידת חיזוק במסחר במטבע חוץ

מאמר arXiv papers · מחבר: Yun-Cheng Tsai et al.

סיכום

המחקר מיישם למידת חיזוק עמוקה במסחר במטבע חוץ, ומנסח את בחירת העסקה כרצף החלטות במקום להסתמך על תחזיות מחיר ישירות. הוא מתאים מדיניות ארביטראז׳ סטטיסטי Sure-Fire לשלוש פעולות אפשריות וממיר היסטוריות מחירים רציפות לתמונות Gramian Angular Field. המחברים משווים למידת Q עמוקה לאופטימיזציה של מדיניות פרוקסימלית, באמצעות נתוני EUR/USD, GBP/USD ו־AUD/USD במרווחים של ארבע שעות.

האימון משתמש בנתונים מ־1 באוגוסט עד 30 בנובמבר 2018, ותקופת הבדיקה היא דצמבר 2018. המחברים מדווחים על ביצועי השקעה חיוביים למודלים המסוגלים לייצג התנהגות שוק מורכבת ואקראית ומצבי שוק שמתארים כראוי את סביבת המסחר. התיאור שסופק אינו כולל נתוני תשואה, מדדי סיכון, הנחות עמלות או הגדרות מפורטות של המודלים, ולכן אי אפשר להעריך כאן את עוצמת התוצאות ואת יכולת ההשוואה ביניהן. הראיות הן בדיקת היתכנות על שלושה צמדי מטבעות בחלוקה היסטורית קצרה; הן אינן מוכיחות שאחד האלגוריתמים יתפקד באמינות בתקופות אחרות או בתנאי ביצוע במסחר חי.

רעיונות מרכזיים

  • הגישה מתייחסת למסחר במטבע חוץ כאל בעיית החלטה סדרתית המשתמשת בלמידת חיזוק.
  • במסגרת מדיניות ארביטראז׳ סטטיסטי מותאמת מוגדרות שלוש פעולות מסחר.
  • חלונות מחירים מקודדים כתמונות Gramian Angular Field לשימוש כקלט למודל.
  • למידת Q עמוקה ואופטימיזציה של מדיניות פרוקסימלית מושוות על שלושה צמדי מטבעות.
  • ההערכה ההיסטורית הקצרה מדווחת על ביצועים חיוביים, אך אינה כוללת מדדים מפורטים או הנחות על עלויות מסחר.

תגיות

הטקסט המלא
# Deep Reinforcement Learning for Foreign Exchange Trading


# Deep Reinforcement Learning for Foreign Exchange Trading









Reinforcement learning can interact with the environment and is suitable for applications in decision control systems. Therefore, we used the reinforcement learning method to establish a foreign exchange transaction, avoiding the long-standing problem of unstable trends in deep learning predictions. In the system design, we optimized the Sure-Fire statistical arbitrage policy, set three different actions, encoded the continuous price over a period of time into a heat-map view of the Gramian Angular Field (GAF) and compared the Deep Q Learning (DQN) and Proximal Policy Optimization (PPO) algorithms. To test feasibility, we analyzed three currency pairs, namely EUR/USD, GBP/USD, and AUD/USD. We trained the data in units of four hours from 1 August 2018 to 30 November 2018 and tested model performance using data between 1 December 2018 and 31 December 2018. The test results of the various models indicated that favorable investment performance was achieved as long as the model was able to handle complex and random processes and the state was able to describe the environment, validating the feasibility of reinforcement learning in the development of trading strategies.

מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0

הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.