עבור לתוכן
כל מסמכי הספרייה

שנאי החלטות מקוון לכוונון מדיניות מסחר

מאמר MQL5 articles

סיכום

המאמר מסביר את שנאי ההחלטות המקוון (ODT), גישה לכוונון עדין של שנאי החלטות באמצעות אינטראקציה מתמשכת עם סביבה. הוא סוקר כיצד מודל הבסיס מתנה פעולות במצבים, בפעולות ובערכי תשואה עד סוף המסלול, ואז מתאר את המדיניות הסטוכסטית של ODT, את אילוץ האנטרופיה לצורך חקירה ואת מאגר החזרה המבוסס על מסלולים. האימון דוגם רצפים באורך קבוע ממסלולים שנשמרו, ויעד התשואה הראשוני עד סוף המסלול נקבע לפי סולם המבוסס על תוצאות מומחים.

החלק המעשי מתאים מודלים שאומנו קודם לכן לאימון מקוון נוסף במערך מסחר MQL5. המימוש שומר על הארכיטקטורה הקודמת ועל נתוני החזרה, אך משמיט את איבר האנטרופיה המפורש ואת האתחול המוצע באמצעות מסלולים לא מקוונים בעלי התשואה הגבוהה ביותר בלבד. המאמר מדווח על שיפור ביעילות המודל בניסוי האימון המקוון שלו, ומזהיר שהתוכניות מדגימות את הטכנולוגיה ואינן מוכנות למסחר חי. הטקסט שסופק אינו כולל מדדים מפורטים או אימות עצמאי, ולכן השיפור המדווח אינו מוכיח יכולת הכללה או רווחיות.

רעיונות מרכזיים

  • ODT מרחיב אימון לא מקוון של שנאי החלטות באמצעות למידה נוספת מאינטראקציה מקוונת.
  • הוא משתמש במדיניות סטוכסטית ובגבול תחתון לאנטרופיה כדי לעודד חקירה.
  • מאגר החזרה שלו שומר מסלולים, שמהם נדגמים רצפים באורך קבוע לצורך אימון.
  • מימוש MQL5 המתואר משמיט את הפסד האנטרופיה ומשתמש במאגר הקיים המלא, במקום לאתחל אותו רק עם מסלולים בעלי הביצועים הטובים ביותר.
  • המאמר מדווח על שיפור ביעילות המודל, אך אינו מספק כאן אימות מפורט ומזהיר מפני שימוש ישיר במסחר חי.

תגיות

הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.