עבור לתוכן
כל מסמכי הספרייה

גרדיאנט מדיניות דטרמיניסטי עמוק לאופטימיזציה של תיק

מאמר arXiv papers · מחבר: Ayman Chaouki et al.

סיכום

עבודה זו בודקת אם למידת חיזוק עמוקה יכולה לשחזר אסטרטגיות מסחר אופטימליות בסביבות שקל לתאר אך מאתגרות מבחינה מתמטית. המחברים מתמקדים בגרדיאנט מדיניות דטרמיניסטי עמוק, שיטה הלומדת מדיניות לבחירת פעולות באמצעות אינטראקציה עם סביבה. הם בוחרים הגדרות שבהן האסטרטגיה האופטימלית, או קירוב קרוב שלה, כבר ידועה, וכך אפשר להשוות את ההתנהגות והתגמול שנלמדו לפתרון ייחוס.

התוצאה המדווחת היא שהסוכן משחזר מאפיינים חיוניים של האסטרטגיות הידועות ומשיג תגמולים קרובים לאופטימליים. הדבר מספק ראיות לכך שהאלגוריתם יכול לשמש כפותֵר בסביבות שנבדקו. הקטע אינו מזהה את מודלי השוק, אילוצי התיק, הליכי האימון או מדדי ההערכה הספציפיים. לכן מסקנתו מוגבלת לתנאים המבוקרים שנבחרו, ואינה מוכיחה ביצועים בשווקים חיים ורועשים, בנוכחות עלויות עסקה או כאשר המדיניות האופטימלית אינה ידועה.

רעיונות מרכזיים

  • המחקר בוחן למידת חיזוק עמוקה כדרך לפתרון אסטרטגיות מסחר.
  • הוא משתמש בגרדיאנט מדיניות דטרמיניסטי עמוק בסביבות מאתגרות מתמטית אך פשוטות מבחינה מושגית.
  • בסביבות שנבדקו, האסטרטגיות האופטימליות או כמעט אופטימליות ידועות לצורך השוואה.
  • לפי הדיווח, הסוכן משחזר מאפיינים מרכזיים של האסטרטגיות ומשיג תגמולים כמעט אופטימליים.
  • הקטע אינו מוכיח ביצועים תחת חיכוכי שוק חי או כאשר המדיניות האופטימלית אינה ידועה.

תגיות

הטקסט המלא
# Deep Deterministic Portfolio Optimization


# Deep Deterministic Portfolio Optimization









Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.

מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0

הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.