עבור לתוכן
כל מסמכי הספרייה

למידת חיזוק היררכית מבוססת מודלי שפה למסחר בזוגות

מאמר arXiv papers · מחבר: Polydoros Giannouris et al.

סיכום

עבודה זו מציגה מסחר בזוגות כבעיית החלטה היררכית עם שני שלבים מקושרים: בחירת זוג נכסים באופק ארוך יותר וביצוע עסקאות באופקים קצרים יותר תחת יכולת תצפית חלקית. מכיוון שמשוב מתקבל באיחור ועשוי להיות עמום, תוצאות גרועות יכולות לנבוע מבחירת הזוג, ממדיניות הביצוע או משניהם. השיטה המוצעת משתמשת במודלי שפה גדולים כמדיניות בשתי הרמות ומתאימה אותם באמצעות עדכוני הנחיות במקום כוונון עדין מבוסס גרדיאנטים.

משוב טקסטואלי ברמות המסלול והאפיזודה משמש להתאמה נפרדת של הפשטות בבחירת זוגות ושל התנהגות הביצוע. המחברים טוענים שהפרדה זו מסייעת לבודד מקורות לשינויים בביצועים ולהפחית חוסר יציבות בין שתי רמות המדיניות. מדווח כי ניסויים על נתוני שוק מהעולם האמיתי מציגים שיפורים עקביים לעומת מדדי בסיס מסורתיים ומבוססי LLM. המסמך אינו מפרט את מערכי הנתונים, עלויות המסחר, בקרות הסיכון או תכנון ההערכה, ולכן אי אפשר לקבוע מתיאור זה בלבד אם ניתן לסחור בשיטה בזמן אמת או עד כמה התוצאות מכלילות.

רעיונות מרכזיים

  • הגישה מפרידה בין בחירת זוג באופק ארוך לבין ביצוע עסקאות באופק קצר יותר.
  • מודלי שפה גדולים משמשים כמדיניות בשתי הרמות של היררכיית המסחר.
  • עדכוני הנחיות משתמשים במשוב טקסטואלי להתאמת המדיניות ללא כוונון עדין מבוסס גרדיאנטים.
  • ניסויים מדווחים על נתוני שוק מהעולם האמיתי מציגים ביצועים טובים ממדדי בסיס מסורתיים ומבוססי LLM, אך פרטי ההערכה אינם מפורטים.

תגיות

הטקסט המלא
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading


# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading









Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.

מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0

הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.