التعلم المعزز الهرمي بنماذج اللغة لتداول الأزواج
الملخص
يؤطر هذا العمل تداول الأزواج بوصفه مسألة قرار هرمية ذات مرحلتين مترابطتين: اختيار زوج من الأصول على أفق أطول، وتنفيذ الصفقات على آفاق أقصر في ظل قابلية رصد جزئية. ولأن التغذية الراجعة تصل متأخرة وقد تكون ملتبسة، فقد تنتج النتائج الضعيفة عن اختيار الزوج أو سياسة التنفيذ أو كليهما. وتستخدم الطريقة المقترحة نماذج لغوية كبيرة بوصفها سياسات في كلا المستويين، وتكيفها عبر تحديثات للمطالبات بدلاً من الضبط الدقيق القائم على التدرج.
تُستخدم التغذية الراجعة النصية على مستوى المسارات والحلقات لتعديل تجريدات اختيار الأزواج وسلوك التنفيذ كلٌّ على حدة. ويرى المؤلفون أن هذا الفصل يساعد على عزل مصادر تغير الأداء والحد من عدم الاستقرار بين مستويي السياسة. وتشير التجارب على بيانات سوق حقيقية إلى تحسن متسق مقارنة بخطوط أساس تقليدية وأخرى قائمة على LLM. ولا تحدد الوثيقة مجموعات البيانات أو تكاليف التداول أو ضوابط المخاطر أو تصميم التقييم، لذا لا يمكن الحكم من هذا الوصف وحده على قابلية التداول الفعلي أو مدى تعميم النتائج.
الأفكار الرئيسية
- يفصل النهج بين اختيار الأزواج على أفق طويل وتنفيذ الصفقات على أفق أقصر.
- تعمل النماذج اللغوية الكبيرة كسياسات على مستويي التسلسل الهرمي للتداول.
- تستخدم تحديثات المطالبات تغذية راجعة نصية لتكييف السياسات دون ضبط دقيق قائم على التدرج.
- تتفوق التجارب المبلغ عنها على بيانات سوق حقيقية على خطوط الأساس التقليدية والقائمة على LLM، لكن تفاصيل التقييم غير متاحة.
الوسوم
النص الكامل
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading # Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.
يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0
أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.