رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی سلسله‌مراتبی با مدل زبانی برای معاملات جفتی

مقاله arXiv papers · نویسنده: Polydoros Giannouris et al.

خلاصه

این پژوهش معامله جفتی را مسئله‌ای سلسله‌مراتبی برای تصمیم‌گیری می‌داند که دو مرحله مرتبط دارد: انتخاب یک جفت دارایی در افق زمانی بلندتر و اجرای معاملات در افق‌های کوتاه‌تر، با مشاهده‌پذیری جزئی. از آنجا که بازخورد با تأخیر می‌رسد و ممکن است مبهم باشد، نتایج ضعیف می‌توانند ناشی از انتخاب جفت، سیاست اجرا یا هر دو باشند. روش پیشنهادی از مدل‌های زبانی بزرگ به‌عنوان سیاست در هر دو سطح استفاده می‌کند و آن‌ها را با به‌روزرسانی پرامپت‌ها، نه تنظیم دقیق مبتنی بر گرادیان، سازگار می‌سازد.

از بازخورد متنی در سطح مسیر و اپیزود برای تنظیم جداگانه انتزاع‌های انتخاب جفت و رفتار اجرا استفاده می‌شود. نویسندگان می‌گویند این جداسازی به شناسایی منشأ تغییرات عملکرد کمک می‌کند و ناپایداری میان دو سطح سیاست را کاهش می‌دهد. گزارش شده است که آزمایش‌ها روی داده‌های واقعی بازار، بهبودهای پیوسته‌ای نسبت به خط‌مبناهای سنتی و مبتنی بر LLM نشان می‌دهند. این سند مجموعه‌داده‌ها، هزینه‌های معامله، کنترل‌های ریسک یا طراحی ارزیابی را مشخص نمی‌کند؛ بنابراین فقط بر اساس این توصیف نمی‌توان امکان معامله زنده یا میزان تعمیم‌پذیری نتایج را سنجید.

ایده‌های کلیدی

  • این رویکرد انتخاب جفت در افق بلندمدت را از اجرای معامله در افق کوتاه‌تر جدا می‌کند.
  • مدل‌های زبانی بزرگ در هر دو سطح سلسله‌مراتب معاملاتی نقش سیاست را دارند.
  • به‌روزرسانی پرامپت‌ها با استفاده از بازخورد متنی، سیاست‌ها را بدون تنظیم دقیق مبتنی بر گرادیان سازگار می‌کند.
  • گزارش شده است که آزمایش‌ها روی داده‌های واقعی بازار از خط‌مبناهای سنتی و مبتنی بر LLM بهتر عمل می‌کنند، هرچند جزئیات ارزیابی ارائه نشده است.

برچسب‌ها

متن کامل
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading


# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading









Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.