یادگیری تقویتی سلسلهمراتبی با مدل زبانی برای معاملات جفتی
خلاصه
این پژوهش معامله جفتی را مسئلهای سلسلهمراتبی برای تصمیمگیری میداند که دو مرحله مرتبط دارد: انتخاب یک جفت دارایی در افق زمانی بلندتر و اجرای معاملات در افقهای کوتاهتر، با مشاهدهپذیری جزئی. از آنجا که بازخورد با تأخیر میرسد و ممکن است مبهم باشد، نتایج ضعیف میتوانند ناشی از انتخاب جفت، سیاست اجرا یا هر دو باشند. روش پیشنهادی از مدلهای زبانی بزرگ بهعنوان سیاست در هر دو سطح استفاده میکند و آنها را با بهروزرسانی پرامپتها، نه تنظیم دقیق مبتنی بر گرادیان، سازگار میسازد.
از بازخورد متنی در سطح مسیر و اپیزود برای تنظیم جداگانه انتزاعهای انتخاب جفت و رفتار اجرا استفاده میشود. نویسندگان میگویند این جداسازی به شناسایی منشأ تغییرات عملکرد کمک میکند و ناپایداری میان دو سطح سیاست را کاهش میدهد. گزارش شده است که آزمایشها روی دادههای واقعی بازار، بهبودهای پیوستهای نسبت به خطمبناهای سنتی و مبتنی بر LLM نشان میدهند. این سند مجموعهدادهها، هزینههای معامله، کنترلهای ریسک یا طراحی ارزیابی را مشخص نمیکند؛ بنابراین فقط بر اساس این توصیف نمیتوان امکان معامله زنده یا میزان تعمیمپذیری نتایج را سنجید.
ایدههای کلیدی
- این رویکرد انتخاب جفت در افق بلندمدت را از اجرای معامله در افق کوتاهتر جدا میکند.
- مدلهای زبانی بزرگ در هر دو سطح سلسلهمراتب معاملاتی نقش سیاست را دارند.
- بهروزرسانی پرامپتها با استفاده از بازخورد متنی، سیاستها را بدون تنظیم دقیق مبتنی بر گرادیان سازگار میکند.
- گزارش شده است که آزمایشها روی دادههای واقعی بازار از خطمبناهای سنتی و مبتنی بر LLM بهتر عمل میکنند، هرچند جزئیات ارزیابی ارائه نشده است.
برچسبها
متن کامل
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading # Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.