انتخاب جفت و معامله همزمان با یادگیری تقویتی سلسلهمراتبی
خلاصه
این مقاله معاملات جفتی را مسئلهای تصمیمگیری یکپارچه میداند، نه فرایندی که ابتدا جفت دارایی را انتخاب کند و سپس آن را معامله کند. نویسندگان استدلال میکنند که جداسازی این مراحل میتواند اطلاعات مفیدی را کنار بگذارد: مرحله انتخاب ممکن است قابلیت معامله مؤثر جفت را نادیده بگیرد و عامل معاملهگر ممکن است به داراییهای انتخابشده بیشبرازش کند، بیآنکه از کل مجموعه داراییها بیاموزد.
روش یادگیری تقویتی سلسلهمراتبی آنها انتخاب جفت را به سیاست سطح بالا و اقدامات معاملاتی را به سیاست سطح پایین واگذار میکند. این دو سیاست بهطور مشترک بهینه میشوند تا تصمیمهای انتخاب و اجرا بر یکدیگر اثر بگذارند. گزارش شده است که آزمایشها با دادههای واقعی سهام، در مقایسه با روشهای موجود انتخاب و معامله، اثربخشی معاملات جفتی را بهبود میدهند. سند رقم مشخصی از عملکرد یا محدودیتهای آزمایشیِ جزئی ارائه نمیکند؛ بنابراین نشان نمیدهد این رویکرد تا چه حد به بازارها، طبقات دارایی یا هزینههای معاملاتی دیگر تعمیمپذیر است.
ایدههای کلیدی
- انتخاب جفت و اجرای معامله را میتوان بهعنوان بخشهای مرتبط یک وظیفه آموخت.
- سیاستی سطح بالا جفت دارایی را انتخاب میکند و سیاستی سطح پایین تصمیمهای معاملاتی را میگیرد.
- یادگیری مشترک میتواند اطلاعات عملکرد معامله را به مرحله انتخاب جفت بازگرداند.
- مطالعه، مقایسههایی با رویکردهای موجود را بر دادههای واقعی سهام گزارش میکند.
- توضیحات ارائهشده رقمهای عملکردی جزئی یا شواهدی فراتر از آزمایشهای سهام ندارند.
برچسبها
متن کامل
# Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning # Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning Pair trading is one of the most effective statistical arbitrage strategies which seeks a neutral profit by hedging a pair of selected assets. Existing methods generally decompose the task into two separate steps: pair selection and trading. However, the decoupling of two closely related subtasks can block information propagation and lead to limited overall performance. For pair selection, ignoring the trading performance results in the wrong assets being selected with irrelevant price movements, while the agent trained for trading can overfit to the selected assets without any historical information of other assets. To address it, in this paper, we propose a paradigm for automatic pair trading as a unified task rather than a two-step pipeline. We design a hierarchical reinforcement learning framework to jointly learn and optimize two subtasks. A high-level policy would select two assets from all possible combinations and a low-level policy would then perform a series of trading actions. Experimental results on real-world stock data demonstrate the effectiveness of our method on pair trading compared with both existing pair selection and trading methods.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.