یادگیری تقویتی برای آربیتراژ آماری در سهام جفتشده
خلاصه
این پژوهش چارچوبی بدون مدل مبتنی بر یادگیری تقویتی برای آربیتراژ آماری میان سهام جفتشده ارائه میکند. ابتدا با انتخاب ضرایب دارایی که سنجهای تجربی از مدتزمان لازم برای بازگشت اسپرد را کمینه میکنند، اسپردی بازگشتگر به میانگین میسازد. این رویکرد معیار زمان بازگشتِ مشاهدهشده را جایگزین اتکا به یک فرض ثابت مدل میکند.
چارچوب برای معامله از یادگیری تقویتی استفاده میکند تا استراتژی بازگشت به میانگین را انتخاب کند. حالت آن روندهای اخیر حرکت قیمت را نیز دربر میگیرد، نه اینکه فقط به فاصله اسپرد از میانگین بلندمدت اتکا کند؛ پاداش هم متناسب با ویژگیهای معامله بر مبنای بازگشت به میانگین طراحی شده است. شرح ارائهشده طرح را بیان میکند، اما نتیجهای از عملکرد تجربی، جزئیات آموزش یا مقایسه با استراتژیهای دیگر ندارد. بنابراین رویکرد را توضیح میدهد، اما اثربخشی عملی و استحکام آن را در اینجا اثبات نمیکند.
ایدههای کلیدی
- چارچوب با کمینهسازی سنجهای تجربی از مدتزمان لازم برای بازگشت اسپرد، اسپردهای سهام جفتشده را میسازد.
- ضرایب دارایی در فرایند ساخت اسپرد بهینه میشوند.
- برای انتخاب کنشهای معاملاتی اسپرد از یادگیری تقویتی استفاده میشود.
- بازنمایی حالت، علاوه بر زمینه بازگشت به میانگین، روندهای اخیر قیمت را نیز دربر میگیرد.
- شرح، شواهد عملکرد یا جزئیات پیادهسازی را گزارش نمیکند.
برچسبها
متن کامل
# Advanced Statistical Arbitrage with Reinforcement Learning # Advanced Statistical Arbitrage with Reinforcement Learning Statistical arbitrage is a prevalent trading strategy which takes advantage of mean reverse property of spread of paired stocks. Studies on this strategy often rely heavily on model assumption. In this study, we introduce an innovative model-free and reinforcement learning based framework for statistical arbitrage. For the construction of mean reversion spreads, we establish an empirical reversion time metric and optimize asset coefficients by minimizing this empirical mean reversion time. In the trading phase, we employ a reinforcement learning framework to identify the optimal mean reversion strategy. Diverging from traditional mean reversion strategies that primarily focus on price deviations from a long-term mean, our methodology creatively constructs the state space to encapsulate the recent trends in price movements. Additionally, the reward function is carefully tailored to reflect the unique characteristics of mean reversion trading.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.