یادگیری تقویتی اکتشافی برای معاملات سفتهبازانه و جفتی
خلاصه
این مطالعه معامله سفتهبازانه را بهصورت مسئله توقف بهینه دنبالهای صورتبندی میکند که در آن زمانهای ورود و خروج با توابع مطلوبیت و فرایندهای قیمت عمومی انتخاب میشوند. ابتدا مسئله توقف را با نمایش رویدادهای ورود و خروج بهصورت جهشهای فرایندهای کاکس ساده میکند؛ کنترلهای کراندار شدت این فرایندها را عامل انتخاب میکند.
در صورتبندی یادگیری تقویتی اکتشافی، سیاستهای تصادفی توزیعهای احتمال را روی این شدتها قرار میدهند و آنتروپی دیفرانسیلی شانون تابع هدف را منظم میکند. معادلات اکتشافی همیلتون–ژاکوبی–بلمنِ حاصل، سیاستهای بهینه را در قالب گیبس به دست میدهند. نویسندگان برآوردهای خطا و همگرایی تابع هدف یادگیری به تابع ارزش مسئله اصلی را اثبات میکنند و سپس الگوریتمی را در کاربردی برای معاملات جفتی نشان میدهند. شرح ارائهشده هیچ داده یا نتیجه عملکردی برای آن کاربرد ندارد و همگرایی بیانشده به تابع هدف مدلشده مربوط است، نه نتیجهای اثباتشده از معامله زنده.
ایدههای کلیدی
- معامله سفتهبازانه بهصورت مسئله توقف بهینه بر زمانهای ورود و خروج مدل میشود.
- صورتبندی سادهشده، رویدادهای توقف را با جهشهای فرایند کاکس و شدتهای کراندار تحت کنترل نمایش میدهد.
- سیاستهای شدت تصادفی با استفاده از آنتروپی دیفرانسیلی شانون منظم میشوند.
- این چارچوب معادلات HJB اکتشافی و سیاستهای بهینه در قالب گیبس را به دست میدهد.
- این پژوهش نتایج خطا و همگرایی را اثبات میکند و الگوریتمی برای معاملات جفتی ارائه میدهد.
برچسبها
متن کامل
# Reinforcement Learning for Speculative Trading under Exploratory Framework # Reinforcement Learning for Speculative Trading under Exploratory Framework We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.