رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی اکتشافی برای معاملات سفته‌بازانه و جفتی

مقاله arXiv papers · نویسنده: Yun Zhao et al.

خلاصه

این مطالعه معامله سفته‌بازانه را به‌صورت مسئله توقف بهینه دنباله‌ای صورت‌بندی می‌کند که در آن زمان‌های ورود و خروج با توابع مطلوبیت و فرایندهای قیمت عمومی انتخاب می‌شوند. ابتدا مسئله توقف را با نمایش رویدادهای ورود و خروج به‌صورت جهش‌های فرایندهای کاکس ساده می‌کند؛ کنترل‌های کراندار شدت این فرایندها را عامل انتخاب می‌کند.

در صورت‌بندی یادگیری تقویتی اکتشافی، سیاست‌های تصادفی توزیع‌های احتمال را روی این شدت‌ها قرار می‌دهند و آنتروپی دیفرانسیلی شانون تابع هدف را منظم می‌کند. معادلات اکتشافی همیلتون–ژاکوبی–بلمنِ حاصل، سیاست‌های بهینه را در قالب گیبس به دست می‌دهند. نویسندگان برآوردهای خطا و همگرایی تابع هدف یادگیری به تابع ارزش مسئله اصلی را اثبات می‌کنند و سپس الگوریتمی را در کاربردی برای معاملات جفتی نشان می‌دهند. شرح ارائه‌شده هیچ داده یا نتیجه عملکردی برای آن کاربرد ندارد و همگرایی بیان‌شده به تابع هدف مدل‌شده مربوط است، نه نتیجه‌ای اثبات‌شده از معامله زنده.

ایده‌های کلیدی

  • معامله سفته‌بازانه به‌صورت مسئله توقف بهینه بر زمان‌های ورود و خروج مدل می‌شود.
  • صورت‌بندی ساده‌شده، رویدادهای توقف را با جهش‌های فرایند کاکس و شدت‌های کراندار تحت کنترل نمایش می‌دهد.
  • سیاست‌های شدت تصادفی با استفاده از آنتروپی دیفرانسیلی شانون منظم می‌شوند.
  • این چارچوب معادلات HJB اکتشافی و سیاست‌های بهینه در قالب گیبس را به دست می‌دهد.
  • این پژوهش نتایج خطا و همگرایی را اثبات می‌کند و الگوریتمی برای معاملات جفتی ارائه می‌دهد.

برچسب‌ها

متن کامل
# Reinforcement Learning for Speculative Trading under Exploratory Framework


# Reinforcement Learning for Speculative Trading under Exploratory Framework









We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.