الانتقال إلى المحتوى
جميع مستندات المكتبة

التعلم المعزز الاستكشافي للتداول المضاربي وتداول الأزواج

مقال arXiv papers · المؤلف: Yun Zhao et al.

الملخص

تصوغ هذه الدراسة التداول المضاربي بوصفه مسألة إيقاف أمثل متسلسلة، تختار أوقات الدخول والخروج في ظل دوال منفعة وعمليات أسعار عامة. وتبدأ بإرخاء مسألة الإيقاف عبر تمثيل أحداث الدخول والخروج بقفزات عمليات كوكس، التي يختار الوكيل ضوابط شدتها المحدودة.

في صياغة التعلم المعزز الاستكشافي، تضع السياسات العشوائية توزيعات احتمالية على هذه الشدات، وتُستخدم الإنتروبيا التفاضلية لشانون لتنظيم الدالة الهدف. وتنتج عن ذلك معادلات هاميلتون-جاكوبي-بلمان الاستكشافية سياسات مثلى بصيغة غيبس. ويثبت المؤلفون تقديرات للخطأ وتقارب هدف التعلم إلى دالة قيمة المسألة الأصلية، ثم يعرضون خوارزمية في تطبيق لتداول الأزواج. ولا يقدم الوصف بيانات أو نتائج أداء لهذا التطبيق، كما أن التقارب المذكور يتعلق بالهدف المصوغ، لا بنتيجة مثبتة للتداول الفعلي.

الأفكار الرئيسية

  • يُمثَّل التداول المضاربي بوصفه مسألة إيقاف أمثل لأوقات الدخول والخروج.
  • تمثل صياغة مُرخاة أحداث الإيقاف بقفزات عمليات كوكس، تضبطها شدات محدودة.
  • تُنظَّم سياسات الشدة العشوائية باستخدام الإنتروبيا التفاضلية لشانون.
  • يشتق الإطار معادلات HJB استكشافية وسياسات مثلى بصيغة غيبس.
  • يثبت العمل نتائج للخطأ والتقارب، ويعرض خوارزمية لتداول الأزواج.

الوسوم

النص الكامل
# Reinforcement Learning for Speculative Trading under Exploratory Framework


# Reinforcement Learning for Speculative Trading under Exploratory Framework









We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.