الانتقال إلى المحتوى
جميع مستندات المكتبة

التعلم المعزز PPO لتداول الأسهم عالي التردد النشط

مقال arXiv papers · المؤلف: Antonio Briola et al.

الملخص

تصف الوثيقة نهجًا شاملًا للتعلم المعزز العميق في تداول الأسهم النشط عالي التردد. ويستخدم الوكلاء التحسين بسياسة المنطقة القريبة لتداول وحدة واحدة من سهم Intel، مع حالات مبنية على مجموعات مختلفة من سمات دفتر الأوامر محددة السعر. وتُختار بيانات التدريب عند تغير الأسعار بدرجة كبيرة لزيادة نسبة الإشارة إلى الضوضاء؛ ويُخصص شهر متصل للتحقق، يليه شهر منفصل للاختبار. وتُضبط المعلمات الفائقة باستخدام تحسين متسلسل قائم على النموذج.

يذكر المؤلفون أن الوكلاء يعثرون على أنماط متكررة في دفتر الأوامر ويحققون عوائد إيجابية مستقرة خلال فترة الاختبار رغم الظروف المتغيرة والمليئة بالضوضاء. وهذا دليل من تجربة محدودة النطاق على سهم واحد خلال سلسلة قصيرة من الأشهر. ولا يقدم الوصف إحصاءات العوائد أو تكاليف المعاملات أو مقارنات بالمعايير أو أدلة على بقاء السلوك المتعلم في فترات وأصول أخرى أو عند التنفيذ الفعلي. وقد يؤثر اختيار عينات التدريب وفق حركة السعر أيضًا فيما يتعلمه الوكلاء، لذا لا ينبغي اعتبار النتيجة المذكورة دليلًا عامًا على الربحية.

الأفكار الرئيسية

  • يستخدم الوكلاء التحسين بسياسة المنطقة القريبة لتداول وحدة واحدة من سهم واحد.
  • تختلف تمثيلات حالاتهم بحسب سمات دفتر الأوامر محددة السعر التي تتضمنها.
  • يركز التدريب على العينات ذات التحركات السعرية الكبيرة، مع فترتين منفصلتين للتحقق والاختبار.
  • تُضبط المعلمات الفائقة من خلال تحسين متسلسل قائم على النموذج.
  • تُذكر عوائد إيجابية في الاختبار، لكن التعميم الأوسع وتكاليف التنفيذ لم يثبتا.

الوسوم

النص الكامل
# Deep Reinforcement Learning for Active High Frequency Trading


# Deep Reinforcement Learning for Active High Frequency Trading









We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.