الانتقال إلى المحتوى
جميع مستندات المكتبة

مقارنة DQN وPPO للتعلم المعزز في تداول الفوركس

مقال arXiv papers · المؤلف: Yun-Cheng Tsai et al.

الملخص

تطبق هذه الدراسة التعلم المعزز العميق على تداول العملات الأجنبية، وتصوغ اختيار الصفقات كسلسلة من القرارات بدلًا من الاعتماد على التنبؤ المباشر بالأسعار. وتكيّف سياسة المراجحة الإحصائية Sure-Fire إلى ثلاثة إجراءات ممكنة، وتحول سجلات الأسعار المتصلة إلى صور المجال الزاوي الغرامي. ويقارن المؤلفون بين التعلم العميق على طريقة كيو والتحسين بسياسة المنطقة القريبة باستخدام بيانات EUR/USD وGBP/USD وAUD/USD بفواصل مدتها أربع ساعات.

يستخدم التدريب بيانات من 1 أغسطس حتى 30 نوفمبر 2018، بينما تمتد فترة الاختبار إلى ديسمبر 2018. ويفيد المؤلفون بأداء استثماري ملائم للنماذج القادرة على تمثيل سلوك السوق المعقد والعشوائي، وبحالات تصف بيئة التداول على نحو كافٍ. ولا يقدم الوصف أرقامًا للعوائد أو مقاييس للمخاطر أو افتراضات للرسوم أو إعدادات تفصيلية للنموذج، لذا لا يمكن تقييم قوة النتائج وقابليتها للمقارنة هنا. والدليل هو اختبار جدوى على ثلاثة أزواج عملات ضمن تقسيم تاريخي موجز؛ ولا يثبت أن أيًا من الخوارزميتين سيحقق أداءً موثوقًا في فترات أخرى أو في ظروف التنفيذ الفعلي.

الأفكار الرئيسية

  • يتعامل النهج مع تداول الفوركس بوصفه مسألة قرارات متتابعة باستخدام التعلم المعزز.
  • تُحدد ثلاثة إجراءات تداول ضمن سياسة مراجحة إحصائية مكيّفة.
  • تُرمّز نوافذ الأسعار على شكل صور مجال زاوي غرامي لإدخالها إلى النموذج.
  • تُقارن طريقتا التعلم العميق على طريقة كيو والتحسين بسياسة المنطقة القريبة على ثلاثة أزواج عملات.
  • يفيد التقييم التاريخي الموجز بأداء ملائم، لكنه لا يتضمن مقاييس تفصيلية أو افتراضات لتكاليف التداول.

الوسوم

النص الكامل
# Deep Reinforcement Learning for Foreign Exchange Trading


# Deep Reinforcement Learning for Foreign Exchange Trading









Reinforcement learning can interact with the environment and is suitable for applications in decision control systems. Therefore, we used the reinforcement learning method to establish a foreign exchange transaction, avoiding the long-standing problem of unstable trends in deep learning predictions. In the system design, we optimized the Sure-Fire statistical arbitrage policy, set three different actions, encoded the continuous price over a period of time into a heat-map view of the Gramian Angular Field (GAF) and compared the Deep Q Learning (DQN) and Proximal Policy Optimization (PPO) algorithms. To test feasibility, we analyzed three currency pairs, namely EUR/USD, GBP/USD, and AUD/USD. We trained the data in units of four hours from 1 August 2018 to 30 November 2018 and tested model performance using data between 1 December 2018 and 31 December 2018. The test results of the various models indicated that favorable investment performance was achieved as long as the model was able to handle complex and random processes and the state was able to describe the environment, validating the feasibility of reinforcement learning in the development of trading strategies.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.