رفتن به محتوا
همه اسناد کتابخانه

مقایسه DQN و PPO برای یادگیری تقویتی در معاملات فارکس

مقاله arXiv papers · نویسنده: Yun-Cheng Tsai et al.

خلاصه

این مطالعه یادگیری تقویتی عمیق را برای معاملات ارز خارجی به‌کار می‌گیرد و انتخاب معامله را به‌جای اتکا به پیش‌بینی مستقیم قیمت، دنباله‌ای از تصمیم‌ها در نظر می‌گیرد. سیاست آربیتراژ آماری Sure-Fire را به سه کنش ممکن تبدیل می‌کند و تاریخچه‌های پیوسته قیمت را به تصویرهای میدان زاویه‌ای گرمیان تبدیل می‌کند. نویسندگان یادگیری عمیق Q را با بهینه‌سازی سیاست مجاور و با استفاده از داده‌های EUR/USD، GBP/USD و AUD/USD در بازه‌های چهار‌ساعته مقایسه می‌کنند.

آموزش از داده‌های 1 اوت تا 30 نوامبر 2018 استفاده می‌کند و دوره آزمون دسامبر 2018 است. نویسندگان برای مدل‌هایی که می‌توانند رفتار پیچیده و تصادفی بازار و حالت‌هایی را که محیط معامله را به‌درستی توصیف می‌کنند بازنمایی کنند، عملکرد سرمایه‌گذاری مطلوب گزارش می‌کنند. توضیحات ارائه‌شده هیچ رقم بازده، سنجه ریسک، فرض کارمزد یا تنظیمات دقیق مدل را نمی‌دهد؛ بنابراین نمی‌توان قدرت و قابلیت مقایسه نتایج را در اینجا ارزیابی کرد. شواهد، آزمون امکان‌پذیری روی سه جفت‌ارز و یک برش تاریخی کوتاه است؛ اثبات نمی‌کند هیچ‌یک از دو الگوریتم در دوره‌های دیگر یا شرایط اجرای زنده قابل‌اعتماد عمل کنند.

ایده‌های کلیدی

  • این رویکرد معاملات فارکس را با یادگیری تقویتی، مسئله‌ای از تصمیم‌گیری پیاپی می‌داند.
  • در سیاست آربیتراژ آماریِ سازگارشده، سه کنش معاملاتی تعریف می‌شوند.
  • پنجره‌های قیمت برای ورود به مدل به تصویرهای میدان زاویه‌ای گرمیان رمزگذاری می‌شوند.
  • یادگیری عمیق Q و بهینه‌سازی سیاست مجاور روی سه جفت‌ارز مقایسه می‌شوند.
  • ارزیابی تاریخی کوتاه عملکرد مطلوبی گزارش می‌کند، اما سنجه‌های دقیق و فرض‌های هزینه معامله را ارائه نمی‌دهد.

برچسب‌ها

متن کامل
# Deep Reinforcement Learning for Foreign Exchange Trading


# Deep Reinforcement Learning for Foreign Exchange Trading









Reinforcement learning can interact with the environment and is suitable for applications in decision control systems. Therefore, we used the reinforcement learning method to establish a foreign exchange transaction, avoiding the long-standing problem of unstable trends in deep learning predictions. In the system design, we optimized the Sure-Fire statistical arbitrage policy, set three different actions, encoded the continuous price over a period of time into a heat-map view of the Gramian Angular Field (GAF) and compared the Deep Q Learning (DQN) and Proximal Policy Optimization (PPO) algorithms. To test feasibility, we analyzed three currency pairs, namely EUR/USD, GBP/USD, and AUD/USD. We trained the data in units of four hours from 1 August 2018 to 30 November 2018 and tested model performance using data between 1 December 2018 and 31 December 2018. The test results of the various models indicated that favorable investment performance was achieved as long as the model was able to handle complex and random processes and the state was able to describe the environment, validating the feasibility of reinforcement learning in the development of trading strategies.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.