مقایسه DQN و PPO برای یادگیری تقویتی در معاملات فارکس
خلاصه
این مطالعه یادگیری تقویتی عمیق را برای معاملات ارز خارجی بهکار میگیرد و انتخاب معامله را بهجای اتکا به پیشبینی مستقیم قیمت، دنبالهای از تصمیمها در نظر میگیرد. سیاست آربیتراژ آماری Sure-Fire را به سه کنش ممکن تبدیل میکند و تاریخچههای پیوسته قیمت را به تصویرهای میدان زاویهای گرمیان تبدیل میکند. نویسندگان یادگیری عمیق Q را با بهینهسازی سیاست مجاور و با استفاده از دادههای EUR/USD، GBP/USD و AUD/USD در بازههای چهارساعته مقایسه میکنند.
آموزش از دادههای 1 اوت تا 30 نوامبر 2018 استفاده میکند و دوره آزمون دسامبر 2018 است. نویسندگان برای مدلهایی که میتوانند رفتار پیچیده و تصادفی بازار و حالتهایی را که محیط معامله را بهدرستی توصیف میکنند بازنمایی کنند، عملکرد سرمایهگذاری مطلوب گزارش میکنند. توضیحات ارائهشده هیچ رقم بازده، سنجه ریسک، فرض کارمزد یا تنظیمات دقیق مدل را نمیدهد؛ بنابراین نمیتوان قدرت و قابلیت مقایسه نتایج را در اینجا ارزیابی کرد. شواهد، آزمون امکانپذیری روی سه جفتارز و یک برش تاریخی کوتاه است؛ اثبات نمیکند هیچیک از دو الگوریتم در دورههای دیگر یا شرایط اجرای زنده قابلاعتماد عمل کنند.
ایدههای کلیدی
- این رویکرد معاملات فارکس را با یادگیری تقویتی، مسئلهای از تصمیمگیری پیاپی میداند.
- در سیاست آربیتراژ آماریِ سازگارشده، سه کنش معاملاتی تعریف میشوند.
- پنجرههای قیمت برای ورود به مدل به تصویرهای میدان زاویهای گرمیان رمزگذاری میشوند.
- یادگیری عمیق Q و بهینهسازی سیاست مجاور روی سه جفتارز مقایسه میشوند.
- ارزیابی تاریخی کوتاه عملکرد مطلوبی گزارش میکند، اما سنجههای دقیق و فرضهای هزینه معامله را ارائه نمیدهد.
برچسبها
متن کامل
# Deep Reinforcement Learning for Foreign Exchange Trading # Deep Reinforcement Learning for Foreign Exchange Trading Reinforcement learning can interact with the environment and is suitable for applications in decision control systems. Therefore, we used the reinforcement learning method to establish a foreign exchange transaction, avoiding the long-standing problem of unstable trends in deep learning predictions. In the system design, we optimized the Sure-Fire statistical arbitrage policy, set three different actions, encoded the continuous price over a period of time into a heat-map view of the Gramian Angular Field (GAF) and compared the Deep Q Learning (DQN) and Proximal Policy Optimization (PPO) algorithms. To test feasibility, we analyzed three currency pairs, namely EUR/USD, GBP/USD, and AUD/USD. We trained the data in units of four hours from 1 August 2018 to 30 November 2018 and tested model performance using data between 1 December 2018 and 31 December 2018. The test results of the various models indicated that favorable investment performance was achieved as long as the model was able to handle complex and random processes and the state was able to describe the environment, validating the feasibility of reinforcement learning in the development of trading strategies.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.