رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی PPO برای معامله فعال پربسامد سهام

مقاله arXiv papers · نویسنده: Antonio Briola et al.

خلاصه

این سند رویکردی سرتاسری از یادگیری تقویتی عمیق برای معامله فعال پربسامد سهام شرح می‌دهد. عامل‌ها با بهینه‌سازی سیاست مجاور، یک واحد از سهام اینتل را معامله می‌کنند و حالت‌ها از مجموعه‌های متفاوتی از ویژگی‌های دفتر سفارش محدود ساخته می‌شوند. داده‌های آموزشی بر اساس تغییرات بزرگ قیمت انتخاب می‌شوند تا نسبت سیگنال به نویز افزایش یابد؛ یک ماه پیوسته برای اعتبارسنجی و ماهی جداگانه برای آزمون کنار گذاشته می‌شود. ابرپارامترها با بهینه‌سازی متوالی مبتنی بر مدل تنظیم می‌شوند.

نویسندگان گزارش می‌کنند که عامل‌ها الگوهای تکرارشونده‌ای در دفتر سفارش می‌یابند و با وجود شرایط پرنویز و متغیر، در دوره آزمون بازده مثبت پایداری تولید می‌کنند. این شواهد از آزمایشی با دامنه محدود روی یک سهم و در توالی کوتاهی از ماه‌ها به دست آمده است. شرح، آمار بازده، هزینه‌های تراکنش، مقایسه با معیار یا شواهدی ارائه نمی‌دهد که رفتار آموخته‌شده در دوره‌ها، دارایی‌ها و اجرای زنده دیگر دوام بیاورد. انتخاب نمونه‌های آموزشی بر اساس حرکت قیمت نیز ممکن است بر آنچه عامل‌ها می‌آموزند اثر بگذارد؛ بنابراین نتیجه گزارش‌شده را نباید اثباتی کلی بر سودآوری دانست.

ایده‌های کلیدی

  • عامل‌ها با بهینه‌سازی سیاست مجاور، یک واحد از یک سهم را معامله می‌کنند.
  • بازنمایی حالت آن‌ها از نظر ویژگی‌های دفتر سفارش محدودِ گنجانده‌شده متفاوت است.
  • آموزش بر نمونه‌های دارای حرکت بزرگ قیمت تمرکز دارد و دوره‌های اعتبارسنجی و آزمون جدا هستند.
  • ابرپارامترها با بهینه‌سازی متوالی مبتنی بر مدل تنظیم می‌شوند.
  • بازده مثبت در آزمون گزارش شده، اما تعمیم‌پذیری گسترده‌تر و هزینه‌های اجرا اثبات نشده‌اند.

برچسب‌ها

متن کامل
# Deep Reinforcement Learning for Active High Frequency Trading


# Deep Reinforcement Learning for Active High Frequency Trading









We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.