مواد پر جائیں
لائبریری کی تمام دستاویزات

فعال ہائی فریکوئنسی اسٹاک ٹریڈنگ کے لیے PPO ری اِنفورسمنٹ لرننگ

مضمون arXiv papers · مصنف: Antonio Briola et al.

خلاصہ

دستاویز فعال ہائی فریکوئنسی اسٹاک ٹریڈنگ کے لیے گہری ری اِنفورسمنٹ لرننگ کا ایک مکمل طریقہ بیان کرتی ہے۔ ایجنٹس پراکسمل پالیسی آپٹیمائزیشن استعمال کرتے ہوئے Intel اسٹاک کی ایک اکائی ٹریڈ کرتے ہیں، اور حالتیں لمٹ آرڈر بک کی مختلف خصوصیات سے بناتے ہیں۔ سگنل اور شور کا تناسب بڑھانے کے لیے بڑے قیمت تغیرات والے تربیتی ڈیٹا منتخب کیے جاتے ہیں؛ ایک مسلسل مہینہ توثیق کے لیے مختص ہے، جس کے بعد ایک الگ مہینہ ٹیسٹنگ کے لیے ہے۔ ہائپر پیرامیٹرز کو تسلسلی ماڈل پر مبنی اصلاح سے موزوں بنایا جاتا ہے۔

مصنفین رپورٹ کرتے ہیں کہ ایجنٹس آرڈر بک میں بار بار آنے والے پیٹرنز تلاش کرتے ہیں اور شور اور بدلتے حالات کے باوجود آزمائشی مدت میں مستحکم مثبت منافع دیتے ہیں۔ یہ ایک اسٹاک اور چند ماہ کے محدود تجربے کے شواہد ہیں۔ تفصیل میں منافع کے اعدادوشمار، لین دین کی لاگت، معیاروں سے موازنہ یا یہ شواہد نہیں کہ سیکھا ہوا رویہ دوسرے ادوار، اثاثوں اور لائیو اجرا میں قائم رہے گا۔ قیمت کی حرکت کے مطابق تربیتی نمونوں کا انتخاب ایجنٹس کے سیکھنے کے عمل کو بھی شکل دے سکتا ہے، اس لیے رپورٹ شدہ نتیجے کو منافع بخشی کا عمومی ثبوت نہ سمجھیں۔

اہم خیالات

  • ایجنٹس پراکسمل پالیسی آپٹیمائزیشن سے ایک اسٹاک کی ایک اکائی ٹریڈ کرتے ہیں۔
  • ان کی حالتوں کی نمائندگی میں لمٹ آرڈر بک کی شامل خصوصیات مختلف ہیں۔
  • تربیت میں قیمت کی بڑی حرکات والے نمونوں پر زور ہے، جبکہ توثیق اور ٹیسٹ کے ادوار الگ ہیں۔
  • ہائپر پیرامیٹرز کو تسلسلی ماڈل پر مبنی اصلاح کے ذریعے موزوں کیا جاتا ہے۔
  • مثبت آزمائشی منافع رپورٹ کیا گیا ہے، مگر وسیع تر عمومیت اور اجرا کی لاگت ثابت نہیں۔

ٹیگز

مکمل متن
# Deep Reinforcement Learning for Active High Frequency Trading


# Deep Reinforcement Learning for Active High Frequency Trading









We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔