مواد پر جائیں
لائبریری کی تمام دستاویزات

پیش گوئی کے سگنلز کے ساتھ لمٹ آرڈر پر عمل درآمد کے لیے ڈیپ ری انفورسمنٹ لرننگ

مضمون arXiv papers · مصنف: Peer Nagy et al.

خلاصہ

یہ مطالعہ مختصر مدتی ٹریڈنگ پیش گوئی کو لمٹ آرڈر کی جگہ اور لمٹ آرڈر بک میں انوینٹری کے فیصلوں میں بدلنے کے لیے ڈیپ ری انفورسمنٹ لرننگ استعمال کرتا ہے۔ یہ تاریخی آرڈر بک پیغامات سے بنے نقلی NASDAQ ایکویٹی ماحول میں ایک ایجنٹ کو ABIDES سمیولیٹر کے ذریعے تربیت دیتا ہے۔ ایجنٹ موجودہ بک، حالیہ مارکیٹ تاریخ اور سمت کے سگنل کا مشاہدہ کرتا ہے، پھر ڈیپ ڈبل ڈویلنگ کیو لرننگ اور ترجیحی غیر ہم وقت تجربہ ری پلے کے ذریعے عمل درآمد کی پالیسی سیکھتا ہے۔

عمل درآمد کو کسی مخصوص پیش گوئی کے طریقے سے الگ جانچنے کے لیے محققین مختلف سطح کے شور والے مصنوعی الفا سگنلز آزماتے ہیں۔ وہ رپورٹ کرتے ہیں کہ سیکھا ہوا ایجنٹ انوینٹری سنبھالتا اور آرڈر مؤثر طریقے سے لگاتا ہے، اور اسی سگنل کے ساتھ دی گئی ہیورسٹک اسٹریٹیجی سے بہتر کارکردگی دکھاتا ہے۔ یہ موازنہ بیان کردہ سمیولیٹر میں عمل درآمد کے طریقے کی تائید کرتا ہے، مگر دستاویز کارکردگی کے اعداد یا لائیو مارکیٹ کے نتائج کا ثبوت نہیں دیتی۔ اس لیے مصنوعی سگنلز اور نقلی ماحول کا معیار اور حقیقت پسندی اطلاق سے متعلق نتائج کو محدود کرتے ہیں۔

اہم خیالات

  • ایجنٹ سمت پر مبنی پیش گوئی کو لمٹ آرڈر اور انوینٹری کے فیصلوں میں بدلنا سیکھتا ہے۔
  • تربیت تاریخی پیغامات پر مبنی NASDAQ لمٹ آرڈر بک سمیولیٹر میں ہوتی ہے۔
  • ایجنٹ بک کی حالت، حالیہ تاریخ اور مختصر مدتی پیش گوئی کا مشاہدہ کرتا ہے۔
  • مختلف سطح کے شور والے مصنوعی سگنلز محققین کو پیش گوئی کے معیار کے بجائے عمل درآمد پر توجہ دینے دیتے ہیں۔
  • سمیولیشن میں سیکھا ہوا طریقہ اسی سگنل والی ہیورسٹک سے بہتر ہے، مگر لائیو کارکردگی ثابت نہیں۔

ٹیگز

مکمل متن
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets


# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets









We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔