सामग्री पर जाएं
लाइब्रेरी के सभी दस्तावेज़

पूर्वानुमान संकेतों के साथ लिमिट-ऑर्डर निष्पादन हेतु डीप रीइन्फोर्समेंट लर्निंग

लेख arXiv papers · लेखक: Peer Nagy et al.

सारांश

यह अध्ययन डीप रीइन्फोर्समेंट लर्निंग का उपयोग करके अल्पकालिक ट्रेडिंग पूर्वानुमान को लिमिट-ऑर्डर लगाने और लिमिट ऑर्डर बुक में इन्वेंटरी संबंधी निर्णयों में बदलता है। यह ऐतिहासिक ऑर्डर-बुक संदेशों से बने सिम्युलेटेड NASDAQ इक्विटी परिवेश में एजेंट को प्रशिक्षित करता है, जिसमें ABIDES सिम्युलेटर का उपयोग किया गया है। एजेंट मौजूदा बुक, हालिया बाज़ार इतिहास और दिशात्मक संकेत देखता है, फिर Deep Double Duelling Q-learning और प्राथमिकता-आधारित एसिंक्रोनस अनुभव पुनःप्रयोग के साथ निष्पादन नीति सीखता है।

किसी खास पूर्वानुमान विधि से अलग निष्पादन का आकलन करने के लिए, शोधकर्ता अलग-अलग शोर स्तरों वाले सिंथेटिक अल्फ़ा संकेतों का परीक्षण करते हैं। उनके अनुसार, सीखा हुआ एजेंट इन्वेंटरी का प्रबंधन और ऑर्डर लगाना प्रभावी ढंग से करता है तथा समान संकेत पाने वाली ह्यूरिस्टिक रणनीति से बेहतर प्रदर्शन करता है। यह तुलना वर्णित सिम्युलेटर के भीतर निष्पादन विधि का समर्थन करती है, लेकिन दस्तावेज़ प्रदर्शन के आँकड़े या लाइव बाज़ार के नतीजों का प्रमाण नहीं देता। इसलिए सिंथेटिक संकेतों और सिम्युलेटेड परिवेश की गुणवत्ता और यथार्थता, वास्तविक उपयोग में लागू करने से जुड़े निष्कर्षों को सीमित करती है।

मुख्य विचार

  • एजेंट दिशात्मक पूर्वानुमान को लिमिट-ऑर्डर और इन्वेंटरी संबंधी निर्णयों में बदलना सीखता है।
  • प्रशिक्षण में ऐतिहासिक संदेशों पर आधारित NASDAQ लिमिट ऑर्डर बुक सिम्युलेटर का उपयोग होता है।
  • एजेंट बुक की स्थिति, हालिया इतिहास और अल्पकालिक पूर्वानुमान देखता है।
  • अलग-अलग शोर वाले सिंथेटिक संकेत शोधकर्ताओं को पूर्वानुमान गुणवत्ता के बजाय निष्पादन पर ध्यान देने देते हैं।
  • सिमुलेशन में सीखी हुई नीति समान संकेत इस्तेमाल करने वाली ह्यूरिस्टिक से बेहतर है, हालांकि लाइव प्रदर्शन स्थापित नहीं है।

टैग

पूरा पाठ
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets


# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets









We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.

स्रोत के लाइसेंस के तहत श्रेय सहित पूरा पाठ दिखाया गया है। लाइसेंस: abstract CC0

यह सारांश मूल स्रोत के आधार पर Stratmill के शोध एजेंट ने लिखा है; यह स्रोत की प्रति नहीं है।