क्लोज़िंग ऑक्शन वाले बाजारों के लिए लिक्विडेशन नीतियाँ सीखना
सारांश
यह अध्ययन ऐसे ट्रेडर पर विचार करता है जो लिमिट ऑर्डर बुक के माध्यम से बेचता है और फिर क्लोज़िंग ऑक्शन में निर्देशित शेड्यूल का उपयोग करके बची हुई इन्वेंटरी समायोजित करता है। दोनों चरण नीलामी के समापन मूल्य के पूर्वानुमान और नीलामी के दौरान मिलने वाले फ़ीडबैक से जुड़े हैं। लेखक सिम्युलेटेड बाजार में गहरे Q-नेटवर्क की तुलना प्रोजेक्टेड DDPG, TD3 और SAC रीइन्फ़ोर्समेंट लर्निंग नीतियों से करते हैं; इसमें कृत्रिम rough Heston कीमतें और ऐतिहासिक मध्य-मूल्य पथ उपयोग किए गए हैं।
नीतियों का चयन और मूल्यांकन इन्वेंटरी-दंडित कार्यान्वयन कमी के आधार पर किया जाता है, और मूल्यांकन को भारित प्रशिक्षण उद्देश्य से अलग रखा जाता है। रिपोर्ट किए गए सिमुलेशन में सीखी गई विधियों की दंडित कमी, Avellaneda–Stoikov और TWAP संदर्भ रणनीतियों से कम है। समान कृत्रिम तुलनाएँ यह भी दिखाती हैं कि नीलामी तक पहुँच से चारों सीखने की विधियों को मदद मिलती है। अधिक सघन नीलामी फ़ीडबैक से सीखने में सुधार होता है, जबकि समापन-मूल्य पूर्वानुमान का अतिरिक्त निर्णय-मूल्य शिक्षार्थी के अनुसार बदलता है। ये निष्कर्ष सिमुलेशन पर आधारित हैं; विवरण लाइव ट्रेडिंग में प्रदर्शन या अन्य बाजार स्थितियों में सामान्यीकरण स्थापित नहीं करता।
मुख्य विचार
- लिक्विडेशन प्रक्रिया सतत लिमिट-ऑर्डर ट्रेडिंग को क्लोज़िंग ऑक्शन के साथ जोड़ती है।
- नीलामी शेड्यूल सतत ट्रेडिंग के बाद बची इन्वेंटरी को समायोजित करते हैं।
- सिम्युलेटेड कीमतों और ऐतिहासिक मध्य-मूल्य पथों का उपयोग करके रीइन्फ़ोर्समेंट लर्निंग के चार तरीकों की तुलना की जाती है।
- सीखी गई नीतियों में Avellaneda–Stoikov और TWAP संदर्भों से कम इन्वेंटरी-दंडित कमी रिपोर्ट की गई है।
- समान कृत्रिम तुलनाओं में नीलामी तक पहुँच हर शिक्षार्थी को मदद देती है, जबकि पूर्वानुमान का मूल्य शिक्षार्थी पर निर्भर करता है।
टैग
पूरा पाठ
# Learning Optimal Liquidation with Closing Auctions # Learning Optimal Liquidation with Closing Auctions We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.
स्रोत के लाइसेंस के तहत श्रेय सहित पूरा पाठ दिखाया गया है। लाइसेंस: abstract CC0
यह सारांश मूल स्रोत के आधार पर Stratmill के शोध एजेंट ने लिखा है; यह स्रोत की प्रति नहीं है।