पोर्टफोलियो अनुकूलन के लिए डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट
सारांश
यह कार्य जाँचता है कि क्या डीप रीइनफ़ोर्समेंट लर्निंग ऐसे परिवेशों में इष्टतम ट्रेडिंग रणनीतियाँ प्राप्त कर सकती है जिन्हें वर्णित करना आसान, लेकिन गणितीय रूप से चुनौतीपूर्ण है। लेखक डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट पर ध्यान देते हैं, जो परिवेश के साथ अंतःक्रिया के ज़रिए कार्रवाई चुनने की नीति सीखने की विधि है। वे ऐसी स्थितियाँ चुनते हैं जहाँ इष्टतम रणनीति या उसका निकट अनुमान पहले से ज्ञात है, ताकि सीखे गए व्यवहार और पुरस्कार की तुलना संदर्भ समाधान से की जा सके।
रिपोर्ट किए गए नतीजे में एजेंट ज्ञात रणनीतियों की मुख्य विशेषताएँ प्राप्त करता है और इष्टतम के करीब पुरस्कार पाता है। इससे परीक्षण किए गए परिवेशों में एल्गोरिदम के समाधानकर्ता के रूप में काम कर सकने का साक्ष्य मिलता है। अंश विशिष्ट बाज़ार मॉडल, पोर्टफोलियो बाधाएँ, प्रशिक्षण प्रक्रियाएँ या मूल्यांकन माप निर्दिष्ट नहीं करता। इसलिए इसका निष्कर्ष चुनी गई नियंत्रित स्थितियों तक सीमित है और शोरयुक्त लाइव बाज़ारों, लेन-देन लागतों के साथ, या इष्टतम नीति अज्ञात होने पर प्रदर्शन स्थापित नहीं करता।
मुख्य विचार
- अध्ययन ट्रेडिंग रणनीतियों के समाधानकर्ता के रूप में डीप रीइनफ़ोर्समेंट लर्निंग का मूल्यांकन करता है।
- यह गणितीय रूप से जटिल, लेकिन अवधारणात्मक रूप से सरल परिवेशों में डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट का उपयोग करता है।
- परीक्षण किए गए परिवेशों में तुलना के लिए ज्ञात या लगभग ज्ञात इष्टतम रणनीतियाँ हैं।
- रिपोर्ट किया गया एजेंट रणनीति की मुख्य विशेषताएँ प्राप्त करता है और लगभग इष्टतम पुरस्कार पाता है।
- अंश लाइव बाज़ार बाधाओं या अज्ञात इष्टतम नीतियों के अंतर्गत प्रदर्शन स्थापित नहीं करता।
टैग
पूरा पाठ
# Deep Deterministic Portfolio Optimization # Deep Deterministic Portfolio Optimization Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.
स्रोत के लाइसेंस के तहत श्रेय सहित पूरा पाठ दिखाया गया है। लाइसेंस: abstract CC0
यह सारांश मूल स्रोत के आधार पर Stratmill के शोध एजेंट ने लिखा है; यह स्रोत की प्रति नहीं है।