पोर्टफ़ोलियो रणनीतियों के लिए मज़बूत जोखिम-सचेत रीइन्फोर्समेंट लर्निंग
सारांश
यह कार्य जोखिम-सचेत प्रदर्शन मानदंडों के तहत नीतियों को अनुकूलित करने के लिए रीइन्फोर्समेंट लर्निंग तरीका विकसित करता है। यह रैंक-निर्भर अपेक्षित उपयोगिता से नीतियों का मूल्यांकन करता है, जिससे एजेंट लाभ और नकारात्मक परिणामों के बारे में अलग-अलग वरीयताएँ व्यक्त कर सकता है। मॉडल की अनिश्चितता से निपटने के लिए, नीति का आकलन मॉडल किए गए वितरण के चारों ओर वासरस्टीन दूरी के गोले के भीतर सबसे खराब स्थिति वाले रिटर्न वितरण के तहत किया जाता है। इससे नेस्टेड निर्णय समस्या बनती है: एजेंट नीति चुनता है, फिर एक प्रतिकूल पक्ष पास का ऐसा वितरण चुनता है जो उसका प्रदर्शन घटाता है।
लेखक नीति चयन और प्रतिकूल वितरण, दोनों समस्याओं के लिए नीति-ग्रेडिएंट सूत्र निकालते हैं। वे इस विधि का प्रदर्शन मज़बूत पोर्टफ़ोलियो आवंटन, बेंचमार्क अनुकूलन और स्टैटिस्टिकल आर्बिट्राज पर करते हैं। ये अनुप्रयोग ढाँचे का लक्षित दायरा दिखाते हैं, लेकिन दस्तावेज़ तुलनात्मक प्रदर्शन के आँकड़े, बाज़ार डेटा का विवरण या व्यावहारिक कार्यान्वयन मार्गदर्शन नहीं देता। इसलिए इसकी उपयोगिता किसी विशिष्ट ट्रेडिंग परिवेश में मॉडल, अनिश्चितता समुच्चय और जोखिम वरीयताओं के आगे सत्यापन पर निर्भर करती है।
मुख्य विचार
- रैंक-निर्भर अपेक्षित उपयोगिता नीतियों को लाभ और हानि के जोखिम के बीच अलग-अलग समझौते व्यक्त करने देती है।
- ढाँचा वासरस्टीन निकटता के भीतर सबसे खराब स्थिति वाले वितरण के मुकाबले हर नीति का मूल्यांकन करता है।
- आंतरिक प्रतिकूल समस्या ऐसा वितरण खोजती है जो चुनी गई नीति का प्रदर्शन घटा दे।
- लेखक नीति अनुकूलन और प्रतिकूल समस्या, दोनों के लिए नीति-ग्रेडिएंट निकालते हैं।
- प्रदर्शनों में पोर्टफ़ोलियो आवंटन, बेंचमार्क अनुकूलन और स्टैटिस्टिकल आर्बिट्राज शामिल हैं।
टैग
पूरा पाठ
# Robust Risk-Aware Reinforcement Learning # Robust Risk-Aware Reinforcement Learning We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.
स्रोत के लाइसेंस के तहत श्रेय सहित पूरा पाठ दिखाया गया है। लाइसेंस: abstract CC0
यह सारांश मूल स्रोत के आधार पर Stratmill के शोध एजेंट ने लिखा है; यह स्रोत की प्रति नहीं है।