सामग्री पर जाएं
लाइब्रेरी के सभी दस्तावेज़

गतिशील उत्तल जोखिम मापों के साथ पॉलिसी-ग्रेडिएंट रीइन्फ़ोर्समेंट लर्निंग

लेख arXiv papers · लेखक: Anthony Coache et al.

सारांश

यह दस्तावेज़ क्रमिक अनुकूलन के लिए मॉडल-मुक्त रीइन्फ़ोर्समेंट लर्निंग विधि प्रस्तुत करता है, जहाँ परिणामों का मूल्यांकन गतिशील उत्तल जोखिम मापों से किया जाता है। यह नीतियों का मूल्य आँकने के लिए समय-संगत डायनेमिक प्रोग्रामिंग सिद्धांत का उपयोग करता है, फिर बेहतर नीतियाँ खोजने के लिए पॉलिसी-ग्रेडिएंट अपडेट निकालता है। नीतियों को अनुकूलित करने के लिए न्यूरल नेटवर्क वाला एक्टर-क्रिटिक तरीका प्रस्तावित है।

यह विधि तीन कार्यों पर प्रदर्शित की गई है: सांख्यिकीय आर्बिट्राज ट्रेडिंग, वित्तीय हेजिंग और रोबोट का बाधा-बचाव नियंत्रण। इससे पता चलता है कि ढाँचा वित्तीय और गैर-वित्तीय, दोनों क्षेत्रों में लागू है, लेकिन विवरण में प्रदर्शन आँकड़े, तुलना के तरीके, बाज़ार संबंधी मान्यताएँ या कार्यान्वयन का विवरण नहीं है। इसलिए यह अनुकूलन संरचना और अनुप्रयोग क्षेत्र बताता है, जबकि ट्रेडिंग प्रभावशीलता और व्यावहारिक सीमाओं के प्रमाण निर्दिष्ट नहीं हैं।

मुख्य विचार

  • गतिशील उत्तल जोखिम माप अनिश्चित परिणामों के क्रम का मूल्यांकन करने का तरीका देते हैं।
  • संभावित नीतियों का मूल्य आँकने के लिए समय-संगत डायनेमिक प्रोग्रामिंग का उपयोग किया जाता है।
  • पॉलिसी-ग्रेडिएंट नियम और न्यूरल नेटवर्क वाला एक्टर-क्रिटिक तरीका नीति अनुकूलन में सहायक हैं।
  • प्रदर्शनों में सांख्यिकीय आर्बिट्राज, वित्तीय हेजिंग और रोबोट द्वारा बाधा-बचाव शामिल हैं।
  • उपलब्ध विवरण में तुलनात्मक परिणाम या बाज़ार कार्यान्वयन की मान्यताएँ नहीं दी गई हैं।

टैग

पूरा पाठ
# Reinforcement Learning with Dynamic Convex Risk Measures


# Reinforcement Learning with Dynamic Convex Risk Measures









We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.

स्रोत के लाइसेंस के तहत श्रेय सहित पूरा पाठ दिखाया गया है। लाइसेंस: abstract CC0

यह सारांश मूल स्रोत के आधार पर Stratmill के शोध एजेंट ने लिखा है; यह स्रोत की प्रति नहीं है।