ट्रेडिंग नीतियों को फ़ाइन-ट्यून करने के लिए ऑनलाइन Decision Transformer
सारांश
यह लेख Online Decision Transformer (ODT) समझाता है, जो किसी परिवेश के साथ जारी अंतःक्रिया के ज़रिए Decision Transformer को फ़ाइन-ट्यून करने का तरीका है। यह देखता है कि आधार मॉडल हाल की अवस्थाओं, कार्रवाइयों और शेष रिटर्न मानों के आधार पर कार्रवाइयाँ कैसे चुनता है, फिर ODT की स्टोकेस्टिक नीति, अन्वेषण के लिए एन्ट्रॉपी बाधा और ट्रैजेक्टरी-आधारित रीप्ले बफ़र का वर्णन करता है। प्रशिक्षण संग्रहीत ट्रैजेक्टरी से निश्चित लंबाई के उप-अनुक्रम नमूना लेता है, और आरंभिक शेष-रिटर्न लक्ष्य विशेषज्ञ परिणामों पर आधारित पैमाने से तय होता है।
व्यावहारिक भाग पहले से प्रशिक्षित मॉडलों को MQL5 ट्रेडिंग सेटअप में अतिरिक्त ऑनलाइन प्रशिक्षण के लिए अनुकूलित करता है। कार्यान्वयन पहले की संरचना और रीप्ले डेटा रखता है, लेकिन स्पष्ट एन्ट्रॉपी पद और केवल सबसे अधिक रिटर्न वाली ऑफ़लाइन ट्रैजेक्टरी से आरंभ करने का प्रस्ताव छोड़ देता है। लेख अपने ऑनलाइन प्रशिक्षण प्रयोग में मॉडल दक्षता बेहतर होने की बात कहता है, साथ ही चेतावनी देता है कि कार्यक्रम तकनीक का प्रदर्शन हैं और लाइव ट्रेडिंग के लिए तैयार नहीं। दिए गए पाठ में विस्तृत माप या स्वतंत्र सत्यापन नहीं है, इसलिए बताया गया सुधार सामान्यीकरण या लाभप्रदता स्थापित नहीं करता।
मुख्य विचार
- ODT ऑफ़लाइन Decision Transformer प्रशिक्षण को ऑनलाइन अंतःक्रिया से आगे सीखने की सुविधा देता है।
- यह अन्वेषण को प्रोत्साहित करने के लिए स्टोकेस्टिक नीति और एन्ट्रॉपी की निचली सीमा उपयोग करता है।
- इसका रीप्ले बफ़र ट्रैजेक्टरी संग्रहीत करता है, जिनसे प्रशिक्षण के लिए निश्चित लंबाई के उप-अनुक्रम नमूना लिए जाते हैं।
- वर्णित MQL5 कार्यान्वयन एन्ट्रॉपी लॉस छोड़ता है और बफ़र में केवल शीर्ष प्रदर्शन वाली ट्रैजेक्टरी डालने के बजाय पूरा मौजूदा बफ़र उपयोग करता है।
- लेख मॉडल दक्षता बेहतर होने की बात बताता है, लेकिन यहाँ विस्तृत सत्यापन नहीं देता और सीधे लाइव उपयोग के विरुद्ध चेतावनी देता है।
टैग
यह सारांश मूल स्रोत के आधार पर Stratmill के शोध एजेंट ने लिखा है; यह स्रोत की प्रति नहीं है।