रणनीति के 1,000 रूप। विजेता का मापा गया Sharpe 2.0। 5% की गलत सकारात्मक दर। ये आँकड़े मज़बूत नतीजे जैसे लगते हैं—जब तक आप यह न पूछें कि उसे खोजने के लिए कितनी कोशिशें की गईं। पर्याप्त कोशिशों के बाद, केवल शोर से भी भरोसेमंद दिखने वाला बैकटेस्ट सामने आ सकता है।
चौंकाने वाला आँकड़ा Sharpe नहीं है। वह है परीक्षणों की संख्या। हर इंडिकेटर विंडो, एंट्री थ्रेशहोल्ड, यूनिवर्स का चुनाव और छोड़ा गया विचार, संयोग से मिले अच्छे नतीजे को चुनने का एक और मौका है। अगर आपकी शोध प्रक्रिया उन कोशिशों को भूल जाती है, तो आपका भरोसे का हिसाब भी उन्हें नज़रअंदाज़ कर देता है।
ज़्यादा रणनीतियाँ आज़माने से विजेता बेहतर क्यों दिखने लगता है?
कल्पना करें कि आपने ऐसी 1,000 रणनीतियाँ जाँचीं जिनमें कोई वास्तविक बढ़त नहीं है। पारंपरिक परीक्षण के तहत हर एक के सांख्यिकीय रूप से महत्वपूर्ण दिखने की 5% संभावना है। वास्तविक शोध में ये परीक्षण पूरी तरह स्वतंत्र नहीं होते, लेकिन मूल बात सही है: जितने ज़्यादा विकल्प आप देखते हैं, उनमें से किसी एक के संयोगवश असाधारण दिखने की संभावना उतनी ही बढ़ती है।
अगर हर विकल्प स्वतंत्र होता, तब भी कम-से-कम एक के उस 5% सीमा को पार करने की संभावना करीब 99.4% होती। व्यवहार में, आस-पास की पैरामीटर सेटिंग अक्सर एक जैसा प्रदर्शन करती हैं, इसलिए 1,000 रूप, संयोग के 1,000 स्वतंत्र उछाल नहीं हैं। लेकिन प्रभावी कोशिशों की संख्या भी शायद ही कभी केवल 1 होती है।
नोटबुक में मैंने एक आम जाल देखा है: शोधकर्ता 5 से 100 तक के लुकबैक जाँचता है, Sharpe सतह का प्लॉट बनाता है, फिर साफ़-सुथरी दिखने वाली चोटी की रिपोर्ट करता है। संवेदनशीलता समझने के लिए यह सतह उपयोगी है। लेकिन चोटी भी एक खोज प्रक्रिया का नतीजा है; उसे उस थ्रेशहोल्ड से कम श्रेय मिलना चाहिए जिसे प्रयोग से पहले चुना गया हो।
शोध का परीक्षण किसे मानें?
उन फ़ैसलों की गिनती करें जिन पर देखे गए नतीजों का असर पड़ा। परीक्षण कोड किया हुआ बैकटेस्ट हो सकता है, लेकिन इक्विटी कर्व देखने के बाद किया गया मैन्युअल बदलाव भी हो सकता है। अगर पुरानी सेटिंग में रैली छूट जाने के बाद आपने स्टॉप को चौड़ा किया, तो उस बदलाव में परीक्षण अवधि की जानकारी इस्तेमाल हुई।
| शोध का कदम | क्या इसे आम तौर पर परीक्षण गिनते हैं? | क्यों |
|---|---|---|
| एक और सिग्नल थ्रेशहोल्ड जाँचना | हाँ | नतीजा विकल्प चुनने में मदद करता है |
| ड्रॉडाउन देखने के बाद तारीख़ की सीमा बदलना | हाँ | प्रदर्शन के जवाब में सैंपल चुना गया |
| दर्ज किए गए डेटा बग को ठीक करना | आम तौर पर नहीं | इस बदलाव से प्रयोग अपनी तय मंशा के मुताबिक़ हो जाता है |
| उसी फ़्रीज़ की हुई रणनीति को नई होल्डआउट अवधि पर चलाना | अभी कोई नया चयन परीक्षण नहीं | उस नतीजे के आधार पर ट्यून करने पर यह परीक्षण बन जाता है |
सीमा कहाँ खींचनी है, इसमें विवेक की ज़रूरत होती है। टाइपो ठीक करना, यह देखने के बाद किसी फ़ीचर को बदलने से अलग है कि वह कहाँ नाकाम हुआ। परिकल्पना, बदलाव, डेटा अवधि और नतीजे के साथ परीक्षणों का एक छोटा लॉग रखें। उसे सुरुचिपूर्ण बनाने की ज़रूरत नहीं; तारीख़ वाला CSV, 3 महीने बाद याददाश्त से अपनी खोज दोबारा बनाने से बेहतर है।
क्या मल्टीपल टेस्टिंग के लिए अपना Sharpe सुधार सकता हूँ?
Deflated Sharpe Ratio जैसी विधियाँ यह अनुमान लगाती हैं कि कई विकल्पों में से चयन करने पर दिखने वाला प्रदर्शन कितना पैदा हो सकता है; साथ ही वे रिटर्न वितरण और परीक्षणों की निर्भरता जैसे कारकों को भी ध्यान में रखती हैं। ये उपयोगी जाँच हैं, कोई ऐसी मशीन नहीं जो बिखरी हुई शोध प्रक्रिया को पक्के भरोसे में बदल दे। इनके नतीजे मान्यताओं और परीक्षणों की संख्या के विश्वसनीय होने पर निर्भर करते हैं।
मोटे तौर पर समझें: मान लें कि एक शोधकर्ता ने 400 रूप आज़माए, 1.8 का Sharpe पाया और अनुमान लगाया कि रिटर्न में काफ़ी skew और fat tails हैं। इस नतीजे की कसौटी, पहले से पंजीकृत एक परीक्षण से मिले 1.8 Sharpe से ऊँची होनी चाहिए। सुधार के बाद सबूत काफ़ी कमज़ोर हो सकते हैं; इससे यह साबित नहीं होता कि बढ़त वास्तविक है।
खोज का रिकॉर्ड तब रखें जब उसका बचाव करने की ज़रूरत पड़ने से पहले: विकल्पों की संख्या, पैरामीटर की सीमाएँ, देखी गई डेटा अवधियाँ और कोई भी मैन्युअल बदलाव। अगर ये बातें मालूम नहीं हैं, तो बैकटेस्ट को खोजपरक बताएँ।
पेपर ट्रेडिंग से पहले क्या होना चाहिए?
एक विकल्प फ़्रीज़ करें और उसे चलाने से पहले अगला मूल्यांकन तय करें। एक उपयोगी क्रम है: ट्रेनिंग डेटा से रणनीति चुनें, वैलिडेशन डेटा पर उसे जाँचें, फिर अंतिम अवधि या पेपर ट्रेडिंग की ऐसी विंडो सुरक्षित रखें जो डिज़ाइन में वापस जानकारी न दे। हर चरण एक अलग सवाल का जवाब देता है; अंतिम चरण पर बार-बार रणनीति बदलने से वही ट्रेनिंग डेटा बन जाता है।
यह भी देखें कि आस-पास की सेटिंग से एक जैसी तस्वीर मिलती है या नहीं। मामूली सकारात्मक नतीजों का चौड़ा दायरा आम तौर पर सुई जैसी एक चोटी से ज़्यादा भरोसेमंद होता है, हालाँकि मज़बूती से त्रुटिपूर्ण निष्पादन मॉडल सही नहीं हो जाता। फ़ीस, फंडिंग, इम्पैक्ट और इंस्ट्रूमेंट की उपलब्धता अब भी उसी के अनुरूप होनी चाहिए जिसका सामना रणनीति को करना पड़ सकता था।
पेपर ट्रेडिंग से परिचालन समानता के बारे में सबूत मिलते हैं: समय, ऑर्डर का प्रबंधन और यह कि लाइव शोध पाइपलाइन उम्मीद के मुताबिक़ काम करती है या नहीं। इससे पहले हो चुका चयन मिट नहीं सकता। पहला पेपर ऑर्डर भेजे जाने पर भी, संयोग से अच्छे निकले 1,000 बैकटेस्ट, 1,000 कोशिशें ही रहते हैं।
इसलिए जब बैकटेस्ट में Sharpe 2 आए, तो इक्विटी कर्व के साथ शोध का इतिहास भी माँगें। कितने विचार आज़माए गए? किन नतीजों ने अगला प्रयोग बदल दिया? रिपोर्ट का सबसे अहम आँकड़ा शायद यही जवाब हो।
← सभी पोस्ट


