حکمتِ عملی کی 1,000 اقسام۔ کامیاب حکمتِ عملی کا ناپا گیا شارپ تناسب 2.0۔ غلط مثبت نتیجے کی شرح 5%۔ یہ اعداد مضبوط نتیجے کا تاثر دیتے ہیں، یہاں تک کہ آپ پوچھیں کہ اسے ڈھونڈنے کے لیے کتنی کوششیں کی گئیں۔ کافی کوششوں کے بعد محض شور سے بھی بیک ٹیسٹ کا قائل کن نتیجہ نکل سکتا ہے۔
حیران کن عدد شارپ تناسب نہیں، بلکہ آزمائشوں کی تعداد ہے۔ ہر انڈیکیٹر ونڈو، انٹری حد، اثاثوں کے مجموعے کا انتخاب، اور ترک کیا گیا خیال ایک خوش قسمت نتیجہ چننے کا ایک اور موقع ہے۔ اگر آپ کا تحقیقی طریقۂ کار ان کوششوں کو نظرانداز کرتا ہے، تو آپ کا اعتماد کا حساب بھی انہیں نظرانداز کرے گا۔
زیادہ حکمتِ عملی آزمانے سے کامیاب حکمتِ عملی بہتر کیوں دکھائی دیتی ہے؟
سوچیں کہ آپ ایسی 1,000 حکمتِ عملیاں آزماتے ہیں جن میں کوئی حقیقی برتری نہیں۔ روایتی آزمائش میں ہر ایک کے شماریاتی طور پر اہم دکھائی دینے کا امکان 5% ہے۔ حقیقی تحقیق میں یہ آزمائشیں ایک دوسرے سے مکمل طور پر آزاد نہیں ہوتیں، لیکن بنیادی بات یہی رہتی ہے: جتنے زیادہ امیدواروں کا جائزہ لیں گے، اتنا ہی زیادہ امکان ہوگا کہ کوئی ایک اتفاقاً غیر معمولی نظر آئے۔
اگر ہر امیدوار ایک دوسرے سے آزاد بھی ہو، تو کم از کم ایک کے 5% کی حد پار کرنے کا امکان تقریباً 99.4% ہے۔ عملی تحقیق میں قریب قریب پیرامیٹر سیٹنگز اکثر ملتے جلتے نتائج دیتی ہیں، اس لیے 1,000 اقسام کا مطلب 1,000 آزاد سکے اچھالنا نہیں۔ مگر مؤثر کوششوں کی تعداد بھی شاذ ہی ایک ہوتی ہے۔
نوٹ بکس میں مجھے ایک چھوٹی سی پھسلن اکثر نظر آتی ہے: محقق 5 سے 100 تک لُک بیک آزماتا ہے، شارپ تناسب کا سطحی گراف بناتا ہے، پھر صاف ستھری چوٹی کو رپورٹ کر دیتا ہے۔ یہ سطحی گراف حساسیت سمجھنے میں مفید ہے۔ مگر چوٹی بھی تلاش کا نتیجہ ہے، اور اسے اس حد سے کم اہمیت دینی چاہیے جو تجربے سے پہلے طے کی گئی ہو۔
تحقیقی آزمائش میں کیا شمار ہوتا ہے؟
ان فیصلوں کو شمار کریں جو دیکھے گئے نتائج سے متاثر ہوئے ہوں۔ آزمائش کوڈ کے ذریعے چلایا گیا بیک ٹیسٹ ہو سکتا ہے، مگر ایک دستی تبدیلی بھی ہو سکتی ہے جو ایکویٹی کَرو دیکھنے کے بعد کی گئی ہو۔ اگر پرانی سیٹنگ میں تیزی سے آنے والی بڑھوتری رہ گئی، اس لیے آپ نے اسٹاپ کی حد بڑھا دی، تو اس تبدیلی میں ٹیسٹ کی مدت کی معلومات استعمال ہوئیں۔
| تحقیقی اقدام | کیا عموماً اسے آزمائش شمار کیا جاتا ہے؟ | وجہ |
|---|---|---|
| سگنل کی ایک اور حد آزمانا | ہاں | نتیجہ امیدوار منتخب کرنے میں مدد دیتا ہے |
| ڈرا ڈاؤن دیکھنے کے بعد تاریخوں کی حد بدلنا | ہاں | کارکردگی دیکھ کر نمونہ منتخب کیا گیا |
| دستاویزی ڈیٹا بگ درست کرنا | عموماً نہیں | تبدیلی سے طے شدہ تجربہ بحال ہوتا ہے |
| اسی منجمد حکمتِ عملی کو نئے ہولڈ آؤٹ دورانیے پر چلانا | ابھی کوئی نئی انتخابی آزمائش نہیں | اگر آپ اس نتیجے کی بنیاد پر سیٹنگز بہتر کریں تو یہ ایک آزمائش بن جاتی ہے |
حد کا تعین کرنے میں فیصلہ کرنا پڑتا ہے۔ ٹائپنگ کی غلطی درست کرنا، ناکامی کی جگہ دیکھ کر فیچر بدلنے سے مختلف ہے۔ مفروضے، تبدیلی، ڈیٹا کے دورانیے اور نتیجے کے ساتھ ایک مختصر آزمائشی لاگ رکھیں۔ اسے نفیس بنانے کی ضرورت نہیں؛ تاریخ درج CSV تین ماہ بعد یادداشت سے اپنی تلاش دوبارہ ترتیب دینے سے بہتر ہے۔
کیا میں متعدد آزمائشوں کے لیے اپنے شارپ تناسب کی اصلاح کر سکتا ہوں؟
ڈیفلیٹڈ شارپ ریشو جیسے طریقے اندازہ لگاتے ہیں کہ کتنے امیدواروں میں سے انتخاب کرنے کے باعث کتنی ظاہری کارکردگی سامنے آ سکتی ہے، اور اس میں منافع کی تقسیم اور آزمائشوں کے باہمی تعلق جیسے عوامل بھی شامل ہوتے ہیں۔ یہ مفید تشخیصی طریقے ہیں، ایسی مشین نہیں جو بے ترتیب تحقیقی عمل کو یقین میں بدل دے۔ ان کے نتائج مفروضوں اور آزمائشوں کی تعداد کے قابلِ اعتبار ہونے پر منحصر ہیں۔
ایک سرسری اندازے کے لیے فرض کریں کہ ایک محقق نے 400 اقسام آزمائیں، 1.8 کا شارپ تناسب پایا، اور اندازہ لگایا کہ منافع میں خاصا اسکیو اور موٹی دُمیں ہیں۔ اس نتیجے کے لیے اس 1.8 کے شارپ تناسب سے زیادہ سخت معیار ہونا چاہیے جو پہلے سے رجسٹرڈ ایک آزمائش سے ملا ہو۔ اصلاح ثبوت کو کافی کمزور کر سکتی ہے؛ یہ نہیں بتا سکتی کہ برتری حقیقی ہے۔
تلاش کی تفصیل اس وقت درج کریں جب اس کا دفاع کرنے کی ضرورت پیش آنے سے پہلے ہی ہو: امیدواروں کی تعداد، پیرامیٹر کی حدود، دیکھے گئے ڈیٹا کے دورانیے، اور دستی تبدیلیاں۔ اگر یہ تفصیلات معلوم نہ ہوں، تو بیک ٹیسٹ کو تجرباتی قرار دیں۔
پیپر ٹریڈنگ سے پہلے کیا ہونا چاہیے؟
ایک امیدوار منتخب کر کے منجمد کریں، اور اسے چلانے سے پہلے اگلی جانچ کا طریقہ طے کریں۔ ایک مفید ترتیب یہ ہے کہ تربیتی ڈیٹا سے حکمتِ عملی منتخب کریں، توثیقی ڈیٹا پر اس کا جائزہ لیں، پھر آخری مدت یا پیپر ٹریڈنگ کی ایسی کھڑکی محفوظ رکھیں جس کے نتائج ڈیزائن میں واپس شامل نہ ہوں۔ ہر مرحلہ ایک الگ سوال کا جواب دیتا ہے؛ آخری مرحلے کے نتائج پر بار بار حکمتِ عملی بدلنے سے وہ مزید تربیتی ڈیٹا بن جاتا ہے۔
یہ بھی دیکھیں کہ آس پاس کی سیٹنگز سے بھی وہی کہانی سامنے آتی ہے یا نہیں۔ معمولی طور پر مثبت نتائج کا وسیع علاقہ عموماً سوئی جیسی ایک چوٹی سے زیادہ قابلِ اعتبار ہوتا ہے، اگرچہ مضبوطی ناقص عمل درآمد کے ماڈل کو درست نہیں کرتی۔ فیس، فنڈنگ، مارکیٹ امپیکٹ، اور انسٹرومنٹ کی دستیابی پھر بھی اس صورتِ حال سے مطابقت رکھنی چاہیے جس کا سامنا حکمتِ عملی کو ہو سکتا تھا۔
پیپر ٹریڈنگ سے عملی مطابقت کے بارے میں مزید ثبوت ملتا ہے: وقت بندی، آرڈر ہینڈلنگ، اور آیا لائیو تحقیقی پائپ لائن توقع کے مطابق کام کرتی ہے۔ یہ پہلے سے ہو چکے انتخابی عمل کو مٹا نہیں سکتی۔ جب پہلا پیپر آرڈر بھیجا جائے گا، تو ہزار خوش قسمت بیک ٹیسٹ پھر بھی ہزار کوششیں ہی رہیں گے۔
لہٰذا جب بیک ٹیسٹ 2 کا شارپ تناسب دکھائے، تو ایکویٹی کَرو کے ساتھ تحقیق کی پوری تاریخ بھی مانگیں۔ کتنے خیالات آزمائے گئے؟ کن نتائج نے اگلے تجربے کو بدلا؟ رپورٹ میں شاید یہی سب سے اہم شماریاتی عدد ہو۔
← تمام پوسٹس


