30 اگست، 2026 · statistics

بیک ٹیسٹ میں Sharpe کا مطلب کتنا ٹریڈز کے بعد ہوتا ہے؟

بیک ٹیسٹ میں Sharpe کا مطلب کتنا ٹریڈز کے بعد ہوتا ہے؟

یہ وہ سوال ہے جو مجھ سے سب سے زیادہ پوچھا جاتا ہے، کسی نہ کسی شکل میں، ان لوگوں کے ذریعے جنہوں نے ابھی اپنی پہلی حکمت عملی مکمل کی ہے: مجھے کتنے ٹریڈز درکار ہیں تاکہ نتیجہ حقیقی ہو؟ عموماً اس کے ساتھ ایک نمبر ہوتا ہے۔ "میرے 1,200 ٹریڈز ہیں، یہ کافی ہے، ہے نا؟" اور ایماندار جواب سب کو ناراض کرتا ہے، کیونکہ یہ بالکل ٹریڈ کی تعداد نہیں ہے۔

یہ پوری بات ایک لائن میں ہے، اور پھر میں باقی پوسٹ اس بات پر خرچ کروں گا کہ یہ کیوں تکلیف دہ ہے۔

1/√Tسالانہ Sharpe کی معیاری غلطی، T سالوں میں
±0.88کسی بھی 5 سالہ Sharpe کے گرد 95% کا بینڈ
1.4ان ہی 5 سالوں میں 100 شور حکمت عملیوں میں سے سب سے خوش نصیب Sharpe دکھاتا ہے

Sharpe ratio کی معیاری غلطی کیا ہے؟

ایک Sharpe کے لیے جو n دورانیہ واپسیوں پر حساب کیا گیا ہو، یہ فرض کرتے ہوئے کہ وہ آزاد ہیں اور تقریباً عام ہیں، نمونے کی غلطی یہ ہے:

SE(s) ≈ √((1 + s²/2) / n)

جہاں s اسی تعدد پر ماپا گیا Sharpe ہے۔ دونوں طرف کو سالانہ بنائیں اور کچھ صاف نکلتا ہے۔ k مشاہدات فی سال اور T سالوں کے ساتھ، سالانہ Sharpe S میں:

SE(S) ≈ √((1 + S²/(2k)) / T)

حسن میں 2k کو دیکھیں۔ یومیہ واپسیوں کے لیے k = 252 ہے، تو 2 کا Sharpe بھی نیومریٹر میں 4/504 ≈ 0.008 کا حصہ ڈالتا ہے۔ پوری اصطلاح 1 پر گر جاتی ہے۔ سالانہ Sharpe کی معیاری غلطی تقریباً 1/√T ہے، جہاں T آپ کے ڈیٹا کے کیلنڈر سال ہیں۔ یہ بالکل Sharpe خود پر منحصر نہیں ہے، اور یہ آپ کے نمونے کی تعدد پر منحصر نہیں ہے، اور یہ بالکل اس بات پر منحصر نہیں ہے کہ آپ نے کتنے ٹریڈز لیے۔

تو:

ڈیٹا کے سالSE(Sharpe)95% CI اگر آپ نے 1.5 ناپا
11.00−0.46 سے 3.46
20.710.11 سے 2.89
30.580.37 سے 2.63
50.450.62 سے 2.38
100.320.88 سے 2.12

دو سال کی تاریخ میں Sharpe 1.5 دکھانے والا بیک ٹیسٹ خود کو 95% کی سطح پر سکے فلپ سے الگ نہیں کر سکتا۔ یہ زیادہ تر کرپٹو تحقیق کے لیے بنیادی صورتحال ہے، کیونکہ زیادہ تر لوگوں کا صاف، بقاوٹ سے تصحیح شدہ، فیس درست ڈیٹا 2022 کے آس پاس شروع ہوتا ہے اور دلچسپ علامتوں میں سے آدھ 2023 سے پہلے موجود نہیں تھیں۔

لیکن میرے 40,000 ٹریڈز ہیں۔ کیا یہ مسئلہ حل نہیں کرتا؟

نہیں، اور یہ غلط فہمی ہے جسے میں سب سے زیادہ ختم کرنا چاہتا ہوں۔

ٹریڈ کی تعداد اور نمونے کی لمبائی مختلف مقدار ہیں اور ان میں سے صرف ایک فارمولے میں ہے۔ اگر آپ کی حکمت عملی 6 مہینوں میں 40,000 بار چلتی ہے، تو آپ کے پاس T = 0.5 اور SE ≈ 1.41 ہے۔ 2.0 کے ماپے گئے Sharpe پر آپ کا 95% وقفہ −0.8 سے 4.8 تک چلتا ہے۔ چالیس ہزار ٹریڈز اور ایماندار نتیجہ یہ ہے "اچھا ہو سکتا ہے، منفی بھی ہو سکتا ہے۔"

وجہ یہ ہے کہ وہ 40,000 ٹریڈز 40,000 مختلف مارکیٹ حالت پر 40,000 آزاد داو نہیں ہیں۔ یہ تقریباً 180 دنوں کی مارکیٹ رویے سے 40,000 نمونے ہیں، اور دن ایک دوسرے سے مرتبط ہیں، اور نظام اپنے اندر مرتبط ہیں۔ ایک اعلی تعدد والی اوسط واپسی کتاب جو 4 مہینے تک ہر روز منافع کماتی ہے، واقعی ایک شرط لگائی ہے — یہ کہ مختصر مدتی واپسی اس لیکویڈٹی نظام میں قائم رہتی ہے — اور اس شرط کا انحلال شاید چند آزاد بار ہوا ہے۔

جو ذہنی تبدیلی میں استعمال کرتا ہوں: نظاموں کو گنیں، فلز کو نہیں۔ اس حکمت عملی نے کتنی واقعی مختلف مارکیٹ حالات میں جینا ہے؟ ایک فنڈنگ کیری حکمت عملی جو ایک لمبے بنیادی مثبت دور میں چلی ہے، n = 1 دیکھی ہے، چاہے اس نے کتنے بھی گھنٹے کے دوبارہ توازن محفوظ کیے ہوں۔

فوری تشخیص: اپنے روزانہ P&L کو 20 دنوں کے بلاک لمبائی کے ساتھ بلاک بوسٹریپ کریں اور دوبارہ نمونے لیے گئے Sharpes کی پھیلاؤ دیکھیں۔ اگر 5واں فیصد صفر سے نیچے ہے، تو آپ کی ٹریڈ کی تعداد بے معنی ہے۔ اس میں numpy کی تقریباً 9 لائنیں لگتی ہیں اور اس نے مجھے دوسرے کسی بھی واحد جانچ سے زیادہ حکمت عملیوں سے روکا ہے۔

کیا یہ فارمولا حقیقی حکمت عملیوں کے لیے کام کرتا ہے؟

بالکل نہیں، اور یہ اس سمت میں غلطی کرتا ہے جو آپ کو پسند نہیں آئے گی۔ 1/√T نتیجہ IID عام واپسیوں کو مانتا ہے۔ حقیقی حکمت عملی کی واپسیاں خود متقابل اور ترچھی ہوتی ہیں، اور ترچھا پن عموماً کسی بھی چیز کے لیے منفی ہوتا ہے جو کیری، مختصر vol، یا اوسط واپسی جیسا لگتا ہے۔ Mertens کی تصحیح ان لمحات کو واپس لاتی ہے:

SE(s) ≈ √((1 + s²/2 − γ₃·s + (γ₄−3)·s²/4) / n)

γ₃ ترچھے پن اور γ₄ کے ساتھ kurtosis۔ منفی ترچھا پن −γ₃·s اصطلاح کو مثبت بناتا ہے، جو وقفہ کو چوڑا کرتا ہے۔ اضافی kurtosis اسے مزید چوڑا کرتا ہے۔ تقریباً −1.2 ترچھے پن اور 9 kurtosis والی ایک عام کرپٹو کیری P&L کے لیے، میں نے درست شدہ معیاری غلطی کو نادان ایک سے 30–40% بڑا دیکھا ہے۔ Lo کا 2002 کا مقالہ خود متقابل پہلو کو سنبھالتا ہے اور اثر اسی نشانی کا ہے: واپسیوں میں مثبت سلسلہ وار مطابقت نادان Sharpe کو بڑھاتی ہے اور ظاہری غلطی کو گھٹاتی ہے، جو ایک برا مجموعہ ہے۔

تو 1/√T کو اپنی عدم یقین دہی کے فلور کے طور پر لیں۔ یہ بہترین صورتحال ہے۔

اگر میں نے 500 تبدیلیوں کا جانچ کیا تو Sharpe کتنا اونچا ہونا چاہیے؟

اب ہم اس حصے پر آتے ہیں جو کسی کے لیے بھی اہم ہے جو خودکار تحقیق پائپ لائن چلا رہا ہے، جو صورتحال Stratmill میں ہر روز ہماری ہے: جنریشن ایجنٹ ایک امیدوار نہیں بناتا، سینکڑوں بناتا ہے۔

ایک معیاری عام سے M ڈرا کی متوقع زیادہ سے زیادہ تقریباً √(2 ln M) ہے۔ اپنی معیاری غلطی سے ضرب کریں اور آپ کو Sharpe ملتا ہے جو M واقعی بیکار حکمت عملیوں میں سے سب سے خوش نصیب دکھائے گا۔

جانچی گئی حکمت عملیاں√(2 ln M)شور میں سے بہترین Sharpe، 5yr (SE 0.45)شور میں سے بہترین، 2yr (SE 0.71)
102.150.961.52
1003.031.362.16
5003.531.582.50
5,0004.131.852.93

دوسری آخری قطار پڑھیں۔ اگر آپ نے دو سال کے ڈیٹا کے خلاف 500 امیدوار بنائے اور فاتح Sharpe 2.4 دکھاتا ہے، تو آپ نے بالکل کچھ نہیں پایا۔ یہ شور کی تہہ سے نیچے ہے۔ Bailey اور López de Prado کا deflated Sharpe اسے واریانس کے ساتھ رسمی بناتا ہے جو آپ کے ٹریل Sharpes کا √(2 ln M) کی خام جگہ لیتا ہے، اور اسے درست طریقے سے لاگو کرنا ارزش رکھتا ہے، لیکن خام ورژن آج رویے بدلنے کے لیے کافی ہے۔

دو چیزیں اسے ٹیبل سے زیادہ خراب بناتی ہیں۔ پہلے، M ان حکمت عملیوں کی تعداد نہیں ہے جو آپ نے محفوظ کیں، یہ ان کی تعداد ہے جو آپ نے جانچے، ہر پیرامیٹر ٹوئک شامل، ہر "بس مجھے 30-دورانیہ نظر واپسی آزمائیں" شامل، ہر بگ فکس کے بعد دوبارہ چلائیں۔ کوئی ایمانداری سے نہیں گنتا۔ دوسرے، آپ کے امیدوار آزاد ڈرا نہیں ہیں، تو √(2 ln M) مؤثر چوڑائی کو زیادہ ظاہر کرتا ہے، اگرچہ متقابل ٹریلز بھی اس بات کا مطلب ہیں کہ ایک خوش نصیب نظام ان سب کو ایک ساتھ اٹھاتا ہے۔

مقداری تحقیق میں سب سے خطرناک نمبر وہ ہے جو کسی نے لاگ نہیں کیا: آپ نے کتنی بار دیکھا۔

تو میں واقعی کیا کروں؟

پانچ چیزیں، اس ترتیب میں جو میں انہیں کروں گا۔

  1. ہر جانچ لاگ کریں۔ ہر بیک ٹیسٹ رن پر بڑھنے والا ایک کاؤنٹر، مستقل، کبھی ری سیٹ نہیں۔ اگر آپ نہیں بات سکتے کہ M کیا ہے، تو آپ نہیں بات سکتے کہ آپ کی حد کیا ہے۔ یہ پوری فہرست میں انجینئرنگ کا سب سے زیادہ قیمتی گھنٹہ ہے۔
  2. Sharpe کو ہمیشہ اس کے وقفے کے ساتھ رپورٹ کریں۔ کبھی ننگا نمبر نہ چھاپیں۔ ہمارے بیک ٹیسٹ رپورٹیں 1.72 ± 0.51 (2.9y, skew-adjusted) اور ± اختیاری نہیں ہے۔ یہ پوری ٹیم کے نتائج کے بارے میں بات کرنے کا طریقہ بدل دیتا ہے۔
  3. دیکھنے سے پہلے M اور T سے حد طے کریں۔ اوپر والی ٹیبل سے نمبر نکالیں اور اسے لکھیں۔ بعد کی حدیں وہ طریقہ ہے جس سے سب لوگ خود کو ایک منحنی فٹ میں بات کرتے ہیں۔
  4. نمونے سے محروم ہونے پر تعدد کو ترجیح دیں۔ آپ مزید کیلنڈر وقت نہیں بنا سکتے، لیکن آپ ایک ہی سگنل کو 40 غیر متقابل علامتوں پر چلا سکتے ہیں۔ یہ واقعی مؤثر n کو بڑھاتا ہے جس طریقے سے ٹریڈ کی تعدد بڑھانا نہیں کرتا۔ تعلقات کو دیکھیں — رسک آف گھنٹے میں 40 کرپٹو پرپس ایک آلات ہیں۔
  5. پھر اسے کاغذی تجارت کریں۔ آؤٹ آف سیمپل وقت ہر دن ایک دن جمع ہوتا ہے اور کوئی شارٹ کٹ نہیں ہے، جو بالکل اسی وجہ سے یہ واحد نمونہ ہے جس پر کوئی اوورفٹ نہیں کر سکتا۔

ان میں سے کوئی بھی مختصر نمونوں کو قابل استعمال نہیں بناتا۔ یہ آپ کو اس بات کے بارے میں ایماندار بناتا ہے کہ ایک مختصر نمونہ کیا سہارا دے سکتا ہے، جو زیادہ تر بیک ٹیسٹ رپورٹیں ظاہر کرنے کے لیے لکھی گئی ہیں اس سے کمزور دعویٰ ہے۔ دو سال کا Sharpe 1.5 ایک مفروضہ ہے جو کاغذی تجارت کے قابل ہے۔ یہ ایک تلاش نہیں ہے۔

sharpe ratiooverfittingbacktestingstatistical significancequant research
شیئر کریںXLinkedInFacebookRedditHacker NewsWhatsAppTelegramEmail
← تمام پوسٹس