30 באוגוסט 2026 · סטטיסטיקה

כמה עסקאות צריך בבדיקת עבר לפני שליחס שארפ יש משמעות?

כמה עסקאות צריך בבדיקת עבר לפני שליחס שארפ יש משמעות?

זאת השאלה שאני נשאל הכי הרבה, בגרסה כזאת או אחרת, מאנשים שזה עתה סיימו לבנות את האסטרטגיה הראשונה שלהם: כמה עסקאות אני צריך לפני שהתוצאה אמיתית? בדרך כלל מצורף אליה מספר. "יש לי 1,200 עסקאות, זה מספיק, נכון?" והתשובה הכנה מרגיזה את כולם, כי אין לה שום קשר למספר העסקאות.

הנה כל העניין בשורה אחת, ואחר כך אקדיש את שאר הפוסט להסביר למה היא כואבת.

1/√Tשגיאת תקן של יחס שארפ שנתי, T נמדד בשנים
±0.88רווח סמך של 95% סביב כל יחס שארפ שנמדד לאורך 5 שנים
1.4יחס השארפ שהאסטרטגיה המזליקה ביותר מבין 100 אסטרטגיות רעש מציגה באותן 5 שנים

מהי שגיאת התקן של יחס שארפ?

עבור יחס שארפ שמחושב על פני n תשואות תקופתיות, בהנחה שהן בלתי תלויות ובעלות התפלגות נורמלית בקירוב, שגיאת הדגימה היא:

SE(s) ≈ √((1 + s²/2) / n)

כאשר s הוא יחס השארפ שנמדד באותה תדירות. נחשב שנתית את שני האגפים, ומתקבלת תוצאה פשוטה. עם k תצפיות בשנה ו-T שנים, ליחס השארפ השנתי S יש:

SE(S) ≈ √((1 + S²/(2k)) / T)

שימו לב ל-2k במכנה. בתשואות יומיות k = 252, ולכן אפילו יחס שארפ של 2 תורם 4/504 ≈ 0.008 למונה. כל הביטוי מצטמצם ל-1. שגיאת התקן של יחס שארפ שנתי היא בקירוב 1/√T, כאשר T הוא מספר שנות הנתונים הקלנדריות שלכם. היא כמעט לא תלויה ביחס השארפ עצמו, אינה תלויה בתדירות הדגימה, ובהחלט אינה תלויה במספר העסקאות שביצעתם.

אז:

שנות נתוניםשגיאת תקן (Sharpe)רווח סמך של 95% אם המדידה שלכם היא 1.5
11.00−0.46 עד 3.46
20.710.11 עד 2.89
30.580.37 עד 2.63
50.450.62 עד 2.38
100.320.88 עד 2.12

בדיקת עבר שמציגה יחס שארפ של 1.5 על פני שנתיים של נתונים אינה יכולה להבחין סטטיסטית בינה לבין הטלת מטבע ברמת ביטחון של 95%. זה המצב הבסיסי ברוב המחקר בקריפטו, כי הנתונים הנקיים, המתוקנים להטיית הישרדות והמדויקים מבחינת עמלות של רוב האנשים מתחילים אי שם סביב 2022, ומחצית מהנכסים המעניינים כלל לא היו קיימים לפני 2023.

אבל יש לי 40,000 עסקאות. זה לא פותר את הבעיה?

לא, וזאת אי-ההבנה שהכי חשוב לי לעקור.

מספר העסקאות ואורך המדגם הם גדלים שונים, ורק אחד מהם מופיע בנוסחה. אם האסטרטגיה שלכם נכנסת לפעולה 40,000 פעמים במשך שישה חודשים, אז T = 0.5 ו-SE ≈ 1.41. רווח הסמך של 95% עבור יחס שארפ מדוד של 2.0 נע בין −0.8 ל-4.8. 40,000 עסקאות, והמסקנה הכנה היא "יכול להיות שזה טוב, ויכול להיות שהתשואה שלילית".

הסיבה היא ש-40,000 העסקאות האלה אינן 40,000 הימורים בלתי תלויים על 40,000 מצבי שוק שונים. אלה 40,000 דגימות של התנהגות שוק לאורך כ-180 ימים; הימים מתואמים זה עם זה, והמשטרים מתואמים בתוך עצמם. תיק בתדירות גבוהה של חזרה לממוצע, שמרוויח כל יום במשך ארבעה חודשים, למעשה ביצע הימור אחד — שחזרה לטווח קצר תישמר במשטר הנזילות הזה — וצפה בהכרעת ההימור אולי קומץ פעמים בלתי תלויות.

ההחלפה המחשבתית שאני עושה: סופרים משטרי שוק, לא ביצועים. בכמה תנאי שוק שונים באמת האסטרטגיה הזאת שרדה? אסטרטגיית נשיאת מימון שפעלה לאורך תקופה ארוכה אחת שבה הבסיס היה חיובי ראתה n = 1, בלי קשר למספר האיזונים מחדש השעתיים שנרשמו.

בדיקת אבחון מהירה: בצעו bootstrap בבלוקים ל-P&L היומי שלכם, עם אורך בלוק של 20 ימים, ובדקו את פיזור יחסי השארפ שהתקבלו בדגימה מחדש. אם האחוזון ה-5 נמוך מאפס, מספר העסקאות שלכם לא רלוונטי. זה דורש בערך תשע שורות numpy, וכבר הניא אותי מלאמץ יותר אסטרטגיות מכל בדיקה יחידה אחרת.

האם הנוסחה מתאימה לאסטרטגיות אמיתיות?

לא בדיוק, והיא טועה בכיוון שלא תאהבו. התוצאה 1/√T מניחה תשואות IID נורמליות. תשואות של אסטרטגיות אמיתיות מתואמות סדרתית ובעלות הטיה, וההטיה בדרך כלל שלילית בכל מה שדומה לנשיאת תשואה, שורט תנודתיות או חזרה לממוצע. התיקון של Mertens מחזיר למשוואה את המומנטים האלה:

SE(s) ≈ √((1 + s²/2 − γ₃·s + (γ₄−3)·s²/4) / n)

כאשר γ₃ היא ההטיה ו-γ₄ היא הגבנוניות. הטיה שלילית הופכת את האיבר −γ₃·s לחיובי, וכך מרחיבה את רווח הסמך. עודף גבנוניות מרחיב אותו עוד יותר. ב-P&L טיפוסי של אסטרטגיית נשיאת תשואה בקריפטו, עם הטיה בסביבות −1.2 וגבנוניות בסביבות 9, ראיתי שגיאת תקן מתוקנת שגדולה ב-30–40% מהשגיאה הנאיבית. המאמר של Lo משנת 2002 מטפל בהיבט של המתאם הסדרתי, וההשפעה באותו כיוון: מתאם סדרתי חיובי בתשואות מנפח את יחס השארפ הנאיבי ומקטין את השגיאה הנחזית — שילוב בעייתי במיוחד.

לכן התייחסו ל-1/√T כרף התחתון של אי-הוודאות שלכם. זה התרחיש הטוב ביותר.

כמה גבוה יחס השארפ צריך להיות אם בדקתי 500 גרסאות?

עכשיו אנחנו מגיעים לחלק שחשוב לכל מי שמריץ צינור מחקר אוטומטי, כלומר למצב שאנחנו נמצאים בו מדי יום ב-Stratmill: סוכן יצירת האסטרטגיות לא מייצר מועמד אחד, אלא מאות.

המקסימום הצפוי של M דגימות מהתפלגות נורמלית סטנדרטית הוא בקירוב √(2 ln M). נכפיל את זה בשגיאת התקן ונקבל את יחס השארפ שאסטרטגיה חסרת ערך לחלוטין, אך המזלית ביותר מבין M אסטרטגיות כאלה, תציג.

אסטרטגיות שנבדקו√(2 ln M)יחס שארפ של הטובה מבין אסטרטגיות הרעש, 5 שנים (שגיאת תקן 0.45)הטובה מבין אסטרטגיות הרעש, 2 שנים (שגיאת תקן 0.71)
102.150.961.52
1003.031.362.16
5003.531.582.50
5,0004.131.852.93

קראו את השורה השנייה מהסוף. אם יצרתם 500 מועמדים על סמך שנתיים של נתונים והמנצח מציג יחס שארפ של 2.4, לא מצאתם כלום. התוצאה נמצאת מתחת לרצפת הרעש. מדד Sharpe המתוקן של Bailey ו-López de Prado מנסח את זה באופן פורמלי, ומשתמש בשונות של יחסי השארפ שנבדקו במקום בקירוב הגס √(2 ln M). כדאי לממש אותו כראוי, אבל אפילו הגרסה הגסה מספיקה כדי לשנות את ההתנהלות כבר היום.

יש שני דברים שמחמירים את המצב מעבר למה שהטבלה מרמזת. ראשית, M הוא לא מספר האסטרטגיות ששמרתם, אלא מספר האסטרטגיות ש-בדקתם, כולל כל שינוי בפרמטרים, כל "רק ננסה תקופת מבט לאחור של 30 במקום", וכל הרצה מחדש אחרי תיקון באג. אף אחד לא סופר בכנות. שנית, המועמדים שלכם אינם דגימות בלתי תלויות, ולכן √(2 ln M) מגזים ברוחב האפקטיבי; עם זאת, ניסויים מתואמים גם אומרים שמשטר מזל אחד יכול להרים יחד אשכול שלם של מועמדים.

המספר המסוכן ביותר במחקר הכמותי הוא זה שאף אחד לא תיעד: כמה פעמים בדקתם.

אז מה אני עושה בפועל?

חמישה דברים, לפי הסדר שבו הייתי עושה אותם.

  1. תעדו כל בדיקה. מונה שמתקדם בכל הרצת בדיקת עבר, נשמר ולעולם לא מתאפס. אם אינכם יכולים לומר מהו M, אינכם יכולים לומר מהו הרף שלכם. זאת שעת ההנדסה היחידה בעלת הערך הגבוה ביותר בכל הרשימה.
  2. דווחו תמיד על יחס שארפ יחד עם רווח הסמך שלו. אל תציגו אף פעם מספר בודד. דוחות בדיקת העבר שלנו מציגים 1.72 ± 0.51 (2.9y, skew-adjusted), וה-± אינו נתון לבחירה. כך משתנה האופן שבו כל הצוות מדבר על תוצאות.
  3. קבעו את הרף לפי M ו-T לפני שאתם מסתכלים על התוצאות. שלפו את המספר מהטבלה למעלה ורשמו אותו. רפים שנקבעים בדיעבד הם הדרך שבה כולם משכנעים את עצמם שהתאמת עקומה היא תגלית.
  4. כשאין מספיק נתונים, העדיפו רוחב על פני תדירות. אי אפשר לייצר עוד זמן קלנדרי, אבל אפשר להריץ את אותו אות על פני 40 נכסים שאינם מתואמים. כך אכן מגדילים את n האפקטיבי, בניגוד להגדלת תדירות העסקאות. אבל שימו לב למתאמים — 40 חוזים תמידיים בקריפטו בשעה של שנאת סיכון הם למעשה מכשיר אחד.
  5. אחר כך, הריצו אותו במסחר נייר. זמן מחוץ למדגם מצטבר יום אחד בכל יום, ואין קיצור דרך. זאת בדיוק הסיבה שזה המדגם היחיד שאי אפשר לבצע עליו התאמת יתר.

שום דבר מכל זה לא הופך מדגמים קצרים לשימושיים. זה עוזר להיות כנים לגבי הטענות שמדגם קצר יכול לבסס — טענות הרבה יותר צנועות מאלה שרוב דוחות בדיקות העבר מרמזים עליהן. יחס שארפ של 1.5 לאורך שנתיים הוא השערה ששווה לבדוק במסחר נייר. הוא אינו ממצא.

יחס שארפהתאמת יתרבדיקת עברמובהקות סטטיסטיתמחקר כמותי
← כל הפוסטים