אלף וריאציות של אסטרטגיה. יחס Sharpe מדוד של 2.0 לזוכה. שיעור חיוביים כוזבים של 5%. המספרים האלה נשמעים כמו תוצאה חזקה, עד ששואלים כמה ניסיונות נדרשו כדי למצוא אותה. אחרי מספיק ניסיונות, גם רעש לבדו יכול להפיק בקטסט משכנע.
המספר המפתיע אינו יחס Sharpe. זה מספר הניסויים. כל חלון של אינדיקטור, סף כניסה, בחירת יקום וניסיון שנזנח הם עוד הזדמנות לבחור תוצאה מוצלחת במקרה. אם תהליך המחקר שלכם מתעלם מהניסיונות האלה, גם חישוב רמת הביטחון שלכם מתעלם מהם.
למה ריבוי אסטרטגיות שנבדקות גורם לזוכה להיראות טוב יותר?
דמיינו שבדקתם 1,000 אסטרטגיות שאין להן יתרון אמיתי. לכל אחת יש סיכוי של 5% להיראות מובהקת סטטיסטית לפי מבחן מקובל. במחקר אמיתי הניסויים האלה אינם בלתי תלויים לחלוטין, אבל העיקרון ברור: ככל שבוחנים יותר מועמדות, כך גדל הסיכוי שאחת מהן תיראה יוצאת דופן במקרה.
גם אילו כל מועמדת הייתה בלתי תלויה, ההסתברות שלפחות אחת תעבור את סף ה־5% היא כ־99.4%. בפועל, הגדרות פרמטרים סמוכות מתנהגות לעיתים קרובות באופן דומה, ולכן 1,000 וריאציות אינן 1,000 הטלות מטבע בלתי תלויות. אבל גם מספר הניסיונות האפקטיבי כמעט אף פעם אינו אחד.
הנה מלכודת קטנה שנתקלתי בה במחברות מחקר: חוקר בודק תקופות מבט לאחור מ־5 עד 100, מציג את משטח ה־Sharpe ואז מדווח על הפסגה שנראית נקייה. המשטח מועיל להבנת הרגישות. הפסגה היא גם תוצר של חיפוש, ומגיע לה פחות קרדיט מסף שנבחר לפני הניסוי.
מה נחשב לניסוי מחקר?
ספרו החלטות שהושפעו מהתוצאות שנצפו. ניסוי יכול להיות בקטסט בקוד, אבל גם שינוי ידני שנעשה אחרי צפייה בעקומת ההון. אם הרחבתם סטופ כי ההגדרה הקודמת פספסה עלייה חדה, התיקון הזה השתמש במידע מתקופת הבדיקה.
| פעולת מחקר | האם בדרך כלל נחשבת לניסוי? | למה |
|---|---|---|
| בדיקת סף נוסף לאות | כן | התוצאה עוזרת לבחור מועמדת |
| שינוי טווח התאריכים אחרי צפייה בירידה | כן | המדגם נבחר בתגובה לביצועים |
| תיקון באג נתונים שתועד | בדרך כלל לא | השינוי מחזיר את הניסוי לתכנון המקורי |
| הרצת אסטרטגיה קפואה וזהה על תקופת החזקה חדשה | עדיין לא מדובר בניסוי בחירה חדש | היא הופכת לניסוי כזה אם מכווננים את האסטרטגיה לפי התוצאה |
הגבול בין המקרים דורש שיקול דעת. תיקון שגיאת הקלדה שונה משינוי מאפיין אחרי שגיליתם היכן הוא נכשל. נהלו יומן ניסויים קצר ובו ההשערה, השינוי, תקופת הנתונים והתוצאה. הוא לא צריך להיות מלוטש; קובץ CSV מתוארך עדיף על ניסיון לשחזר מהזיכרון את תהליך החיפוש שלכם כעבור שלושה חודשים.
אפשר לתקן את יחס ה־Sharpe שלי עבור בדיקות מרובות?
שיטות כמו יחס Sharpe מתוקנן (Deflated Sharpe Ratio) מעריכות כמה מהביצועים הנראים לעין עשויים לנבוע מבחירה מתוך מועמדות רבות, תוך התחשבות בגורמים כגון התפלגות התשואות ותלות בין הניסויים. הן כלי אבחון מועילים, לא מכונה שהופכת תהליך מחקר מבולגן לוודאות. התוצאות שלהן תלויות בהנחות ובאמינות של ספירת הניסויים שלכם.
כדי לקבל תחושה כללית, נניח שחוקר בדק 400 וריאציות, מצא יחס Sharpe של 1.8 ומעריך שהתשואות שלו מוטות מאוד ובעלות זנבות עבים. לתוצאה הזאת צריך להיות רף מחמיר יותר מזה של יחס Sharpe 1.8 שהתקבל במבחן יחיד שנרשם מראש. התיקון עשוי להחליש במידה ניכרת את הראיות; הוא אינו יכול לקבוע שהיתרון אמיתי.
תעדו את החיפוש לפני שתצטרכו להגן עליו: מספר המועמדות, טווחי הפרמטרים, תקופות הנתונים שנבדקו וכל שינוי ידני. אם הפרטים האלה אינם ידועים, תארו את הבקטסט כגישושי.
מה כדאי לעשות לפני מסחר בנייר?
הקפיאו מועמדת אחת והגדירו את ההערכה הבאה לפני הרצתה. רצף מועיל הוא לבחור את האסטרטגיה באמצעות נתוני אימון, לבחון אותה בנתוני אימות, ואז לשמור תקופה סופית או חלון של מסחר בנייר שאינם משפיעים על התכנון. כל שלב עונה על שאלה אחרת; התאמות חוזרות לאסטרטגיה בשלב הסופי הופכות אותו לנתוני אימון נוספים.
בדקו גם אם הגדרות סמוכות מספרות את אותו הסיפור. אזור רחב של תוצאות חיוביות במידה מתונה אמין בדרך כלל יותר מפסגה צרה וחדה, אם כי עמידות אינה מתקנת מודל ביצוע פגום. עמלות, מימון, השפעת מחיר וזמינות המכשירים עדיין צריכים להתאים לתנאים שהאסטרטגיה הייתה עשויה להתמודד איתם.
מסחר בנייר מוסיף ראיות לגבי התאמה תפעולית: תזמון, טיפול בהוראות, והאם צינור המחקר החי פועל כמצופה. הוא אינו יכול למחוק את הבחירה שכבר התרחשה. אלף בקטסטים מוצלחים במקרה נשארים אלף ניסיונות גם כשהוראת הנייר הראשונה נשלחת.
לכן, כשבקטסט מדווח על יחס Sharpe של 2, בקשו לראות את היסטוריית המחקר לצד עקומת ההון. כמה רעיונות נבדקו? אילו תוצאות שינו את הניסוי הבא? ייתכן שהתשובה היא הנתון החשוב ביותר בדוח.
← כל הפוסטים


