בדיקת עבר טובה יותר בפסילת אסטרטגיה מאשר בבחירה באחת. ברגע שמשתמשים בביצועים היסטוריים כדי לבחור מבין גרסאות רבות, בדיקת העבר הופכת לחלק מהניסוי, ולמנצחת לכאורה מתלווה מחיר סמוי: הטיית בחירה.
זה נשמע הפוך. אנחנו עורכים בדיקות עבר כי אנחנו רוצים לדעת איזו אסטרטגיה עובדת. אבל כל בחירה שמונחית על ידי אותה היסטוריה צורכת חלק מהראיות שבה. משנים את תקופת הבדיקה, הסף, היקום, יום האיזון מחדש או כלל הסטופ אחרי שראיתם את התוצאות, ושאלתם את הנתונים שאלה נוספת. בסופו של דבר הם שמעו מספיק שאלות כדי לספק לכם תשובה משכנעת במקרה.
למה בדיקת אסטרטגיות רבות יותר הופכת את התוצאה הטובה ביותר לפחות אמינה?
דמיינו שבדקתם 100 אסטרטגיות שאין להן יתרון אמיתי. התשואות שלהן עדיין יהיו שונות זו מזו. אם אומדני הביצועים בלתי תלויים בקירוב והרעש מתפלג נורמלית, ה-Sharpe הטוב ביותר מביניהן יהיה חיובי, אף שה-Sharpe האמיתי של כל אסטרטגיה הוא אפס.
קירוב גס לתוחלת המקסימום של 100 דגימות נורמליות סטנדרטיות בלתי תלויות הוא 2.5 סטיות תקן מעל הממוצע. ראו בכך המחשה, לא תיקון שאפשר להדביק בדוח: גרסאות אמיתיות של אסטרטגיות מתואמות זו עם זו, לאומדני Sharpe יש שגיאת דגימה משלהם, ותשואות כמעט אף פעם אינן מתנהגות כמו דגימות נורמליות נקיות. למרות ההסתייגויות האלה, הנקודה המעשית נשארת בעינה. ככל שבודקים יותר מועמדות, כך גדל הסיכוי שהציון המוביל משקף רעש חיובי.
ו״מועמדת״ אינה רק בדיקת עבר שנשמרה. היא כוללת כל בחירה שנעשתה אחרי עיון בתוצאה: הרחבת היקום כי הגרף נראה תנודתי, השמטת שנה שפוגעת בביצועים, או שינוי הנחת העמלות עד שהעקומה מתאוששת. ההחלטות האלה נספרות גם אם אף אחד לא נתן להן מספר גרסה.
תעדו את המחקר לפני הרצת הגרסה הבאה
תעדו את החיפוש במלואו, כולל רעיונות שנדחו והסיבה לכל שינוי. כך תקבלו תיעוד כן יותר של מידת ההשפעה של הבחירה על התוצאה, ויהיה קשה יותר לזכור רק את הניסיונות המבטיחים.
| מה לתעד | דוגמה | למה זה חשוב |
|---|---|---|
| השערה | היפוך מגמה בטווח קצר מתחזק אחרי תנועות חריגות בגודלן בחוזים תמידיים על BTC | מפריד בין הרעיון לבין הגדרות הפרמטרים שנבחרו בסופו של דבר |
| גרסה וחותמת זמן | אות ל-48 שעות, 2026-10-09, הרצה 014 | סופר את החיפושים ומקשר בין התוצאות לקוד ולנתונים |
| כלל הבחירה | בחירה לפי Sharpe נטו; לפחות 100 עסקאות | מבהיר מה פירוש ״הטוב ביותר״ לפני ההשוואה |
| גרסאות שנדחו | חלונות של 12, 24 ו-72 שעות; כולם נשמרו | מונע מהמנצחת הגלויה למחוק את המתחרות שלה |
תיעוד לא יבטל את החיפוש. הוא יהפוך אותו לברור, וזה הצעד הראשון בדרך להערכת רמת הביטחון שהמנצחת ראויה לה.
שמרו נתונים שהמחקר לא יוכל לבדוק שוב ושוב
חלקו את הנתונים לפי זמן, ואז הגנו על התקופה הסופית. פתחו את האסטרטגיה על פני תקופה אחת, קבלו החלטות בעזרת תקופת אימות, ואז העריכו את האסטרטגיה שהוקפאה פעם אחת בלבד על נתונים מאוחרים יותר שנשמרו בצד. לדוגמה, אפשר להשתמש ב-2018–2022 לפיתוח, ב-2023 לאימות, ולשמור את 2024–2025 בצד. אלה רק תאריכים להמחשה: השוק, אופק האסטרטגיה וכיסוי הנתונים צריכים לקבוע את החלוקה.
כתבו מה פירוש ״הוקפאה״: האות, היקום, גודל הפוזיציה, הנחות הביצוע וכללים לטיפול בנתונים חסרים. אם תקופת ההערכה הסופית מאכזבת ואתם מכווננים את האסטרטגיה על פיה, התקופה הזאת הפכה לנתוני אימות. ההערכה הכנה הבאה תצטרך ראיות חדשות.
גם כאן מדגמים קטנים עלולים להטעות. אסטרטגיה שביצעה 18 עסקאות בתקופת ההערכה הסופית עדיין לא מספקת בסיס למסקנה מדויקת. דווחו על מספר העסקאות ועל אי-הוודאות לצד נתוני התשואה; ממוצע יחיד יכול לגרום למדגם קטן להיראות חד-משמעי.
האם זה אומר שבדיקות עבר חסרות תועלת לבחירת אסטרטגיות?
לא. המבקרים צודקים בכך שתקופות הערכה סופיות נוקשות עלולות להיות בזבזניות: השווקים משתנים, ההיסטוריה קצרה, ותקופה שלא נגעו בה עשויה לייצג משטר שוק חריג אחד בלבד. תהליך בדיקה מתגלגלת שתוכנן בקפידה יכול להראות איך אסטרטגיה מתנהגת כשההיסטוריה הזמינה מתקדמת. אבל הוא לא הופך כוונון חוזר לחינמי. אם בחנתם כל מקטע ועדכנתם את האסטרטגיה, המקטעים האלה השפיעו על המחקר.
השתמשו בבדיקות עבר כדי לחשוף דרכי כשל, להשוות מספר קטן של רעיונות המבוססים על מנגנון שוק, ולבדוק אם התוצאות מחזיקות מעמד מול עמלות, מימון, השפעת שוק ושינויים בפרמטרים שנראים סבירים. תעדו את התהליך. שמרו נתונים להערכה סופית. לאחר מכן העבירו גרסה מבטיחה וקפואה למסחר מדומה, שבו עשויים להתגלות פערים תפעוליים.
התשובה החשובה ביותר של בדיקת עבר היא לעיתים קרובות: ״הרעיון הזה נכשל בתנאים שכבר אפשר לזהות״. כשהיא אומרת ״זו האסטרטגיה הטובה ביותר״, שאלו כמה תשובות אחרות ביקשתם ממנה לתת.
← כל הפוסטים


