Backtest lepiej sprawdza się przy odrzucaniu strategii niż przy wybieraniu jednej. Gdy tylko używasz historycznych wyników do wyboru spośród wielu wariantów, backtest staje się częścią eksperymentu, a pozorny zwycięzca zaczyna nieść ukryty koszt: błąd selekcji.
Brzmi to na opak. Robimy backtesty, bo chcemy wiedzieć, która strategia działa. Jednak każdy wybór oparty na tych samych danych historycznych uszczupla ich wartość dowodową. Zmień okres lookback, próg, uniwersum, dzień rebalansowania lub regułę stop po obejrzeniu wyników, a zadajesz danym kolejne pytanie. W końcu usłyszą ich tyle, że przypadkiem udzielą przekonującej odpowiedzi.
Dlaczego testowanie większej liczby strategii sprawia, że najlepszemu wynikowi trudniej zaufać?
Wyobraź sobie testowanie 100 strategii, z których żadna nie ma rzeczywistej przewagi. Ich stopy zwrotu i tak będą się różnić. Jeśli oszacowania wyników są w przybliżeniu niezależne, a szum ma rozkład normalny, najwyższy Sharpe spośród nich będzie dodatni, mimo że rzeczywisty Sharpe każdej strategii wynosi zero.
Zgrubne przybliżenie wartości oczekiwanej maksimum ze 100 niezależnych losowań ze standardowego rozkładu normalnego to 2.5 odchylenia standardowego powyżej średniej. Potraktuj to jako ilustrację, a nie korektę, którą można wkleić do raportu: rzeczywiste warianty strategii są skorelowane, oszacowania Sharpe'a mają własny błąd próbkowania, a stopy zwrotu rzadko zachowują się jak idealne losowania z rozkładu normalnego. Praktyczny wniosek pozostaje aktualny mimo tych zastrzeżeń. Im więcej wariantów sprawdzasz, tym większe prawdopodobieństwo, że najwyższy wynik odzwierciedla korzystny szum.
„Wariant” to nie tylko zapisany backtest. To każda decyzja podjęta po obejrzeniu wyniku: poszerzenie uniwersum, bo wykres wygląda chaotycznie, usunięcie niekorzystnego roku albo zmiana założeń dotyczących opłat, aż krzywa znów zacznie rosnąć. Te decyzje też się liczą, nawet jeśli nikt nie przypisał im numeru wersji.
Zanim uruchomisz kolejny wariant, prowadź rejestr badań
Zapisuj cały proces poszukiwań, w tym odrzucone pomysły i powody każdej zmiany. Dzięki temu uczciwiej ocenisz, w jakim stopniu wynik został wyselekcjonowany, i trudniej będzie pamiętać wyłącznie obiecujące próby.
| Zapis | Przykład | Dlaczego to ważne |
|---|---|---|
| Hipoteza | Krótkoterminowe odwrócenie jest silniejsze po wyjątkowo dużych ruchach BTC perp | Oddziela pomysł od późniejszych ustawień parametrów |
| Wariant i znacznik czasu | Sygnał 48-godzinny, 2026-10-09, przebieg 014 | Zlicza przeszukane warianty i łączy wyniki z kodem oraz danymi |
| Reguła wyboru | Wybór na podstawie Sharpe'a netto; minimum 100 transakcji | Pokazuje, co oznaczało „najlepszy” przed porównaniem |
| Odrzucone warianty | Okna 12, 24 i 72-godzinne; wszystkie zachowane | Zapobiega temu, by widoczny zwycięzca wymazał konkurencję |
Rejestr nie cofnie procesu poszukiwań. Sprawi, że będzie on przejrzysty, a to pierwszy krok do oceny, na ile zwycięskiemu wariantowi można zaufać.
Odłóż dane, do których proces badawczy nie będzie wracać
Podziel dane w czasie, a następnie zabezpiecz końcowy okres. Opracuj strategię na jednym przedziale, podejmuj decyzje na podstawie przedziału walidacyjnego, a zamrożoną strategię oceń tylko raz na późniejszej próbie odłożonej. Możesz na przykład wykorzystać lata 2018–2022 do opracowania, 2023 do walidacji, a lata 2024–2025 odłożyć na później. To tylko przykładowy podział: powinny o nim decydować rynek, horyzont strategii i dostępność danych.
Zapisz, co oznacza „zamrożona” strategia: sygnał, uniwersum, wielkość pozycji, założenia dotyczące realizacji zleceń i wszelkie reguły postępowania z brakującymi danymi. Jeśli wyniki na próbie odłożonej rozczarują i dostroisz do niej strategię, ten okres stanie się danymi walidacyjnymi. Do następnej uczciwej oceny potrzebne będą świeże dane.
Właśnie tutaj dają o sobie znać małe próby. Strategia, która zawarła 18 transakcji w okresie odłożonym, nie daje podstaw do precyzyjnego werdyktu. Obok statystyk stóp zwrotu podaj liczbę transakcji i niepewność; sama średnia może sprawić, że skromna próba będzie wyglądać na rozstrzygającą.
Czy to znaczy, że backtesty są bezużyteczne przy wyborze strategii?
Nie. Krytycy mają rację, że ścisłe próby odłożone mogą być nieefektywne: rynki się zmieniają, historia jest krótka, a nietknięty okres może obejmować tylko jeden nietypowy reżim. Starannie zaprojektowany proces walk-forward może pokazać, jak zachowuje się strategia, gdy dostępna historia przesuwa się naprzód. Nie sprawia to jednak, że wielokrotne dostrajanie nic nie kosztuje. Jeśli analizujesz każdy fold i zmieniasz strategię, te foldy wpłynęły na badania.
Używaj backtestów do wykrywania trybów porażki, porównywania niewielkiej liczby pomysłów opartych na mechanizmie rynkowym oraz sprawdzania, czy wyniki utrzymują się przy realistycznych założeniach dotyczących opłat, funding rate, wpływu na rynek i zmian parametrów. Prowadź rejestr. Zachowaj końcową próbę odłożoną. Następnie przetestuj obiecującą, zamrożoną wersję w handlu papierowym, gdzie mogą ujawnić się rozbieżności operacyjne.
Najmocniejsza odpowiedź backtestu często brzmi: „Ten pomysł zawodzi w warunkach, które już potrafimy rozpoznać”. Gdy mówi: „To najlepsza strategia”, zapytaj, ile innych odpowiedzi miał wcześniej udzielić.
← Wszystkie wpisy


