10 września 2026 · badania

Twój wskaźnik Sharpe’a przetrwał każdy test. Nadal może być dziełem przypadku.

Twój wskaźnik Sharpe’a przetrwał każdy test. Nadal może być dziełem przypadku.

Tysiąc wariantów strategii. Zmierzony wskaźnik Sharpe’a zwycięzcy: 2.0. Wskaźnik fałszywych trafień: 5%. Te liczby brzmią jak mocny wynik, dopóki nie zapytamy, ile prób wymagało jego znalezienie. Przy wystarczającej liczbie podejść przekonujący backtest może powstać z samego szumu.

Zaskakująca nie jest wartość Sharpe’a, lecz liczba prób. Każde okno wskaźnika, próg wejścia, wybór uniwersum i odrzucony pomysł to kolejna szansa na wybranie szczęśliwego wyniku. Jeśli w procesie badawczym nie uwzględniamy tych prób, nie uwzględnia ich również nasze obliczenie pewności.

Dlaczego testowanie większej liczby strategii sprawia, że zwycięzca wygląda lepiej?

Wyobraźmy sobie test 1,000 strategii, z których żadna nie ma rzeczywistej przewagi. Każda ma 5% szans na pozorną istotność statystyczną w standardowym teście. W rzeczywistych badaniach te próby nie są całkowicie niezależne, ale podstawowa intuicja pozostaje trafna: im więcej kandydatów analizujemy, tym większe prawdopodobieństwo, że któryś przypadkiem będzie wyglądał wyjątkowo.

Nawet gdyby każdy kandydat był niezależny, prawdopodobieństwo, że co najmniej jeden przekroczy próg 5%, wynosi około 99.4%. W praktyce sąsiednie ustawienia parametrów często działają podobnie, więc 1,000 wariantów nie oznacza 1,000 niezależnych rzutów monetą. Efektywna liczba prób rzadko jednak wynosi tylko jedną.

Widziałem w notatnikach pewną pułapkę: badacz testuje okresy wsteczne od 5 do 100, tworzy wykres powierzchni wskaźnika Sharpe’a, a następnie raportuje ładnie wyglądające maksimum. Taka powierzchnia pomaga zrozumieć wrażliwość wyników. Maksimum jest też efektem przeszukiwania i zasługuje na mniejsze uznanie niż próg wybrany przed eksperymentem.

Co liczy się jako próba badawcza?

Uwzględniajmy decyzje, na które wpłynęły zaobserwowane wyniki. Próbą może być zakodowany backtest, ale również ręczna zmiana wprowadzona po obejrzeniu krzywej kapitału. Jeśli poszerzyliśmy stop loss, bo poprzednie ustawienie nie pozwoliło wykorzystać wzrostu, ta poprawka wykorzystała informacje z okresu testowego.

Działanie badawczeCzy zwykle liczy się jako próba?Dlaczego
Testowanie kolejnego progu sygnałuTakWynik pomaga wybrać kandydata
Zmiana zakresu dat po zaobserwowaniu obsunięciaTakPróbę dobrano w reakcji na wyniki
Naprawa udokumentowanego błędu w danychZwykle nieZmiana przywraca zamierzony przebieg eksperymentu
Uruchomienie tej samej zamrożonej strategii na nowym okresie weryfikacyjnymNa razie nie jest nową próbą selekcjiStaje się nią, jeśli dostrajamy strategię na podstawie tego wyniku

Granica bywa płynna. Poprawienie literówki to coś innego niż zmiana cechy po zauważeniu, gdzie strategia zawiodła. Prowadźmy krótki rejestr prób z hipotezą, zmianą, okresem danych i wynikiem. Nie musi być dopracowany; datowany plik CSV jest lepszy niż odtwarzanie poszukiwań z pamięci po 3 miesiącach.

Czy mogę skorygować wskaźnik Sharpe’a pod kątem testowania wielokrotnego?

Metody takie jak Deflated Sharpe Ratio szacują, jaka część pozornych wyników mogła powstać wskutek selekcji spośród wielu kandydatów, z uwzględnieniem takich czynników jak rozkład stóp zwrotu i zależność między próbami. To przydatne narzędzia diagnostyczne, ale nie maszyna, która zamienia nieuporządkowany proces badawczy w pewność. Wyniki zależą od założeń i wiarygodności podanej liczby prób.

Dla orientacji załóżmy, że badacz przetestował 400 wariantów, uzyskał wskaźnik Sharpe’a równy 1.8 i ocenia, że stopy zwrotu cechują się znaczną skośnością oraz grubymi ogonami. Taki wynik powinien przejść wyższy próg niż wskaźnik Sharpe’a równy 1.8 uzyskany w jednym z góry zarejestrowanym teście. Korekta może znacząco osłabić dowody, ale nie powie nam, czy przewaga jest rzeczywista.

Zapisujmy przebieg poszukiwań, zanim przyjdzie nam go bronić: liczbę kandydatów, zakresy parametrów, analizowane okresy danych i wszelkie ręczne poprawki. Jeśli nie znamy tych szczegółów, opiszmy backtest jako eksploracyjny.

Co zrobić przed paper tradingiem?

Zamroźmy jednego kandydata i określmy kolejną ocenę, zanim ją przeprowadzimy. Przydatna kolejność to wybór strategii na danych treningowych, analiza na danych walidacyjnych, a następnie pozostawienie końcowego okresu lub okna paper tradingu, które nie wpływa na projekt. Każdy etap odpowiada na inne pytanie; wielokrotne dostosowywanie strategii na etapie końcowym zamienia go w kolejną porcję danych treningowych.

Sprawdźmy też, czy sąsiednie ustawienia prowadzą do podobnych wniosków. Szeroki obszar umiarkowanie dodatnich wyników jest zwykle bardziej wiarygodny niż pojedynczy, ostry szczyt, choć odporność nie naprawi wadliwego modelu realizacji zleceń. Prowizje, funding, wpływ na cenę i dostępność instrumentu nadal muszą odpowiadać warunkom, z którymi strategia mogłaby się zetknąć.

Paper trading dostarcza dowodów dotyczących zgodności operacyjnej: czasu realizacji, obsługi zleceń i tego, czy działający na żywo proces badawczy zachowuje się zgodnie z oczekiwaniami. Nie wymazuje wcześniejszej selekcji. Tysiąc szczęśliwych backtestów nadal oznacza tysiąc prób, gdy składamy pierwsze zlecenie w paper tradingu.

Gdy więc backtest pokazuje wskaźnik Sharpe’a równy 2, poprośmy o historię badań obok krzywej kapitału. Ile pomysłów przetestowano? Które wyniki wpłynęły na kolejny eksperyment? Odpowiedź może być najważniejszą statystyką w raporcie.

przeoptymalizowanie backtestuwskaźnik Sharpe’atestowanie wielokrotnebadania strategiitesty kroczące
← Wszystkie wpisy