Tusen strategivarianter. En uppmätt Sharpe-kvot på 2.0 för vinnaren. En falskt positiv frekvens på 5%. Det låter som ett starkt resultat tills man frågar hur många försök som krävdes för att hitta det. Med tillräckligt många försök kan ett övertygande backtest uppstå enbart ur brus.
Det överraskande talet är inte Sharpe-kvoten. Det är antalet försök. Varje indikatorfönster, inträdeströskel, val av instrumentuniversum och förkastad idé är ytterligare en chans att välja ett resultat som haft tur. Om din forskningsprocess glömmer de försöken gör även din konfidensberäkning det.
Varför ser vinnaren bättre ut när man provar fler strategier?
Föreställ dig att du testar 1,000 strategier utan någon verklig fördel. Var och en har 5% sannolikhet att se statistiskt signifikant ut enligt ett konventionellt test. I verklig forskning är försöken inte helt oberoende, men grundtanken gäller ändå: ju fler kandidater du granskar, desto större är sannolikheten att en ser exceptionell ut av en slump.
Även om alla kandidater vore oberoende är sannolikheten att minst en klarar den tröskeln på 5% ungefär 99.4%. I praktiken beter sig närliggande parameterinställningar ofta likartat, så 1,000 varianter innebär inte 1,000 oberoende krona-eller-klave-kast. Men det effektiva antalet försök är sällan bara ett heller.
Här är en liten fälla jag sett i notebooks: en forskare testar tillbakablicksperioder från 5 till 100, ritar upp Sharpe-ytan och rapporterar sedan den prydliga toppen. Ytan är användbar för att förstå känsligheten. Toppen är också resultatet av en sökning och förtjänar mindre tilltro än en tröskel som valts före experimentet.
Vad räknas som ett forskningsförsök?
Räkna beslut som påverkats av observerade resultat. Ett försök kan vara ett kodat backtest, men också en manuell ändring som görs efter att ha sett aktiekurvan. Om du vidgade en stop-loss eftersom den gamla inställningen missade en uppgång, använde den ändringen information från testperioden.
| Forskningsåtgärd | Räknas det vanligtvis som ett försök? | Varför |
|---|---|---|
| Testa ytterligare en signaltröskel | Ja | Resultatet hjälper till att välja en kandidat |
| Ändra datumintervallet efter att ha sett en nedgång | Ja | Urvalet gjordes som svar på resultatet |
| Rätta ett dokumenterat datafel | Vanligtvis inte | Ändringen återställer det avsedda experimentet |
| Kör samma frysta strategi på en ny holdout-period | Inget nytt urvalsförsök ännu | Det blir ett försök om du finjusterar mot det resultatet |
Gränsdragningen kräver omdöme. Att rätta ett stavfel är något annat än att ändra en egenskap efter att ha sett var den misslyckades. För en kort logg över försöken med hypotes, ändring, dataperiod och utfall. Den behöver inte vara elegant; en daterad CSV-fil är bättre än att försöka återskapa sökningen ur minnet tre månader senare.
Kan jag korrigera min Sharpe-kvot för multipla tester?
Metoder som Deflated Sharpe Ratio uppskattar hur mycket av den skenbara avkastningen som kan bero på urval bland många kandidater, samtidigt som de tar hänsyn till faktorer som avkastningsfördelning och beroenden mellan försök. De är användbara diagnostiska verktyg, inte en maskin som förvandlar en rörig forskningsprocess till visshet. Resultaten beror på antagandena och på om antalet försök du anger är trovärdigt.
För att få en ungefärlig känsla: anta att en forskare testade 400 varianter, fick en Sharpe-kvot på 1.8 och uppskattar att avkastningen har betydande skevhet och tjocka svansar. Det resultatet bör klara en högre tröskel än en Sharpe-kvot på 1.8 från ett enda förregistrerat test. Korrigeringen kan försvaga beläggen avsevärt, men den kan inte tala om för dig att fördelen är verklig.
Dokumentera sökningen innan du behöver försvara den: antal kandidater, parameterintervall, granskade dataperioder och eventuella manuella ändringar. Om detaljerna är okända bör du beskriva backtestet som explorativt.
Vad bör ske före paper trading?
Lås en kandidat och bestäm nästa utvärdering innan du kör den. Ett användbart upplägg är att välja strategin med träningsdata, granska den med valideringsdata och sedan spara en slutlig period eller ett paper-trading-fönster som inte påverkar utformningen. Varje steg besvarar en egen fråga; om du upprepade gånger justerar strategin utifrån det sista steget blir det mer träningsdata.
Undersök också om närliggande inställningar visar samma sak. Ett brett område med måttligt positiva resultat är oftast mer trovärdigt än en ensam, nålspetsig topp, även om robusthet inte kan rädda en bristfällig exekveringsmodell. Avgifter, funding, marknadspåverkan och tillgången till instrument måste fortfarande motsvara de förhållanden strategin skulle ha mött.
Paper trading ger belägg för operativ överensstämmelse: timing, orderhantering och om den levande forskningspipelinen fungerar som väntat. Det kan inte sudda ut urvalet som redan gjorts. Tusen backtester som haft tur är fortfarande tusen försök när den första paper-ordern skickas.
Så när ett backtest visar en Sharpe-kvot på 2, be att få se forskningshistoriken bredvid aktiekurvan. Hur många idéer testades? Vilka resultat påverkade nästa experiment? Svaret kan vara rapportens viktigaste statistik.
← Alla inlägg


