En backtest er bedre til at afvise en strategi end til at vælge en. I det øjeblik du bruger historisk performance til at vælge mellem mange varianter, bliver backtesten en del af eksperimentet, og den tilsyneladende vinder får en skjult omkostning: selektionsbias.
Det lyder bagvendt. Vi backtester, fordi vi vil vide, hvilken strategi der virker. Men hvert valg, der styres af den samme historik, bruger noget af dens beviskraft. Ændr lookback, tærskel, univers, rebalanceringsdag eller stopregel, efter at du har set resultaterne, og så har du stillet dataene endnu et spørgsmål. Til sidst har de fået så mange spørgsmål, at de ved et tilfælde giver dig et overbevisende svar.
Hvorfor bliver det bedste resultat mindre troværdigt, når man tester flere strategier?
Forestil dig, at du tester 100 strategier uden nogen reel edge. Deres afkast vil alligevel variere. Hvis deres performancemål er nogenlunde uafhængige, og støjen er normalfordelt, vil den bedste Sharpe blandt dem være positiv, selvom alle strategiernes sande Sharpe er nul.
En grov tilnærmelse for den forventede maksimumværdi af 100 uafhængige standardnormalfordelte træk er 2.5 standardafvigelser over gennemsnittet. Se det som en illustration, ikke en korrektion, du kan indsætte i en rapport: virkelige strategivarianter er korrelerede, Sharpe-estimater har deres egen stikprøvefejl, og afkast følger sjældent pæne normalfordelte træk. Den praktiske pointe gælder stadig trods disse forbehold. Jo flere kandidater du undersøger, desto større er sandsynligheden for, at topscoren afspejler gunstig støj.
Og en »kandidat« er ikke kun en gemt backtest. Det er ethvert valg, du træffer efter at have set et resultat: at udvide universet, fordi grafen ser ujævn ud, fjerne et år, der trækker resultatet ned, eller ændre en gebyrantagelse, indtil kurven retter sig op. De valg tæller også, selvom ingen gav dem et versionsnummer.
Før en forskningslog, inden du kører den næste variant
Registrér hele søgningen, også idéer, du forkaster, og grunden til hver ændring. Så får du en mere ærlig redegørelse for, hvor meget resultatet blev udvalgt, og det bliver sværere kun at huske de forsøg, der så lovende ud.
| Registrér | Eksempel | Hvorfor det er vigtigt |
|---|---|---|
| Hypotese | Kortvarig mean reversion er stærkere efter usædvanligt store bevægelser i BTC-perpetuals | Adskiller idéen fra dens endelige parameterindstillinger |
| Variant og tidsstempel | 48-timers signal, 2026-10-09, kørsel 014 | Tæller søgningerne og knytter resultaterne til kode og data |
| Udvælgelsesregel | Vælg efter netto-Sharpe; mindst 100 handler | Viser, hvad »bedst« betød før sammenligningen |
| Forkastede varianter | 12-, 24- og 72-timers vinduer; alle bevaret | Forhindrer, at den synlige vinder udsletter konkurrenterne |
En log kan ikke gøre søgningen ugjort. Den gør søgningen gennemskuelig, hvilket er første skridt til at vurdere, hvor meget tillid vinderen fortjener.
Reservér data, som forskningsprocessen ikke kan blive ved med at genbesøge
Opdel data efter tid, og beskyt derefter den sidste periode. Udvikl strategien på ét interval, træf beslutninger med et valideringsinterval, og evaluér den fastlåste strategi én gang på et senere holdout-datasæt. Du kunne for eksempel bruge 2018–2022 til udvikling, 2023 til validering og derefter reservere 2024–2025. Datoerne er kun et eksempel: markedet, strategiens tidshorisont og datadækningen bør afgøre opdelingen.
Skriv ned, hvad »fastlåst« betyder: signal, univers, positionsstørrelse, eksekveringsantagelser og eventuelle regler for manglende data. Hvis holdout-resultatet skuffer, og du tilpasser strategien efter det, er perioden blevet til valideringsdata. Den næste ærlige evaluering kræver nye data.
Det er også her, små stikprøver bider. En strategi, der handler 18 gange i et holdout-datasæt, giver ikke grundlag for en præcis konklusion. Rapportér antal handler og usikkerhed sammen med afkaststatistikken; ét gennemsnit kan få en lille stikprøve til at se afklaret ud.
Betyder det, at backtests er ubrugelige til at vælge strategier?
Nej. Kritikerne har ret i, at strenge holdout-datasæt kan være spild af data: markeder ændrer sig, historikken er kort, og en uberørt periode repræsenterer måske kun ét usædvanligt regime. En omhyggeligt tilrettelagt walk-forward-proces kan vise, hvordan en strategi klarer sig, efterhånden som den tilgængelige historik ruller frem. Det gør stadig ikke gentagen tilpasning omkostningsfri. Hvis du undersøger hvert fold og reviderer strategien, har disse folds påvirket forskningen.
Brug backtests til at afdække fejlsituationer, sammenligne et lille antal idéer, der bygger på en markedsmekanisme, og teste, om resultaterne holder ved realistiske gebyrer, funding, market impact og parameterændringer. Før en log. Bevar et endeligt holdout-datasæt. Tag derefter en lovende, fastlåst version videre til paper trading, hvor uoverensstemmelser i driften kan komme frem.
Det stærkeste svar fra en backtest er ofte: »Denne idé bryder sammen under forhold, vi allerede kan se.« Når den siger: »Dette er den bedste strategi«, så spørg, hvor mange andre svar den blev bedt om at give.
← Alle indlæg


