En backtest egner seg bedre til å forkaste en strategi enn til å velge en. I det øyeblikket du bruker historisk avkastning til å velge mellom mange varianter, blir backtesten en del av eksperimentet, og den tilsynelatende vinneren får en skjult kostnad: seleksjonsskjevhet.
Dette høres bakvendt ut. Vi kjører backtester fordi vi vil vite hvilken strategi som fungerer. Men hvert valg som styres av den samme historikken, bruker opp noe av bevisgrunnlaget. Endrer du tilbakeblikk, terskel, investeringsunivers, rebalanseringsdag eller stop-regel etter å ha sett resultatene, har du stilt dataene et nytt spørsmål. Til slutt har de fått nok spørsmål til å gi deg et overbevisende svar ved en tilfeldighet.
Hvorfor blir det beste resultatet mindre til å stole på når vi tester flere strategier?
Tenk deg at du tester 100 strategier uten noen reell fordel. Avkastningen deres vil likevel variere. Hvis ytelsesestimatene er omtrent uavhengige og støyen er normalfordelt, vil den høyeste Sharpe-verdien blant dem være positiv, selv om den sanne Sharpe-verdien til hver strategi er null.
Et grovt anslag for forventet maksimum av 100 uavhengige standardnormalfordelte observasjoner er 2.5 standardavvik over gjennomsnittet. Se på dette som en illustrasjon, ikke en korreksjon du kan lime inn i en rapport: virkelige strategivarianter er korrelerte, Sharpe-estimater har sin egen utvalgsfeil, og avkastning følger sjelden rene normalfordelinger. Det praktiske poenget står seg likevel. Jo flere kandidater du undersøker, desto større er sjansen for at toppresultatet skyldes gunstig støy.
Og en «kandidat» er ikke bare en lagret backtest. Det er alle valg som tas etter at man har sett et resultat: å utvide investeringsuniverset fordi grafen ser hakkete ut, fjerne et år som trekker ned, eller endre gebyrforutsetningen til kurven snur oppover igjen. Disse beslutningene teller selv om ingen ga dem et versjonsnummer.
Før en forskningslogg før du kjører neste variant
Loggfør hele søket, også forkastede ideer og grunnen til hver endring. Da får du en mer ærlig oversikt over hvor mye resultatet ble valgt ut, og det blir vanskeligere å huske bare de lovende forsøkene.
| Før opp | Eksempel | Hvorfor det er viktig |
|---|---|---|
| Hypotese | Kortsiktig reversering er sterkere etter uvanlig store bevegelser i BTC-perpetualer | Skiller ideen fra parameterinnstillingene den ender opp med |
| Variant og tidsstempel | 48-timers signal, 2026-10-09, kjøring 014 | Teller søket og knytter resultatene til kode og data |
| Utvelgelsesregel | Velg etter netto Sharpe; minst 100 handler | Viser hva «best» betydde før sammenligningen |
| Forkastede varianter | 12, 24 og 72-timers vinduer; alle beholdes | Hindrer at den synlige vinneren visker ut konkurrentene |
En logg kan ikke gjøre om søket. Den gjør søket forståelig, og det er første skritt mot å vurdere hvor mye tillit vinneren fortjener.
Hold av data som forskningsprosessen ikke kan vende tilbake til
Del dataene opp etter tid, og beskytt deretter den siste perioden. Utvikle strategien på ett tidsrom, ta beslutninger på grunnlag av et valideringsintervall, og evaluer den fryste strategien én gang på et senere testsett. Du kan for eksempel bruke 2018–2022 til utvikling, 2023 til validering og holde av 2024–2025. Datoene er bare et eksempel: markedet, strategiens tidshorisont og datadekningen bør avgjøre inndelingen.
Skriv ned hva «fryst» betyr: signal, investeringsunivers, posisjonsstørrelse, forutsetninger om utførelse og eventuelle regler for manglende data. Hvis testsettet skuffer og du justerer strategien etter det, har perioden blitt valideringsdata. Den neste ærlige evalueringen krever nye bevis.
Det er også her små utvalg blir et problem. En strategi som handler 18 ganger i testsettet, gir ikke grunnlag for en presis konklusjon. Oppgi antall handler og usikkerheten sammen med avkastningsstatistikken; ett gjennomsnitt kan få et tynt datagrunnlag til å virke avklart.
Betyr dette at backtester er ubrukelige når vi skal velge strategier?
Nei. Kritikerne har rett i at strenge testsett kan være sløsing: markeder endrer seg, historikkene er korte, og en urørt periode kan bare representere ett uvanlig markedsregime. En nøye utformet walk-forward-prosess kan vise hvordan en strategi oppfører seg etter hvert som tilgjengelig historikk rullerer fremover. Men gjentatt justering blir ikke gratis av den grunn. Hvis du undersøker hver fold og reviderer strategien, har foldene påvirket forskningen.
Bruk backtester til å avdekke feilmåter, sammenligne et lite antall ideer som bygger på en markedsmekanisme, og undersøke om resultatene holder seg ved plausible gebyrer, finansieringskostnader, markedspåvirkning og parameterendringer. Før en logg. Bevar et endelig testsett. Ta deretter en lovende, fryst versjon over i papirkonto, der avvik i den operative gjennomføringen kan komme til syne.
Det sterkeste svaret fra en backtest er ofte: «Denne ideen bryter sammen under forhold vi allerede kan se.» Når den sier «Dette er den beste strategien», bør du spørre hvor mange andre svar den ble bedt om å gi.
← Alle innlegg


