Ett backtest är bättre på att sålla bort en strategi än på att välja ut en. Så fort du använder historisk avkastning för att välja mellan många varianter blir backtestet en del av experimentet, och den skenbara vinnaren får en dold kostnad: urvalsbias.
Det låter bakvänt. Vi backtestar för att ta reda på vilken strategi som fungerar. Men varje val som styrs av samma historik förbrukar en del av dess bevisvärde. Ändra lookback-period, tröskelvärde, universum, ombalanseringsdag eller stopregel efter att du sett resultaten, så har du ställt data ytterligare en fråga. Förr eller senare har den fått tillräckligt många frågor för att av en slump ge dig ett övertygande svar.
Varför blir det bästa resultatet mindre tillförlitligt när man testar fler strategier?
Tänk dig att du testar 100 strategier utan någon verklig fördel. Deras avkastning kommer ändå att skilja sig åt. Om prestationsskattningarna är ungefär oberoende och bruset är normalfördelat kommer den bästa Sharpe-kvoten bland dem att vara positiv, trots att varje strategis verkliga Sharpe-kvot är noll.
En grov uppskattning av det förväntade maximumet av 100 oberoende standardnormalfördelade dragningar är 2.5 standardavvikelser över medelvärdet. Se det som en illustration, inte som en korrigering att klistra in i en rapport: verkliga strategivarianter är korrelerade, Sharpe-skattningar har sitt eget urvalsfel och avkastning följer sällan en ren normalfördelning. Den praktiska poängen kvarstår trots dessa förbehåll. Ju fler kandidater du granskar, desto större är sannolikheten att toppresultatet speglar gynnsamt brus.
Och en ”kandidat” är inte bara ett sparat backtest. Det är varje val du gör efter att ha sett ett resultat: att bredda universumet för att diagrammet ser ryckigt ut, ta bort ett år som drar ned resultatet eller ändra ett avgiftsantagande tills kurvan återhämtar sig. Sådana beslut räknas även om ingen gav dem ett versionsnummer.
För en forskningslogg innan du testar nästa variant
Dokumentera hela sökningen, även idéer du förkastat och skälet till varje ändring. Då får du en ärligare bild av hur mycket resultatet har valts fram, och det blir svårare att bara minnas de försök som såg lovande ut.
| Dokumentera | Exempel | Varför det spelar roll |
|---|---|---|
| Hypotes | Kortfristig mean reversion är starkare efter ovanligt stora rörelser i BTC-perpetualer | Skiljer idén från de parameterinställningar den senare får |
| Variant och tidsstämpel | 48-timmarssignal, 2026-10-09, körning 014 | Räknar sökningen och kopplar resultaten till kod och data |
| Urvalsregel | Välj utifrån netto-Sharpe; minst 100 affärer | Visar vad ”bäst” betydde innan jämförelsen |
| Förkastade varianter | 12-, 24- och 72-timmarsfönster; alla sparade | Hindrar den synliga vinnaren från att sudda ut konkurrenterna |
En logg gör inte sökningen ogjord. Den synliggör den, vilket är första steget mot att bedöma hur mycket förtroende vinnaren förtjänar.
Reservera data som forskningsprocessen inte får återanvända
Dela upp data över tid och skydda sedan den sista perioden. Utveckla strategin under en period, fatta beslut med hjälp av en valideringsperiod och utvärdera den frysta strategin en enda gång på en senare holdout-period. Du kan till exempel använda 2018–2022 för utveckling, 2023 för validering och reservera 2024–2025. Datumen är bara en skiss: marknaden, strategins tidshorisont och datatäckningen bör styra uppdelningen.
Skriv ned vad ”fryst” innebär: signal, universum, positionsstorlek, exekveringsantaganden och eventuella regler för saknade data. Om holdout-resultatet gör dig besviken och du justerar strategin utifrån det har perioden blivit valideringsdata. Nästa ärliga utvärdering kräver nya belägg.
Det är också här små urval blir ett problem. En strategi som gör 18 affärer under en holdout-period ger inte underlag för en precis bedömning. Redovisa antalet affärer och osäkerheten tillsammans med avkastningsmåtten; ett enda genomsnitt kan få ett litet urval att se avgjort ut.
Betyder det här att backtester är värdelösa när man ska välja strategier?
Nej. Kritiker har rätt i att strikta holdout-perioder kan vara slöseri: marknader förändras, historiken är kort och en orörd period kanske bara representerar en ovanlig regim. En väl utformad walk-forward-process kan visa hur en strategi beter sig när den tillgängliga historiken rullar framåt. Men upprepad finjustering blir inte gratis för det. Om du granskar varje fold och ändrar strategin har dessa foldar påverkat forskningen.
Använd backtester för att upptäcka svagheter, jämföra ett litet antal idéer som bygger på en marknadsmekanism och testa om resultaten håller för rimliga antaganden om avgifter, funding, marknadspåverkan och parameterändringar. För en logg. Spara en slutlig holdout-period. Testa sedan en lovande, fryst version i paper trading, där avvikelser i den praktiska driften kan komma fram.
Det starkaste svaret ett backtest ofta kan ge är: ”Den här idén fallerar under förhållanden vi redan kan se.” När det säger: ”Det här är den bästa strategin”, fråga hur många andra svar du bad det om.
← Alla inlägg


