10. september 2026 · research

Din Sharpe-ratio bestod alle test. Den kan stadig være et tilfælde.

Din Sharpe-ratio bestod alle test. Den kan stadig være et tilfælde.

Tusind strategivarianter. En målt Sharpe på 2.0 for vinderen. En falsk positiv-rate på 5%. Tallene lyder som et stærkt resultat, indtil du spørger, hvor mange forsøg der skulle til for at finde det. Med forsøg nok kan en overbevisende backtest opstå alene af støj.

Det overraskende tal er ikke Sharpe-værdien. Det er antallet af forsøg. Hvert indikatorvindue, hver indgangstærskel, hvert valg af univers og hver forkastet idé giver endnu en chance for at udvælge et heldigt resultat. Hvis din researchproces glemmer de forsøg, gør din konfidensberegning det også.

Hvorfor får vinderen et bedre udseende, når man prøver flere strategier?

Forestil dig, at du tester 1,000 strategier uden reel edge. Hver af dem har 5% chance for at se statistisk signifikant ud i en konventionel test. I praksis er forsøgene ikke helt uafhængige, men grundideen holder: Jo flere kandidater du undersøger, desto større er sandsynligheden for, at én af dem ser usædvanlig god ud ved et tilfælde.

Selv hvis alle kandidater var uafhængige, er sandsynligheden for, at mindst én overskrider tærsklen på 5%, omkring 99.4%. I praksis opfører nærliggende parameterindstillinger sig ofte ens, så 1,000 varianter er ikke 1,000 uafhængige møntkast. Men det effektive antal forsøg er sjældent kun ét.

Her er en lille faldgrube, jeg har set i notebooks: En researcher tester lookbacks fra 5 til 100, plotter Sharpe-overfladen og rapporterer derefter den pæne top. Overfladen er nyttig til at forstå følsomheden. Toppen er også resultatet af en søgning og fortjener mindre vægt end en tærskel, der blev valgt før eksperimentet.

Hvad tæller som et researchforsøg?

Tæl beslutninger, der blev påvirket af de observerede resultater. Et forsøg kan være en kodet backtest, men også en manuel ændring efter at have set aktiekurven. Hvis du gjorde et stop bredere, fordi den gamle indstilling missede et rally, brugte ændringen information fra testperioden.

ResearchhandlingTæller det normalt som et forsøg?Hvorfor
Test af endnu en signaltærskelJaResultatet hjælper med at udvælge en kandidat
Ændring af datoperioden efter at have set et drawdownJaStikprøven blev valgt som reaktion på resultatet
Udbedring af en dokumenteret datafejlNormalt nejÆndringen genskaber det tilsigtede eksperiment
Kørsel af den samme fastlåste strategi på en ny holdout-periodeEndnu ikke et nyt udvælgelsesforsøgDet bliver et, hvis du tuner efter resultatet

Grænsen afhænger af et skøn. En rettelse af en slåfejl er noget andet end at ændre en feature, efter du har set, hvor den fejlede. Før en kort forsøgslog med hypotesen, ændringen, dataperioden og resultatet. Den behøver ikke være elegant; en CSV med datoer er bedre end at skulle rekonstruere din søgning ud fra hukommelsen tre måneder senere.

Kan jeg korrigere min Sharpe for multiple testing?

Metoder som Deflated Sharpe Ratio estimerer, hvor meget af den tilsyneladende performance der kan skyldes udvælgelse blandt mange kandidater, samtidig med at de tager højde for faktorer som afkastfordeling og afhængighed mellem forsøg. De er nyttige diagnostiske værktøjer, men ikke en maskine, der kan forvandle en rodet researchproces til sikkerhed. Resultaterne afhænger af antagelserne og af, om dit antal forsøg er troværdigt.

Som en grov illustration: En researcher tester 400 varianter, finder en Sharpe på 1.8 og vurderer, at afkastene har betydelig skævhed og fede haler. Det resultat bør møde en højere tærskel end en Sharpe på 1.8 fra én forhåndsregistreret test. Korrektionen kan svække evidensen betydeligt; den kan ikke fortælle dig, at edge er reel.

Registrér søgningen, før du får brug for at forsvare den: antal kandidater, parameterrammer, undersøgte dataperioder og eventuelle manuelle ændringer. Hvis du ikke kender detaljerne, så beskriv backtesten som eksplorativ.

Hvad bør ske før paper trading?

Fastlås én kandidat, og definér den næste evaluering, før du kører den. En brugbar rækkefølge er at vælge strategien med træningsdata, undersøge den med valideringsdata og derefter reservere en sidste periode eller paper-trading-periode, som ikke påvirker designet. Hvert trin besvarer et forskelligt spørgsmål; hvis du gentagne gange justerer strategien ud fra det sidste trin, bliver det til mere træningsdata.

Undersøg også, om nærliggende indstillinger fortæller den samme historie. Et bredt område med moderat positive resultater er som regel mere troværdigt end en enkelt nålespids af en top, selvom robusthed ikke redder en mangelfuld eksekveringsmodel. Gebyrer, funding, markedspåvirkning og tilgængelighed af instrumenter skal stadig svare til de vilkår, strategien kunne være blevet mødt med.

Paper trading giver mere evidens om operationel overensstemmelse: timing, ordrehåndtering, og om den live research-pipeline opfører sig som forventet. Det kan ikke viske den allerede foretagne udvælgelse væk. Tusind heldige backtests er stadig tusind forsøg, når den første paperordre sendes afsted.

Så når en backtest viser en Sharpe på 2, så bed om researchhistorikken sammen med aktiekurven. Hvor mange idéer blev afprøvet? Hvilke resultater ændrede det næste eksperiment? Svaret kan være rapportens vigtigste statistik.

backtest-overtilpasningSharpe-ratiomultiple testingstrategiforskningwalk-forward
← Alle indlæg