Tusen strategivarianter. En målt Sharpe på 2.0 for vinneren. En falsk positiv-rate på 5 %. Tallene høres overbevisende ut helt til du spør hvor mange forsøk som gikk med på å finne resultatet. Med nok forsøk kan en overbevisende backtest oppstå av ren støy.
Det overraskende tallet er ikke Sharpe-verdien. Det er antallet forsøk. Hvert indikatorvindu, hver inngangsterskel, hvert valg av univers og hver forkastede idé gir enda en mulighet til å velge et heldig resultat. Hvis researchprosessen din glemmer disse forsøkene, gjør også konfidensberegningen det.
Hvorfor ser vinneren bedre ut når du prøver flere strategier?
Tenk deg at du tester 1,000 strategier uten noen reell edge. Hver av dem har 5 % sjanse for å framstå som statistisk signifikant i en konvensjonell test. I faktisk research er ikke forsøkene helt uavhengige, men grunntanken står: Jo flere kandidater du undersøker, desto større er sjansen for at én av dem ser eksepsjonell ut ved en tilfeldighet.
Selv om alle kandidatene var uavhengige, er sannsynligheten for at minst én passerer 5 %-terskelen omtrent 99.4 %. I praksis oppfører nærliggende parameterverdier seg ofte likt, så 1,000 varianter tilsvarer ikke 1,000 uavhengige myntkast. Men det effektive antallet forsøk er sjelden bare ett heller.
Her er en liten felle jeg har sett i notebooks: En researcher tester lookbacks fra 5 til 100, plotter Sharpe-overflaten og rapporterer deretter den pene toppen. Overflaten er nyttig for å forstå følsomhet. Toppen er også resultatet av et søk, og fortjener mindre tillit enn en terskel som ble valgt før eksperimentet.
Hva regnes som et research-forsøk?
Tell med beslutninger som ble påvirket av observerte resultater. Et forsøk kan være en kodet backtest, men det kan også være en manuell endring du gjorde etter å ha sett egenkapitalkurven. Hvis du utvidet en stop fordi den forrige innstillingen gikk glipp av en oppgang, brukte du informasjon fra testperioden.
| Research-handling | Regnes vanligvis som et forsøk? | Hvorfor |
|---|---|---|
| Teste en annen signalterskel | Ja | Resultatet bidrar til å velge en kandidat |
| Endre datoperioden etter å ha sett et drawdown | Ja | Utvalget ble valgt som følge av resultatene |
| Rette en dokumentert datafeil | Vanligvis ikke | Endringen gjenoppretter det planlagte eksperimentet |
| Kjøre den samme fastlåste strategien på en ny holdout-periode | Foreløpig ikke et nytt utvalgsforsøk | Det blir et forsøk hvis du tuner mot resultatet |
Grensen krever skjønn. En skrivefeilretting er noe annet enn å endre en feature etter at du har sett hvor den feilet. Før en kort logg over forsøkene med hypotesen, endringen, dataperioden og resultatet. Den trenger ikke være elegant; en CSV med datoer er bedre enn å rekonstruere søket fra hukommelsen tre måneder senere.
Kan jeg korrigere Sharpe-verdien for multiple testing?
Metoder som Deflated Sharpe Ratio anslår hvor mye av den tilsynelatende avkastningen som kan skyldes seleksjon blant mange kandidater, samtidig som de tar hensyn til faktorer som avkastningsfordeling og avhengighet mellom forsøk. De er nyttige diagnostiske verktøy, ikke en maskin som gjør en rotete researchprosess sikker. Resultatene avhenger av antakelsene og av om antallet forsøk du oppgir er troverdig.
For å få en grov følelse av størrelsesordenen: Tenk deg at en researcher testet 400 varianter, fant en Sharpe på 1.8 og anslår at avkastningen har betydelig skjevhet og fete haler. Det resultatet bør møte en høyere terskel enn en Sharpe på 1.8 fra én forhåndsregistrert test. Korrigeringen kan svekke evidensen betydelig; den kan ikke fortelle deg at edgen er reell.
Dokumenter søket før du må forsvare det: antall kandidater, parameterintervaller, dataperioder du har sett på og eventuelle manuelle endringer. Hvis du ikke kjenner disse detaljene, bør du beskrive backtesten som utforskende.
Hva bør skje før paper trading?
Lås én kandidat og definer neste evaluering før du kjører den. En nyttig rekkefølge er å velge strategien med treningsdata, undersøke den på valideringsdata og deretter holde av en siste periode eller et paper-trading-vindu som ikke påvirker utformingen. Hvert trinn besvarer et eget spørsmål; justerer du strategien gjentatte ganger på det siste trinnet, blir det mer treningsdata.
Undersøk også om nærliggende innstillinger forteller samme historie. Et bredt felt med moderat positive resultater er vanligvis mer troverdig enn én spiss topp, selv om robusthet ikke kan redde en mangelfull modell for ordreutførelse. Gebyrer, funding, markedspåvirkning og tilgang på instrumenter må fortsatt gjenspeile det strategien faktisk kunne ha møtt.
Paper trading gir mer evidens om operasjonell paritet: timing, ordrehåndtering og om den løpende research-pipelinen oppfører seg som forventet. Det kan ikke viske ut seleksjonen som allerede har skjedd. Tusen heldige backtester er fortsatt tusen forsøk når den første paper-ordren går ut.
Så når en backtest viser en Sharpe på 2, bør du be om research-historikken sammen med egenkapitalkurven. Hvor mange ideer ble prøvd? Hvilke resultater endret det neste eksperimentet? Svaret kan være den viktigste statistikken i rapporten.
← Alle innlegg


