Duizend strategievarianten. Een gemeten Sharpe van 2.0 voor de winnaar. Een fout-positiefpercentage van 5%. Dat klinkt als een sterk resultaat, totdat je vraagt hoeveel pogingen eraan voorafgingen. Bij genoeg pogingen kan een overtuigende backtest puur uit ruis voortkomen.
Het verrassende getal is niet de Sharpe. Het is het aantal pogingen. Elke indicatorperiode, instapdrempel, universumkeuze en verworpen idee biedt weer een kans om een gelukkig resultaat te selecteren. Als je onderzoeksproces die pogingen niet bijhoudt, doet je betrouwbaarheidsberekening dat ook niet.
Waarom lijkt de winnaar beter als je meer strategieën probeert?
Stel dat je 1,000 strategieën test die geen echt voordeel hebben. Elk heeft 5% kans om volgens een conventionele toets statistisch significant te lijken. In echt onderzoek zijn die tests niet volledig onafhankelijk, maar het basisidee blijft overeind: hoe meer kandidaten je bekijkt, hoe groter de kans dat er toevallig één uitzonderlijk lijkt.
Zelfs als elke kandidaat onafhankelijk was, is de kans dat er minstens één die drempel van 5% haalt ongeveer 99.4%. In de praktijk gedragen nabije parameterinstellingen zich vaak vergelijkbaar, dus 1,000 varianten zijn geen 1,000 onafhankelijke muntworpen. Maar het effectieve aantal pogingen is zelden één.
Hier is een kleine valkuil die ik in notebooks ben tegengekomen: een onderzoeker test terugkijkperiodes van 5 tot 100, tekent het Sharpe-oppervlak en rapporteert vervolgens de fraai ogende piek. Dat oppervlak is nuttig om de gevoeligheid te begrijpen. De piek is ook het resultaat van een zoektocht en verdient minder vertrouwen dan een drempel die vóór het experiment is gekozen.
Wat telt als een onderzoekstest?
Tel beslissingen mee die zijn beïnvloed door waargenomen resultaten. Een test kan een gecodeerde backtest zijn, maar ook een handmatige aanpassing nadat je de vermogenscurve hebt bekeken. Als je een stop ruimer hebt gezet omdat de oude instelling een rally miste, gebruikte die aanpassing informatie uit de testperiode.
| Onderzoeksactie | Telt dit meestal als een test? | Waarom |
|---|---|---|
| Een andere signaaldrempel testen | Ja | Het resultaat helpt bij de selectie van een kandidaat |
| De datumperiode aanpassen nadat je een drawdown hebt gezien | Ja | De steekproef is gekozen als reactie op de prestaties |
| Een gedocumenteerde datafout herstellen | Meestal niet | De aanpassing herstelt het bedoelde experiment |
| Dezelfde bevroren strategie uitvoeren op een nieuwe holdout-periode | Nog geen nieuwe selectietest | Dat wordt er één zodra je op basis van dat resultaat gaat bijstellen |
Waar je de grens trekt, vergt enig oordeel. Een typefout herstellen is iets anders dan een kenmerk aanpassen nadat je hebt gezien waar het faalde. Houd een kort logboek bij met de hypothese, wijziging, datap periode en uitkomst. Dat hoeft niet mooi te zijn; een gedateerd CSV-bestand is beter dan je zoektocht drie maanden later uit je geheugen te reconstrueren.
Kan ik mijn Sharpe corrigeren voor multiple testing?
Methoden zoals de Deflated Sharpe Ratio schatten hoeveel van de ogenschijnlijke prestaties kan voortkomen uit selectie uit veel kandidaten, rekening houdend met factoren zoals de rendementsverdeling en afhankelijkheid tussen tests. Het zijn nuttige diagnostische hulpmiddelen, geen machines die een rommelig onderzoeksproces omzetten in zekerheid. De uitkomsten hangen af van aannames en van de geloofwaardigheid van je aantal tests.
Neem als grove indicatie een onderzoeker die 400 varianten testte, een Sharpe van 1.8 vond en inschat dat de rendementen een aanzienlijke scheefheid en dikke staarten hebben. Dat resultaat moet aan een strengere maatstaf voldoen dan een Sharpe van 1.8 uit één vooraf geregistreerde test. De correctie kan het bewijs aanzienlijk verzwakken; ze kan je niet vertellen dat het voordeel echt is.
Leg je zoektocht vast voordat je die moet verantwoorden: het aantal kandidaten, parameterbereiken, bekeken datap periodes en eventuele handmatige aanpassingen. Als die gegevens onbekend zijn, beschrijf de backtest dan als verkennend.
Wat moet er gebeuren voordat je met paper trading begint?
Bevries één kandidaat en bepaal de volgende evaluatie voordat je die uitvoert. Een bruikbare volgorde is de strategie kiezen met trainingsdata, die op validatiedata beoordelen en vervolgens een laatste periode of paper-tradingvenster reserveren dat niet terugvloeit naar het ontwerp. Elke fase beantwoordt een andere vraag; als je de strategie in de laatste fase steeds aanpast, wordt die fase opnieuw trainingsdata.
Bekijk ook of nabije instellingen hetzelfde beeld geven. Een breed gebied met bescheiden positieve resultaten is doorgaans geloofwaardiger dan één scherpe piek, al maakt robuustheid een gebrekkig uitvoeringsmodel niet goed. Kosten, funding, marktimpact en beschikbaarheid van instrumenten moeten nog steeds overeenkomen met wat de strategie in werkelijkheid had kunnen meemaken.
Paper trading levert bewijs over de operationele overeenstemming: timing, orderafhandeling en of de live onderzoekspijplijn zich gedraagt zoals verwacht. Het wist eerdere selectie niet uit. Duizend backtests die toevallig goed uitpakten, blijven duizend pogingen wanneer de eerste paperorder wordt verstuurd.
Vraag dus bij een backtest met een Sharpe van 2 ook om de onderzoeksvoorgeschiedenis naast de vermogenscurve. Hoeveel ideeën zijn geprobeerd? Welke resultaten hebben het volgende experiment veranderd? Het antwoord is misschien wel de belangrijkste statistiek in het rapport.
← Alle artikelen


