2026. szeptember 10. · kutatás

A Sharpe-mutatód minden próbát kiállt. Ettől még lehet, hogy csak a véletlen műve.

A Sharpe-mutatód minden próbát kiállt. Ettől még lehet, hogy csak a véletlen műve.

Ezer stratégia-változat. A győztes mért Sharpe-mutatója 2.0. Az álpozitív eredmény 5%-os valószínűsége. Ezek az adatok erős eredménynek tűnnek, amíg meg nem kérdezed, hány próbálkozás kellett a megtalálásához. Elég sok próbálkozás után már önmagában a zajból is meggyőző backtest születhet.

Nem a Sharpe-mutató a meglepő, hanem a próbák száma. Minden indikátorablak, belépési küszöb, eszközkör-választás és elvetett ötlet újabb lehetőséget ad arra, hogy véletlenül kedvező eredményt válasszunk ki. Ha a kutatási folyamatod megfeledkezik ezekről a próbákról, a megbízhatósági számításod is figyelmen kívül hagyja őket.

Miért teszi meggyőzőbbnek a győztes eredményt, ha több stratégiát próbálunk ki?

Tegyük fel, hogy 1,000 olyan stratégiát tesztelsz, amelyeknek valójában nincs előnyük. Mindegyiknek 5% az esélye arra, hogy egy hagyományos teszt szerint statisztikailag szignifikánsnak tűnjön. A valós kutatásban ezek a próbák nem teljesen függetlenek, de az alapgondolat érvényes: minél több jelöltet vizsgálsz meg, annál valószínűbb, hogy valamelyik véletlenül kivételesnek látszik.

Még ha minden jelölt független lenne is, körülbelül 99.4% annak a valószínűsége, hogy legalább egy átlépi az 5%-os küszöböt. A gyakorlatban az egymáshoz közeli paraméterbeállítások gyakran hasonlóan viselkednek, tehát 1,000 változat nem jelent 1,000 független pénzfeldobást. Az effektív próbálkozások száma azonban ritkán csak egy.

Íme egy apró csapda, amellyel jegyzetfüzetekben találkoztam: egy kutató 5-től 100-ig vizsgálja a visszatekintési ablakokat, kirajzolja a Sharpe-felületet, majd beszámol a szép, tiszta csúcsértékről. A felület hasznos az érzékenység megértéséhez. A csúcs azonban egy keresés eredménye is, ezért kevesebb súlyt érdemel, mint egy kísérlet előtt kiválasztott küszöb.

Mi számít kutatási próbának?

Vedd számba azokat a döntéseket, amelyekre hatással voltak a megfigyelt eredmények. Próba lehet egy kódolt backtest, de az equity curve megtekintése után kézzel végzett módosítás is. Ha azért tágítottál a stopon, mert a régi beállítással lemaradtál egy raliról, a módosítás felhasználta a tesztidőszak adatait.

Kutatási lépésÁltalában próbának számít?Miért
Újabb jelzési küszöb teszteléseIgenAz eredmény segít kiválasztani a jelöltet
Az időszak módosítása egy visszaesés megtekintése utánIgenA mintát a teljesítményre reagálva választottad ki
Dokumentált adathiba javításaÁltalában nemA módosítás helyreállítja a tervezett kísérletet
Ugyanannak a befagyasztott stratégiának a futtatása egy új, visszatartott időszakonEgyelőre nem jelent újabb szelekciós próbátAkkor válik azzá, ha az eredmény alapján hangolod a stratégiát

A határvonal meghúzásához mérlegelés kell. Más egy elgépelés javítása, mint egy jellemző módosítása annak észrevétele után, hogy hol vallott kudarcot. Vezess rövid próbajegyzéket a hipotézisről, a változtatásról, az adatperiódusról és az eredményről. Nem kell elegánsnak lennie; egy dátumozott CSV jobb, mint három hónappal később emlékezetből rekonstruálni a keresést.

Korrigálhatom a Sharpe-mutatót a többszörös tesztelés hatására?

Az olyan módszerek, mint a Deflated Sharpe Ratio, megbecsülik, hogy a látszólagos teljesítmény mekkora része eredhet sok jelölt közötti szelekcióból, figyelembe véve többek között a hozameloszlást és a próbák függőségét. Hasznos diagnosztikai eszközök, de nem alakítják bizonyossággá a rendezetlen kutatási folyamatot. Az eredményük a feltevésektől és attól is függ, mennyire hiteles a próbák száma.

Durva becslésként tegyük fel, hogy egy kutató 400 változatot tesztelt, 1.8-as Sharpe-mutatót talált, és úgy becsüli, hogy a hozamok eloszlása erősen ferde, vastag szélű. Ennek az eredménynek magasabb küszöböt kell megugrania, mint egy előre regisztrált tesztből származó 1.8-as Sharpe-mutatónak. A korrekció jelentősen gyengítheti a bizonyítékot; azt viszont nem tudja megmondani, hogy valódi-e az előny.

Rögzítsd a keresés részleteit, mielőtt számot kell adnod róla: a jelöltek számát, a paramétertartományokat, a megvizsgált adatperiódusokat és a kézi módosításokat. Ha ezek az adatok nem ismertek, nevezd a backtestet feltáró jellegűnek.

Mi történjen a papíralapú kereskedés előtt?

Fagyassz be egy jelöltet, és még a futtatás előtt határozd meg a következő értékelés módját. Hasznos sorrend: a stratégia kiválasztása tanítóadatokon, ellenőrzése validációs adatokon, majd egy végső időszak vagy papíralapú kereskedési ablak fenntartása, amely nem hat vissza a tervezésre. Minden szakasz más kérdésre ad választ; ha a végső szakasz alapján újra meg újra módosítod a stratégiát, az újabb tanítóadattá válik.

Azt is nézd meg, hogy a közeli beállítások hasonló képet mutatnak-e. A szerényen pozitív eredmények szélesebb tartománya általában hitelesebb, mint egy tűhegyes csúcs, bár a robusztusság nem ment meg egy hibás végrehajtási modelltől. A díjaknak, a finanszírozási költségnek, az árhatásnak és az eszközök elérhetőségének továbbra is azt kell tükrözniük, amivel a stratégiának a valóságban szembe kellett volna néznie.

A papíralapú kereskedés a működésbeli egyezésről ad további bizonyítékot: az időzítésről, a megbízások kezeléséről és arról, hogy az éles kutatási folyamat a várakozások szerint működik-e. A korábban végrehajtott szelekciót azonban nem törli el. Ezer szerencsés backtest ezer próbálkozás marad akkor is, amikor kimegy az első papírmegbízás.

Ha tehát egy backtest 2-es Sharpe-mutatót jelez, az equity curve mellett kérd el a kutatási előzményeket is. Hány ötletet próbáltatok ki? Mely eredmények változtatták meg a következő kísérletet? Lehet, hogy ezek a jelentés legfontosabb adatai.

backtest-túlillesztésSharpe-mutatótöbbszörös tesztelésstratégiai kutatásgördülő előretesztelés
← Összes bejegyzés