Tuhat strategiavariaatiota. Voittajan mitattu Sharpe-luku on 2.0. Väärien positiivisten tulosten osuus on 5%. Nämä luvut kuulostavat vahvalta tulokselta, kunnes kysyt, montako yritystä sen löytämiseen tarvittiin. Riittävän monen yrityksen jälkeen vakuuttava backtest voi syntyä pelkästä kohinasta.
Yllättävä luku ei ole Sharpe. Se on kokeilujen määrä. Jokainen indikaattorin aikaikkuna, sisääntulokynnys, sijoituskohteiden valinta ja hylätty idea tarjoaa uuden mahdollisuuden valita onnekas tulos. Jos tutkimusprosessisi unohtaa nämä yritykset, myös luottamuslaskelmasi unohtaa ne.
Miksi useampien strategioiden kokeileminen saa voittajan näyttämään paremmalta?
Kuvittele testaavasi 1,000 strategiaa, joilla ei ole todellista etua. Jokaisella on 5%:n mahdollisuus näyttää tavanomaisessa testissä tilastollisesti merkitsevältä. Todellisessa tutkimuksessa kokeilut eivät ole täysin riippumattomia, mutta perusajatus pätee: mitä useampia ehdokkaita tarkastelet, sitä todennäköisemmin jokin niistä näyttää sattumalta poikkeukselliselta.
Vaikka kaikki ehdokkaat olisivat riippumattomia, todennäköisyys sille, että vähintään yksi ylittää tuon 5%:n rajan, on noin 99.4%. Käytännössä lähekkäiset parametriasetukset tuottavat usein samankaltaisia tuloksia, joten 1,000 variaatiota eivät vastaa 1,000 riippumatonta kolikonheittoa. Todellinen kokeilujen määrä on kuitenkin harvoin vain yksi.
Tässä on pieni sudenkuoppa, johon olen törmännyt muistikirjoissa: tutkija testaa lookback-jaksoja 5:stä 100:aan, piirtää Sharpe-pinnan ja raportoi sitten siistin näköisen huipun. Pinta auttaa ymmärtämään herkkyyttä. Huippu on myös haun tulos, joten sille kuuluu antaa vähemmän painoarvoa kuin ennen koetta valitulle kynnykselle.
Mikä lasketaan tutkimuskokeiluksi?
Laske mukaan päätökset, joihin havaitut tulokset vaikuttivat. Kokeilu voi olla koodattu backtest, mutta myös manuaalinen muutos, jonka teit nähtyäsi tuottokäyrän. Jos pidensit stop-lossia, koska vanha asetus ei osunut nousuun, muutos hyödynsi testijakson tietoja.
| Tutkimustoimi | Lasketaanko yleensä kokeiluksi? | Perustelu |
|---|---|---|
| Toisen signaalikynnyksen testaaminen | Kyllä | Tulos auttaa valitsemaan ehdokkaan |
| Ajanjakson muuttaminen pudotuksen näkemisen jälkeen | Kyllä | Otos valittiin tuloskehityksen perusteella |
| Dokumentoidun data-virheen korjaaminen | Yleensä ei | Muutos palauttaa alkuperäisen kokeen tarkoituksen |
| Saman lukitun strategian ajaminen uudella holdout-jaksolla | Ei vielä uutta valintakoetta | Siitä tulee sellainen, jos virität strategiaa tuloksen perusteella |
Rajanveto vaatii harkintaa. Kirjoitusvirheen korjaaminen on eri asia kuin ominaisuuden muuttaminen sen jälkeen, kun olet huomannut, missä se epäonnistui. Pidä lyhyttä koepäiväkirjaa, johon kirjaat hypoteesin, muutoksen, datajakson ja tuloksen. Sen ei tarvitse olla hienostunut: päivätty CSV on parempi kuin haun rekonstruointi muistista kolme kuukautta myöhemmin.
Voinko korjata Sharpe-lukuani useiden testien varalta?
Deflated Sharpe Ratio -menetelmän kaltaiset lähestymistavat arvioivat, kuinka suuri osa näennäisestä tuotosta voisi syntyä useiden ehdokkaiden joukosta valitsemisen seurauksena, ja ottavat huomioon esimerkiksi tuottojakauman ja kokeilujen riippuvuuden. Ne ovat hyödyllisiä diagnostiikkatyökaluja, eivät kone, joka muuttaa sekavan tutkimusprosessin varmuudeksi. Tulokset riippuvat oletuksista ja siitä, onko kokeilujen määrä uskottava.
Suuntaa antavana esimerkkinä tutkija testasi 400 variaatiota, sai Sharpe-luvuksi 1.8 ja arvioi tuottojensa olevan voimakkaasti vinoja ja paksuhäntäisiä. Tulos vaatii korkeamman näyttökynnyksen kuin Sharpe-luku 1.8 yhdestä ennakkoon rekisteröidystä testistä. Korjaus voi heikentää näyttöä huomattavasti, mutta se ei voi kertoa, onko etu todellinen.
Kirjaa haku muistiin ennen kuin joudut perustelemaan sen: ehdokkaiden määrä, parametrialueet, tarkastellut datajaksot ja kaikki manuaaliset muutokset. Jos näitä tietoja ei ole saatavilla, kuvaile backtestiä kokeilevaksi.
Mitä pitää tapahtua ennen paperikaupankäyntiä?
Lukitse yksi ehdokas ja määrittele seuraava arviointi ennen sen ajamista. Hyödyllinen etenemisjärjestys on valita strategia harjoitusdatalla, tarkastella sitä validointidatalla ja jättää sen jälkeen viimeinen jakso tai paperikaupankäynnin aikaikkuna käyttöön niin, ettei se vaikuta suunnitteluun. Kukin vaihe vastaa eri kysymykseen; strategian toistuva säätäminen viimeisen vaiheen tulosten perusteella muuttaa sen uudeksi harjoitusdataksi.
Tarkista myös, kertovatko läheiset asetukset samaa tarinaa. Laaja alue kohtuullisen myönteisiä tuloksia on yleensä uskottavampi kuin yksi neulamainen huippu, vaikka vakaus ei pelasta virheellistä toteutusmallia. Kulujen, rahoitusmaksujen, markkinavaikutuksen ja instrumenttien saatavuuden pitää silti vastata strategian todellisia kaupankäyntiolosuhteita.
Paperikaupankäynti antaa lisänäyttöä operatiivisesta vastaavuudesta: ajoituksesta, toimeksiantojen käsittelystä ja siitä, toimiiko live-tutkimusputki odotetusti. Se ei voi pyyhkiä pois jo tapahtunutta valintaa. Tuhat onnekasta backtestiä on yhä tuhat yritystä, kun ensimmäinen paperitoimeksianto lähtee matkaan.
Kun backtestin Sharpe-luvuksi ilmoitetaan 2, pyydä tuottokäyrän rinnalle tutkimushistoria. Kuinka monta ideaa kokeiltiin? Mitkä tulokset muuttivat seuraavaa koetta? Vastaus voi olla raportin tärkein tilasto.
← Kaikki kirjoitukset


