30. elokuu 2026 · tilastot

Kuinka monta kauppaa backtesti tarvitsee, ennen kuin Sharpe kertoo mitään?

Kuinka monta kauppaa backtesti tarvitsee, ennen kuin Sharpe kertoo mitään?

Tämä on kysymys, jonka kuulen useimmin eri muodoissa ihmisiltä, jotka ovat juuri saaneet ensimmäisen strategiansa valmiiksi: kuinka monta kauppaa tarvitsen, ennen kuin tulos on todellinen? Yleensä mukana on jokin luku. ”Minulla on 1,200 kauppaa, sehän riittää, eikö?” Rehellinen vastaus ärsyttää kaikkia, sillä kyse ei ole kauppojen määrästä lainkaan.

Tässä koko juttu yhdellä rivillä. Sen jälkeen käytän lopun kirjoituksesta siihen, miksi se tuntuu ikävältä.

1/√Tannualisoidun Sharpen keskivirhe, T vuosina
±0.8895%:n luottamusväli mille tahansa 5 vuoden Sharpe-arvolle
1.4Sharpe, jonka onnekkain 100 kohinastrategiasta näyttää saman 5 vuoden aikana

Mikä on Sharpen suhdeluvun keskivirhe?

Kun Sharpe lasketaan n jaksottaisesta tuotosta olettaen, että tuotot ovat riippumattomia ja suunnilleen normaalijakautuneita, otantavirhe on:

SE(s) ≈ √((1 + s²/2) / n)

jossa s on samalla taajuudella mitattu Sharpe. Kun annualisoimme molemmat puolet, saamme yksinkertaisen tuloksen. Jos vuodessa on k havaintoa ja dataa on T vuotta, annualisoidun Sharpen S keskivirhe on:

SE(S) ≈ √((1 + S²/(2k)) / T)

Katso 2k nimittäjää. Päivätuotoille k = 252, joten jopa Sharpe-arvo 2 lisää osoittajaan 4/504 ≈ 0.008. Koko termi supistuu arvoon 1. Annualisoidun Sharpen keskivirhe on noin 1/√T, missä T on datan kalenterivuosien määrä. Se riippuu tuskin lainkaan Sharpe-arvosta, ei otantataajuudesta eikä missään tapauksessa tekemiesi kauppojen määrästä.

Eli:

DatavuosiaSE(Sharpe)95%:n LV, jos mitattu arvo oli 1.5
11.00−0.46–3.46
20.710.11–2.89
30.580.37–2.63
50.450.62–2.38
100.320.88–2.12

Backtesti, jonka Sharpe on 1.5 kahden vuoden historiasta laskettuna, ei 95%:n luottamustasolla eroa tilastollisesti kolikonheitosta. Tämä on useimpien kryptomarkkinoita koskevien tutkimusten lähtötilanne, sillä useimpien käytössä puhdas, selviytymisharhan korjattu ja kulut tarkasti huomioiva data alkaa vuoden 2022 tienoilta, eikä puolta kiinnostavista symboleista ollut olemassa ennen vuotta 2023.

Mutta minulla on 40,000 kauppaa. Eikö se ratkaise ongelmaa?

Ei, ja tämä on väärinkäsitys, josta haluan eniten päästä eroon.

Kauppojen määrä ja otoksen pituus ovat eri suureita, ja kaavassa on niistä vain toinen. Jos strategiasi tekee 40,000 kauppaa kuudessa kuukaudessa, T = 0.5 ja SE ≈ 1.41. Kun mitattu Sharpe on 2.0, sen 95%:n luottamusväli on −0.8–4.8. Neljäkymmentätuhatta kauppaa, ja rehellinen johtopäätös kuuluu: ”strategia voi olla hyvä tai sitten tappiollinen.”

Syy on se, etteivät nuo 40,000 kauppaa ole 40,000 riippumatonta vetoa 40,000 erilaisessa markkinatilanteessa. Ne ovat 40,000 havaintoa noin 180 päivän markkinakäyttäytymisestä, ja päivät korreloivat keskenään, samoin eri ajanjaksot omien ryhmiensä sisällä. Korkean taajuuden keskiarvoon palautuva strategia, joka tuottaa voittoa joka päivä neljän kuukauden ajan, on oikeastaan tehnyt yhden vedon — sen, että lyhyen aikavälin palautuminen toimii tässä likviditeettitilanteessa — ja nähnyt vedon ratkeavan ehkä vain muutaman kerran riippumattomasti.

Käytän tällaista nyrkkisääntöä: laske markkinatilanteet, älä toteutuneita kauppoja. Kuinka monesta aidosti erilaisesta markkinatilanteesta strategia selviytyi? Rahoituskoron carry-strategia, joka toimi yhden pitkän positiivisen basis-jakson ajan, on nähnyt n = 1 riippumatta siitä, montako tuntikohtaista uudelleenpainotusta se teki.

Nopea tarkistus: tee päivittäiselle P&L:lle lohkobootstrap 20 päivän lohkopituudella ja tarkastele otannalla saatujen Sharpe-arvojen hajontaa. Jos 5. persentiili on alle nollan, kauppojen määrällä ei ole merkitystä. Tämän toteuttaa noin yhdeksällä numpy-rivillä, ja se on saanut minut luopumaan useammasta strategiasta kuin mikään muu yksittäinen tarkistus.

Päteekö kaava todellisiin strategioihin?

Ei aivan, ja se aliarvioi epävarmuutta tavalla, josta et pidä. Tulos 1/√T olettaa tuotot riippumattomiksi ja normaalijakautuneiksi. Todellisten strategioiden tuotot ovat autokorreloituneita ja vinoja, ja vinous on yleensä negatiivista strategioissa, jotka muistuttavat carrya, short volia tai keskiarvoon palautumista. Mertensin korjaus ottaa nämä momentit huomioon:

SE(s) ≈ √((1 + s²/2 − γ₃·s + (γ₄−3)·s²/4) / n)

missä γ₃ on vinous ja γ₄ huipukkuus. Negatiivinen vinous tekee termistä −γ₃·s positiivisen ja kasvattaa luottamusväliä. Ylimääräinen huipukkuus kasvattaa sitä edelleen. Tyypillisessä krypto carry -strategian P&L:ssä, jossa vinous on noin −1.2 ja huipukkuus noin 9, olen nähnyt korjatun keskivirheen olevan 30–40% naiiviarviota suurempi. Lon vuoden 2002 artikkeli käsittelee autokorrelaatiota, ja vaikutus on samansuuntainen: tuottojen positiivinen sarjakorrelaatio paisuttaa naiivia Sharpea ja pienentää näennäistä virhettä, mikä on ikävä yhdistelmä.

Käsittele siis 1/√T:tä epävarmuuden alarajana. Se on paras mahdollinen tapaus.

Kuinka suuri Sharpen pitää olla, jos testasin 500 vaihtoehtoa?

Nyt pääsemme asiaan, jolla on merkitystä kaikille, jotka pyörittävät automatisoitua tutkimusputkea — siihen tilanteeseen, jossa Stratmillissä olemme joka päivä: generointiin käytetty agentti ei tuota yhtä ehdokasta vaan satoja.

M standardinormaalijakaumasta otetun havainnon maksimiarvo on keskimäärin suunnilleen √(2 ln M). Kun kerrot sen keskivirheelläsi, saat Sharpe-arvon, jonka M aidosti arvottomasta strategiasta onnekkain näyttää.

Testatut strategiat√(2 ln M)Kohinasta paras Sharpe, 5 v (SE 0.45)Kohinasta paras, 2 v (SE 0.71)
102.150.961.52
1003.031.362.16
5003.531.582.50
5,0004.131.852.93

Lue toiseksi viimeinen rivi. Jos tuotit 500 ehdokasta kahden vuoden datalla ja voittajan Sharpe on 2.4, et ole löytänyt yhtään mitään. Tulos jää kohinatason alle. Bailey ja López de Prado formalisoivat tämän deflatoidussa Sharpessa, jossa kokeiltujen Sharpe-arvojen varianssi korvaa karkean √(2 ln M) -arvion. Se kannattaa ottaa kunnolla käyttöön, mutta jo karkea versio riittää muuttamaan toimintaa heti.

Taulukon antamaa kuvaa pahentaa kaksi asiaa. Ensinnäkään M ei ole tallentamiesi strategioiden määrä vaan niiden määrä, jotka arvioit — mukaan lukien jokainen parametrimuutos, jokainen ”kokeillaanpa sittenkin 30 jakson lookbackia” ja jokainen uudelleenajo bugikorjauksen jälkeen. Kukaan ei laske rehellisesti. Toiseksi ehdokkaat eivät ole toisistaan riippumattomia otoksia, joten √(2 ln M) yliarvioi testauksen todellisen laajuuden. Korreloituneet kokeilut tarkoittavat kuitenkin myös sitä, että yksi onnekas markkinatilanne nostaa koko ryhmän strategioita yhtä aikaa.

Kvantitatiivisessa tutkimuksessa vaarallisin luku on se, jota kukaan ei kirjannut: kuinka monta kertaa katsoit tuloksia.

Mitä minä sitten käytännössä teen?

Viisi asiaa tässä järjestyksessä.

  1. Kirjaa jokainen arviointi. Laskuri, joka kasvaa jokaisella backtest-ajolla, tallentuu pysyvästi eikä nollaudu koskaan. Jos et osaa kertoa M:n arvoa, et voi määrittää kynnysarvoasi. Tämä on koko listan arvokkain tunti insinöörityötä.
  2. Raportoi Sharpe aina luottamusväleineen. Älä koskaan tulosta pelkkää lukua. Backtest-raporttimme näyttävät 1.72 ± 0.51 (2.9y, skew-adjusted), eikä ±-merkintä ole valinnainen. Se muuttaa koko tiimin tavan puhua tuloksista.
  3. Aseta raja M:n ja T:n perusteella ennen kuin katsot tuloksia. Poimi luku yllä olevasta taulukosta ja kirjoita se muistiin. Jälkikäteen asetetut rajat saavat ihmiset uskomaan käyräsovitukseen.
  4. Suosi laajempaa kattavuutta suuremman taajuuden sijaan, kun otos on pieni. Et voi tuottaa lisää kalenteriaikaa, mutta voit ajaa saman signaalin 40 korreloimattomalla symbolilla. Se kasvattaa aidosti efektiivistä n:ää, toisin kuin kaupankäyntitaajuuden lisääminen. Tarkkaile kuitenkin korrelaatioita — 40 kryptoperpetua riskin välttämisen tunnin aikana ovat yksi instrumentti.
  5. Siirry sen jälkeen paper-kaupankäyntiin. OOS-aikaa kertyy yhden päivän verran päivässä, eikä siihen ole oikotietä. Juuri siksi se on ainoa otos, jota kukaan ei voi ylisovittaa.

Mikään tästä ei tee lyhyistä otoksista käyttökelpoisia. Se auttaa olemaan rehellinen siitä, mitä lyhyellä otoksella voi perustella — väite on paljon heikompi kuin useimpien backtest-raporttien perusteella voisi luulla. Kahden vuoden Sharpe 1.5 on hypoteesi, joka kannattaa testata paper-kaupankäynnillä. Se ei ole tutkimustulos.

Sharpen suhdelukuylisovittaminenbacktestaustilastollinen merkitsevyyskvantitatiivinen tutkimus
← Kaikki kirjoitukset