Agosto 30, 2026 · estadistika

Ilang trade ang kailangan ng backtest bago magkaroon ng saysay ang Sharpe?

Ilang trade ang kailangan ng backtest bago magkaroon ng saysay ang Sharpe?

Ito ang tanong na pinakamadalas kong marinig, sa kung anu-anong paraan, mula sa mga katatapos lang gumawa ng una nilang strategy: ilang trade ang kailangan ko bago masabing totoo ang resulta? Kadalasan may kasamang numero. "Mayroon akong 1,200 trade, sapat na iyon, 'di ba?" At nakakainis sa lahat ang tapat na sagot, dahil hindi bilang ng trade ang batayan.

Ito ang buong paliwanag sa isang linya, at gugugulin ko ang natitirang bahagi ng post sa pagtalakay kung bakit masakit tanggapin ito.

1/√Tstandard error ng annualized Sharpe, T ay nasa mga taon
±0.8895% band sa paligid ng anumang Sharpe sa loob ng 5 taon
1.4Sharpe na makukuha ng pinakapalad sa 100 noise strategy sa loob ng kaparehong 5 taon

Ano ang standard error ng ratio ng Sharpe?

Para sa Sharpe na kinalkula mula sa n periodic return, sa palagay na magkakahiwalay ang mga ito at humigit-kumulang normal ang distribusyon, ganito ang sampling error:

SE(s) ≈ √((1 + s²/2) / n)

kung saan ang s ay ang Sharpe na sinukat sa kaparehong frequency. I-annualize ang magkabilang panig at may lilitaw na malinis na resulta. Kung may k observation kada taon at T taon, ganito ang annualized Sharpe S:

SE(S) ≈ √((1 + S²/(2k)) / T)

Tingnan ang 2k na nasa denominator. Para sa daily return, k = 252, kaya kahit Sharpe na 2 ay nagdaragdag lang ng 4/504 ≈ 0.008 sa numerator. Nagiging 1 ang buong termino. Tinatayang 1/√T ang standard error ng annualized Sharpe, kung saan ang T ay ang mga taon ng kalendaryong saklaw ng datos mo. Halos hindi ito nakadepende sa mismong Sharpe, hindi ito nakadepende sa frequency ng sampling, at lalong hindi ito nakadepende sa dami ng trade mo.

Kaya:

Taon ng datosSE(Sharpe)95% CI kung 1.5 ang nasukat mo
11.00−0.46 hanggang 3.46
20.710.11 hanggang 2.89
30.580.37 hanggang 2.63
50.450.62 hanggang 2.38
100.320.88 hanggang 2.12

Hindi kayang patunayan ng backtest na may Sharpe na 1.5 sa loob ng dalawang taon ng kasaysayan na naiiba ito sa basta paghula sa antas na 95%. Ito ang karaniwang kalagayan sa karamihan ng crypto research, dahil kadalasan ay nagsisimula lang bandang 2022 ang malinis na datos ng mga tao na naitama para sa survivorship at tumpak ang fees, at wala pa ang kalahati ng mga kawili-wiling symbol bago mag-2023.

Pero mayroon akong 40,000 trade. Hindi ba naaayos niyon ang problema?

Hindi, at ito ang maling pagkaunawang pinakagusto kong pawiin.

Magkaibang bagay ang bilang ng trade at haba ng sample, at isa lang sa mga ito ang nasa pormula. Kung 40,000 beses mag-trigger ang strategy mo sa loob ng anim na buwan, T = 0.5 at SE ≈ 1.41. Mula −0.8 hanggang 4.8 ang 95% interval mo para sa nasukat na Sharpe na 2.0. Sa 40,000 trade, ang tapat na konklusyon ay "puwedeng maganda, puwede ring negatibo."

Dahil ang 40,000 trade na iyon ay hindi 40,000 independiyenteng pustang inilagay sa 40,000 magkakaibang kalagayan ng merkado. Mga sample ang mga ito mula sa humigit-kumulang 180 araw ng kilos ng merkado; magkakaugnay ang mga araw at magkakaugnay din ang mga regime sa loob ng bawat isa. Ang high-frequency mean-reversion book na kumikita araw-araw sa loob ng apat na buwan ay iisang pustang nailagay lang talaga — na mananatili ang reversion sa maikling horizon sa ganitong liquidity regime — at marahil ilang magkakahiwalay na beses lang nasubok ang kinalabasan nito.

Ito ang pamalit na kaisipang ginagamit ko: bilangin ang mga regime, hindi ang mga fill. Ilang tunay na magkakaibang kalagayan ng merkado ang napagdaanan ng strategy na ito? Kung tumakbo ang funding-carry strategy sa iisang mahabang panahong positibo ang basis, n = 1 ang nakita nito, gaano man karaming hourly rebalance ang naitala.

Mabilis na pagsusuri: magsagawa ng block bootstrap sa daily P&L mo gamit ang haba ng block na 20 araw at tingnan ang lawak ng mga Sharpe mula sa resampling. Kung mas mababa sa zero ang 5th percentile, walang saysay ang bilang ng trade mo. Mga siyam na linya lang ito ng numpy, at mas marami na akong estratehiyang tinalikuran dahil dito kaysa sa alinmang iisang pagsusuri.

Gumagana ba ang pormula sa mga totoong strategy?

Hindi eksakto, at nagkakamali ito sa paraang hindi mo magugustuhan. Ipinapalagay ng 1/√T na IID normal ang mga return. May autocorrelation at skew ang totoong return ng strategy, at karaniwang negatibo ang skew para sa anumang kahawig ng carry, short vol, o mean reversion. Isinasama muli ng pagwawasto ni Mertens ang mga moment na iyon:

SE(s) ≈ √((1 + s²/2 − γ₃·s + (γ₄−3)·s²/4) / n)

kung saan ang γ₃ ay ang skew at ang γ₄ ay ang kurtosis. Dahil negatibo ang skew, nagiging positibo ang terminong −γ₃·s, kaya lumalawak ang interval. Lalo pa itong pinalalawak ng sobrang kurtosis. Para sa karaniwang crypto carry P&L na may skew na nasa −1.2 at kurtosis na nasa 9, nakita kong 30–40% na mas malaki ang corrected standard error kaysa sa payak na tantiya. Tinutugunan ng papel ni Lo noong 2002 ang usapin ng autocorrelation, at gayon din ang direksiyon ng epekto: pinalalaki ng positibong serial correlation sa mga return ang payak na Sharpe at pinaliliit ang tila error, isang masamang kombinasyon.

Kaya ituring ang 1/√T bilang pinakamababang tantiya sa kawalan ng katiyakan mo. Pinakamainam na senaryo na iyan.

Gaano kataas dapat ang Sharpe kung sumubok ako ng 500 variant?

Dito na tayo sa bahaging mahalaga sa sinumang nagpapatakbo ng automated research pipeline, na siyang ginagawa namin araw-araw sa Stratmill: hindi iisang kandidato ang inilalabas ng generation agent kundi daan-daan.

Tinatayang √(2 ln M) ang inaasahang pinakamataas na halaga sa M na draw mula sa standard normal distribution. I-multiply ito sa standard error mo at makukuha mo ang Sharpe na maipapakita ng pinakapalad sa M na estratehiyang talagang walang halaga.

Mga strategy na sinubukan√(2 ln M)Sharpe ng pinakamahusay sa noise, 5 taon (SE 0.45)Pinakamahusay sa noise, 2 taon (SE 0.71)
102.150.961.52
1003.031.362.16
5003.531.582.50
5,0004.131.852.93

Basahin ang pangalawa sa huling hanay. Kung nakabuo ka ng 500 kandidato gamit ang dalawang taon ng datos at Sharpe 2.4 ang ipinakita ng nanalo, wala ka talagang natuklasan. Mas mababa iyon sa antas ng noise. Pormal na inilalarawan ito ng deflated Sharpe nina Bailey at López de Prado, gamit ang variance ng mga Sharpe sa mga pagsubok bilang pamalit sa payak na √(2 ln M). Makabubuting ipatupad ito nang wasto, pero sapat na ang payak na bersyon para mabago ang kilos mo ngayon.

May 2 bagay na nagpapalala rito kumpara sa ipinahihiwatig ng talahanayan. Una, hindi ang bilang ng mga strategy na inimbak mo ang M; ito ang bilang ng mga sinuri mo, kasama ang bawat pagbabago sa parameter, bawat "subukan ko nga ang lookback na 30 period," at bawat muling pagpapatakbo matapos ayusin ang bug. Walang nagtatala nang tapat. Ikalawa, hindi magkakahiwalay na draw ang mga kandidato mo, kaya nasosobrahan ng √(2 ln M) ang epektibong dami ng mga pagsubok; pero dahil magkakaugnay ang mga ito, naiaangat din ng iisang mapalad na regime ang buong pangkat ng mga ito.

Ang pinakamapanganib na numero sa quant research ay ang hindi itinatala ninuman: ilang beses kang tumingin.

Kaya ano ba talaga ang ginagawa ko?

Limang bagay, ayon sa pagkakasunod na gagawin ko.

  1. Itala ang bawat pagsusuri. Magkaroon ng counter na nadaragdagan sa bawat pagpapatakbo ng backtest, naka-save at hindi kailanman niro-reset. Kung hindi mo masabi kung ano ang M, hindi mo masasabi kung ano ang threshold mo. Ito ang may pinakamalaking pakinabang sa bawat oras ng engineering sa buong listahan.
  2. Palaging iulat ang Sharpe kasama ang interval nito. Huwag magpakita ng hubad na numero lang. Inilalabas ng mga backtest report namin ang 1.72 ± 0.51 (2.9y, skew-adjusted) at hindi puwedeng alisin ang ±. Binabago nito ang paraan ng pagtalakay ng buong team sa mga resulta.
  3. Itakda ang pamantayan batay sa M at T bago tumingin. Kunin ang numero sa talahanayan sa itaas at isulat ito. Dahil sa mga threshold na itinakda pagkatapos makita ang resulta, nakukumbinsi ng lahat ang sarili nilang magandang fit ang isang curve.
  4. Mas piliin ang lawak kaysa dalas kapag kulang ang sample mo. Hindi ka makagagawa ng dagdag na oras sa kalendaryo, pero puwede mong patakbuhin ang kaparehong signal sa 40 symbol na walang ugnayan sa isa't isa. Tunay nitong pinapataas ang epektibong n sa paraang hindi nagagawa ng pagpapadalas ng mga trade. Bantayan pa rin ang mga correlation — iisang instrumento lang ang 40 crypto perp sa oras na umiiwas sa panganib ang merkado.
  5. Pagkatapos, isagawa ang paper trading. Naiipon ang out-of-sample na oras sa bilis na isang araw kada araw at walang shortcut dito; kaya ito lang ang sample na hindi kayang i-overfit ninuman.

Hindi nagiging kapaki-pakinabang ang maiikling sample dahil dito. Nagiging tapat ka lang tungkol sa kayang suportahan ng maikling sample, na mas mahina kaysa sa ipinahihiwatig ng karamihan sa mga ulat ng backtest. Isang hypothesis na sulit subukan sa paper trading ang Sharpe na 1.5 sa loob ng dalawang taon. Hindi iyon isang natuklasan.

ratio ng Sharpeoverfittingbacktestingkabuluhang estadistikalquant research
← Lahat ng post