Mas mahusay ang backtest sa pagtanggi sa isang strategy kaysa sa pagpili nito. Sa sandaling gamitin mo ang nakaraang performance para pumili sa maraming variant, nagiging bahagi ng eksperimento ang backtest, at may nakatagong kapalit ang tila nanalo: selection bias.
Parang baligtad ito. Nagba-backtest tayo dahil gusto nating malaman kung aling strategy ang gumagana. Pero bawat pasyang ginagabayan ng parehong kasaysayan ay kumakain sa ebidensiya nito. Baguhin ang lookback, threshold, universe, araw ng rebalance, o tuntunin sa stop matapos makita ang mga resulta, at muli kang nagtanong sa datos. Kalaunan, sapat na ang dami ng tanong para makakuha ka ng kapani-paniwalang sagot kahit nagkataon lang.
Bakit hindi gaanong mapagkakatiwalaan ang pinakamahusay na resulta kapag mas marami kang sinusubukang strategy?
Isipin mong sumubok ka ng 100 strategy na walang tunay na edge. Magkakaiba pa rin ang kanilang returns. Kung halos independent ang mga pagtatantiya ng performance at normal ang distribusyon ng ingay, magiging positibo ang pinakamataas na Sharpe sa mga ito kahit zero ang tunay na Sharpe ng bawat strategy.
Tinatayang 2.5 standard deviation na mas mataas sa mean ang inaasahang maximum sa 100 independent na standard normal draw. Ituring itong ilustrasyon, hindi pagwawastong maaari mong basta ilagay sa ulat: magkakaugnay ang mga totoong variant ng strategy, may sarili ring sampling error ang mga pagtatantiya ng Sharpe, at bihirang kumilos ang returns na parang malilinis na normal draw. Nananatili ang praktikal na punto sa kabila ng mga limitasyong ito. Habang mas marami kang kandidatong sinusuri, mas malamang na pinalakas ng paborableng ingay ang pinakamataas na score.
At hindi lang naka-save na backtest ang maituturing na “kandidato.” Kasama rito ang bawat pasyang ginawa matapos tumingin sa resulta: pagpapalawak ng universe dahil magulo ang hitsura ng chart, pag-aalis ng isang taong nakakasama sa resulta, o pagbabago ng palagay sa bayarin hanggang bumawi ang kurba. Bilang ang mga pasyang iyon kahit walang nagtalaga sa mga ito ng version number.
Magtago ng talaan ng pananaliksik bago patakbuhin ang susunod na variant
Itala ang buong paghahanap, pati ang mga itinapong ideya at dahilan sa bawat pagbabago. Nagbibigay ito ng mas tapat na salaysay kung gaano pinili ang resulta at nagpapahirap na matandaan lang ang mga kaakit-akit na pagsubok.
| Itala | Halimbawa | Bakit mahalaga |
|---|---|---|
| Hipotesis | Mas malakas ang short-term reversal pagkatapos ng di-pangkaraniwang laki ng galaw sa BTC perp | Inihihiwalay ang ideya sa mga parameter setting na pinili sa huli |
| Variant at timestamp | 48-hour signal, 2026-10-09, run 014 | Binibilang ang mga pagsubok at iniuugnay ang mga resulta sa code at datos |
| Panuntunan sa pagpili | Pumili batay sa net Sharpe; hindi bababa sa 100 trade | Ipinapakita kung ano ang ibig sabihin ng “pinakamahusay” bago ang paghahambing |
| Mga itinapong variant | 12, 24, 72-hour na window; panatilihin ang lahat | Pinipigilan nitong burahin ng nakikitang nanalo ang mga katunggali nito |
Hindi mababawi ng talaan ang paghahanap. Ginagawa nitong malinaw ang naging proseso, na unang hakbang para mataya kung gaano kalaki ang tiwalang nararapat sa nanalo.
Magtira ng datos na hindi na muling babalikan sa proseso ng pananaliksik
Hatiin ang datos ayon sa panahon, saka protektahan ang huling yugto. Buuin ang strategy gamit ang isang saklaw ng panahon, magpasya gamit ang yugto ng validation, at isang beses lang suriin ang strategy na hindi na binago gamit ang holdout mula sa mas huling panahon. Halimbawa, maaari mong gamitin ang 2018–2022 para sa pagbuo, ang 2023 para sa validation, at itabi ang 2024–2025. Gabay na halimbawa lang ang mga petsang ito: dapat nakabatay ang paghahati sa merkado, haba ng panahon ng strategy, at saklaw ng datos.
Isulat kung ano ang ibig sabihin ng “hindi na binago”: signal, universe, sizing, mga palagay sa execution, at anumang tuntunin para sa nawawalang datos. Kung hindi maganda ang resulta sa holdout at iaangkop mo ang strategy batay rito, naging validation data na ang panahong iyon. Kailangan ng bagong ebidensiya para sa susunod na tapat na pagsusuri.
Dito rin nagiging problema ang maliliit na sample. Hindi pa sapat ang 18 trade ng isang strategy sa holdout para makapagbigay ng tiyak na hatol. Iulat ang bilang ng trade at kawalang-katiyakan kasama ng mga estadistika ng return; maaaring magmukhang tiyak ang manipis na sample dahil sa iisang average.
Ibig bang sabihin nito'y walang silbi ang mga backtest sa pagpili ng strategy?
Hindi. Tama ang mga kritiko na maaaring aksaya ang mahihigpit na holdout: nagbabago ang mga merkado, maikli ang kasaysayan, at maaaring isang di-pangkaraniwang rehimen lang ang kinakatawan ng panahong hindi ginalaw. Maipapakita ng maingat na idinisenyong walk-forward na proseso kung paano kumikilos ang strategy habang umuusad ang magagamit na kasaysayan. Pero hindi nito ginagawang libre ang paulit-ulit na pag-aangkop. Kung susuriin mo ang bawat fold at babaguhin ang strategy, nakaimpluwensiya ang mga fold na iyon sa pananaliksik.
Gamitin ang mga backtest para ilantad ang mga paraan ng pagkabigo, ihambing ang kaunting ideyang nakaugat sa mekanismo ng merkado, at subukan kung nananatili ang mga resulta kapag may makatwirang pagbabago sa bayarin, funding, impact, at mga parameter. Magtago ng talaan. Itabi ang huling holdout. Pagkatapos, dalhin ang isang promising na bersiyong hindi na binago sa paper trading, kung saan maaaring lumitaw ang mga hindi pagtutugma sa operasyon.
Madalas ganito ang pinakamalakas na sagot ng backtest: “Bumibigay ang ideyang ito sa mga kondisyong nakikita na natin.” Kapag sinabi nitong, “Ito ang pinakamahusay na strategy,” itanong kung ilang iba pang sagot ang hiniling dito.
← Lahat ng post


