Isang libong baryasyon ng estratehiya. Sinukat na Sharpe na 2.0 para sa napili. 5% na antas ng maling positibo. Mukhang matibay ang mga bilang na iyan, hanggang itanong mo kung ilang pagsubok ang ginawa para mahanap ito. Kapag sapat ang dami ng pagsubok, puwedeng magmukhang kapani-paniwala ang backtest kahit ingay lang ang pinagmulan.
Hindi ang Sharpe ang nakakagulat na bilang. Ang bilang ng mga pagsubok ang nakakagulat. Bawat window ng indicator, threshold ng entry, pagpili ng uniberso, at ideyang itinapon ay isa pang pagkakataong makapili ng resultang pinalad lang. Kapag hindi naitala ng proseso ng pananaliksik mo ang mga pagsubok na iyon, hindi rin isasama ng pagkalkula ng kumpiyansa mo ang mga ito.
Bakit mas gumaganda ang dating ng napiling estratehiya kapag mas marami kang sinusubukan?
Isipin mong sumubok ka ng 1,000 estratehiyang walang tunay na edge. Bawat isa ay may 5% na tsansang magmukhang makabuluhan sa estadistika ayon sa karaniwang pagsusuri. Hindi lubusang magkakahiwalay ang mga pagsubok na ito sa aktuwal na pananaliksik, pero nananatili ang pangunahing ideya: habang dumarami ang kandidatong sinusuri mo, mas tumataas ang posibilidad na may magmukhang pambihira kahit nagkataon lang.
Kahit magkakahiwalay ang bawat kandidato, mga 99.4% ang posibilidad na may kahit isang makalagpas sa 5% na threshold na iyon. Sa aktuwal, madalas magkahawig ang kilos ng magkalapit na setting ng parameter, kaya hindi katumbas ng 1,000 baryasyon ang 1,000 magkakahiwalay na paghagis ng barya. Pero bihira ring iisa lang talaga ang epektibong bilang ng mga pagsubok.
May maliit na patibong akong nakita sa mga notebook: sinusubukan ng mananaliksik ang mga lookback mula 5 hanggang 100, iginuguhit ang surface ng Sharpe, saka iniuulat ang mukhang malinis na rurok. Kapaki-pakinabang ang surface para maunawaan ang pagiging sensitibo. Pero bunga rin ng paghahanap ang rurok, kaya mas kaunti ang dapat na maging tiwala rito kaysa sa threshold na pinili bago ang eksperimento.
Ano ang maituturing na pagsubok sa pananaliksik?
Bilangin ang mga desisyong naimpluwensiyahan ng mga resultang nakita mo. Maaaring isang naka-code na backtest ang pagsubok, pero maaari rin itong manu-manong pagbabagong ginawa matapos makita ang equity curve. Kung pinaluwag mo ang stop dahil hindi nasakyan ng dating setting ang isang rally, gumamit ang pagbabagong iyon ng impormasyong mula sa panahon ng pagsubok.
| Gawain sa pananaliksik | Karaniwan bang binibilang bilang pagsubok? | Bakit |
|---|---|---|
| Pagsubok ng isa pang threshold ng signal | Oo | Tumutulong ang resulta sa pagpili ng kandidato |
| Pagbabago ng saklaw ng petsa matapos makakita ng drawdown | Oo | Pinili ang sample batay sa naging performance |
| Pag-aayos ng dokumentadong bug sa datos | Karaniwan ay hindi | Ibinabalik ng pagbabago ang eksperimentong nilayon |
| Pagpapatakbo sa parehong nakapirming estratehiya sa bagong holdout period | Wala pang bagong pagsubok sa pagpili | Nagiging pagsubok ito kapag iniakma mo ang estratehiya batay sa resultang iyon |
May puwang para sa paghuhusga rito. Iba ang pag-aayos ng typo sa pagbabago ng feature matapos mapansin kung saan ito pumalya. Magtago ng maikling talaan ng mga pagsubok na naglalaman ng hypothesis, pagbabago, panahon ng datos, at kinalabasan. Hindi kailangang pulido; mas mabuti na ang CSV na may petsa kaysa subukang buuing muli sa alaala ang paghahanap mo makalipas ang 3 buwan.
Maaari ko bang itama ang Sharpe ko para sa maramihang pagsubok?
Tinatantiya ng mga paraang gaya ng Deflated Sharpe Ratio kung gaano kalaking bahagi ng nakikitang performance ang maaaring nagmula sa pagpili sa maraming kandidato, habang isinasaalang-alang ang mga salik gaya ng distribusyon ng mga return at pagdepende ng mga pagsubok sa isa't isa. Kapaki-pakinabang ang mga ito bilang pagsusuri, pero hindi sila makinang makapagpapalit ng magulong proseso ng pananaliksik tungo sa katiyakan. Nakadepende ang mga output sa mga palagay at sa pagiging kapani-paniwala ng bilang ng mga pagsubok mo.
Para magkaroon ng paunang ideya, ipagpalagay na sinubukan ng isang mananaliksik ang 400 baryasyon, nakakita ng Sharpe na 1.8, at tinatantiyang malaki ang skew at taba ng mga buntot ng mga return. Dapat mas mataas ang pamantayang pagdaanan ng resultang iyon kaysa sa Sharpe na 1.8 mula sa iisang pagsubok na nairehistro muna. Maaaring lubos na pahinain ng pagwawasto ang ebidensiya; hindi nito mapatutunayang tunay ang edge.
Itala ang paghahanap bago mo kailangang ipagtanggol ito: bilang ng mga kandidato, mga saklaw ng parameter, mga panahong sinuri sa datos, at anumang manu-manong pagbabago. Kung hindi alam ang mga detalyeng ito, ilarawan ang backtest bilang paunang pagsisiyasat.
Ano ang dapat gawin bago ang paper trading?
Pumili ng isang kandidato, huwag na itong baguhin, at tukuyin ang susunod na pagsusuri bago ito patakbuhin. Isang kapaki-pakinabang na pagkakasunod-sunod ang pagpili ng estratehiya gamit ang training data, pagsusuri rito gamit ang validation data, at pagtabi ng huling panahon o window ng paper trading na hindi makaaapekto sa disenyo. Iba-ibang tanong ang sinasagot ng bawat yugto; kapag paulit-ulit mong inayos ang estratehiya batay sa huling yugto, nagiging dagdag na training data na ito.
Suriin din kung pareho ang ipinahihiwatig ng magkakalapit na setting. Karaniwang mas kapani-paniwala ang malawak na bahagi ng katamtamang positibong resulta kaysa sa iisang matulis na rurok, pero hindi naililigtas ng pagiging matatag ang depektibong execution model. Dapat pa ring tumugma ang mga fee, funding, impact, at availability ng instrumento sa mga kondisyong maaaring naranasan ng estratehiya.
Nagdaragdag ang paper trading ng ebidensiya tungkol sa pagkakatugma ng operasyon: tiyempo, paghawak ng order, at kung kumikilos ayon sa inaasahan ang live na pipeline ng pananaliksik. Hindi nito mabubura ang pagpiling naganap na. Isang libong backtest na nagkataong maganda pa rin ang bilang ng mga pagsubok nang maipadala na ang unang paper order.
Kaya kapag nag-ulat ang backtest ng Sharpe na 2, hingin ang kasaysayan ng pananaliksik kasabay ng equity curve. Ilang ideya ang sinubukan? Aling mga resulta ang nagpabago sa susunod na eksperimento? Maaaring iyon ang pinakamahalagang estadistika sa ulat.
← Lahat ng post


