Seribu varian strategi. Sharpe terukur 2.0 bagi strategi yang menang. Kadar positif palsu 5%. Angka-angka itu kedengaran seperti hasil yang kukuh sehinggalah anda bertanya berapa banyak percubaan dibuat untuk mendapatkannya. Dengan percubaan yang mencukupi, backtest yang meyakinkan boleh terhasil daripada hingar semata-mata.
Angka yang mengejutkan bukanlah Sharpe. Sebaliknya, jumlah percubaan. Setiap tempoh indikator, ambang kemasukan, pilihan set instrumen dan idea yang ditolak memberi satu lagi peluang untuk memilih hasil yang bernasib baik. Jika proses penyelidikan anda melupakan percubaan tersebut, pengiraan keyakinan anda juga begitu.
Mengapa mencuba lebih banyak strategi membuat strategi terbaik kelihatan lebih baik?
Bayangkan anda menguji 1,000 strategi yang tiada kelebihan sebenar. Setiap satunya mempunyai peluang 5% untuk kelihatan signifikan secara statistik dalam ujian konvensional. Dalam penyelidikan sebenar, percubaan-percubaan itu tidak sepenuhnya bebas antara satu sama lain, tetapi asasnya tetap sama: semakin banyak calon yang anda teliti, semakin besar kemungkinan salah satunya kelihatan luar biasa secara kebetulan.
Walaupun setiap calon bebas sepenuhnya, kebarangkalian sekurang-kurangnya satu melepasi ambang 5% itu kira-kira 99.4%. Dalam praktiknya, tetapan parameter yang berdekatan selalunya berkelakuan serupa, jadi 1,000 varian bukanlah 1,000 lambungan syiling yang bebas. Namun, jumlah percubaan berkesan juga jarang sekali cuma satu.
Inilah perangkap kecil yang pernah saya lihat dalam buku nota: seorang penyelidik menguji tempoh lihat balik dari 5 hingga 100, memplot permukaan Sharpe, kemudian melaporkan puncak yang kelihatan kemas. Permukaan itu berguna untuk memahami kepekaan. Puncaknya juga hasil daripada suatu carian, jadi ia tidak patut diberi kredit sebanyak ambang yang ditetapkan sebelum eksperimen.
Apakah yang dikira sebagai percubaan penyelidikan?
Kira keputusan yang dipengaruhi oleh hasil yang diperhatikan. Percubaan boleh berupa backtest berkod, tetapi boleh juga berupa perubahan manual selepas melihat lengkung ekuiti. Jika anda meluaskan stop kerana tetapan lama terlepas kenaikan mendadak, semakan itu menggunakan maklumat daripada tempoh ujian.
| Tindakan penyelidikan | Biasanya dikira sebagai percubaan? | Sebab |
|---|---|---|
| Menguji ambang isyarat yang lain | Ya | Hasilnya membantu memilih calon |
| Mengubah julat tarikh selepas melihat susut nilai | Ya | Sampel dipilih sebagai tindak balas kepada prestasi |
| Membaiki pepijat data yang didokumenkan | Biasanya tidak | Perubahan itu mengembalikan eksperimen kepada tujuan asalnya |
| Menjalankan strategi yang dibekukan pada tempoh pegangan baharu | Belum dikira sebagai percubaan pemilihan baharu | Ia dikira jika anda melaras strategi berdasarkan hasil itu |
Sempadannya memerlukan pertimbangan. Membaiki kesilapan taip berbeza daripada mengubah ciri selepas menyedari titik kegagalannya. Simpan log percubaan ringkas yang mencatat hipotesis, perubahan, tempoh data dan hasil. Log itu tidak perlu kemas; fail CSV bertarikh lebih baik daripada cuba mengingati semula carian anda tiga bulan kemudian.
Bolehkah saya melaraskan Sharpe saya untuk ujian berbilang?
Kaedah seperti Deflated Sharpe Ratio menganggarkan sejauh mana prestasi yang kelihatan itu mungkin terhasil daripada pemilihan antara banyak calon, sambil mengambil kira faktor seperti taburan pulangan dan kebergantungan antara percubaan. Kaedah ini berguna sebagai diagnostik, tetapi bukan mesin yang menukar proses penyelidikan yang bercelaru menjadi kepastian. Hasilnya bergantung pada andaian dan sama ada jumlah percubaan anda boleh dipercayai.
Sebagai gambaran kasar, katakan seorang penyelidik menguji 400 varian, mendapat Sharpe 1.8 dan menganggarkan pulangannya mempunyai kecondongan serta ekor tebal yang ketara. Hasil itu patut dikenakan ambang yang lebih tinggi berbanding Sharpe 1.8 daripada satu ujian prapendaftaran. Pelarasan itu mungkin melemahkan bukti dengan ketara; namun, ia tidak dapat memberitahu anda bahawa kelebihan itu benar-benar wujud.
Catat proses carian sebelum anda perlu mempertahankannya: jumlah calon, julat parameter, tempoh data yang diteliti dan sebarang semakan manual. Jika butiran itu tidak diketahui, nyatakan backtest tersebut sebagai penerokaan.
Apakah yang patut dilakukan sebelum dagangan kertas?
Bekukan satu calon dan tetapkan penilaian seterusnya sebelum menjalankannya. Urutan yang berguna ialah memilih strategi menggunakan data latihan, menelitinya dengan data pengesahan, kemudian menyimpan tempoh akhir atau tetingkap dagangan kertas yang tidak mempengaruhi reka bentuk. Setiap peringkat menjawab soalan yang berbeza; melaras strategi berulang kali berdasarkan peringkat akhir menjadikan data itu data latihan tambahan.
Teliti juga sama ada tetapan yang berdekatan memberikan gambaran yang sama. Kawasan luas dengan hasil sederhana yang positif biasanya lebih boleh dipercayai daripada satu puncak yang tajam, walaupun keteguhan tidak dapat menyelamatkan model pelaksanaan yang cacat. Yuran, pembiayaan, impak dan ketersediaan instrumen masih perlu sepadan dengan keadaan yang mungkin dihadapi strategi tersebut.
Dagangan kertas menambah bukti tentang kesetaraan operasi: pemasaan, pengendalian pesanan dan sama ada saluran penyelidikan langsung berfungsi seperti yang dijangka. Namun, ia tidak dapat memadamkan pemilihan yang sudah berlaku. Seribu backtest yang bernasib baik tetap seribu percubaan apabila pesanan kertas pertama dihantar.
Jadi, apabila backtest melaporkan Sharpe 2, minta sejarah penyelidikan di samping lengkung ekuiti. Berapa banyak idea yang telah dicuba? Hasil yang mana mengubah eksperimen seterusnya? Jawapannya mungkin statistik paling penting dalam laporan itu.
← Semua catatan


