10 September 2026 · riset

Rasio Sharpe Anda Lulus Semua Pengujian. Namun, Bisa Jadi Itu Hanya Kebetulan.

Rasio Sharpe Anda Lulus Semua Pengujian. Namun, Bisa Jadi Itu Hanya Kebetulan.

Seribu varian strategi. Sharpe terukur sebesar 2.0 untuk yang terbaik. Tingkat positif palsu 5%. Angka-angka itu terdengar seperti hasil yang kuat sampai kita bertanya berapa banyak percobaan yang dilakukan untuk menemukannya. Dengan cukup banyak percobaan, backtest yang meyakinkan bisa muncul hanya dari noise.

Mengapa mencoba lebih banyak strategi membuat yang terbaik tampak makin bagus? Jawabannya bukan nilai Sharpe, melainkan jumlah percobaannya. Setiap rentang indikator, ambang masuk, pilihan semesta aset, dan gagasan yang dibuang memberi peluang tambahan untuk memilih hasil yang kebetulan beruntung. Jika proses riset Anda melupakan percobaan-percobaan itu, perhitungan tingkat keyakinan Anda juga akan mengabaikannya.

Mengapa mencoba lebih banyak strategi membuat strategi terbaik tampak lebih baik?

Bayangkan menguji 1,000 strategi yang sama sekali tidak punya keunggulan nyata. Masing-masing memiliki peluang 5% untuk tampak signifikan secara statistik menurut pengujian konvensional. Dalam riset nyata, percobaan-percobaan itu tidak sepenuhnya independen, tetapi intuisinya tetap berlaku: makin banyak kandidat yang Anda periksa, makin besar kemungkinan salah satunya tampak istimewa hanya karena kebetulan.

Bahkan jika setiap kandidat independen, peluang setidaknya satu kandidat melewati ambang 5% itu sekitar 99.4%. Dalam praktiknya, pengaturan parameter yang berdekatan sering menunjukkan perilaku serupa, sehingga 1,000 varian bukanlah 1,000 lemparan koin yang independen. Namun, jumlah percobaan efektif juga jarang hanya satu.

Saya pernah melihat jebakan kecil ini di notebook: seorang peneliti menguji lookback dari 5 hingga 100, memetakan permukaan Sharpe, lalu melaporkan puncak yang tampak rapi. Permukaan itu berguna untuk memahami sensitivitas. Namun, puncaknya juga merupakan hasil pencarian, sehingga layak mendapat bobot lebih kecil daripada ambang yang ditentukan sebelum eksperimen.

Apa yang dihitung sebagai percobaan riset?

Hitung keputusan yang dipengaruhi oleh hasil yang sudah diamati. Percobaan bisa berupa backtest berkode, tetapi bisa juga berupa perubahan manual setelah melihat kurva ekuitas. Jika Anda memperlebar stop karena pengaturan sebelumnya melewatkan reli, revisi itu menggunakan informasi dari periode pengujian.

Tindakan risetBiasanya dihitung sebagai percobaan?Alasan
Menguji ambang sinyal lainYaHasilnya membantu memilih kandidat
Mengubah rentang tanggal setelah melihat drawdownYaSampel dipilih sebagai respons terhadap kinerja
Memperbaiki bug data yang terdokumentasiBiasanya tidakPerubahan ini mengembalikan eksperimen ke rancangan semula
Menjalankan strategi yang sama dan dibekukan pada periode holdout baruBelum menjadi percobaan seleksi baruBaru menjadi percobaan jika Anda menyetel strategi berdasarkan hasil itu

Batasnya memang memerlukan pertimbangan. Memperbaiki salah ketik berbeda dengan mengubah fitur setelah melihat titik kegagalannya. Catat percobaan secara ringkas, termasuk hipotesis, perubahan, periode data, dan hasilnya. Catatan itu tidak perlu rapi; CSV bertanggal lebih baik daripada mencoba mengingat kembali pencarian Anda tiga bulan kemudian.

Bisakah Sharpe saya dikoreksi untuk pengujian berganda?

Metode seperti Deflated Sharpe Ratio memperkirakan seberapa besar kinerja yang tampak bisa muncul dari seleksi di antara banyak kandidat, dengan memperhitungkan faktor seperti distribusi imbal hasil dan ketergantungan antarpercobaan. Metode ini berguna sebagai diagnostik, bukan mesin yang mengubah proses riset yang berantakan menjadi kepastian. Hasilnya bergantung pada asumsi dan apakah jumlah percobaan yang Anda catat dapat dipercaya.

Sebagai gambaran kasar, anggap seorang peneliti menguji 400 varian, menemukan Sharpe 1.8, dan memperkirakan bahwa imbal hasilnya memiliki skew yang besar serta ekor tebal. Hasil itu seharusnya menghadapi ambang yang lebih berat daripada Sharpe 1.8 dari satu pengujian yang sudah dipreregistrasi. Koreksi dapat sangat melemahkan bukti; tetapi tidak bisa memastikan bahwa keunggulan itu nyata.

Catat proses pencarian sebelum Anda perlu mempertanggungjawabkannya: jumlah kandidat, rentang parameter, periode data yang dilihat, dan setiap revisi manual. Jika detail itu tidak diketahui, sebut backtest tersebut sebagai eksploratif.

Apa yang perlu dilakukan sebelum paper trading?

Bekukan satu kandidat dan tetapkan evaluasi berikutnya sebelum menjalankannya. Urutan yang berguna adalah memilih strategi menggunakan data pelatihan, memeriksanya pada data validasi, lalu menyisihkan periode akhir atau jendela paper trading yang tidak digunakan untuk mengubah rancangan. Setiap tahap menjawab pertanyaan yang berbeda; jika strategi terus disesuaikan berdasarkan tahap akhir, tahap itu berubah menjadi data pelatihan tambahan.

Periksa juga apakah pengaturan yang berdekatan menunjukkan pola yang sama. Area hasil positif moderat yang luas biasanya lebih meyakinkan daripada satu puncak yang sangat tajam, meskipun ketahanan tidak memperbaiki model eksekusi yang cacat. Biaya, funding, dampak pasar, dan ketersediaan instrumen tetap harus sesuai dengan kondisi yang mungkin dihadapi strategi.

Paper trading menambah bukti tentang kesesuaian operasional: waktu, penanganan order, dan apakah pipeline riset langsung bekerja sesuai harapan. Namun, ini tidak menghapus seleksi yang sudah terjadi. Seribu backtest yang beruntung tetap berarti seribu percobaan saat order pertama untuk paper trading dikirim.

Jadi, ketika backtest melaporkan Sharpe sebesar 2, mintalah riwayat risetnya bersama kurva ekuitas. Berapa banyak ide yang dicoba? Hasil mana yang mengubah eksperimen berikutnya? Jawabannya mungkin merupakan statistik terpenting dalam laporan itu.

overfitting backtestrasio Sharpepengujian bergandariset strategiwalk-forward
← Semua artikel