30 Ogos 2026 · statistik

Berapa banyak dagangan diperlukan sebelum Sharpe backtest membawa makna?

Berapa banyak dagangan diperlukan sebelum Sharpe backtest membawa makna?

Inilah soalan yang paling kerap diajukan kepada saya, dalam pelbagai bentuk, oleh mereka yang baru menyiapkan strategi pertama: berapa banyak dagangan yang saya perlukan sebelum hasilnya benar-benar boleh dipercayai? Biasanya soalan itu disertakan dengan satu angka. "Saya ada 1,200 dagangan, itu sudah cukup, kan?" Jawapan jujurnya mengecewakan semua orang, kerana jawapannya langsung bukan bilangan dagangan.

Inilah keseluruhan rumusannya dalam satu baris. Selepas itu saya akan huraikan sepanjang baki tulisan ini sebabnya ia menyakitkan.

1/√Tralat piawai bagi Sharpe yang dianualkan, T dalam tahun
±0.88julat 95% di sekitar sebarang Sharpe 5 tahun
1.4nilai Sharpe yang ditunjukkan oleh strategi hingar paling bertuah daripada 100 strategi dalam tempoh 5 tahun yang sama

Apakah ralat piawai bagi nisbah Sharpe?

Bagi Sharpe yang dikira daripada n pulangan berkala, dengan andaian pulangan itu saling bebas dan lebih kurang normal, ralat persampelannya ialah:

SE(s) ≈ √((1 + s²/2) / n)

dengan s ialah Sharpe yang diukur pada frekuensi yang sama. Anualkan kedua-dua belah dan terbitlah satu hasil yang kemas. Dengan k pemerhatian setahun dan T tahun, Sharpe yang dianualkan S mempunyai:

SE(S) ≈ √((1 + S²/(2k)) / T)

Perhatikan 2k pada penyebut. Bagi pulangan harian, k = 252, jadi walaupun Sharpe bernilai 2 hanya menyumbang 4/504 ≈ 0.008 kepada pengangka. Keseluruhan sebutan itu menjadi 1. Ralat piawai bagi Sharpe yang dianualkan kira-kira 1/√T, dengan T ialah bilangan tahun kalendar data anda. Nilai ini hampir tidak bergantung pada Sharpe itu sendiri, tidak bergantung pada frekuensi persampelan, dan langsung tidak bergantung pada bilangan dagangan yang anda lakukan.

Jadi:

Tahun dataSE(Sharpe)95% CI jika nilai yang diukur ialah 1.5
11.00−0.46 hingga 3.46
20.710.11 hingga 2.89
30.580.37 hingga 2.63
50.450.62 hingga 2.38
100.320.88 hingga 2.12

Backtest yang menunjukkan Sharpe 1.5 sepanjang dua tahun sejarah tidak dapat membezakan prestasinya secara statistik daripada lambungan syiling pada aras 95%. Inilah keadaan asas bagi kebanyakan penyelidikan kripto, kerana data bersih yang telah dilaraskan untuk bias kelangsungan dan ketepatan yuran biasanya bermula sekitar 2022, manakala separuh daripada simbol menarik belum wujud sebelum 2023.

Tapi saya ada 40,000 dagangan. Bukankah itu menyelesaikan masalahnya?

Tidak, dan inilah salah faham yang paling saya mahu hapuskan.

Bilangan dagangan dan panjang sampel ialah kuantiti yang berbeza, dan hanya satu daripadanya muncul dalam formula. Jika strategi anda mencetuskan dagangan 40,000 kali dalam tempoh enam bulan, T = 0.5 dan SE ≈ 1.41. Selang 95% bagi Sharpe terukur 2.0 merangkumi −0.8 hingga 4.8. Dengan 40,000 dagangan, kesimpulan jujurnya tetap "mungkin bagus, mungkin juga negatif."

Sebabnya, 40,000 dagangan itu bukan 40,000 pertaruhan bebas merentas 40,000 keadaan pasaran yang berbeza. Itu ialah 40,000 sampel daripada kira-kira 180 hari gelagat pasaran; hari-hari tersebut pula saling berkorelasi, begitu juga rejim dalam setiap kelompok. Buku dagangan pembalikan min frekuensi tinggi yang menjana wang setiap hari selama empat bulan sebenarnya hanya membuat satu pertaruhan — bahawa pembalikan jangka pendek kekal dalam rejim kecairan ini — dan mungkin hanya menyaksikan pertaruhan itu membuahkan hasil beberapa kali yang benar-benar bebas.

Cara saya memikirkannya: hitung rejim, bukan isian. Berapa banyak keadaan pasaran yang benar-benar berbeza telah dilalui strategi ini? Strategi carry pembiayaan yang berjalan sepanjang satu tempoh panjang dengan asas positif hanya melihat n = 1, tidak kira berapa banyak pengimbangan semula setiap jam yang direkodkan.

Pemeriksaan pantas: lakukan block bootstrap terhadap P&L harian anda dengan panjang blok 20 hari, kemudian perhatikan taburan Sharpe yang disampel semula. Jika persentil ke-5 di bawah sifar, bilangan dagangan anda tidak relevan. Kod ini hanya memerlukan kira-kira sembilan baris numpy dan lebih banyak strategi berjaya menghalang saya daripada memilihnya berbanding pemeriksaan lain.

Adakah formula ini terpakai pada strategi sebenar?

Tidak sepenuhnya, dan ralatnya memihak kepada arah yang anda tidak suka. Hasil 1/√T mengandaikan pulangan normal IID. Pulangan strategi sebenar mempunyai autokorelasi dan kecondongan, yang biasanya negatif bagi apa-apa strategi yang menyerupai carry, short vol atau pembalikan min. Pembetulan Mertens mengambil kira semula momen tersebut:

SE(s) ≈ √((1 + s²/2 − γ₃·s + (γ₄−3)·s²/4) / n)

dengan γ₃ ialah kecondongan dan γ₄ ialah kurtosis. Kecondongan negatif menjadikan sebutan −γ₃·s positif, lalu melebarkan selang. Kurtosis berlebihan melebarkannya lagi. Bagi P&L carry kripto biasa dengan kecondongan sekitar −1.2 dan kurtosis sekitar 9, saya pernah melihat ralat piawai yang dibetulkan 30–40% lebih besar daripada anggaran mudah. Makalah Lo pada 2002 menangani autokorelasi, dan kesannya sehala: korelasi bersiri positif dalam pulangan menaikkan Sharpe mudah dan mengecilkan ralat yang kelihatan, gabungan yang berbahaya.

Jadi anggap 1/√T sebagai had minimum bagi ketidakpastian anda. Inilah keadaan terbaik.

Berapa tinggi Sharpe perlu jika saya menguji 500 variasi?

Sekarang kita sampai kepada perkara yang penting bagi sesiapa yang menjalankan saluran penyelidikan automatik, iaitu keadaan kami setiap hari di Stratmill: ejen penjanaan bukan menghasilkan satu calon, tetapi ratusan.

Nilai maksimum jangkaan bagi M cabutan daripada taburan normal piawai kira-kira √(2 ln M). Darabkan dengan ralat piawai anda untuk mendapatkan nilai Sharpe yang akan ditunjukkan oleh strategi tidak bernilai yang paling bertuah daripada M strategi.

Strategi yang diuji√(2 ln M)Sharpe terbaik daripada hingar, 5 tahun (SE 0.45)Terbaik daripada hingar, 2 tahun (SE 0.71)
102.150.961.52
1003.031.362.16
5003.531.582.50
5,0004.131.852.93

Lihat baris kedua terakhir. Jika anda menjana 500 calon menggunakan data dua tahun dan pemenangnya mencatat Sharpe 2.4, anda sebenarnya belum menemui apa-apa. Nilainya masih di bawah lantai hingar. Sharpe terlaras Bailey dan López de Prado memformalkan pengiraan ini dengan menggunakan varians Sharpe percubaan sebagai ganti √(2 ln M) yang kasar. Berbaloi untuk melaksanakannya dengan betul, tetapi anggaran kasar ini pun sudah cukup untuk mengubah tingkah laku hari ini.

Ada dua perkara yang menjadikan keadaan lebih buruk daripada yang ditunjukkan jadual. Pertama, M bukan bilangan strategi yang anda simpan, tetapi bilangan yang anda nilai, termasuk setiap pelarasan parameter, setiap "biar saya cuba lookback 30 tempoh pula," dan setiap ulangan selepas pembetulan pepijat. Tiada siapa mengiranya dengan jujur. Kedua, calon anda bukan cabutan bebas, jadi √(2 ln M) melebihanggarkan keluasan efektif; namun percubaan yang berkorelasi juga bermakna satu rejim bertuah boleh menaikkan seluruh kelompok strategi itu serentak.

Angka paling berbahaya dalam penyelidikan kuantitatif ialah angka yang tiada siapa catat: berapa kali anda mencuba.

Jadi, apa yang saya lakukan?

Lima perkara, mengikut turutan yang akan saya lakukan.

  1. Catat setiap penilaian. Gunakan pembilang yang bertambah setiap kali backtest dijalankan, disimpan secara kekal dan tidak pernah ditetapkan semula. Jika anda tidak tahu nilai M, anda tidak boleh menentukan ambang anda. Inilah kerja kejuruteraan sejam yang paling bernilai dalam seluruh senarai ini.
  2. Sentiasa laporkan Sharpe bersama selangnya. Jangan sekali-kali memaparkan angka sahaja. Laporan backtest kami memaparkan 1.72 ± 0.51 (2.9y, skew-adjusted) dan tanda ± itu wajib ada. Ini mengubah cara seluruh pasukan membincangkan hasil.
  3. Tetapkan ambang berdasarkan M dan T sebelum melihat hasilnya. Ambil angkanya daripada jadual di atas dan catatkan. Ambang yang ditetapkan selepas melihat hasil ialah cara orang meyakinkan diri bahawa curve fit itu boleh dipercayai.
  4. Utamakan keluasan berbanding kekerapan apabila sampel anda terhad. Anda tidak boleh mencipta masa kalendar tambahan, tetapi anda boleh menjalankan isyarat yang sama pada 40 simbol yang tidak berkorelasi. Ini benar-benar meningkatkan n efektif, sedangkan peningkatan kekerapan dagangan tidak. Namun, awasi korelasi — 40 kontrak perpetual kripto dalam satu jam pengelakan risiko ibarat satu instrumen.
  5. Kemudian, lakukan paper trading. Masa luar sampel terkumpul satu hari demi satu hari dan tiada jalan pintas. Sebab itulah inilah satu-satunya sampel yang tiada siapa boleh terlebih suai.

Semua ini tidak menjadikan sampel pendek berguna. Ia membantu anda jujur tentang kesimpulan yang boleh disokong oleh sampel pendek — tuntutan yang jauh lebih lemah daripada gambaran yang biasanya disiratkan dalam laporan backtest. Sharpe 1.5 bagi tempoh dua tahun ialah hipotesis yang wajar diuji melalui paper trading. Ia bukan penemuan.

nisbah Sharpeterlebih suaibacktestingkeertian statistikpenyelidikan kuantitatif
← Semua catatan