Bin strateji varyasyonu. Kazanan için ölçülen Sharpe oranı 2.0. Yanlış pozitif oranı %5. Bu rakamlar, sonucu bulmak için kaç deneme yaptığınızı sorana kadar güçlü bir bulgu gibi görünür. Yeterince deneme yapıldığında, yalnızca gürültüden ikna edici bir geriye dönük test sonucu çıkabilir.
Şaşırtıcı olan Sharpe oranı değil, deneme sayısıdır. Her gösterge penceresi, giriş eşiği, yatırım evreni seçimi ve elenen fikir, şanslı bir sonucu seçmek için yeni bir fırsattır. Araştırma süreciniz bu denemeleri hesaba katmıyorsa, güven hesabınız da katmaz.
Daha fazla strateji denemek kazananı neden daha iyi gösterir?
Gerçek bir avantajı olmayan 1,000 stratejiyi test ettiğinizi düşünün. Her birinin, geleneksel bir testte istatistiksel olarak anlamlı görünme olasılığı %5 olsun. Gerçek araştırmalarda bu denemeler birbirinden tamamen bağımsız değildir; yine de temel fikir geçerlidir: Ne kadar çok adayı incelerseniz, birinin tesadüfen olağanüstü görünme olasılığı o kadar artar.
Her aday bağımsız olsaydı bile, en az birinin bu %5 eşiğini aşma olasılığı yaklaşık %99.4 olurdu. Uygulamada, birbirine yakın parametre ayarları çoğu zaman benzer sonuç verir; dolayısıyla 1,000 varyasyon, birbirinden bağımsız 1,000 yazı tura atışı değildir. Ama etkili deneme sayısı da nadiren yalnızca 1 olur.
Not defterlerinde sık rastladığım küçük bir tuzak var: Araştırmacı, 5'ten 100'e kadar geriye bakış sürelerini test ediyor, Sharpe yüzeyini çiziyor, sonra da düzgün görünen zirveyi raporluyor. Yüzey, duyarlılığı anlamak için faydalıdır. Ancak zirve aynı zamanda bir aramanın ürünüdür ve deneyden önce belirlenmiş bir eşikten daha az takdiri hak eder.
Bir araştırma denemesi neleri kapsar?
Gözlemlenen sonuçların etkilediği kararları sayın. Bir deneme, kodlanmış bir geriye dönük test olabilir; ancak öz sermaye eğrisini gördükten sonra yaptığınız manuel bir değişiklik de denemedir. Eski ayar bir yükselişi kaçırdığı için stop seviyesini genişlettiyseniz, test döneminden gelen bilgiyi kullanmış oldunuz.
| Araştırma eylemi | Genellikle deneme sayılır mı? | Neden |
|---|---|---|
| Başka bir sinyal eşiğini test etmek | Evet | Sonuç, aday seçimine yardımcı olur |
| Bir düşüşü gördükten sonra tarih aralığını değiştirmek | Evet | Örneklem, performansa göre seçilmiştir |
| Belgelenmiş bir veri hatasını düzeltmek | Genellikle hayır | Değişiklik, amaçlanan deneyi yeniden işler hâle getirir |
| Aynı dondurulmuş stratejiyi yeni bir ayrılmış dönemde çalıştırmak | Henüz yeni bir seçim denemesi sayılmaz | Sonuca göre ayar yaparsanız deneme sayılır |
Sınırın nerede olduğu konusunda muhakeme gerekir. Yazım hatasını düzeltmek, nerede başarısız olduğunu gördükten sonra bir özelliği değiştirmekten farklıdır. Hipotezi, değişikliği, veri dönemini ve sonucu içeren kısa bir deneme kaydı tutun. Kusursuz olması gerekmez; tarihli bir CSV, 3 ay sonra arama sürecinizi hafızanızdan yeniden kurmaya çalışmaktan iyidir.
Çoklu test için Sharpe oranımı düzeltebilir miyim?
Deflated Sharpe Ratio gibi yöntemler, getiri dağılımı ve denemeler arasındaki bağımlılık gibi etkenleri hesaba katarak, görünen performansın çok sayıda aday arasından seçim yapılmasıyla ne ölçüde ortaya çıkmış olabileceğini tahmin eder. Bunlar yararlı tanı araçlarıdır; dağınık bir araştırma sürecini kesinliğe dönüştüren makineler değildir. Sonuçları, varsayımlara ve deneme sayınızın güvenilir olup olmadığına bağlıdır.
Kabaca fikir edinmek için, bir araştırmacının 400 varyasyonu test ettiğini, 1.8 Sharpe bulduğunu ve getirilerinde belirgin çarpıklık ile kalın kuyruklar olduğunu varsaydığını düşünün. Bu sonuç, deneyden önce kayda geçirilmiş tek bir testten gelen 1.8 Sharpe'a kıyasla daha yüksek bir eşiği aşmalıdır. Düzeltme, kanıtı ciddi ölçüde zayıflatabilir; ancak avantajın gerçek olduğunu söyleyemez.
Savunmanız gerekmeden önce arama sürecini kaydedin: aday sayısı, parametre aralıkları, incelenen veri dönemleri ve tüm manuel değişiklikler. Bu ayrıntılar bilinmiyorsa, geriye dönük testi keşif amaçlı olarak tanımlayın.
Kâğıt üzerinde işlem yapmadan önce ne olmalı?
Bir adayı sabitleyin ve çalıştırmadan önce bir sonraki değerlendirmeyi tanımlayın. Yararlı bir sıra şöyledir: stratejiyi eğitim verisiyle seçin, doğrulama verisiyle inceleyin, ardından tasarım sürecine geri beslenmeyecek son bir dönem ya da kâğıt üzerinde işlem penceresi ayırın. Her aşama farklı bir soruyu yanıtlar; son aşamada stratejiyi tekrar tekrar ayarlamak, o aşamayı yeni eğitim verisine dönüştürür.
Birbirine yakın ayarların da aynı hikâyeyi anlatıp anlatmadığını inceleyin. Orta düzeyde pozitif sonuçlardan oluşan geniş bir bölge, genellikle tek ve iğne gibi sivri bir zirveden daha inandırıcıdır; yine de sağlamlık, kusurlu bir emir gerçekleştirme modelini telafi etmez. Ücretler, fonlama, piyasa etkisi ve enstrümanların erişilebilirliği, stratejinin karşılaşabileceği koşullarla hâlâ uyumlu olmalıdır.
Kâğıt üzerinde işlem yapmak, zamanlama, emir işleme ve canlı araştırma hattının beklendiği gibi çalışıp çalışmadığı konusunda operasyonel tutarlılığa dair ek kanıt sağlar. Daha önce gerçekleşmiş seçim yanlılığını ortadan kaldıramaz. İlk kâğıt işlem emri gönderildiğinde, şanslı bin geriye dönük test hâlâ bin denemedir.
Geriye dönük test 2 Sharpe bildirdiğinde, öz sermaye eğrisinin yanında araştırma geçmişini de sorun. Kaç fikir denendi? Hangi sonuçlar bir sonraki deneyi değiştirdi? Bu yanıt, rapordaki en önemli istatistik olabilir.
← Tüm yazılar


