2026年9月10日 · リサーチ

Sharpe比はあらゆる検証を乗り越えた。それでも偶然かもしれない。

Sharpe比はあらゆる検証を乗り越えた。それでも偶然かもしれない。

戦略のバリエーションを1,000通り試し、最良のもののSharpe比が2.0、偽陽性率が5%。一見、かなり強い結果に聞こえます。しかし、それを見つけるまでに何回試したかを考えると話は変わります。十分な回数を試せば、ノイズだけから説得力のあるバックテスト結果が生まれることもあります。

意外な数字はSharpe比ではありません。試行回数です。インジケーターの期間、エントリー閾値、対象銘柄の選択、見送ったアイデアの一つひとつが、偶然に恵まれた結果を選び出す機会になります。リサーチの過程でその試行を記録しなければ、信頼度の計算からも抜け落ちます。

戦略をたくさん試すと、なぜ勝者の成績がよく見えるのでしょうか?

本当の優位性がない戦略を1,000個検証すると想像してください。従来の検定では、それぞれが統計的に有意に見える確率は5%です。実際のリサーチでは各試行が完全に独立しているわけではありませんが、基本的な考え方は変わりません。候補を多く調べるほど、偶然により1つが際立って見える可能性が高まります。

すべての候補が独立だとしても、少なくとも1つが5%の閾値を超える確率は約99.4%です。実際には、近いパラメーター設定は似た挙動をすることが多いため、1,000通りのバリエーションが独立したコイントス1,000回に相当するわけではありません。それでも、有効な試行回数が1回だけということはまずありません。

ノートブックで見かけた小さな落とし穴があります。リサーチャーがルックバック期間を5から100まで試し、Sharpe比の分布をプロットして、きれいに見えるピークを報告するケースです。分布を見ることは感度の理解に役立ちます。一方、そのピークは探索の結果でもあり、実験前に決めた閾値ほど高く評価すべきではありません。

リサーチの試行回数には何を含めるべきでしょうか?

観測した結果に影響されて行った判断を数えます。試行はコードを書いて実行したバックテストだけではありません。損益曲線を見た後に手作業で変更した設定も含まれます。以前の設定では上昇を逃したためにストップ幅を広げたなら、その修正にはテスト期間の情報が使われています。

リサーチ上の作業通常、試行に数える?理由
別のシグナル閾値を試すはい結果を使って候補を選ぶため
ドローダウンを見た後に期間を変更するはい成績を見てからサンプルを選んでいるため
記録済みのデータ不具合を修正する通常はいいえ意図した実験に戻す変更のため
固定した戦略を新しいホールドアウト期間で実行する新たな選択試行にはまだならないその結果に合わせて調整すれば、試行に数える

どこまでを試行とみなすかには判断が伴います。誤字の修正と、失敗した箇所に気づいた後の特徴量変更は別物です。仮説、変更内容、データ期間、結果を簡潔な試行ログに残しましょう。凝った形式でなくてかまいません。3か月後に記憶をたどるより、日付入りのCSVを残しておく方が確実です。

多重検定を考慮してSharpe比を補正できますか?

Deflated Sharpe Ratioなどの手法は、リターン分布や試行間の依存関係といった要因を考慮しながら、多数の候補から選んだことで見かけの成績がどれほど生じうるかを推定します。診断としては役立ちますが、雑然としたリサーチ過程を確実な結論に変える機械ではありません。算出結果は前提条件と、試行回数の見積もりが妥当かどうかに左右されます。

大まかな例として、あるリサーチャーが400通りを試し、Sharpe比1.8を得たとします。リターンには大きな歪みと厚い裾があると推定されています。この結果には、事前登録した1回の検定でSharpe比1.8を得た場合よりも高いハードルを課すべきです。補正によって証拠の説得力はかなり弱まるかもしれませんが、その優位性が本物だとは判断できません。

説明が必要になる前に探索の記録を残しましょう。候補数、パラメーターの範囲、確認したデータ期間、手作業による修正を記録します。詳細が分からない場合は、そのバックテストを探索的なものとして説明してください。

ペーパートレードの前に何をすべきでしょうか?

候補を1つに固定し、実行前に次の評価方法を定めます。たとえば、学習データで戦略を選び、検証データで確認した後、最終期間またはペーパートレードの期間を確保し、その結果が設計にフィードバックされないようにします。各段階で答える問いは異なります。最終段階の結果を見て戦略を繰り返し調整すると、その期間は新たな学習データになります。

近隣の設定でも同じ傾向が見られるか確認しましょう。針のように尖ったピーク1つより、ほどほどに良い結果が広く分布する方が、通常は信頼できます。ただし、頑健性が不適切な執行モデルを補うわけではありません。手数料、ファンディング、マーケットインパクト、取引可能な銘柄は、戦略が実際に直面しうる条件に合わせる必要があります。

ペーパートレードでは、タイミング、注文処理、実運用のリサーチパイプラインが想定どおりに動くかといった、運用面の整合性を確かめる証拠が得られます。すでに行った選択を取り消すことはできません。最初のペーパー注文を出す時点でも、運に恵まれたバックテスト1,000回は、1,000回の試行です。

バックテストでSharpe比2が報告されたら、損益曲線とともにリサーチの経緯を尋ねましょう。アイデアはいくつ試したのか。どの結果が次の実験を変えたのか。その答えは、レポートの中でもっとも重要な統計量かもしれません。

バックテストの過剰適合Sharpe比多重検定戦略リサーチウォークフォワード
← 記事一覧