Das ist die Frage, die mir Menschen, die gerade ihre erste Strategie fertiggestellt haben, am häufigsten in irgendeiner Form stellen: Wie viele Trades brauche ich, bevor das Ergebnis belastbar ist? Meistens hängt gleich eine Zahl dran. „Ich habe 1,200 Trades, das reicht doch, oder?“ Und die ehrliche Antwort enttäuscht alle, denn es geht überhaupt nicht um die Anzahl der Trades.
Hier ist die ganze Sache in einer Zeile. Danach widme ich den Rest des Beitrags der Frage, warum das wehtut.
Wie groß ist der Standardfehler einer Sharpe Ratio?
Für einen Sharpe, der auf n periodischen Renditen basiert und bei dem wir annehmen, dass sie unabhängig und annähernd normalverteilt sind, beträgt der Stichprobenfehler:
SE(s) ≈ √((1 + s²/2) / n)
wobei s der auf derselben Frequenz gemessene Sharpe ist. Annualisieren wir beide Seiten, ergibt sich eine einfache Formel. Bei k Beobachtungen pro Jahr und T Jahren gilt für den annualisierten Sharpe S:
SE(S) ≈ √((1 + S²/(2k)) / T)
Schau dir das 2k im Nenner an. Bei täglichen Renditen ist k = 252, also trägt selbst ein Sharpe von 2 nur 4/504 ≈ 0.008 zum Zähler bei. Der ganze Term vereinfacht sich zu 1. Der Standardfehler eines annualisierten Sharpe beträgt ungefähr 1/√T, wobei T für deine Kalenderjahre an Daten steht. Er hängt kaum vom Sharpe selbst ab, nicht von der Stichprobenfrequenz und ganz sicher nicht davon, wie viele Trades du gemacht hast.
Also:
| Datenjahre | SE(Sharpe) | 95%-KI bei einem gemessenen Wert von 1.5 |
|---|---|---|
| 1 | 1.00 | −0.46 bis 3.46 |
| 2 | 0.71 | 0.11 bis 2.89 |
| 3 | 0.58 | 0.37 bis 2.63 |
| 5 | 0.45 | 0.62 bis 2.38 |
| 10 | 0.32 | 0.88 bis 2.12 |
Ein Backtest mit Sharpe 1.5 über eine Historie von zwei Jahren kann auf dem 95%-Niveau statistisch nicht von einem Münzwurf unterschieden werden. Das ist die Ausgangslage für den Großteil der Krypto-Forschung, denn die sauberen, um Survivorship Bias bereinigten und gebührengetreuen Daten der meisten beginnen ungefähr 2022, und die Hälfte der interessanten Symbole gab es vor 2023 noch gar nicht.
Aber ich habe 40,000 Trades. Behebt das das Problem nicht?
Nein. Dieses Missverständnis möchte ich unbedingt aus der Welt schaffen.
Die Anzahl der Trades und die Stichprobenlänge sind verschiedene Größen, und nur eine davon steht in der Formel. Wenn deine Strategie innerhalb von sechs Monaten 40,000-mal handelt, hast du T = 0.5 und SE ≈ 1.41. Dein 95%-Intervall für einen gemessenen Sharpe von 2.0 reicht von −0.8 bis 4.8. Bei 40,000 Trades lautet die ehrliche Schlussfolgerung also: „Kann gut sein, kann aber auch negativ sein.“
Der Grund: Diese 40,000 Trades sind keine 40,000 unabhängigen Wetten auf 40,000 verschiedene Marktlagen. Es sind 40,000 Stichproben aus ungefähr 180 Tagen Marktverhalten. Die Tage sind miteinander korreliert, und auch die Regime weisen innerhalb ihrer selbst Korrelationen auf. Ein Hochfrequenz-Mean-Reversion-Portfolio, das vier Monate lang jeden Tag Gewinn macht, hat im Grunde eine Wette abgeschlossen – dass kurzfristige Umkehr in diesem Liquiditätsregime Bestand hat – und konnte beobachten, wie sich diese Wette vielleicht eine Handvoll unabhängiger Male entwickelt hat.
Als Denkhilfe nutze ich: Regime zählen, nicht Ausführungen. Wie viele wirklich unterschiedliche Marktbedingungen hat diese Strategie überstanden? Eine Funding-Carry-Strategie, die während einer langen Phase mit positiver Basis lief, hat n = 1 beobachtet – unabhängig davon, wie viele stündliche Rebalancierungen sie verbucht hat.
Schnelltest: Führe einen Block-Bootstrap deiner täglichen P&L mit einer Blocklänge von 20 Tagen durch und betrachte die Streuung der neu berechneten Sharpe-Werte. Liegt das 5. Perzentil unter null, ist die Anzahl deiner Trades irrelevant. Das geht mit ungefähr neun Zeilen numpy, und kein anderer einzelner Test hat mich von mehr Strategien abgebracht.
Gilt die Formel auch für echte Strategien?
Nicht ganz, und sie irrt in die Richtung, die dir nicht gefallen wird. Das Ergebnis 1/√T setzt IID-normalverteilte Renditen voraus. Renditen echter Strategien weisen Autokorrelationen und Schiefe auf, und bei Strategien, die nach Carry, Short Vol oder Mean Reversion aussehen, ist die Schiefe meist negativ. Mertens' Korrektur berücksichtigt diese Momente:
SE(s) ≈ √((1 + s²/2 − γ₃·s + (γ₄−3)·s²/4) / n)
wobei γ₃ die Schiefe und γ₄ die Kurtosis bezeichnet. Bei negativer Schiefe ist der Term −γ₃·s positiv, wodurch sich das Intervall verbreitert. Eine erhöhte Kurtosis verbreitert es zusätzlich. Bei typischen Krypto-Carry-P&L mit einer Schiefe um −1.2 und einer Kurtosis um 9 habe ich den korrigierten Standardfehler schon 30–40% größer gesehen als den naiv berechneten. Los Paper von 2002 behandelt die Autokorrelation; der Effekt geht in dieselbe Richtung: Positive serielle Korrelation in den Renditen bläht den naiven Sharpe auf und verkleinert den scheinbaren Fehler – eine unangenehme Kombination.
Betrachte 1/√T also als Untergrenze deiner Unsicherheit. Besser wird es nicht.
Wie hoch muss der Sharpe sein, wenn ich 500 Varianten getestet habe?
Jetzt kommen wir zu dem Teil, der für alle wichtig ist, die eine automatisierte Forschungs-Pipeline betreiben – so wie wir jeden Tag bei Stratmill: Der Generierungsagent liefert nicht einen Kandidaten, sondern Hunderte.
Der erwartete Maximalwert von M Ziehungen aus einer Standardnormalverteilung liegt ungefähr bei √(2 ln M). Multipliziere ihn mit deinem Standardfehler, und du erhältst den Sharpe, den die glücklichste von M tatsächlich wertlosen Strategien aufweisen wird.
| Getestete Strategien | √(2 ln M) | Sharpe der besten Rauschstrategie, 5 Jahre (SE 0.45) | Beste Rauschstrategie, 2 Jahre (SE 0.71) |
|---|---|---|---|
| 10 | 2.15 | 0.96 | 1.52 |
| 100 | 3.03 | 1.36 | 2.16 |
| 500 | 3.53 | 1.58 | 2.50 |
| 5,000 | 4.13 | 1.85 | 2.93 |
Schau dir die vorletzte Zeile an. Wenn du 500 Kandidaten anhand von zwei Jahren Daten generiert hast und der Gewinner einen Sharpe von 2.4 aufweist, hast du exakt nichts gefunden. Der Wert liegt unterhalb des Rauschpegels. Baileys und López de Prados deflationierter Sharpe formalisiert das, indem die Varianz deiner getesteten Sharpe-Werte an die Stelle des groben √(2 ln M) tritt. Das sauber zu implementieren lohnt sich, aber schon die grobe Version reicht, um dein Verhalten ab heute zu ändern.
Zwei Dinge machen die Lage noch schlechter, als die Tabelle vermuten lässt. Erstens ist M nicht die Anzahl der Strategien, die du gespeichert hast, sondern die Anzahl der Strategien, die du bewertet hast – einschließlich jeder Parameteränderung, jedes „Ich probiere einfach mal einen 30-periodigen Lookback“ und jeder Wiederholung nach einer Fehlerkorrektur. Niemand zählt ehrlich. Zweitens sind deine Kandidaten keine unabhängigen Ziehungen, daher überschätzt √(2 ln M) die effektive Breite. Korrelationen zwischen den Tests bedeuten aber auch, dass ein einzelnes glückliches Regime gleich eine ganze Gruppe davon begünstigt.
Die gefährlichste Zahl in der Quant-Forschung ist die, die niemand protokolliert hat: Wie oft hast du hingeschaut?
Was mache ich also konkret?
Fünf Dinge, in der Reihenfolge, in der ich sie angehen würde.
- Jede Auswertung protokollieren. Ein Zähler, der bei jedem Backtest-Lauf hochzählt, dauerhaft gespeichert wird und nie zurückgesetzt wird. Wenn du M nicht angeben kannst, kannst du auch deinen Schwellenwert nicht nennen. Das ist die einzelne Stunde Engineering-Arbeit mit dem größten Nutzen auf der ganzen Liste.
- Den Sharpe immer mit seinem Intervall angeben. Nie nur eine nackte Zahl ausgeben. Unsere Backtest-Berichte geben
1.72 ± 0.51 (2.9y, skew-adjusted)aus, und das ± ist Pflicht. Es verändert die Art, wie das ganze Team über Ergebnisse spricht. - Die Schwelle anhand von M und T festlegen, bevor du dir die Ergebnisse ansiehst. Lies den Wert aus der Tabelle oben ab und notiere ihn. Nachträglich festgelegte Schwellenwerte führen dazu, dass sich alle einen Curve Fit schönreden.
- Bei zu wenig Daten lieber auf mehr Breite als mehr Frequenz setzen. Mehr Kalenderzeit kannst du nicht herbeizaubern, aber du kannst dasselbe Signal auf 40 unkorrelierten Symbolen laufen lassen. Das erhöht das effektive n tatsächlich, anders als eine höhere Handelsfrequenz. Achte aber auf die Korrelationen: 40 Krypto-Perps während einer Risk-off-Stunde sind ein einziges Instrument.
- Dann im Paper-Trading testen. Die Out-of-Sample-Zeit wächst mit einem Tag pro Tag, und es gibt keine Abkürzung. Genau deshalb ist es die einzige Stichprobe, die niemand überfitten kann.
Nichts davon macht kurze Stichproben brauchbar. Es hilft dir, ehrlich einzuschätzen, welche Aussage eine kurze Stichprobe stützen kann – und das ist eine viel schwächere Aussage, als die meisten Backtest-Berichte suggerieren. Ein Sharpe von 1.5 über zwei Jahre ist eine Hypothese, die einen Paper-Trading-Test wert ist. Es ist kein Befund.
← Alle Beiträge
