Tausend Strategievarianten. Ein gemessener Sharpe-Wert von 2.0 für den Spitzenreiter. Eine Falsch-Positiv-Rate von 5%. Das klingt nach einem starken Ergebnis, bis man fragt, wie viele Versuche nötig waren, um es zu finden. Bei genügend vielen Versuchen kann allein aus Rauschen ein überzeugender Backtest entstehen.
Die überraschende Zahl ist nicht der Sharpe-Wert. Es ist die Zahl der Versuche. Jedes Indikatorfenster, jeder Einstiegsschwellenwert, jede Auswahl des Anlageuniversums und jede verworfene Idee bietet eine weitere Chance, ein Glücksergebnis auszuwählen. Wenn dein Forschungsprozess diese Versuche vergisst, tut es deine Konfidenzberechnung auch.
Warum sieht die beste Strategie umso besser aus, je mehr Strategien man ausprobiert?
Stell dir vor, du testest 1,000 Strategien ohne echten Vorteil. Jede hat eine Wahrscheinlichkeit von 5%, bei einem herkömmlichen Test statistische Signifikanz zu zeigen. In der echten Forschung sind diese Versuche nicht völlig unabhängig, aber die Grundidee bleibt: Je mehr Kandidaten du prüfst, desto wahrscheinlicher sieht einer davon zufällig außergewöhnlich aus.
Selbst wenn jeder Kandidat unabhängig wäre, läge die Wahrscheinlichkeit, dass mindestens einer die Schwelle von 5% überschreitet, bei etwa 99.4%. In der Praxis verhalten sich benachbarte Parametereinstellungen oft ähnlich, also sind 1,000 Varianten nicht gleichbedeutend mit 1,000 unabhängigen Münzwürfen. Die effektive Zahl der Versuche liegt aber selten bei nur einem.
Eine kleine Falle, die mir in Notebooks schon begegnet ist: Jemand testet Lookbacks von 5 bis 100, stellt die Sharpe-Oberfläche dar und berichtet dann den sauber aussehenden Höchstwert. Die Oberfläche hilft, die Sensitivität zu verstehen. Der Höchstwert ist zugleich das Ergebnis einer Suche und verdient weniger Vertrauen als ein Schwellenwert, der vor dem Experiment festgelegt wurde.
Was zählt als Forschungsversuch?
Zähle Entscheidungen, die von beobachteten Ergebnissen beeinflusst wurden. Ein Versuch kann ein programmierter Backtest sein, aber auch eine manuelle Änderung nach dem Blick auf die Equity-Kurve. Wenn du einen Stop weiter gesetzt hast, weil die alte Einstellung eine Rally verpasst hat, hast du Informationen aus dem Testzeitraum verwendet.
| Forschungsmaßnahme | Zählt normalerweise als Versuch? | Warum |
|---|---|---|
| Einen weiteren Signalschwellenwert testen | Ja | Das Ergebnis hilft bei der Auswahl eines Kandidaten |
| Den Zeitraum ändern, nachdem man einen Drawdown gesehen hat | Ja | Die Stichprobe wurde als Reaktion auf die Performance ausgewählt |
| Einen dokumentierten Datenfehler beheben | Meistens nein | Die Änderung stellt das geplante Experiment wieder her |
| Dieselbe eingefrorene Strategie in einem neuen Holdout-Zeitraum ausführen | Vorerst kein neuer Auswahlversuch | Er wird zu einem, wenn du die Strategie anhand dieses Ergebnisses optimierst |
Die Abgrenzung erfordert Urteilsvermögen. Einen Tippfehler zu beheben ist etwas anderes, als ein Merkmal zu ändern, nachdem man gesehen hat, wo es versagt hat. Führe ein kurzes Versuchsprotokoll mit Hypothese, Änderung, Datenzeitraum und Ergebnis. Es muss nicht ausgefeilt sein: Eine datierte CSV ist besser, als drei Monate später die Suche aus dem Gedächtnis rekonstruieren zu müssen.
Kann ich meinen Sharpe-Wert für multiples Testen korrigieren?
Methoden wie die Deflated Sharpe Ratio schätzen, wie viel der scheinbaren Performance durch die Auswahl aus vielen Kandidaten zustande gekommen sein könnte. Dabei berücksichtigen sie Faktoren wie die Renditeverteilung und die Abhängigkeit zwischen Versuchen. Sie sind nützliche Diagnosewerkzeuge, aber keine Maschine, die einen chaotischen Forschungsprozess in Gewissheit verwandelt. Ihre Ergebnisse hängen von Annahmen und davon ab, ob die angegebene Zahl der Versuche glaubwürdig ist.
Als grobe Orientierung: Angenommen, jemand hat 400 Varianten getestet, einen Sharpe-Wert von 1.8 gefunden und schätzt, dass die Renditen deutlich schief verteilt sind und fette Verteilungsschwänze aufweisen. Dieses Ergebnis sollte eine höhere Hürde überwinden als ein Sharpe-Wert von 1.8 aus einem einzigen vorab registrierten Test. Die Korrektur kann die Aussagekraft deutlich abschwächen; sie kann dir nicht sagen, dass der Vorteil echt ist.
Dokumentiere die Suche, bevor du sie verteidigen musst: Zahl der Kandidaten, Parameterbereiche, geprüfte Datenzeiträume und alle manuellen Änderungen. Wenn diese Angaben fehlen, bezeichne den Backtest als explorativ.
Was sollte vor dem Paper-Trading passieren?
Fixiere einen Kandidaten und lege die nächste Auswertung fest, bevor du sie durchführst. Eine sinnvolle Abfolge: Wähle die Strategie anhand von Trainingsdaten aus, prüfe sie mit Validierungsdaten und reserviere dann einen abschließenden Zeitraum oder ein Paper-Trading-Fenster, das nicht in die Entwicklung zurückfließt. Jede Stufe beantwortet eine andere Frage. Wenn du die Strategie in der letzten Stufe wiederholt anpasst, wird diese zu weiteren Trainingsdaten.
Prüfe außerdem, ob benachbarte Einstellungen dieselbe Geschichte erzählen. Ein breiter Bereich mit moderat positiven Ergebnissen ist meist glaubwürdiger als ein nadelförmiger Spitzenwert. Robustheit kann jedoch ein fehlerhaftes Ausführungsmodell nicht retten. Gebühren, Funding, Markteinfluss und Instrumentverfügbarkeit müssen weiterhin den Bedingungen entsprechen, denen die Strategie tatsächlich ausgesetzt gewesen wäre.
Paper-Trading liefert zusätzliche Erkenntnisse über die betriebliche Übereinstimmung: Timing, Orderabwicklung und die Frage, ob die Live-Forschungspipeline wie erwartet funktioniert. Die bereits erfolgte Auswahl lässt sich dadurch nicht rückgängig machen. Tausend glückliche Backtests bleiben tausend Versuche, wenn die erste Paper-Order aufgegeben wird.
Wenn ein Backtest also einen Sharpe-Wert von 2 ausweist, frage neben der Equity-Kurve auch nach dem Verlauf der Forschung. Wie viele Ideen wurden ausprobiert? Welche Ergebnisse haben das nächste Experiment beeinflusst? Die Antwort könnte die wichtigste Kennzahl im Bericht sein.
← Alle Beiträge


