Ein Backtest eignet sich besser dazu, eine Strategie zu verwerfen, als eine auszuwählen. Sobald Sie anhand der historischen Performance zwischen vielen Varianten wählen, wird der Backtest Teil des Experiments – und der vermeintliche Gewinner hat einen versteckten Preis: Selection Bias.
Das klingt verkehrt herum. Wir führen Backtests durch, weil wir wissen wollen, welche Strategie funktioniert. Doch jede Entscheidung, die sich an denselben historischen Daten orientiert, verbraucht einen Teil ihrer Aussagekraft. Ändern Sie den Lookback, den Schwellenwert, das Anlageuniversum, den Rebalancing-Tag oder die Stop-Regel, nachdem Sie die Ergebnisse gesehen haben, stellen Sie den Daten eine weitere Frage. Irgendwann haben sie genug Fragen gehört, um Ihnen zufällig eine überzeugende Antwort zu geben.
Warum wird das beste Ergebnis weniger vertrauenswürdig, wenn man mehr Strategien testet?
Stellen Sie sich vor, Sie testen 100 Strategien ohne echten Edge. Ihre Renditen werden trotzdem voneinander abweichen. Sind ihre Performance-Schätzungen ungefähr unabhängig und ist das Rauschen normalverteilt, wird der beste Sharpe unter ihnen positiv sein, obwohl der tatsächliche Sharpe jeder Strategie bei 0 liegt.
Eine grobe Näherung für das erwartete Maximum aus 100 unabhängigen standardnormalverteilten Ziehungen liegt 2.5 Standardabweichungen über dem Mittelwert. Betrachten Sie das als Veranschaulichung, nicht als Korrektur, die Sie einfach in einen Bericht übernehmen können: Reale Strategievarianten sind korreliert, Sharpe-Schätzungen unterliegen einem eigenen Stichprobenfehler, und Renditen verhalten sich selten wie sauber normalverteilte Ziehungen. Die praktische Aussage bleibt trotz dieser Einschränkungen bestehen: Je mehr Kandidaten Sie prüfen, desto wahrscheinlicher spiegelt die höchste Kennzahl günstiges Rauschen wider.
Ein „Kandidat“ ist nicht nur ein gespeicherter Backtest. Dazu zählt jede Entscheidung, die Sie nach einem Blick auf ein Ergebnis treffen: das Anlageuniversum auszuweiten, weil der Chart unruhig wirkt, ein schmerzhaftes Jahr auszuschließen oder eine Gebührenannahme so lange zu ändern, bis sich die Kurve erholt. Auch diese Entscheidungen zählen, selbst wenn niemand ihnen eine Versionsnummer gegeben hat.
Führen Sie ein Forschungsprotokoll, bevor Sie die nächste Variante testen
Dokumentieren Sie die gesamte Suche, auch verworfene Ideen und den Grund für jede Änderung. So halten Sie ehrlicher fest, wie stark das Ergebnis durch Auswahl beeinflusst wurde, und es fällt schwerer, sich nur an die vielversprechenden Versuche zu erinnern.
| Dokumentieren | Beispiel | Warum das wichtig ist |
|---|---|---|
| Hypothese | Kurzfristige Umkehr ist nach ungewöhnlich starken Bewegungen bei BTC-Perpetuals ausgeprägter | Trennt die Idee von den später gewählten Parametern |
| Variante und Zeitstempel | 48-Stunden-Signal, 2026-10-09, Lauf 014 | Zählt die Suchversuche und verknüpft die Ergebnisse mit Code und Daten |
| Auswahlregel | Auswahl nach Netto-Sharpe; mindestens 100 Trades | Zeigt, was „beste“ Strategie vor dem Vergleich bedeutete |
| Verworfene Varianten | 12-, 24- und 72-Stunden-Zeiträume; alle dokumentiert | Verhindert, dass der sichtbare Gewinner seine Konkurrenz auslöscht |
Ein Protokoll macht die Suche nicht ungeschehen. Es macht sie nachvollziehbar – der erste Schritt, um einzuschätzen, wie viel Vertrauen der Gewinner verdient.
Halten Sie Daten zurück, die Sie im Forschungsprozess nicht immer wieder heranziehen können
Teilen Sie die Daten nach Zeiträumen auf und schützen Sie dann den letzten Zeitraum. Entwickeln Sie die Strategie mit einem Zeitraum, treffen Sie Entscheidungen anhand eines Validierungszeitraums und bewerten Sie die eingefrorene Strategie genau 1 Mal anhand eines späteren Holdouts. Beispielsweise könnten Sie 2018–2022 für die Entwicklung und 2023 für die Validierung verwenden und 2024–2025 zurückhalten. Das sind nur Beispielzeiträume: Die Aufteilung sollte sich nach Markt, Strategiehorizont und Datenabdeckung richten.
Legen Sie fest, was „eingefroren“ bedeutet: Signal, Anlageuniversum, Positionsgröße, Ausführungsannahmen und Regeln für fehlende Daten. Enttäuscht der Holdout und passen Sie die Strategie daran an, ist dieser Zeitraum zu Validierungsdaten geworden. Für die nächste ehrliche Bewertung brauchen Sie neue Evidenz.
Hier machen sich auch kleine Stichproben bemerkbar. Eine Strategie, die in einem Holdout 18 Mal handelt, erlaubt noch kein präzises Urteil. Berichten Sie neben den Renditekennzahlen auch die Anzahl der Trades und die Unsicherheit. Ein einzelner Durchschnitt kann eine kleine Stichprobe endgültiger erscheinen lassen, als sie ist.
Heißt das, Backtests sind nutzlos, wenn man Strategien auswählen will?
Nein. Kritiker haben recht, dass strenge Holdouts Daten verschwenden können: Märkte verändern sich, historische Reihen sind kurz, und ein unberührter Zeitraum kann nur ein ungewöhnliches Marktregime abbilden. Ein sorgfältig gestalteter Walk-forward-Prozess kann zeigen, wie sich eine Strategie verhält, wenn die verfügbare Historie fortgeschrieben wird. Wiederholtes Optimieren wird dadurch trotzdem nicht kostenlos. Prüfen Sie jeden Fold und überarbeiten anschließend die Strategie, haben diese Folds die Forschung beeinflusst.
Nutzen Sie Backtests, um Schwachstellen aufzudecken, eine kleine Zahl von Ideen mit plausibler Marktmechanik zu vergleichen und zu prüfen, ob die Ergebnisse auch bei plausiblen Gebühren, Funding, Market Impact und Parameteränderungen Bestand haben. Führen Sie ein Protokoll. Bewahren Sie einen finalen Holdout. Überführen Sie dann eine vielversprechende, eingefrorene Version ins Paper-Trading, wo Abweichungen im operativen Ablauf sichtbar werden können.
Die stärkste Aussage eines Backtests lautet oft: „Diese Idee scheitert unter Bedingungen, die wir bereits erkennen können.“ Lautet die Aussage: „Das ist die beste Strategie“, fragen Sie, wie viele andere Antworten der Backtest geben sollte.
← Alle Beiträge


