Zielkonflikte bei der Zeitreihenvalidierung: Training, Abdeckung und Kausalität
Zusammenfassung
Die Arbeit untersucht einen grundlegenden Zielkonflikt bei der Validierung von Zeitreihenmodellen: Trainingsläufe benötigen genügend Beobachtungen, Test-Folds sollten einen ausreichenden Teil der Stichprobe abdecken und das Training muss jedem Testpunkt vorausgehen. Sie formalisiert diese Ziele durch Schranken, die Trainingsumfang, Testabdeckung, Informationsleckage aus zukünftigen Daten und den zeitlichen Abstand zwischen Testpunkten und späteren Trainingsbeobachtungen verknüpfen. Unter einer Beta-Mixing-Annahme begrenzen die Autoren außerdem den Verzerrungseffekt durch Informationsleckage und setzen dessen Größe mit dem zeitlichen Abstand in Beziehung.
Die Analyse charakterisiert eine expandierende Walk-Forward-Validierung als kausale Grenze und vergleicht sie mit K-Fold- und Purged-K-Fold-Verfahren. Laut Text ergab eine zufällig gemischte Fünf-Fold-Validierung mit reinem Rauschen einen Informationskoeffizienten von +0.32; bei zusammenhängenden Folds waren es +0.004, obwohl dieselbe Menge an Zukunftsdaten verwendet wurde. Diese Schlussfolgerungen hängen vom angegebenen mathematischen Rahmen ab; die Zusammenfassung enthält weder Beweisdetails noch umfassendere empirische Tests. Sie weist außerdem darauf hin, dass eine Sperrfrist die Informationsleckage verringern kann, wenn Abhängigkeiten schnell abklingen, aber Kausalitätsprobleme durch Nichtstationarität nicht behebt.
Kernaussagen
- Unter den angegebenen Schranken lassen sich Trainingsumfang, Testabdeckung und zeitliche Kausalität nicht gleichzeitig maximieren.
- Eine Validierung jenseits der kausalen Grenze erfordert zukünftige Beobachtungen im Training.
- Unter der angegebenen Beta-Mixing-Annahme hängt die Verzerrung durch Informationsleckage vom zeitlichen Abstand zu zukünftigen Trainingsdaten ab.
- Eine expandierende Walk-Forward-Validierung gilt als kausale Grenze; bei K-Fold-Verfahren wird Kausalität zugunsten der Abdeckung aufgegeben.
- Eine Sperrfrist kann die Informationsleckage verringern, wenn ein Prozess schnell sein Gedächtnis verliert, behebt aber keine Nichtstationarität.
Schlagwörter
Volltext
# 2609.29530
# The Impossible Trinity of Time-Series Validation: A Conservation Law among Training Sufficiency, Test Coverage, and Temporal Causality
Validating a model on a time series asks for three things at once: each training run should use most of the sample (sufficiency), the test sets should together cover most of the sample (coverage), and training data should come before test data (causality). We prove that the three cannot be had together and price each one. Let $α$ be the smallest training fraction over folds, $β$ the fraction of the sample covered by tests, $Λ$ the fraction of the sample used as training data from the future of a test point, and $δ$ the distance from a test point to the nearest training point in its future. Every scheme on a sample of length $T$ satisfies $α+β\le 1+Λ$ and $α+\min\{β,δ/T\} \le 1$, and under $β$-mixing the leakage bias at a test point is at most $2Mβ_{\mathrm{mix}}(δ)$. In words: going beyond the causal frontier $α+β=1$ requires training on the future; that future data must sit within $(1-α)T$ of a test point; and its harm depends on its distance, not its amount. Hence expanding walk-forward is exactly the Pareto frontier of causal validation, $k$-fold cross-validation buys the most future data, and purged $k$-fold with an embargo pays in distance instead, which is cheap when the process forgets quickly but cannot repair the part of causality demanded by non-stationarity. On pure noise, shuffled 5-fold reports an information coefficient of $+0.32$, while contiguous 5-fold, using the same amount of future data, reports $+0.004$.Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.