Trade-offs entre treinamento, cobertura e causalidade na validação de séries temporais
Resumo
O artigo estuda um conflito fundamental na validação de modelos de séries temporais: as execuções de treinamento precisam de observações suficientes, as partições de teste devem cobrir uma parte adequada da amostra e o treinamento deve preceder cada ponto de teste. O artigo formaliza esses objetivos por meio de limites que relacionam a suficiência do treinamento, a cobertura dos testes, o vazamento de dados futuros e a distância entre os pontos de teste e as observações futuras de treinamento. Os autores também limitam o viés do vazamento sob uma hipótese de beta-mixing, relacionando sua magnitude à separação temporal.
A análise caracteriza a validação walk-forward expansiva como a fronteira causal e a compara com esquemas k-fold e k-fold purgado. O texto afirma que a validação k-fold com dados embaralhados em ruído puro produziu um coeficiente de informação de +0.32, enquanto a validação k-fold contígua resultou em +0.004, apesar de usar a mesma quantidade de dados futuros. Essas conclusões dependem da estrutura matemática apresentada; o resumo fornecido não inclui detalhes das provas nem testes empíricos mais amplos. Também ressalta que um embargo pode reduzir o vazamento quando a dependência desaparece rapidamente, mas não resolve problemas de causalidade ligados à não estacionariedade.
Ideias principais
- Segundo os limites do artigo, não é possível maximizar ao mesmo tempo a suficiência do treinamento, a cobertura dos testes e a causalidade temporal.
- A validação que ultrapassa a fronteira causal precisa usar observações futuras no treinamento.
- Sob a hipótese de beta-mixing apresentada, o viés do vazamento depende da distância temporal até os dados futuros de treinamento.
- A validação walk-forward expansiva é apresentada como a fronteira causal, enquanto esquemas k-fold trocam causalidade por cobertura.
- Um embargo pode reduzir o vazamento quando um processo perde dependência rapidamente, mas não corrige a não estacionariedade.
Tags
Texto completo
# 2609.29530
# The Impossible Trinity of Time-Series Validation: A Conservation Law among Training Sufficiency, Test Coverage, and Temporal Causality
Validating a model on a time series asks for three things at once: each training run should use most of the sample (sufficiency), the test sets should together cover most of the sample (coverage), and training data should come before test data (causality). We prove that the three cannot be had together and price each one. Let $α$ be the smallest training fraction over folds, $β$ the fraction of the sample covered by tests, $Λ$ the fraction of the sample used as training data from the future of a test point, and $δ$ the distance from a test point to the nearest training point in its future. Every scheme on a sample of length $T$ satisfies $α+β\le 1+Λ$ and $α+\min\{β,δ/T\} \le 1$, and under $β$-mixing the leakage bias at a test point is at most $2Mβ_{\mathrm{mix}}(δ)$. In words: going beyond the causal frontier $α+β=1$ requires training on the future; that future data must sit within $(1-α)T$ of a test point; and its harm depends on its distance, not its amount. Hence expanding walk-forward is exactly the Pareto frontier of causal validation, $k$-fold cross-validation buys the most future data, and purged $k$-fold with an embargo pays in distance instead, which is cheap when the process forgets quickly but cannot repair the part of causality demanded by non-stationarity. On pure noise, shuffled 5-fold reports an information coefficient of $+0.32$, while contiguous 5-fold, using the same amount of future data, reports $+0.004$.Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.