رفتن به محتوا
همه اسناد کتابخانه

توازن‌های اعتبارسنجی سری زمانی: آموزش، پوشش و علیت

مقاله arXiv papers · نویسنده: Jiayu Li

خلاصه

این مقاله تضادی بنیادی در اعتبارسنجی مدل‌های سری زمانی را بررسی می‌کند: دوره‌های آموزش به مشاهدات کافی نیاز دارند، بخش‌های آزمون باید سهم کافی از نمونه را پوشش دهند و آموزش باید پیش از هر نقطه آزمون انجام شود. مقاله این اهداف را با کران‌هایی صورت‌بندی می‌کند که کفایت آموزش، پوشش آزمون، نشت داده‌های آینده و فاصله میان نقاط آزمون و مشاهدات آینده در آموزش را به هم مرتبط می‌سازند. نویسندگان همچنین تحت فرض بتا-مخلوط، سوگیری ناشی از نشت را کران‌گذاری می‌کنند و اندازه آن را به فاصله زمانی پیوند می‌دهند.

تحلیل، اعتبارسنجی پیش‌رونده با پنجره گسترش‌یابنده را مرز علیت می‌داند و آن را با طرح‌های کی‌فولد و کی‌فولد پاک‌سازی‌شده مقایسه می‌کند. متن می‌گوید اعتبارسنجی پنج‌قسمتیِ درهم‌ریخته روی نویز محض، ضریب اطلاعاتی +0.32 ایجاد کرد؛ در حالی که اعتبارسنجی پنج‌قسمتیِ پیوسته با وجود استفاده از همان مقدار داده آینده، به +0.004 رسید. این نتیجه‌گیری‌ها به چارچوب ریاضی بیان‌شده وابسته‌اند؛ خلاصه ارائه‌شده جزئیات اثبات یا آزمون‌های تجربی گسترده‌تر را نمی‌آورد. همچنین هشدار می‌دهد که اگر وابستگی به‌سرعت از میان برود، دوره منع می‌تواند نشت را کاهش دهد، اما مشکلات علیت ناشی از ناپایایی را حل نمی‌کند.

ایده‌های کلیدی

  • طبق کران‌های مقاله، کفایت آموزش، پوشش آزمون و علیت زمانی را نمی‌توان هم‌زمان به حداکثر رساند.
  • اعتبارسنجی‌ای که از مرز علیت فراتر می‌رود باید از مشاهدات آینده در آموزش استفاده کند.
  • طبق فرض بتا-مخلوط بیان‌شده، سوگیری نشت به فاصله زمانی تا داده‌های آینده در آموزش وابسته است.
  • اعتبارسنجی پیش‌رونده با پنجره گسترش‌یابنده مرز علیت معرفی می‌شود، در حالی که طرح‌های کی‌فولد علیت را با پوشش مبادله می‌کنند.
  • اگر یک فرایند سریع فراموش کند، دوره منع می‌تواند نشت را کاهش دهد، اما ناپایایی را برطرف نمی‌کند.

برچسب‌ها

متن کامل
# 2609.29530


# The Impossible Trinity of Time-Series Validation: A Conservation Law among Training Sufficiency, Test Coverage, and Temporal Causality









Validating a model on a time series asks for three things at once: each training run should use most of the sample (sufficiency), the test sets should together cover most of the sample (coverage), and training data should come before test data (causality). We prove that the three cannot be had together and price each one. Let $α$ be the smallest training fraction over folds, $β$ the fraction of the sample covered by tests, $Λ$ the fraction of the sample used as training data from the future of a test point, and $δ$ the distance from a test point to the nearest training point in its future. Every scheme on a sample of length $T$ satisfies $α+β\le 1+Λ$ and $α+\min\{β,δ/T\} \le 1$, and under $β$-mixing the leakage bias at a test point is at most $2Mβ_{\mathrm{mix}}(δ)$. In words: going beyond the causal frontier $α+β=1$ requires training on the future; that future data must sit within $(1-α)T$ of a test point; and its harm depends on its distance, not its amount. Hence expanding walk-forward is exactly the Pareto frontier of causal validation, $k$-fold cross-validation buys the most future data, and purged $k$-fold with an embargo pays in distance instead, which is cheap when the process forgets quickly but cannot repair the part of causality demanded by non-stationarity. On pure noise, shuffled 5-fold reports an information coefficient of $+0.32$, while contiguous 5-fold, using the same amount of future data, reports $+0.004$.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.