مواد پر جائیں
لائبریری کی تمام دستاویزات

ٹائم سیریز کی توثیق میں سمجھوتے: تربیت، کوریج اور علت

مضمون arXiv papers · مصنف: Jiayu Li

خلاصہ

مقالہ ٹائم سیریز ماڈل کی توثیق میں ایک بنیادی ٹکراؤ کا مطالعہ کرتا ہے: تربیتی حصے میں کافی مشاہدات چاہییں، ٹیسٹ فولڈز کو نمونے کے کافی حصے کا احاطہ کرنا چاہیے، اور ہر ٹیسٹ پوائنٹ سے پہلے تربیت ہونی چاہیے۔ مصنفین ان مقاصد کو تربیت کی کفایت، ٹیسٹ کوریج، مستقبل کے ڈیٹا کے رساؤ، اور ٹیسٹ پوائنٹس سے مستقبل کے تربیتی مشاہدات کے فاصلے کے باہمی تعلق کی حدود سے باقاعدہ شکل دیتے ہیں۔ وہ بیٹا مکسنگ مفروضے کے تحت رساؤ کے تعصب کی حد بھی اخذ کرتے ہیں، جس کا حجم زمانی فاصلے سے جوڑتے ہیں۔

تجزیہ بڑھتے ہوئے واک فارورڈ توثیق کو علّی حد قرار دیتا اور اس کا موازنہ کے فولڈ اور پرجڈ کے فولڈ طریقوں سے کرتا ہے۔ متن کے مطابق خالص شور پر شفل کیے گئے پانچ فولڈ توثیق میں انفارمیشن کوفیشینٹ +0.32 تھا، جبکہ مسلسل پانچ فولڈ میں مستقبل کے ڈیٹا کی یکساں مقدار استعمال کرنے کے باوجود نتیجہ +0.004 رہا۔ یہ نتائج بیان کردہ ریاضیاتی ترتیب پر منحصر ہیں؛ فراہم کردہ خلاصے میں ثبوت کی تفصیل یا وسیع تر تجرباتی آزمائشیں نہیں۔ یہ بھی خبردار کیا گیا ہے کہ جب انحصار تیزی سے ختم ہو تو ایمبارگو رساؤ گھٹا سکتا ہے، لیکن غیر ساکنیت سے جڑے علّی مسائل حل نہیں کر سکتا۔

اہم خیالات

  • مقالے کی حدود کے تحت تربیت کی کفایت، ٹیسٹ کوریج اور زمانی علت کو بیک وقت زیادہ سے زیادہ نہیں کیا جا سکتا۔
  • علّی حد سے آگے کی توثیق میں تربیت کے لیے مستقبل کے مشاہدات استعمال کرنا پڑتے ہیں۔
  • بیٹا مکسنگ کے بیان کردہ مفروضے کے تحت رساؤ کا تعصب مستقبل کے تربیتی ڈیٹا تک زمانی فاصلے پر منحصر ہے۔
  • بڑھتی ہوئی واک فارورڈ توثیق کو علّی حد کے طور پر پیش کیا گیا ہے، جبکہ کے فولڈ طریقے علت کے بدلے کوریج دیتے ہیں۔
  • جب عمل تیزی سے سابقہ انحصار بھولتا ہو تو ایمبارگو رساؤ گھٹا سکتا ہے، لیکن غیر ساکنیت درست نہیں کر سکتا۔

ٹیگز

مکمل متن
# 2609.29530


# The Impossible Trinity of Time-Series Validation: A Conservation Law among Training Sufficiency, Test Coverage, and Temporal Causality









Validating a model on a time series asks for three things at once: each training run should use most of the sample (sufficiency), the test sets should together cover most of the sample (coverage), and training data should come before test data (causality). We prove that the three cannot be had together and price each one. Let $α$ be the smallest training fraction over folds, $β$ the fraction of the sample covered by tests, $Λ$ the fraction of the sample used as training data from the future of a test point, and $δ$ the distance from a test point to the nearest training point in its future. Every scheme on a sample of length $T$ satisfies $α+β\le 1+Λ$ and $α+\min\{β,δ/T\} \le 1$, and under $β$-mixing the leakage bias at a test point is at most $2Mβ_{\mathrm{mix}}(δ)$. In words: going beyond the causal frontier $α+β=1$ requires training on the future; that future data must sit within $(1-α)T$ of a test point; and its harm depends on its distance, not its amount. Hence expanding walk-forward is exactly the Pareto frontier of causal validation, $k$-fold cross-validation buys the most future data, and purged $k$-fold with an embargo pays in distance instead, which is cheap when the process forgets quickly but cannot repair the part of causality demanded by non-stationarity. On pure noise, shuffled 5-fold reports an information coefficient of $+0.32$, while contiguous 5-fold, using the same amount of future data, reports $+0.004$.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔