ارزیابی پیشنگر برای جایگزینی مدلهای پیشبینی رمزارز | Stratmill
خلاصه
این مقاله سیاستی برای استقرار سامانههای پیشبینی با بازآموزی منظم معرفی میکند: مدل فعلی به خدمتدهی ادامه میدهد، درحالیکه مدل رقیب با بازبرازش و مقداردهی اولیه گرم، خارج از مسیر خدمتدهی اجرا میشود؛ سپس هر دو در همان هفته بعدی و با برچسبهای تأخیری مقایسه میشوند. مدل رقیب تنها در صورتی جایگزین مدل فعلی میشود که از آستانه ثابتِ برتری جفتشده در لگاریتم درستنمایی منفی عبور کند. هدف، جلوگیری از تعویض خودکار بر اساس تقویم است؛ زیرا برازش جدید ممکن است از مدلی که به یادگیری ادامه داده بدتر باشد.
در بازپخش تاریخی طی دو دوره جداگانه بایننس، این سیاست در مقایسه با جایگزینی تقویمی، ارتقای خودکار و نگهداری پیوسته، لگاریتم درستنمایی منفی را کاهش داد. این سیاست مدلهای رقیب کمتری را ارتقا داد و تغییرات مدل مستقر را کاهش داد. نویسندگان از سازگاری جهتدار نتایج در بذرهای تصادفی، بودجههای آزمون، حاشیههای ارتقا، پنل داراییهای قدیمیتر و یک تابع هدف نظارتشده گزارش میدهند. این نتایج بازپخش، مربوط به قراردادهای مشخص آتی دائمی رمزارز هستند؛ شرح موجود عملکرد در استقرار زنده یا بازارهای دیگر را اثبات نمیکند.
ایدههای کلیدی
- این سیاست پیش از جایگزینی، مدل رقیب را که با مقداردهی اولیه گرم بازبرازش شده است در کنار مدل فعلیِ حفظشده ارزیابی میکند.
- هر دو مدل با برچسبهای تأخیریِ همان هفته بعد ارزیابی میشوند.
- ارتقا مستلزم بهبود جفتشدهای ثابت در لگاریتم درستنمایی منفی است.
- بازپخش تاریخی، در مقایسه با سیاستهای مقایسهای فهرستشده، از زیان پیشبینی کمتر و تغییرات کمتر در مدلهای مستقر گزارش میدهد.
- بررسیهای استحکام گزارششده، بذرهای تصادفی، تنظیمات ارتقا، پنلهای دارایی و یک تابع هدف نظارتشده متفاوت را پوشش میدهند.
برچسبها
متن کامل
# Train Often, Deploy Selectively: Forward-Gated Model Replacement in Crypto Markets # Train Often, Deploy Selectively: Forward-Gated Model Replacement in Crypto Markets Production forecasting systems retrain models regularly, but a retrained candidate does not necessarily outperform a continuously maintained incumbent that has continued to learn. We introduce Shadow Before Swap (SBS), a deployment policy that warm-refits a challenger off the serving path, evaluates it against the maintained incumbent on the same next week of delayed labels, and promotes it only after a fixed paired negative-log-likelihood (NLL) advantage. In historical replay over two nonoverlapping Binance episodes spanning 48 UTC weeks, three seeds, eight underlyings, and two perpetual-futures contract types, SBS reduces NLL by 0.1472% relative to calendar replacement, 0.0755% relative to schedule-matched automatic promotion, and 0.0428% relative to continuous maintenance. The corresponding episode-stratified four-week block intervals are 0.1139%-0.1754%, 0.0521%-0.0980%, and 0.0301%-0.0554%, respectively. SBS promotes 114 of 528 challengers, reducing deployed model changes by 78.4% while improving the serving trajectory. The effect remains directionally consistent across seeds, trial budgets, promotion margins, an earlier 20-asset panel, and a topology-matched supervised objective. SBS thus provides a practical deployment policy that improves probabilistic forecasts while limiting consequential model-state transitions.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.