الانتقال إلى المحتوى
جميع مستندات المكتبة

التعلم عبر الإنترنت دون إسقاط مع الذاكرة والندم الديناميكي

مقال arXiv papers · المؤلف: Hongyu Zhou et al.

الملخص

تتناول هذه الورقة التحسين المحدب عبر الإنترنت مع الذاكرة، حيث تعتمد كل خسارة على القرار الحالي والقرارات السابقة. ويمكن لهذا الاعتماد نمذجة حالات تؤثر فيها الإجراءات السابقة في النتائج الحالية. ويقدم المؤلفون خوارزمية تجميعية فوقية وقاعدية لا تتطلب الإسقاط، ومصممة لتقليل الندم الديناميكي، الذي يقيس الأداء مقارنةً بسلاسل قرارات متغيرة بمرور الزمن. ويستهدف تجنب الإسقاطات عنق زجاجة حسابيًا شائعًا في التعلم عبر الإنترنت.

تجمع الطريقة بين خوارزمية فرانك–وولف عبر الإنترنت وخوارزمية هيدج. وتطبقها الورقة على التحكم في أنظمة خطية متغيرة بمرور الزمن ومعرضة لضوضاء عملية غير متوقعة، فتبني متحكمًا ذا ذاكرة وندم ديناميكي محدود مقارنةً بسياسة تغذية راجعة خطية مثلى متغيرة بمرور الزمن. وتُعرض محاكاة لأنظمة خطية ثابتة بمرور الزمن للتحقق. ويحدد الوصف أيضًا المراجحة الإحصائية والتنبؤ بالسلاسل الزمنية كتطبيقات محفزة، لكنه لا يقدم استراتيجية تداول أو تقييمًا للسوق أو نتائج أداء رقمية في هذه المجالات. لذلك تتعلق الأدلة المعروضة هنا بالتحكم المحاكى، لا بعوائد تداول مثبتة.

الأفكار الرئيسية

  • يمثل التعلم عبر الإنترنت مع الذاكرة خسائر تعتمد على القرارات الحالية والسابقة.
  • تتجنب الخوارزمية المقترحة عمليات الإسقاط وتستهدف الندم الديناميكي في مواجهة القرارات المتغيرة.
  • تجمع الطريقة بين فرانك–وولف عبر الإنترنت وهيدج.
  • يطبق متحكم الطريقة على أنظمة خطية ذات ضوضاء عملية غير متوقعة.
  • يتعلق التحقق الموصوف بالتحكم المحاكى، لا بأداء التداول في الأسواق.

الوسوم

النص الكامل
# 2301.00497


# Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control









Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.