رفتن به محتوا
همه اسناد کتابخانه

یادگیری آنلاین بدون فرافکنی با حافظه و پشیمانی پویا

مقاله arXiv papers · نویسنده: Hongyu Zhou et al.

خلاصه

این مقاله به بهینه‌سازی محدب آنلاین با حافظه می‌پردازد؛ جایی که هر زیان هم به تصمیم فعلی و هم به تصمیم‌های قبلی وابسته است. چنین وابستگی‌ای می‌تواند موقعیت‌هایی را مدل‌سازی کند که در آن‌ها اقدامات گذشته بر پیامدهای کنونی اثر می‌گذارند. نویسندگان الگوریتم یادگیری پایه-فرا بدون فرافکنی را معرفی می‌کنند که برای کمینه‌کردن پشیمانی پویا طراحی شده است؛ این معیار عملکرد را با دنباله‌های تصمیمِ متغیر در طول زمان مقایسه می‌کند. حذف فرافکنی، گلوگاه محاسباتی رایجی را در یادگیری آنلاین هدف می‌گیرد.

این روش فرانک-ولف آنلاین را با هج ترکیب می‌کند. مقاله آن را برای کنترل سامانه‌های خطی متغیر با زمان و در معرض نویز فرایندی پیش‌بینی‌ناپذیر به کار می‌گیرد و کنترل‌گری با حافظه و پشیمانی پویای کراندار می‌سازد که با سیاست بازخورد خطیِ بهینه و متغیر با زمان سنجیده می‌شود. شبیه‌سازی سامانه‌های خطی ناوردا با زمان به‌عنوان اعتبارسنجی گزارش شده است. توضیح، آربیتراژ آماری و پیش‌بینی سری زمانی را نیز کاربردهای انگیزه‌بخش معرفی می‌کند، اما برای این حوزه‌ها راهبرد معاملاتی، ارزیابی بازار یا نتیجه عملکردی عددی ارائه نمی‌دهد. بنابراین شواهد ارائه‌شده مربوط به کنترل شبیه‌سازی‌شده است، نه بازده معاملاتی اثبات‌شده.

ایده‌های کلیدی

  • یادگیری آنلاین با حافظه، زیان‌هایی را مدل می‌کند که به تصمیم‌های فعلی و گذشته وابسته‌اند.
  • الگوریتم پیشنهادی از عملیات فرافکنی اجتناب می‌کند و پشیمانی پویا را در مقایسه با تصمیم‌های متغیر هدف می‌گیرد.
  • این روش فرانک-ولف آنلاین و هج را ترکیب می‌کند.
  • یک کنترل‌گر این روش را برای سامانه‌های خطی دارای نویز فرایندی پیش‌بینی‌ناپذیر به کار می‌گیرد.
  • اعتبارسنجی برای کنترل شبیه‌سازی‌شده توصیف شده است، نه عملکرد در بازارهای معاملاتی.

برچسب‌ها

متن کامل
# 2301.00497


# Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control









Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.