یادگیری آنلاین بدون فرافکنی با حافظه و پشیمانی پویا
خلاصه
این مقاله به بهینهسازی محدب آنلاین با حافظه میپردازد؛ جایی که هر زیان هم به تصمیم فعلی و هم به تصمیمهای قبلی وابسته است. چنین وابستگیای میتواند موقعیتهایی را مدلسازی کند که در آنها اقدامات گذشته بر پیامدهای کنونی اثر میگذارند. نویسندگان الگوریتم یادگیری پایه-فرا بدون فرافکنی را معرفی میکنند که برای کمینهکردن پشیمانی پویا طراحی شده است؛ این معیار عملکرد را با دنبالههای تصمیمِ متغیر در طول زمان مقایسه میکند. حذف فرافکنی، گلوگاه محاسباتی رایجی را در یادگیری آنلاین هدف میگیرد.
این روش فرانک-ولف آنلاین را با هج ترکیب میکند. مقاله آن را برای کنترل سامانههای خطی متغیر با زمان و در معرض نویز فرایندی پیشبینیناپذیر به کار میگیرد و کنترلگری با حافظه و پشیمانی پویای کراندار میسازد که با سیاست بازخورد خطیِ بهینه و متغیر با زمان سنجیده میشود. شبیهسازی سامانههای خطی ناوردا با زمان بهعنوان اعتبارسنجی گزارش شده است. توضیح، آربیتراژ آماری و پیشبینی سری زمانی را نیز کاربردهای انگیزهبخش معرفی میکند، اما برای این حوزهها راهبرد معاملاتی، ارزیابی بازار یا نتیجه عملکردی عددی ارائه نمیدهد. بنابراین شواهد ارائهشده مربوط به کنترل شبیهسازیشده است، نه بازده معاملاتی اثباتشده.
ایدههای کلیدی
- یادگیری آنلاین با حافظه، زیانهایی را مدل میکند که به تصمیمهای فعلی و گذشته وابستهاند.
- الگوریتم پیشنهادی از عملیات فرافکنی اجتناب میکند و پشیمانی پویا را در مقایسه با تصمیمهای متغیر هدف میگیرد.
- این روش فرانک-ولف آنلاین و هج را ترکیب میکند.
- یک کنترلگر این روش را برای سامانههای خطی دارای نویز فرایندی پیشبینیناپذیر به کار میگیرد.
- اعتبارسنجی برای کنترل شبیهسازیشده توصیف شده است، نه عملکرد در بازارهای معاملاتی.
برچسبها
متن کامل
# 2301.00497 # Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.