مواد پر جائیں
لائبریری کی تمام دستاویزات

میموری اور متحرک پچھتاوے کے ساتھ پروجیکشن سے آزاد آن لائن لرننگ

مضمون arXiv papers · مصنف: Hongyu Zhou et al.

خلاصہ

یہ مقالہ میموری والی آن لائن محدب آپٹیمائزیشن پر ہے، جہاں ہر نقصان موجودہ اور پہلے کے فیصلوں دونوں پر منحصر ہوتا ہے۔ ایسا انحصار ان حالات کو ماڈل کر سکتا ہے جہاں ماضی کے اعمال موجودہ نتائج پر اثر انداز ہوں۔ مصنفین متحرک پچھتاوا کم کرنے کے لیے پروجیکشن سے آزاد میٹا بیس لرننگ الگورتھم متعارف کراتے ہیں، جو بدلتے وقت کے ساتھ فیصلہ جاتی سلسلوں کے مقابل کارکردگی ناپتا ہے۔ پروجیکشن سے بچنا آن لائن لرننگ کی عام حسابی رکاوٹ کو ہدف بناتا ہے۔

یہ طریقہ آن لائن فرینک وولف کو ہیج کے ساتھ ملاتا ہے۔ مقالہ غیر متوقع عمل کے شور والے خطی، وقت کے ساتھ بدلتے نظاموں کے کنٹرول میں اسے لاگو کرتا ہے، اور میموری والا کنٹرولر بناتا ہے جس کا متحرک پچھتاوا بہترین وقت کے ساتھ بدلتی خطی فیڈبیک پالیسی کے مقابل محدود ہے۔ توثیق کے طور پر وقت کے ساتھ غیر بدلتے خطی نظاموں کی سمیولیشن رپورٹ کی گئی ہے۔ وضاحت شماریاتی آربیٹریج اور ٹائم سیریز پیش گوئی کو محرک اطلاقات بھی بتاتی ہے، مگر ان شعبوں کے لیے تجارتی حکمتِ عملی، مارکیٹ جائزہ یا عددی کارکردگی کے نتائج نہیں دیتی۔ یہاں پیش کردہ شہادت ثابت شدہ تجارتی منافع کے بجائے سمیولیٹڈ کنٹرول سے متعلق ہے۔

اہم خیالات

  • میموری والی آن لائن لرننگ ایسے نقصانات ظاہر کرتی ہے جو موجودہ اور ماضی کے فیصلوں پر منحصر ہوں۔
  • مجوزہ الگورتھم پروجیکشن آپریشنز سے بچتا ہے اور بدلتے فیصلوں کے مقابل متحرک پچھتاوے کو ہدف بناتا ہے۔
  • یہ طریقہ آن لائن فرینک وولف اور ہیج کو ملاتا ہے۔
  • کنٹرولر غیر متوقع عمل کے شور والے خطی نظاموں پر طریقہ لاگو کرتا ہے۔
  • توثیق سمیولیٹڈ کنٹرول کے لیے بیان ہوئی ہے، تجارتی مارکیٹ کی کارکردگی کے لیے نہیں۔

ٹیگز

مکمل متن
# 2301.00497


# Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control









Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔