Zum Inhalt springen
Alle Bibliotheksdokumente

Projektionsfreies Online-Lernen mit Gedächtnis und dynamischem Regret

Artikel arXiv papers · Autor: Hongyu Zhou et al.

Zusammenfassung

Dieses Paper behandelt Online-Konvexoptimierung mit Gedächtnis, bei der jeder Verlust sowohl von der aktuellen als auch von früheren Entscheidungen abhängt. Eine solche Abhängigkeit kann Situationen modellieren, in denen vergangene Aktionen aktuelle Ergebnisse beeinflussen. Die Autoren führen einen projektionsfreien Meta-Basis-Lernalgorithmus ein, der dynamisches Regret minimieren soll, also die Leistung im Vergleich zu wechselnden, zeitvariablen Entscheidungsfolgen misst. Der Verzicht auf Projektionen zielt auf einen häufigen Rechenengpass beim Online-Lernen.

Das Verfahren kombiniert Online Frank-Wolfe mit Hedge. Das Paper wendet es auf die Steuerung linearer zeitvariabler Systeme mit unvorhersehbarem Prozessrauschen an und entwickelt einen Regler mit Gedächtnis und begrenztem dynamischem Regret gegenüber einer optimalen zeitvariablen linearen Feedbackstrategie. Simulationen linearer zeitinvarianter Systeme dienen laut Bericht der Validierung. Die Beschreibung nennt statistische Arbitrage und Zeitreihenprognosen als mögliche Anwendungsgebiete, enthält dafür aber weder eine Handelsstrategie noch Marktevaluationen oder numerische Leistungsergebnisse. Die vorgelegten Belege betreffen daher simulierte Steuerung und keine nachgewiesenen Trading-Renditen.

Kernaussagen

  • Online-Lernen mit Gedächtnis modelliert Verluste, die von aktuellen und früheren Entscheidungen abhängen.
  • Der vorgeschlagene Algorithmus vermeidet Projektionsschritte und zielt auf dynamisches Regret gegenüber wechselnden Entscheidungen.
  • Das Verfahren kombiniert Online Frank-Wolfe und Hedge.
  • Ein Regler wendet das Verfahren auf lineare Systeme mit unvorhersehbarem Prozessrauschen an.
  • Beschrieben wird eine Validierung anhand simulierter Steuerung, nicht anhand der Leistung an Trading-Märkten.

Schlagwörter

Volltext
# 2301.00497


# Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control









Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.