Apprentissage en ligne sans projection avec mémoire
Résumé
Cet article traite de l’optimisation convexe en ligne avec mémoire, où chaque perte dépend de la décision actuelle et des décisions antérieures. Cette dépendance peut modéliser des situations où les actions passées influencent les résultats présents. Les auteurs introduisent un algorithme d’apprentissage méta-base sans projection visant à minimiser le regret dynamique, qui mesure la performance par rapport à des séquences de décisions variables dans le temps. L’absence de projections vise à éviter un goulot d’étranglement informatique courant dans l’apprentissage en ligne.
La méthode combine Online Frank-Wolfe et Hedge. L’article l’applique au contrôle de systèmes linéaires variables dans le temps soumis à un bruit de processus imprévisible, en construisant un contrôleur avec mémoire dont le regret dynamique est borné par rapport à une politique optimale de rétroaction linéaire variable dans le temps. Des simulations sur des systèmes linéaires invariants dans le temps sont présentées comme validation. La description cite également l’arbitrage statistique et la prévision de séries temporelles comme applications motivantes, mais ne fournit pour ces domaines ni stratégie de trading, ni évaluation de marché, ni résultats numériques de performance. Les éléments présentés portent donc sur le contrôle simulé, et non sur des rendements de trading démontrés.
Idées clés
- L’apprentissage en ligne avec mémoire représente des pertes qui dépendent des décisions actuelles et passées.
- L’algorithme proposé évite les opérations de projection et vise à limiter le regret dynamique face à des décisions changeantes.
- La méthode combine Online Frank-Wolfe et Hedge.
- Un contrôleur applique la méthode à des systèmes linéaires soumis à un bruit de processus imprévisible.
- La validation porte sur le contrôle simulé, et non sur les performances de trading sur les marchés.
Étiquettes
Texte intégral
# 2301.00497 # Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.