Aprendizado online sem projeções, com memória e arrependimento dinâmico
Resumo
Este artigo trata da otimização convexa online com memória, na qual cada perda depende tanto da decisão atual quanto das decisões anteriores. Essa dependência pode modelar situações em que ações passadas influenciam resultados presentes. Os autores apresentam um algoritmo de aprendizado meta-base sem projeções, projetado para minimizar o arrependimento dinâmico, que mede o desempenho em relação a sequências de decisões variáveis no tempo. Evitar projeções busca resolver um gargalo computacional comum no aprendizado online.
O método combina Online Frank-Wolfe com Hedge. O artigo o aplica ao controle de sistemas lineares variáveis no tempo sujeitos a ruído de processo imprevisível, construindo um controlador com memória e arrependimento dinâmico limitado em relação a uma política ótima de realimentação linear variável no tempo. São relatadas simulações em sistemas lineares invariantes no tempo como validação. A descrição também aponta a arbitragem estatística e a previsão de séries temporais como aplicações motivadoras, mas não fornece estratégia de trading, avaliação de mercado nem resultados numéricos de desempenho nessas áreas. Portanto, as evidências apresentadas tratam de controle simulado, não de retornos de trading demonstrados.
Ideias principais
- O aprendizado online com memória representa perdas que dependem das decisões atuais e passadas.
- O algoritmo proposto evita operações de projeção e busca minimizar o arrependimento dinâmico em relação a decisões variáveis.
- O método combina Online Frank-Wolfe e Hedge.
- Um controlador aplica o método a sistemas lineares com ruído de processo imprevisível.
- A validação descrita trata de controle simulado, não do desempenho em mercados de trading.
Tags
Texto completo
# 2301.00497 # Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.