Перейти к содержимому
Все документы библиотеки

Онлайн-обучение с памятью без проекций и динамическим сожалением

Статья arXiv papers · Автор: Hongyu Zhou et al.

Сводка

В статье рассматривается онлайн-выпуклая оптимизация с памятью, где каждая функция потерь зависит как от текущего решения, так и от предыдущих решений. Такая зависимость может моделировать ситуации, в которых прошлые действия влияют на текущие результаты. Авторы предлагают алгоритм мета-базового обучения без проекций, предназначенный для минимизации динамического сожаления, то есть для оценки качества на фоне меняющихся во времени последовательностей решений. Отказ от проекций нацелен на устранение распространённого вычислительного узкого места онлайн-обучения.

Метод сочетает Online Frank-Wolfe и Hedge. В статье он применяется для управления линейными нестационарными системами с непредсказуемым шумом процесса: строится контроллер с памятью и ограниченным динамическим сожалением относительно оптимальной нестационарной политики линейной обратной связи. В качестве проверки приводятся симуляции линейных стационарных систем. В описании статистический арбитраж и прогнозирование временных рядов также названы мотивирующими областями применения, но торговая стратегия, оценка на рыночных данных или численные результаты для этих областей не представлены. Таким образом, приведённые свидетельства относятся к симулированному управлению, а не к доказанной доходности торговли.

Ключевые идеи

  • Онлайн-обучение с памятью учитывает функции потерь, зависящие от текущих и прошлых решений.
  • Предложенный алгоритм избегает операций проецирования и нацелен на минимизацию динамического сожаления относительно меняющихся решений.
  • Метод сочетает Online Frank-Wolfe и Hedge.
  • Контроллер применяет этот метод к линейным системам с непредсказуемым шумом процесса.
  • Описана проверка на симуляциях для управления, а не оценка результатов на торговых рынках.

Теги

Полный текст
# 2301.00497


# Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control









Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.