Aprendizaje online sin proyecciones, con memoria y arrepentimiento dinámico
Resumen
Este artículo aborda la optimización convexa online con memoria, donde cada pérdida depende tanto de la decisión actual como de decisiones anteriores. Esta dependencia puede modelar situaciones en las que las acciones pasadas influyen en los resultados presentes. Los autores presentan un algoritmo de aprendizaje meta-base sin proyecciones, diseñado para minimizar el arrepentimiento dinámico, que mide el rendimiento frente a secuencias de decisiones variables en el tiempo. Evitar las proyecciones busca resolver un cuello de botella computacional habitual en el aprendizaje online.
El método combina Online Frank-Wolfe con Hedge. El artículo lo aplica al control de sistemas lineales variables en el tiempo sujetos a ruido de proceso imprevisible y construye un controlador con memoria cuyo arrepentimiento dinámico está acotado con respecto a una política óptima de retroalimentación lineal variable en el tiempo. Se presentan simulaciones en sistemas lineales invariantes en el tiempo como validación. La descripción también identifica el arbitraje estadístico y la predicción de series temporales como aplicaciones motivadoras, pero no ofrece una estrategia de trading, una evaluación de mercado ni resultados numéricos de rendimiento para esos ámbitos. Por tanto, la evidencia presentada se refiere al control simulado, no a rendimientos de trading demostrados.
Ideas clave
- El aprendizaje online con memoria representa pérdidas que dependen de decisiones actuales y pasadas.
- El algoritmo propuesto evita las operaciones de proyección y busca reducir el arrepentimiento dinámico frente a decisiones cambiantes.
- El método combina Online Frank-Wolfe y Hedge.
- Un controlador aplica el método a sistemas lineales con ruido de proceso imprevisible.
- La validación descrita corresponde al control simulado, no al rendimiento en mercados de trading.
Etiquetas
Texto completo
# 2301.00497 # Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.