Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Học trực tuyến không phép chiếu với bộ nhớ và hối tiếc động

Bài viết arXiv papers · Tác giả: Hongyu Zhou et al.

Tóm tắt

Bài nghiên cứu đề cập đến tối ưu hóa lồi trực tuyến có bộ nhớ, trong đó mỗi hàm mất mát phụ thuộc vào cả quyết định hiện tại lẫn các quyết định trước đó. Sự phụ thuộc này có thể mô hình hóa những bối cảnh mà hành động trong quá khứ ảnh hưởng đến kết quả hiện tại. Các tác giả giới thiệu một thuật toán học siêu cơ sở không cần phép chiếu, được thiết kế để giảm thiểu hối tiếc động, tức thước đo hiệu suất so với các chuỗi quyết định biến thiên theo thời gian. Việc tránh phép chiếu nhắm đến một nút thắt tính toán phổ biến trong học trực tuyến.

Phương pháp kết hợp Online Frank-Wolfe với Hedge. Bài nghiên cứu áp dụng phương pháp này để điều khiển các hệ thống tuyến tính biến thiên theo thời gian chịu nhiễu quá trình khó dự đoán, xây dựng bộ điều khiển có bộ nhớ và hối tiếc động bị chặn so với chính sách phản hồi tuyến tính biến thiên theo thời gian tối ưu. Bài báo cáo các mô phỏng trên hệ thống tuyến tính bất biến theo thời gian để xác nhận phương pháp. Mô tả cũng nêu chênh lệch thống kê và dự báo chuỗi thời gian là những ứng dụng tạo động lực, nhưng không đưa ra chiến lược giao dịch, đánh giá thị trường hay kết quả hiệu suất định lượng cho các lĩnh vực này. Vì vậy, bằng chứng được trình bày ở đây liên quan đến điều khiển mô phỏng chứ không phải lợi nhuận giao dịch đã được chứng minh.

Ý chính

  • Học trực tuyến có bộ nhớ biểu diễn các hàm mất mát phụ thuộc vào quyết định hiện tại và quá khứ.
  • Thuật toán đề xuất tránh các phép chiếu và nhắm đến hối tiếc động so với các quyết định biến thiên.
  • Phương pháp kết hợp Online Frank-Wolfe và Hedge.
  • Một bộ điều khiển áp dụng phương pháp cho các hệ thống tuyến tính có nhiễu quá trình khó dự đoán.
  • Phần xác nhận được mô tả là dành cho điều khiển mô phỏng, không phải hiệu suất trên thị trường giao dịch.

Thẻ

Toàn văn
# 2301.00497


# Efficient Online Learning with Memory via Frank-Wolfe Optimization: Algorithms with Bounded Dynamic Regret and Applications to Control









Projection operations are a typical computation bottleneck in online learning. In this paper, we enable projection-free online learning within the framework of Online Convex Optimization with Memory (OCO-M) -- OCO-M captures how the history of decisions affects the current outcome by allowing the online learning loss functions to depend on both current and past decisions. Particularly, we introduce the first projection-free meta-base learning algorithm with memory that minimizes dynamic regret, i.e., that minimizes the suboptimality against any sequence of time-varying decisions. We are motivated by artificial intelligence applications where autonomous agents need to adapt to time-varying environments in real-time, accounting for how past decisions affect the present. Examples of such applications are: online control of dynamical systems; statistical arbitrage; and time series prediction. The algorithm builds on the Online Frank-Wolfe (OFW) and Hedge algorithms. We demonstrate how our algorithm can be applied to the online control of linear time-varying systems in the presence of unpredictable process noise. To this end, we develop a controller with memory and bounded dynamic regret against any optimal time-varying linear feedback control policy. We validate our algorithm in simulated scenarios of online control of linear time-invariant systems.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.