Khám phá bằng entropy Tsallis để điều khiển với các nhân tố ẩn
Tóm tắt
Nghiên cứu này khảo sát kiểm soát tối ưu khi mô hình có các nhân tố ẩn và người ra quyết định chọn một phân phối trên các hành động thay vì trực tiếp chọn một hành động duy nhất. Nghiên cứu đưa entropy Tsallis vào làm phần thưởng cho việc khám phá không gian trạng thái, trong cả thiết lập thời gian rời rạc và liên tục. Các tác giả suy ra phân phối trạng thái tối ưu có dạng q-Gaussian và xác định vị trí của nó bằng các phương trình xuôi-ngược tương ứng với từng thiết lập.
Bài báo cũng xem xét mối liên hệ giữa các nghiệm khám phá thu được và kiểm soát tối ưu động tiêu chuẩn. Với cách tiếp cận không phụ thuộc mô hình, bài báo phát triển chính sách tối ưu theo ý tưởng chung của học Q mềm. Phương pháp được trình bày là có thể hữu ích để xây dựng chiến lược kinh doanh chênh lệch thống kê vững chắc hơn, chứ không phải bằng chứng rằng một hệ thống giao dịch cụ thể đã được kiểm định hoặc cải thiện. Mô tả được cung cấp nêu kết quả lý thuyết và hướng ứng dụng, nhưng không có dữ liệu thị trường, hiệu suất giao dịch hay chi tiết triển khai thực tế. Mức độ liên quan đến giao dịch vì thế phụ thuộc vào cách chuyển khung kiểm soát thành chiến lược và đánh giá bằng thực nghiệm.
Ý chính
- Khung này kiểm soát phân phối trên các hành động trong mô hình có nhân tố ẩn.
- Entropy Tsallis khuyến khích khám phá không gian trạng thái trong thời gian rời rạc và liên tục.
- Phân phối trạng thái tối ưu được suy ra có dạng q-Gaussian.
- Phân tích liên hệ các nghiệm có tính đến khám phá với kiểm soát tối ưu động tiêu chuẩn.
- Chính sách không phụ thuộc mô hình được phát triển theo hướng học Q mềm và có thể gợi mở nghiên cứu kinh doanh chênh lệch thống kê.
Thẻ
Toàn văn
# Exploratory Control with Tsallis Entropy for Latent Factor Models # Exploratory Control with Tsallis Entropy for Latent Factor Models We study optimal control in models with latent factors where the agent controls the distribution over actions, rather than actions themselves, in both discrete and continuous time. To encourage exploration of the state space, we reward exploration with Tsallis Entropy and derive the optimal distribution over states - which we prove is $q$-Gaussian distributed with location characterized through the solution of an FBS$Δ$E and FBSDE in discrete and continuous time, respectively. We discuss the relation between the solutions of the optimal exploration problems and the standard dynamic optimal control solution. Finally, we develop the optimal policy in a model-agnostic setting along the lines of soft $Q$-learning. The approach may be applied in, e.g., developing more robust statistical arbitrage trading strategies.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.