Mục tiêu rủi ro lồi trong học tăng cường cho giao dịch
Tóm tắt
Bài nghiên cứu trình bày một khuôn khổ học tăng cường cho các bài toán ra quyết định có mục tiêu rủi ro được biểu diễn qua hàm chấm điểm lồi. Khuôn khổ có thể biểu diễn các thước đo như phương sai, Expected Shortfall và Value-at-Risk entropy, cũng như tiện ích lợi nhuận–rủi ro. Trọng tâm là giúp các mục tiêu này có thể áp dụng theo thời gian, trong bối cảnh tối ưu hóa rủi ro có thể gây ra tính bất nhất theo thời gian: một chính sách được ưu tiên trước đó có thể không còn được ưu tiên ở thời điểm ra quyết định sau.
Để xử lý vấn đề này, các tác giả bổ sung một biến phụ trợ vào trạng thái và tái cấu trúc bài toán thành một bài toán tối ưu hóa hai trạng thái. Họ mô tả thuật toán Actor-Critic được điều chỉnh riêng, các bảo đảm xấp xỉ lý thuyết không đòi hỏi quá trình quyết định Markov liên tục, và quy trình lấy mẫu biến phụ trợ lấy cảm hứng từ tối thiểu hóa luân phiên. Bài nghiên cứu báo cáo các thử nghiệm mô phỏng, bao gồm một ứng dụng giao dịch chênh lệch thống kê, làm bằng chứng về hiệu quả của phương pháp. Phần mô tả hiện có không đưa ra kết quả bằng số hay thiết lập thử nghiệm chi tiết; tính hội tụ của phương pháp lấy mẫu phụ thuộc vào các giả định đã nêu, nên chưa rõ hiệu suất thực tế ngoài các mô phỏng được thử nghiệm.
Ý chính
- Hàm chấm điểm lồi có thể biểu diễn một số thước đo rủi ro quen thuộc trong mục tiêu học tăng cường.
- Bổ sung biến phụ trợ vào trạng thái giúp xử lý tính bất nhất theo thời gian trong quyết định nhạy cảm với rủi ro.
- Phương pháp Actor-Critic được đề xuất có bảo đảm xấp xỉ không đòi hỏi quá trình trạng thái liên tục.
- Phương pháp lấy mẫu lấy cảm hứng từ tối thiểu hóa luân phiên được báo cáo là hội tụ trong một số điều kiện nhất định.
- Các thử nghiệm mô phỏng bao gồm ứng dụng giao dịch chênh lệch thống kê.
Thẻ
Toàn văn
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions # Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.