Học tăng cường bằng gradient chính sách với thước đo rủi ro lồi động
Tóm tắt
Tài liệu trình bày một phương pháp học tăng cường không dựa trên mô hình để tối ưu hóa tuần tự khi kết quả được đánh giá bằng các thước đo rủi ro lồi động. Phương pháp sử dụng nguyên lý quy hoạch động nhất quán theo thời gian để định giá các chính sách, sau đó suy ra các bước cập nhật gradient chính sách nhằm tìm ra chính sách tốt hơn. Phương pháp tác tử-phê bình dùng mạng nơ-ron được đề xuất để tối ưu hóa các chính sách đó.
Phương pháp được minh họa trên ba nhiệm vụ: giao dịch chênh lệch giá thống kê, phòng hộ tài chính và điều khiển robot tránh chướng ngại vật. Điều này cho thấy khung được áp dụng trong cả bối cảnh tài chính lẫn phi tài chính, nhưng mô tả không cung cấp số liệu hiệu suất, phương pháp so sánh, giả định thị trường hay chi tiết triển khai. Vì vậy, tài liệu trình bày cấu trúc tối ưu hóa và phạm vi ứng dụng, nhưng không nêu bằng chứng về hiệu quả giao dịch hay các hạn chế thực tiễn.
Ý chính
- Các thước đo rủi ro lồi động cung cấp cách đánh giá chuỗi kết quả bất định.
- Quy hoạch động nhất quán theo thời gian được dùng để định giá các chính sách ứng viên.
- Các quy tắc gradient chính sách và phương pháp tác tử-phê bình dùng mạng nơ-ron hỗ trợ tối ưu hóa chính sách.
- Các minh họa gồm giao dịch chênh lệch giá thống kê, phòng hộ tài chính và giúp robot tránh chướng ngại vật.
- Mô tả hiện có không cung cấp kết quả so sánh hay giả định triển khai trên thị trường.
Thẻ
Toàn văn
# Reinforcement Learning with Dynamic Convex Risk Measures # Reinforcement Learning with Dynamic Convex Risk Measures We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.