Gradient chính sách xác định sâu cho tối ưu hóa danh mục
Tóm tắt
Nghiên cứu kiểm tra liệu học tăng cường sâu có thể tìm lại các chiến lược giao dịch tối ưu trong những môi trường dễ mô tả nhưng khó về mặt toán học hay không. Các tác giả tập trung vào gradient chính sách xác định sâu, một phương pháp học chính sách chọn hành động thông qua tương tác với môi trường. Họ chọn các bối cảnh đã biết chiến lược tối ưu hoặc phương án gần đúng, nhờ đó có thể so sánh hành vi đã học và phần thưởng với nghiệm tham chiếu.
Kết quả được báo cáo là tác nhân tìm lại các đặc điểm cốt yếu của chiến lược đã biết và đạt phần thưởng gần tối ưu. Điều này cung cấp bằng chứng cho thấy thuật toán có thể hoạt động như một bộ giải trong các môi trường được kiểm thử. Phần trích dẫn không xác định mô hình thị trường cụ thể, ràng buộc danh mục, quy trình huấn luyện hay thước đo đánh giá. Vì vậy, kết luận chỉ giới hạn ở các bối cảnh có kiểm soát đã chọn và không chứng minh hiệu suất trong thị trường thực nhiễu động, khi có chi phí giao dịch hoặc khi chưa biết chính sách tối ưu.
Ý chính
- Nghiên cứu đánh giá học tăng cường sâu như một bộ giải cho chiến lược giao dịch.
- Nghiên cứu dùng gradient chính sách xác định sâu trong các môi trường đơn giản về khái niệm nhưng phức tạp về toán học.
- Các môi trường được kiểm thử có chiến lược tối ưu đã biết hoặc gần như đã biết để đối chiếu.
- Tác nhân được báo cáo là tìm lại các đặc điểm chiến lược chính và đạt phần thưởng gần tối ưu.
- Phần trích dẫn không chứng minh hiệu suất khi có ma sát thị trường thực hoặc khi chưa biết chính sách tối ưu.
Thẻ
Toàn văn
# Deep Deterministic Portfolio Optimization # Deep Deterministic Portfolio Optimization Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.