Học sâu Q-learning cho giao dịch danh mục nhiều tài sản
Tóm tắt
Nghiên cứu mô hình hóa giao dịch danh mục thành một quá trình quyết định Markov và huấn luyện tác nhân bằng học sâu Q-learning để chọn phân bổ trên nhiều tài sản. Không gian hành động rời rạc và tổ hợp: với mỗi tài sản, tác nhân chọn hướng giao dịch ở quy mô định trước. Để xử lý các hành động vi phạm ràng buộc, phương pháp ánh xạ đề xuất không khả thi sang phương án khả thi gần nhất. Nghiên cứu cũng mô tả thiết kế tác nhân và mạng Q nhằm quản lý không gian hành động nhiều tài sản, đồng thời mô phỏng các hành động khả thi ở mỗi trạng thái.
Phương pháp được đánh giá bằng backtest trên hai danh mục đại diện, với kết quả được báo cáo là vượt các chiến lược chuẩn. Tài liệu không xác định danh mục, chuẩn so sánh, kỳ đánh giá hay giả định về chi phí giao dịch, nên chỉ từ phần mô tả chưa thể nhận định phạm vi của kết quả so sánh hoặc mức độ liên quan đến giao dịch thực.
Ý chính
- Quá trình ra quyết định danh mục được mô hình hóa thành quá trình quyết định Markov và huấn luyện bằng học sâu Q-learning.
- Tác nhân chọn hướng và quy mô giao dịch định trước ở dạng rời rạc cho từng tài sản.
- Một bước ánh xạ chuyển các hành động đề xuất không khả thi thành hành động khả thi gần nhất.
- Backtest trên hai danh mục được báo cáo là vượt chiến lược chuẩn, nhưng không có chi tiết đánh giá.
Thẻ
Toàn văn
# An intelligent financial portfolio trading strategy using deep Q-learning # An intelligent financial portfolio trading strategy using deep Q-learning Portfolio traders strive to identify dynamic portfolio allocation schemes so that their total budgets are efficiently allocated through the investment horizon. This study proposes a novel portfolio trading strategy in which an intelligent agent is trained to identify an optimal trading action by using deep Q-learning. We formulate a Markov decision process model for the portfolio trading process, and the model adopts a discrete combinatorial action space, determining the trading direction at prespecified trading size for each asset, to ensure practical applicability. Our novel portfolio trading strategy takes advantage of three features to outperform in real-world trading. First, a mapping function is devised to handle and transform an initially found but infeasible action into a feasible action closest to the originally proposed ideal action. Second, by overcoming the dimensionality problem, this study establishes models of agent and Q-network for deriving a multi-asset trading strategy in the predefined action space. Last, this study introduces a technique that has the advantage of deriving a well-fitted multi-asset trading strategy by designing an agent to simulate all feasible actions in each state. To validate our approach, we conduct backtests for two representative portfolios and demonstrate superior results over the benchmark strategies.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.