Kết hợp các tác nhân học tăng cường sâu để giao dịch cổ phiếu
Tóm tắt
Bài nghiên cứu mô tả phương pháp giao dịch cổ phiếu tự động kết hợp ba thuật toán học tăng cường tác nhân-phê bình: Tối ưu hóa chính sách cận, Tác nhân-phê bình lợi thế và Gradient chính sách xác định sâu. Các tác nhân được huấn luyện để học quyết định giao dịch nhằm tối đa hóa lợi nhuận đầu tư, rồi kết hợp thế mạnh của chúng vào một mô hình tổ hợp được thiết kế để thích ứng với các điều kiện thị trường. Kỹ thuật tải theo yêu cầu cũng được dùng để xử lý dữ liệu lớn trong khi hạn chế mức dùng bộ nhớ khi huấn luyện với các hành động liên tục.
Phương pháp được đánh giá trên các cổ phiếu có thanh khoản cao trong phạm vi Dow Jones và so sánh với từng thuật toán học riêng lẻ, Chỉ số Bình quân Công nghiệp Dow Jones và một danh mục phương sai tối thiểu. Kết quả được báo cáo là mô hình tổ hợp đạt tỷ lệ Sharpe cao hơn các phương pháp riêng lẻ và chuẩn đối chiếu đó. Trích đoạn không nêu giai đoạn đánh giá, ràng buộc danh mục chi tiết, giả định chi phí giao dịch hay kiểm tra độ vững. Vì vậy, cần hiểu tuyên bố về hiệu suất trong phạm vi thiết lập kiểm định đã nêu của nghiên cứu, chứ không xem đó là bằng chứng về lợi nhuận tương lai.
Ý chính
- Chiến lược kết hợp các tác nhân-phê bình PPO, A2C và DDPG thành một mô hình tổ hợp.
- Các tác nhân học quyết định giao dịch cổ phiếu với mục tiêu là lợi nhuận đầu tư.
- Xử lý dữ liệu tải theo yêu cầu được dùng để giảm nhu cầu bộ nhớ trong lúc huấn luyện.
- Đánh giá so sánh mô hình tổ hợp với các phương pháp cấu thành, một chỉ số thị trường và danh mục phương sai tối thiểu.
- Mô hình tổ hợp được báo cáo là có tỷ lệ Sharpe cao nhất trong các so sánh đó, trong phạm vi thiết lập kiểm định của nghiên cứu.
Thẻ
Toàn văn
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy
Stock trading strategies play a critical role in investment. However, it is challenging to design a profitable strategy in a complex and dynamic stock market. In this paper, we propose an ensemble strategy that employs deep reinforcement schemes to learn a stock trading strategy by maximizing investment return. We train a deep reinforcement learning agent and obtain an ensemble trading strategy using three actor-critic based algorithms: Proximal Policy Optimization (PPO), Advantage Actor Critic (A2C), and Deep Deterministic Policy Gradient (DDPG). The ensemble strategy inherits and integrates the best features of the three algorithms, thereby robustly adjusting to different market situations. In order to avoid the large memory consumption in training networks with continuous action space, we employ a load-on-demand technique for processing very large data. We test our algorithms on the 30 Dow Jones stocks that have adequate liquidity. The performance of the trading agent with different reinforcement learning algorithms is evaluated and compared with both the Dow Jones Industrial Average index and the traditional min-variance portfolio allocation strategy. The proposed deep ensemble strategy is shown to outperform the three individual algorithms and two baselines in terms of the risk-adjusted return measured by the Sharpe ratio. This work is fully open-sourced at \href{https://github.com/AI4Finance-Foundation/Deep-Reinforcement-Learning-for-Automated-Stock-Trading-Ensemble-Strategy-ICAIF-2020}{GitHub}.Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.