So sánh DQN và PPO trong học tăng cường cho giao dịch forex
Tóm tắt
Nghiên cứu áp dụng học tăng cường sâu vào giao dịch ngoại hối, xem việc lựa chọn giao dịch là một chuỗi quyết định thay vì dựa vào dự báo giá trực tiếp. Nghiên cứu điều chỉnh chính sách kinh doanh chênh lệch thống kê Sure-Fire thành ba hành động khả thi và chuyển lịch sử giá liên tục thành ảnh Gramian Angular Field. Các tác giả so sánh Deep Q Learning với Proximal Policy Optimization bằng dữ liệu EUR/USD, GBP/USD và AUD/USD theo khoảng thời gian bốn giờ.
Huấn luyện sử dụng dữ liệu từ ngày 1 tháng 8 đến ngày 30 tháng 11 năm 2018, còn giai đoạn kiểm thử là tháng 12 2018. Các tác giả báo cáo hiệu quả đầu tư thuận lợi ở những mô hình có thể biểu diễn hành vi thị trường phức tạp, ngẫu nhiên và các trạng thái mô tả đầy đủ môi trường giao dịch. Mô tả được cung cấp không nêu con số lợi nhuận, thước đo rủi ro, giả định về phí hoặc thiết lập mô hình chi tiết, nên không thể đánh giá mức độ mạnh và khả năng so sánh của kết quả tại đây. Bằng chứng là một thử nghiệm tính khả thi trên ba cặp tiền tệ với phân chia lịch sử ngắn; nghiên cứu không chứng minh thuật toán nào sẽ hoạt động đáng tin cậy trong giai đoạn khác hoặc khi thực thi giao dịch thực.
Ý chính
- Phương pháp xem giao dịch forex là bài toán quyết định tuần tự sử dụng học tăng cường.
- Ba hành động giao dịch được xác định trong chính sách kinh doanh chênh lệch thống kê đã điều chỉnh.
- Các cửa sổ giá được mã hóa thành ảnh Gramian Angular Field làm đầu vào cho mô hình.
- Deep Q Learning và Proximal Policy Optimization được so sánh trên ba cặp tiền tệ.
- Đánh giá lịch sử ngắn báo cáo hiệu quả thuận lợi nhưng không nêu thước đo chi tiết và giả định chi phí giao dịch.
Thẻ
Toàn văn
# Deep Reinforcement Learning for Foreign Exchange Trading # Deep Reinforcement Learning for Foreign Exchange Trading Reinforcement learning can interact with the environment and is suitable for applications in decision control systems. Therefore, we used the reinforcement learning method to establish a foreign exchange transaction, avoiding the long-standing problem of unstable trends in deep learning predictions. In the system design, we optimized the Sure-Fire statistical arbitrage policy, set three different actions, encoded the continuous price over a period of time into a heat-map view of the Gramian Angular Field (GAF) and compared the Deep Q Learning (DQN) and Proximal Policy Optimization (PPO) algorithms. To test feasibility, we analyzed three currency pairs, namely EUR/USD, GBP/USD, and AUD/USD. We trained the data in units of four hours from 1 August 2018 to 30 November 2018 and tested model performance using data between 1 December 2018 and 31 December 2018. The test results of the various models indicated that favorable investment performance was achieved as long as the model was able to handle complex and random processes and the state was able to describe the environment, validating the feasibility of reinforcement learning in the development of trading strategies.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.