Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Học tăng cường sâu cho giao dịch cặp tiền mã hóa linh hoạt

Bài viết arXiv papers · Tác giả: Damian Lebiedź et al.

Tóm tắt

Nghiên cứu kiểm định học tăng cường sâu như một lớp thực thi bổ trợ cho giao dịch cặp trên thị trường tiền mã hóa biến động mạnh. Khuôn khổ trước tiên lọc và xếp hạng các cặp tiềm năng, sau đó dùng tác nhân Tối ưu hóa Chính sách Gần nhất với lớp Bộ nhớ Dài-Ngắn hạn để đưa ra quyết định thực thi. Thiết kế rủi ro cố định, trung bình thích ứng và các biện pháp kiểm soát rủi ro tất định giới hạn tác nhân, nhằm giảm rủi ro phân kỳ. Đánh giá sử dụng dữ liệu hợp đồng tương lai Binance USD-M theo giờ và so sánh chính sách học được với chuẩn cơ sở dựa trên heuristic.

Kết quả ngoài mẫu được báo cáo nghiêng về chính sách học tăng cường; bootstrap khối vòng dừng cho thấy hiệu suất vượt trội đã điều chỉnh theo rủi ro có ý nghĩa thống kê ở mức 10 phần trăm. Kết quả không đạt ngưỡng ý nghĩa nghiêm ngặt hơn là 5 phần trăm, điều mà nghiên cứu liên hệ với phương sai đặc thù cao của tài sản số. Bằng chứng chỉ áp dụng cho dữ liệu và thiết lập đã kiểm định; mô tả không nêu mức hiệu suất, giả định về chi phí giao dịch hoặc kiểm định trên sàn và giai đoạn khác. Thiết kế lai cung cấp cách giới hạn quyết định thực thi do mô hình học được, nhưng khả năng vững chắc rộng hơn vẫn là câu hỏi bỏ ngỏ.

Ý chính

  • Hệ thống đề xuất kết hợp lựa chọn cặp bằng phương pháp thống kê với một lớp thực thi được học.
  • Tác nhân PPO cùng với LSTM đưa ra quyết định thực thi trong các giới hạn rủi ro tất định.
  • Nghiên cứu đánh giá phương pháp trên dữ liệu hợp đồng tương lai Binance USD-M theo giờ và so sánh với chuẩn cơ sở heuristic.
  • Hiệu suất vượt trội đã điều chỉnh theo rủi ro được báo cáo có ý nghĩa ở mức 10 phần trăm nhưng không ở mức 5 phần trăm.
  • Kết quả chỉ áp dụng cho thị trường, dữ liệu và cấu hình chiến lược đã kiểm định.

Thẻ

Toàn văn
# Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning


# Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning









This study aims to determine whether the application of Deep Reinforcement Learning (DRL) as a specialized execution overlay can enhance pair trading in highly volatile cryptocurrency markets. Although classical implementations of the strategy have proven successful in traditional equities, they frequently exhibit rigidity and suffer from severe divergence risks when applied to high-variance environments. To address this need, this research introduces novel concepts. To construct a robust system, we developed a hierarchical "Filter-then-Rank" pair selection methodology and a proprietary "Fixed Risk, Adaptive Mean" execution model. The system employs a Proximal Policy Optimization (PPO) agent with a Long Short-Term Memory (LSTM) layer to govern execution decisions within strict deterministic risk management boundaries. Evaluated on 1-hour interval data from the Binance USD-M Futures market, the optimized RL policy achieved an out-of-sample performance that substantially outperformed the heuristic baseline. A stationary circular block bootstrap robustness check confirms that the agent's risk-adjusted outperformance is statistically significant at the 10 percent level. Although falling marginally short of the stricter 5 percent threshold, this result highlights the extreme idiosyncratic variance characteristic of digital assets. Ultimately, this thesis contributes to the quantitative finance literature by introducing a hybrid architecture that combines statistical arbitrage with DRL execution policies. Furthermore, it delivers a novel framework for safe reinforcement learning via deterministic shielding, proving that anchoring a neural policy to statistically robust boundaries successfully mitigates severe divergence risks.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.