Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Học tăng cường hồi quy có xét rủi ro cho giao dịch cặp

Bài viết arXiv papers · Tác giả: Weiguang Han et al.

Tóm tắt

Tài liệu này mô tả CREDIT, một phương pháp học tăng cường cho giao dịch cặp, sử dụng đơn vị hồi quy có cổng hai chiều và cơ chế chú ý theo thời gian. Kiến trúc này nhằm nắm bắt các mối quan hệ theo thời gian trong biến động giá của hai tài sản, bao gồm cả những mô hình có thể bị bỏ sót khi xét riêng từng trạng thái thị trường. Phương pháp cũng sử dụng phần thưởng tính đến cả lợi nhuận giao dịch lẫn rủi ro, nhằm hạn chế các giao dịch có tiềm năng lời và lỗ lớn.

Các tác giả trình bày phương pháp này như một giải pháp cho tình trạng giao dịch thường xuyên, chi phí giao dịch và chấp nhận rủi ro trong các phương pháp học tăng cường trước đó. Họ báo cáo rằng CREDIT vượt trội so với các phương pháp học tăng cường hiện có và thu được lợi nhuận đáng kể trong các thử nghiệm dùng dữ liệu cổ phiếu Mỹ trong năm năm. Phần trích dẫn không nêu chi tiết chuẩn so sánh, giả định chi phí, phép đo rủi ro hoặc kết quả bằng số, nên không thể đánh giá quy mô hay độ vững của lợi thế được báo cáo. Hiệu suất trên các thị trường hoặc giai đoạn khác chưa được xác lập ở đây.

Ý chính

  • CREDIT áp dụng học hồi quy và chú ý theo thời gian vào lịch sử giá để giao dịch cặp hai tài sản.
  • Phần thưởng tính đến cả lợi nhuận và rủi ro giao dịch.
  • Thiết kế hướng tới việc học các mô hình giá dài hạn hơn và giảm giao dịch quá mức.
  • Các thử nghiệm trên dữ liệu cổ phiếu Mỹ trong năm năm được báo cáo là vượt trội so với những phương pháp học tăng cường khác.
  • Phần trích dẫn không cung cấp đủ chi tiết để đánh giá độ vững hoặc chi phí giao dịch thực tế.

Thẻ

Toàn văn
# Mastering Pair Trading with Risk-Aware Recurrent Reinforcement Learning


# Mastering Pair Trading with Risk-Aware Recurrent Reinforcement Learning









Although pair trading is the simplest hedging strategy for an investor to eliminate market risk, it is still a great challenge for reinforcement learning (RL) methods to perform pair trading as human expertise. It requires RL methods to make thousands of correct actions that nevertheless have no obvious relations to the overall trading profit, and to reason over infinite states of the time-varying market most of which have never appeared in history. However, existing RL methods ignore the temporal connections between asset price movements and the risk of the performed trading. These lead to frequent tradings with high transaction costs and potential losses, which barely reach the human expertise level of trading. Therefore, we introduce CREDIT, a risk-aware agent capable of learning to exploit long-term trading opportunities in pair trading similar to a human expert. CREDIT is the first to apply bidirectional GRU along with the temporal attention mechanism to fully consider the temporal correlations embedded in the states, which allows CREDIT to capture long-term patterns of the price movements of two assets to earn higher profit. We also design the risk-aware reward inspired by the economic theory, that models both the profit and risk of the tradings during the trading period. It helps our agent to master pair trading with a robust trading preference that avoids risky trading with possible high returns and losses. Experiments show that it outperforms existing reinforcement learning methods in pair trading and achieves a significant profit over five years of U.S. stock data.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.