Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Học tăng cường PPO cho giao dịch cổ phiếu tần suất cao chủ động

Bài viết arXiv papers · Tác giả: Antonio Briola et al.

Tóm tắt

Tài liệu mô tả phương pháp học tăng cường sâu từ đầu đến cuối cho giao dịch cổ phiếu tần suất cao chủ động. Các tác nhân dùng phương pháp tối ưu hóa chính sách lân cận để giao dịch một đơn vị cổ phiếu Intel, với trạng thái được xây dựng từ các tập đặc trưng sổ lệnh giới hạn khác nhau. Dữ liệu huấn luyện được chọn khi giá biến động lớn nhằm tăng tỷ lệ tín hiệu trên nhiễu; một tháng liên tiếp được dành cho xác thực, sau đó là một tháng riêng để kiểm thử. Siêu tham số được tinh chỉnh bằng tối ưu hóa tuần tự dựa trên mô hình.

Các tác giả báo cáo rằng tác nhân tìm thấy các mẫu lặp lại trong sổ lệnh và tạo ra lợi nhuận dương ổn định trong giai đoạn kiểm thử dù điều kiện biến động và nhiều nhiễu. Đây là bằng chứng từ thí nghiệm có phạm vi hẹp trên một cổ phiếu trong một chuỗi tháng ngắn. Mô tả không có thống kê lợi nhuận, chi phí giao dịch, so sánh chuẩn hay bằng chứng rằng hành vi đã học duy trì được ở giai đoạn, tài sản khác và khi khớp lệnh thực. Việc chọn mẫu huấn luyện theo biến động giá cũng có thể định hình điều tác nhân học được, vì vậy không nên xem kết quả báo cáo là bằng chứng rộng về khả năng sinh lời.

Ý chính

  • Các tác nhân dùng phương pháp tối ưu hóa chính sách lân cận để giao dịch một đơn vị của một cổ phiếu.
  • Biểu diễn trạng thái của chúng khác nhau ở các đặc trưng sổ lệnh giới hạn được đưa vào.
  • Huấn luyện tập trung vào mẫu có biến động giá lớn, với các giai đoạn xác thực và kiểm thử riêng.
  • Siêu tham số được tinh chỉnh bằng tối ưu hóa tuần tự dựa trên mô hình.
  • Nghiên cứu báo cáo lợi nhuận dương trong giai đoạn kiểm thử, nhưng chưa xác lập khả năng khái quát rộng hơn hay chi phí khớp lệnh.

Thẻ

Toàn văn
# Deep Reinforcement Learning for Active High Frequency Trading


# Deep Reinforcement Learning for Active High Frequency Trading









We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.