Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Học tăng cường sâu để thực thi lệnh giới hạn với tín hiệu dự báo

Bài viết arXiv papers · Tác giả: Peer Nagy et al.

Tóm tắt

Nghiên cứu dùng học tăng cường sâu để chuyển dự báo giao dịch ngắn hạn thành quyết định đặt lệnh giới hạn và quản lý tồn kho trong sổ lệnh giới hạn. Nghiên cứu huấn luyện một tác nhân trong môi trường cổ phiếu NASDAQ mô phỏng, được xây dựng từ thông điệp sổ lệnh lịch sử, bằng trình mô phỏng ABIDES. Tác nhân quan sát sổ lệnh hiện tại, lịch sử thị trường gần đây và tín hiệu định hướng, rồi học chính sách thực thi bằng Deep Double Duelling Q-learning và phát lại trải nghiệm bất đồng bộ có ưu tiên.

Để đánh giá khâu thực thi độc lập với một phương pháp dự báo cụ thể, các nhà nghiên cứu thử nghiệm tín hiệu alpha tổng hợp có các mức nhiễu khác nhau. Họ báo cáo rằng tác nhân đã học quản lý tồn kho và đặt lệnh hiệu quả, vượt trội hơn chiến lược heuristic khi được cung cấp cùng tín hiệu. So sánh này hỗ trợ phương pháp thực thi trong phạm vi trình mô phỏng được mô tả, nhưng tài liệu không cung cấp số liệu hiệu suất hay bằng chứng về kết quả trên thị trường thực. Vì vậy, chất lượng và mức độ chân thực của tín hiệu tổng hợp cùng môi trường mô phỏng hạn chế kết luận về việc triển khai.

Ý chính

  • Tác nhân học cách chuyển dự báo định hướng thành quyết định đặt lệnh giới hạn và quản lý tồn kho.
  • Quá trình huấn luyện sử dụng trình mô phỏng sổ lệnh giới hạn NASDAQ dựa trên thông điệp lịch sử.
  • Tác nhân quan sát trạng thái sổ lệnh, lịch sử gần đây và dự báo ngắn hạn.
  • Tín hiệu tổng hợp với mức nhiễu thay đổi giúp nhà nghiên cứu tập trung vào thực thi thay vì chất lượng dự báo.
  • Trong mô phỏng, chính sách đã học vượt trội hơn phương pháp heuristic dùng cùng tín hiệu, nhưng hiệu suất trên thị trường thực chưa được xác lập.

Thẻ

Toàn văn
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets


# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets









We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.