Học tăng cường khám phá cho giao dịch đầu cơ và giao dịch cặp
Tóm tắt
Nghiên cứu mô hình hóa giao dịch đầu cơ thành bài toán dừng tối ưu tuần tự, trong đó chọn thời điểm vào và thoát lệnh theo các hàm tiện ích và quá trình giá tổng quát. Trước tiên, nghiên cứu nới lỏng bài toán dừng bằng cách biểu diễn sự kiện vào và thoát lệnh thành các bước nhảy của quá trình Cox, trong đó tác nhân lựa chọn các biến kiểm soát cường độ bị chặn.
Trong cách xây dựng học tăng cường khám phá, các chính sách ngẫu nhiên đặt phân phối xác suất lên những cường độ này, còn entropy vi phân Shannon điều chỉnh hàm mục tiêu. Các phương trình Hamilton-Jacobi-Bellman khám phá thu được cho ra chính sách tối ưu dạng Gibbs. Các tác giả xác lập ước lượng sai số và sự hội tụ của mục tiêu học đến hàm giá trị của bài toán ban đầu, sau đó trình diễn một thuật toán trong ứng dụng giao dịch cặp. Mô tả được cung cấp không nêu dữ liệu hay kết quả hiệu suất của ứng dụng đó, và sự hội tụ được nêu liên quan đến mục tiêu mô hình hóa chứ không phải kết quả giao dịch thực đã được chứng minh.
Ý chính
- Giao dịch đầu cơ được mô hình hóa thành bài toán dừng tối ưu theo thời điểm vào và thoát lệnh.
- Cách xây dựng nới lỏng biểu diễn sự kiện dừng bằng các bước nhảy của quá trình Cox được kiểm soát qua cường độ bị chặn.
- Chính sách cường độ ngẫu nhiên được điều chỉnh bằng entropy vi phân Shannon.
- Khuôn khổ suy ra các phương trình HJB và chính sách tối ưu dạng Gibbs.
- Công trình xác lập kết quả về sai số và hội tụ, đồng thời trình diễn thuật toán cho giao dịch cặp.
Thẻ
Toàn văn
# Reinforcement Learning for Speculative Trading under Exploratory Framework # Reinforcement Learning for Speculative Trading under Exploratory Framework We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.