Học chính sách thanh lý cho thị trường có đấu giá đóng cửa
Tóm tắt
Nghiên cứu xem xét một nhà giao dịch bán qua sổ lệnh giới hạn rồi điều chỉnh lượng tồn kho còn lại bằng các lịch trình đặt lệnh có dấu trong phiên đấu giá đóng cửa. Hai giai đoạn được kết nối bằng dự báo giá khớp lệnh đấu giá và phản hồi trong phiên đấu giá. Các tác giả so sánh mạng Q sâu với các chính sách học tăng cường DDPG chiếu DDPG, TD3 và SAC trong thị trường mô phỏng, sử dụng giá rough Heston tổng hợp và đường đi của giá trung vị lịch sử.
Các chính sách được chọn và đánh giá bằng mức thiếu hụt thực hiện có phạt tồn kho, trong khi việc đánh giá được tách biệt với mục tiêu huấn luyện có trọng số. Trong các mô phỏng được báo cáo, những phương pháp học được có mức thiếu hụt sau phạt thấp hơn các chiến lược tham chiếu Avellaneda–Stoikov và TWAP. Các phép so sánh tổng hợp tương ứng cũng cho thấy quyền tiếp cận đấu giá giúp ích cho cả bốn phương pháp học. Phản hồi đấu giá dày hơn cải thiện quá trình học, còn giá trị quyết định bổ sung từ dự báo giá khớp lệnh thay đổi tùy phương pháp học. Những phát hiện này dựa trên mô phỏng; phần mô tả không chứng minh hiệu quả trong giao dịch thực hoặc khả năng khái quát sang điều kiện thị trường khác.
Ý chính
- Quy trình thanh lý kết hợp giao dịch liên tục bằng lệnh giới hạn với đấu giá đóng cửa.
- Lịch lệnh trong phiên đấu giá điều chỉnh lượng tồn kho còn lại sau giao dịch liên tục.
- Bốn phương pháp học tăng cường được so sánh bằng giá mô phỏng và đường đi của giá trung vị lịch sử.
- Các chính sách học được báo cáo có mức thiếu hụt sau phạt tồn kho thấp hơn các phương pháp tham chiếu Avellaneda–Stoikov và TWAP.
- Quyền tiếp cận đấu giá giúp ích cho mỗi phương pháp học trong các phép so sánh tổng hợp tương ứng, còn giá trị dự báo tùy thuộc vào phương pháp học.
Thẻ
Toàn văn
# Learning Optimal Liquidation with Closing Auctions # Learning Optimal Liquidation with Closing Auctions We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.