Mô hình chuyên gia hỗn hợp cho khớp lệnh tiền mã hóa: độ ổn định và rủi ro đuôi
Tóm tắt
Nghiên cứu so sánh Double Deep Q-Learning với mô hình chuyên gia hỗn hợp được phân vùng bằng K-means và mạng dày có số tham số tương đương để thực hiện lệnh BTC/USDT. Đánh giá dùng dữ liệu sổ lệnh giới hạn Binance tổng hợp trung bình theo khoảng năm phút, tập trung vào thiếu hụt thực thi, biến thiên theo hạt giống huấn luyện, sụp đổ chính sách và rủi ro đuôi trong chính sách. Kết quả được so sánh với các chuẩn giá trung bình theo thời gian và thanh lý ngay trong môi trường phát lại, nơi thanh lý sớm gần như không tốn chi phí do thiết kế phần thưởng và khoản phạt đã nêu.
Không cấu hình đã học nào cải thiện đáng kể mức thiếu hụt trung bình so với mô hình học cơ sở; trong đặc tả này, mỗi cấu hình đều có mức thiếu hụt trung bình cao hơn cả hai chuẩn đơn giản. Phân tích lặp hạt giống và loại bỏ thành phần cho thấy việc ngăn sụp đổ gắn với thăm dò giảm dần, chứ không phải lợi ích nội tại của mô hình chuyên gia hỗn hợp; kết hợp các thay đổi về thăm dò và phần thưởng có thể khiến sụp đổ quay trở lại. Cấu hình có nhiều chuyên gia nhất cho thấy độ phân tán giữa các hạt giống thấp nhất, nhưng kết quả này không vững sau điều chỉnh so sánh nhiều lần, trong khi rủi ro đuôi trong chính sách tăng khi số chuyên gia tăng. Các phát hiện chỉ áp dụng cho môi trường và đặc tả được kiểm tra; quy kết thay đổi khi số hạt giống thay đổi cũng cho thấy mức độ bất định của đánh giá.
Ý chính
- Các cấu hình chuyên gia hỗn hợp được kiểm tra không làm giảm đáng kể mức thiếu hụt trung bình so với Double Deep Q-Learning thuần.
- Trong môi trường phát lại theo đặc tả, giá trung bình theo thời gian và thanh lý ngay có mức thiếu hụt trung bình thấp hơn các cấu hình đã học.
- Thăm dò giảm dần ngăn các trường hợp sụp đổ chính sách quan sát được mà không cần phân vùng chuyên gia.
- Độ phân tán giữa các hạt giống và rủi ro đuôi trong chính sách thay đổi khác nhau khi số chuyên gia tăng.
- Quy kết nguyên nhân lỗi có thể thay đổi theo số hạt giống huấn luyện, nên cần đánh giá qua nhiều hạt giống lặp lại.
Thẻ
Toàn văn
# Mixture-of-Experts for Cryptocurrency Order Execution: Training Stability, Tail Risk, and Failure Modes
# Mixture-of-Experts for Cryptocurrency Order Execution: Training Stability, Tail Risk, and Failure Modes
Deep reinforcement-learning policies for order execution can vary substantially across training seeds, so apparent architectural gains may reflect favourable training realisations rather than reproducible properties of the architecture. We evaluate vanilla Double Deep Q-Learning (DDQL), K-means-partitioned mixtures of DDQL experts at $K \in \{2, 4, 8\}$, and dense networks parameter-matched to the $K{=}4$ and $K{=}8$ expert budgets on 5-minute mean-aggregated BTC/USDT limit order book data from Binance. No learned configuration significantly improves mean implementation shortfall over DDQL. Under the reported specification, all have higher mean shortfall than TWAP (0.39 bps) and immediate liquidation (0.21 bps) in an environment whose frictionless replay and terminal-urgency penalty make early liquidation nearly costless; 11/100 vanilla-DDQL runs, versus none in either MoE $K{\geq}4$ arm, converge to a policy that waits until forced liquidation. We then decompose this specification on a device-matched baseline. Annealed exploration alone eliminates observed collapses (12/100 to 0/100; exact McNemar $p{=}4.9{\times}10^{-4}$), matching the elimination under expert partitioning. Combining annealed exploration with the aligned reward restores collapse in 19/30 runs; with all three specification changes, it rises to 48/100. In this environment, expert partitioning is unnecessary to suppress collapse and appears to mask a training-specification failure rather than confer an intrinsic performance benefit. No MoE $K{=}8$ run collapses under any of the six specifications tested. Across-seed dispersion is lowest at $K{=}8$ but non-monotone and not robust to family-wise adjustment, while within-policy tail risk worsens monotonically with $K$. The apparent attribution of the failure mode reverses between 30 and 100 seeds, illustrating the importance of repeated-seed evaluation.Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.