Chẩn đoán PPO so với chính sách giao dịch môi giới giải tích
Tóm tắt
Nghiên cứu kiểm tra liệu tối ưu hóa chính sách gần đúng có thể học các quyết định về tốc độ giao dịch của một nhà môi giới trong trò chơi liên tục theo thời gian giữa môi giới và nhà giao dịch có nghiệm giải tích hay không. Nghiên cứu suy ra phần thưởng rời rạc từ mục tiêu liên tục theo thời gian, kiểm tra cách triển khai bằng tinh chỉnh lưới và một đẳng thức một bước, rồi so sánh các chính sách đã học với chuẩn giải tích trong các bối cảnh có hoặc không có dòng lệnh ngẫu nhiên từ người giao dịch thiếu thông tin và thông tin không đầy đủ.
Khi không có dòng lệnh từ người giao dịch thiếu thông tin, chính sách PPO truyền thẳng tiến gần đến hành động tham chiếu. Khi có dòng lệnh ngẫu nhiên, các chính sách PPO truyền thẳng và hồi quy vẫn thiếu chính xác, dù học có giám sát cho thấy các tác nhân của chúng có thể biểu diễn mục tiêu. Chẩn đoán Monte Carlo cho thấy các bộ phê bình gặp khó khăn khi xếp hạng những hành động gần nhau, còn tạo hình phần thưởng không giúp ích một cách đáng tin cậy. Bộ điều khiển tương đương chắc chắn dựa trên lịch sử hoạt động gần chuẩn hơn khi thông tin không đầy đủ. PPO điều chỉnh một chính sách giải tích cố định theo chi phí thực thi đã thay đổi, nhưng mức cải thiện được báo cáo chỉ thu hẹp một phần nhỏ khoảng cách tới chuẩn mới. Kết quả cho thấy giá trị của chuẩn giải tích cũng như giới hạn của các phương pháp RL được kiểm tra.
Ý chính
- Trò chơi giao dịch có nghiệm giải tích cung cấp chuẩn trực tiếp để đánh giá chính sách học tăng cường.
- PPO tiến gần hành động tham chiếu khi không có dòng lệnh ngẫu nhiên từ người giao dịch thiếu thông tin, nhưng thiếu chính xác trong bối cảnh ngẫu nhiên được kiểm tra.
- Năng lực biểu diễn của tác nhân không đảm bảo quyết định chính xác khi bộ phê bình xếp hạng hành động thiếu tin cậy.
- Bộ điều khiển nhân quả dựa trên lịch sử quan sát được vẫn gần với chuẩn hơn khi thông tin không đầy đủ.
- Khởi tạo PPO từ chính sách giải tích hỗ trợ phần nào việc thích ứng với chi phí thực thi đã thay đổi.
Thẻ
Toàn văn
# When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game # When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game Reinforcement learning (RL) is increasingly used for financial optimal-control problems when complex dynamics make analytical strategies difficult to obtain. There are financial mathematics literactures which provides many solved models whose equations and controls could evaluate and guide learning; we ask whether RL can exploit these results. We place a proximal policy optimisation (PPO) agent in an analytically solved continuous-time broker--trader game. PPO replaces the broker and chooses its trading speed while interacting with an informed trader and stochastic uninformed order flow. We derive a finite-step reward from the broker's continuous-time payoff and verify its discrete implementation through grid refinement and an exact one-step identity. With zero uninformed flow, a validation-selected PPO--FFNN approaches the reference action. With stochastic uninformed flow, the tested PPO--FFNN and PPO--LSTM remain inaccurate, although supervised learning confirms that their actors can represent the action. Monte Carlo diagnostics show that their critics do not reliably rank nearby actions; potential-based reward shaping also gives no reliable improvement. Under partial information, a causal certainty-equivalent controller based on the broker's observable history remains close to the reference, while PPO has larger errors and lower payoffs. Finally, we freeze the analytical policy and train PPO to adjust it after the execution cost changes. Halving the cost yields a repeatable improvement that closes \(2.22\%\) of the gap to the changed-cost reference. The analytical solution therefore provides both a benchmark for diagnosing RL and a useful starting policy for adaptation.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.