Giao dịch PPO với mức độ tiếp xúc mục tiêu theo chế độ để kiểm soát sụt giảm
Tóm tắt
PPO-HRAP kết hợp Tối ưu hóa Chính sách Gần với mức độ tiếp xúc mục tiêu suy ra từ chế độ thị trường. Chính sách quan sát các đặc trưng thị trường và trạng thái danh mục, sau đó kết hợp hành động đã học với mức độ tiếp xúc mục tiêu theo chế độ. Hàm thưởng tính đến lợi suất logarit của danh mục, mức tăng của drawdown có điều kiện theo VIX, độ lệch so với mức độ tiếp xúc mục tiêu và chi phí luân chuyển. Thiết kế hướng đến cân bằng giữa tham gia vào mức tăng và kiểm soát drawdown, đồng thời xử lý xu hướng các chính sách tập trung vào lợi nhuận duy trì mức đầu tư cao và các khoản phạt rủi ro lớn khiến chính sách trở nên quá thận trọng.
Trong giai đoạn 2020 đến 2022 của SPY được giữ lại để kiểm định, nghiên cứu báo cáo mức drawdown tối đa thấp hơn so với Mua và Nắm giữ, cùng với các thước đo hiệu quả lợi nhuận và điều chỉnh theo rủi ro. Kết quả qua năm lần khởi tạo SPY được mô tả là ổn định; các kiểm định một lần trên QQQ và DIA cũng xếp phương pháp đứng đầu về tổng lợi nhuận và tỷ số Sharpe trong số các phương pháp được so sánh. Các tác giả thừa nhận luân chuyển cao và bằng chứng hạn chế trên nhiều tài sản, nên độ vững rộng hơn vẫn chưa chắc chắn.
Ý chính
- PPO-HRAP kết hợp hành động của chính sách đã học với mức độ tiếp xúc mục tiêu suy ra từ chế độ thị trường.
- Hàm thưởng tính đến lợi nhuận, mức tăng drawdown có điều kiện theo VIX, độ lệch khỏi mức độ tiếp xúc mục tiêu và luân chuyển.
- Đánh giá trên SPY được giữ lại để kiểm định báo cáo drawdown tối đa thấp hơn so với Mua và Nắm giữ.
- Kết quả qua năm lần khởi tạo SPY ổn định, trong khi bằng chứng từ QQQ và DIA chỉ dựa trên một lần chạy.
- Phương pháp vẫn có vòng quay danh mục cao và bằng chứng hạn chế về độ vững trên nhiều tài sản.
Thẻ
Toàn văn
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading # PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.