معامله PPO با پیشین مواجهه آگاه از رژیم برای کنترل افت سرمایه
خلاصه
PPO-HRAP بهینهسازی سیاست مجاور را با مواجهه هدفِ برآمده از رژیم ترکیب میکند. سیاست آن ویژگیهای بازار و وضعیت سبد را مشاهده میکند و سپس کنش یادگرفتهشده را با هدف رژیم درهم میآمیزد. پاداش، بازدههای لگاریتمی سبد، افزایش افت سرمایه مشروط به VIX، انحراف از مواجهه هدف و هزینههای گردش سبد را لحاظ میکند. این طراحی میکوشد مشارکت در رشد را با کنترل افت سرمایه متوازن کند و به گرایش سیاستهای متمرکز بر سود به سرمایهگذاری سنگین و گرایش جریمههای ریسک شدید به محتاطشدن بیشازحد سیاستها میپردازد.
در بازه کنارگذاشتهشده SPY از 2020 تا 2022، مطالعه افت سرمایه بیشینه کمتری از نگهداری و حفظ موقعیت گزارش میکند و در کنار آن سنجههای بازده و عملکرد تعدیلشده با ریسک را میآورد. نتایج در پنج بذر SPY پایدار توصیف شدهاند؛ آزمونهای تکاجرا روی QQQ و DIA نیز این روش را از نظر بازده کل و نسبت شارپ در میان روشهای مقایسهشده در رتبه نخست قرار میدهند. نویسندگان گردش سبد بالا و شواهد محدود میان داراییها را میپذیرند؛ بنابراین استحکام گستردهتر همچنان نامطمئن است.
ایدههای کلیدی
- PPO-HRAP کنش سیاست یادگرفتهشده را با مواجهه هدفی که از رژیمهای بازار گرفته شده ترکیب میکند.
- پاداش، بازدهها، افزایش افت سرمایه مشروط به VIX، انحراف از مواجهه هدف و گردش سبد را لحاظ میکند.
- ارزیابی کنارگذاشتهشده SPY افت سرمایه بیشینه کمتری از نگهداری و حفظ موقعیت گزارش میکند.
- نتایج پنج بذر SPY پایدارند، درحالیکه شواهد QQQ و DIA از تکاجراها میآیند.
- این روش همچنان گردش سبد بالا و شواهد محدودی درباره استحکام میان داراییها دارد.
برچسبها
متن کامل
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading # PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.