رفتن به محتوا
همه اسناد کتابخانه

معامله PPO با پیشین مواجهه آگاه از رژیم برای کنترل افت سرمایه

مقاله arXiv papers · نویسنده: Duong Hien Chi Kien et al.

خلاصه

PPO-HRAP بهینه‌سازی سیاست مجاور را با مواجهه هدفِ برآمده از رژیم ترکیب می‌کند. سیاست آن ویژگی‌های بازار و وضعیت سبد را مشاهده می‌کند و سپس کنش یادگرفته‌شده را با هدف رژیم درهم می‌آمیزد. پاداش، بازده‌های لگاریتمی سبد، افزایش افت سرمایه مشروط به VIX، انحراف از مواجهه هدف و هزینه‌های گردش سبد را لحاظ می‌کند. این طراحی می‌کوشد مشارکت در رشد را با کنترل افت سرمایه متوازن کند و به گرایش سیاست‌های متمرکز بر سود به سرمایه‌گذاری سنگین و گرایش جریمه‌های ریسک شدید به محتاط‌شدن بیش‌ازحد سیاست‌ها می‌پردازد.

در بازه کنارگذاشته‌شده SPY از 2020 تا 2022، مطالعه افت سرمایه بیشینه کمتری از نگهداری و حفظ موقعیت گزارش می‌کند و در کنار آن سنجه‌های بازده و عملکرد تعدیل‌شده با ریسک را می‌آورد. نتایج در پنج بذر SPY پایدار توصیف شده‌اند؛ آزمون‌های تک‌اجرا روی QQQ و DIA نیز این روش را از نظر بازده کل و نسبت شارپ در میان روش‌های مقایسه‌شده در رتبه نخست قرار می‌دهند. نویسندگان گردش سبد بالا و شواهد محدود میان دارایی‌ها را می‌پذیرند؛ بنابراین استحکام گسترده‌تر همچنان نامطمئن است.

ایده‌های کلیدی

  • PPO-HRAP کنش سیاست یادگرفته‌شده را با مواجهه هدفی که از رژیم‌های بازار گرفته شده ترکیب می‌کند.
  • پاداش، بازده‌ها، افزایش افت سرمایه مشروط به VIX، انحراف از مواجهه هدف و گردش سبد را لحاظ می‌کند.
  • ارزیابی کنارگذاشته‌شده SPY افت سرمایه بیشینه کمتری از نگهداری و حفظ موقعیت گزارش می‌کند.
  • نتایج پنج بذر SPY پایدارند، درحالی‌که شواهد QQQ و DIA از تک‌اجراها می‌آیند.
  • این روش همچنان گردش سبد بالا و شواهد محدودی درباره استحکام میان دارایی‌ها دارد.

برچسب‌ها

متن کامل
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading


# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading









Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.