עבור לתוכן
כל מסמכי הספרייה

מסחר PPO עם חשיפה מותאמת משטר לשליטה בדרואודאון

מאמר arXiv papers · מחבר: Duong Hien Chi Kien et al.

סיכום

PPO-HRAP משלבת אופטימיזציה של מדיניות פרוקסימלית עם חשיפת יעד הנגזרת ממשטר השוק. המדיניות שלה צופה בתכונות השוק ובמצב התיק, ואז משלבת את הפעולה הנלמדת עם יעד המשטר. פונקציית התגמול מביאה בחשבון תשואות לוגריתמיות של התיק, עליות בדרואודאון המותנות ב־VIX, סטייה מחשיפת היעד ועלויות מחזור תיק. התכנון נועד לאזן בין השתתפות ברווחים לבין שליטה בדרואודאון, ולהתמודד עם נטייתן של שיטות המכוונות לרווח להישאר מושקעות בכבדות ועם נטייתם של קנסות סיכון חזקים להפוך שיטות לזהירות מדי.

בחלון SPY שהוחזק מחוץ למדגם, מ־2020 עד 2022, המחקר מדווח על דרואודאון מקסימלי נמוך יותר מאשר בקנייה והחזקה, לצד מדדי התשואה והביצועים מותאמי הסיכון שלו. התוצאות בחמישה זרעים של SPY מתוארות כיציבות; בבדיקות חד־פעמיות על QQQ ועל DIA, השיטה מדורגת גם ראשונה בתשואה הכוללת וביחס שארפ מבין השיטות שהושוו. המחברים מציינים תחלופה גבוהה וראיות מוגבלות בין נכסים, ולכן העמידות הרחבה יותר נותרת לא ודאית.

רעיונות מרכזיים

  • PPO-HRAP משלבת את פעולת המדיניות הנלמדת עם חשיפת יעד הנגזרת ממשטרי שוק.
  • התגמול מתחשב בתשואות, בעליות בדרואודאון המותנות ב־VIX, בסטייה מחשיפת היעד ובמחזור התיק.
  • הערכה על SPY שהוחזק מחוץ למדגם מדווחת על דרואודאון מקסימלי נמוך יותר מאשר בקנייה והחזקה.
  • התוצאות בחמישה אתחולים אקראיים של SPY יציבות, ואילו הראיות של QQQ ושל DIA מבוססות על הרצה יחידה.
  • לשיטה עדיין יש תחלופה גבוהה וראיות מוגבלות לעמידות בין נכסים.

תגיות

הטקסט המלא
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading


# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading









Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.

מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0

הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.