Zum Inhalt springen
Alle Bibliotheksdokumente

PPO-Trading mit regimebasiertem Engagementsziel zur Drawdown-Steuerung

Artikel arXiv papers · Autor: Duong Hien Chi Kien et al.

Zusammenfassung

PPO-HRAP verbindet Proximal Policy Optimization mit einem aus Marktregimen abgeleiteten Zielengagement. Die Strategie beobachtet Marktmerkmale und den Portfoliostatus und kombiniert anschließend die gelernte Aktion mit dem Regimeziel. Die Belohnungsfunktion berücksichtigt logarithmische Portfoliorenditen, vom VIX abhängige Drawdown-Zunahmen, Abweichungen vom Zielengagement und Umschichtungskosten. Das Design soll die Teilnahme an Kursgewinnen mit Drawdown-Steuerung in Einklang bringen und damit der Tendenz gewinnorientierter Strategien entgegenwirken, stark investiert zu bleiben, sowie der Tendenz hoher Risikostrafen, Strategien übermäßig vorsichtig zu machen.

Für ein zurückgehaltenes SPY-Zeitfenster von 2020 bis 2022 berichtet die Studie einen niedrigeren maximalen Drawdown als bei Buy and Hold sowie Rendite- und risikobereinigte Performancekennzahlen. Die Ergebnisse über fünf SPY-Seeds werden als stabil beschrieben; Einzeltests mit QQQ und DIA platzieren die Methode unter den verglichenen Verfahren ebenfalls an erster Stelle bei Gesamtrendite und Sharpe Ratio. Die Autoren räumen einen hohen Umschlag und begrenzte Evidenz über verschiedene Assets hinweg ein; die allgemeine Robustheit bleibt daher ungewiss.

Kernaussagen

  • PPO-HRAP kombiniert die gelernte Strategieaktion mit einem aus Marktregimen abgeleiteten Zielengagement.
  • Die Belohnungsfunktion berücksichtigt Renditen, vom VIX abhängige Drawdown-Zunahmen, Abweichungen vom Zielengagement und Umschichtungen.
  • Die Auswertung des zurückgehaltenen SPY-Zeitraums berichtet einen niedrigeren maximalen Drawdown als bei Buy and Hold.
  • Die Ergebnisse über fünf SPY-Seeds sind stabil, während die Evidenz für QQQ und DIA aus Einzeltests stammt.
  • Die Methode weist weiterhin einen hohen Umschlag und eine begrenzte Evidenz zur Robustheit über verschiedene Assets hinweg auf.

Schlagwörter

Volltext
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading


# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading









Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.