Passer au contenu
Tous les documents de la bibliothèque

Trading PPO avec un a priori d’exposition adapté au régime pour contrôler le drawdown

Article arXiv papers · Auteur: Duong Hien Chi Kien et al.

Résumé

PPO-HRAP associe l’optimisation proximale de politique à une exposition cible déduite du régime de marché. Sa politique observe les caractéristiques du marché et l’état du portefeuille, puis combine l’action apprise avec l’exposition cible du régime. La fonction de récompense tient compte des rendements logarithmiques du portefeuille, des hausses du drawdown conditionnées par le VIX, de l’écart par rapport à l’exposition cible et des coûts de rotation du portefeuille. La conception vise à équilibrer la participation aux gains et le contrôle du drawdown, en répondant à la tendance des politiques axées sur le profit à rester fortement investies et à celle des pénalités de risque élevées à rendre les politiques trop prudentes.

Sur une fenêtre SPY mise de côté, de 2020 à 2022, l’étude rapporte un drawdown maximal inférieur à celui de la stratégie Buy and Hold, ainsi que ses mesures de rendement et de performance ajustée du risque. Les résultats obtenus avec cinq initialisations SPY sont décrits comme stables ; des tests en une seule exécution sur QQQ et DIA classent également la méthode en première position pour le rendement total et le ratio de Sharpe parmi les méthodes comparées. Les auteurs reconnaissent une rotation élevée et des éléments limités sur d’autres actifs ; la robustesse générale demeure donc incertaine.

Idées clés

  • PPO-HRAP combine l’action de la politique apprise avec une exposition cible déduite des régimes de marché.
  • La récompense tient compte des rendements, des hausses de drawdown conditionnées par le VIX, de l’écart d’exposition cible et de la rotation du portefeuille.
  • L’évaluation sur une fenêtre SPY mise de côté rapporte un drawdown maximal inférieur à celui de Buy and Hold.
  • Les résultats obtenus avec cinq initialisations SPY sont stables, tandis que les éléments sur QQQ et DIA proviennent d’exécutions uniques.
  • La méthode présente toujours une rotation élevée et des éléments limités quant à sa robustesse sur différents actifs.

Étiquettes

Texte intégral
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading


# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading









Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.