Saltar al contenido
Todos los documentos de la biblioteca

Trading PPO con exposición objetivo según el régimen para controlar el drawdown

Artículo arXiv papers · Autor: Duong Hien Chi Kien et al.

Resumen

PPO-HRAP combina la optimización de políticas proximales con una exposición objetivo derivada del régimen. Su política observa las características del mercado y el estado de la cartera, y luego combina la acción aprendida con el objetivo del régimen. La recompensa tiene en cuenta los rendimientos logarítmicos de la cartera, los aumentos del drawdown condicionados por VIX, la desviación respecto a la exposición objetivo y los costes de rotación. El diseño busca equilibrar la participación en las ganancias con el control del drawdown, y abordar la tendencia de las políticas centradas en el beneficio a mantener una gran exposición y la de las penalizaciones de riesgo fuertes a volverlas demasiado cautelosas.

En un periodo de SPY reservado para prueba, de 2020 a 2022, el estudio informa de un drawdown máximo inferior al de comprar y mantener, junto con sus medidas de rentabilidad y rendimiento ajustado al riesgo. Los resultados de cinco semillas de SPY se describen como estables; las pruebas de una sola ejecución con QQQ y DIA también sitúan el método en primer lugar en rentabilidad total y ratio de Sharpe entre los métodos comparados. Los autores reconocen una rotación elevada y evidencia limitada entre activos, por lo que la robustez general sigue siendo incierta.

Ideas clave

  • PPO-HRAP combina la acción de la política aprendida con una exposición objetivo derivada de los regímenes del mercado.
  • La recompensa tiene en cuenta los rendimientos, los aumentos del drawdown condicionados por VIX, la desviación respecto a la exposición objetivo y la rotación.
  • La evaluación con datos SPY reservados para prueba informa de un drawdown máximo menor que el de comprar y mantener.
  • Los resultados de cinco semillas de SPY son estables, mientras que la evidencia con QQQ y DIA procede de una sola ejecución.
  • El método todavía presenta una rotación elevada y evidencia limitada de robustez entre activos.

Etiquetas

Texto completo
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading


# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading









Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.