Pular para o conteúdo
Todos os documentos da biblioteca

Trading PPO com exposição-alvo baseada em regimes para controlar drawdown

Artigo arXiv papers · Autor: Duong Hien Chi Kien et al.

Resumo

PPO-HRAP combina otimização de política proximal com uma exposição-alvo derivada dos regimes de mercado. A política observa características do mercado e o estado da carteira, e então combina a ação aprendida com o alvo do regime. A recompensa considera os retornos logarítmicos da carteira, aumentos do drawdown condicionados ao VIX, desvios em relação à exposição-alvo e custos de giro. O projeto busca equilibrar a participação nos ganhos com o controle do drawdown, abordando a tendência de políticas focadas no lucro de manterem investimentos elevados e de penalidades de risco fortes tornarem as políticas cautelosas demais.

Em um período reservado do SPY, de 2020 a 2022, o estudo relata drawdown máximo menor que o da estratégia de compra e manutenção, junto com medidas de retorno e desempenho ajustado ao risco. Os resultados em cinco sementes do SPY são descritos como estáveis; testes em execução única com QQQ e DIA também classificam o método em primeiro lugar em retorno total e índice de Sharpe entre os métodos comparados. Os autores reconhecem o alto giro e as evidências limitadas entre ativos, portanto a robustez mais ampla continua incerta.

Ideias principais

  • PPO-HRAP combina a ação aprendida pela política com uma exposição-alvo derivada dos regimes de mercado.
  • A recompensa considera retornos, aumentos de drawdown condicionados ao VIX, desvios da exposição-alvo e giro.
  • A avaliação reservada do SPY relata drawdown máximo menor que o da estratégia de compra e manutenção.
  • Os resultados em cinco sementes do SPY são estáveis, enquanto as evidências para QQQ e DIA vêm de execuções únicas.
  • O método ainda apresenta alto giro e evidências limitadas de robustez entre ativos.

Tags

Texto completo
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading


# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading









Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.