Торговля PPO с учётом режимов рынка для контроля просадки
Сводка
PPO-HRAP объединяет проксимальную оптимизацию политики с целевой позицией, определяемой рыночным режимом. Политика учитывает рыночные факторы и состояние портфеля, а затем сочетает выученное действие с целевой позицией для данного режима. Функция вознаграждения учитывает логарифмическую доходность портфеля, увеличение просадки с учётом VIX, отклонение от целевой позиции и издержки оборота. Модель стремится сбалансировать участие в росте с контролем просадки, решая проблему склонности политик, ориентированных на прибыль, сохранять высокую долю вложений, а сильных штрафов за риск — делать политику чрезмерно осторожной.
На отложенном периоде SPY с 2020 по 2022 в исследовании сообщается о меньшей максимальной просадке по сравнению с Buy and Hold, а также приводятся показатели доходности и эффективности с поправкой на риск. Результаты для пяти запусков SPY описаны как стабильные; в единичных запусках для QQQ и DIA метод также занимает первое место среди сравниваемых методов по совокупной доходности и коэффициенту Шарпа. Авторы признают высокий оборот и ограниченность данных по разным активам, поэтому более широкая устойчивость остаётся неопределённой.
Ключевые идеи
- PPO-HRAP сочетает действие выученной политики с целевой позицией, определяемой рыночным режимом.
- Функция вознаграждения учитывает доходность, увеличение просадки с учётом VIX, отклонение от целевой позиции и оборот.
- Оценка на отложенном периоде SPY показывает меньшую максимальную просадку по сравнению с Buy and Hold.
- Результаты пяти запусков SPY стабильны, а данные по QQQ и DIA основаны на единичных запусках.
- У метода остаются высокий оборот и ограниченные данные об устойчивости на разных активах.
Теги
Полный текст
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading # PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.