ڈرا ڈاؤن کنٹرول کے لیے بازاری نظام سے آگاہ ہدفی زد کے ساتھ PPO ٹریڈنگ
خلاصہ
PPO-HRAP پروکسمل پالیسی آپٹیمائزیشن کو بازاری نظام سے اخذ کردہ ہدفی زد کے ساتھ ملاتا ہے۔ اس کی پالیسی بازاری خصوصیات اور پورٹ فولیو کی حالت دیکھتی ہے، پھر سیکھی ہوئی کارروائی کو نظام کے ہدف کے ساتھ ملاتی ہے۔ انعام میں پورٹ فولیو کے لاگ منافع، VIX سے مشروط ڈرا ڈاؤن میں اضافے، ہدفی زد سے انحراف، اور ٹرن اوور کے اخراجات شامل ہیں۔ اس ڈیزائن کا مقصد منافع میں شرکت اور ڈرا ڈاؤن کنٹرول میں توازن رکھنا ہے؛ یوں منافع پر مرکوز پالیسیوں کے بھاری سرمایہ کاری برقرار رکھنے اور سخت خطرہ جرمانوں سے پالیسیوں کے حد سے زیادہ محتاط ہونے کے رجحان سے نمٹا جاتا ہے۔
SPY کے ایک الگ رکھے گئے دورانیے میں، 2020 سے 2022 تک، مطالعہ بتاتا ہے کہ زیادہ سے زیادہ ڈرا ڈاؤن، خرید کر رکھیں حکمتِ عملی کے مقابلے میں کم تھا، ساتھ ہی ریٹرن اور خطرے کے مطابق کارکردگی کے پیمانے بھی پیش کیے گئے۔ SPY کے پانچ سیڈز کے نتائج مستحکم بتائے گئے ہیں؛ QQQ اور DIA پر ایک ایک بار کیے گئے ٹیسٹوں میں بھی زیرِ مطالعہ طریقہ، موازنہ شدہ طریقوں میں مجموعی ریٹرن اور شارپ تناسب کے لحاظ سے پہلے نمبر پر ہے۔ مصنفین زیادہ ٹرن اوور اور مختلف اثاثوں پر محدود شواہد تسلیم کرتے ہیں، اس لیے وسیع تر مضبوطی کے بارے میں غیر یقینی برقرار ہے۔
اہم خیالات
- PPO-HRAP سیکھی ہوئی پالیسی کی کارروائی کو بازاری نظام سے اخذ کردہ ہدفی زد کے ساتھ ملاتا ہے۔
- اس کا انعام منافع، VIX سے مشروط ڈرا ڈاؤن میں اضافہ، ہدفی زد سے انحراف اور ٹرن اوور کو شامل کرتا ہے۔
- الگ رکھے گئے SPY کے جائزے میں خرید کر رکھنے کی حکمتِ عملی سے کم زیادہ سے زیادہ ڈرا ڈاؤن رپورٹ ہوا۔
- SPY کے پانچ بیجوں کے نتائج مستحکم ہیں، جبکہ QQQ اور DIA کے شواہد ایک ایک بار کے تجربات سے ہیں۔
- اس طریقے میں اب بھی ٹرن اوور زیادہ ہے اور مختلف اثاثوں پر مضبوطی کے شواہد محدود ہیں۔
ٹیگز
مکمل متن
# PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading # PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.
ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0
یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔