متحرک کرپٹو جوڑی ٹریڈنگ کے لیے گہری تقویتی سیکھ
خلاصہ
یہ مطالعہ اتار چڑھاؤ والی کرپٹو کرنسی منڈیوں میں جوڑی ٹریڈنگ کے لیے نفاذی تہہ کے طور پر گہری تقویتی سیکھ آزماتا ہے۔ اس کا فریم ورک پہلے امیدوار جوڑیوں کو چھانٹتا اور درجہ بندی کرتا ہے، پھر نفاذ کے فیصلے کرنے کے لیے Long Short-Term Memory تہہ والا Proximal Policy Optimization ایجنٹ استعمال کرتا ہے۔ مقررہ خطرے اور موافق اوسط کا ڈیزائن اور متعین خطرہ کنٹرولز ایجنٹ کو محدود کرتے ہیں، تاکہ انحراف کا خطرہ کم ہو۔ جائزے میں Binance USD-M فیوچرز کا گھنٹہ وار ڈیٹا استعمال کیا گیا ہے اور سیکھی ہوئی پالیسی کا موازنہ ایک ہیورسٹک معیار سے کیا گیا ہے۔
نمونے سے باہر رپورٹ کردہ نتائج تقویتی سیکھ کی پالیسی کے حق میں ہیں، اور اسٹیشنری سرکلر بلاک بوٹسٹریپ سے 10 فیصد سطح پر شماریاتی طور پر نمایاں خطرے کے مطابق ایڈجسٹ شدہ بہتر کارکردگی ظاہر ہوتی ہے۔ نتیجہ زیادہ سخت 5 فیصد اہمیت کی حد تک نہیں پہنچتا، جسے مطالعہ ڈیجیٹل اثاثوں کے بلند انفرادی اتار چڑھاؤ سے جوڑتا ہے۔ شواہد آزمائے گئے ڈیٹا اور ترتیب تک مخصوص ہیں؛ وضاحت میں کارکردگی کی مقدار، لین دین کی لاگت کے مفروضے یا دوسرے تجارتی مقامات اور ادوار پر آزمائشیں نہیں دی گئیں۔ یہ مخلوط ڈیزائن سیکھی ہوئی نفاذی فیصلوں کو محدود کرنے کا طریقہ دیتا ہے، مگر وسیع تر مضبوطی کا سوال ابھی کھلا ہے۔
اہم خیالات
- مجوزہ نظام شماریاتی جوڑیوں کے انتخاب کو سیکھی ہوئی نفاذی تہہ کے ساتھ ملاتا ہے۔
- PPO ایجنٹ، LSTM کے ساتھ متعین خطرے کی حدود میں نفاذی فیصلے کرتا ہے۔
- مطالعہ اس طریقے کو Binance USD-M فیوچرز کے گھنٹہ وار ڈیٹا پر ہیورسٹک معیار کے مقابلے میں جانچتا ہے۔
- رپورٹ کردہ خطرے کے مطابق ایڈجسٹ شدہ بہتر کارکردگی 10 فیصد سطح پر نمایاں ہے، مگر 5 فیصد سطح پر نہیں۔
- نتائج آزمائی گئی منڈی، ڈیٹا اور اسٹریٹیجی کی ترتیب تک مخصوص ہیں۔
ٹیگز
مکمل متن
# Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning # Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning This study aims to determine whether the application of Deep Reinforcement Learning (DRL) as a specialized execution overlay can enhance pair trading in highly volatile cryptocurrency markets. Although classical implementations of the strategy have proven successful in traditional equities, they frequently exhibit rigidity and suffer from severe divergence risks when applied to high-variance environments. To address this need, this research introduces novel concepts. To construct a robust system, we developed a hierarchical "Filter-then-Rank" pair selection methodology and a proprietary "Fixed Risk, Adaptive Mean" execution model. The system employs a Proximal Policy Optimization (PPO) agent with a Long Short-Term Memory (LSTM) layer to govern execution decisions within strict deterministic risk management boundaries. Evaluated on 1-hour interval data from the Binance USD-M Futures market, the optimized RL policy achieved an out-of-sample performance that substantially outperformed the heuristic baseline. A stationary circular block bootstrap robustness check confirms that the agent's risk-adjusted outperformance is statistically significant at the 10 percent level. Although falling marginally short of the stricter 5 percent threshold, this result highlights the extreme idiosyncratic variance characteristic of digital assets. Ultimately, this thesis contributes to the quantitative finance literature by introducing a hybrid architecture that combines statistical arbitrage with DRL execution policies. Furthermore, it delivers a novel framework for safe reinforcement learning via deterministic shielding, proving that anchoring a neural policy to statistically robust boundaries successfully mitigates severe divergence risks.
ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0
یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔