کرپٹو کرنسی پورٹ فولیو مینجمنٹ کے لیے تقویتی سیکھنا
خلاصہ
یہ مقالہ کرپٹو کرنسی پورٹ فولیو سنبھالنے کے لیے سافٹ ایکٹر کریٹک (SAC) اور ڈیپ ڈیٹرمنسٹک پالیسی گریڈینٹ (DDPG) استعمال کرنے کی تجویز دیتا ہے۔ ایجنٹ تاریخی مارکیٹ ڈیٹا کے ذریعے مصنوعی ماحول میں مسلسل ٹریڈنگ کے اقدامات سیکھتے ہیں اور منفی پہلو کے خطرے اور لین دین کے اخراجات کو مدنظر رکھتے ہوئے مجموعی منافع حاصل کرنے کے لیے پورٹ فولیو کے وزن بدلتے ہیں۔ SAC اینٹروپی سے باقاعدہ کردہ مقصد استعمال کرتا ہے، جسے مقالہ شور والے حالات میں زیادہ استحکام سے جوڑتا ہے۔
متعدد کرپٹو کرنسیوں پر تجربات کے مطابق دونوں ایجنٹ یکساں وزن اور اوسط-تغیر پورٹ فولیو کے بنیادی طریقوں سے بہتر کارکردگی دکھاتے ہیں، جبکہ SAC، DDPG سے زیادہ مستحکم اور مضبوط ہے۔ خلاصے میں اثاثوں، نمونے کی مدت، مارکیٹ کے مفروضوں، لین دین کے اخراجات کے ماڈل یا عددی نتائج کی وضاحت نہیں ہے۔ شواہد تاریخی ڈیٹا اور مصنوعی ماحول میں تجرباتی جانچ سے حاصل ہوئے ہیں، اس لیے یہ بذاتِ خود ظاہر نہیں کرتے کہ طریقے لائیو ٹریڈنگ یا مختلف مارکیٹ حالات میں بھی اسی طرح کارکردگی دکھائیں گے۔
اہم خیالات
- SAC اور DDPG ایجنٹ مصنوعی ماحول میں تاریخی مارکیٹ ڈیٹا سے مسلسل پورٹ فولیو اقدامات سیکھتے ہیں۔
- ایجنٹ منافع، منفی پہلو کے خطرے اور لین دین کے اخراجات کو مدنظر رکھتے ہوئے پورٹ فولیو کے وزن بدلتے ہیں۔
- مقالے کے مطابق متعدد کرپٹو کرنسیوں میں کارکردگی یکساں وزن اور اوسط-تغیر بنیادی طریقوں سے بہتر رہی۔
- رپورٹ کے مطابق شور والی مارکیٹ میں SAC، DDPG سے زیادہ مستحکم ہے۔
- خلاصے میں تجرباتی ترتیب یا کارکردگی کے عددی نتائج نہیں دیے گئے۔
ٹیگز
مکمل متن
# 2511.20678 # Cryptocurrency Portfolio Management with Reinforcement Learning: Soft Actor--Critic and Deep Deterministic Policy Gradient Algorithms This paper proposes a reinforcement learning--based framework for cryptocurrency portfolio management using the Soft Actor--Critic (SAC) and Deep Deterministic Policy Gradient (DDPG) algorithms. Traditional portfolio optimization methods often struggle to adapt to the highly volatile and nonlinear dynamics of cryptocurrency markets. To address this, we design an agent that learns continuous trading actions directly from historical market data through interaction with a simulated trading environment. The agent optimizes portfolio weights to maximize cumulative returns while minimizing downside risk and transaction costs. Experimental evaluations on multiple cryptocurrencies demonstrate that the SAC and DDPG agents outperform baseline strategies such as equal-weighted and mean--variance portfolios. The SAC algorithm, with its entropy-regularized objective, shows greater stability and robustness in noisy market conditions compared to DDPG. These results highlight the potential of deep reinforcement learning for adaptive and data-driven portfolio management in cryptocurrency markets.
ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0
یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔