التعلم المعزز لإدارة محافظ العملات الرقمية
الملخص
تقترح هذه الورقة استخدام طريقة ممثل الناقد اللين (SAC) وتدرج السياسة الحتمية العميق (DDPG) لإدارة محافظ العملات الرقمية. وتتعلم الوكلاء إجراءات تداول متصلة في بيئة محاكاة باستخدام بيانات السوق التاريخية، مع تعديل أوزان المحفظة سعيًا إلى عوائد تراكمية ومراعاة مخاطر الجانب السلبي وتكاليف المعاملات. وتستخدم طريقة SAC دالة هدف منتظمة بالإنتروبيا، وترتبط في الورقة باستقرار أكبر في الظروف المشوشة.
تفيد التجارب على عملات رقمية متعددة بأن كلا الوكيلين يتفوقان على المعايير المرجعية للمحافظ متساوية الأوزان ومتوسط التباين، مع استقرار ومتانة أكبر لـSAC مقارنةً بـDDPG. ولا يحدد الملخص الأصول أو فترة العينة أو افتراضات السوق أو نموذج تكاليف المعاملات أو النتائج العددية. وبما أن الأدلة مستمدة من تقييم تجريبي باستخدام بيانات تاريخية وبيئة محاكاة، فهي لا تثبت وحدها أن أداء الطرق سيكون مماثلًا في التداول الفعلي أو في ظروف سوق مختلفة.
الأفكار الرئيسية
- يتعلم وكيلا SAC وDDPG إجراءات مستمرة للمحفظة من بيانات السوق التاريخية في بيئة محاكاة.
- يعدّل الوكيلان أوزان المحفظة مع مراعاة العوائد ومخاطر الجانب السلبي وتكاليف المعاملات.
- تفيد الورقة بأداء أفضل من معايير المحافظ متساوية الأوزان ومتوسط التباين عبر عملات رقمية متعددة.
- يُذكر أن SAC أكثر استقرارًا من DDPG في ظروف السوق المشوشة.
- لا يقدم الملخص تفاصيل الإعداد التجريبي أو أرقام الأداء.
الوسوم
النص الكامل
# 2511.20678 # Cryptocurrency Portfolio Management with Reinforcement Learning: Soft Actor--Critic and Deep Deterministic Policy Gradient Algorithms This paper proposes a reinforcement learning--based framework for cryptocurrency portfolio management using the Soft Actor--Critic (SAC) and Deep Deterministic Policy Gradient (DDPG) algorithms. Traditional portfolio optimization methods often struggle to adapt to the highly volatile and nonlinear dynamics of cryptocurrency markets. To address this, we design an agent that learns continuous trading actions directly from historical market data through interaction with a simulated trading environment. The agent optimizes portfolio weights to maximize cumulative returns while minimizing downside risk and transaction costs. Experimental evaluations on multiple cryptocurrencies demonstrate that the SAC and DDPG agents outperform baseline strategies such as equal-weighted and mean--variance portfolios. The SAC algorithm, with its entropy-regularized objective, shows greater stability and robustness in noisy market conditions compared to DDPG. These results highlight the potential of deep reinforcement learning for adaptive and data-driven portfolio management in cryptocurrency markets.
يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0
أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.