یادگیری تقویتی برای مدیریت سبد ارزهای دیجیتال
خلاصه
این مقاله استفاده از منتقد-بازیگر نرم (SAC) و گرادیان سیاست قطعی عمیق (DDPG) را برای مدیریت سبدهای ارز دیجیتال پیشنهاد میکند. عاملها در محیطی شبیهسازیشده و با استفاده از دادههای تاریخی بازار، کنشهای معاملاتی پیوسته را میآموزند و وزنهای سبد را برای دستیابی به بازده تجمعی، با درنظرگرفتن ریسک نزولی و هزینههای معامله، تنظیم میکنند. SAC از هدفی منظمشده با آنتروپی استفاده میکند که مقاله آن را با پایداری بیشتر در شرایط پُرنویز مرتبط میداند.
آزمایشها روی چندین ارز دیجیتال گزارش میکنند که هر دو عامل از معیارهای مبنای سبد با وزن برابر و میانگینواریانس بهتر عمل میکنند و SAC از DDPG پایدارتر و مستحکمتر است. خلاصه داراییها، دوره نمونه، فرضهای بازار، مدل هزینه معامله یا نتایج عددی را مشخص نمیکند. ازآنجاکه شواهد حاصل ارزیابی آزمایشی با دادههای تاریخی و محیط شبیهسازیشده است، بهتنهایی نشان نمیدهد روشها در معامله زنده یا شرایط دیگر بازار عملکرد مشابهی خواهند داشت.
ایدههای کلیدی
- عاملهای SAC و DDPG در محیطی شبیهسازیشده، کنشهای پیوسته سبد را از دادههای تاریخی بازار میآموزند.
- عاملها وزنهای سبد را با درنظرگرفتن بازده، ریسک نزولی و هزینههای معامله تنظیم میکنند.
- مقاله عملکرد بهتر از معیارهای مبنای وزنبرابر و میانگینواریانس را در چندین ارز دیجیتال گزارش میکند.
- گزارش شده SAC در شرایط پُرنویز بازار از DDPG پایدارتر است.
- خلاصه، جزئیات چیدمان آزمایش یا عملکرد عددی را ارائه نمیکند.
برچسبها
متن کامل
# 2511.20678 # Cryptocurrency Portfolio Management with Reinforcement Learning: Soft Actor--Critic and Deep Deterministic Policy Gradient Algorithms This paper proposes a reinforcement learning--based framework for cryptocurrency portfolio management using the Soft Actor--Critic (SAC) and Deep Deterministic Policy Gradient (DDPG) algorithms. Traditional portfolio optimization methods often struggle to adapt to the highly volatile and nonlinear dynamics of cryptocurrency markets. To address this, we design an agent that learns continuous trading actions directly from historical market data through interaction with a simulated trading environment. The agent optimizes portfolio weights to maximize cumulative returns while minimizing downside risk and transaction costs. Experimental evaluations on multiple cryptocurrencies demonstrate that the SAC and DDPG agents outperform baseline strategies such as equal-weighted and mean--variance portfolios. The SAC algorithm, with its entropy-regularized objective, shows greater stability and robustness in noisy market conditions compared to DDPG. These results highlight the potential of deep reinforcement learning for adaptive and data-driven portfolio management in cryptocurrency markets.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.