رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی برای مدیریت سبد ارزهای دیجیتال

مقاله arXiv papers · نویسنده: Kamal Paykan

خلاصه

این مقاله استفاده از منتقد-بازیگر نرم (SAC) و گرادیان سیاست قطعی عمیق (DDPG) را برای مدیریت سبدهای ارز دیجیتال پیشنهاد می‌کند. عامل‌ها در محیطی شبیه‌سازی‌شده و با استفاده از داده‌های تاریخی بازار، کنش‌های معاملاتی پیوسته را می‌آموزند و وزن‌های سبد را برای دستیابی به بازده تجمعی، با درنظرگرفتن ریسک نزولی و هزینه‌های معامله، تنظیم می‌کنند. SAC از هدفی منظم‌شده با آنتروپی استفاده می‌کند که مقاله آن را با پایداری بیشتر در شرایط پُرنویز مرتبط می‌داند.

آزمایش‌ها روی چندین ارز دیجیتال گزارش می‌کنند که هر دو عامل از معیارهای مبنای سبد با وزن برابر و میانگین‌واریانس بهتر عمل می‌کنند و SAC از DDPG پایدارتر و مستحکم‌تر است. خلاصه دارایی‌ها، دوره نمونه، فرض‌های بازار، مدل هزینه معامله یا نتایج عددی را مشخص نمی‌کند. ازآنجاکه شواهد حاصل ارزیابی آزمایشی با داده‌های تاریخی و محیط شبیه‌سازی‌شده است، به‌تنهایی نشان نمی‌دهد روش‌ها در معامله زنده یا شرایط دیگر بازار عملکرد مشابهی خواهند داشت.

ایده‌های کلیدی

  • عامل‌های SAC و DDPG در محیطی شبیه‌سازی‌شده، کنش‌های پیوسته سبد را از داده‌های تاریخی بازار می‌آموزند.
  • عامل‌ها وزن‌های سبد را با درنظرگرفتن بازده، ریسک نزولی و هزینه‌های معامله تنظیم می‌کنند.
  • مقاله عملکرد بهتر از معیارهای مبنای وزن‌برابر و میانگین‌واریانس را در چندین ارز دیجیتال گزارش می‌کند.
  • گزارش شده SAC در شرایط پُرنویز بازار از DDPG پایدارتر است.
  • خلاصه، جزئیات چیدمان آزمایش یا عملکرد عددی را ارائه نمی‌کند.

برچسب‌ها

متن کامل
# 2511.20678


# Cryptocurrency Portfolio Management with Reinforcement Learning: Soft Actor--Critic and Deep Deterministic Policy Gradient Algorithms









This paper proposes a reinforcement learning--based framework for cryptocurrency portfolio management using the Soft Actor--Critic (SAC) and Deep Deterministic Policy Gradient (DDPG) algorithms. Traditional portfolio optimization methods often struggle to adapt to the highly volatile and nonlinear dynamics of cryptocurrency markets. To address this, we design an agent that learns continuous trading actions directly from historical market data through interaction with a simulated trading environment. The agent optimizes portfolio weights to maximize cumulative returns while minimizing downside risk and transaction costs. Experimental evaluations on multiple cryptocurrencies demonstrate that the SAC and DDPG agents outperform baseline strategies such as equal-weighted and mean--variance portfolios. The SAC algorithm, with its entropy-regularized objective, shows greater stability and robustness in noisy market conditions compared to DDPG. These results highlight the potential of deep reinforcement learning for adaptive and data-driven portfolio management in cryptocurrency markets.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.