Перейти к содержимому
Все документы библиотеки

Обучение с подкреплением для управления криптовалютным портфелем

Статья arXiv papers · Автор: Kamal Paykan

Сводка

В статье предлагается использовать Soft Actor-Critic (SAC) и Deep Deterministic Policy Gradient (DDPG) для управления криптовалютными портфелями. Агенты обучаются совершать непрерывные торговые действия в симулируемой среде на исторических рыночных данных, меняя веса портфеля для достижения совокупной доходности с учетом риска снижения и транзакционных издержек. SAC использует целевую функцию с регуляризацией энтропии, которую статья связывает с большей стабильностью в условиях шума.

В экспериментах с несколькими криптовалютами сообщается, что оба агента превосходят базовые портфели с равными весами и портфели среднее–дисперсия, причем SAC стабильнее и устойчивее, чем DDPG. В кратком описании не указаны активы, период выборки, предположения о рынке, модель транзакционных издержек или численные результаты. Поскольку свидетельства основаны на экспериментальной оценке с использованием исторических данных и симулируемой среды, сами по себе они не показывают, что методы будут работать аналогично при реальной торговле или в иных рыночных условиях.

Ключевые идеи

  • Агенты SAC и DDPG обучаются непрерывно менять параметры портфеля по историческим рыночным данным в симулируемой среде.
  • Агенты меняют веса портфеля с учетом доходности, риска снижения и транзакционных издержек.
  • В статье сообщается, что результаты на нескольких криптовалютах превосходят результаты портфелей с равными весами и портфелей, построенных по критерию среднего и дисперсии.
  • Сообщается, что SAC стабильнее DDPG в условиях рыночного шума.
  • В кратком описании нет сведений об экспериментальной постановке или численных показателях эффективности.

Теги

Полный текст
# 2511.20678


# Cryptocurrency Portfolio Management with Reinforcement Learning: Soft Actor--Critic and Deep Deterministic Policy Gradient Algorithms









This paper proposes a reinforcement learning--based framework for cryptocurrency portfolio management using the Soft Actor--Critic (SAC) and Deep Deterministic Policy Gradient (DDPG) algorithms. Traditional portfolio optimization methods often struggle to adapt to the highly volatile and nonlinear dynamics of cryptocurrency markets. To address this, we design an agent that learns continuous trading actions directly from historical market data through interaction with a simulated trading environment. The agent optimizes portfolio weights to maximize cumulative returns while minimizing downside risk and transaction costs. Experimental evaluations on multiple cryptocurrencies demonstrate that the SAC and DDPG agents outperform baseline strategies such as equal-weighted and mean--variance portfolios. The SAC algorithm, with its entropy-regularized objective, shows greater stability and robustness in noisy market conditions compared to DDPG. These results highlight the potential of deep reinforcement learning for adaptive and data-driven portfolio management in cryptocurrency markets.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.