Saltar al contenido
Todos los documentos de la biblioteca

Aprendizaje por refuerzo para gestionar carteras de criptomonedas

Artículo arXiv papers · Autor: Kamal Paykan

Resumen

Este artículo propone usar Soft Actor-Critic (SAC) y Deep Deterministic Policy Gradient (DDPG) para gestionar carteras de criptomonedas. Los agentes aprenden acciones de trading continuas en un entorno simulado con datos históricos de mercado y ajustan las ponderaciones de la cartera para buscar rentabilidad acumulada teniendo en cuenta el riesgo bajista y los costes de transacción. SAC usa un objetivo regularizado por entropía, que el artículo relaciona con una mayor estabilidad en condiciones ruidosas.

Los experimentos con varias criptomonedas comunican que ambos agentes superan a los referentes de cartera equiponderada y de media-varianza, y que SAC es más estable y robusto que DDPG. El resumen no especifica los activos, el periodo de la muestra, los supuestos de mercado, el modelo de costes de transacción ni los resultados numéricos. Como la evidencia procede de una evaluación experimental con datos históricos y un entorno simulado, por sí sola no demuestra que los métodos vayan a rendir de forma similar en trading real o en otras condiciones de mercado.

Ideas clave

  • Los agentes SAC y DDPG aprenden acciones continuas para la cartera a partir de datos históricos de mercado en un entorno simulado.
  • Los agentes ajustan las ponderaciones de la cartera teniendo en cuenta la rentabilidad, el riesgo bajista y los costes de transacción.
  • El artículo comunica un mejor rendimiento que los referentes equiponderado y de media-varianza con varias criptomonedas.
  • Se informa que SAC es más estable que DDPG en condiciones de mercado ruidosas.
  • El resumen no ofrece detalles del diseño experimental ni cifras de rendimiento.

Etiquetas

Texto completo
# 2511.20678


# Cryptocurrency Portfolio Management with Reinforcement Learning: Soft Actor--Critic and Deep Deterministic Policy Gradient Algorithms









This paper proposes a reinforcement learning--based framework for cryptocurrency portfolio management using the Soft Actor--Critic (SAC) and Deep Deterministic Policy Gradient (DDPG) algorithms. Traditional portfolio optimization methods often struggle to adapt to the highly volatile and nonlinear dynamics of cryptocurrency markets. To address this, we design an agent that learns continuous trading actions directly from historical market data through interaction with a simulated trading environment. The agent optimizes portfolio weights to maximize cumulative returns while minimizing downside risk and transaction costs. Experimental evaluations on multiple cryptocurrencies demonstrate that the SAC and DDPG agents outperform baseline strategies such as equal-weighted and mean--variance portfolios. The SAC algorithm, with its entropy-regularized objective, shows greater stability and robustness in noisy market conditions compared to DDPG. These results highlight the potential of deep reinforcement learning for adaptive and data-driven portfolio management in cryptocurrency markets.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.