Aprendizado por reforço para gestão de carteiras de criptomoedas
Resumo
Este artigo propõe o uso de Soft Actor-Critic (SAC) e Deep Deterministic Policy Gradient (DDPG) para gerir carteiras de criptomoedas. Os agentes aprendem ações contínuas de trading em um ambiente simulado com dados históricos de mercado, ajustando os pesos da carteira para buscar retornos acumulados enquanto consideram o risco de queda e os custos de transação. SAC usa um objetivo regularizado por entropia, que o artigo associa a maior estabilidade em condições ruidosas.
Experimentos com várias criptomoedas relatam que ambos os agentes superam as referências de carteiras com pesos iguais e média-variância, sendo SAC mais estável e robusto que DDPG. O resumo não especifica os ativos, o período da amostra, as hipóteses de mercado, o modelo de custos de transação ou os resultados numéricos. Como as evidências vêm de uma avaliação experimental com dados históricos e um ambiente simulado, elas não demonstram, por si só, que os métodos terão desempenho semelhante no trading ao vivo ou em diferentes condições de mercado.
Ideias principais
- Agentes SAC e DDPG aprendem ações contínuas para a carteira a partir de dados históricos de mercado em um ambiente simulado.
- Os agentes ajustam os pesos da carteira considerando retornos, risco de queda e custos de transação.
- O artigo relata desempenho superior às referências de pesos iguais e média-variância em várias criptomoedas.
- Segundo o relato, SAC é mais estável que DDPG em condições de mercado ruidosas.
- O resumo não apresenta a configuração experimental nem detalhes numéricos de desempenho.
Tags
Texto completo
# 2511.20678 # Cryptocurrency Portfolio Management with Reinforcement Learning: Soft Actor--Critic and Deep Deterministic Policy Gradient Algorithms This paper proposes a reinforcement learning--based framework for cryptocurrency portfolio management using the Soft Actor--Critic (SAC) and Deep Deterministic Policy Gradient (DDPG) algorithms. Traditional portfolio optimization methods often struggle to adapt to the highly volatile and nonlinear dynamics of cryptocurrency markets. To address this, we design an agent that learns continuous trading actions directly from historical market data through interaction with a simulated trading environment. The agent optimizes portfolio weights to maximize cumulative returns while minimizing downside risk and transaction costs. Experimental evaluations on multiple cryptocurrencies demonstrate that the SAC and DDPG agents outperform baseline strategies such as equal-weighted and mean--variance portfolios. The SAC algorithm, with its entropy-regularized objective, shows greater stability and robustness in noisy market conditions compared to DDPG. These results highlight the potential of deep reinforcement learning for adaptive and data-driven portfolio management in cryptocurrency markets.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.