Aprendizaje por refuerzo para carteras cripto de futuros, préstamo y cortos
Resumen
El estudio propone un gestor de carteras de aprendizaje por refuerzo para un contexto de alto riesgo. Combina operaciones en ambos sentidos con préstamos y financiación, usa una recompensa basada en pérdidas y ganancias y busca mejorar la gestión del riesgo bajista y el uso del capital. La implementación combina un agente Soft Actor-Critic con una red convolucional y atención multicabezal. La cartera contiene criptoactivos negociados en futuros perpetuos, usa USDT para prestar y financiarse, y se rebalancea periódicamente según datos recientes del mercado.
El modelo se evalúa en dos periodos con distintas condiciones de volatilidad, y los autores informan de un rendimiento superior al de las referencias, sobre todo en escenarios de alta volatilidad. El fragmento no identifica las referencias, no ofrece medidas detalladas de riesgo ni explica cómo trata los costes de transacción. Tampoco aporta evidencia más allá de esas pruebas históricas. Por tanto, los resultados describen la evaluación comunicada y no demuestran que el enfoque vaya a seguir siendo rentable en otros periodos o en la operativa real.
Ideas clave
- El gestor de carteras combina operaciones largas y cortas con préstamos y financiación.
- La recompensa basada en pérdidas y ganancias busca respaldar la gestión del riesgo bajista y la asignación de capital.
- La implementación usa Soft Actor-Critic con una red convolucional y atención multicabezal.
- El modelo se evalúa en una cartera diversificada de futuros perpetuos cripto con rebalanceo periódico.
- La ventaja comunicada frente a las referencias es mayor en periodos de prueba con alta volatilidad, pero los límites de generalización no están claros.
Etiquetas
Texto completo
# Optimizing Portfolio with Two-Sided Transactions and Lending: A Reinforcement Learning Framework # Optimizing Portfolio with Two-Sided Transactions and Lending: A Reinforcement Learning Framework This study presents a Reinforcement Learning (RL)-based portfolio management model tailored for high-risk environments, addressing the limitations of traditional RL models and exploiting market opportunities through two-sided transactions and lending. Our approach integrates a new environmental formulation with a Profit and Loss (PnL)-based reward function, enhancing the RL agent's ability in downside risk management and capital optimization. We implemented the model using the Soft Actor-Critic (SAC) agent with a Convolutional Neural Network with Multi-Head Attention (CNN-MHA). This setup effectively manages a diversified 12-crypto asset portfolio in the Binance perpetual futures market, leveraging USDT for both granting and receiving loans and rebalancing every 4 hours, utilizing market data from the preceding 48 hours. Tested over two 16-month periods of varying market volatility, the model significantly outperformed benchmarks, particularly in high-volatility scenarios, achieving higher return-to-risk ratios and demonstrating robust profitability. These results confirm the model's effectiveness in leveraging market dynamics and managing risks in volatile environments like the cryptocurrency market.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.