Aprendizaje profundo por refuerzo para crear mercado con criptomonedas
Resumen
El artículo presenta un marco de aprendizaje profundo por refuerzo para crear mercado con criptomonedas, en el que los agentes aprenden a gestionar inventario mientras interactúan con un entorno de trading simulado. El entorno representa las observaciones del mercado mediante datos del libro de órdenes limitadas y estadísticas de llegada del flujo de órdenes. Los agentes utilizan algoritmos de gradiente de políticas y una red neuronal de propagación hacia delante aproxima sus políticas o funciones de valor.
El experimento compara dos funciones de recompensa y evalúa combinaciones de agente y recompensa mediante los rendimientos diarios y medios de las operaciones. Los autores presentan el marco como una forma de abordar el problema estocástico de control de inventario al que se enfrentan los creadores de mercado. La descripción proporcionada no identifica los algoritmos específicos, las definiciones de recompensa, el conjunto de datos ni los resultados numéricos, por lo que no permite establecer cómo se trasladaría el rendimiento a mercados reales ni a otras condiciones de mercado.
Ideas clave
- El marco aplica aprendizaje profundo por refuerzo a la creación de mercado con criptomonedas.
- Los agentes observan información del libro de órdenes limitadas y estadísticas de llegada del flujo de órdenes.
- Los métodos de gradiente de políticas interactúan con el entorno de mercado mediante una red neuronal de propagación hacia delante.
- Se comparan dos funciones de recompensa usando los rendimientos diarios y medios de las operaciones.
- La aplicación indicada es el control estocástico de inventario para creadores de mercado, aunque la descripción proporcionada omite detalles de implementación y transferencia.
Etiquetas
Texto completo
# Deep Reinforcement Learning in Cryptocurrency Market Making # Deep Reinforcement Learning in Cryptocurrency Market Making This paper sets forth a framework for deep reinforcement learning as applied to market making (DRLMM) for cryptocurrencies. Two advanced policy gradient-based algorithms were selected as agents to interact with an environment that represents the observation space through limit order book data, and order flow arrival statistics. Within the experiment, a forward-feed neural network is used as the function approximator and two reward functions are compared. The performance of each combination of agent and reward function is evaluated by daily and average trade returns. Using this DRLMM framework, this paper demonstrates the effectiveness of deep reinforcement learning in solving stochastic inventory control challenges market makers face.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.