Saltar al contenido
Todos los documentos de la biblioteca

Ensamblado de agentes de aprendizaje por refuerzo profundo para trading de acciones

Artículo arXiv papers · Autor: Hongyang Yang et al.

Resumen

El artículo describe un enfoque automatizado de trading de acciones que combina tres algoritmos de aprendizaje por refuerzo actor-crítico: Proximal Policy Optimization, Advantage Actor Critic y Deep Deterministic Policy Gradient. Los agentes se entrenan para aprender decisiones de trading con el objetivo de maximizar los rendimientos de la inversión, y sus puntos fuertes se integran en un ensamblado diseñado para adaptarse a distintas condiciones de mercado. También se utiliza una técnica de carga bajo demanda para procesar grandes volúmenes de datos y limitar el uso de memoria durante el entrenamiento con acciones continuas.

El enfoque se evalúa con acciones líquidas del universo Dow Jones y se compara con los algoritmos de aprendizaje individuales, el Dow Jones Industrial Average y una cartera de varianza mínima. El resultado comunicado es que el ensamblado obtiene un ratio de Sharpe superior al de esos métodos individuales y referencias. El fragmento no indica el periodo de evaluación, las restricciones detalladas de la cartera, los supuestos sobre costes de transacción ni las pruebas de robustez. Por tanto, la afirmación sobre el rendimiento debe entenderse dentro de la configuración de prueba indicada en el estudio y no como prueba de rendimientos futuros.

Ideas clave

  • La estrategia combina agentes actor-crítico PPO, A2C y DDPG en un ensamblado.
  • Los agentes aprenden decisiones de trading de acciones con el rendimiento de la inversión como objetivo.
  • Se utiliza el procesamiento de datos bajo demanda para reducir las necesidades de memoria durante el entrenamiento.
  • La evaluación compara el ensamblado con los métodos que lo componen, un índice de mercado y una cartera de varianza mínima.
  • Según el estudio, el ensamblado obtiene el ratio de Sharpe más alto en esas comparaciones, dentro de la configuración de prueba indicada.

Etiquetas

Texto completo
# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy


# Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy









Stock trading strategies play a critical role in investment. However, it is challenging to design a profitable strategy in a complex and dynamic stock market. In this paper, we propose an ensemble strategy that employs deep reinforcement schemes to learn a stock trading strategy by maximizing investment return. We train a deep reinforcement learning agent and obtain an ensemble trading strategy using three actor-critic based algorithms: Proximal Policy Optimization (PPO), Advantage Actor Critic (A2C), and Deep Deterministic Policy Gradient (DDPG). The ensemble strategy inherits and integrates the best features of the three algorithms, thereby robustly adjusting to different market situations. In order to avoid the large memory consumption in training networks with continuous action space, we employ a load-on-demand technique for processing very large data. We test our algorithms on the 30 Dow Jones stocks that have adequate liquidity. The performance of the trading agent with different reinforcement learning algorithms is evaluated and compared with both the Dow Jones Industrial Average index and the traditional min-variance portfolio allocation strategy. The proposed deep ensemble strategy is shown to outperform the three individual algorithms and two baselines in terms of the risk-adjusted return measured by the Sharpe ratio. This work is fully open-sourced at \href{https://github.com/AI4Finance-Foundation/Deep-Reinforcement-Learning-for-Automated-Stock-Trading-Ensemble-Strategy-ICAIF-2020}{GitHub}.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.