Saltar al contenido
Todos los documentos de la biblioteca

Gradiente de política determinista profundo para optimizar carteras

Artículo arXiv papers · Autor: Ayman Chaouki et al.

Resumen

Este trabajo comprueba si el aprendizaje por refuerzo profundo puede encontrar estrategias de negociación óptimas en entornos fáciles de describir, pero difíciles desde el punto de vista matemático. Los autores se centran en el gradiente de política determinista profundo, un método que aprende una política para elegir acciones interactuando con un entorno. Seleccionan contextos donde la estrategia óptima, o una aproximación cercana, ya se conoce, lo que permite comparar el comportamiento aprendido y la recompensa con una solución de referencia.

El resultado comunicado es que el agente recupera características esenciales de las estrategias conocidas y obtiene recompensas cercanas al óptimo. Esto aporta evidencia de que el algoritmo puede servir como método de resolución en los entornos probados. El extracto no identifica los modelos de mercado concretos, las restricciones de cartera, los procedimientos de entrenamiento ni las métricas de evaluación. Por tanto, la conclusión se limita a los contextos controlados elegidos y no demuestra rendimiento en mercados reales ruidosos, con costes de transacción o cuando se desconoce la política óptima.

Ideas clave

  • El estudio evalúa el aprendizaje por refuerzo profundo como método para encontrar estrategias de negociación óptimas.
  • Utiliza el gradiente de política determinista profundo en entornos matemáticamente complejos, pero conceptualmente sencillos.
  • Los entornos probados tienen estrategias óptimas conocidas o casi conocidas para poder compararlas.
  • El agente descrito recupera características clave de las estrategias y obtiene recompensas casi óptimas.
  • El extracto no demuestra rendimiento ante fricciones de mercado en mercados reales ni cuando se desconoce la política óptima.

Etiquetas

Texto completo
# Deep Deterministic Portfolio Optimization


# Deep Deterministic Portfolio Optimization









Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.