Saltar al contenido
Todos los documentos de la biblioteca

Aprendizaje profundo por refuerzo con medidas de riesgo espectral dinámicas que se pueden elicitar

Artículo arXiv papers · Autor: Anthony Coache et al.

Resumen

El documento presenta un marco de aprendizaje por refuerzo sensible al riesgo en el que un agente optimiza medidas de riesgo espectral dinámicas y coherentes en el tiempo. Utiliza la elicibilidad condicional para construir funciones de puntuación estrictamente consistentes, que actúan como penalizaciones durante la estimación. Las redes neuronales profundas estiman las medidas de riesgo y los autores demuestran que esta clase de medidas puede aproximarse con precisión arbitraria mediante dichas redes.

El marco también incluye un algoritmo actor-crítico que aprende a partir de episodios completos sin añadir transiciones anidadas. Los autores lo comparan con un enfoque de simulación anidada en dos aplicaciones: arbitraje estadístico y asignación de carteras, utilizando datos simulados y reales. La descripción no aporta resultados numéricos, detalles de implementación ni información sobre los conjuntos de datos reales, por lo que permite entender el diseño y el alcance declarado de la evaluación, pero no valorar las mejoras de rendimiento ni la robustez. El método es pertinente para decisiones de cartera en las que importa controlar la distribución de pérdidas además de la recompensa esperada.

Ideas clave

  • El marco optimiza medidas de riesgo espectral dinámicas y coherentes en el tiempo mediante aprendizaje por refuerzo.
  • La elicibilidad condicional proporciona funciones de puntuación estrictamente consistentes que se utilizan como penalizaciones de estimación.
  • Las redes neuronales profundas estiman las medidas de riesgo; se presenta un resultado de aproximación para esta clase de medidas.
  • El método actor-crítico utiliza episodios completos y evita añadir transiciones anidadas.
  • La comparación incluye simulación anidada, arbitraje estadístico y asignación de carteras con datos simulados y reales.

Etiquetas

Texto completo
# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning


# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning









We propose a novel framework to solve risk-sensitive reinforcement learning (RL) problems where the agent optimises time-consistent dynamic spectral risk measures. Based on the notion of conditional elicitability, our methodology constructs (strictly consistent) scoring functions that are used as penalizers in the estimation procedure. Our contribution is threefold: we (i) devise an efficient approach to estimate a class of dynamic spectral risk measures with deep neural networks, (ii) prove that these dynamic spectral risk measures may be approximated to any arbitrary accuracy using deep neural networks, and (iii) develop a risk-sensitive actor-critic algorithm that uses full episodes and does not require any additional nested transitions. We compare our conceptually improved reinforcement learning algorithm with the nested simulation approach and illustrate its performance in two settings: statistical arbitrage and portfolio allocation on both simulated and real data.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.