Aprendizaje por gradiente de política con medidas dinámicas de riesgo convexo
Resumen
El documento presenta un método de aprendizaje por refuerzo sin modelo para la optimización secuencial cuando los resultados se evalúan con medidas dinámicas de riesgo convexo. Utiliza un principio de programación dinámica coherente en el tiempo para valorar políticas y, después, deriva actualizaciones de gradiente de política para encontrar otras mejores. Propone un enfoque actor-crítico con redes neuronales para optimizar esas políticas.
El método se demuestra en tres tareas: trading de arbitraje estadístico, cobertura financiera y control de evitación de obstáculos para un robot. Esto muestra que el marco se aplica tanto en contextos financieros como no financieros, pero la descripción no proporciona cifras de rendimiento, métodos de comparación, supuestos de mercado ni detalles de implementación. Por tanto, expone la estructura de optimización y el ámbito de aplicación, pero no especifica pruebas sobre la eficacia del trading ni sus limitaciones prácticas.
Ideas clave
- Las medidas dinámicas de riesgo convexo ofrecen una forma de evaluar secuencias de resultados inciertos.
- Se utiliza programación dinámica coherente en el tiempo para valorar políticas candidatas.
- Las reglas de gradiente de política y un método actor-crítico con redes neuronales permiten optimizar las políticas.
- Las demostraciones incluyen arbitraje estadístico, cobertura financiera y evitación de obstáculos por un robot.
- La descripción disponible no ofrece resultados comparativos ni supuestos de implementación en mercados.
Etiquetas
Texto completo
# Reinforcement Learning with Dynamic Convex Risk Measures # Reinforcement Learning with Dynamic Convex Risk Measures We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.