Objetivos de riesgo convexos en aprendizaje por refuerzo para trading
Resumen
Este artículo presenta un marco de aprendizaje por refuerzo para problemas de decisión con objetivos de riesgo expresados mediante funciones de puntuación convexas. El marco puede representar medidas como la varianza, el déficit esperado y el valor en riesgo entrópico, además de la utilidad de media-riesgo. Se centra en hacer viables estos objetivos a lo largo del tiempo, donde optimizar el riesgo puede generar inconsistencia temporal: una política preferida al principio puede dejar de serlo en una decisión posterior.
Para abordar este problema, los autores amplían el estado con una variable auxiliar y reformulan la tarea como una optimización de dos estados. Describen un algoritmo Actor-Critic personalizado, garantías teóricas de aproximación que no requieren un proceso de decisión de Markov continuo y un procedimiento de muestreo con variable auxiliar inspirado en la minimización alternada. El artículo reporta experimentos de simulación, incluida una aplicación al arbitraje estadístico, como evidencia de la eficacia del método. La descripción disponible no ofrece resultados numéricos ni detalles del diseño experimental, y la convergencia del método de muestreo depende de los supuestos indicados; por tanto, no está claro su rendimiento práctico más allá de las simulaciones probadas.
Ideas clave
- Las funciones de puntuación convexas permiten expresar varias medidas de riesgo conocidas dentro de un objetivo de aprendizaje por refuerzo.
- Ampliar el estado con una variable auxiliar ayuda a abordar la inconsistencia temporal en decisiones sensibles al riesgo.
- El método Actor-Critic propuesto incluye garantías de aproximación que no requieren un proceso de estados continuo.
- Se afirma que un método de muestreo inspirado en la minimización alternada converge bajo ciertas condiciones.
- Los experimentos de simulación incluyen una aplicación al trading de arbitraje estadístico.
Etiquetas
Texto completo
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions # Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.