Saltar al contenido
Todos los documentos de la biblioteca

Aprendizaje por refuerzo robusto y consciente del riesgo para carteras

Artículo arXiv papers · Autor: Sebastian Jaimungal et al.

Resumen

Este trabajo desarrolla un enfoque de aprendizaje por refuerzo para optimizar políticas según criterios de rendimiento que tienen en cuenta el riesgo. Evalúa las políticas mediante utilidad esperada dependiente del rango, que permite a un agente expresar distintas preferencias por las ganancias y los resultados desfavorables. Para abordar la incertidumbre del modelo, evalúa la política con la distribución de rendimientos del peor caso dentro de una bola de distancia de Wasserstein en torno a la distribución modelada. Esto crea un problema de decisión anidado: el agente selecciona una política y después un adversario elige una distribución cercana que reduce su rendimiento.

Los autores derivan fórmulas de gradiente de política tanto para la selección de políticas como para los problemas de distribución adversaria. Demuestran el método en asignación robusta de carteras, optimización frente a un índice de referencia y arbitraje estadístico. Estas aplicaciones muestran el alcance previsto del marco, pero el documento no ofrece cifras de rendimiento comparativo, detalles de los datos de mercado ni orientación práctica para su implementación. Por tanto, su utilidad depende de una validación adicional del modelo, del conjunto de incertidumbre y de las preferencias de riesgo en un contexto de trading concreto.

Ideas clave

  • La utilidad esperada dependiente del rango permite que las políticas codifiquen distintas compensaciones entre ganancias y riesgo a la baja.
  • El marco evalúa cada política frente a una distribución del peor caso dentro de una vecindad de Wasserstein.
  • Un problema interno adversario busca una distribución que reduzca el rendimiento de la política elegida.
  • Los autores derivan gradientes de política para la optimización de políticas y el problema adversario.
  • Las demostraciones abarcan asignación de carteras, optimización frente a índices de referencia y arbitraje estadístico.

Etiquetas

Texto completo
# Robust Risk-Aware Reinforcement Learning


# Robust Risk-Aware Reinforcement Learning









We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.