Passer au contenu
Tous les documents de la bibliothèque

Objectifs de risque convexes et apprentissage par renforcement pour le trading

Article arXiv papers · Auteur: Shanyu Han et al.

Résumé

Cet article présente un cadre d’apprentissage par renforcement pour les problèmes de décision dont les objectifs de risque s’expriment au moyen de fonctions de score convexes. Le cadre peut représenter des mesures telles que la variance, la perte extrême moyenne et la valeur à risque entropique, ainsi que l’utilité moyenne-risque. Il vise à rendre ces objectifs applicables dans le temps, car l’optimisation du risque peut entraîner une incohérence temporelle : une politique privilégiée auparavant peut ne plus l’être à une étape de décision ultérieure.

Pour y remédier, les auteurs augmentent l’état avec une variable auxiliaire et reformulent le problème comme une optimisation à deux états. Ils décrivent un algorithme Actor-Critic personnalisé, des garanties théoriques d’approximation qui ne nécessitent pas de processus de décision de Markov continu, ainsi qu’une procédure d’échantillonnage avec variable auxiliaire inspirée de la minimisation alternée. L’article rapporte des expériences de simulation, notamment une application à l’arbitrage statistique, pour étayer l’efficacité de la méthode. La description disponible ne donne aucun résultat numérique ni détail sur le dispositif expérimental, et la convergence de la méthode d’échantillonnage dépend des hypothèses énoncées ; les performances pratiques au-delà des simulations testées restent donc incertaines.

Idées clés

  • Les fonctions de score convexes permettent d’intégrer plusieurs mesures de risque courantes à un objectif d’apprentissage par renforcement.
  • L’ajout d’une variable auxiliaire à l’état aide à traiter l’incohérence temporelle des décisions sensibles au risque.
  • La méthode Actor-Critic proposée s’accompagne de garanties d’approximation qui ne nécessitent pas un processus d’état continu.
  • Une méthode d’échantillonnage inspirée de la minimisation alternée est annoncée convergente sous certaines conditions.
  • Les expériences de simulation comprennent une application au trading d’arbitrage statistique.

Étiquettes

Texte intégral
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions


# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions









We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.