Passer au contenu
Tous les documents de la bibliothèque

Apprentissage par renforcement robuste et sensible au risque pour les stratégies de portefeuille

Article arXiv papers · Auteur: Sebastian Jaimungal et al.

Résumé

Ce travail développe une approche d’apprentissage par renforcement pour optimiser des politiques selon des critères de performance tenant compte du risque. Il évalue les politiques à l’aide de l’utilité espérée dépendante du rang, qui permet à un agent d’exprimer différentes préférences concernant les gains et les pertes. Pour tenir compte de l’incertitude du modèle, la politique est évaluée selon la distribution des rendements la plus défavorable à l’intérieur d’une boule de distance de Wasserstein autour de la distribution modélisée. Il en résulte un problème de décision imbriqué : l’agent choisit une politique, puis un adversaire sélectionne une distribution voisine qui en dégrade la performance.

Les auteurs dérivent des formules de gradient de politique pour les problèmes de sélection de politique et de distribution adversariale. Ils démontrent la méthode sur l’allocation robuste de portefeuille, l’optimisation par rapport à un indice de référence et l’arbitrage statistique. Ces applications illustrent le champ d’application visé par le cadre, mais le document ne donne aucun chiffre comparatif de performance, aucun détail sur les données de marché ni aucun conseil pratique de mise en œuvre. Son utilité dépend donc d’une validation plus poussée du modèle, de l’ensemble d’incertitude et des préférences en matière de risque dans un contexte de trading précis.

Idées clés

  • L’utilité espérée dépendante du rang permet aux politiques d’encoder différents compromis entre gains et risque de baisse.
  • Le cadre évalue chaque politique selon la distribution la plus défavorable dans un voisinage de Wasserstein.
  • Un problème interne adversarial cherche une distribution qui réduit la performance de la politique choisie.
  • Les auteurs dérivent des gradients de politique pour l’optimisation de la politique et le problème adversarial.
  • Les démonstrations portent sur l’allocation de portefeuille, l’optimisation par rapport à un indice de référence et l’arbitrage statistique.

Étiquettes

Texte intégral
# Robust Risk-Aware Reinforcement Learning


# Robust Risk-Aware Reinforcement Learning









We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.