Passer au contenu
Tous les documents de la bibliothèque

Apprentissage par gradient de politique avec mesures de risque convexes dynamiques

Article arXiv papers · Auteur: Anthony Coache et al.

Résumé

Le document présente une méthode d’apprentissage par renforcement sans modèle pour l’optimisation séquentielle lorsque les résultats sont évalués à l’aide de mesures de risque convexes dynamiques. Elle utilise un principe de programmation dynamique cohérent dans le temps pour évaluer les politiques, puis en déduit des mises à jour par gradient de politique afin de trouver de meilleures politiques. Une approche acteur-critique avec réseaux neuronaux est proposée pour optimiser ces politiques.

La méthode est illustrée sur trois tâches : l’arbitrage statistique en trading, la couverture financière et le contrôle d’évitement d’obstacles pour un robot. Cela montre que le cadre s’applique à des domaines financiers et non financiers, mais la description ne fournit ni chiffres de performance, ni méthodes de comparaison, ni hypothèses de marché, ni détails de mise en œuvre. Elle présente donc la structure d’optimisation et le champ d’application, sans préciser les éléments permettant d’évaluer l’efficacité du trading et ses limites pratiques.

Idées clés

  • Les mesures de risque convexes dynamiques permettent d’évaluer des séquences de résultats incertains.
  • La programmation dynamique cohérente dans le temps sert à évaluer les politiques envisagées.
  • Les règles de gradient de politique et une méthode acteur-critique par réseau neuronal facilitent l’optimisation des politiques.
  • Les démonstrations couvrent l’arbitrage statistique, la couverture financière et l’évitement d’obstacles par un robot.
  • La description disponible ne présente ni résultats comparatifs ni hypothèses de mise en œuvre sur les marchés.

Étiquettes

Texte intégral
# Reinforcement Learning with Dynamic Convex Risk Measures


# Reinforcement Learning with Dynamic Convex Risk Measures









We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.