Zum Inhalt springen
Alle Bibliotheksdokumente

Policy-Gradient-Reinforcement-Learning mit dynamischen konvexen Risikomaßen

Artikel arXiv papers · Autor: Anthony Coache et al.

Zusammenfassung

Das Dokument stellt ein modellfreies Reinforcement-Learning-Verfahren zur sequenziellen Optimierung vor, bei dem Ergebnisse anhand dynamischer konvexer Risikomaße bewertet werden. Es nutzt ein zeitkonsistentes dynamisches Programmierungsprinzip zur Bewertung von Policies und leitet anschließend Policy-Gradient-Updates ab, um bessere Policies zu finden. Zur Optimierung dieser Policies wird ein Actor-Critic-Ansatz mit neuronalen Netzen vorgeschlagen.

Die Methode wird an drei Aufgaben demonstriert: statistischem Arbitragehandel, finanzieller Absicherung und Hindernisvermeidung durch einen Roboter. Dies zeigt, dass das Framework sowohl auf finanzielle als auch auf nichtfinanzielle Bereiche angewandt wird. Die Beschreibung enthält jedoch weder Performancekennzahlen und Vergleichsmethoden noch Marktannahmen oder Implementierungsdetails. Sie vermittelt daher die Optimierungsstruktur und den Anwendungsbereich, lässt aber Nachweise zur Effektivität beim Trading und zu praktischen Einschränkungen offen.

Kernaussagen

  • Dynamische konvexe Risikomaße bieten eine Möglichkeit, Folgen unsicherer Ergebnisse zu bewerten.
  • Ein zeitkonsistentes dynamisches Programmierungsverfahren bewertet mögliche Strategien.
  • Policy-Gradient-Regeln und ein Actor-Critic-Verfahren mit neuronalen Netzen unterstützen die Strategieoptimierung.
  • Die Demonstrationen umfassen statistische Arbitrage, finanzielle Absicherung und die Hindernisvermeidung durch einen Roboter.
  • Die vorliegende Beschreibung nennt weder Vergleichsergebnisse noch Annahmen zur Umsetzung am Markt.

Schlagwörter

Volltext
# Reinforcement Learning with Dynamic Convex Risk Measures


# Reinforcement Learning with Dynamic Convex Risk Measures









We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.