Zum Inhalt springen
Alle Bibliotheksdokumente

Konvexe Risikoziele im bestärkenden Lernen für den Handel

Artikel arXiv papers · Autor: Shanyu Han et al.

Zusammenfassung

Diese Arbeit stellt einen Rahmen für bestärkendes Lernen bei Entscheidungsproblemen mit Risikozielen vor, die durch konvexe Bewertungsfunktionen ausgedrückt werden. Der Rahmen kann unter anderem Varianz, Expected Shortfall und entropischen Value at Risk sowie den Nutzen aus Rendite und Risiko abbilden. Im Mittelpunkt steht die Umsetzung solcher Ziele über die Zeit. Eine Risikooptimierung kann zeitliche Inkonsistenz erzeugen: Eine zunächst bevorzugte Strategie muss zu einem späteren Entscheidungszeitpunkt nicht mehr bevorzugt sein.

Um dies zu lösen, ergänzen die Autoren den Zustand um eine Hilfsvariable und formulieren das Problem als Optimierung mit zwei Zuständen neu. Sie beschreiben einen angepassten Actor-Critic-Algorithmus, theoretische Approximationsgarantien, die keinen kontinuierlichen Markov-Entscheidungsprozess voraussetzen, sowie ein von alternierender Minimierung inspiriertes Stichprobenverfahren mit Hilfsvariable. Als Beleg für die Wirksamkeit der Methode berichtet die Arbeit Simulationsexperimente, darunter eine Anwendung auf statistische Arbitrage. Die verfügbare Beschreibung enthält keine numerischen Ergebnisse oder detaillierten Angaben zum Versuchsaufbau. Die Konvergenz des Stichprobenverfahrens gilt zudem nur unter den genannten Annahmen. Die praktische Performance außerhalb der getesteten Simulationen bleibt daher unklar.

Kernaussagen

  • Konvexe Bewertungsfunktionen können verschiedene bekannte Risikomaße in einem Ziel für bestärkendes Lernen ausdrücken.
  • Eine Hilfsvariable im Zustand hilft, zeitliche Inkonsistenz bei risikosensitiven Entscheidungen zu berücksichtigen.
  • Für die vorgeschlagene Actor-Critic-Methode werden Approximationsgarantien angegeben, die keinen kontinuierlichen Zustandsprozess voraussetzen.
  • Das von alternierender Minimierung inspirierte Stichprobenverfahren soll unter bestimmten Bedingungen konvergieren.
  • Zu den Simulationsexperimenten gehört eine Anwendung auf den Handel mit statistischer Arbitrage.

Schlagwörter

Volltext
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions


# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions









We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.