Zum Inhalt springen
Alle Bibliotheksdokumente

Deep Reinforcement Learning mit dynamischen spektralen Risikomaßen

Artikel arXiv papers · Autor: Anthony Coache et al.

Zusammenfassung

Das Dokument stellt einen risikosensitiven Reinforcement-Learning-Ansatz vor, bei dem ein Agent zeitkonsistente dynamische spektrale Risikomaße optimiert. Mit bedingter Elicitierbarkeit werden strikt konsistente Bewertungsfunktionen konstruiert, die bei der Schätzung als Strafterme dienen. Tiefe neuronale Netze schätzen die Risikomaße. Die Autoren beweisen, dass sich diese Klasse von Maßen mit solchen Netzen beliebig genau approximieren lässt.

Der Ansatz umfasst außerdem einen Actor-Critic-Algorithmus, der aus vollständigen Episoden lernt, ohne verschachtelte Übergänge hinzuzufügen. Die Autoren vergleichen ihn anhand zweier Anwendungen – statistische Arbitrage und Portfolioallokation – mit einem verschachtelten Simulationsansatz und verwenden dafür sowohl simulierte als auch reale Daten. Die Beschreibung enthält keine numerischen Ergebnisse oder Implementierungsdetails und keine Angaben zu den realen Datensätzen. Sie ermöglicht daher ein Verständnis des Designs und des beschriebenen Evaluierungsumfangs, aber keine Beurteilung von Leistungsgewinnen oder Robustheit. Die Methode ist für Portfolioentscheidungen relevant, bei denen neben dem erwarteten Ertrag auch die Kontrolle der Verlustverteilung zählt.

Kernaussagen

  • Der Ansatz optimiert zeitkonsistente dynamische spektrale Risikomaße im Reinforcement Learning.
  • Bedingte Elicitierbarkeit liefert strikt konsistente Bewertungsfunktionen, die als Strafterme bei der Schätzung dienen.
  • Tiefe neuronale Netze schätzen die Risikomaße; für die Maßklasse wird ein Approximationsresultat angegeben.
  • Die Actor-Critic-Methode verwendet vollständige Episoden und vermeidet zusätzliche verschachtelte Übergänge.
  • Der Vergleich umfasst verschachtelte Simulation, statistische Arbitrage und Portfolioallokation mit simulierten und realen Daten.

Schlagwörter

Volltext
# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning


# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning









We propose a novel framework to solve risk-sensitive reinforcement learning (RL) problems where the agent optimises time-consistent dynamic spectral risk measures. Based on the notion of conditional elicitability, our methodology constructs (strictly consistent) scoring functions that are used as penalizers in the estimation procedure. Our contribution is threefold: we (i) devise an efficient approach to estimate a class of dynamic spectral risk measures with deep neural networks, (ii) prove that these dynamic spectral risk measures may be approximated to any arbitrary accuracy using deep neural networks, and (iii) develop a risk-sensitive actor-critic algorithm that uses full episodes and does not require any additional nested transitions. We compare our conceptually improved reinforcement learning algorithm with the nested simulation approach and illustrate its performance in two settings: statistical arbitrage and portfolio allocation on both simulated and real data.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.