Zum Inhalt springen
Alle Bibliotheksdokumente

Deep Deterministic Policy Gradient zur Portfoliooptimierung

Artikel arXiv papers · Autor: Ayman Chaouki et al.

Zusammenfassung

Diese Arbeit prüft, ob tiefes bestärkendes Lernen in Umgebungen optimale Handelsstrategien finden kann, die sich einfach beschreiben lassen, mathematisch jedoch anspruchsvoll sind. Im Mittelpunkt steht Deep Deterministic Policy Gradient, eine Methode, die durch Interaktion mit einer Umgebung eine Handlungsstrategie erlernt. Die Autoren wählen Umgebungen, in denen die optimale Strategie oder eine gute Näherung bereits bekannt ist, sodass sich das gelernte Verhalten und die erzielte Belohnung mit einer Referenzlösung vergleichen lassen.

Als Ergebnis wird berichtet, dass der Agent wesentliche Merkmale der bekannten Strategien erfasst und nahezu optimale Belohnungen erzielt. Das liefert Hinweise darauf, dass der Algorithmus in den getesteten Umgebungen als Lösungsverfahren dienen kann. Der Auszug nennt weder die konkreten Marktmodelle und Portfoliobeschränkungen noch die Trainingsverfahren oder Bewertungskennzahlen. Die Schlussfolgerung beschränkt sich daher auf die gewählten kontrollierten Umgebungen und belegt keine Leistung in rauschbehafteten realen Märkten, bei Transaktionskosten oder wenn die optimale Strategie unbekannt ist.

Kernaussagen

  • Die Studie prüft tiefes bestärkendes Lernen als Lösungsverfahren für Handelsstrategien.
  • Sie verwendet Deep Deterministic Policy Gradient in mathematisch anspruchsvollen, aber konzeptionell einfachen Umgebungen.
  • In den getesteten Umgebungen sind optimale oder annähernd optimale Strategien zum Vergleich bekannt.
  • Der Agent erfasst laut Bericht wichtige Strategiemerkmale und erzielt nahezu optimale Belohnungen.
  • Der Auszug belegt keine Leistung unter Live-Marktfriktionen oder bei unbekannten optimalen Strategien.

Schlagwörter

Volltext
# Deep Deterministic Portfolio Optimization


# Deep Deterministic Portfolio Optimization









Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.