Zum Inhalt springen
Alle Bibliotheksdokumente

Deep Q-Learning für Trading: Bellman-Updates und Experience Replay

Artikel MQL5 articles

Zusammenfassung

Dieser Artikel stellt Deep Q-Learning als Reinforcement-Learning-Methode vor, bei der ein neuronales Netz Aktionswerte aus den Zuständen einer Umgebung schätzt. Er erklärt, dass der Agent aus Übergängen zwischen Zustand, Aktion, Belohnung und Folgezustand lernt und Aktionen anhand geschätzter künftiger Renditen auswählt, die mit einem Faktor abgezinst werden. Das Bellman-Update verknüpft den Wert einer aktuellen Aktion mit ihrer Belohnung und dem höchsten geschätzten Wert im Folgezustand.

Der Artikel beschreibt Experience Replay als Möglichkeit, die Auswirkungen korrelierter aufeinanderfolgender Beobachtungen zu verringern: Übergänge werden in einem begrenzten Puffer gespeichert, anschließend wird anhand zufällig ausgewählter vergangener Stichproben trainiert. Außerdem nennt er ein Zielnetz als weitere Komponente von DQN, doch der bereitgestellte Text bricht ab, bevor es ausführlich erklärt wird. In der Einleitung werden die Atari-Ergebnisse von DeepMind angeführt. Im Fazit berichtet der Autor, dass Tests seines Trading-Modells auf die Machbarkeit hindeuten, nennt hier aber keine konkreten Leistungskennzahlen. Diese Aussagen belegen weder Robustheit noch Profitabilität im Live-Handel; die Methode muss für den vorgesehenen Markt und die verwendeten Daten sorgfältig bewertet werden.

Kernaussagen

  • Eine Q-Funktion schätzt anhand der bisherigen Erfahrungen des Agenten den Wert einer Aktion in einem bestimmten Zustand.
  • Deep Q-Learning nutzt ein neuronales Netz, um Aktionswerte ohne eine endliche Zustandstabelle anzunähern.
  • Ein Diskontfaktor gewichtet erwartete Belohnungen geringer, je weiter sie in der Zukunft liegen.
  • Bellman-Updates kombinieren beobachtete Belohnungen mit dem höchsten geschätzten Wert des Folgezustands.
  • Experience Replay speichert Übergänge und trainiert mit Zufallsstichproben, um aufeinanderfolgende Korrelationen zu verringern.

Schlagwörter

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.