Zum Inhalt springen
Alle Bibliotheksdokumente

Belohnungen im Reinforcement Learning für Trading-Agenten zerlegen

Artikel MQL5 articles

Zusammenfassung

Dieser Artikel beschreibt die Zerlegung von Belohnungen im Reinforcement Learning und deren Implementierung in einer Soft-Actor-Critic-Variante mit der DICE-Methode. Statt eine einzige Wertfunktion für eine zusammengesetzte Belohnung zu lernen, schätzt der Agent den Wert jeder einzelnen Belohnungskomponente. Eine gewichtete Kombination unterstützt dann die Policy-Optimierung und den Vergleich verschiedener Prioritäten für Belohnungen. Die Komponenten können außerdem dabei helfen, zu diagnostizieren, welche Teile des Belohnungssignals das Verhalten beeinflussen.

Die Erörterung hebt Implementierungsprobleme hervor: Das Training mehrerer Wertschätzungen erhöht die Komplexität, während unabhängig berechnete komponentenweise Mindestschätzungen der Kritiker ein Ungleichgewicht erzeugen können. Der beschriebene Ansatz wählt stattdessen den Kritiker mit dem niedrigeren Gesamtwert aus und verwendet dessen Komponentenschätzungen. Außerdem setzt er Conflict-Averse Gradient Descent ein, um konkurrierende Optimierungsziele zu behandeln. Der Artikel berichtet, dass die Implementierung sowohl mit Trainingsdaten als auch mit Out-of-Sample-Daten Gewinne erzielte, bezeichnet die Ergebnisse jedoch als unzureichend und regt Experimente mit Belohnungskomponenten an. Dies ist ein berichtetes Ergebnis und kein Beleg für robuste Leistung über verschiedene Märkte oder Einstellungen hinweg.

Kernaussagen

  • Bei der Belohnungszerlegung wird für jede Komponente einer zusammengesetzten Belohnung eine eigene Wertschätzung trainiert.
  • Eine gewichtete Summe der Komponentenwerte kann das Gesamtziel rekonstruieren und den Vergleich verschiedener Prioritäten ermöglichen.
  • Komponentenweise Mindestschätzungen der Kritiker können das Training aus dem Gleichgewicht bringen; stattdessen wird vorgeschlagen, einen Kritiker anhand seiner Gesamtschätzung auszuwählen.
  • Conflict-Averse Gradient Descent kombiniert Komponentengradienten, um konkurrierende Optimierungsziele zu behandeln.
  • Die berichteten SAC+DICE-Ergebnisse waren innerhalb und außerhalb der Stichprobe profitabel, doch der Artikel bezeichnet sie als vorläufig.

Schlagwörter

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.