Zum Inhalt springen
Alle Bibliotheksdokumente

Nuklearnorm-Belohnungen für Reinforcement Learning im Trading

Artikel MQL5 articles

Zusammenfassung

Der Artikel stellt die Maximierung der Nuklearnorm als intrinsische Belohnung für Reinforcement-Learning-Agenten vor, die Umgebungen mit spärlichen externen Belohnungen erkunden. Dazu bildet er eine Matrix aus kodierten Darstellungen eines besuchten Zustands und seiner nächsten Nachbarzustände und verwendet die Nuklearnorm als kontinuierliches Maß für die Zustandsvielfalt. Die vorgeschlagene Belohnung normalisiert diesen Wert anhand der Frobeniusnorm der Matrix, um den Einfluss niedriger Entropie zu begrenzen und die Belohnungsskala an die Matrixdimensionen anzupassen. Der Ansatz wird in RE3 integriert, das bereits einen Encoder und nächste Zustände verwendet, ergänzt um einen zufälligen Faltungsencoder und zerlegte Trading-Belohnungen.

Der Artikel verweist auf frühere Forschung, die eine bessere Erkundungsleistung als bei anderen Methoden berichtet, auch bei hinzugefügtem Rauschen. In der eigenen Trading-Implementierung führte der Test Berichten zufolge zu vielfältigerem Agentenverhalten als bei einfachem RE3, aber auch zu chaotischerem Trading; der gemeldete Profitfaktor betrug 1.02. Der Autor sagt, dass die Balance zwischen Erkundung und Ausnutzung weiterhin ungelöst ist. Diese Ergebnisse beziehen sich auf das beschriebene Experiment und belegen weder eine Übertragbarkeit der Methode noch ihre Profitabilität im Live-Handel.

Kernaussagen

  • Die Methode verwendet die Nuklearnorm als kontinuierliches Maß für die Vielfalt kodierter benachbarter Zustände.
  • Die intrinsische Belohnung wird durch die Frobeniusnorm normalisiert, um den Einfluss niedriger Entropie zu verringern und ihre Skala zu kontrollieren.
  • Der Artikel integriert die Belohnung mit einem zufälligen Faltungsencoder und zerlegten Trading-Belohnungen in RE3.
  • Das gemeldete Trading-Experiment erzeugte vielfältigeres, aber chaotischeres Verhalten als einfaches RE3, mit einem Profitfaktor von 1.02.
  • Die Balance zwischen Erkundung und Ausnutzung bleibt in der Implementierung ein offenes Problem.

Schlagwörter

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.