Passer au contenu
Tous les documents de la bibliothèque

Récompense de curiosité par norme nucléaire en apprentissage par renforcement pour le trading

Article MQL5 articles

Résumé

L’article présente la maximisation de la norme nucléaire comme une récompense intrinsèque pour les agents d’apprentissage par renforcement qui explorent des environnements où les récompenses externes sont rares. Il forme une matrice à partir des représentations encodées d’un état visité et de ses états voisins les plus proches, puis utilise la norme nucléaire comme approximation continue de la diversité des états. La récompense proposée normalise cette mesure par la norme de Frobenius de la matrice afin de limiter l’influence d’une faible entropie et d’adapter l’échelle de la récompense aux dimensions de la matrice. L’approche est intégrée à RE3, qui utilise déjà un encodeur et les états voisins les plus proches, avec un encodeur convolutionnel aléatoire et des récompenses de trading décomposées.

L’article cite des recherches antérieures faisant état de meilleures performances d’exploration que d’autres méthodes, y compris avec l’ajout de bruit. Dans sa propre implémentation de trading, les tests auraient produit un comportement d’agent plus varié qu’avec RE3 seul, mais aussi un trading plus chaotique ; le facteur de profit rapporté était de 1.02. L’auteur indique que l’équilibre entre exploration et exploitation reste à trouver. Ces résultats sont propres à l’expérience décrite et ne démontrent pas que la méthode se généralise ou soit rentable sur les marchés réels.

Idées clés

  • La méthode utilise la norme nucléaire comme approximation continue de la diversité des états voisins encodés.
  • La récompense intrinsèque est normalisée par la norme de Frobenius afin de réduire l’influence d’une faible entropie et d’en contrôler l’échelle.
  • L’article intègre la récompense à RE3, avec un encodeur convolutionnel aléatoire et des récompenses de trading décomposées.
  • L’expérience de trading rapportée a produit un comportement plus varié, mais plus chaotique, qu’avec RE3 seul, avec un facteur de profit de 1.02.
  • Dans cette implémentation, l’équilibre entre exploration et exploitation reste une question ouverte.

Étiquettes

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.