Passer au contenu
Tous les documents de la bibliothèque

Apprentissage par renforcement PPO pour le trading haute fréquence actif | Stratmill

Article arXiv papers · Auteur: Antonio Briola et al.

Résumé

Le document décrit une approche complète d’apprentissage profond par renforcement pour le trading actif à haute fréquence d’actions. Les agents utilisent l’optimisation de politique proximale pour négocier une unité de l’action Intel, à partir d’états construits avec différents ensembles de caractéristiques du carnet d’ordres à cours limité. Les données d’entraînement sont sélectionnées en fonction de fortes variations de prix afin d’augmenter le rapport signal-bruit ; un mois consécutif est réservé à la validation, puis un mois distinct aux tests. Les hyperparamètres sont réglés par optimisation séquentielle fondée sur un modèle.

Les auteurs rapportent que les agents repèrent des schémas récurrents dans le carnet d’ordres et génèrent des rendements positifs stables pendant la période de test, malgré des conditions changeantes et bruitées. Il s’agit d’éléments issus d’une expérience de portée restreinte, sur une seule action et une courte série de mois. La description ne donne ni statistiques de rendement, ni coûts de transaction, ni comparaisons avec des références, ni preuve que le comportement appris résiste à d’autres périodes, actifs ou à l’exécution en réel. La sélection des échantillons d’entraînement selon les mouvements de prix peut également influencer l’apprentissage des agents ; le résultat rapporté ne doit donc pas être considéré comme une preuve générale de rentabilité.

Idées clés

  • Les agents utilisent l’optimisation de politique proximale pour négocier une unité d’une seule action.
  • Leurs représentations d’état varient selon les caractéristiques du carnet d’ordres à cours limité qu’elles incluent.
  • L’entraînement privilégie les échantillons comportant de fortes variations de prix, avec des périodes distinctes pour la validation et les tests.
  • Les hyperparamètres sont réglés par optimisation séquentielle fondée sur un modèle.
  • Des rendements positifs sont rapportés en test, mais la généralisation et les coûts d’exécution ne sont pas établis.

Étiquettes

Texte intégral
# Deep Reinforcement Learning for Active High Frequency Trading


# Deep Reinforcement Learning for Active High Frequency Trading









We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.