Zum Inhalt springen
Alle Bibliotheksdokumente

PPO-Reinforcement-Learning für aktives Hochfrequenz-Aktien-Trading

Artikel arXiv papers · Autor: Antonio Briola et al.

Zusammenfassung

Das Dokument beschreibt einen durchgängigen Deep-Reinforcement-Learning-Ansatz für aktives Hochfrequenz-Aktien-Trading. Agenten nutzen Proximal Policy Optimization, um eine Einheit der Intel-Aktie zu handeln. Ihre Zustände beruhen auf unterschiedlichen Kombinationen von Limit-Orderbuchmerkmalen. Die Trainingsdaten werden anhand großer Kursbewegungen ausgewählt, um das Signal-Rausch-Verhältnis zu erhöhen. Ein zusammenhängender Monat dient der Validierung, danach folgt ein separater Testmonat. Die Hyperparameter werden mit sequenzieller modellbasierter Optimierung abgestimmt.

Die Autoren berichten, dass die Agenten wiederkehrende Muster im Orderbuch finden und im Testzeitraum trotz rauschbehafteter, wechselnder Bedingungen stabile positive Renditen erzielen. Dies sind Belege aus einem eng begrenzten Experiment mit einer Aktie über eine kurze Abfolge von Monaten. Die Beschreibung enthält weder Renditekennzahlen noch Transaktionskosten, Benchmark-Vergleiche oder Belege dafür, dass das erlernte Verhalten in anderen Zeiträumen, bei anderen Vermögenswerten oder in der Live-Ausführung Bestand hat. Die Auswahl der Trainingsstichproben anhand von Kursbewegungen kann außerdem beeinflussen, was die Agenten lernen. Das berichtete Ergebnis sollte daher nicht als allgemeiner Nachweis der Profitabilität gelten.

Kernaussagen

  • Die Agenten nutzen Proximal Policy Optimization, um eine Einheit einer einzelnen Aktie zu handeln.
  • Ihre Zustandsdarstellungen unterscheiden sich darin, welche Limit-Orderbuchmerkmale sie enthalten.
  • Das Training verwendet bevorzugt Stichproben mit großen Kursbewegungen; Validierungs- und Testzeiträume sind getrennt.
  • Die Hyperparameter werden durch sequenzielle modellbasierte Optimierung abgestimmt.
  • Es werden positive Testrenditen berichtet, doch eine breitere Übertragbarkeit ist nicht belegt und es liegen keine Angaben zu Ausführungskosten vor.

Schlagwörter

Volltext
# Deep Reinforcement Learning for Active High Frequency Trading


# Deep Reinforcement Learning for Active High Frequency Trading









We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.