Exploratives Reinforcement Learning für spekulatives Trading und Pair Trading
Zusammenfassung
Diese Studie formuliert spekulatives Trading als sequenzielles optimal stopping Problem, bei dem Einstiegs- und Ausstiegszeitpunkte unter allgemeinen Nutzenfunktionen und Preisprozessen gewählt werden. Zunächst wird das Stoppzeitproblem gelockert, indem Einstiegs- und Ausstiegsereignisse als Sprünge von Cox-Prozessen dargestellt werden, deren begrenzte Intensitätssteuerungen der Agent auswählt.
In der explorativen Reinforcement-Learning-Formulierung legen randomisierte Strategien Wahrscheinlichkeitsverteilungen über diese Intensitäten fest; die differentielle Shannon-Entropie regularisiert die Zielfunktion. Die daraus entstehenden explorativen Hamilton-Jacobi-Bellman-Gleichungen liefern optimale Strategien in Gibbs-Form. Die Autoren leiten Fehlerabschätzungen und die Konvergenz der Lernzielfunktion zum Wert der ursprünglichen Problemstellung her und demonstrieren anschließend einen Algorithmus in einer Pair-Trading-Anwendung. Die vorliegende Beschreibung enthält keine Daten oder Leistungsergebnisse für diese Anwendung. Die angegebene Konvergenz betrifft die modellierte Zielfunktion und belegt kein Ergebnis im Live-Trading.
Kernaussagen
- Spekulatives Trading wird als Optimal-Stopping-Problem über Einstiegs- und Ausstiegszeitpunkte modelliert.
- Eine gelockerte Formulierung stellt Stoppereignisse als Sprünge von Cox-Prozessen mit begrenzten Intensitäten dar.
- Randomisierte Intensitätsstrategien werden mithilfe der differentiellen Shannon-Entropie regularisiert.
- Der Rahmen leitet explorative HJB-Gleichungen und optimale Strategien in Gibbs-Form her.
- Die Arbeit liefert Fehler- und Konvergenzergebnisse und demonstriert einen Algorithmus für Pair Trading.
Schlagwörter
Volltext
# Reinforcement Learning for Speculative Trading under Exploratory Framework # Reinforcement Learning for Speculative Trading under Exploratory Framework We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.
Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.