Passer au contenu
Tous les documents de la bibliothèque

Apprentissage par renforcement exploratoire pour le trading spéculatif et par paires

Article arXiv papers · Auteur: Yun Zhao et al.

Résumé

Cette étude formule le trading spéculatif comme un problème séquentiel d’arrêt optimal, où les moments d’entrée et de sortie sont choisis selon des fonctions d’utilité et des processus de prix généraux. Elle assouplit d’abord le problème d’arrêt en représentant les événements d’entrée et de sortie par des sauts de processus de Cox, dont les commandes d’intensité bornées sont sélectionnées par l’agent.

Dans la formulation d’apprentissage par renforcement exploratoire, les politiques randomisées placent des distributions de probabilité sur ces intensités, et l’entropie différentielle de Shannon régularise l’objectif. Les équations exploratoires de Hamilton-Jacobi-Bellman qui en résultent donnent des politiques optimales sous forme de Gibbs. Les auteurs établissent des estimations d’erreur et la convergence de l’objectif d’apprentissage vers la fonction de valeur du problème initial, puis présentent un algorithme appliqué au trading par paires. La description fournie ne donne ni données ni résultats de performance pour cette application, et la convergence annoncée concerne l’objectif modélisé plutôt qu’un résultat démontré en trading réel.

Idées clés

  • Le trading spéculatif est modélisé comme un problème d’arrêt optimal portant sur les moments d’entrée et de sortie.
  • Une formulation assouplie représente les événements d’arrêt par des sauts de processus de Cox régis par des intensités bornées.
  • Les politiques d’intensité randomisées sont régularisées par l’entropie différentielle de Shannon.
  • Le cadre déduit des équations HJB exploratoires et des politiques optimales sous forme de Gibbs.
  • Le travail établit des résultats d’erreur et de convergence, puis présente un algorithme de trading par paires.

Étiquettes

Texte intégral
# Reinforcement Learning for Speculative Trading under Exploratory Framework


# Reinforcement Learning for Speculative Trading under Exploratory Framework









We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.