Обучение с подкреплением и исследованием пространства действий для спекулятивной и парной торговли
Сводка
В исследовании спекулятивная торговля формулируется как задача последовательной оптимальной остановки: моменты входа и выхода выбираются при общих функциях полезности и процессах цен. Сначала задача остановки ослабляется: события входа и выхода представляются скачками процессов Кокса, а агент выбирает их ограниченные интенсивности.
В постановке исследовательского обучения с подкреплением рандомизированные политики задают распределения вероятностей для этих интенсивностей, а целевая функция регуляризуется дифференциальной энтропией Шеннона. Полученные исследовательские уравнения Гамильтона—Якоби—Беллмана дают оптимальные политики в форме Гиббса. Авторы устанавливают оценки погрешности и сходимость целевой функции обучения к функции ценности исходной задачи, а затем демонстрируют алгоритм на примере парной торговли. В представленном описании нет данных или результатов эффективности для этого примера; указанная сходимость относится к моделируемой целевой функции, а не к подтверждённому результату торговли на реальном счёте.
Ключевые идеи
- Спекулятивная торговля моделируется как задача оптимальной остановки с выбором времени входа и выхода.
- В ослабленной постановке события остановки представлены скачками процесса Кокса с ограниченными управляемыми интенсивностями.
- Рандомизированные политики интенсивности регуляризуются дифференциальной энтропией Шеннона.
- В рамках подхода выводятся уравнения для исследования пространства действий HJB и оптимальные политики в форме Гиббса.
- В работе получены результаты об ошибке и сходимости, а также продемонстрирован алгоритм для парной торговли.
Теги
Полный текст
# Reinforcement Learning for Speculative Trading under Exploratory Framework # Reinforcement Learning for Speculative Trading under Exploratory Framework We study a speculative trading problem within the exploratory reinforcement learning (RL) framework of Wang et al. [2020]. The problem is formulated as a sequential optimal stopping problem over entry and exit times under general utility function and price process. We first consider a relaxed version of the problem in which the stopping times are modeled by the jump times of Cox processes driven by bounded, non-randomized intensity controls. Under the exploratory formulation, the agent's randomized control is characterized via the probability measure over the jump intensities, and their objective function is regularized by Shannon's differential entropy. This yields a system of the exploratory HJB equations and Gibbs distributions in closed-form as the optimal policy. Error estimates and convergence of the RL objective to the value function of the original problem are established. Finally, an RL algorithm is designed, and its implementation is showcased in a pairs-trading application.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.