Перейти к содержимому
Все документы библиотеки

PPO: обучение с подкреплением для высокочастотной торговли акциями

Статья arXiv papers · Автор: Antonio Briola et al.

Сводка

В документе описан сквозной подход к активной высокочастотной торговле акциями на основе глубокого обучения с подкреплением. Агенты используют проксимальную оптимизацию политики для торговли одной акцией Intel, а их состояния формируются из разных наборов признаков книги лимитных заявок. Для повышения отношения сигнал/шум отбираются обучающие данные с крупными изменениями цены; один непрерывный месяц оставлен для валидации, а следующий отдельный месяц — для тестирования. Гиперпараметры настраиваются последовательной оптимизацией на основе моделей.

Авторы сообщают, что агенты находят повторяющиеся паттерны в книге заявок и показывают устойчивую положительную доходность в тестовом периоде, несмотря на шумные и меняющиеся условия. Это результат узкого эксперимента с одной акцией на протяжении короткого ряда месяцев. В описании нет статистики доходности, транзакционных издержек, сравнений с бенчмарками или свидетельств того, что выученное поведение сохраняется в другие периоды, на других активах и при реальном исполнении. Отбор обучающих примеров по движению цены также может влиять на то, чему обучаются агенты, поэтому заявленный результат не следует считать широким доказательством прибыльности.

Ключевые идеи

  • Агенты используют проксимальную оптимизацию политики для торговли одной единицей одного актива.
  • Представления состояний различаются набором включённых признаков книги лимитных заявок.
  • В обучении приоритет отдан примерам с крупными движениями цен; периоды валидации и тестирования выделены отдельно.
  • Гиперпараметры настраиваются последовательной оптимизацией на основе моделей.
  • Сообщается о положительной доходности на тесте, но более широкая обобщаемость и издержки исполнения не установлены.

Теги

Полный текст
# Deep Reinforcement Learning for Active High Frequency Trading


# Deep Reinforcement Learning for Active High Frequency Trading









We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.