Перейти к содержимому
Все документы библиотеки

Глубокое обучение с подкреплением для исполнения лимитных ордеров с сигналами прогноза

Статья arXiv papers · Автор: Peer Nagy et al.

Сводка

В исследовании глубокое обучение с подкреплением используется для преобразования краткосрочного торгового прогноза в решения о размещении лимитных ордеров и управлении запасом в книге лимитных ордеров. Агент обучается в симулируемой среде торговли акциями NASDAQ, созданной на основе исторических сообщений книги ордеров с помощью симулятора ABIDES. Агент наблюдает за текущей книгой, недавней историей рынка и направленным сигналом, после чего обучает политику исполнения на основе Deep Double Duelling Q-learning и приоритетного асинхронного воспроизведения опыта.

Чтобы оценить исполнение отдельно от конкретного метода прогнозирования, исследователи проверяют синтетические альфа-сигналы с разными уровнями шума. По их сообщению, обученный агент эффективно управляет запасом и размещает ордера, превосходя эвристическую стратегию с тем же сигналом. Это сравнение подтверждает эффективность метода исполнения в описанном симуляторе, но в документе нет численных результатов или данных о торговле на реальном рынке. Поэтому качество и реалистичность синтетических сигналов и симулируемой среды ограничивают выводы о практическом применении.

Ключевые идеи

  • Агент учится преобразовывать направленный прогноз в решения о размещении лимитных ордеров и управлении запасом.
  • Для обучения используется симулятор книги лимитных ордеров NASDAQ, основанный на исторических сообщениях.
  • Агент наблюдает за состоянием книги ордеров, недавней историей и краткосрочным прогнозом.
  • Синтетические сигналы с разным уровнем шума позволяют исследователям сосредоточиться на исполнении, а не на качестве прогноза.
  • В симуляции обученная политика превосходит эвристическую стратегию с тем же сигналом, но её результаты на реальном рынке не установлены.

Теги

Полный текст
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets


# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets









We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.