رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی عمیق برای اجرای سفارش محدود با سیگنال پیش‌بینی

مقاله arXiv papers · نویسنده: Peer Nagy et al.

خلاصه

این مطالعه از یادگیری تقویتی عمیق استفاده می‌کند تا پیش‌بینی کوتاه‌مدت معامله را به تصمیم‌های ثبت سفارش محدود و موجودی در دفتر سفارش محدود تبدیل کند. عامل را در محیط شبیه‌سازی‌شده سهام NASDAQ و بر پایه پیام‌های تاریخی دفتر سفارش، با شبیه‌ساز ABIDES آموزش می‌دهد. عامل دفتر فعلی، تاریخچه اخیر بازار و سیگنال جهت را مشاهده می‌کند و سپس با یادگیری Q دوگانه دوئلینگ عمیق و بازپخش تجربه ناهمگامِ اولویت‌بندی‌شده، سیاست اجرا را می‌آموزد.

برای ارزیابی اجرا به‌طور مستقل از هر روش پیش‌بینی خاص، پژوهشگران سیگنال‌های آلفای مصنوعی با درجات مختلف نویز را می‌آزمایند. گزارش می‌کنند که عامل آموزش‌دیده موجودی را مدیریت و سفارش‌ها را به‌طور مؤثر ثبت می‌کند و با دریافت همان سیگنال از استراتژی ابتکاری بهتر عمل می‌کند. این مقایسه در چارچوب شبیه‌ساز توصیف‌شده از روش اجرا پشتیبانی می‌کند، اما سند ارقام عملکرد یا شواهدی از نتایج بازار زنده ارائه نمی‌دهد. بنابراین کیفیت و واقع‌گرایی سیگنال‌های مصنوعی و محیط شبیه‌سازی‌شده، نتیجه‌گیری درباره به‌کارگیری را محدود می‌کنند.

ایده‌های کلیدی

  • عامل می‌آموزد پیش‌بینی جهت‌دار را به تصمیم‌های سفارش محدود و موجودی تبدیل کند.
  • آموزش از شبیه‌ساز دفتر سفارش محدود NASDAQ مبتنی بر پیام‌های تاریخی استفاده می‌کند.
  • عامل وضعیت دفتر، تاریخچه اخیر و پیش‌بینی کوتاه‌مدت را مشاهده می‌کند.
  • سیگنال‌های مصنوعی با نویز متفاوت به پژوهشگران اجازه می‌دهند اجرا را جدا از کیفیت پیش‌بینی بررسی کنند.
  • در شبیه‌سازی، سیاست آموخته‌شده با استفاده از همان سیگنال از روش ابتکاری بهتر عمل می‌کند، اما عملکرد زنده اثبات نشده است.

برچسب‌ها

متن کامل
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets


# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets









We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.