یادگیری تقویتی عمیق برای اجرای سفارش محدود با سیگنال پیشبینی
خلاصه
این مطالعه از یادگیری تقویتی عمیق استفاده میکند تا پیشبینی کوتاهمدت معامله را به تصمیمهای ثبت سفارش محدود و موجودی در دفتر سفارش محدود تبدیل کند. عامل را در محیط شبیهسازیشده سهام NASDAQ و بر پایه پیامهای تاریخی دفتر سفارش، با شبیهساز ABIDES آموزش میدهد. عامل دفتر فعلی، تاریخچه اخیر بازار و سیگنال جهت را مشاهده میکند و سپس با یادگیری Q دوگانه دوئلینگ عمیق و بازپخش تجربه ناهمگامِ اولویتبندیشده، سیاست اجرا را میآموزد.
برای ارزیابی اجرا بهطور مستقل از هر روش پیشبینی خاص، پژوهشگران سیگنالهای آلفای مصنوعی با درجات مختلف نویز را میآزمایند. گزارش میکنند که عامل آموزشدیده موجودی را مدیریت و سفارشها را بهطور مؤثر ثبت میکند و با دریافت همان سیگنال از استراتژی ابتکاری بهتر عمل میکند. این مقایسه در چارچوب شبیهساز توصیفشده از روش اجرا پشتیبانی میکند، اما سند ارقام عملکرد یا شواهدی از نتایج بازار زنده ارائه نمیدهد. بنابراین کیفیت و واقعگرایی سیگنالهای مصنوعی و محیط شبیهسازیشده، نتیجهگیری درباره بهکارگیری را محدود میکنند.
ایدههای کلیدی
- عامل میآموزد پیشبینی جهتدار را به تصمیمهای سفارش محدود و موجودی تبدیل کند.
- آموزش از شبیهساز دفتر سفارش محدود NASDAQ مبتنی بر پیامهای تاریخی استفاده میکند.
- عامل وضعیت دفتر، تاریخچه اخیر و پیشبینی کوتاهمدت را مشاهده میکند.
- سیگنالهای مصنوعی با نویز متفاوت به پژوهشگران اجازه میدهند اجرا را جدا از کیفیت پیشبینی بررسی کنند.
- در شبیهسازی، سیاست آموختهشده با استفاده از همان سیگنال از روش ابتکاری بهتر عمل میکند، اما عملکرد زنده اثبات نشده است.
برچسبها
متن کامل
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets # Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.