التعلم المعزز العميق لتنفيذ الأوامر المحددة بإشارات التوقع
الملخص
تستخدم الدراسة التعلم المعزز العميق لتحويل توقع تداول قصير الأجل إلى قرارات لوضع الأوامر المحددة وإدارة المخزون في دفتر أوامر محددة. وتدرّب وكيلًا في بيئة أسهم محاكاة لـ NASDAQ مبنية على رسائل دفتر الأوامر التاريخية، باستخدام محاكي ABIDES. يلاحظ الوكيل دفتر الأوامر الحالي وتاريخ السوق الحديث وإشارة اتجاهية، ثم يتعلم سياسة تنفيذ باستخدام التعلم Q المزدوج العميق المتبارز وإعادة تشغيل الخبرات غير المتزامنة ذات الأولوية.
لتقييم التنفيذ بمعزل عن أي طريقة توقع بعينها، يختبر الباحثون إشارات ألفا اصطناعية بمستويات مختلفة من الضوضاء. ويفيدون بأن الوكيل المتعلم يدير المخزون ويضع الأوامر بفاعلية، متفوقًا على استراتيجية استدلالية تستخدم الإشارة نفسها. تدعم هذه المقارنة طريقة التنفيذ ضمن المحاكي الموصوف، لكن الوثيقة لا تقدم أرقام أداء أو دليلًا على نتائج في سوق فعلي. لذلك تحد جودة الإشارات الاصطناعية والبيئة المحاكاة وواقعيتها من الاستنتاجات المتعلقة بالنشر.
الأفكار الرئيسية
- يتعلم الوكيل تحويل توقع اتجاهي إلى قرارات بشأن الأوامر المحددة والمخزون.
- يستخدم التدريب محاكي دفتر أوامر محددة لـ NASDAQ قائمًا على الرسائل التاريخية.
- يراقب الوكيل حالة دفتر الأوامر والتاريخ الحديث وتوقعًا قصير الأجل.
- تتيح الإشارات الاصطناعية متفاوتة الضوضاء للباحثين التركيز على التنفيذ بدلًا من جودة التوقع.
- في المحاكاة، تتفوق السياسة المتعلمة على استراتيجية استدلالية تستخدم الإشارة نفسها، لكن الأداء الفعلي في السوق غير مثبت.
الوسوم
النص الكامل
# Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets # Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets We employ deep reinforcement learning (RL) to train an agent to successfully translate a high-frequency trading signal into a trading strategy that places individual limit orders. Based on the ABIDES limit order book simulator, we build a reinforcement learning OpenAI gym environment and utilise it to simulate a realistic trading environment for NASDAQ equities based on historic order book messages. To train a trading agent that learns to maximise its trading return in this environment, we use Deep Duelling Double Q-learning with the APEX (asynchronous prioritised experience replay) architecture. The agent observes the current limit order book state, its recent history, and a short-term directional forecast. To investigate the performance of RL for adaptive trading independently from a concrete forecasting algorithm, we study the performance of our approach utilising synthetic alpha signals obtained by perturbing forward-looking returns with varying levels of noise. Here, we find that the RL agent learns an effective trading strategy for inventory management and order placing that outperforms a heuristic benchmark trading strategy having access to the same signal.
يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0
أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.