شبكة كيو العميقة للتداول المدربة على مسارات سوق اصطناعية
الملخص
تقدم الورقة شبكة كيو العميقة للتداول (TDQN)، وهي نهج للتعلم المعزز العميق لاختيار مراكز سوق الأسهم بمرور الوقت. وتكيف طريقة DQN للتداول، وتجعل نسبة شارب مقياس الأداء الذي تسعى الاستراتيجية إلى تعظيمه. والهدف الموصوف هو إيجاد مراكز مناسبة أثناء التداول، لا مجرد تطبيق خوارزمية عامة للتعلم المعزز من دون تعديل.
يُدرَّب الوكيل باستخدام مسارات اصطناعية مولدة من مجموعة محدودة من بيانات الأسهم التاريخية. وتقترح الورقة أيضًا طريقة أشد صرامة لتقييم استراتيجيات التداول، وتفيد بنتائج واعدة لـTDQN وفق هذا التقييم. ولا يحدد الوصف الأسواق أو تفاصيل مجموعة البيانات أو الاستراتيجيات المرجعية أو النتائج العددية أو إجراءات التقييم، لذا لا يمكن الحكم على الأداء المبلغ عنه أو قابليته للتعميم من هذا النص وحده. وتشكل المسارات الاصطناعية والبيانات التاريخية المحدودة سمتين أساسيتين للنهج، لكن كيفية إنشائهما وآثارهما غير مشروحة هنا.
الأفكار الرئيسية
- يكيف TDQN التعلم العميق بطريقة كيو لاختيار مراكز التداول في أسواق الأسهم.
- صُممت الاستراتيجية لتعظيم الأداء المقاس بنسبة شارب.
- يستخدم التدريب مسارات اصطناعية مولدة من مجموعة بيانات تاريخية محدودة.
- تقترح الورقة طريقة أشد صرامة لتقييم الأداء وتفيد بنتائج واعدة.
- يغفل الوصف المتاح تفاصيل التنفيذ والأدلة العددية اللازمة لتقييم المتانة.
الوسوم
النص الكامل
# An Application of Deep Reinforcement Learning to Algorithmic Trading # An Application of Deep Reinforcement Learning to Algorithmic Trading This scientific research paper presents an innovative approach based on deep reinforcement learning (DRL) to solve the algorithmic trading problem of determining the optimal trading position at any point in time during a trading activity in stock markets. It proposes a novel DRL trading strategy so as to maximise the resulting Sharpe ratio performance indicator on a broad range of stock markets. Denominated the Trading Deep Q-Network algorithm (TDQN), this new trading strategy is inspired from the popular DQN algorithm and significantly adapted to the specific algorithmic trading problem at hand. The training of the resulting reinforcement learning (RL) agent is entirely based on the generation of artificial trajectories from a limited set of stock market historical data. In order to objectively assess the performance of trading strategies, the research paper also proposes a novel, more rigorous performance assessment methodology. Following this new performance assessment approach, promising results are reported for the TDQN strategy.
يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0
أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.