تعلم سياسات الترميز التلقائي من البداية إلى النهاية للمراجحة الإحصائية
الملخص
تستكشف هذه الدراسة استخدام المشفرات التلقائية للمراجحة الإحصائية في أسهم US. وفي سير العمل التقليدي ذي المرحلتين، يحدد نموذج تسعير أو مكونات رئيسية أصلاً اصطناعياً، ثم تنتج استراتيجية منفصلة للارتداد إلى المتوسط إشارات التداول. ويدرّب المؤلفون أولاً مشفراً تلقائياً معيارياً على عوائد الأسهم، ويبنون استراتيجيات حول عملية أورنشتاين–أولنبيك. ثم يدمجون المشفر التلقائي في تمثيل عصبي لسياسات المحافظ ينتج التوزيعات مباشرة.
يُدرّب النموذج المدمج من البداية إلى النهاية عبر تمرير العوائد المعدلة حسب المخاطر عكسياً، رابطاً بين تعلم التمثيل وقرارات المحفظة. وتفيد النتائج المبلغ عنها بأن هذا النهج يبسط تطوير الاستراتيجية ويحقق عوائد إجمالية أعلى من البدائل المقارنة. ولا تقدم الخلاصة فترة التقييم أو نتائج معدلة حسب المخاطر أو صافية من التكاليف أو تفاصيل المقارنة أو أدلة على الأداء خارج بيئة الدراسة. لذا فإن الميزة المبلغ عنها نتيجة بحثية، وليست ضماناً للربحية في التداول الفعلي.
الأفكار الرئيسية
- تطبق الورقة مشفرات تلقائية مدربة على عوائد أسهم US للمراجحة الإحصائية.
- يستخدم النهج الأساسي مشفراً تلقائياً لتحديد أصل اصطناعي واستراتيجية ارتداد إلى المتوسط من نوع أورنشتاين–أولنبيك.
- يدمج التصميم من البداية إلى النهاية المشفر التلقائي في شبكة تنتج توزيعات المحفظة مباشرة.
- يعتمد التدريب على التمرير العكسي لعوائد المحفظة المعدلة حسب المخاطر.
- يفيد المؤلفون بتحقيق عوائد إجمالية أعلى من البدائل، بينما لا تثبت الخلاصة الأداء الصافي أو الفعلي.
الوسوم
النص الكامل
# End-to-End Policy Learning of a Statistical Arbitrage Autoencoder Architecture # End-to-End Policy Learning of a Statistical Arbitrage Autoencoder Architecture In Statistical Arbitrage (StatArb), classical mean reversion trading strategies typically hinge on asset-pricing or PCA based models to identify the mean of a synthetic asset. Once such a (linear) model is identified, a separate mean reversion strategy is then devised to generate a trading signal. With a view of generalising such an approach and turning it truly data-driven, we study the utility of Autoencoder architectures in StatArb. As a first approach, we employ a standard Autoencoder trained on US stock returns to derive trading strategies based on the Ornstein-Uhlenbeck (OU) process. To further enhance this model, we take a policy-learning approach and embed the Autoencoder network into a neural network representation of a space of portfolio trading policies. This integration outputs portfolio allocations directly and is end-to-end trainable by backpropagation of the risk-adjusted returns of the neural policy. Our findings demonstrate that this innovative end-to-end policy learning approach not only simplifies the strategy development process, but also yields superior gross returns over its competitors illustrating the potential of end-to-end training over classical two-stage approaches.
يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0
أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.