الانتقال إلى المحتوى
جميع مستندات المكتبة

تدرج السياسة الحتمي العميق لتحسين المحافظ

مقال arXiv papers · المؤلف: Ayman Chaouki et al.

الملخص

يختبر هذا العمل ما إذا كان التعلم المعزز العميق يستطيع استعادة استراتيجيات تداول مثلى في بيئات يسهل وصفها لكنها صعبة رياضيًا. ويركز المؤلفون على تدرج السياسة الحتمي العميق، وهي طريقة تتعلم سياسة لاختيار الأفعال عبر التفاعل مع البيئة. ويختارون حالات تكون فيها الاستراتيجية المثلى، أو تقريب قريب منها، معروفة مسبقًا، بما يسمح بمقارنة السلوك المتعلم والمكافأة بحل مرجعي.

والنتيجة المبلغ عنها هي أن الوكيل يستعيد السمات الأساسية للاستراتيجيات المعروفة ويحقق مكافآت قريبة من المثلى. ويوفر ذلك دليلًا على قدرة الخوارزمية على العمل كأداة حل في البيئات المختبرة. ولا يحدد المقتطف نماذج السوق بعينها أو قيود المحافظ أو إجراءات التدريب أو مقاييس التقييم. لذا يقتصر استنتاجه على الحالات المضبوطة المختارة، ولا يثبت الأداء في أسواق حية تتسم بضوضاء عشوائية أو مع تكاليف معاملات أو عندما تكون السياسة المثلى مجهولة.

الأفكار الرئيسية

  • تقيّم الدراسة التعلم المعزز العميق بوصفه أداة لحل مسائل استراتيجيات التداول.
  • تستخدم تدرج السياسة الحتمي العميق في بيئات صعبة رياضيًا لكنها بسيطة مفاهيميًا.
  • تملك البيئات المختبرة استراتيجيات مثلى معروفة أو شبه معروفة للمقارنة.
  • يستعيد الوكيل المبلغ عنه السمات الأساسية للاستراتيجية ويحقق مكافآت قريبة من المثلى.
  • لا يثبت المقتطف الأداء في ظل احتكاكات السوق الفعلية أو عند جهل السياسات المثلى.

الوسوم

النص الكامل
# Deep Deterministic Portfolio Optimization


# Deep Deterministic Portfolio Optimization









Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.