تعلم معزز متعدد الوكلاء يراعي الإنصاف لتنفيذ تداول الأسهم
الملخص
تبحث الورقة كيفية تنفيذ مكتب تداول أوامر عدة عملاء يطلبون الأصول نفسها عندما تختلف أحجام أوامرهم وآفاقهم الزمنية وتفضيلاتهم للمخاطر. وقد تحرك عمليات التنفيذ المبكرة الأسعار، لذا قد يؤدي تحسين إيرادات التداول الإجمالية إلى الإضرار بالعملاء الذين تُنفذ أوامرهم لاحقاً. ويستخدم الإطار المقترح التعلم المعزز متعدد الوكلاء لتطوير استراتيجيات للعملاء بصورة فردية مع موازنة نتائجهم ضمن المجموعة.
يجمع مؤشر جيني المعمم إيرادات العملاء، ويوفر وسيلة لضبط هدف الإنصاف إلى جانب تحسين الإيرادات. ويفيد المؤلفون بأدلة تجريبية على أن النهج يحسن الإنصاف مع الحفاظ على تحسين الإيرادات، ويرون أن التعلم المعزز يستطيع تكييف الاستراتيجيات مع تغير ظروف السوق. ولا يقدم الوصف المتاح مجموعة بيانات أو إعداداً تجريبياً أو نتائج رقمية أو تفاصيل المقارنة، لذا لا يمكن تقييم قوة الادعاء التجريبي ومدى تعميمه من هذا النص وحده.
الأفكار الرئيسية
- قد ينشأ تعارض في تنفيذ أوامر العملاء بين تعظيم إجمالي الإيرادات ومعاملتهم بإنصاف.
- قد تؤثر الأوامر المبكرة في الأسعار وترفع تكاليف التنفيذ اللاحق.
- يستخدم الإطار التعلم المعزز متعدد الوكلاء لتعلم استراتيجيات تنفيذ مخصصة للعملاء.
- يدمج مؤشر جيني المعمم الإنصاف التوزيعي في تجميع الإيرادات.
- تدعي الوثيقة تحسن الإنصاف مع الحفاظ على تحسين الإيرادات، لكنها تقدم تفاصيل قليلة لتقييم الأدلة.
الوسوم
النص الكامل
# Fairness in Multi-agent Reinforcement Learning for Stock Trading # Fairness in Multi-agent Reinforcement Learning for Stock Trading Unfair stock trading strategies have been shown to be one of the most negative perceptions that customers can have concerning trading and may result in long-term losses for a company. Investment banks usually place trading orders for multiple clients with the same target assets but different order sizes and diverse requirements such as time frame and risk aversion level, thereby total earning and individual earning cannot be optimized at the same time. Orders executed earlier would affect the market price level, so late execution usually means additional implementation cost. In this paper, we propose a novel scheme that utilizes multi-agent reinforcement learning systems to derive stock trading strategies for all clients which keep a balance between revenue and fairness. First, we demonstrate that Reinforcement learning (RL) is able to learn from experience and adapt the trading strategies to the complex market environment. Secondly, we show that the Multi-agent RL system allows developing trading strategies for all clients individually, thus optimizing individual revenue. Thirdly, we use the Generalized Gini Index (GGI) aggregation function to control the fairness level of the revenue across all clients. Lastly, we empirically demonstrate the superiority of the novel scheme in improving fairness meanwhile maintaining optimization of revenue.
يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0
أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.