رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی چندعاملی با ملاحظه انصاف برای اجرای سفارش سهام

مقاله arXiv papers · نویسنده: Wenhang Bao

خلاصه

این مقاله بررسی می‌کند که میز معاملاتی چگونه باید سفارش‌های چند مشتری را که به دنبال دارایی‌های یکسان‌اند اجرا کند، درحالی‌که اندازه سفارش‌ها، افق زمانی و ترجیحات ریسک آن‌ها متفاوت است. اجراهای زودتر می‌توانند قیمت‌ها را جابه‌جا کنند؛ بنابراین بهینه‌سازی درآمد کل معاملات ممکن است به زیان مشتریانی تمام شود که سفارششان دیرتر اجرا می‌شود. چارچوب پیشنهادی از یادگیری تقویتی چندعاملی برای تدوین استراتژی‌های مختص هر مشتری استفاده می‌کند و هم‌زمان پیامدهای گروهی را متوازن می‌سازد.

شاخص جینی تعمیم‌یافته درآمد مشتریان را تجمیع می‌کند و راهی برای کنترل هدف انصاف در کنار بهینه‌سازی درآمد فراهم می‌آورد. نویسندگان شواهد تجربی ارائه می‌کنند که رویکردشان انصاف را بهبود می‌دهد و بهینه‌سازی درآمد را حفظ می‌کند؛ همچنین استدلال می‌کنند که یادگیری تقویتی می‌تواند استراتژی‌ها را با شرایط متغیر بازار سازگار کند. توضیحات ارائه‌شده داده‌ها، طرح آزمایش، نتایج عددی یا جزئیات مقایسه را مشخص نمی‌کند؛ بنابراین نمی‌توان از همین متن به‌تنهایی قدرت و تعمیم‌پذیری ادعای تجربی را ارزیابی کرد.

ایده‌های کلیدی

  • اجرای سفارش‌های مشتریان می‌تواند میان بیشینه‌سازی درآمد کل و رفتار منصفانه با مشتریان تعارض ایجاد کند.
  • سفارش‌های زودتر ممکن است بر قیمت‌ها اثر بگذارند و هزینه اجرای سفارش‌های بعدی را افزایش دهند.
  • این چارچوب از یادگیری تقویتی چندعاملی برای یادگیری استراتژی‌های اجرای مختص مشتریان استفاده می‌کند.
  • شاخص جینی تعمیم‌یافته، انصاف توزیعی را در تجمیع درآمد وارد می‌کند.
  • این متن مدعی بهبود انصاف همراه با حفظ بهینه‌سازی درآمد است، اما جزئیات کمی برای ارزیابی شواهد ارائه می‌دهد.

برچسب‌ها

متن کامل
# Fairness in Multi-agent Reinforcement Learning for Stock Trading


# Fairness in Multi-agent Reinforcement Learning for Stock Trading









Unfair stock trading strategies have been shown to be one of the most negative perceptions that customers can have concerning trading and may result in long-term losses for a company. Investment banks usually place trading orders for multiple clients with the same target assets but different order sizes and diverse requirements such as time frame and risk aversion level, thereby total earning and individual earning cannot be optimized at the same time. Orders executed earlier would affect the market price level, so late execution usually means additional implementation cost. In this paper, we propose a novel scheme that utilizes multi-agent reinforcement learning systems to derive stock trading strategies for all clients which keep a balance between revenue and fairness. First, we demonstrate that Reinforcement learning (RL) is able to learn from experience and adapt the trading strategies to the complex market environment. Secondly, we show that the Multi-agent RL system allows developing trading strategies for all clients individually, thus optimizing individual revenue. Thirdly, we use the Generalized Gini Index (GGI) aggregation function to control the fairness level of the revenue across all clients. Lastly, we empirically demonstrate the superiority of the novel scheme in improving fairness meanwhile maintaining optimization of revenue.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.