الانتقال إلى المحتوى
جميع مستندات المكتبة

تعلم سياسات التصفية في الأسواق ذات مزادات الإغلاق

مقال arXiv papers · المؤلف: Julius Graf et al.

الملخص

تتناول هذه الدراسة متداولاً يبيع عبر دفتر أوامر محددة، ثم يعدّل المخزون المتبقي باستخدام جداول لكميات ذات إشارات موجبة أو سالبة في مزاد الإغلاق. ويربط بين المرحلتين توقع سعر الإقفال في المزاد والتغذية الراجعة أثناء المزاد. ويقارن المؤلفون بين شبكات كيو العميقة وسياسات التعلم المعزز DDPG وTD3 وSAC المسقطة في سوق محاكاة، مستخدمين أسعار هِستون خشنة اصطناعية ومسارات تاريخية لأسعار منتصف السوق.

تُختار السياسات وتُقيّم باستخدام عجز التنفيذ المعاقَب على أساس المخزون، مع فصل التقييم عن هدف التدريب الموزون. وتحقق الأساليب المتعلمة عجزاً أقل بعد العقوبة من استراتيجيتي أفيلانيدا–ستويك وTWAP المرجعيتين في عمليات المحاكاة المذكورة. وتشير المقارنات الاصطناعية المتطابقة أيضاً إلى أن إتاحة المزاد تفيد أساليب التعلم الأربعة جميعاً. وتحسن التغذية الراجعة الأكثر كثافة أثناء المزاد التعلم، بينما تختلف القيمة الإضافية لاتخاذ القرار التي يوفرها توقع سعر الإقفال باختلاف أسلوب التعلم. وتستند هذه النتائج إلى المحاكاة؛ ولا يثبت الوصف الأداء في التداول الفعلي أو التعميم على ظروف سوق أخرى.

الأفكار الرئيسية

  • تجمع عملية التصفية بين تداول مستمر عبر أوامر محددة ومزاد إغلاق.
  • تعدّل جداول المزاد المخزون المتبقي بعد التداول المستمر.
  • تُقارن أربعة أساليب للتعلم المعزز باستخدام أسعار محاكاة ومسارات تاريخية لأسعار منتصف السوق.
  • تشير النتائج إلى عجز أقل بعد العقوبة على المخزون للسياسات المتعلمة مقارنة بمرجعي أفيلانيدا–ستويك وTWAP.
  • تفيد إتاحة المزاد كل أسلوب تعلم في المقارنات الاصطناعية المتطابقة، بينما تعتمد قيمة التوقع على أسلوب التعلم.

الوسوم

النص الكامل
# Learning Optimal Liquidation with Closing Auctions


# Learning Optimal Liquidation with Closing Auctions









We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.