رفتن به محتوا
همه اسناد کتابخانه

یادگیری سیاست‌های تسویه در بازارهای دارای حراج پایانی

مقاله arXiv papers · نویسنده: Julius Graf et al.

خلاصه

این مطالعه معامله‌گری را بررسی می‌کند که از طریق دفتر سفارش محدود می‌فروشد و سپس موجودی باقی‌مانده را با برنامه‌های جهت‌دار در حراج پایانی تنظیم می‌کند. دو مرحله با پیش‌بینی قیمت تسویه حراج و بازخورد حین حراج به هم مرتبط‌اند. نویسندگان شبکه‌های عمیق Q را با سیاست‌های یادگیری تقویتی DDPG، TD3 و SAC فرافکنی‌شده در بازاری شبیه‌سازی‌شده مقایسه می‌کنند و از قیمت‌های مصنوعی زبرِ هستون و مسیرهای تاریخی قیمت میانی بهره می‌گیرند.

سیاست‌ها با استفاده از کسری اجرای تعدیل‌شده بر اساس جریمه موجودی انتخاب و ارزیابی می‌شوند و ارزیابی از هدف آموزش وزن‌دار جدا نگه داشته می‌شود. رویکردهای یادگرفته‌شده در شبیه‌سازی‌های گزارش‌شده کسری جریمه‌شده کمتری از استراتژی‌های مرجع آولاندا–استویکوف و TWAP دارند. مقایسه‌های مصنوعیِ همسان همچنین نشان می‌دهند دسترسی به حراج به هر چهار روش یادگیری کمک می‌کند. بازخورد متراکم‌تر حراج یادگیری را بهبود می‌دهد، درحالی‌که ارزش تصمیم‌گیری افزوده پیش‌بینی قیمت تسویه میان یادگیرنده‌ها متفاوت است. این یافته‌ها مبتنی بر شبیه‌سازی‌اند؛ توضیحات عملکرد در معامله زنده یا تعمیم به شرایط دیگر بازار را اثبات نمی‌کند.

ایده‌های کلیدی

  • فرایند تسویه، معامله پیوسته با سفارش محدود را با حراج پایانی ترکیب می‌کند.
  • برنامه‌های حراج، موجودی باقی‌مانده پس از معامله پیوسته را تنظیم می‌کنند.
  • چهار رویکرد یادگیری تقویتی با قیمت‌های شبیه‌سازی‌شده و مسیرهای تاریخی قیمت میانی مقایسه می‌شوند.
  • سیاست‌های یادگرفته‌شده در مقایسه با مراجع آولاندا–استویکوف و TWAP، کسری تعدیل‌شده بر اساس جریمه موجودی کمتری گزارش می‌کنند.
  • دسترسی به حراج در مقایسه‌های مصنوعیِ همسان به هر یادگیرنده کمک می‌کند، درحالی‌که ارزش پیش‌بینی به یادگیرنده بستگی دارد.

برچسب‌ها

متن کامل
# Learning Optimal Liquidation with Closing Auctions


# Learning Optimal Liquidation with Closing Auctions









We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.