یادگیری سیاستهای تسویه در بازارهای دارای حراج پایانی
خلاصه
این مطالعه معاملهگری را بررسی میکند که از طریق دفتر سفارش محدود میفروشد و سپس موجودی باقیمانده را با برنامههای جهتدار در حراج پایانی تنظیم میکند. دو مرحله با پیشبینی قیمت تسویه حراج و بازخورد حین حراج به هم مرتبطاند. نویسندگان شبکههای عمیق Q را با سیاستهای یادگیری تقویتی DDPG، TD3 و SAC فرافکنیشده در بازاری شبیهسازیشده مقایسه میکنند و از قیمتهای مصنوعی زبرِ هستون و مسیرهای تاریخی قیمت میانی بهره میگیرند.
سیاستها با استفاده از کسری اجرای تعدیلشده بر اساس جریمه موجودی انتخاب و ارزیابی میشوند و ارزیابی از هدف آموزش وزندار جدا نگه داشته میشود. رویکردهای یادگرفتهشده در شبیهسازیهای گزارششده کسری جریمهشده کمتری از استراتژیهای مرجع آولاندا–استویکوف و TWAP دارند. مقایسههای مصنوعیِ همسان همچنین نشان میدهند دسترسی به حراج به هر چهار روش یادگیری کمک میکند. بازخورد متراکمتر حراج یادگیری را بهبود میدهد، درحالیکه ارزش تصمیمگیری افزوده پیشبینی قیمت تسویه میان یادگیرندهها متفاوت است. این یافتهها مبتنی بر شبیهسازیاند؛ توضیحات عملکرد در معامله زنده یا تعمیم به شرایط دیگر بازار را اثبات نمیکند.
ایدههای کلیدی
- فرایند تسویه، معامله پیوسته با سفارش محدود را با حراج پایانی ترکیب میکند.
- برنامههای حراج، موجودی باقیمانده پس از معامله پیوسته را تنظیم میکنند.
- چهار رویکرد یادگیری تقویتی با قیمتهای شبیهسازیشده و مسیرهای تاریخی قیمت میانی مقایسه میشوند.
- سیاستهای یادگرفتهشده در مقایسه با مراجع آولاندا–استویکوف و TWAP، کسری تعدیلشده بر اساس جریمه موجودی کمتری گزارش میکنند.
- دسترسی به حراج در مقایسههای مصنوعیِ همسان به هر یادگیرنده کمک میکند، درحالیکه ارزش پیشبینی به یادگیرنده بستگی دارد.
برچسبها
متن کامل
# Learning Optimal Liquidation with Closing Auctions # Learning Optimal Liquidation with Closing Auctions We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.