رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی آفلاین برای خروج از موقعیت با لحاظ اثر قیمت

مقاله arXiv papers · نویسنده: Eyal Neuman et al.

خلاصه

این سند بررسی می‌کند که معامله‌گر چگونه می‌تواند از موقعیتی در دارایی پرریسک خارج شود، وقتی معاملات اثر موقت بر قیمت می‌گذارند و هسته این اثر ناشناخته است. پیشنهاد می‌کند هسته یا پروپاگیتور به‌صورت ناپارامتری و از داده‌های ایستا شامل مسیرهای قیمت همبسته، سیگنال‌های معاملاتی و سفارش‌های بزرگ برآورد شود. دقت برآورد با معیاری سنجیده می‌شود که صراحتاً به مجموعه‌داده موجود وابسته است.

یک راهبرد اجرای حریصانه که فقط بر هسته برآوردشده تکیه دارد، ممکن است هزینه‌هایی بالاتر از حد انتظار داشته باشد. نویسندگان این مسئله را به همبستگی کاذب میان راهبرد و برآوردگر و نیز عدم‌قطعیت ناشی از تابع هزینه سوگیرانه نسبت می‌دهند. روش پیشنهادی آن‌ها برای یادگیری تقویتی آفلاین از زیان بدبینانه‌ای استفاده می‌کند که عدم‌قطعیت برآورد را در نظر می‌گیرد و از بهینه‌سازی بهره می‌برد که برای حذف آن همبستگی طراحی شده است. آن‌ها بدون نیاز به دانستن دقیق هسته واقعی، کرانی مجانبی و بهینه برای هزینه‌های اجرا به دست می‌آورند و آزمایش‌های عددیِ پشتیبانِ برآوردگر و راهبرد را گزارش می‌کنند. متن جزئیات آزمایش‌ها را ارائه نمی‌دهد یا عملکرد عملی در شرایط معامله زنده را کمّی نمی‌کند.

ایده‌های کلیدی

  • این روش، هسته اثر موقت قیمت را از داده‌های ایستا شامل مسیرهای همبسته و فعالیت معاملاتی برآورد می‌کند.
  • راهبرد حریصانه مبتنی بر برآورد ممکن است به‌دلیل همبستگی کاذب راهبرد و برآوردگر، بهینه نباشد.
  • زیان بدبینانه، عدم‌قطعیت هسته برآوردشده اثر قیمت را در نظر می‌گیرد.
  • رویکرد پیشنهادی یادگیری تقویتی آفلاین، بدون نیاز به دانستن دقیق هسته، کرانی مجانبی برای هزینه اجرا به دست می‌دهد.
  • آزمایش‌های عددی گزارش شده‌اند، اما متن نتیجه‌ای از معامله زنده ارائه نمی‌کند.

برچسب‌ها

متن کامل
# An Offline Learning Approach to Propagator Models


# An Offline Learning Approach to Propagator Models









We consider an offline learning problem for an agent who first estimates an unknown price impact kernel from a static dataset, and then designs strategies to liquidate a risky asset while creating transient price impact. We propose a novel approach for a nonparametric estimation of the propagator from a dataset containing correlated price trajectories, trading signals and metaorders. We quantify the accuracy of the estimated propagator using a metric which depends explicitly on the dataset. We show that a trader who tries to minimise her execution costs by using a greedy strategy purely based on the estimated propagator will encounter suboptimality due to so-called spurious correlation between the trading strategy and the estimator and due to intrinsic uncertainty resulting from a biased cost functional. By adopting an offline reinforcement learning approach, we introduce a pessimistic loss functional taking the uncertainty of the estimated propagator into account, with an optimiser which eliminates the spurious correlation, and derive an asymptotically optimal bound on the execution costs even without precise information on the true propagator. Numerical experiments are included to demonstrate the effectiveness of the proposed propagator estimator and the pessimistic trading strategy.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.