یادگیری تقویتی آفلاین برای خروج از موقعیت با لحاظ اثر قیمت
خلاصه
این سند بررسی میکند که معاملهگر چگونه میتواند از موقعیتی در دارایی پرریسک خارج شود، وقتی معاملات اثر موقت بر قیمت میگذارند و هسته این اثر ناشناخته است. پیشنهاد میکند هسته یا پروپاگیتور بهصورت ناپارامتری و از دادههای ایستا شامل مسیرهای قیمت همبسته، سیگنالهای معاملاتی و سفارشهای بزرگ برآورد شود. دقت برآورد با معیاری سنجیده میشود که صراحتاً به مجموعهداده موجود وابسته است.
یک راهبرد اجرای حریصانه که فقط بر هسته برآوردشده تکیه دارد، ممکن است هزینههایی بالاتر از حد انتظار داشته باشد. نویسندگان این مسئله را به همبستگی کاذب میان راهبرد و برآوردگر و نیز عدمقطعیت ناشی از تابع هزینه سوگیرانه نسبت میدهند. روش پیشنهادی آنها برای یادگیری تقویتی آفلاین از زیان بدبینانهای استفاده میکند که عدمقطعیت برآورد را در نظر میگیرد و از بهینهسازی بهره میبرد که برای حذف آن همبستگی طراحی شده است. آنها بدون نیاز به دانستن دقیق هسته واقعی، کرانی مجانبی و بهینه برای هزینههای اجرا به دست میآورند و آزمایشهای عددیِ پشتیبانِ برآوردگر و راهبرد را گزارش میکنند. متن جزئیات آزمایشها را ارائه نمیدهد یا عملکرد عملی در شرایط معامله زنده را کمّی نمیکند.
ایدههای کلیدی
- این روش، هسته اثر موقت قیمت را از دادههای ایستا شامل مسیرهای همبسته و فعالیت معاملاتی برآورد میکند.
- راهبرد حریصانه مبتنی بر برآورد ممکن است بهدلیل همبستگی کاذب راهبرد و برآوردگر، بهینه نباشد.
- زیان بدبینانه، عدمقطعیت هسته برآوردشده اثر قیمت را در نظر میگیرد.
- رویکرد پیشنهادی یادگیری تقویتی آفلاین، بدون نیاز به دانستن دقیق هسته، کرانی مجانبی برای هزینه اجرا به دست میدهد.
- آزمایشهای عددی گزارش شدهاند، اما متن نتیجهای از معامله زنده ارائه نمیکند.
برچسبها
متن کامل
# An Offline Learning Approach to Propagator Models # An Offline Learning Approach to Propagator Models We consider an offline learning problem for an agent who first estimates an unknown price impact kernel from a static dataset, and then designs strategies to liquidate a risky asset while creating transient price impact. We propose a novel approach for a nonparametric estimation of the propagator from a dataset containing correlated price trajectories, trading signals and metaorders. We quantify the accuracy of the estimated propagator using a metric which depends explicitly on the dataset. We show that a trader who tries to minimise her execution costs by using a greedy strategy purely based on the estimated propagator will encounter suboptimality due to so-called spurious correlation between the trading strategy and the estimator and due to intrinsic uncertainty resulting from a biased cost functional. By adopting an offline reinforcement learning approach, we introduce a pessimistic loss functional taking the uncertainty of the estimated propagator into account, with an optimiser which eliminates the spurious correlation, and derive an asymptotically optimal bound on the execution costs even without precise information on the true propagator. Numerical experiments are included to demonstrate the effectiveness of the proposed propagator estimator and the pessimistic trading strategy.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.