گرادیان سیاست قطعی عمیق برای بهینهسازی سبد
خلاصه
این پژوهش میآزماید که آیا یادگیری تقویتی عمیق میتواند استراتژیهای معاملاتی بهینه را در محیطهایی بازیابی کند که توصیفشان ساده اما از نظر ریاضی دشوار است. نویسندگان بر گرادیان سیاست قطعی عمیق تمرکز میکنند؛ روشی که با تعامل با محیط، سیاستی برای انتخاب کنشها میآموزد. آنها شرایطی را برمیگزینند که استراتژی بهینه یا تقریب نزدیکی از آن از پیش معلوم است تا بتوان رفتار آموختهشده و پاداش را با راهحل مرجع مقایسه کرد.
نتیجه گزارششده این است که عامل ویژگیهای اساسی استراتژیهای معلوم را بازیابی میکند و پاداشهایی نزدیک به مقدار بهینه میگیرد. این امر نشان میدهد الگوریتم میتواند در محیطهای آزمودهشده نقش حلکننده داشته باشد. گزیده مدلهای مشخص بازار، محدودیتهای سبد، رویههای آموزش یا معیارهای ارزیابی را معرفی نمیکند. بنابراین نتیجهگیری به محیطهای کنترلشده انتخابشده محدود است و عملکرد در بازارهای زنده و پرنویز، با هزینههای معاملاتی یا در شرایطی که سیاست بهینه نامعلوم است را اثبات نمیکند.
ایدههای کلیدی
- پژوهش یادگیری تقویتی عمیق را بهعنوان حلکنندهای برای استراتژیهای معاملاتی ارزیابی میکند.
- در محیطهایی با توصیف مفهومی ساده اما ریاضی غیربدیهی از گرادیان سیاست قطعی عمیق استفاده میکند.
- محیطهای آزمودهشده استراتژیهای بهینه معلوم یا تقریباً معلوم دارند تا امکان مقایسه فراهم شود.
- عامل گزارششده ویژگیهای کلیدی استراتژی را بازیابی میکند و به پاداشی نزدیک به بهینه میرسد.
- گزیده عملکرد در شرایط اصطکاک بازار زنده یا سیاست بهینه نامعلوم را اثبات نمیکند.
برچسبها
متن کامل
# Deep Deterministic Portfolio Optimization # Deep Deterministic Portfolio Optimization Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.