رفتن به محتوا
همه اسناد کتابخانه

گرادیان سیاست قطعی عمیق برای بهینه‌سازی سبد

مقاله arXiv papers · نویسنده: Ayman Chaouki et al.

خلاصه

این پژوهش می‌آزماید که آیا یادگیری تقویتی عمیق می‌تواند استراتژی‌های معاملاتی بهینه را در محیط‌هایی بازیابی کند که توصیفشان ساده اما از نظر ریاضی دشوار است. نویسندگان بر گرادیان سیاست قطعی عمیق تمرکز می‌کنند؛ روشی که با تعامل با محیط، سیاستی برای انتخاب کنش‌ها می‌آموزد. آن‌ها شرایطی را برمی‌گزینند که استراتژی بهینه یا تقریب نزدیکی از آن از پیش معلوم است تا بتوان رفتار آموخته‌شده و پاداش را با راه‌حل مرجع مقایسه کرد.

نتیجه گزارش‌شده این است که عامل ویژگی‌های اساسی استراتژی‌های معلوم را بازیابی می‌کند و پاداش‌هایی نزدیک به مقدار بهینه می‌گیرد. این امر نشان می‌دهد الگوریتم می‌تواند در محیط‌های آزموده‌شده نقش حل‌کننده داشته باشد. گزیده مدل‌های مشخص بازار، محدودیت‌های سبد، رویه‌های آموزش یا معیارهای ارزیابی را معرفی نمی‌کند. بنابراین نتیجه‌گیری به محیط‌های کنترل‌شده انتخاب‌شده محدود است و عملکرد در بازارهای زنده و پرنویز، با هزینه‌های معاملاتی یا در شرایطی که سیاست بهینه نامعلوم است را اثبات نمی‌کند.

ایده‌های کلیدی

  • پژوهش یادگیری تقویتی عمیق را به‌عنوان حل‌کننده‌ای برای استراتژی‌های معاملاتی ارزیابی می‌کند.
  • در محیط‌هایی با توصیف مفهومی ساده اما ریاضی غیربدیهی از گرادیان سیاست قطعی عمیق استفاده می‌کند.
  • محیط‌های آزموده‌شده استراتژی‌های بهینه معلوم یا تقریباً معلوم دارند تا امکان مقایسه فراهم شود.
  • عامل گزارش‌شده ویژگی‌های کلیدی استراتژی را بازیابی می‌کند و به پاداشی نزدیک به بهینه می‌رسد.
  • گزیده عملکرد در شرایط اصطکاک بازار زنده یا سیاست بهینه نامعلوم را اثبات نمی‌کند.

برچسب‌ها

متن کامل
# Deep Deterministic Portfolio Optimization


# Deep Deterministic Portfolio Optimization









Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.