رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی عمیق با سنجه‌های ریسک طیفی پویای قابل اظهار

مقاله arXiv papers · نویسنده: Anthony Coache et al.

خلاصه

این سند چارچوبی برای یادگیری تقویتی حساس به ریسک ارائه می‌کند که در آن یک عامل، سنجه‌های ریسک طیفی پویای سازگار با زمان را بهینه می‌کند. از قابلیت اظهار شرطی برای ساخت توابع امتیازدهیِ کاملاً سازگار استفاده می‌کند؛ این توابع هنگام برآورد نقش جریمه دارند. شبکه‌های عصبی عمیق سنجه‌های ریسک را برآورد می‌کنند و نویسندگان ثابت می‌کنند که این دسته از سنجه‌ها را می‌توان با چنین شبکه‌هایی با دقت دلخواه تقریب زد.

این چارچوب همچنین الگوریتم بازیگر-منتقدی دارد که از دوره‌های کامل یاد می‌گیرد، بی‌آنکه انتقال‌های تودرتو اضافه کند. نویسندگان آن را در دو کاربرد—آربیتراژ آماری و تخصیص پرتفوی—با رویکرد شبیه‌سازی تودرتو مقایسه می‌کنند و از داده‌های شبیه‌سازی‌شده و واقعی بهره می‌برند. توضیحات، نتایج عددی، جزئیات پیاده‌سازی یا اطلاعات مجموعه‌داده‌های واقعی را ارائه نمی‌کنند؛ ازاین‌رو طراحی و دامنه ارزیابی اعلام‌شده را روشن می‌کنند، اما امکان قضاوت درباره بهبود عملکرد یا استحکام را نمی‌دهند. این روش برای تصمیم‌های پرتفوی مرتبط است که در آن‌ها کنترل توزیع زیان در کنار پاداش مورد انتظار اهمیت دارد.

ایده‌های کلیدی

  • این چارچوب سنجه‌های ریسک طیفی پویای سازگار با زمان را در یادگیری تقویتی بهینه می‌کند.
  • قابلیت اظهار شرطی، توابع امتیازدهی کاملاً سازگاری فراهم می‌کند که به‌عنوان جریمه برآورد به کار می‌روند.
  • شبکه‌های عصبی عمیق سنجه‌های ریسک را برآورد می‌کنند و برای این دسته از سنجه‌ها نتیجه‌ای درباره تقریب ارائه شده است.
  • روش بازیگر-منتقد از دوره‌های کامل استفاده می‌کند و از انتقال‌های تودرتوی اضافی پرهیز دارد.
  • مقایسه، شبیه‌سازی تودرتو، آربیتراژ آماری و تخصیص پرتفوی را با داده‌های شبیه‌سازی‌شده و واقعی در بر می‌گیرد.

برچسب‌ها

متن کامل
# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning


# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning









We propose a novel framework to solve risk-sensitive reinforcement learning (RL) problems where the agent optimises time-consistent dynamic spectral risk measures. Based on the notion of conditional elicitability, our methodology constructs (strictly consistent) scoring functions that are used as penalizers in the estimation procedure. Our contribution is threefold: we (i) devise an efficient approach to estimate a class of dynamic spectral risk measures with deep neural networks, (ii) prove that these dynamic spectral risk measures may be approximated to any arbitrary accuracy using deep neural networks, and (iii) develop a risk-sensitive actor-critic algorithm that uses full episodes and does not require any additional nested transitions. We compare our conceptually improved reinforcement learning algorithm with the nested simulation approach and illustrate its performance in two settings: statistical arbitrage and portfolio allocation on both simulated and real data.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.