یادگیری تقویتی عمیق با سنجههای ریسک طیفی پویای قابل اظهار
خلاصه
این سند چارچوبی برای یادگیری تقویتی حساس به ریسک ارائه میکند که در آن یک عامل، سنجههای ریسک طیفی پویای سازگار با زمان را بهینه میکند. از قابلیت اظهار شرطی برای ساخت توابع امتیازدهیِ کاملاً سازگار استفاده میکند؛ این توابع هنگام برآورد نقش جریمه دارند. شبکههای عصبی عمیق سنجههای ریسک را برآورد میکنند و نویسندگان ثابت میکنند که این دسته از سنجهها را میتوان با چنین شبکههایی با دقت دلخواه تقریب زد.
این چارچوب همچنین الگوریتم بازیگر-منتقدی دارد که از دورههای کامل یاد میگیرد، بیآنکه انتقالهای تودرتو اضافه کند. نویسندگان آن را در دو کاربرد—آربیتراژ آماری و تخصیص پرتفوی—با رویکرد شبیهسازی تودرتو مقایسه میکنند و از دادههای شبیهسازیشده و واقعی بهره میبرند. توضیحات، نتایج عددی، جزئیات پیادهسازی یا اطلاعات مجموعهدادههای واقعی را ارائه نمیکنند؛ ازاینرو طراحی و دامنه ارزیابی اعلامشده را روشن میکنند، اما امکان قضاوت درباره بهبود عملکرد یا استحکام را نمیدهند. این روش برای تصمیمهای پرتفوی مرتبط است که در آنها کنترل توزیع زیان در کنار پاداش مورد انتظار اهمیت دارد.
ایدههای کلیدی
- این چارچوب سنجههای ریسک طیفی پویای سازگار با زمان را در یادگیری تقویتی بهینه میکند.
- قابلیت اظهار شرطی، توابع امتیازدهی کاملاً سازگاری فراهم میکند که بهعنوان جریمه برآورد به کار میروند.
- شبکههای عصبی عمیق سنجههای ریسک را برآورد میکنند و برای این دسته از سنجهها نتیجهای درباره تقریب ارائه شده است.
- روش بازیگر-منتقد از دورههای کامل استفاده میکند و از انتقالهای تودرتوی اضافی پرهیز دارد.
- مقایسه، شبیهسازی تودرتو، آربیتراژ آماری و تخصیص پرتفوی را با دادههای شبیهسازیشده و واقعی در بر میگیرد.
برچسبها
متن کامل
# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning # Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning We propose a novel framework to solve risk-sensitive reinforcement learning (RL) problems where the agent optimises time-consistent dynamic spectral risk measures. Based on the notion of conditional elicitability, our methodology constructs (strictly consistent) scoring functions that are used as penalizers in the estimation procedure. Our contribution is threefold: we (i) devise an efficient approach to estimate a class of dynamic spectral risk measures with deep neural networks, (ii) prove that these dynamic spectral risk measures may be approximated to any arbitrary accuracy using deep neural networks, and (iii) develop a risk-sensitive actor-critic algorithm that uses full episodes and does not require any additional nested transitions. We compare our conceptually improved reinforcement learning algorithm with the nested simulation approach and illustrate its performance in two settings: statistical arbitrage and portfolio allocation on both simulated and real data.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.