اکتشاف با آنتروپی تسالیس برای کنترل عوامل پنهان
خلاصه
این پژوهش کنترل بهینه را در مدلی بررسی میکند که عوامل پنهان دارد و تصمیمگیرنده بهجای انتخاب مستقیم یک کنش، توزیعی از کنشها را انتخاب میکند. این کار آنتروپی تسالیس را بهعنوان پاداشی برای اکتشاف فضای حالت، هم در تنظیمات زمانگسسته و هم زمانپیوسته، معرفی میکند. نویسندگان یک توزیع حالت بهینه با شکل کیو-گاوسی استخراج میکنند و مکان این توزیع را در فضای حالت از طریق معادلات پیشرو-پسرو برای هر یک از این تنظیمات مشخص میکنند.
مقاله همچنین بررسی میکند که راهحلهای اکتشاف حاصل چگونه با کنترل بهینه پویای استاندارد مرتبطاند. برای رویکردی مستقل از مدل، سیاستی بهینه بر پایه ایده کلی یادگیری کیو نرم توسعه میدهد. این روش بهعنوان رویکردی بالقوه مفید برای ساخت استراتژیهای آربیتراژ آماری مقاومتر ارائه میشود، نه بهعنوان شاهدی که سامانه معاملاتی خاصی آزموده یا بهبود یافته باشد. توضیحات ارائهشده شامل نتایج نظری و مسیری برای کاربرد است، اما داده بازار، عملکرد معاملاتی یا جزئیات پیادهسازی عملی ندارد. بنابراین ارتباط آن با معاملهگری به چگونگی تبدیل چارچوب کنترل به استراتژی و ارزیابی تجربی آن بستگی دارد.
ایدههای کلیدی
- این چارچوب در مدلهای دارای عوامل پنهان، توزیعی از کنشها را کنترل میکند.
- آنتروپی تسالیس، اکتشاف فضای حالت را در زمان گسسته و پیوسته پاداش میدهد.
- توزیع حالت بهینه استخراجشده شکلی کیو-گاوسی دارد.
- تحلیل، راهحلهای آگاه از اکتشاف را به کنترل بهینه پویای استاندارد مرتبط میکند.
- سیاستی مستقل از مدل بر اساس یادگیری کیو نرم توسعه یافته است و میتواند در پژوهش آربیتراژ آماری مفید باشد.
برچسبها
متن کامل
# Exploratory Control with Tsallis Entropy for Latent Factor Models # Exploratory Control with Tsallis Entropy for Latent Factor Models We study optimal control in models with latent factors where the agent controls the distribution over actions, rather than actions themselves, in both discrete and continuous time. To encourage exploration of the state space, we reward exploration with Tsallis Entropy and derive the optimal distribution over states - which we prove is $q$-Gaussian distributed with location characterized through the solution of an FBS$Δ$E and FBSDE in discrete and continuous time, respectively. We discuss the relation between the solutions of the optimal exploration problems and the standard dynamic optimal control solution. Finally, we develop the optimal policy in a model-agnostic setting along the lines of soft $Q$-learning. The approach may be applied in, e.g., developing more robust statistical arbitrage trading strategies.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.