رفتن به محتوا
همه اسناد کتابخانه

اکتشاف با آنتروپی تسالیس برای کنترل عوامل پنهان

مقاله arXiv papers · نویسنده: Ryan Donnelly et al.

خلاصه

این پژوهش کنترل بهینه را در مدلی بررسی می‌کند که عوامل پنهان دارد و تصمیم‌گیرنده به‌جای انتخاب مستقیم یک کنش، توزیعی از کنش‌ها را انتخاب می‌کند. این کار آنتروپی تسالیس را به‌عنوان پاداشی برای اکتشاف فضای حالت، هم در تنظیمات زمان‌گسسته و هم زمان‌پیوسته، معرفی می‌کند. نویسندگان یک توزیع حالت بهینه با شکل کیو-گاوسی استخراج می‌کنند و مکان این توزیع را در فضای حالت از طریق معادلات پیشرو-پسرو برای هر یک از این تنظیمات مشخص می‌کنند.

مقاله همچنین بررسی می‌کند که راه‌حل‌های اکتشاف حاصل چگونه با کنترل بهینه پویای استاندارد مرتبط‌اند. برای رویکردی مستقل از مدل، سیاستی بهینه بر پایه ایده کلی یادگیری کیو نرم توسعه می‌دهد. این روش به‌عنوان رویکردی بالقوه مفید برای ساخت استراتژی‌های آربیتراژ آماری مقاوم‌تر ارائه می‌شود، نه به‌عنوان شاهدی که سامانه معاملاتی خاصی آزموده یا بهبود یافته باشد. توضیحات ارائه‌شده شامل نتایج نظری و مسیری برای کاربرد است، اما داده بازار، عملکرد معاملاتی یا جزئیات پیاده‌سازی عملی ندارد. بنابراین ارتباط آن با معامله‌گری به چگونگی تبدیل چارچوب کنترل به استراتژی و ارزیابی تجربی آن بستگی دارد.

ایده‌های کلیدی

  • این چارچوب در مدل‌های دارای عوامل پنهان، توزیعی از کنش‌ها را کنترل می‌کند.
  • آنتروپی تسالیس، اکتشاف فضای حالت را در زمان گسسته و پیوسته پاداش می‌دهد.
  • توزیع حالت بهینه استخراج‌شده شکلی کیو-گاوسی دارد.
  • تحلیل، راه‌حل‌های آگاه از اکتشاف را به کنترل بهینه پویای استاندارد مرتبط می‌کند.
  • سیاستی مستقل از مدل بر اساس یادگیری کیو نرم توسعه یافته است و می‌تواند در پژوهش آربیتراژ آماری مفید باشد.

برچسب‌ها

متن کامل
# Exploratory Control with Tsallis Entropy for Latent Factor Models


# Exploratory Control with Tsallis Entropy for Latent Factor Models









We study optimal control in models with latent factors where the agent controls the distribution over actions, rather than actions themselves, in both discrete and continuous time. To encourage exploration of the state space, we reward exploration with Tsallis Entropy and derive the optimal distribution over states - which we prove is $q$-Gaussian distributed with location characterized through the solution of an FBS$Δ$E and FBSDE in discrete and continuous time, respectively. We discuss the relation between the solutions of the optimal exploration problems and the standard dynamic optimal control solution. Finally, we develop the optimal policy in a model-agnostic setting along the lines of soft $Q$-learning. The approach may be applied in, e.g., developing more robust statistical arbitrage trading strategies.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.