الانتقال إلى المحتوى
جميع مستندات المكتبة

استكشاف إنتروبيا تساليس للتحكم بالعوامل الكامنة

مقال arXiv papers · المؤلف: Ryan Donnelly et al.

الملخص

يدرس هذا العمل التحكم الأمثل عندما يتضمن النموذج عوامل كامنة ويختار متخذ القرار توزيعًا على الأفعال بدلًا من اختيار فعل واحد مباشرة. ويطرح إنتروبيا تساليس مكافأةً لاستكشاف فضاء الحالات، في الزمن المتقطع والزمن المستمر. ويشتق المؤلفون توزيعًا أمثل للحالات بصيغة غاوسية من الرتبة q، ويحددون موضعه عبر معادلات أمامية وخلفية لكل من السياقين.

وتبحث الورقة أيضًا صلة حلول الاستكشاف الناتجة بالتحكم الديناميكي الأمثل المعتاد. ولنهج مستقل عن النموذج، تطور سياسة مثلى تتبع الفكرة العامة للتعلم المعزز الناعم Q (soft Q-learning). ويُعرض الأسلوب بوصفه قد يفيد في بناء استراتيجيات مراجحة إحصائية أكثر متانة، لا بوصفه دليلًا على اختبار نظام تداول معين أو تحسينه. ويقدم الوصف المتاح نتائج نظرية واتجاهًا للتطبيق، لكنه لا يتضمن بيانات سوق أو أداء تداول أو تفاصيل تنفيذ عملية. لذا تعتمد صلته بالتداول على كيفية تحويل إطار التحكم إلى استراتيجية وتقييمها تجريبيًا.

الأفكار الرئيسية

  • يتحكم الإطار في توزيع على الأفعال ضمن نماذج ذات عوامل كامنة.
  • تكافئ إنتروبيا تساليس استكشاف فضاء الحالات في الزمن المتقطع والمستمر.
  • يتخذ توزيع الحالات الأمثل المشتق صيغة غاوسية من الرتبة q.
  • يربط التحليل الحلول المراعية للاستكشاف بالتحكم الديناميكي الأمثل المعتاد.
  • تُطوَّر سياسة مستقلة عن النموذج على غرار التعلم المعزز الناعم Q (soft Q-learning)، وقد تفيد أبحاث المراجحة الإحصائية.

الوسوم

النص الكامل
# Exploratory Control with Tsallis Entropy for Latent Factor Models


# Exploratory Control with Tsallis Entropy for Latent Factor Models









We study optimal control in models with latent factors where the agent controls the distribution over actions, rather than actions themselves, in both discrete and continuous time. To encourage exploration of the state space, we reward exploration with Tsallis Entropy and derive the optimal distribution over states - which we prove is $q$-Gaussian distributed with location characterized through the solution of an FBS$Δ$E and FBSDE in discrete and continuous time, respectively. We discuss the relation between the solutions of the optimal exploration problems and the standard dynamic optimal control solution. Finally, we develop the optimal policy in a model-agnostic setting along the lines of soft $Q$-learning. The approach may be applied in, e.g., developing more robust statistical arbitrage trading strategies.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.