Перейти к содержимому
Все документы библиотеки

Обучение с подкреплением градиентом политики и динамическими выпуклыми мерами риска

Статья arXiv papers · Автор: Anthony Coache et al.

Сводка

В документе представлен не основанный на модели метод обучения с подкреплением для последовательной оптимизации, когда результаты оцениваются с помощью динамических выпуклых мер риска. Для оценки политик используется согласованный во времени принцип динамического программирования, после чего выводятся обновления градиента политики для поиска более эффективных вариантов. Для оптимизации политик предлагается подход «актор-критик» с нейронными сетями.

Метод демонстрируется на трех задачах: торговле статистическим арбитражем, финансовом хеджировании и управлении роботом при обходе препятствий. Это показывает применение подхода как в финансовой, так и в нефинансовой областях, однако в описании нет показателей эффективности, методов сравнения, рыночных допущений или деталей реализации. Таким образом, изложены структура оптимизации и область применения, но не представлены данные об эффективности торговли и практических ограничениях.

Ключевые идеи

  • Динамические выпуклые меры риска позволяют оценивать последовательности неопределенных результатов.
  • Для оценки возможных политик используется согласованное во времени динамическое программирование.
  • Для оптимизации политик применяются правила градиента политики и нейросетевой метод «актор-критик».
  • Подход демонстрируется на задачах статистического арбитража, финансового хеджирования и обхода препятствий роботом.
  • В доступном описании нет результатов сравнения или допущений о реализации на рынке.

Теги

Полный текст
# Reinforcement Learning with Dynamic Convex Risk Measures


# Reinforcement Learning with Dynamic Convex Risk Measures









We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.